BlockBeats 律動財經
動察 Beating AI 快訊,OpenAI 自 9 月 3 日發布 GPT-6 Astra 後,多項模型評測基準數據被持續調整,部分修改使 Astra 表現更優,同時部分競爭對手模型的成績出現下滑,引發外界對 AI「刷榜」和評測透明度的質疑。
其中,Astra 的幻覺率曾從 4.2% 下調至 2%,GPT-5.6 Sol 則從 12.2% 降至 9.4%,隨後兩者又恢復至 4.2% 和 12.2%。在數學評測中,Anthropic 的 Fable 5.1 得分也曾從 87.8% 降至 78%,目前已回升至 83%;GPT-5.6 Sol 則從 83% 降至 80.5%,後恢復至 83%。
此外,Astra 在 ARC-AGI-3 評測中的成績從發布前草稿的 98.6% 提升至最終頁面的 99.99%,其編程評測成績也從 57.7% 小幅上調至 57.9%。OpenAI 表示,評測結果會受到模型版本、工具配置、推理級別及測試運行等因素影響,此次調整是為了確保數據更準確地反映模型的最佳性能。
不過,斯坦福大學研究人員認為,頻繁重新運行評測可能涉及所謂「Benchmaxxing」,即通過調整測試條件最大化基準成績。業內人士指出,隨著 AI 模型競爭加劇,評測數據已成為衡量模型能力及爭奪市場的重要工具,如何提高基準測試的透明度和可複現性正受到越來越多關注。
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
下一篇