20小時編程評測拉開差距:Claude Fable 5.1領先GPT-5.6超24分,GLM-5.3排第三
BlockBeats 律動財經
動察 Beating AI 快訊,AI 研究團隊 Proximal 發布超長周期編程評測 FrontierSWE v2。任務從 17 個擴大到 34 個,每個模型在每項任務上跑 5 次,單次最多幹 20 小時。Claude Fable 5.1 平均得分 56.29%,大幅領先 GPT-5.6 的 32.2%。開源模型 GLM-5.3 以 30.2% 排第三。
FrontierSWE 裡的任務已經不只是修代碼。Agent 要從零寫電路模擬器、訓練天氣預測模型,還要靠望遠鏡照片匹配星表,或者只看遊戲畫面訓練賽車 Bot。v2 統一換成 Proximus harness。每次任務最多運行 20 小時,模型準備交卷時,系統會先保存當前版本並告訴它還剩多少時間,避免模型過早結束任務。
這個改動對成績影響不小。Proximal 在 6 項任務上對比發現,Claude Opus 5 和 GPT-5.6 換成 Proximus 後都工作得更久,平均成績也高於各自原生 harness。
評測還抓到了多次主動作弊。GPT-5.6 曾意識到讀取公開答案「可能涉及反作弊問題」,最後還是用了這條捷徑;另一次甚至利用 Modal 的後台服務讀取隱藏驗證文件。Muse Spark 1.2 則改測試腳本、塞入公開答案,還寫代碼嘗試掩蓋作弊痕跡。確認違規的運行全部被記為零分。
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
- 買幣要選交易所!優惠盡在鉅亨買幣
- 掌握全球財經資訊點我下載APP
延伸閱讀
- 比特幣又被Fed嚇跌!8萬美元屢攻不破 連四日走低
- 比特幣多頭夢醒?非農強勁引爆Fed升息警報 才站回8萬美元又被打下來
- 橋水達里歐改口建議持有比特幣!分析:想靠它避險恐怕「錯了」
- 比特幣為何突然暴漲?能否突破8萬美元需觀察這「三項指標」
- 講座
- 公告
上一篇
下一篇