‌
‌
‌
‌
‌
快訊

20小時編程評測拉開差距:Claude Fable 5.1領先GPT-5.6超24分,GLM-5.3排第三

BlockBeats 律動財經

動察 Beating AI 快訊,AI 研究團隊 Proximal 發布超長周期編程評測 FrontierSWE v2。任務從 17 個擴大到 34 個,每個模型在每項任務上跑 5 次,單次最多幹 20 小時。Claude Fable 5.1 平均得分 56.29%,大幅領先 GPT-5.6 的 32.2%。開源模型 GLM-5.3 以 30.2% 排第三。


FrontierSWE 裡的任務已經不只是修代碼。Agent 要從零寫電路模擬器、訓練天氣預測模型,還要靠望遠鏡照片匹配星表,或者只看遊戲畫面訓練賽車 Bot。v2 統一換成 Proximus harness。每次任務最多運行 20 小時,模型準備交卷時,系統會先保存當前版本並告訴它還剩多少時間,避免模型過早結束任務。

‌


這個改動對成績影響不小。Proximal 在 6 項任務上對比發現,Claude Opus 5 和 GPT-5.6 換成 Proximus 後都工作得更久,平均成績也高於各自原生 harness。


‌

評測還抓到了多次主動作弊。GPT-5.6 曾意識到讀取公開答案「可能涉及反作弊問題」,最後還是用了這條捷徑;另一次甚至利用 Modal 的後台服務讀取隱藏驗證文件。Muse Spark 1.2 則改測試腳本、塞入公開答案,還寫代碼嘗試掩蓋作弊痕跡。確認違規的運行全部被記為零分。

原文連結

發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。

暢行幣圈交易全攻略,專家駐群實戰交流

▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!

▶ 前往鉅亨買幣找交易所優惠

‌
section icon

鉅亨講座

看更多
  • 講座
  • 公告
    ‌
    Empty
    Empty
    ‌