BlockBeats 律動財經
動察 Beating AI 快訊,陳天橋旗下全新 AI 專案 Apodex 發布科學 Agent 評測 FrontierChallenge,用 97 個真實科學工作流測試 AI 能不能從頭到尾把任務完成。12 個前沿模型參與測試,最佳成績也只有 20.6%。GPT-5.6 Sol + Codex 和 Grok 4.6 + Claude Code 並列第一,各完整通過 20 項。
測試還發現,Agent 經常沒做完卻說自己做完了。在使用 Claude Code 作為 Agent 框架的 10 組模型測試中,849 次失敗任務裡有 75.5% 最終仍聲稱已經完成。另一方面,所有參評系統在電化學和環境科學任務上的平均得分達到 94.9,但沒有一個完整通過。
這套評測專門把「大部分做對」和「真正交付完成」分開。榜單比較的也是模型 + Agent 運行框架,不是單獨比較裸模型。
官方同時提醒,每個系統每題只有一次運行,小幅分差不能直接理解成穩定的模型排名。
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
上一篇
下一篇