Terminal-Bench 4.0:GLM-5.3衝到第三,超過GPT-5.6 Sol
BlockBeats 律動財經
動察 Beating AI 快訊,Terminal-Bench 發布 4.0,重新校準 Agent 執行任務時的時間、CPU 和內存,並修復 19 個任務、移除 8 個存在飽和、拒答、公開解法或品質問題的任務。所有任務的最長執行時間統一到 8 小時,主要是減少超時和環境問題對成績的干擾。
最新榜單裡,Opus 5 + Claude Code 以 51.8% 排第一,Fable 5 以 44.5% 第二。GLM-5.3 + Claude Code 拿到 41.8%,衝到第三,超過 GPT-5.6 Sol + Codex 的 37.3%。前三名裡,GLM-5.3 是唯一不是 Anthropic 的模型。
在 Terminal-Bench 3.0 中,GLM-5.3 還是 32.4% 排第四,落後 GPT-5.6 Sol 的 34.6%;到了 4.0,GLM-5.3 升到第三,反過來領先 Sol 4.5 個百分點。
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
- 買幣要選交易所!優惠盡在鉅亨買幣
- 掌握全球財經資訊點我下載APP
- 講座
- 公告
上一篇
下一篇