快訊

Terminal-Bench 4.0:GLM-5.3衝到第三,超過GPT-5.6 Sol

BlockBeats 律動財經

動察 Beating AI 快訊,Terminal-Bench 發布 4.0,重新校準 Agent 執行任務時的時間、CPU 和內存,並修復 19 個任務、移除 8 個存在飽和、拒答、公開解法或品質問題的任務。所有任務的最長執行時間統一到 8 小時,主要是減少超時和環境問題對成績的干擾。


最新榜單裡,Opus 5 + Claude Code 以 51.8% 排第一,Fable 5 以 44.5% 第二。GLM-5.3 + Claude Code 拿到 41.8%,衝到第三,超過 GPT-5.6 Sol + Codex 的 37.3%。前三名裡,GLM-5.3 是唯一不是 Anthropic 的模型。



在 Terminal-Bench 3.0 中,GLM-5.3 還是 32.4% 排第四,落後 GPT-5.6 Sol 的 34.6%;到了 4.0,GLM-5.3 升到第三,反過來領先 Sol 4.5 個百分點。

原文連結

發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。

暢行幣圈交易全攻略,專家駐群實戰交流

▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!

前往鉅亨買幣找交易所優惠


section icon

鉅亨講座

看更多
  • 講座
  • 公告

    Empty
    Empty