美股

馬斯克Grok 4.6亮相!性能追平GPT-5.6 Sol、API價格砍半

鉅亨網新聞中心

馬斯克旗下SpaceXAI(原xAI)周三(12日)正式推出新一代旗艦模型Grok 4.6, 將主要升級方向鎖定長時間運行的AI代理(Agent)、複雜程式設計、知識工作及互動與視覺任務。SpaceXAI表示, Grok 4.6在多項前沿模型測試中已進入第一梯隊, 同時以每100萬個輸入Token 2美元、輸出Token 6美元的價格切入市場, 約為部分競爭對手的一半, 企圖以「高性能+低成本」策略搶攻開發者市場。

cover image of news article
(圖:REUTERS/TPG)

SpaceXAI在官方公告中表示, Grok 4.6是在Grok 4.5基礎上進一步強化, 特別針對長時間運行的Agent及更具挑戰性的互動、視覺工作。新模型可以處理需要多步驟執行的研究工作、程式碼庫分析及應用程式開發, 並在更長的任務過程中進行自主測試與驗證, 讓模型不只是回答問題, 而是能持續完成一項完整工作。


SpaceXAI指出, Grok 4.6接受比Grok 4.5更長的補充訓練, 訓練資料包括經過篩選的模型生成推理資料及高品質工程資料, 同時改進最佳化器與訓練方法。公司並利用Grok 4.5生成不同推理強度、Agent框架以及STEM、軟體工程和知識工作等領域的SFT軌跡, 再透過強化學習訓練Grok 4.6執行通用程式設計、知識工作、核心程式最佳化、網頁開發及電腦輔助設計等任務。

這次升級最受市場關注的之一, 是Grok 4.6在Artificial Analysis Intelligence Index取得61分, 與OpenAI的GPT-5.6 Sol並列。Artificial Analysis指出, 該指數綜合多項測試, 用來評估模型在數學、科學、程式設計與推理等不同能力的整體表現。Grok 4.6因此進一步縮小與頂級模型之間的性能差距。

在GDPVal-AA v2測試中, Grok 4.6則取得1,753 Elo, 高於GPT-5.6 Sol的1,728分及Anthropic旗下Claude Fable 5的1,741分。這項測試著重於具有實際經濟價值的專業工作, 包括不同職業與產業的知識工作任務, 更接近企業實際導入AI代理後可能面對的工作場景。

不過, Grok 4.6並非在所有評測中都取得第一。SpaceXAI公布的其他測試顯示, 新模型在CursorBench v3.2取得69.9%, 高於Grok 4.5 High的66.7%; FrontierCode v1.1達61.3%, 高於前代56.6%; APEX-Agents達57.5%, 高於前代47.1%; APEX-SWE為56.4%, 高於前代53.6%; AA-Briefcase則由前代1,313分提升至1,577分; Harvey LAB也由12.9%提高至15.8%。

在部分測試中, 競爭對手仍然領先, 因此較準確的說法是Grok 4.6已在多項Agent、程式設計及知識工作測試進入頂級模型行列, 而非全面擊敗所有競爭模型。Artificial Analysis的排名也會隨模型新增與測試更新而變動, 因此SpaceXAI公布的排名主要反映發布時點的橫向比較。

除了模型性能, Grok 4.6的價格策略更可能成為AI產業下一階段競爭的焦點。SpaceXAI將標準API價格設定為每100萬個輸入Token 2美元、每100萬個輸出Token 6美元, 並提供速度更快、價格約為兩倍的版本。公司宣稱, 標準版本價格約為其他前沿模型的一半。

這項定價策略將Grok 4.6直接推向開發者及企業AI市場。相較之下, 市場目前對前沿模型的競爭已逐漸從單純比拚基準測試, 延伸到每次推理成本、Token效率、速度以及能否完成實際工作的能力。當模型性能逐漸接近時, 相同工作究竟需要多少運算成本, 很可能成為企業選擇模型的重要因素。

不過, API單價並不代表所有任務的最終成本都會同比下降。不同模型的Token消耗、推理強度、任務執行時間以及Agent需要呼叫多少次工具, 都會影響實際使用成本。因此, Grok 4.6的「半價」主要是API標價上的比較, 並不意味著所有應用場景的總成本都一定低50%。

SpaceXAI也同步擴大Grok 4.6的開發者通路。新模型已提供給Cursor、Grok Build及API使用, 並透過OpenRouter、Vercel及Cloudflare(NET-US)等平台與服務商提供。SpaceXAI表示, 上線首周Cursor與Grok Build用戶可獲得2倍包含用量, 讓開發者能以更低門檻測試新模型。

這也延續SpaceXAI近幾個月積極搶攻AI程式開發市場的策略。公司7月推出Grok Build開源版本, 將旗下程式設計Agent的核心框架公開, 包括上下文組裝、工具調用、程式碼讀取與修改、命令執行、技能、插件及子Agent等功能, 並允許開發者在本地環境運行。

Grok Build原先已被SpaceXAI定位為面向專業軟體工程與複雜程式設計工作的Coding Agent, 使用者可以先讓模型規劃工作, 再審核與批准執行計畫, 每次程式碼修改也會以差異檔案方式呈現。Grok 4.6此次進一步強化Agent能力, 等於為這套開發工具提供更強大的模型引擎。

SpaceXAI此次還特別強調, Grok 4.6在「把想法變成產品」方面有明顯提升。面對一個模糊的產品概念, 模型可以先研究陌生領域, 設計應用架構, 建立核心功能, 再根據測試結果及使用者回饋進行多輪修改。在視覺及互動式專案中, 新模型也能更快產出完整的第一版成果。

這種能力反映AI模型競爭正從「問答」走向「執行」。過去大模型主要以回答問題、生成文字或程式碼作為能力展示, 現在OpenAI、Anthropic、Google及SpaceXAI等業者都逐步把Agent能力視為下一個競爭戰場, 希望模型能自行使用工具、拆解任務、修改成果並完成長時間工作。

Grok 4.6在GDPVal-AA v2的表現尤其符合這項趨勢。SpaceXAI公布的1,753 Elo不只是一般知識問答成績, 而是來自需要模型在Agent環境中完成實際專業工作的測試, 因此公司試圖藉此證明新模型不只是「聊天能力」提升, 而是已能處理更接近企業工作流程的任務。

馬斯克也迅速在社群平台X為新模型造勢。他轉發Grok 4.6取得1,753 Elo及在多項測試領先的相關內容, 並對新模型作出高度評價。這也是馬斯克近期持續親自推廣Grok產品的最新例子。

從產業競爭角度來看, Grok 4.6的推出時間也值得注意。Grok 4.5才在7月16日發布, SpaceXAI不到一個月便推出下一代版本。Grok 4.5當時已將程式設計、Agent任務及知識工作列為主要能力, 並強調與Cursor共同訓練, 顯示SpaceXAI正在快速縮短模型迭代週期。

SpaceXAI近期也持續把Grok從聊天機器人擴展為完整AI工作平台。7月推出的Automations功能允許使用者設定一次工作, 之後讓Grok按照排程或收到電子郵件等觸發條件自行執行, 並回報結果; 5月推出的Connectors則讓Grok直接連接企業及個人使用的應用程式, 執行讀取電子郵件、整理文件、更新簡報、管理行事曆及編輯試算表等工作。

因此, Grok 4.6的真正戰略意義可能不只是與GPT或Claude比拚排行榜, 而是SpaceXAI正試圖建立從模型、Agent、Coding工具到第三方開發平台的完整生態系。若低API價格能夠吸引大量開發者, 再透過Cursor、Grok Build、OpenRouter及雲端平台擴大使用, SpaceXAI便有機會在模型之外取得更大的開發者入口。

不過, 低價策略也代表SpaceXAI必須承擔更高的運算成本壓力。前沿模型的訓練與推理都需要大量GPU及資料中心資源, 若模型價格持續下探, AI業者必須依靠更高的使用量、更高的Token效率或其他商業模式來支撐毛利率。這也意味著Grok 4.6的價格戰不只是爭取市占率, 同時也是對SpaceXAI基礎設施效率的一項考驗。

對開發者而言, Grok 4.6的吸引力則在於它同時提供前沿級性能與相對低廉的API價格。若其在實際工作中的Token效率及任務完成率能夠維持目前的測試表現, 開發者可能更願意把Grok納入程式設計、研究、資料分析及企業Agent工作流。

而對OpenAI與Anthropic等競爭對手而言, Grok 4.6也進一步加劇前沿模型價格壓力。當新模型在部分專業工作測試中已能取得領先, 同時API價格又明顯較低, 市場競爭就不再只是誰的模型最聰明, 而是誰能以最低成本完成最多工作。

目前Grok 4.6已經可以透過API以及部分開發者平台使用, 但不同平台的可用方式與方案可能有所差異。SpaceXAI此次發布的重點也主要放在開發者與Agent應用, 而非單純消費者聊天產品的更新。

整體而言, Grok 4.6顯示SpaceXAI正在把AI競賽的戰場從單一模型性能, 推向長時間Agent執行能力、程式設計、知識工作及推理成本。61分的Artificial Analysis Intelligence Index與1,753 Elo的GDPVal-AA v2成績, 讓Grok進一步站上前沿模型競爭舞台; 每100萬Token輸入2美元、輸出6美元的價格, 則是SpaceXAI試圖擴大市場滲透率的另一張王牌。

隨著模型能力差距逐漸縮小, AI產業下一階段的勝負關鍵可能從「誰擁有最高分」轉向「誰能以更低成本完成更多工作」。Grok 4.6此次同時押注性能與價格, 能否真正轉化為開發者使用量與企業採用, 將決定這場AI模型價格戰究竟只是一次產品攻勢, 還是成為SpaceXAI搶進前沿AI市場的重要轉折點。


文章標籤

section icon

鉅亨講座

看更多
  • 講座
  • 公告

    Empty
    Empty