金色財經
作者:郭雅麗 袁澤世;來源:華泰睿思
7月16日,Kimi更新K3模型,實現2.8兆參數、100萬Token上下文和原生視覺能力,進一步切入長時程編程、知識工作與複雜推理場景。與市場主要關注開放權重與榜單成績不同,我們更關注其生產案例中數千次網頁檢索、終端數據調用、遞歸迭代及多子Agent並行所反映的推理負載變化。Kimi K3建議採用64張以上加速卡組成的超節點部署,表明高帶寬互聯、推理集群、上下文緩存及Agent基礎軟體的重要性進一步提升。K3智能的提高直接帶來了token定價的提高,進一步強化了國產模型的商業化能力。
模型規模與稀疏架構同步升級,開放模型繼續向前沿能力靠攏
Kimi K3參數規模達到2.8兆,採用Kimi Delta Attention、Attention Residuals及Stable LatentMoE架構,每次推理有效激活896個專家中的16個,並通過訓練和數據配方優化,實現相較Kimi K2約2.5倍的整體縮放效率提升。模型同時支持100萬Token上下文及原生視覺理解,覆蓋軟體工程、知識工作與深度推理。市場主流觀點更重視參數規模與開放權重,我們認為,KDA、AttnRes及高稀疏MoE對跨卡通信、專家路由和推理軟體提出的新要求,或構成更具持續性的國產軟硬體適配變化。
長時程Agent工作負載顯著擴大,單任務計算消耗可能持續上行
據Kimi官方披露,K3生成AI ASIC行業研究網站時經歷120輪以上遞歸改進,完成2800次以上網頁搜尋與抓取、1100次以上終端數據調用,處理超過1.1萬頁內容,覆蓋87份季度報告和99份原始PDF;引力波分析案例則調用20個以上並發子Agent處理391個事件。上述任務已由一次問答轉向檢索、執行、校驗、繪圖和修改組成的長鏈路流程。我們認為,Agent滲透帶來的核心增量並非用戶請求數量本身,而是每個任務內部Token、工具調用次數和並行執行寬度的共同增長,帶來真實工作流滲透提升。
智能能力升級推動價格中樞上移,逐步接近海外高端模型
Kimi K3 API緩存命中輸入、未命中輸入和輸出價格分別為$0.30、$3.00和$15.00/百萬Token,較Kimi K2系列價格明顯提升,反映其產品定位已由低價模型服務轉向長上下文、複雜推理和Agent任務驅動的旗艦能力定價。橫向比較看,K3價格高於GLM、MiniMax等多數國產模型,國產模型價格中樞正在隨智能能力提升逐步向海外水平靠攏。我們認為,K3通過自動緩存和推理系統優化降低實際調用成本,使模型廠商能夠在提升名義Token價格的同時維持用戶使用門檻,行業商業化競爭正由單純低價轉向模型能力、緩存效率與算力利用率的綜合比拼。
投資結論
隨著國產模型在長上下文、多模態、工具調用及複雜Workflow執行等方面持續進步,其與海外前沿模型的能力差距正在收窄,模型價值也由單輪問答逐步轉向檢索、分析、執行、驗證和交付等實際工作環節。我們認為,複雜工作能力提升有望增強客戶付費意願,推動API價格中樞、調用量及商業化空間同步改善。
風險提示:宏觀經濟波動,技術進步不及預期,中美競爭加劇。
Kimi K3:開放模型向複雜生產任務延伸
Kimi K3以全球參數規模領先的開放模型定位,推動智能能力向生產場景延伸。據Kimi官方部落格披露,Kimi K3總參數規模達到2.8兆,是全球首個達到3兆參數級別的開放模型,按總參數量計處於當前已公開開放模型的較高水平。模型採用Kimi Delta Attention和Attention Residuals架構,並通過Stable LatentMoE將專家數量擴展至896個、單次推理激活16個專家,結合訓練及數據配方優化,相較Kimi K2實現約2.5倍的整體縮放效率提升。Kimi K3同時具備原生視覺能力和100萬Token上下文窗口,主要面向長時程編程、知識工作及複雜推理,產品定位由對話模型進一步轉向能夠持續調用工具、執行複雜Workflow並交付完整成果的生產型智能系統。Kimi K3完整模型權重計劃於2026年7月27日前發布,並將同步披露更完整的架構、訓練及評測技術報告。
Kimi K3的Coding能力已進入全球前沿模型梯隊,多項複雜工程評測領先海外閉源模型。據Kimi官方評測,Kimi K3在Program Bench中得分77.8,超過GPT-5.6 Sol的77.6和Claude Fable 5的76.8;在Terminal Bench 2.1中得分88.3,接近GPT-5.6 Sol的88.8,並高於Claude Fable 5和Claude Opus 4.8的84.6;在FrontierSWE中得分81.2,較GPT-5.6 Sol和Claude Opus 4.8分別高9.9和14.5;在SWE Marathon中得分42.0,同樣超過GPT-5.6 Sol的39.0及Claude Fable 5的35.0。我們認為,Kimi K3在代碼理解、終端操作、倉庫級修改及長期軟體工程任務方面已具備較強競爭力,國產模型Coding能力與海外前沿模型的差距正在明顯收窄。
Kimi K3將代碼生成延伸至較長周期的工程任務。據Kimi官方披露,模型能夠在較少人工干預下持續執行長時間工程任務,瀏覽大型代碼倉庫並協調終端工具。在GPU內核優化測試中,各模型可使用不超過24小時,對NVIDIA H200及另一類通用GPU上的四項任務進行分析、重寫和測試;Kimi K3在部分任務中表現出較強競爭力,早期版本還承擔了研發團隊較多內核優化工作。我們認為,代碼模型的價值正在由局部補全轉向倉庫級理解、性能分析和驗證閉環,任務持續時間與外部工具調用量的上升將顯著擴大單次編程請求的推理負載。
原生多模態使視覺資訊直接參與代碼修改。Kimi K3能夠在代碼與實時截圖之間反覆迭代,根據視覺結果調整遊戲開發、前端頁面和CAD內容。官方案例顯示,模型使用Three.js WebGPU和GPU計算構建程序化瀏覽器3D探索遊戲,並結合外部生成工具製作人物與馬匹資產,形成包含森林、村莊、雪山和動態天氣的開放場景。我們認為,視覺進入執行閉環後,模型不再只生成代碼,而是需要持續獲取截圖、識別問題並重新運行程序,推理調用次數和外部計算任務將隨迭代輪數增長。
架構升級:稀疏化與資訊流優化並行推進
Kimi K3通過注意力機制和殘差結構調整改善規模擴張效率。模型採用Kimi Delta Attention與Attention Residuals作為架構骨幹,其中KDA用於提升注意力在長序列條件下的計算效率,AttnRes則在不同網路深度之間選擇性檢索歷史表征,而非對各層資訊進行統一累積。配合訓練方法和數據配方優化,官方測算Kimi K3相較Kimi K2實現約2.5倍的整體縮放效率提升。我們認為,在參數規模持續增加的背景下,單純依靠計算資源擴張的邊際效率可能下降,注意力計算、跨層資訊流和數據配方將共同決定訓練投入向模型能力轉化的效率。
高稀疏MoE降低有效計算量,但提高專家並行複雜度。Kimi K3採用Stable LatentMoE,在896個專家中有效激活16個專家,激活比例約為1.8%。為應對高稀疏度條件下的路由和負載均衡問題,模型引入Quantile Balancing,根據路由分數量化分位數直接分配專家,減少啟發式更新及敏感超參數;Per-Head Muon則對不同注意力頭獨立優化,SiTU和Gated MLA分別用於改善激活控制與注意力選擇。我們認為,MoE能夠控制單次推理有效計算量,但專家數量提升後,負載均衡、跨設備通信和調度效率對集群利用率的影響將進一步擴大。
多代技術持續復用與迭代,Kimi K3體現較強的技術積累效應。月之暗面自2024年推出Mooncake分離式推理架構後,持續圍繞超大模型訓練與長上下文推理完善技術體系:2025年Kimi K2通過MoE與MuonClip驗證兆參數模型的穩定訓練,隨後推出Kimi Linear及KDA,以降低長上下文計算量和KV Cache占用;2026年又通過Attention Residuals改善超深網路的資訊傳遞。Kimi K3進一步將上述技術與Stable LatentMoE、專家負載均衡及量化感知訓練相結合,實現2.8兆參數規模和100萬Token上下文,並使整體縮放效率較K2提升約2.5倍。我們認為,K3的能力提升並非單次堆疊參數,而是模型架構、訓練方法和推理系統持續積累的結果,技術復用有望縮短後續模型迭代周期,並提升API定價及商業化效率。
Kimi K3明確提出64張以上加速卡的超節點部署建議。據Kimi官方披露,大規模模型推理效率受益於更大的高帶寬通信域,因此建議在擁有64張或更多加速卡的超節點環境中部署Kimi K3。該要求意味著模型雖然每次僅激活部分專家,但在百萬Token上下文、長時程執行和專家並行場景下,仍需要較強的設備間通信、顯存管理及任務調度能力。我們認為,推理基礎設施的競爭指標正在從單卡算力擴展至超節點內部互聯、共享內存域、集合通信效率和系統級穩定性,高速網路與整機系統價值量有望隨模型規模同步提升。
商業化:緩存效率成為低價長上下文服務的關鍵
智能能力提升推動API價格中樞上移。Kimi K3緩存命中輸入、未命中輸入和輸出價格分別為$0.30、$3.00和$15.00/百萬Token,較Kimi K2.6明顯提價,並高於GLM-5.2和MiniMax-M3;其中輸出價格已與GPT-5.6 Terra相當,但仍低於GPT-5.6 Sol和Claude Fable 5。我們認為,隨著長上下文、多模態和複雜Workflow能力提升,國產模型定價正由低價競爭逐步轉向能力定價。
系統級優化降低實際調用成本,支撐API提價後的商業化效率。Kimi平台對常規模型請求自動啟用上下文緩存,緩存命中輸入價格僅為未命中的十分之一;據Kimi官方披露,Mooncake分離式推理架構使編碼工作負載緩存命中率超過90%。同時,Kimi K3通過Prefill與Decode分離、KDA前綴緩存、靜態專家並行、關鍵路徑無主機同步及專家負載均衡等方式,提高長上下文和高稀疏MoE場景下的集群利用率。我們認為,模型競爭正由單純比較Token報價,轉向緩存復用、顯存管理、算力調度及集群吞吐效率的綜合競爭。
風險提示
宏觀經濟波動。若宏觀經濟波動,可能對AI產業資本投入產生負面影響,導致AI產業變革、新技術落地節奏、整體行業增長不及預期。
技術進步不及預期。若AI技術、大模型技術、AI應用進展不及預期,或對行業落地情況產生不利影響。
中美競爭加劇。中美競爭加劇,或影響國內算力基礎設施布局,導致國內AI大模型技術迭代速度放緩。
來源:金色財經
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
上一篇
下一篇