鉅亨網編譯莊閔棻
儘管中國人工智慧(AI)公司月之暗面(Moonshot AI)近期推出的新一代大型語言模型 Kimi K3 採用線性注意力機制,引發市場對輝達 (NVDA-US) 、HBM 以及網路設備需求可能受到削弱的擔憂,但半導體研究機構 SemiAnalysis 認為,K3 的龐大參數規模與獨特的推理架構,反而可能讓高階 AI 硬體需求更加吃緊。
SemiAnalysis 指出,K3 龐大的參數規模與推理架構對算力需求極高,預計不僅不會壓抑高階 AI 硬體需求,反而有望帶動輝達高階 GPU、HBM 及高速互連解決方案的需求持續成長。
根據該機構的分析,K3 的參數量超過 2.8 兆,單是模型權重就需要超過 1.5TB 的 HBM 容量才能承載。
即便在使用者同時上線人數不算多的情況下,推理過程中產生的 KV 快取(KV cache)仍必須大量卸載至伺服器的 DDR5 記憶體與 NVMe 固態硬碟,顯示 HBM 空間吃緊的情況並未因此緩解。
更值得留意的是,月之暗面先前已透露,若要讓 K3 以高效率方式運作,至少需要 64 顆晶片組成的大規模擴展域架構,而這樣的硬體規格,恰好與輝達 GB200、GB300 NVL72 等機架級 AI 伺服器的設計理念不謀而合。
SemiAnalysis 因此指出,外界原先認為線性注意力機制會削弱 GPU 需求的推論,恐怕搞錯了方向。
真正的效應可能剛好相反,當模型推理效率提升、成本下降,將吸引更多企業與應用場景導入 AI,長期反而會拉升 GPU、HBM、DRAM 與網路基礎設施的需求。
市場的疑慮主要來自 K3 所採用的 Kimi Delta Attention(KDA)機制。相較於傳統 Transformer 架構的注意力運算,KDA 能大幅減少 KV 快取傳輸所需的資料量,最多可將網路頻寬壓力降低約十倍。
這樣的技術突破,讓不少投資人聯想到先前 DeepSeek R1 問世時,市場對 AI 硬體需求可能萎縮的恐慌情緒。
不過 SemiAnalysis 強調,這類看法忽略了大型模型推理過程中另一項關鍵變數,即參數規模本身所帶來的運算與互聯壓力。
K3 超過 2.8 兆的參數量,代表模型部署必須仰賴大規模分散式運算系統才能完成。此外,K3 導入專為混合專家(MoE)模型設計的先進平行化運算技術 WideEP 策略,將 896 個專家模組分散部署至多顆 GPU 上,讓單一 GPU 只需負責部分專家權重,藉此提高運算效率。
然而 WideEP 也帶來新的挑戰,專家模組之間頻繁的資料交換,需要更強大的網路互聯能力來支撐。
SemiAnalysis 分析指出,輝達 GB200/GB300 NVL72 所採用的銅背板互聯架構,機架內頻寬可達傳統 DGX B200 系統的 18 倍,恰好適合應付這類大規模專家平行推理任務。
換句話說,KDA 機制在 KV 快取傳輸上省下的頻寬,很可能被 WideEP 架構所需的權重交換頻寬給部分抵銷,整體 AI 基礎設施承受的壓力並未真正減輕。
值得注意的是,並非所有業界人士都認同輝達將是唯一贏家。
半導體與 AI 行業分析專家 GDP 便指出,月之暗面所提及的「64 顆晶片擴展域」架構,並不必然等同於輝達的 NVL72 方案,華為昇騰 950 SuperPod 同樣採用 64 顆晶片的配置,且具備類似 NVLink 功能的統一總線記憶體擴展能力。
從架構延展性來看,昇騰 950 SuperPod 甚至可跨越 16 個機架、擴展至 1024 顆 NPU,在因應大規模模型推理需求上同樣具備一定競爭力。
這也代表,K3 所帶動的硬體需求成長,未必會讓輝達獨享紅利,但整體市場對高階 AI 互聯系統的需求強化趨勢仍相當明確。
SemiAnalysis 進一步援引經濟學上的「傑文斯悖論」(Jevons paradox)來解釋這波 AI 基礎設施發展趨勢。該理論主張,當某項技術讓資源使用效率提升、單位成本下降時,總體需求往往不減反增,原因在於應用範圍會隨之擴大。
套用在 AI 產業,線性注意力機制降低了推理成本後,可能促使更多企業著手部署 AI 應用,進而讓全球 AI 推理規模持續擴張,最終帶動 GPU、HBM、DRAM 及高速網路設備的需求同步成長。
不過,GDP 對此抱持較為保留的態度。他認同傑文斯悖論在長期趨勢上的合理性,但也提醒,KDA 機制對於長上下文任務中的狀態儲存最佳化,確實具有實質效益。
他分析,即使 K3 模型權重規模龐大,但由於採用 4bit 量化與高度稀疏化設計,實際記憶體壓力可能低於外界直覺認知。
GDP 認為,真正值得市場長期關注的變數,在於包括 OpenAI、Anthropic 與 Google(GOOGL-US) DeepMind 等全球推理需求最大的幾家 AI 公司,是否已經或即將採用類似 KDA、DeepSeek CSA/HCA 等線性注意力方案。
他指出,一旦這些頭部 AI 公司大規模導入此類架構,長上下文推理對記憶體與互聯資源的需求可能明顯下滑,這將成為左右未來 AI 硬體需求結構的關鍵因素。
分析人士指出,展望後市,產業界真正該追問的問題,或許不再是線性注意力機制能否降低單一環節的資源消耗,而是 AI 應用規模持續擴張所帶來的新增需求,究竟能否長期跑贏架構效率提升所節省下來的資源缺口。
上一篇
下一篇
