金色財經
作者:辰子Tina;來源:矽谷非共識
從 Token Optimization 到 Model Routing,過去一個月我最大的幾個判斷。
先說三個結論:
矽谷最火的詞已經從Token Maxing變成了Value Maxing:企業第一次開始系統性地管理 AI 成本。
開源模型的token市佔率漲得比大多數人想象的快:某頭部Coding Agent平台上,7 個月從 0.1% 漲到 15%。但 token 市佔率和收入市佔率是兩回事。
一個多月前Gavin Baker給過一個框架:前沿模型拿走90%的價值,開源模型承載80%的token。用最新數據檢驗,token那一半兌現得比預期還快:6月初,中國模型的 token 量在 OpenRouter 上已經超過美國模型。
昨天,Google交出了Q2財報,正好是本文一個現成的註腳——Google Cloud 收入年增率增長 82% 至 248 億美元,backlog升至5140 億。更值得注意的一個數字:Google第一方模型 API 的吞吐量已達每分鐘約220億 token,上季度還是160億。
Token Optimization聊了半年,token 總量還在加速——這就是後文會講到的 Jevons Paradox 的實時演示。但市場盤後給的反應是下跌:資本開支翻倍至 449 億美元,上市以來首次出現單季自由現金流為負。增長沒人懷疑了,市場開始給"賬單"定價。
上周在Menlo Park參加了一場閉門會,和Cursor, Fireworks, Cognition, Sierra 等十幾家AI Native公司聊了兩天。 加上這段時間在斯坦福,以及和創始人一對一訪談里反覆討論同一批問題,我越來越確定一件事:AI 的競爭,正在從Capability 轉向Economics。過去兩年討論的是誰能訓出最強的模型;今天,企業開始問的是:哪些任務值得調用最強的模型,哪些任務用便宜的模型就夠了。對應的兩個關鍵詞,是Token Optimization和Model Routing。前者意味著企業第一次開始系統性管理 AI 成本;後者意味著企業不再依賴單一模型,而是根據任務,在閉源、開源甚至自研模型之間動態分配流量。矽谷關於開源模型的討論,已經從"它夠不夠聰明",變成了"它能不能承擔更多生產流量"。而這背後真正影響的,是 OpenAI、Anthropic 這些 Frontier Labs 未來幾年的收入增長曲線。增長沒有放緩,但增長的邏輯變了先糾正一個容易被誤解的判斷:企業開始優化 token,不等於 AI 投資降溫。恰恰相反,這批 AI Native 公司的增速依然驚人。三個例子就夠說明問題:Fireworks的ARR年初約4億美元,現在已突破10億,剛剛以175億美元估值完成融資;Cognition約 5 億美元,年增率接近七倍;影音生成賽道的 Higgsfield,14 個月前收入是零,現在 5 億美元。支撐增長的原因有三個:模型能力過去半年出現明顯躍遷,企業真正看到了 ROI;產品從 Copilot 演進到 Agent,單個任務消耗的 token 顯著增加;越來越多公司切換到 Subscription 加 Usage 的混合收費,Token Consumption 直接轉化為收入。AI Spending 沒有放緩,只是進入了精細化營運階段:企業依然願意花錢,但不再願意為低價值的 token 買單。Token Optimization:每一次客戶對話都在談成本Token Optimization是這兩天出現頻率最高的話題。Cursor的原話是:現在每一次客戶對話,都在談這個。企業開始重新設計 Workflow,分析哪些任務真正需要最強模型,哪些任務可以下沉到更便宜的模型。但也不是所有人都在踩剎車。ClickHouse 是個有意思的反例:他們付給 Claude 的錢,今年1 月是 2 萬美元/月,6 月是 100 萬美元/月,漲了 50 倍,相當於自己收入的 5%。即便如此,公司依然鼓勵員工放開用,預期要漲到10%,因為他們認為 AI 帶來的生產力提升遠高於這部分成本。不過縱觀全場,ClickHouse 是少數派。大多數企業已經在裝剎車。有公司把這輪優化潮的導火索,歸結為軟體廠商集體轉向 token 計費——比如微軟 6 月 1 日把 GitHub Copilot 改成了按 token 收費。當成本第一次變得清晰可見,管控就開始了。這讓我想起 2022 到 2024 年的 Cloud Optimization。當時企業沒有放棄雲,只是在優化資源利用率——但值得記住的是,當時多頭也說"優化完了會花得更多",結果是 AWS、Snowflake、Datadog 們經歷了連續四個季度的增速下滑。今天優化的對象從雲資源變成了 token,劇本會不會重演,是下半年最值得盯的問題之一。Model Routing:企業買的不再是一個模型,而是一套系統如果說 Token Optimization 是目標,Model Routing 就是方法。我們早已越過了"給用戶一個模型下拉菜單"的階段。Cognition 現在可以把一次推理任務拆成多個子任務,根據成本、推理能力、延遲和準確率,自動分配給不同的模型。用戶甚至不需要知道背後調用了誰。企業真正採購的,不再是某一個模型,而是一套能智能調度多個模型的系統。去年的問題是:Who builds the best model?今年的問題是:Who routes to the best model?這個遷移有多快?兩個數據點:客服 AI 公司 Decagon 披露,30% 的 token 請求已經路由給開源模型;Factory 平台上,開源模型的 token 市佔率去年 12 月只有 0.1%,2 月到 1%,現在是 10% 到 15%——7 個月漲了一百多倍。他們的創始人甚至認為,12 個月後可能到 90%。90% 我持保留意見,但方向和斜率是清楚的。而且值得注意的是,路由給開源模型不只是圖便宜——好幾家公司提到另一個動機:不想被任何一家模型廠商鎖死。模型市場的啞鈴結構:要麼 Great,要麼 Cheap聊完這些公司,我對模型格局的判斷可以濃縮成一個詞:啞鈴。模型市場最終會形成一個啞鈴結構。要麼 Great,要麼 Cheap。中間地帶,會越來越難生存。兩端各自都會經歷整合。便宜這一端,這半年新面孔不斷——Kimi K3、GLM 5.2、Qwen 輪番搶鏡——但把地板價釘死的仍然是 DeepSeek:它至今是 OpenRouter 上市佔率最大的單一模型供應商,超過任何一家美國廠商。有投資人把它稱為市場的 "price-performance floor"。DeepSeek 給整個市場設定了性價比的地板:任何比它貴的模型,必須顯著更好,否則用戶寧可用 DeepSeek 多重試幾次。一個模型如果只是和它打平、或者只好一點點,會很難活下去。而強的這一端,真正的問題是:便宜的模型會不會跨過 "good enough" 這條線?Bear case 是:一旦便宜模型足夠好,大多數用戶就滿足了,Frontier Labs 的溢價隨之瓦解。我不同意這個判斷。我認為對 frontier intelligence 的需求永遠不會被徹底滿足——每當模型能力上一個台階,就會解鎖一批原來做不了的任務。啞鈴的兩端,都會有 durable demand。
一個多月前,Gavin Baker 給過一個框架:frontier 拿走 90% 的價值,開源承載 80% 的 token。當時我還在想,這個判斷會不會很快過時——畢竟 Kimi K3、DeepSeek V4 都是之後的事。用最新數據檢驗下來,結論是:token 那一半兌現得比他說的還快,價值那一半暫時還立着。OpenRouter 的路由數據顯示,中國模型的 token 量在 6 月初已經正式超過美國模型;到 7 月中,亞洲模型約占全平台 token 的 60%,年初以來市佔率翻了三倍。拉長一年看更驚人:Google、OpenAI、Anthropic 三家合計的 token 市佔率,從去年 6 月的約 70% 掉到了今年 6 月的約 30%;DeepSeek 單家占 16% 以上,已經是平台第一大供應商,V4 發布後半年內市佔率翻倍,agentic 工作負載是主要驅動。但框架的另一半同樣成立:Anthropic 只占約 12–13% 的 token,收入捕獲卻遠超按量計算的水平——在編程相關的支出里,Claude 系列長期占六成以上。市場正在分成兩條車道:commodity lane 跑量,premium lane 收錢。當然要打個折扣:OpenRouter 的樣本偏向開發者和價格敏感的流量,不能完全代表企業市場。但作為方向指標,它足夠清楚。一個具體的例子是 Harvey。上周我和他們技術負責人聊天,他們用自有的法律數據,和第三方合作在開源模型上做了 RL 和 SFT,再配一個 router——結果比直接用 Opus 4.8 效果更好、成本更低。這可能就是未來的樣子:前沿模型繼續被重度使用,但越來越多的token流向task-specific的開源模型。標價正在失去參考價值:真正該算的是 Fully Loaded Cost另一個值得關注的變化是,模型之間的標價(Input / Output Token Price)正在變得越來越沒有參考價值。企業真正關心的,不是每百萬 Token 的價格,而是完成同一個任務的總成本。緩存命中率(Cache Hit Rate)、推理穩定性、Retry 次數、Token 效率都會影響最終成本。有時候,看起來便宜四倍的模型,在真實生產環境裡,最終節省的成本可能遠沒有那麼多。矽谷的一線反饋也印證了這一點。便宜模型如果一次通過率低,需要重試兩三輪,token 價差很快就被吃掉;重試產生的緩存 token,還會反過來侵蝕賬面上的成本優勢。DeepSeek 把地板壓得最低,靠的是極致低價;但一線用戶抱怨最多的,恰恰是輸出不夠穩定、同一任務多次運行結果不一致。一個更便宜但更常失敗的模型,在生產環境裡可能並不便宜。所以這一節我最想留下的一句話是:真正該比的不是每百萬 token 的標價,而是 fully loaded cost per successful task——每一次成功任務的完全成本。類似的算術也適用於 on-prem vs cloud 的爭論。推特上有人認真算過賬:GLM 5.2 的 API 價格是每百萬 token 輸入 $1.40、輸出 $4.40;如果自購硬體本地跑,門檻約 2 萬美元、輸出約 20 tok/s——就算 24 小時全年跑滿,也要 5 年半才回本。按總成本算,雲的 token 效率仍然完勝本地。在算力緊缺、硬體迭代這麼快的當下,這筆賬只會越來越傾向雲。最後是可用性——這是我認為被低估的約束。GLM 這類模型目前嚴重受制於晶片,主要通過 Together、Fireworks 這類推理平台提供,還沒有在各大公有雲全面鋪開(雖然 AWS、Azure 已經開始上架部分中國模型);甚至Kimi因為算力不足,一度暫停過新用戶訂閱。中國模型的威脅值得跟蹤,但現在下重注還太早。接下來我會用兩個問題持續跟蹤:
來源:金色財經
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
上一篇
下一篇