金色財經
作者:矽谷Alan Walker;來源:嘉妍Kea
加州大道的 Zombie Café,早上七點半。昨晚 DeepSeek 那份"預計漲幅較大"的公告出來之後,幾個開發者群直接炸了——有人連夜在寫多模型路由,有人在算漲三倍之後還劃不劃算。而矽谷Alan Walker 想借這個時點,把一個被討論了兩年、但始終沒被講透的問題徹底講透:這個價格,當初到底是怎麼做出來的。
先看價格,這是全部討論的起點。
今天(2026 年 8 月 7 日),DeepSeek 開放平台的牌價是:V4-Flash 每百萬 token,輸入 0.14 美元、緩存命中輸入 0.0028 美元、輸出 0.28 美元;V4-Pro 對應是 0.435、0.003625 和 0.87 美元。國內開發者看到的人民幣口徑是 Flash 平峰期 1 元 / 0.02 元 / 2 元,Pro 是 3 元 / 0.025 元 / 6 元。
同一天,美國這邊的牌價:GPT-5.6 Sol 輸入 5 美元、輸出 30 美元;Claude Opus 5 輸入 5 美元、輸出 25 美元;Claude Fable 5 輸入 10 美元、輸出 50 美元;Gemini 3.1 Pro 輸入 2 美元、輸出 12 美元。
表 1:主流模型 API 牌價(美元 / 百萬 token,2026 年 8 月 7 日,各家官方定價頁)
| DeepSeek-V4-Flash | 0.14 | 0.0028 | 0.28 |
| DeepSeek-V4-Pro | 0.435 | 0.003625 | 0.87 |
| Claude Fable 5 | 10.00 | 1.00 | 50.00 |
| GPT-5.6 Sol | 5.00 | 0.50 | 30.00 |
| Claude Opus 5 | 5.00 | 0.50 | 25.00 |
| GPT-5.4 | 2.50 | 0.25 | 15.00 |
| Gemini 3.1 Pro | 2.00 | 0.20 | 12.00 |
| Claude Sonnet 5(促銷價至 8/31) | 2.00 | 0.20 | 10.00 |
| GPT-5.4 nano | 0.20 | — | 1.25 |
註:Gemini 3.1 Pro 與 GPT-5.6 系列對超過 20 萬 token 的長上下文另設更高計價檔(Gemini 漲至 4/18,GPT-5.6 Sol 漲至 10/45);DeepSeek 100 萬 token 上下文不加價。DeepSeek 人民幣價為平峰價,工作日高峰時段(9:00–12:00、14:00–18:00)計費翻倍。
做幾個除法。V4-Flash 的輸出價對 GPT-5.6 Sol 是 1/107,對 Claude Fable 5 是 1/179。緩存命中輸入那一列更誇張:V4-Pro 的 0.003625 美元對 Claude Opus 5 的 0.50 美元,是 1/138。對標旗艦的 V4-Pro,輸出價對 GPT-5.6 Sol 也有 1/34。
還有一個背景必須先交代:就在昨天,8 月 6 日,DeepSeek 發公告說計劃近期整體上調 API 定價,"預計漲幅較大"。也就是說,你現在看到的這張表,是這個價格體系存在的最後一段時間。這反而是把這個問題講清楚的最好時機——因為連它自己都承認,這個價格不可持續了。那它當初是怎麼做到的?
市面上的解釋停留在兩個字:MoE。這個解釋不能算錯,但它解釋不了數量級。MoE 大家都在用,OpenAI 和 Google 的旗艦幾乎可以確定也是 MoE,憑什麼別人用 MoE 賣 30 美元,它用 MoE 賣 0.28 美元?
真正的答案分兩半。技術上的極致優化,最多解釋十倍;剩下那十倍,藏在商業結構里。兩個十倍相乘,才是一百倍。下面先講技術的十倍,再講那個幾乎沒人認真講過的、商業的十倍。
1技術的十倍:所有功夫都下在同一個地方——顯存
把 DeepSeek-V4 技術報告里所有降本手段列出來,你會發現它們表面上五花八門,落點其實只有一個:顯存。為什麼偏偏是顯存,第二節揭曉。先看這四處。
第一處:激活率壓到 3%。V4-Pro 總參數 1.6 兆,每個 token 只激活 490 億,激活率 3.06%;V4-Flash 總參數 2840 億,激活 130 億。推理算力跟激活參數走,不跟總參數走——所以一個 1.6 兆參數的模型,算力開銷只相當於一個 490 億的模型。3% 的激活率在公開可查的前沿模型里是最低一檔。
第二處:注意力壓縮九成。V4 放棄原生注意力,改用 CSA(壓縮稀疏注意力)與 HCA(重度壓縮注意力)交錯。官方技術報告的數據:100 萬 token 場景下,V4-Pro 單 token 推理 FLOPs 只有上一代 V3.2 的 27%,KV 緩存只有 10%;V4-Flash 壓得更低,FLOPs 10%,KV 緩存 7%。KV 緩存是長上下文場景吃顯存的第一大戶,壓掉九成,意味著同一張卡能塞進去的並發請求變成十倍以上——硬體沒變,單位時間能賣的 token 變成了十幾倍。
第三處:FP4 量化感知訓練。MoE 專家權重用 FP4 精度儲存,其餘大部分用 FP8。從 FP16 到 FP4,同樣的顯存裝四倍的權重。而且這是訓練階段就按低精度來(QAT),不是訓完再壓,精度損失被訓練本身吸收。為了在這麼低的精度下訓得穩,配了一整套補丁:mHC 流形約束超連接、Muon 優化器、預期路由、SwiGLU 鉗位——團隊自己承認這些技巧為什麼有效,底層機理仍是開放問題。
第四處:緩存放到硬盤上。V4 引入異構 KV Cache 與磁盤緩存機制,壓縮後的注意力條目直接落盤儲存。這件事直接體現在價格表上,而且是整張表里最被忽略的一格:
表 2:緩存命中折扣力度(各家官方定價頁,2026 年 8 月 7 日;折扣比例為作者計算)
| GPT-5.6 Sol | 5.00 | 0.50 | 10.0% |
| Claude Opus 5 | 5.00 | 0.50 | 10.0% |
| Gemini 3.1 Pro | 2.00 | 0.20 | 10.0% |
| DeepSeek-V4-Flash | 0.14 | 0.0028 | 2.0% |
| DeepSeek-V4-Pro | 0.435 | 0.003625 | 0.83% |
看見沒有:OpenAI、Anthropic、Google 三家的緩存摺扣整整齊齊都是一折。DeepSeek-V4-Pro 打的是 0.83 折。為什麼它敢?因為別人的 prompt cache 存在顯存或高速內存里,成本按每 GB 幾十美元的 HBM 算;它把緩存壓縮後扔到固態盤上,成本按每 GB 幾毛錢的 SSD 算。介質差了兩三個數量級,折扣自然能再差一個數量級。
為 什 麼 這 一 格 最 重 要
Agent 時代的賬單結構變了。一個 coding agent 每次調用,都要把整個代碼庫、系統提示詞、歷史軌跡原樣重發一遍,這部分內容的緩存命中率能到 80% 以上。也就是說,Agent 賬單的大頭不在"輸出",在"重複輸入"。同樣一百萬 token 的重複上下文,Claude Opus 5 收 0.50 美元,V4-Pro 收 0.003625 美元。矽谷不少公司把主力模型切過去之後賬單掉了兩個數量級,主要就掉在這一格,而不是掉在輸出價上。
這四處之外,訓練側還有一手:V4 的後訓練用了全詞表同策略知識蒸餾(OPD),讓 Pro 逐 token 地教 Flash。這解釋了 Flash 為什麼只用 130 億激活參數還能打——它壓根就沒打算自己從頭學,它是被大模型餵大的。經濟含義比技術含義更重要:訓練一次 Pro 的成本,攤到了 Flash 的每一次調用上。今天全球調用量登頂的是賣 0.28 美元的 Flash,而撐起它能力的那筆訓練開銷,記在 Pro 的賬上。
把這幾項的倍數連乘:MoE 相對稠密省 3–10 倍,注意力壓縮再省 4–10 倍(長上下文場景),FP4 讓同樣的卡裝下四倍權重,磁盤緩存讓重複輸入的成本幾乎歸零,蒸餾讓小模型白拿大模型的能力。這就是技術的十倍——嚴格說,在長上下文和 Agent 場景里不止十倍。但注意,這些方法全部寫在公開論文里,權重全部放在 Hugging Face 上。技術上沒有秘密。真正的問題是下一個:為什麼美國公司不照着做?
2被制裁逼出來的路線:它優化的東西,美國公司不缺
要理解為什麼所有功夫都下在顯存上,得回到一個不太舒服的事實:出口管制。
DeepSeek 早期能合法買到的最好的卡是 H800——H100 的中國特供版,算力大體保留,互聯帶寬被砍。2025 年那份 545% 利潤率的賬單(第三節細講),整個推理系統就跑在 H800 上。後來連 H800 也進不來了。這意味著它面對的約束條件和美國實驗室完全不同:美國實驗室缺的是電力和機櫃,它缺的是每一 GB 的顯存和每一條互聯帶寬。
約束條件決定優化方向。當你的卡互聯被砍,你就被迫把專家並行的通信延遲藏進計算里,被迫用 TileLang 手寫融合算子把每一分帶寬榨乾;當你的顯存總量被物理封鎖,你就被迫發明 MLA、被迫走到 CSA/HCA、被迫上 FP4、被迫把緩存扔到硬盤上。從 V2 的 MLA 到 V4 的混合壓縮注意力,這條技術路線一脈相承,而它的起點不是某個天才的靈感,是採購清單上買不到的那幾行。
反過來看美國實驗室。手裡有幾十萬張 H100/B200 的時候,工程師的稀缺資源不是顯存,是研究員的時間。優化目標自然是"每個研究員每個月能推進多少能力",而不是"每一美元能吐多少 token"。不是他們蠢,是他們的約束條件根本不產生這個方向的進化壓力。
省錢是一種能力,而這種能力只在缺錢的地方進化。顯存受限逼出了壓縮技術,帶寬受限逼出了通信調度,採購受限逼出了國產卡適配。制裁沒有卡死這家公司,制裁定義了這家公司。
國產卡這條線還在繼續壓成本。V4 發布當天,細粒度專家並行方案同時在英偉達 GPU 和華為昇騰 NPU 上完成驗證,寒武紀、天數智芯做了 Day 0 適配。DeepSeek 在定價頁上寫了一句極少有廠商會寫的話:受限於高端算力,目前 Pro 的服務吞吐十分有限,預計下半年昇騰 950 超節點批量上市後,Pro 的價格會大幅下調。把降價預期直接掛鈎國產晶片量產節奏——這句話的潛台詞是,它連英偉達那 70% 以上的硬體毛利率,都當成一項可以省掉的成本在管理。美國實驗室沒有這個選項:它們買英偉達的卡,是在給自己的算力付一道奢侈品稅,而且這道稅沒有替代稅率。
3一份被遺忘的賬單:它早就證明了這價格能賺錢
有人會說:價格低說明在燒錢。這個判斷有一份公開材料可以直接反駁,而且這份材料奇怪地被大多數人遺忘了。
2025 年 3 月 1 日,DeepSeek 在開源周最後一天公開了《DeepSeek-V3/R1 推理系統概覽》,把自己的運行賬單攤開了:
2025 年 2 月 27 日 12:00 — 28 日 12:00,真實運行 24 小時
推理服務峰值占用 278 個節點,平均 226.75 個節點(每節點 8 張 H800)。按 GPU 租賃 2 美元 / 小時估算,總成本 87,072 美元 / 天。當日輸出 token 總數 1680 億。若全部按 R1 定價計費,理論日收入 562,027 美元,理論成本利潤率 545%。
官方同時說明:實際收入遠低於此,因為網頁和 App 免費、夜間打折、V3 定價更低。
來源:DeepSeek 官方知乎賬號,2025 年 3 月 1 日;GitHub open-infra-index 倉庫同步發布。
把 87,072 美元全部攤到 1680 億輸出 token 上(上限估算,這筆錢其實還同時服務了輸入),每百萬輸出 token 的成本上限約 0.52 美元。這是一年半前、上上代模型、純英偉達卡的成本。之後架構換代(FLOPs 降到 27%)、精度減半(FP8 到 FP4)、緩存落盤、國產卡引入,四條線同時往下壓——今天 V4-Flash 賣 0.28 美元,完全落在成本曲線的延長線上。
這份賬單里還有一句被跳過的話,價值不亞於那個 545%:白天用所有節點跑推理,晚上負荷低時減少推理節點,騰出來做研究和訓練。這是把 GPU 集群當潮汐電站用。訓練任務可以隨時暫停恢復,推理請求不能,用訓練填推理的谷,集群利用率逼近滿載。注意這件事的門檻:純 API 服務商沒有訓練任務可填谷,純研究機構沒有推理流量可言——必須兩頭都有、兩頭都大,這個招才成立。
"燒錢換市佔率"這個指控,從 2025 年 3 月起就不成立了。它的低價不是補貼出來的,是算出來的。真正的問題從來不是"它是不是在虧",而是"為什麼只有它把價格定在成本線上"。這就要講商業的十倍了。
4商業的十倍:token 價里,一大半不是 token 的錢
現在把一家美國頭部實驗室的 token 定價拆開。你付的 30 美元里,推理的電費和折舊只是零頭,剩下的錢在養這些東西:
下一次訓練。前沿實驗室的 API 毛利,本質上是下一代模型的融資工具。訓練開支以百億美元計年年翻倍,投資人的錢填不滿,API 毛利必須補位。token 定價的第一約束不是成本,是資本開支計劃。
人才軍備。2025 年以來矽谷頂級研究員的挖角報價屢屢見諸報端,單個人的組合薪酬包上億美元的案例已不新鮮。幾千人的實驗室,這筆錢最終都在 token 價里。
幾億免費用戶。ChatGPT、Claude、Gemini 都背着龐大的免費和訂閱用戶群,訂閱費包月、消耗不封頂,重度用戶吃掉的算力遠超月費。這個窟窿要用 API 毛利填。
企業銷售、合規、安全。SLA、數據駐留、審計、紅隊、銷售團隊、客戶成功——這套組織賣的是確定性,也全是成本。
DeepSeek 的成本表上,這幾行幾乎是空的。母公司幻方量化的自有資金養研發,不需要 API 毛利去給下一次訓練融資;沒有全球銷售體系;沒有付費訂閱要補貼;開源社區還免費替它做了大量適配和優化工程——袁進輝當年就說過,V3/R1 的架構和主流模型差別太大,第三方必須照它的報告重寫系統才能跑出效率,而開源把這個門檻降了下來,社區替它完成了閉源公司要發工資才能完成的工作。
解 讀
同樣一個 token,兩家公司定價時看的錨完全不同。美國實驗室的錨是"這個 token 替代了多少人類勞動"——一小時 150 美元的工程師被替代,token 賣 30 美元一百萬個依然顯得便宜,所以定價往價值那頭靠。DeepSeek 的錨是"這個 token 消耗了多少電和折舊"——定價往成本那頭靠。價值定價和成本定價,兩個錨之間隔着的,本來就是兩個數量級。一百倍的價差里,有一半根本不是效率差距,是定價哲學的差距。
5捅破窗戶紙:美國公司不是做不到,是不能做
把上面的邏輯推到底,會碰到一個大多數分析繞開的結論。
假設 OpenAI 明天宣布:GPT-5.6 Sol 降價到 0.30 美元每百萬輸出 token。技術上完全做得到——該有的壓縮技術都是公開論文,該有的工程人才它比誰都多。但它不能這麼做,原因有三層,一層比一層硬。
第一層,收入會當場蒸發。OpenAI 的年化收入已在數百億美元量級,其中 API 是重要一極。價格降到 1/100,現有需求貢獻的收入立刻變成 1/100,而需求彈性再大,也不可能在一個季度里放大一百倍來填坑。DeepSeek 做地板價的時候幾乎沒有存量收入可損失——敢把價格打穿的前提,是你沒有什麼可以被打穿的。這是最標準的創新者窘境:不是看不見,是轉不了身。
第二層,估值會塌方。頭部實驗室數千億美元的估值,建立在一個共同敘事上:智能是稀缺的高價商品,毛利會隨規模改善。旗艦模型按成本定價,等於親口承認 token 是大宗商品——那估值模型就得從"軟體公司"切換到"電力公司",股價營收比差着一個數量級。對上市在即或持續融資中的公司,這不是定價決策,這是自毀決策。
第三層,組織不會執行。為成本定價而生的公司,從晶片採購、集群調度到精度選擇,每個環節都在為"每美元 token 數"優化;為能力溢價而生的公司,每個環節都在為"下一次發布會"優化。讓後者轉向前者,等於讓整個組織換一套本能。歷史上沒有幾家公司完成過這種轉身,而且沒有一家是在自己最賺錢的時候轉的。
這套邏輯有一個天然的對照實驗,恰好能驗證它:Gemini。看錶 1,美國旗艦里最便宜的是誰?Gemini 3.1 Pro,2 美元 / 12 美元,比 GPT-5.6 Sol 和 Claude Opus 5 便宜一半以上。為什麼偏偏是 Google?因為三個約束它各鬆了一格:它用自研 TPU,英偉達那道硬體稅它不交;它的估值不靠 AI 敘事單獨支撐,廣告和雲才是地基,token 按成本定價不會動搖市值邏輯;它的推理基礎設施本來就是按搜尋的規模經濟建的。三個約束松一格,價格就低一半;DeepSeek 三個約束全部為零,價格就低兩個數量級。價格和約束的對應關係,在這三家公司身上排得整整齊齊——這個排列不是巧合,是定價的物理學。
真正的秘密是不對稱:DeepSeek 需要 token 便宜——便宜是它換取影響力、生態和戰略位置的唯一籌碼;美國實驗室需要 token 貴——貴是它們的收入、估值和整個敘事的地基。同一個市場裡,一方的最優解是把價格打到成本,另一方的最優解是把價格釘在價值。你看到的 1/100,就是這兩個最優解之間的距離。
6更深一層:為什麼它比國內同行還便宜
講到這裡還剩最後一個漏洞。前面的商業分析——不用給下一次訓練融資、沒有英偉達的硬體稅、沒有免費用戶的補貼窟窿——聽起來像是"中國公司對美國公司"的普遍優勢。如果只是這樣,那國產模型應該都便宜。但事實不是這樣:
表 3:國產旗艦模型 API 牌價對比(人民幣 / 百萬 token,各家官方定價頁,2026 年 8 月)
| DeepSeek-V4-Pro(平峰) | 3 | 0.025 | 6 |
| DeepSeek-V4-Flash(平峰) | 1 | 0.02 | 2 |
| Kimi K3 | 20 | 2 | 100 |
| Qwen3.7-Max | 12 | — | 36 |
| GLM-5.2(約合) | 10 | — | 31 |
來源:月之暗面開放平台、阿里雲百鍊、智譜官方定價頁。GLM-5.2 官方以美元報價(1.40/4.40 美元),按 7 折算為人民幣約值。高盛研報(經媒體轉述)給出的混合口徑單價:K3 約 2.3 美元、Qwen3.7-Max 約 1.4 美元、GLM-5.2 約 0.9 美元、DeepSeek V4-Pro 約 0.18 美元 / 百萬 token。
看清楚這張表的含義:同樣在中國,同樣面對晶片管制,同樣的電價、同樣的工程師薪酬水平,Kimi K3 的輸出價是 V4-Pro 的 17 倍,Qwen3.7-Max 是 6 倍,GLM-5.2 是 5 倍。"中國成本優勢"解釋不了這個差距——大家的成本環境是一樣的。那差距從哪來?三個地方,一個比一個深。
第一,別人租算力,它有自己的機房。DeepSeek 脫胎於幻方量化,而幻方在管制落地之前就自建了萬卡級的螢火集群——這批卡是自有資產,推理成本按折舊和電費算。多數同行的推理跑在雲上,雲廠商的毛利就疊在它們的成本里;即便是字節、阿里這種自己有雲的,模型團隊用集團的卡也要走內部結算,價格里同樣含着一道內部毛利。一邊按折舊算賬,一邊按租金算賬,起跑線就不在一處。
第二,專家並行的經濟學:架構可以抄,流量抄不走。這一點最容易被忽略。V4 的核心降本手段是大規模跨節點專家並行——把幾百個專家攤到大量 GPU 上,靠巨大的 batch size 把矩陣乘法的效率打滿。注意這套打法成立的前提:請求量必須大到隨時能把 batch 填滿。批次填不滿,專家攤得越開,通信開銷越虧,稀疏架構反而比稠密更貴。DeepSeek 的調用量是全球第一(V4-Flash 單周 7.22 兆 token),批次永遠是滿的,單位成本被攤到理論下限;同行就算把開源代碼原樣搬走,沒有這個量級的流量,跑出來的單位成本也是另一個數字。換句話說,它的成本優勢有一半寫在論文里,另一半寫在流量榜上——前者人人可抄,後者抄不動。而低價帶來流量、流量攤薄成本、成本支撐更低價,這個循環一旦轉起來,後進者從任何一點都切不進去。
第三,也是最根本的:同行的 API 是收入,它的 API 是支出。看看各家的處境。月之暗面融資多輪、估值高企,K3 定價明說要"價值變現",對標的是 Claude 而不是成本線;智譜在上市通道里,第一季把 API 定價提了 83%,因為招股書需要毛利率;阿里的通義要給雲業務導流和創收,定價里含着雲的商業目標。它們的 API 報表上都是收入項,收入項就要背毛利指標。DeepSeek 的 API 在幻方體系裡更接近一個支出項——花一筆可控的錢,換取生態、標準和話語權。一個要向投資人證明"我能把 token 賣出利潤",一個要向行業證明"token 本來就不值錢"——兩句話對應兩張定價表。
它比美國公司便宜和比中國同行便宜,是同一個原因的兩次顯形:定價表上寫的不是成本,是這家公司靠什麼活着。靠融資活的,價格里含着估值;靠雲活的,價格里含着雲的指標;只有既不缺錢、又不指望 token 掙錢的,價格里才只剩下電費和折舊。全世界符合這個條件的大模型公司,目前只有一家。
7潑盆冷水:便宜的賬單之外,還有三筆賬
講完秘密,必須把代價也擺出來,不然這篇文章就成了軟文。
第一筆賬:知識密度。按 DeepSeek 官方技術報告的對比表,V4-Pro-Max 在 SimpleQA-Verified(純事實性知識召回)上得分 57.9,對 Gemini 3.1 Pro 的 75.6,差了近 18 個點;HLE 上 37.7 對 44.4。編碼和數學是它的強項——LiveCodeBench 93.5 超過 GPT-5.4 的 91.7,Codeforces 評分 3206 排進人類選手前 23 位,SWE-bench Verified 80.6 與 Gemini 打平——但 DeepSeek 自己承認在通用世界知識上落後前沿 3 到 6 個月。注意:這些分數全部來自廠商自評,第三方獨立復現尚未完成。如果你的場景是法律檢索、醫療問答、金融盡調,那 18 個點會變成實打實的幻覺率,省下的 token 錢可能不夠賠一次錯。
第二筆賬:穩定性。8 月 4 日,V4-Flash 因前所未有的訪問量出現容量不足。偶發事故的說法站不住——它是低價高負載的結構性結果。OpenRouter 周榜(7 月 27 日至 8 月 2 日)顯示 V4-Flash 以 7.22 兆 token 的調用量登頂全球第一;V4-Pro 的並發上限只有 500。峰谷定價想削峰,但 coding agent 可以批式、異步、跨時區地跑,而且用戶橫跨中美——這邊的谷正好是那邊的峰,二十四小時全是高峰。閉源廠商貴出來的那部分錢里,有一塊買的就是確定性——這塊錢 DeepSeek 沒收,你也確實沒得到。
第三筆賬:時間。這是最大的一筆。8 月 6 日的漲價公告說明,把價格釘在成本線上這件事,連它自己也只能維持在算力供給寬鬆的窗口裡。現價已經是 5 月 31 日"永久降價"到原價 1/4 之後的價格,如果只是恢復原價,漲幅就是 300%。而且這不是孤例:智譜第一季 API 定價提升 83%(調用量仍增長 400%),Kimi K3 輸入價較前代漲超 3 倍、發布三天就因請求量超載暫停新用戶訂閱。整個行業正在從"拼低價搶用戶"轉向"算力賬單面前人人平等"。
給 決 策 者 的 三 行 結 論
寫代碼、跑 Agent、批量處理長文檔——切過去,性價比差距大到不需要開會討論,但立刻把多模型路由寫好,漲價方案隨時落地。
事實召回敏感的場景(法律、醫療、盡調)——那 18 個點的知識差距是真實的幻覺率,別為省 token 錢冒這個險。
生產級流量——先看清 Pro 只有 500 並發這個硬約束,再決定要不要把身家押在一個剛宕過機、正要漲價的服務上。
8結語:秘密的全文
回到標題的問題。DeepSeek 把 token 做到這麼便宜的秘密,完整版本是這樣的:
技術上,它被制裁逼着把全部功夫下在顯存上——3% 的激活率、壓掉九成的注意力、FP4 的權重、落盤的緩存——省出了十倍。商業上,它的成本表里沒有下一次訓練的融資壓力、沒有億級免費用戶的補貼窟窿、沒有銷售合規的組織包袱、沒有估值敘事的枷鎖——又是十倍。兩個十倍相乘,一百倍。
而別人學不來的原因,與技術無關。壓縮注意力的論文是公開的,FP4 的方法是公開的,連 545% 利潤率的賬單都是公開的。缺的從來不是論文,是 允許自己便宜的資產負債表。OpenAI 的 token 價格里含着它的估值,Anthropic 的價格里含着下一次訓練的融資,Kimi 的價格里含着投資人要的回報,通義的價格里含着雲的指標。只有 DeepSeek 的價格里,幾乎只剩電費和折舊——因為它是唯一一家不靠 token 活着的公司。
所以這個價格從來不只是價格。這是一家不需要靠 token 賺錢的公司,和一群必須靠 token 賺錢的公司之間,一場不對等的較量。前者把 token 當彈藥,後者把 token 當糧食——彈藥可以按成本撒出去,糧食必須賣出利潤。
然後是 8 月 6 日。價格屠夫發公告說要大幅漲價。很多人把這讀成"扛不住了",我讀到的是另一層:當調用量做到全球第一、當生態咬鈎、當昇騰的產能表開始決定它的定價表——它手裡終於有了成本曲線之外的東西。便宜從來不是它的目的,便宜是它買入場券的價格。現在票買到了。
token 可以賣到別人的百分之一,這件事它已經證明了。
接下來它要證明的是另一件事:漲價之後,還有多少人走得掉。
· · ·
核 實 說 明
可直接查證的一手事實:表 1、表 2 的全部價格來自 DeepSeek API 文檔定價頁、Anthropic、OpenAI、Google Gemini 官方定價頁,2026 年 8 月 7 日逐條核對;倍數與折扣比例為作者據牌價計算。表 3 的 Kimi K3 價格(輸入 20 元 / 緩存命中 2 元 / 輸出 100 元)來自月之暗面開放平台官方公示;Qwen3.7-Max(輸入 12 元 / 輸出 36 元)來自阿里雲百鍊官方價格頁;GLM-5.2(1.40 / 4.40 美元)為智譜官方美元報價,人民幣約值系作者按 7 匯率折算。V4 參數量(Pro 1.6T/激活 49B,Flash 284B/激活 13B)、FLOPs 與 KV 緩存對比(27%/10%、10%/7%)、FP4 QAT、磁盤 KV 緩存機制、並發上限(Pro 500 / Flash 2500)來自 DeepSeek-V4 技術報告(arXiv:2606.19348)與官方 API 文檔。545% 利潤率賬單來自 DeepSeek 官方知乎《DeepSeek-V3/R1 推理系統概覽》(2025 年 3 月 1 日)及 GitHub open-infra-index。8 月 6 日漲價公告、8 月 4 日容量事故、峰谷計費規則,經 IT之家、界面新聞、觀察者網、21 財經多家獨立報導確認。OpenRouter 周榜 7.22 兆 token 數據經 21 財經等轉述。昇騰/寒武紀/天數智芯適配資訊來自財聯社與各廠商公開發布。智譜定價提升 83% 出自其 CEO 張鵬業績說明會公開表述;Kimi K3 漲價與暫停訂閱出自月之暗面官方公告。
作者估算與推斷(非官方數據):"每百萬輸出 token 成本上限約 0.52 美元"系將當日總成本單獨攤到輸出 token 的上限估算,實際該成本同時服務輸入,僅用於量級判斷。"技術十倍、商業十倍"是作者的分析框架,不是可精確核算的分解。第五節關於 OpenAI/Anthropic 定價約束的三層分析(收入蒸發、估值切換、組織慣性)為作者推斷,兩家公司均未就定價邏輯做過此類公開表述;其中 OpenAI 年化收入"數百億美元量級"、頭部實驗室估值"數千億美元"為據公開報導的量級表述,非精確數字。"研究員組合薪酬包上億美元"指 2025 年以來多家媒體報導的頭部挖角案例,為量級表述。第六節的三點歸因(自有算力、專家並行的規模經濟、API 的報表屬性)同為作者分析框架:"批次填不滿則稀疏架構反而更貴"是專家並行的一般工程規律,各家實際集群利用率均無公開數據;"字節、阿里模型團隊內部結算含內部毛利"為按大型集團通行做法的推斷,非公開披露;幻方螢火集群的自建事實有公開報導,但當前集群規模與折舊口徑無公開數據。高盛研報的混合口徑單價(K3 約 2.3 美元、DeepSeek V4-Pro 約 0.18 美元等)經財經媒體轉述引用,未見研報原文,僅作參照,正文結論不依賴該組數字。
需打折扣看待的資訊:第七節全部評測分數(SimpleQA 57.9/75.6、HLE、LiveCodeBench、Codeforces、SWE-bench)來自 DeepSeek 官方技術報告自評,含對比方 Gemini/GPT/Claude 的分數亦出自該報告,第三方獨立復現尚未完成,Macaron 等機構明確將其標註為"廠商自述"。
存在衝突、本文未採信的資訊:其一,"V4 已徹底脫離 CUDA"的流傳說法與官方開源庫(MegaMoE、DeepGEMM)仍深度綁定 CUDA 工具鏈的事實矛盾,本文只採用"在昇騰 NPU 上完成推理驗證"的官方口徑。其二,高盛報告轉述的"騰訊阿里擬以逾 200 億美元估值投資 DeepSeek"與同文給出的智譜約 530 億美元估值存在明顯邏輯衝突,未見一手證實,不予採用。其三,幻方量化對 DeepSeek 的具體注資規模無公開一手披露,本文只使用"自有資金支持研發"這一雙方公開確認過的表述,不引用任何具體金額。
未涉及:DeepSeek 訓練總成本(自 V3 以來無可核實一手披露);本次漲價的具體幅度(官方未公布,文中"恢復原價即 300%"僅為參照系而非預測)。
本文所有價格與數據截至 2026 年 8 月 7 日,模型定價變動頻繁,實際以各廠商官方頁面為準。
本文不構成投資建議。文中評測分數多為廠商自評,第三方復現結果可能不同。
來源:金色財經
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
上一篇
下一篇