當矽谷開始說打不過國內
金色財經
公司、技術、壁壘,甚至一個人最相信的能力,都在被重新定價。
晚點專欄作者丨五源資本合夥人 孟醒
8 月的一個下午,我從舊金山機場出來,上 101 高速往南開。
灣區的夏天幾乎沒有雲,陽光把路面曬得發白。機場附近還是倉庫和低矮的辦公樓,再往南,風景慢慢被廣告牌接管。
這條路的廣告牌,一直是矽谷最誠實的風向標。兩年前擠滿 SaaS,去年還能看到一點消費品牌,今年清一色全是 AI 公司。
圖一:Kimi 也加入了舊金山 「AI 廣告牌」 大戰;圖二:Codex 的廣告牌在舊金山越來越多,花了血本與 Claude Code 競爭
沒有任何跡象表明 AI 慢下來了,錢、卡、人還在往這裡涌。真正超出我預料的是,一些過去很難聽到的判斷,開始出現在最核心的人群里。
幾位 OpenAI 的朋友,花了很長時間復盤過去一年押錯的方向,也認真拆解中國模型公司到底強在哪;Google 的 researcher 聊到多模態,很直接地說:「打不過國內。」 這當然不能概括今天中美 AI 的整體位置,但幾年前,很難想象這樣的判斷會從矽谷一線的 researcher 嘴裡說出來。
大家開始重新估計中美之間的差距到底有多大,不過這個問題也已經沒有一個統一判斷:在預訓練、後訓練和多模態上,答案可能完全不同。
另一種變化,發生在過去兩年最貴的那批 Neo lab 身上。
Thinking Machines Lab 的 researcher 告訴我,他們今天經歷的痛苦,其他 Neo lab 遲早還會再經歷一遍。而我越來越懷疑,下一家真正跑出來的 Neo lab,不會長成今天這個樣子。
這可能是我這次在矽谷最強烈的感受:過去兩年形成的很多邊界和共識,並沒有想象中那麼牢固:
最頂尖的 researcher 聚在一起,是不是就能再造一家 OpenAI?美國最好的 Lab,是不是在每一個戰場上都能領先?模型、數據、應用和算力,到底誰是誰的上游?最強的模型,是不是就應該一直賣最貴的價格?……
甚至連最漂亮的增長故事,也被重新計算:8 月,彭博報導 Anthropic 的 ARR 達到了 650 億美元,比兩個月前又漲了 180 億。放在任何一家公司身上,這都是驚人的增長。但它仍然低於市場此前的期待,一些投資者原本預期,這個數字會達到 700 多億美元。
五個月前我寫 「全員 token-maxxing」,那時候矽谷最強烈的情緒是怕跟不上,更多 token、更多卡、更大的模型、更快的迭代,速度本身就是答案。
但五個月後,越來越多人開始回頭問:過去兩年我們最相信的那些東西,到底還有多少成立?
「打不過國內」
這次在矽谷出差,我反覆聽到一句以前很少聽到的話:
「打不過國內。」
說這句話的人都挺核心。有 Google 做多模態的 researcher,也有 xAI 和其他 frontier lab 的人,還有的是在研究美國的開源模型。這句話在不同的人、不同的場景里反覆出現,聽得多了,很難再把它當成隨口抱怨。
這裡的 「打不過國內」,指向的是一個個具體方向,不同訓練階段、不同模態、不同任務,答案可能完全相反。
做多模態的人,說的是 Seedance;做開源模型的人,盯着的是 K3;有人看到的是數據和 operation。同時美國自己的幾個開源模型和 Neo lab,進展又明顯沒有達到預期。
還有在多模態,一個讓我意外的是,一直是多模態最堅定的投入者 Google,最王牌的團隊也被砍了算力,無論是做圖片編輯的 Nano Banana,還是做影音的 Veo(現在的 Omni),雖然在美國都已是絕對的第一梯隊,但現在幾乎人人都在轉方向。當 Google 的 researcher 朋友說 「打不過國內」 時,這個背景也很重要。
過去那種拿一張榜單、一條 scaling curve,就給中美模型排出一個總名次的方式,早就失效了。
聽得多了,我越來越想弄清楚:到底哪些地方真的追上來了,哪些地方差距還很大,以及為什麼會出現這種分化。
先從 pre-train 說起。
過去一年,中國模型公司補得最快的一課,是怎麼 「爬 ladder」。
一個幾百億、幾千億參數的模型,很少直接從頭跑到尾。團隊會先在更小的模型上驗證數據、架構和訓練方法,再一級級往上 scale。梯子搭得夠不夠完整,決定了一個小實驗里的誤差,最後會不會在大模型上變成一次幾千萬美元的失敗。
幾位 frontier lab 做預訓練的朋友告訴我,今年國內頭部 Lab 的 scaling ladder 已經明顯完善,訓練方法越來越科學。
所以 pre-train 今天是一個有點反直覺的狀態:看起來,中國和美國的差距仍然很大,但其實在方法論上已經很接近了,剩下的主要是卡和相應的系統工程經驗。
最前沿的 pre-train 依然需要巨量算力,美國 Lab 跑過更多超大規模訓練,有更多卡、更成熟的集群,也更知道幾萬張 GPU 跑起來以後,可能會出現什麼問題,中國缺的還是這種 「把同一套方法穩定 scale 上去」 的經驗。
換句話說,pre-train 的路大家都已經知道該怎麼走,只是美國走得更遠、跑得更多。
Frontier Lab 的算力重心正在快速轉移,Pre-train 的占比持續下降,post-training/RL 快速上升。過去拼的是把模型 「訓出來」,接下來越來越多算力花在讓模型 「變得更好」 和真正跑起來
到了 post-train,就不能這麼給答案了,因為事情開始分化。
Post-train 不是一套統一的方法,需要的能力很多:怎麼定義問題,怎麼設計 environment、reward 和 eval,怎麼把訓練穩定地跑起來,都很重要。但如果看中美之間最容易拉開差距的地方,有三項尤其明顯:大規模 RL、human operation,以及蒸餾。
中國在這三件事上的位置,並不一樣。
最難補的,其實是第一種:大規模 RL。
今天前沿的 post-train,一次 RL 的 Big Run 可能要同時占用上萬張卡,一個任務要連續跑上千步,中間任何一個環節不穩定,整條 trajectory 都可能報廢。你還得知道什麼 environment 值得搭,什麼 reward 真正有效,rubric 怎麼定義,規模從一百步漲到一千步以後,原來的經驗還成不成立。
這些東西很難靠看論文學會,它更像一種只有真正跑過很多次大規模實驗,才會留下來的 「肌肉記憶」。
中國過去沒有那麼多卡,也沒有跑過足夠多這種規模的 RL,所以這一塊的差距,反而比 pre-train 的方法論差距更深。
但 post-train 還有另外一半。
一旦模型要優化的目標已經被定義清楚,接下來需要大量人把數據、標註、評測和反饋一層層鋪出來,這就是中國公司非常擅長的地方。
Seedance 是一個很好的例子。字節自己擁有最終的影音分發平台,它比單純的模型公司更容易知道:一個影音模型到底什麼叫 「好」?什麼樣的運鏡用戶喜歡,什麼樣的人物一致性不可接受,哪一種生成結果真的有人願意發出去……這些東西很難靠一個 benchmark 去提前定義,分發平台本身就在不停幫它定義 benchmark。
一旦目標清楚,後面的事情就開始變得很 「中國」:快速組織大量的人,把數據、標註、評測和訓練一輪一輪往上推。
這裡面當然有算法的因素,但越來越多的差距,藏在算法之外。
這也是為什麼,在多模態領域,特別容易把中國公司的優勢放大。它不像 Coding,很多時候沒有一個乾淨的 「對」 或 「錯」,大量判斷仍然要人來做,目標越模糊,human operation 的價值越高。
OpenAI 和 Google 的朋友,把這種差距概括成了 operation(營運)能力:在一些訓練目標沒有那麼標準化的領域,中國公司的優勢反而會被放大:一旦方向明確,就可以迅速組織大量人力,來搞定大量數據、標註、評測和後訓練的繁雜工作。
美國公司其實也在補這一課。
Meta 最近組建了一個大約 6500 人的內部團隊,叫 Applied AI,大量 Meta 員工被調去出題、造場景、做評測。有人甚至不是主動申請,而是直接收到調崗通知。
第三種是蒸餾。
蒸餾說到底是 post-train 里的一種手段。你可以自己搭 environment、跑 rollout、找 reward,把一種能力從頭訓出來;也可以藉助一個已經具備這種能力的模型,把它的輸出重新變成訓練數據。
所以蒸餾本身並不完全是一件 「不光彩」 的事。很多時候,它只是為了更高效地把一種已經獲得的能力,重新壓回下一代模型里。同一家公司的模型,也會自己蒸自己。
比如 DeepSeek 訓練 R1 時,就用 RL 後的模型生成並篩出了約 60 萬條推理數據,再配合約 20 萬條來自 V3 的非推理數據,回頭重新訓練了一遍 V3-Base。
也正因為模型的輸出可以重新變成訓練數據,推理過程本身開始凸顯價值。今年幾家 frontier lab 開始集體關掉完整的 CoT 輸出。
但門關得並不嚴。
5 月,一組研究者發現,即使完整 CoT 被隱藏,推理資訊仍然可能通過加密的 reasoning block 泄露出來,Anthropic、OpenAI、Google 三家全中招。
具體做法是,把強模型的加密推理塊塞給同一家的弱模型,弱模型就會把裡面的內容用明文寫出來。加密的大門沒有被攻破,但鑰匙竟然就壓在 「門口的腳墊」 下。
這篇論文《Stealing Reasoning Traces from Proprietary LLM APIs》到 8 月才正式公開。沒過多久就又有人找到新的方式,打開了 Fable 5.1 的推理過程,也有第三方公司專門做這個生意。
與此同時,我從幾家數據公司和模型團隊聽到,其實有美國的 Neo lab,也在蒸餾 K3。
原因很現實:開源模型可以直接部署在自己的集群里,成本低,也更方便大量生成數據。當 K3 這類模型在某些能力上已經足夠好時,它自然會進入這些團隊的 post-train 工具箱。
但是,到了 Coding,中國模型卻沒有呈現出多模態那樣的優勢。
Coding 同樣高度依賴 post-train,只是在前面提到的幾種能力里,它更依賴大規模 RL。
Coding 天生有很強的 verifiable reward:代碼能不能運行、測試能不能通過、任務最後有沒有完成,結果都很清楚。但結果好判斷,不等於 RL 好做。
一條 trajectory 如果到上千步,最後往往只拿到一個成功或者失敗的結果。真正困難的是 credit assignment 這個最終結果,到底應該歸功於前面哪幾個關鍵決策?哪一步看起來繞了遠路,卻恰好是最後成功的原因?
所以 Coding 拼的不只是 rollout 能不能做大、RL 能不能跑穩,也包括 reward 怎麼設計、怎麼把最後的成敗分回一條很長的 trajectory 里。這也是今天中國模型,在 post-train 里更難補的一塊。
Human operation 在這裡依然有用,只是邊際價值低了很多。真正需要人的數據,也更看重少數頂尖 coder 的質量,大規模標註的重要性低了很多。
一位 frontier lab 的朋友跟我提到,Anthropic 很多真正高質量的 Coding 數據,主要來自內部 100 多名很強的 coder,普通 Claude Code 用戶產生的數據,反而嘈雜得多。這類任務上,人力鋪得再多也沒用,它要的是精銳。
所以對於 post-train,很難簡單歸結成 「誰的 operation 強,就一定更強」。
如果一個領域目標模糊、質量依賴大量人的判斷,human operation 會被放大,多模態就是典型。
如果一個領域有非常明確的 ground truth,可以自動跑海量 rollout,大規模 RL infra 和少數高質量 expert data 就更重要,coding 更接近這一類。
在這三種能力背後,更值得注意的一個變化是,AI research 本身正在變寬。過去大家說 research,首先想到的是怎麼設計架構、怎麼訓模型。後來,搭 AI infra 也算 research 了,到了今天,operation 本身也進到 research 的範疇。
萬卡規模的 RL、千步的 Rollout、把人組織起來生產數據,這些完全不同的工作,都開始直接決定模型最後能到哪兒。
對一家公司來說,這意味著一個 research 組織,必須同時具備多種能力;對個人來說,一個 researcher 的邊界,也在從 「我能想出什麼」,擴張到 「我能組織和管理什麼」。
而中國公司過去最擅長、一度並不凸顯重要性的能力,恰好在這一輪里,開始變得越來越重要。
所以這次反覆聽到的 「打不過國內」,不是指一個總排名的變化,決定模型能力的東西正在換位置:有些差距還很大,有些過去並不顯眼的能力,卻突然變得越來越重要。
前段時間,在舊金山 AI 創業者圈子裡很火的 Corgi Cafe,是 AI 保險創業公司 Corgi,在辦公室樓下開的一家 24 小時咖啡館,專門留給那些深夜還在寫代碼、做產品的創業者和工程師。它很像這座城市創業文化的縮影:創業不只是一份工作,也是一種 lifestyle。
當然這只是一家咖啡店,但舊金山給人的感覺就是,創業者站在這座城市注意力最集中的地方,他們討論什麼、嘗試什麼,甚至在哪裡聚會,都可能成為下一波潮流的一部分,創新、社交和生活,在這裡經常融為一體
Neo lab 祛魅:每一代 Lab,都有每一代的命運
「Thinking Machines Lab 經歷的所有痛苦,其他 Neo lab 都會再經歷一遍。」
晚上 8 點多,一位曾經與 TML co-founder 共事過、以前不太好約的朋友,這次終於約上了。
過去兩年,Neo lab 是矽谷最昂貴的一種創業方式:最頂尖的 researcher,從 OpenAI、Google、Anthropic 跳出來,VC 跟着人下注。沒有產品、沒有收入都沒關係,只要團隊足夠豪華,先給幾億美元再說。
但無論 TML 還是 SSI、無論從內部看還是外部看,今天的結果都低於預期。一位長期看 frontier lab 的投資人朋友感嘆:「上一波在美國融到大錢的頂級 Neo lab 們,沒有一家做出來。」
Thinking Machines Lab 是其中最重的一注。
去年 7 月,公司成立才五個月,沒有產品,沒有收入,就融了 20 億美元,投後估值 120 億美元,這是史上最大的一筆種子輪。創始人 Mira Murati 出生的阿爾巴尼亞,也投了 1000 萬美元,為此專門修改了 2025 年的國家預算。
去年 11 月,TML 又開始按 500 億美元估值談新一輪,有人報到 600 億。兩個月後,CTO 和一批核心成員離職回到 OpenAI,那輪融資沒有落地。直到最近,TML 才又開始談 400 億美元估值的新融資。
TML 的估值雖然在漲,但新一輪數字,已經低於它去年底想要的價格,這在過去幾年高歌猛進的 AI 市場裡,非常罕見。
更讓我意外的是,連 TML 自己人都覺得,這家公司從一開始就有很強的 「拼起來」 的感覺。
那位曾經與 TML co-founder 共事過的朋友告訴我,幾位聯創當時想做的東西其實差得很遠:Mira Murati 更想做 enterprise,Lilian Weng 對 interaction model 更感興趣,John Schulman 更偏純 research。
官網首頁那份宣言,是幾位創始人各寫一段再拼起來的,最後選 human-AI collaboration 做公司願景,很大程度上因為這是大家少數能重合的地方。
這也解釋了 TML 後來很多問題。
能夠從 OpenAI、Anthropic 這種地方跳過來的人,往往都有很強的 research taste:相信什麼問題重要、什麼路線值得押、什麼方法可能 work,哪條路線應該堅持。
可一群都有強烈 taste 的人湊在一起,也反過來成為問題。因為這是一群在原組織里,無法說服別人、也無法被說服的人,出來自己干。
在成熟的大廠里,組織已經給定了北極星指標。你可以不同意一條技術路線,但最終總有人決定資源往哪放。比如 OpenAI、Anthropic 至少已有一套機制,讓不同的 research taste 最後收斂到組織的選擇上。
這次在 Palo Alto 吃飯,幾位 OpenAI 的朋友坐在我對面。飯還沒上齊,其中一個人已經開始復盤公司過去一年犯過的錯。
最讓他耿耿於懷的是 reasoning 這條路線。o1 明明是 OpenAI 先做出來的,最後卻讓 Anthropic 更早在 coding 上,把這條路線變成了好用的產品,對 OpenAI 來說 「這實在是非常糟糕的一件事。」
兩家公司在管理風格上也有不同。OpenAI 更 bottom-up,很多方向從 researcher 自己往上冒,研究空間大,也容易四處開花。Anthropic 更 top-down,上面決定往哪裡打,資源就集中往那裡打。
前一種容易散,後一種更依賴少數人的判斷。但方向一旦押中,Anthropic 會跑得很快。放到國內,Moonshot 更像前者,DeepSeek 更像後者。
而對於 TML,從第一天起就缺少足夠具體的共同目標。當所有人都很有 taste,每個人最堅持的東西,反而最容易把團隊帶向不同的方向。
在算力和資源充足的時候,不同方向還能同時存在;一旦開始排優先級,矛盾就出來了。TML 的團隊在半年裡迅速膨脹,老人和新人之間的信任還沒長出來,幾位聯創卻接連離開,中層也跟着洗牌。
算力也沒有外界想象得那麼寬裕。從外面看,它和 Google Cloud 簽了巨額算力合約,也拿到了英偉達最新的 GPU;但一線 researcher 的體感依然是實驗互相擠,「很多基本實驗都跑不了」,一些小實驗只能放到小得沒有參考價值的模型上去做。
最疼的一課是 Tinker。一位曾參與過 Tinker 訓練的朋友復盤說,Tinker 是 「目前最優雅的單場景框架」,但也承認團隊一度太享受把框架做漂亮這件事:「當你有 ego,覺得自己推出了一個漂亮框架而自滿的時候,就不會去把髒活做完。」
他說的 ego 很具體:一個很強的 researcher 會天然覺得,設計框架、想算法、解決難題才是自己的工作,prefix caching、成本優化、部署、穩定性這些 「髒活」,總覺得應該有人在後面補。
可產品最後的毛利,偏偏就死在這些地方。同樣的調用量,你沒有認真做 caching,成本就比別人高;框架再漂亮,客戶最後付的錢,還是一筆一筆算出來的。結果這塊生意,反而被把這些 「髒活」 做得更紮實的 Fireworks,搶走了不少。
把這些細節放在一起,TML 暴露出的就是 Neo lab 1.0 最根本的矛盾:一群靠 taste 出來的人,最缺的恰恰是一個不需要 taste 的目標。
這半年我反覆在想,為什麼這一批 Neo lab 起步這麼猛,現在卻慢了下來?
我後來把這個動作理解成 「跳車」。OpenAI、Anthropic 像兩輛高速行駛的大巴。一個 researcher 從車上跳出來的時候,會暫時繼承原來那輛車的速度:履歷、融資、人才、矽谷所有人的注意力,一下子全來了。
但那是原來那輛車的速度。落地以後,你還能不能自己繼續加速,才是最難的。
而這批人跳車的時候,往往還帶着一張 「舊地圖」。
Frontier lab 崛起時,行業缺的是一些非常基礎且稀缺的能力:怎麼搭模型,怎麼做大規模訓練,怎麼找數據,怎麼把幾千、幾萬張卡跑起來。
那時候,掌握這些 know-how 的人本身就是壁壘。OpenAI、Anthropic 也證明了這條極其誘人的路:聚集最好的 researcher,拿到足夠多算力,把 intelligence 不斷往上推,至少在 LLM 的 pre-train 階段,模型不必先定義最後要解決的具體任務,隨著 scale 往上走,一大片能力也會一起改善。
所以第一批 Neo lab 相信 「把最聰明的人重新聚一遍,再給足算力」 並不奇怪。他們複製的,就是 OpenAI、Anthropic 早期被驗證過的成功路徑。
只是模型繼續往前走後,OpenAI、Anthropic 自己面對的難題也變了。機器人、法律、醫療等場景,最後都要回答一個非常具體的問題:任務到底有沒有完成?公司也需要一個足夠清楚的北極星指標,告訴一群各自擁有 research taste 的人,下一步到底應該往哪裡走。
這也是今天 frontier lab 花越來越多精力解決的事情:怎麼搭 environment,benchmark 怎麼設,eval 怎麼做,reward 怎麼定義,模型最後究竟應該在哪個真實任務里變得更好。
每一代 Lab,都有每一代 Lab 的命運。
今天再想做 Neo lab,得在 frontier lab 現在最難的那些問題上,找到新的解法。
所以我越來越覺得,下一批真正跑出來的 Neo lab,可能會從完全不同的地方長出來。它很可能先有產品,再有 environment,最後才長出自己的模型。
Cursor 是一個很直觀的例子。它先進入真實的軟體開發流程,擁有大量真實用戶和任務,然後再不斷往模型層走。
Harvey、OpenEvidence 也有類似的條件。它們最有價值的地方,是每天都在一個具體的工作流里知道:什麼任務用戶真的要完成,什麼結果算成功,模型在哪一步會失敗。
這恰好也是今天 frontier lab 最難補的東西:北極星指標已經寫在產品里,Researcher 不需要從零討論公司究竟應該解決什麼問題。
但變化的並不只有 Neo lab。
這次一路聊下來,一個很明顯的感覺是,過去兩年 AI stack 里分得很清楚的幾類公司,都在往別人的位置上走。
Neo cloud 是最明顯的一類。過去它們最容易被理解成賣 GPU 的公司,現在卻越來越往模型和 inference 上走。
CoreWeave 收購 Weights & Biases 以後,已經把 pre-training、post-training、inference、agent evaluation 一路裝進自己的產品棧。今年 4 月推出的 managed inference 產品,ARR 3 個月裡就從 100 萬美元漲到 1 億美元。
Nebius 也在做類似的事。它的 Token Factory 已經開始直接提供模型推理,今年第二季 production inference workload 環比增長超過 3 倍。
原因並不複雜。GPU 本來就是一門很重的生意,只賣算力 margin 很難一直往上走;一旦手裡有卡、有客戶,也看得到客戶在跑什麼 workload,繼續往 inference、模型服務和 eval 走,幾乎是必然選擇。
另一邊,一些新型 Neo lab 又開始往數據公司走。模型還沒訓出來,或者根本買不起足夠多的數據,就先幫別人做數據、做 environment,把服務過程中積累下來的東西,留一份給自己,最後再反過來訓練自己的模型。
所以今天再看這些公司,原來的標籤已經越來越不夠用了。
Lab 在做數據,Neo cloud 在往模型和 inference 上走,有些 Neo lab 又想把算力和服務一起握在自己手裡。每一家都有變的理由,大家都在往別人的位置上走。
這大概就是這一輪 AI 發展,最有意思的地方。Neo lab 有自己的 2.0,Neo cloud 有自己的 2.0,數據公司也在找自己的 2.0。
再往後會不會還有 3.0,很難說,也許到那時候,今天這些名字本身都已經不重要了。
除了 TML,Google 也在經歷劇烈的人事動盪。我和一位在 Google 待了十三四年的朋友吃飯,他很難想象 Jeff Dean 的離開:「Jeff Dean is Google。」 在他眼裡,Jeff Dean 比 Eric Schmidt 更能代表這家公司的本質。他走,就是 「Google 的一部分走了」(攝於 8 月 8 日 AASF Event)
全矽谷都在搶數據:數商站到了戰爭中央
美國 Spirit 航空公司 5 月就停飛了,但它留下來的一樣東西,突然變得很值錢。
8 月,Google 在破產拍賣里出價 1000 萬美元,想買走這家公司幾十年積下來的內部數據:上億封郵件、幾億條 Teams 消息,還有代碼、財務、營運和項目管理記錄。Mercor 出到 750 萬美元,後來 Micro1 又把價格抬到了 1250 萬美元。
買破產公司這個打法,去年我只從 TML 那裡聽到過,圈裡都當是說着玩的。
但今年大家已經是成建制地干,姿勢都標準化了。一位 Mercor 的朋友告訴我,真正把一家破產公司買回來以後,第一件事是把數據 「救活」。
幾十年的郵件、表格、聊天記錄堆在那裡,外人根本不知道是什麼意思。哪張表對應哪個業務,某個縮寫是誰起的,一個航班取消以後營運、客服和財務究竟怎麼協作,這些關係不會自己從文件里長出來。
所以買完數據,往往還得把一兩個老員工留下來。他們的工作很像給一座廢墟做導遊:告訴你這些東西原來是怎麼運轉的:一個航班取消以後,誰先發現問題;營運、客服和財務怎麼溝通;一個決定經過哪些人;哪裡出了錯,最後又是怎麼解決的。
一家經營失敗的公司,第一次因為 「失敗得足夠真實」,重新變得值錢。
背後的原因也很簡單:容易拿到的網路文本,早已經被 AI 吃過了。整個網路能抓到的文本,大概是 100T 的量級,真正清洗完、能拿來做 pre-train 的,可能只剩 15T。再把那些藏在網頁背後、不容易直接抓到的資訊也扒到極致,最多也就是 300T,這些早都被用完了。
當網路越來越難提供新的數據,模型公司開始把目光轉向那些,還沒有被整理成訓練數據的真實世界。
此時更進一步,「數據」 這個詞也已經不夠用了。模型真正想要的,正在從一份已經整理好的 dataset,變成一個可以不斷產生新任務、新過程和新反饋的 environment。
過去的訓練環境更像一張靜態試卷,但 Agent 要面對的是一個會隨著行動變化、資訊不完整、很多動作無法撤回的世界。它得一邊做事,一邊判斷自己身處什麼環境。
Vending-Bench 2 很像這幾個變化的一個縮影。它是 Andon Labs 做的一個 benchmark,讓 AI agent 自己去經營一台自動售貨機:進什麼貨、怎麼定價、什麼時候補貨、庫存和現金怎麼管。它要跑完整整 365 天,每天還要扣兩美元場地費,最後按帳戶上剩多少錢來計算得分。
Agent 看不到完整的決策空間,只能憑每天拿到的那點資訊往下走。時間也只朝一個方向流動,昨天進錯的那批貨,今天發現了也退不回來。什麼都不做同樣會輸,場地費每天照扣。
更有意思的是,這個環境後來真的走出了模擬器。今年 4 月,Andon Labs 在舊金山簽下一份三年租約,把 10 萬美元和一張信用卡交給一個叫 Luna 的 agent,讓它從零開一家店,選品、定價都由它決定。
舊金山的 Andon Market。Vending-Bench 里的自動售貨機實驗,已經被搬進了真實世界:AI 開始真的面對租金、庫存、定價和每天不斷出現的新問題
這樣的 environment,考驗 AI 的已經不是聰明,它要的是在一個看不全、退不回去、不斷變化的世界裡,把一件不難的事,連續做對很長時間。
而一台自動售貨機,是這類生意里最簡單的一種。真正值錢的那些 environment,在活着的公司里。
這也是 「死」 公司和 「活」 公司最大的區別。已經破產的 Spirit 航空,數據再多,也只能告訴你過去發生過什麼。一家還在營業的公司,明天還會產生新的訂單、新的爭吵、新的誤判,以及最後是怎麼補救的。
所以模型公司更想進入那些還 「活着」 的公司。現在大致有四種辦法,越往下,成本越高,拿到的東西也越完整。
最輕的一層,是讓自己的 agent 直接進入工作流。比如在 Claude Code 里,用戶寫代碼、改 bug、不斷重試,過程自然就被記錄下來。
再往前,是直接進入公司的溝通場景。比如把 agent 放進 Slack,讓它看到任務是怎麼討論、推進和修改的。Claude Tag 乾脆不做自己的界面,它就住在客戶的 Slack 里,誰需要就 @ 它一聲。
如果產品進不去,就派人進去。FDE 住進客戶公司,一邊部署系統、解決問題,一邊更接近真實的工作過程。
但企業對此往往很敏感。一位客戶的技術負責人說得很直接:「我付你錢,是讓你幫我幹活,不是讓你記錄我的數據。」
於是出現了最重的一層:乾脆把公司買下來。
一位 Scale AI 的朋友跟我說,FDE 最多能撿到一些 trajectory;把公司買下來,拿到的卻是整個 environment。公司原來的業務、流程和數據都在,可以不斷產生新的軌跡,甚至直接跑 RL。
賣方也不全是破產的。Mercor 的朋友說,不少還在正常經營的公司也願意賣,因為對它們來說這是一筆 recurring revenue。數商有專門的人去尋找目標,一家家上門談,難點在於對方往往不知道自己手裡有什麼可賣。
於是,數據公司站在中間,越來越像一個行業 know-how 的交換機。Lab 知道自己缺數據,又不知道這些數據藏在哪裡;賣方手裡有東西,卻不知道模型公司究竟想要什麼。
幹這門生意的人,現在也開始分成兩派。
老一派還是按人頭計價。Scale、Mercor 這類公司,本質上賣的是一個人在單位時間裡能加工出多少數據,人越多,產能越大。
新一派開始按 environment 和 trajectory 計價。同樣兩小時的工作量,價格可能差很多,核心是這個環境本身有多稀缺、搭起來有多難。
但老一派也在往前走,最明顯的是 FDE:既然人本來就是最大的資產,乾脆把這些人派進客戶公司解決具體問題。除了更接近真實工作流,這門生意也比一次性的數據項目穩定得多。
所以兩派最後,是在往同一個地方靠:單純賣人力越來越不夠,誰能更接近真實的 environment,誰就更值錢。
不過不管哪一派,核心都是 「加工」。一位在 Scale AI 的朋友,把自己的工作形容成 「廚子」,買公司數據只是買原材料,麻煩的全在後廚。
其中一個核心動作叫 「退檔」:把一家公司已經完成的工作,重新拆回任務剛開始的那一刻。當時手裡有什麼材料,要解決什麼問題,最後產出了什麼,再把整個過程打包成一個 RL environment。
然後是最難的一步:怎麼知道模型做得好不好?數商得把行業里那些老師傅說不清、只能靠手感的判斷,翻譯成一條條 rubric,讓結果可以被機器自動驗證。
現在這間廚房甚至卷到了另一個程度:不能只告訴 lab「我這批數據很好」,還得直接跑實驗,告訴它這批數據能讓基模哪項能力漲、能漲多少。
不過要說數商已經反過來教 lab 做事,那還差得遠。最核心的方向判斷,仍然握在頭部 lab 的 researcher 手裡。
但活得最好的那批數商,已經不滿足於等着被動接單了。它們開始自己去賭哪個方向會重要,提前把對應的 benchmark 搭出來。一旦這個 benchmark 被 frontier lab 認了,變成大家刷榜的依據,它手裡那批數據就順理成章地進了主流。
獨家數據尤其值錢。一份數據如果賣給所有人,一年可能值 1 萬美元;只賣給一家,價格可以翻幾倍。一位在 frontier lab 負責訓練數據的朋友說:「如果我有錢,把所有 data vendor 都買了,這些 data 我甚至都不用。我買掉的,是別人趕超我的可能性。」
Coding 已經給過所有人一次教訓。最初真正重押它的人並不多,直到 coding 的 token 消耗開始暴漲,數據和資源才迅速跟過去。
現在行業里有了一個簡單粗暴的判斷標準:哪裡的 token 在快速增長,數據就往哪裡去。
當然,如今的數據越賣越貴,另一個問題也跟着出現:你買到的東西,到底是哪來的?
一位在大廠做數據採購的朋友,給我講過一件事。他們的合約明明規定,交付的數據不能由 GPT 等模型生成。但有次拿到一批外采數據,用檢測工具一掃,幾乎 100% 都像 GPT 寫的。
他去質問這個印度供應商。對方解釋得非常 「自然」:我們的英語不好,所以先用印度語寫,再用 ChatGPT 翻譯成英文,被你們檢測出來不是很正常嗎?「我也沒招,真的。」
於是這形成了一個 「你只要別讓我知道來源就行」 的局面,畢竟這些數據確實都是模型公司急需的,需求越來越強,來源卻越來越複雜,很多時候買方既沒有能力、也沒有動力一路追查到最底層。
這也給數據商留下了一個很微妙的位置。它們一頭替 lab 找數據、找人、做加工,另一頭也把那些買方不願意直接面對的來源、合規和交付風險,隔離在外面。
某種程度上,數商就是這場模型戰爭里的白手套。
「白手套」 值多少錢?同一條 call trace,來路有問題的報價 3 美元;通過美國供應商合法拿到,要 300 美元。
一百倍的差價,買的是風險轉嫁。
外面的數據這麼麻煩,大廠自然會想到另一條路:那就從自己員工身上找。
今年 Meta 一度記錄員工的鼠標行動、點擊和鍵盤輸入,並隨機截屏用於模型訓練。後來超過 1600 名員工聯名反對,計劃最終停擺。一位 researcher 告訴我,做過類似嘗試的不只 Meta 一家。
但這件事反過來也說明了,真正好的 human data 為什麼這麼難拿。如果想記錄的是一個人工作時發生的一切,這就是最貴、最敏感,也最難規模化的部分。
數據生意再往前走,還有一種更深的 「加工」。
前面那位 Scale AI 的朋友把自己形容成 「廚子」,一份原始數據也可以有不同的 「做法」:簡單一點,是把它清洗、整理成模型可以直接訓練的數據;再往前一步,則是乾脆用這些數據訓練出一個模型。
舊金山的創業公司 Noetik 就更接近後者。
它積累了幾億個帶有空間位置資訊的人體細胞數據,擁有腫瘤領域規模最大的空間生物學數據集。這類數據不只告訴模型一個細胞是什麼,還保留了它在真實組織中的位置,以及周圍有哪些細胞。
Noetik 沒有隻把這些數據作為數據集賣掉,而是拿它們訓練自己的模型。對它的藥企客戶來說,兩者的價值很不一樣:數據記錄的是過去已經發生的東西,模型卻可以拿來處理新的問題。 一個新的藥物、新的實驗條件,都可以用模型做新的虛擬實驗和預測。
今年 GSK(葛蘭素史克)和 Noetik 簽下五年合作,拿到的也是模型的使用權。
所以 Noetik 更像是數據加工鏈條走到更深的一層:賣數據,賣的是一份資產;把數據訓練成模型以後,賣的是利用這份資產繼續推演新問題的能力。 加工越深,越有機會賣出更高溢價。
但這種模式並不容易複製。Noetik 的數據足夠專業,客戶又是藥企,模型本身就可以直接成為產品。更多 human data 還停留在更重、更髒的加工環節里。
模型公司當然也可以自己做,只是背後需要成千上萬名 contractor 的招聘、管理、質檢,以及一整套勞動和合規風險。
Lab 越來越想掌握數據,但並不意味著它們想把整條數據供應鏈都自己做掉。
這也是為什麼,過去看起來最苦的數據生意,反而站到了模型戰爭越來越中央的位置。
矽谷也是一座 「圍城」
最後,如果說這趟矽谷出差,還有一個讓我印象很深的變化,就是那些從 AI 浪潮里得到最多的人,已經開始認真思考:接下來的人生應該怎麼過。
有天晚上,我和一位年輕的 AI researcher 吃飯。聊到這一輪矽谷的人才流動,他忽然說:
「你不覺得這裡就跟緬甸園區差不多嗎?一個大的園區,大家在這上班,聊的全是 agent、infra、startup,同質化特別嚴重。」
這個比喻聽起來很刺耳,但我一時也不知道怎麼反駁。
他自己就是這個 「園區」 里的一份子,他讀博時所在的實驗室,去年畢業了 5 個 PhD,只有一個人到現在沒換過工作。「在一個公司待滿一年,已經是很漫長的事。」
過去兩年,AI 浪潮給 researcher 定出了一個前所未有的高價:以前 50 萬美元年薪,已經是很體面的工作,但現在 100 萬以下的 offer,很多人已經不看了。
離開舊金山時,在機場碰到一場工人抗議,他們要求把時薪提高到 30 美元。20 年前我在美國上學時,打工時薪大概只有 6 美元。另一邊,AI 正在給灣區製造超級財富:今年舊金山都會區三成購房交易是現金全款;去年 10 月 OpenAI 一次員工股票出售,就套現了 66 億美元,其中 75 人每人套現 3000 多萬美元
可最早開始懷疑這個價格還能維持多久的,也是他們自己。
有人仍然像 「傳教士」 一樣相信 AGI,願意為一個技術判斷押很多年;也有人更像 「僱傭兵」,「沒有太多 conviction,能賺多久賺多久,不行再換一家」。到了這個價格,工作也變成了一筆很難拒絕的交易。
兩三年後,AI researcher 也許就不再是今天這樣的稀缺品。有人趕着在窗口關上之前做到 leader,有人開始投資,有人已經在想,賺夠這些錢以後還想做什麼。
所以在研究員的飯桌上,模型之外,買什麼股票、投什麼項目,和下一份工作能不能承載現在的薪酬包,是越來越常見的話題。灣區一些基金的出資人名單里,已經有很多 Anthropic 和 OpenAI 的研究員。
另一位已經財富自由、仍在做 AI 領域探索的朋友,給我數過他的朋友圈:有人想賣紅酒,有人想把國內的貨搬到美國賣,有人準備買新房子,還有人真的蓋了一座室內滑雪場,像在玩現實版的 Minecraft。
「我也想離開任何 digital 的東西一段時間。」 他說。
放在兩年前,這幅畫面幾乎不可想象。那時矽谷最相信的資產之一,就是 researcher 本人。
但這次一路聊下來,我越來越覺得,那些被重新定價的東西,最後也包括我們自己。
那些過去最有把握的能力,可能被模型學會、被工具封裝;原來只有少數人掌握的方法,也可能很快變成整個行業的基本功。
只是身處其中的人,每天只看到一點點變化,反而很容易把它當成正常。
一位年輕研究員跟我說過一句話,我一直記得:「沒有什麼問題,是只有我能回答,而 ChatGPT 不能的。剩下還需要人的,是人與人的溝通,以及在一個人年輕的時候,如何影響他、塑造他。」
他身邊不少人都計劃 「先賺幾年錢,再回學校」。有人拖一年,有人拖兩年,也有人已經拖到了第四年。我後來才明白,這些看起來很私人的選擇,也和這種變化有關。
當公司、技術、壁壘,甚至一個人最相信的能力,都可能在幾年裡被重新定價,最後總會剩下一個沒法交給模型回答的問題:
我們到底想把自己的時間花在哪裡?
來矽谷之前,我在法羅群島休了個假。
那裡離這一切很遠,海上終年是霧,山坡上只有羊、草和零星的房子。我出發前跟朋友說,終於可以有幾天不聊 AI 了。
但好幾次在當地打車,司機都不會說英語,只會說法羅語和丹麥語,我們兩邊比劃了半天還是講不明白,最後只得掏出手機,讓安排這趟行程的 ChatGPT 在中間翻譯。
AI 越來越像一個不會消失的背景。模型可以一次次 rollout,沿着不同的路徑試錯,再從頭來過。人不行,我們無法把幾種人生都活一遍,再回頭挑一個最好的答案。
時間無法回滾。每個選擇,都只有一次。
二十年前留學的時候,我經常爬上 Telegraph Hill,在這裡看舊金山的萬家燈火,那時總會有一種莫名的傷感,類似於 「北漂」 的感覺。也會忍不住想,每一扇亮着的窗戶背後,住着什麼人、他們過着怎樣的生活。
二十年後再站到這裡,城市天際線沒有任何變化,可未來五年因為 AI,這些燈光背後的生活,必然會發生很大改變,他們還會做着今天的工作嗎?又會做出怎樣的人生選擇?AI 帶來的變化,最終會落到每個具體的人身上。也許再過五年回頭看,我們才會真正意識到,今天正處在怎樣的巨變之中。
最後,也感謝你,在這個快節奏的時代,還能看完這篇長文。
來源:金色財經
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
- 讓加密貨幣幫你滾出年化30%現金流
- 掌握全球財經資訊點我下載APP
延伸閱讀
- 比特幣又被Fed嚇跌!8萬美元屢攻不破 連四日走低
- 比特幣多頭夢醒?非農強勁引爆Fed升息警報 才站回8萬美元又被打下來
- 橋水達里歐改口建議持有比特幣!分析:想靠它避險恐怕「錯了」
- 比特幣為何突然暴漲?能否突破8萬美元需觀察這「三項指標」
- 講座
- 公告
上一篇
下一篇