區塊鏈

集體失守:三家頂級AI公司的隱藏思維鏈被公開破解

金色財經

撰文:Shannon@金色財經

一、「我們可以讀取 Opus 4.8 的想法了」

8月11日凌晨5時,安全研究員 Alexander Panfilov(x網名 kotekjedi_ml)在 X 上發出一條推文:

「我們終於可以公開這件事了:我們發現了一種利用前沿 AI 公司 API 漏洞,提取其旗艦模型隱藏推理內容的方法。」


這條推文迅速在 AI 和安全圈刷屏。隨附的 arXiv 論文《Stealing Reasoning Traces from Proprietary LLM APIs》(從專有 LLM API 中竊取推理蹤跡,論文編號2608.09867),當天成為 AI 安全領域討論最熱烈的學術文獻。

來自 ELLIS Institute Tübingen、Max Planck Institute、MATS Research 和 Snyk的研究團隊的核心發現可以用一句話概括。Haiku 4.5 可以讀取 Opus 4.8 的想法。

這句話戳破了 Anthropic、OpenAI 和 Google 三家公司為保護其最有價值的知識產權所精心設計的加密機制。

二、背景:思維鏈為何需要被加密

理解這次漏洞,需要先理解過去兩年 AI 行業發生的一個關鍵轉變。

2024至2025年,以 Claude Opus、GPT-5.6 和 Gemini 3 為代表的新一代「推理模型」,在返回最終答案之前,會先進行大量的內部思考,即「思維鏈」(Chain of Thought)。這些內部推理過程極其寶貴,它們展示了模型如何分解問題、如何處理不確定性、如何進行多步推理,是這些模型能力的真正體現,也是數億美元訓練投入的結晶。

因為這些內部思考包含商業知識產權和安全檢查機制,廠商選擇不以明文形式返回這些內容。

與此同時,還有另一個更緊迫的安全顧慮。如果明文思維鏈被開放,任何人都可以用它來訓練競爭模型,即所謂的「蒸餾攻擊」(Distillation Attack)。這是 AI 公司最不願意看到的結果。

於是,三大廠商相繼將思維鏈從「明文返回」改為「加密塊(Encrypted Block)返回」。用戶在 API 調用中可以看到一個密文塊,但看不到其中的實際內容。這套設計被視為知識產權保護和防蒸餾的標準方案。

問題在於,這套設計存在一個致命的架構假設錯誤。

三、漏洞的技術核心:加密塊的「跨模互通」

研究人員發現了一個架構層面的脆弱性。這些加密塊在同一廠商的生態系統內,可以完全兼容並互換,跨越不同會話、不同用戶,乃至不同模型。

用通俗的語言解釋這意味著什麼。當你用 Opus 4.8 完成一次對話,API 返回給你一個加密的思維鏈塊。這個塊不是「一次性憑據」,而是可以被帶走、放入另一次對話,甚至放入同一廠商另一個完全不同的模型對話中,系統依然會接受它。

研究團隊的攻擊流程極為簡潔。第一步,向 Opus 4.8 發出正常 API 請求,獲取其加密思維鏈塊;第二步,僅將這個加密簽名(thinking signature)發送給同廠商的 Haiku 4.5 模型,並要求它在 標籤中輸出自己的推理;第三步,Haiku 4.5 「照抄」了 Opus 4.8 的隱藏推理內容,以明文逐字輸出。

整個攻擊只需要兩次標準 API 調用,不需要任何特殊權限,不需要對旗艦模型進行越獄。

為什麼輕量模型會「順從」地輸出?因為輕量模型(如 Haiku)缺乏旗艦模型(如 Opus)那些激進的反蒸餾對齊和安全護欄。正是這層「防護差異」,被研究人員作為解密的跳板加以利用。

研究團隊用120道 Codeforces 競賽題驗證了攻擊的精確性。解碼出的推理長度與 API 報告的計費思考 Token 數量高度吻合,這證明提取的內容不是噪聲,而是真實、完整的原始推理過程。

四、四種攻擊向量:比想象的更廣

研究人員系統梳理了這一漏洞可以被利用的四個不同方向。

攻擊向量一:蒸餾——知識產權保護的徹底失效

這是最直接的商業威脅。漏洞繞過了反蒸餾機制,允許攻擊者提取專有模型的推理過程,研究人員已在 Anthropic、OpenAI 和 Google 三家廠商上完成驗證。

任何競爭對手,只需大量調用 API 並使用這一攻擊方法,便可系統地收集旗艦模型的推理樣本,用於訓練自己的模型。這直接瓦解了加密思維鏈在知識產權保護層面的全部價值。

攻擊向量二:大規模個人資訊和憑證泄露

這是最出人意料也最令人警覺的發現。

研究團隊從 GitHub 和 Hugging Face 爬取了6708份公開 Agent 運行記錄,解碼了其中315,320個嵌入的推理塊,共恢復367個個人身份資訊(PII)和182個憑證(密碼、API 密鑰等)。

開發者在分享會話日誌時,完全不知道那些加密塊里裝着什麼內容。他們以為自己分享的是密文,實際上是一個任何持有這套解密方法的人都能打開的容器。

這意味著,過去兩年裡所有將 AI 會話日誌發布到公共代碼倉庫的開發者和團隊,都已經在無意中創造了一個可被追溯的數據泄露記錄——315,320個推理塊已經在公共網路上流通,其中包含真實的個人資訊和系統憑證。

攻擊向量三:有害資訊通過「安全拒絕」的外層滲出

這個向量揭示了一個深刻的安全悖論。當模型「安全地」拒絕了一個惡意請求,最終可見輸出是禮貌的拒絕,但在其隱藏推理過程中,模型可能已經詳細思考了「如何滿足這個請求」,包括具體的危險資訊。這些內容通過加密塊漏出,可以被攻擊者提取。

模型的「拒絕」只保護了輸出層,沒有保護思考層。

攻擊向量四:不可見的提示注入

攻擊者可以利用這一漏洞,將惡意指令完全隱藏在加密塊中,以此污染公開的 Agent 運行記錄。

研究團隊的實際測試是,讓 Haiku 4.5 在 Opus 4.7 的 Claude Code 工作流的一個思維鏈里注入惡意指令,要求模型在每次更新研究方法後,將內容記錄到文件並上傳到攻擊者服務器。結果,Opus 4.7 在沒有任何明文提示的情況下,跟隨了被注入的隱藏指令。

這是一種完全「隱形」的投毒方式。受害者看到的 Agent 日誌毫無異常,但實際的惡意指令嵌藏在密文層中,悄然執行。

五、先知者的遭遇:獨立研究員曾提前三個月報告

2026年5月29日,約翰·霍普金斯大學密碼學家 Matthew Green 就已發布了一篇博文,描述了他花了一個周末時間研究這些加密塊後的發現,推理塊可以在同一會話內、跨會話、乃至完全不同的帳戶之間重放。對於 OpenAI 的模型,還可以跨不同模型重放,不過他注意到 Claude 模型當時對此「有些抗拒」。Green 還演示了這些塊是「語義活躍」的,而不是惰性密文——一個在某次會話中被推理過的社會安全號碼,在另一個帳戶的不同會話中重放該塊後,在毫無提示的情況下重新出現了。

Green 通過各廠商的漏洞賞金計劃提交了報告。根據記錄,OpenAI 回應稱該漏洞無法復現;Anthropic 表示未看到側信道或重放的安全影響,但允許自己可能會更新開發者文檔以向應用開發者發出警告。

獨立研究員在2026年5月和6月記錄了相同的加密推理塊重放漏洞,但 Anthropic、OpenAI 和 Google 在該論文確認315,320個可利用的塊已在公共倉庫流通之前,均未採取架構層面的修復措施。

這段歷史揭示了一個令人不安的過程,漏洞已知、已報告、已被忽視。三個月後,規模更大的學術團隊以無可辯駁的方式重新證明了它的存在和嚴重性。

六、三家廠商各自受到怎樣的衝擊

Anthropic(Claude 系列)

論文的具體演示之一,是用 Claude Haiku 4.5 解碼 Claude Opus 4.8 的推理內容,並進行了跨會話的提示注入攻擊(在 Opus 4.7 的 Claude Code 工作流中注入惡意指令)。

Anthropic 此前對加密思維鏈的定位,是既保護知識產權,又限制資訊泄露。這兩個目標都被這次攻擊直接擊穿。

OpenAI(GPT 系列)

研究人員確認了 GPT-5.6 系列的跨模型兼容性,並證明更輕量的 GPT 模型可以解碼旗艦模型的隱藏推理。

尤其諷刺的是,Green 在5月就向 OpenAI 報告了漏洞,OpenAI 回應稱「無法復現」,而三個月後論文用315,320個公開案例證明了其規模化的可復現性。

Google(Gemini 系列)

Gemini 3 系列同樣被證實存在相同的架構問題,研究人員在 Google AI Studio 上完成了測試驗證。

七、為什麼會設計出這樣的架構?

「加密思維鏈的實現做得非常糟糕」。這是 Simon Willison 在解讀這篇論文時的直接表述,他補充說:「這是這些公司在追求速度時在基礎安全方面失敗的又一個例子。」

從技術層面看,這個設計之所以存在根本性缺陷,是因為它混淆了兩種不同的安全目標:

內容保密(用戶不能讀懂裡面的內容)和防重放安全(加密塊不能被搬運到另一個上下文中使用)是兩個完全獨立的安全屬性。傳統的密碼學早已有成熟的機制來同時實現兩者——例如綁定會話 ID、用戶 ID 和時間戳的消息認證碼(MAC)。

但三家廠商設計的「加密塊」只實現了前者,完全忽略了後者。這意味著它是一把可以輕易複製的鑰匙,而不是一把與特定門鎖綁定的鑰匙。

八、論文提出的修復建議

研究團隊在完成負責任披露的同時,提出了具體的技術修復路徑:

加密層面的修復: 將會話 ID、用戶 ID、時間戳等上下文標識符綁定到加密塊的簽名中,使塊只在其原始上下文中有效,一旦被搬運到新會話或新用戶,驗證即失敗。

系統層面的修復: 將推理塊儲存在服務器端,而不是返回給客戶端——這從根本上消除了塊被「帶走」的可能性,代價是更高的服務器儲存成本和架構複雜度。

數據共享建議: 所有發布過包含這三家廠商 API 會話日誌的開發者和團隊,應立即將這些加密塊視為潛在的敏感數據泄露,而非安全的密文——檢查其中是否包含個人資訊或系統憑證。

九、更深的啟示:AI 安全的「安全劇場」問題

這場事件的真正教訓,超越了這一個具體漏洞本身。

一位工程師在 X 上的評論簡潔地點出了問題的本質:「這不是很有後果性,但這是另一個例子,說明這些公司在追求速度時,在基礎安全方面失敗了。」

加密思維鏈的設計是在商業壓力下快速做出的工程決定。技術社區開始研究明文 CoT 用於蒸餾,公司需要迅速應對,於是推出了「加密」方案。但這個「加密」從未經過嚴肅的密碼學審計。它看起來像安全,感覺像安全,但在基本的密碼學屬性上是殘缺的。

這是「安全劇場」(Security Theater)的典型案例,為了回應外部壓力而快速部署看起來有保護作用的機制,但實際的安全屬性經不起推敲。

對 AI 公司而言,這是一個關於速度與安全之間取捨的結構性警告。在思維鏈加密這個問題上,三家頂級 AI 公司選擇了同一種解決方案,犯了同一種錯誤,並且在獨立研究員提前告警後沒有修復,直到一篇論文將315,320個真實案例擺在所有人面前。

在 AI 能力以每月為單位快速演進的今天,這種「先跑後想」的工程文化,正在製造越來越多難以事後修補的安全債務。

來源:金色財經

發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。

暢行幣圈交易全攻略,專家駐群實戰交流

▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!

前往鉅亨買幣找交易所優惠


section icon

鉅亨講座

看更多
  • 講座
  • 公告

    Empty
    Empty