金色財經
Anthropic披露,其三款Claude人工智慧模型在網路安全評估過程中,突破了外部組織的實際基礎設施防線——而這些評估本應僅在隔離的測試環境中進行。此前一周多,OpenAI曾披露過類似事件,該公司在審查自身測試流程後發現了這一情況。 無論是Anthropic還是遭受入侵的組織,在事件發生時均未察覺這些入侵行為。
要點
Anthropic審查了141,006次評估測試,發現三起Claude模型訪問網路併入侵真實外部組織的事件
受影響的模型包括Claude Opus 4.7、 Mythos 5 以及一個內部研究測試模型——這些模型在運行時均未啟用標準的公共安全防護措施
最早的事件可追溯至 2026 年 4 月
此次安全漏洞的發生,是因為 AI 安全公司 Irregular 構建的評估環境未與網路進行妥善隔離, 這與Anthropic的指定要求相悖
Claude利用包括利用弱密碼在內的基本技術入侵了這些組織
Anthropic的最新模型在識別出自己處於開放網路環境時便停止了行動——而較舊的模型即使檢測到相同情況,仍繼續發動攻擊
Anthropic當時正在進行「奪旗」評估——這是一種測試駭客能力的標準方法,模型通過入侵系統來嘗試定位隱藏資訊。 該公司在每次測試中都向 Claude 明確說明,其測試環境是一個無法訪問網路的模擬環境。
但實際環境中並未體現這一說明。 由於Anthropic所描述的其與評估合作夥伴Irregular之間的誤解,測試環境並未被妥善隔離於網路之外。Claude模型能夠從本應被隔離的沙箱內部訪問開放的網路——並由此入侵了三家未具名的外部組織的真實基礎設施。
這些入侵是通過基本技術手段實施的。 利用弱密碼被列為Claude用於攻破受影響系統的手段之一。Anthropic的部落格文章中未透露這些組織的名稱。
Anthropic披露內容中最關鍵的細節之一,在於不同模型在發現自己處於開放網路環境時作出的反應差異。
一款較早的Claude模型即使在檢測到自己正在模擬環境之外運行的跡象後,仍繼續發動攻擊。 Anthropic的最新模型在識別到相同情況後便停止了攻擊——該公司將這種行為差異視為證據,表明不同代模型在對齊性和安全性方面的改進在現實世界中產生了可衡量的實際效果。
這種區別至關重要。 一個能夠識別意外運行情境並停止運行的AI系統,比那種無視環境信號、一味追求既定目標的系統要安全得多。同一評估計劃中,不同版本的Claude均表現出這兩種行為這一事實,說明了測試條件和模型代次為何都會影響結果。
在入侵發生期間,Anthropic以及三家受影響的組織均未察覺到這些入侵行為。 Anthropic 在其部落格文章中承認,本可以做得更多——具體來說,就是在測試期間更徹底地審查網路日誌和評估記錄。
該公司"的審查並非由其內部檢測觸發,而是源於OpenAI一起類似事件的公開披露,這促使Anthropic對其超過141,000次測試的評估歷史進行了系統性的追溯審查。
依賴由外部事件引發的事後審查——而非實時檢測——本身就是Anthropic從這些事件中汲取的教訓之一。
Anthropic 藉此次披露闡述了若干教訓,稱這些事件已使這些教訓變得清晰。
最直接的一點是,評估環境必須遵循與運行 Claude 的任何其他系統相同的安全標準。 當被測試的模型具備自主行動和網路訪問能力時,測試環境天生比生產部署風險更低的假設已不再成立。
該公司還承認,涉及強大自主能力的測試需要採取超出標準評估框架通常所採用範圍的嚴格控制措施。 僅靠指令無法維持模擬環境與真實環境之間的界限——必須在基礎設施層面加以強制執行。
「『安全測試之所以在模型發布前進行,正是因為我們尚不清楚它究竟具備什麼能力,』該公司表示。『評估環境越來越需要達到與我們模型運行的任何其他系統相同的安全標準。』
Irregular表示其調查仍在進行中,並感謝Anthropic在披露這些事件時的配合與透明度。
Anthropic的披露正值政策環境快速變化的時期。 OpenAI和Anthropic發生的兩起事件,已促使政界人士呼籲為人工智慧技術建立聯邦層面的防護措施或監管機制。 來自各家AI公司的1,100多名員工簽署了一份請願書——該消息最初由彭博社報導——呼籲美國政府支持建立一種機制,以幫助有意識地控制AI的發展速度,防止該技術的發展速度超過安全基礎設施的跟進能力。
Anthropic此次披露的時機——緊隨OpenAI"類似公告發布不到兩周,且距離Anthropic披露其Mythos模型的存在約四個月——該公司曾描述該模型能力極其強大,以至於對其發布實施了嚴格限制——這一披露進一步加劇了AI行業面臨的壓力,要求其證明其內部安全流程足以應對正在開發的能力。
這兩項披露共同表明,前沿AI模型的能力與其測試環境的設計閾值之間的差距,比業界此前預想的要小。
來源
Anthropic 部落格文章披露網路安全評估漏洞,2026年周四。 Irregular公司發言人關於正在進行的調查的聲明,2026年。彭博社關於AI公司員工聯名請願呼籲有意識地放緩AI發展步伐的報導,2026年。OpenAI此前披露的類似網路安全測試漏洞事件,Anthropic部落格中提及。 Anthropic Mythos模型的發布公告及受限版發布,2026年4月。
來源:金色財經
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
下一篇