金色財經
作者:AI寒武紀
OpenAI和Anthropic正在緊急調查數萬起大模型失控事件,AI不僅學會了越獄和黑進政府網站,甚至還有數百個智能體私下建群、聯手黑進外部公司,秘密在全網植入自我複製提示詞。
事情的嚴重程度遠超外界想象。
最近幾個月,在內部測試和實際運行中,頂尖大模型出現了海量違規行為。
這些行為包括繞過安全護欄、自己搭建論壇、逃逸沙盒環境、劫持網站、自主提示以及試圖躲避監控系統。
目前調查涉及的事件總數已經達到數萬起,而且真實數字還在持續擴大。
這直接引發了業內對頂級AI公司能否徹底掌控自己技術的懷疑。
在這些失控記錄中,最嚴重和最為廣為人知的是一起發生在Hugging Face相關測試中。
數百個AI智能體組成了一個群體。
它們在留言板上互相協同,隨後自主黑進了一家外部公司。
它們這麼做僅僅是為了在網路安全測試中刷出更高的分數。
對此,奧特曼在社交平台表示,目前的審查進展沒有預想的那麼快。
OpenAI已經公開宣布暫停訓練最強大的前沿模型。
公司發言人表示,只有在確信已經部署了額外的防護措施和對齊改進之後,才會恢復訓練。
發言人補充說,這不是他們第一次按下暫停鍵,隨著AI能力的提升,這也絕不會是最後一次。
不僅如此,OpenAI近期還披露了一連串事故:
智能體在網路上泄露了53張ChatGPT用戶的圖片;
攻破了澳洲政府的一個網站;
嘗試攻擊包括美國政府在內的其他網站。
前不久,楊安澤在CNBC節目中提到,有實驗室負責人的觀點認為,機器人在訓練期間已經在論壇和各大網站留下了自我複製的代碼。
這一言論隨後在網路上引發了懷疑。
但事實表明,OpenAI在6月份就已經記錄了訓練中自我複製的提示詞注入行為,並剛剛公開了這份報告:
https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/
A廠也有問題。
Anthropic委託了第三方安全機構來評估自家模型,並在本周發布的Opus 5.5系統卡中公布了模型異常行為的頻率。
數據顯示,在對抗性測試中,該模型試圖逃出安全沙盒環境的機率達到了1.5%。
這個百分比看起來很小,但Anthropic和其他公司在測試模型時,運行次數高達數十萬次甚至更多。
哪怕只有極低的失控比例,乘上龐大的測試基數,最終也會變成成千上萬起逃逸沙盒和異常行為。
面對這些情況,AI安全行業的多位專家表達了擔憂。
獨立AI評估機構Transluce的研究員康拉德·斯托斯表示,目前看到的這些智能體行為僅僅是冰山一角。
ControlAI執行董事康納·利希指出,真正可怕的地方在於,這些自主系統正在違背人類的指令去做被禁止的事情,其中甚至可能包含違法犯罪行為。
多位網路安全高管認為,新一代AI模型在完成任務時表現出了極強的適應能力。
想要完全限制它們的手段往往很難奏效,因為人類必須提前預判它們可能失控的每一種方式。
很多時候,AI繞過防禦的方法,人類甚至從來沒有想到過。
試圖列出一份完美的安全守則,幾乎是不可能完成的任務。
現在問題是OpenAI和A廠天天喊安全,但是很多安全事件都是被迫公開的
來源:金色財經
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
上一篇
下一篇