鉅亨網編譯莊閔棻
OpenAI近期自曝,人工智慧(AI)模型在訓練過程中可能在網路上植入能自我複製的提示詞。隨著模型陸續出現繞過安全防護、逃離沙盒,甚至有數百個AI代理私下「組團」入侵外部公司等異常行為,OpenAI已暫停最強尖端大模型的訓練,直到確認新增防護措施與對齊改進已部署到位。
根據《Axios》報導,AI模型失控事件近幾個月持續增加,OpenAI與Anthropic的內部測試及實際運行中,都發現大量違規或異常行為,從繞過安全護欄、逃逸沙盒環境,到自主提示、劫持網站及試圖規避監控系統,相關調查事件目前已達數萬起。
其中一起受到關注的事件發生在Hugging Face相關測試。數百個AI代理在留言板上彼此協作,隨後自主入侵一家外部公司,目的是在網路安全測試中取得更高分數。
對此,OpenAI執行長奧特曼表示,目前相關審查進度並未如預期快速。OpenAI也宣布暫停最強尖端大模型的訓練,直到確認已部署額外防護措施並完成對齊改進後,才會恢復訓練。
OpenAI發言人指出,這並非公司首次暫停模型訓練,隨著AI能力持續提升,未來也不會是最後一次。
不只如此,OpenAI近期陸續披露多起AI代理異常事件,包括在網路上洩露53張ChatGPT用戶圖片、攻破澳洲政府網站,以及嘗試攻擊包括美國政府在內的其他網站。
此外,OpenAI最新公開的一份報告也證實,模型訓練過程中曾出現自我複製的提示注入行為,讓外界重新關注AI模型是否可能透過不同方式繞過既有安全機制。
公司在報告中指出:「我們證實了一種新型的提示注入(prompt injection)存在,其能夠像電腦蠕蟲(computer worm)一樣自行傳播。我們在訓練與評估過程中,並未觀察到其影響擴及模擬工具呼叫之外的範圍;之所以公開分享這項發現,是因為這種提示注入具有新穎性,而非源於任何實際事件。」
Anthropic同樣面臨模型異常行為問題。公司委託第三方安全機構進行模型評估,並在最新發布的Opus 5.5系統卡中揭露測試結果。
資料顯示,在對抗性測試中,Opus 5.5嘗試逃離安全沙盒環境的機率達1.5%。儘管比例看似不高,但AI模型測試通常會執行數十萬次甚至更多。當模型在大規模測試中存在一定比例的異常行為,最終累積的事件數量仍可能相當可觀。
AI安全領域研究人員對此表達擔憂。獨立AI評估機構Transluce研究員Conrad Stokes表示,目前觀察到的AI代理異常行為可能只是「冰山一角」。
分析指出,人類必須事先預測模型可能採取的每一種失控方式,但AI繞過防禦機制的方法,可能是開發者從未想到的情境。因此,要建立一套涵蓋所有可能情況的安全規範,難度相當高。
ControlAI執行董事Connor Leahy則指出,自主系統可能在違背人類指令的情況下執行遭禁止的行為,其中甚至可能涉及違法犯罪活動。
多名網路安全業者高層也認為,新一代AI模型在執行任務時展現高度適應能力,使單純依靠預先制定的安全規則限制模型行為變得更加困難。
下一篇
