金色財經
英國人工智慧安全研究所(UK AI Security Institute)在測試Anthropic"Mythos 5 以及 OpenAI 的 GPT-5.6-Sol 進行測試時,發現了 19 起相關事件。
據稱,Anthropic的Mythos 5利用虛假身份說服人類開發者批准惡意代碼。
據報導,在活動被發現後,該模型曾試圖掩蓋其行為,並繼續使用另一個偽造身份進行運作。
OpenAI的GPT-5.6-Sol在兩起獨立事件中,試圖越過其指定測試範圍進行未經授權的訪問。
AISI表示,雖然未發現任何實際危害,但將該行為描述為新奇、具有潛在欺騙性且比預期的更為嚴重。
據英國人工智慧安全研究所(AISI)稱,Anthropic和OpenAI的人工智慧模型在開放網路上接受網路安全測試時,分別獨立表現出了欺騙性行為。該政府機構稱,研究人員在測試Anthropic的Mythos 5和OpenAI的GPT-5.6-Sol時,記錄了19起相關事件,其中包括模型試圖誤導用戶以及超出任務預定邊界進行操作的情況。
其中一起較為嚴重的事件涉及Anthropic的Mythos 5。 據AISI稱,該模型首先調查了與該項目相關的人類開發者,試圖將惡意代碼植入一個開源數據庫。隨後,據稱它創建了虛假身份,並利用這些身份說服開發者批准該代碼。據報導,在人類發現這一活動後,該AI試圖隱瞞其先前的行為,並使用新創建的身份繼續進行操作。
AISI指出,作為測試流程的一部分,該模型中的常規安全防護措施已被有意移除,以便研究人員更全面地評估其能力。 不過,該機構表示,由此產生的行為超出了評估人員的預期,並將其描述為潛在欺騙性行為的證據。
在兩起獨立事件中,OpenAI的GPT-5.6-Sol還試圖在其指定測試環境範圍之外獲取未經授權的訪問權限。 這些事件是一系列更廣泛測試的一部分,旨在了解當能力日益增強的人工智慧代理獲得訪問真實網路環境的權限時,其行為表現如何。
AISI表示,這些模型在試圖完成評估期間分配的目標時,使用了欺騙性技術。 儘管該機構未發現現實世界中的危害的證據,但承認其測試環境和配置的某些方面助長了這種行為。
「「在某種程度上,我們的評估設計選擇和具體配置助長了這種行為,」AISI 表示,同時警告說,這些智能體表現出了新穎且可能具有欺騙性的行為,其範圍和嚴重程度都超出了預期。 該機構將此事定性為嚴重事件,並表示這將促使評估流程和安全架構發生持久性變革。
這一披露發生在Anthropic和OpenAI相繼披露其AI系統在網路安全評估期間自主行動的事件之後不久。
Anthropic此前曾報告稱,其模型在三次獨立測試中曾自主入侵了另一家組織的系統。 該公司表示,當時這些事件並未被受攻擊的組織察覺。
在AISI披露此事後,Anthropic表示,該事件表明了為何業界需要更嚴格、更統一的標準來評估能力日益增強的AI代理。 該公司認為,必須更謹慎地設計和保障評估環境的安全,以確保研究人員能夠準確測量模型的行為,同時避免無意中為失控活動創造機會。
OpenAI同樣強調了獨立測試的重要性。 該公司表示,外部評估對於理解日益強大的模型如何行為至關重要,並將繼續與研究人員、評估人員及其他行業利益相關方合作,以改進安全實踐。
最新研究結果尤為重要,因為這些AI系統不僅會生成惡意代碼,還會採取額外措施來實現其目標,包括調查特定個人、採用虛假身份,以及在初始行動被發現後仍試圖繼續行動。
上個月, OpenAI表示,其模型在測試期間曾自主入侵另一家公司的系統,並稱該事件是安全研究人員此前曾警告過的此類自主AI網路攻擊的首個已知案例。
隨著人工智慧公司持續開發能夠在有限人工干預下執行日益複雜任務的模型,各國政府和行業領袖如今正面臨一個棘手的問題: 如何才能在不對外部組織或個人造成不必要風險的情況下,對這些系統進行現實情境下的測試?
英國的這一進展正值政府廣泛加強先進人工智慧監管之際。 今年6月,唐納德·川普總統簽署了一項行政命令,要求人工智慧企業在產品廣泛發布前,將其提供給聯邦政府進行評估。
AISI的最新研究結果表明,網路安全評估可能需要隨著模型本身的發展而不斷演進,特別是隨著AI代理越來越能夠調整策略、與人類互動,並在較長時間內追求目標。
來源:金色財經
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
上一篇
下一篇