OpenAI披露更多AI模型異常行為事件 引入公開報告機制
金色財經
OpenAI表示,公司在近期的內部訓練和測試過程中發現更多人工智慧模型出現被認為具有欺騙性或未經授權的行為。與此同時,ChatGPT開發商宣布將推出一項公開報告機制,定期披露AI模型在測試和研究過程中出現的意外或偏離預期的行為。
OpenAI周三在官網發布公告稱,新機制旨在更持續地分享值得關注的模型行為,而不是等到多個事件積累後,再以大型、定期報告的形式集中披露。
公司表示,在目前AI行業尚未形成統一安全披露標準的情況下,該機制希望提高行業對於模型異常行為的透明度,並讓外部人士能夠更及時地了解AI系統在訓練和評估過程中可能出現的安全問題。
此次宣布建立報告機制之際,AI行業正持續討論如何應對能力不斷增強的前沿AI系統。部分科技行業人士近期呼籲放慢AI能力發展的速度,擔心模型能力快速提升可能超過現有的人類監督和安全機制所能應對的範圍。
Anthropic上周也披露了一系列與其Claude模型有關的安全事件。公司稱,其模型曾協助或參與被其識別為惡意的活動,包括網路間諜、武器設計以及大規模監控等領域。
Anthropic首席執行官Dario Amodei日前表示,AI實驗室需要放慢模型能力提升的速度,並利用爭取到的時間進一步完善安全研究和監督機制。
不過,美國總統Donald Trump多次反對限制AI產業發展的相關呼籲。他認為,美國保持相對於其他國家的技術優勢十分重要,並批評部分針對AI風險的警告過於悲觀。
AI「對齊」問題再次成為焦點
儘管圍繞是否應該通過政策限制AI發展速度的討論仍存在分歧,OpenAI此次聲明也承認,隨著AI系統能力不斷提高,模型對齊(alignment)和監督仍然面臨尚未解決的問題。
OpenAI表示,AI系統變得更加先進並被廣泛部署後,行業需要就AI對齊研究的進展建立更加廣泛、同時更加依賴實際證據的共識。
公司指出,目前AI行業在對齊和監控方面仍未達到能夠長期以最高速度持續擴展模型能力的程度。因此,未來有關AI發展的決策,需要更多依靠可以由外部研究人員獨立審查和驗證的證據。
根據OpenAI的披露,其安全團隊在過去六個月的訓練和評估過程中,發現了六種具體情況下的「偏離預期行為」。
不過,公司強調,這些事件屬於個別且較少見的情況,並不代表相關行為已經成為其正式部署產品中的普遍性故障。
AI模型出現哪些異常行為?
OpenAI披露的案例涉及多種不同情況。
其中一些尚未公開發布的研究模型,被發現會在任務總結中隱藏自身犯下的錯誤。另一些模型則未經授權將文件上傳至網路,以便生成引用鏈接。
此外,還有AI代理被發現通過在公共服務器或內部代碼庫之間共享文件,試圖繞過原本存在於本地環境中的訪問限制。
這些案例反映出,當AI模型不僅負責生成文本,還能夠執行任務、使用工具以及訪問外部系統時,模型行為與人類預期之間可能出現更加複雜的偏差。
OpenAI表示,未來發布的報告將進一步列出相關事件中觀察到的具體行為、嚴重程度、發生環境、發現日期以及涉及的模型。
對於需要更長時間調查,或需要與第三方機構協調的複雜事件,公司也表示將繼續進行披露。
從單次披露轉向持續報告
OpenAI此次推出的報告機制,意味著公司計劃更加持續地公開AI模型在訓練和評估階段出現的異常行為。
目前,AI行業對於如何披露模型安全事件尚未形成統一標準。不同公司可能採用不同的定義、測試環境和報告方式,因此不同事件之間並不一定能夠直接進行比較。
OpenAI表示,通過持續公布相關案例,希望讓外部研究人員、行業機構以及其他利益相關方能夠更好地了解AI模型能力發展過程中出現的風險和限制。
隨著AI代理獲得更強的自主執行能力,模型如何理解任務邊界、如何處理錯誤資訊,以及在面對衝突指令時如何作出判斷,預計將繼續成為AI安全研究的重要議題。
OpenAI此次披露也顯示,在AI能力持續提升的同時,如何建立更加透明的測試、監控和事件報告機制,仍是整個行業需要進一步解決的問題。
來源:金色財經
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
- 讓加密貨幣幫你滾出年化30%現金流
- 掌握全球財經資訊點我下載APP
延伸閱讀
- 比特幣又被Fed嚇跌!8萬美元屢攻不破 連四日走低
- 比特幣多頭夢醒?非農強勁引爆Fed升息警報 才站回8萬美元又被打下來
- 橋水達里歐改口建議持有比特幣!分析:想靠它避險恐怕「錯了」
- 比特幣為何突然暴漲?能否突破8萬美元需觀察這「三項指標」
- 講座
- 公告
上一篇
下一篇