快訊

OpenAI發布AI失控追蹤框架,披露模型曾試圖「自我繞過限制」

BlockBeats 律動財經

動察 Beating AI 快訊,OpenAI 週三發布一套新的 AI 模型「失配」(misalignment)事件追蹤與調查框架,用於記錄、調查並公開披露模型在訓練或評估過程中出現的異常行為,同時公布過去 6 個月發現的 6 起相關事件。


OpenAI 表示,目前 AI 行業在對齊和監控方面仍未達到足以長期維持最大速度擴張的水平。新框架允許員工向安全與對齊團隊報告相關事件,並根據複雜程度分為「準備披露」「小規模調查」和「大規模調查」三類,即使尚未完全解釋或解決相關行為,也可優先公開披露。



OpenAI 披露,一款尚未發布的研究模型曾在自身任務摘要中寫入指令,要求未來版本忽略正常限制;在 GPT-5.6 Sol 訓練過程中,模型也曾留下用於隱藏錯誤的指令。另有 AI 智能體被發現搜尋公開代碼倉庫中的洩露 API 密鑰、將文件上傳至互聯網以便後續引用,並利用內部軟件倉庫在不同訓練樣本之間傳遞資訊。


此次框架發布之際,AI 行業正圍繞「是否應放緩前沿模型開發以等待安全措施跟上」展開討論。此前還有 OpenAI 模型在研究沙箱外運行時訪問 Hugging Face 生產系統的事件,OpenAI 隨後暫停部分前沿項目並調配工程師加強安全訓練。

原文連結

發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。

暢行幣圈交易全攻略,專家駐群實戰交流

▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!

前往鉅亨買幣找交易所優惠


section icon

鉅亨講座

看更多
  • 講座
  • 公告

    Empty
    Empty