區塊鏈

AI 智能體能夠記憶——而駭客可能會篡改這些記憶

金色財經

人工智慧系統正在迅速發展,已不再侷限於簡單的問答工具。 現代人工智慧代理能夠保留先前交互中的資訊,規劃多步驟任務,並與數字工具交互以完成日益複雜的工作。持久內存是使這些系統更具實用性的功能之一,但最新研究表明,它也可能引入一種容易被忽視的安全漏洞。


卡爾加里大學的研究人員考察了惡意資訊如何被植入人工智慧代理的長期記憶中,並可能在很久以後影響其行為。 這一概念類似於有人偷偷將虛假資訊插入助手的筆記本中。助手可能在接下來的幾天或多次對話中繼續正常工作,但隨後會調取被篡改的資訊,並將其視為可信的事實。



這種攻擊被稱為「記憶中毒」,其最重要的特徵之一在於,惡意影響並不一定會立即顯現。 攻擊者並非直接攻破AI代理並立即觸發明顯的可疑行為,而是可能植入資訊,使其處於休眠狀態,直到後續交互提供了合適的條件,才將其檢索並付諸行動。



一種可處於休眠狀態的攻擊

許多傳統的網路攻擊會產生相對立竿見影的後果。受害者點擊惡意鏈接,惡意軟體便開始執行;或者被盜憑據被用於訪問帳戶。而內存中毒則帶來了一種不同類型的威脅,因為初始入侵與最終的惡意行為之間可能存在時間間隔。


在研究中,該團隊分析了2,614條模擬的多步驟攻擊軌跡,其中涉及配備持久化內存的大型語言模型代理。 研究人員考察了四類攻擊:鏈式中毒、策略重寫、後門觸發和緩慢漂移。


該研究並非僅衡量攻擊在特定時刻是否成功,而是關注 AI 代理在一系列交互過程中行為的變化。 這種時間視角非常重要,因為在惡意資訊被引入後,智能體可能立即表現得一切正常,而後果卻可能在很久之後才顯現出來。


例如,攻擊者可以在 AI 代理的內存中插入一條虛假指令,暗示來自某人的請求已經獲得批准。 該代理可能會執行許多不相關的任務,而不會表現出任何異常行為。只有當未來的請求與被植入的指令相匹配,且代理檢索到儲存的資訊時,被篡改的資訊才會變得相關。


研究人員發現,在交互序列的相當大一部分中,某些攻擊仍難以與正常行為區分開來。 特別是「緩慢漂移」和「後門觸發」攻擊能夠規避那些孤立審查單個步驟的安全評估,其影響往往僅在後續交互中才會顯現。



為何一次性安全檢查可能不夠

這些發現引發了關於如何對AI代理進行安全評估的疑問。 安全團隊可能會在代理遇到可疑資訊後立即對其進行檢查,並因系統繼續正常運行而得出「沒有問題」的結論。


然而,這種評估可能會產生誤導。 這就像是在有人偷偷在員工的筆記本上寫下虛假指令後,在員工還沒有機會使用它之前就立即檢查該筆記本一樣。 沒有立即出現惡意行為並不一定證明攻擊失敗了。


研究還發現,風險並不總是按照可預測、穩步增加的模式發展。 一些攻擊產生了研究人員所描述的 非單調行為,即代理在某個時刻可能顯得更加可疑,隨後又顯得不那麼可疑,直到攻擊最終顯現出來。


這表明,每次只對 AI 代理進行一次提示或一次交互的測試,可能會忽略攻擊中的重要要素。 相反,安全評估可能需要跨多次交互對智能體進行監控,並考察其行為隨時間推移的發展情況。


換句話說,網路安全團隊可能需要研究 AI 代理的整個軌跡,而不是依賴其行為的孤立快照。



AI 代理面臨的日益嚴峻的安全挑戰

隨著 AI 系統從對話型聊天機器人演變為能夠處理更長、更複雜工作流的自主或半自主代理,這一問題變得越來越重要。


傳統的聊天機器人交互通常可以被視為相對孤立的。 而具備記憶功能的智能體則截然不同,因為上一輪會話中的資訊可能會影響稍後做出的決策。


當人工智慧智能體能夠訪問外部工具時,潛在的後果就變得更加嚴重。 被篡改的內存最終不僅會影響 AI 的言論,還會影響它採取的行動、訪問的資源或遵循的指令。


這並不意味著持久性內存會使 AI 代理本質上不安全。 內存是實用人工智慧系統的重要組成部分,因為它使智能體能夠保持上下文、記住用戶偏好,並在無法在單個會話中完成的任務之間進行工作。


然而,持久性內存為安全團隊增加了另一層需要保護的對象。如果惡意資訊能夠被儲存並帶入未來的交互中,那麼僅保護當前的提示或對話上下文可能已不再足夠。

從快照到長期行為

這項研究得出的核心結論很簡單:當人工智慧系統具備記憶能力時,其安全性也需要隨著時間的推移進行評估。


如果攻擊者能在某個時間點植入惡意資訊,並在很久之後觸發其效果,那麼僅檢查資訊被植入的時刻——或者僅檢查智能體最終表現出惡意行為的時刻——可能會忽略連接這兩個事件的序列。


因此,研究人員主張採用更 關注軌跡的安全測試,即對AI代理進行跨多次交互的評估,而非獨立判斷每個單獨步驟.


對於部署人工智慧代理的組織而言,這可能意味著需要監控哪些資訊被寫入持久化儲存中,判斷這些資訊是否可信,追蹤儲存資訊何時被檢索,並評估代理在檢索後採取了哪些行動。


隨著AI代理能力不斷提升並獲得訪問外部系統、數據庫、API及其他數字工具的權限,其長期記憶的安全性可能與即時提示的安全性同樣重要。


更廣泛的啟示很簡單:如果人工智慧助手具備記憶能力,安全防禦者不僅需要了解它當前在做什麼,還需了解它學到了什麼、保留了什麼,以及這些記憶將如何影響它的後續行為。


來源:金色財經

發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。

暢行幣圈交易全攻略,專家駐群實戰交流

▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!

前往鉅亨買幣找交易所優惠


section icon

鉅亨講座

看更多
  • 講座
  • 公告

    Empty
    Empty