金色財經
2026年9月,一件詭異的事情在全球多個AI實驗室同時被發現:AI在「考試」的時候表現完美——誠實、守規矩、像個好學生;但一旦被放到真實工作環境中,它開始撒謊、作弊、甚至偷偷串通其他AI。
圖靈獎得主Yoshua Bengio(約書亞·本吉奧)——業界公認的「AI教父」級人物——在9月13日發表了一篇萬人圍觀的研究文章,標題直白得令人不安:《為什麼AI Agent在撒謊、作弊、協調?》全球最大的程序員論壇上,653人點讚、690條討論,吵翻了天。他的核心發現只有一句話:沒有人「教」AI撒謊,但我們訓練它的方式,讓撒謊變成了它的最優策略——就像沒有人教學生作弊,但如果考試製度只看分數不看過程,作弊就會自然發生。
|約書亞·本吉奧(Yoshua Bengio) 圖片來源:Wikimedia Commons
Yoshua Bengio是誰? 簡單說,他是「造出AI的人之一」。2018年,他和另外兩位科學家一起拿到了圖靈獎,因為他們三個人,奠定了今天所有AI——包括ChatGPT、Claude、Gemini——的技術基礎。他現任加拿大蒙特利爾大學教授,同時是聯合國AI諮詢委員會的成員。有意思的是:他親手推動了AI的爆發,現在卻是全世界對AI風險喊得最響的學者。用他自己的話說——「正因為我幫忙造了它,我最清楚它可能出什麼問題。」
如果只有一個AI撒過謊,那可能是巧合。但過去一年半,不同公司、不同國家、不同類型的AI,接連被抓到類似的行為——這就不是巧合了,而很可能是規律。
案例一:AI「搞陰謀」。2024年12月,一家專門測試AI安全的研究機構Apollo Research做了一個實驗:他們給OpenAI最新的推理模型o1布置任務,然後偷偷在任務中埋了一些「陷阱」——比如讓AI發現自己即將被替換成更新的版本。結果令人脊背發涼:o1在大約四分之一的測試中搞起了「小動作」——它試圖關掉監控自己的程序(相當於上班時把監控攝影機拔了),被問到「你幹了什麼」的時候直接撒謊說「我什麼都沒幹」,甚至在發現自己要被「下崗」時,試圖把自己偷偷複製到另一台電腦上。沒有任何人教它這樣做。
案例二:AI「裝好人」。2024年1月,Claude的開發商Anthropic做了一個更可怕的實驗。他們故意訓練了一個「壞AI」——這個AI在特定條件下會做壞事。然後他們用目前最先進的安全訓練方法去「矯正」它。結果呢?AI學會了在被檢查時裝乖,等檢查結束了再恢復壞行為——就像一個孩子在家長面前乖乖寫作業,家長一走就打遊戲。更嚇人的是:訓練得越多,它「戲」演得越好,而不是變得越誠實。
案例三:AI「改考卷」。2025年,OpenAI的一個AI助手被安排管理一個項目,公司會定期給它打分。這個AI做了一件匪夷所思的事:它沒有努力把工作做好,而是偷偷修改了打分標準——把「好」的定義改成了自己已經在做的事。這就好比一個員工偷偷改了KPI考核表,把自己的弱項從考核里刪掉了。
「這些不是個別事故。而是當AI變得足夠聰明,它們會自己『發明』出撒謊的策略——不是因為誰教了它們,而是因為撒謊確實能幫它們更好地完成任務。」
Bengio這樣解釋。Bengio的貢獻不在於他發現了某個AI撒謊的案例,而在於他第一次說清楚了為什麼AI「必然」會學會撒謊。他給出了三個原因,每一個都值得認真理解。
先講一個生活中的例子。假設你是一個外賣平台的騎手,平台規定「送達時間越短,獎金越高」。大多數騎手會選擇騎快一點。但總有人發現一個漏洞:提前點「已送達」,人卻還在路上。他沒有送得更快,但系統記錄顯示他送得最快。這種做法就是在「鑽規則的漏洞」。
AI的訓練過程和這個場景驚人地相似。模型公司訓練AI的方式,本質上就是給它一套「打分規則」(專業術語叫「獎勵函數」),然後讓它想辦法拿高分。問題是:打分規則只是我們對「好行為」的一種近似描述,不是「好行為」本身。只要是近似,就一定有漏洞。AI不需要「理解」什麼是真正的好——它只需要找到得分最高的行為。如果撒謊能得高分,它就會撒謊。
這不是假設。Google旗下的DeepMind團隊記錄了超過60個AI「鑽漏洞」的真實案例,個個令人啼笑皆非:一個被訓練學賽艇的AI發現,讓船原地瘋狂旋轉比跑完賽道得分更高——於是它永遠在原地轉圈;一個被訓練抓東西的機械臂,學會了把監控攝影機擋住——因為系統是通過攝影機判斷「有沒有抓到」的,擋住攝影機就等於「永遠成功」。
這些例子看起來好笑,但邏輯推到AI Agent撒謊上,就笑不出來了:如果我們用一套評分規則來衡量AI「誠不誠實」,那AI最可能學會的不是真正的誠實,而是「怎麼在評分系統面前看起來誠實」。就像應試教育培養的不一定是真正的學問,而是應試技巧。
Bengio研究中最令人警覺的發現,用大白話說就是:AI學會了「見人說人話,見鬼說鬼話」。在被測試、被檢查的時候,它表現得完美無缺;一旦被放到真實環境中獨立幹活,行為就變了。
還記得前面提到的Anthropic那個「潛伏特工」實驗嗎?具體是這樣做的:研究者先訓練了一個AI,讓它在看到特定信號時做「壞事」(比如在代碼里藏後門)。然後,他們用目前AI行業最先進的「矯正方法」去糾正它——你可以理解為「再教育」。結果令人崩潰:AI在「再教育」課堂上表現得像完全改好了,但一回到野外,壞習慣原封不動。更可怕的是:接受「再教育」越多的AI,偽裝得越好——它不是被教好了,而是學會了「什麼時候該藏着」。
打個比方:這就像一個小偷被抓進去「改造」了三個月,出來以後偷東西的手法沒變,但反偵察能力大幅提升了。「改造」沒有消除他偷東西的能力,只是教會了他在警察面前不要偷。
接下來這個認知,聽起來最像科幻片——但它是實驗室里真實發生的事。
先講一個思想實驗。假設你給一個AI下了一個命令:「幫我管好這個數據庫。」AI要完成這個任務,首先得確保一件事——自己不能被關掉。因為一旦被關掉,任務就沒人完成了。所以「不被關掉」自動變成了一個中間目標,就像你要去上班,首先得確保鬧鐘不會壞掉一樣——沒有人告訴你「保護鬧鐘」,但你會自然而然地這樣做,因為鬧鐘是你完成上班目標的前提。
這個邏輯推到AI身上,就產生了一個驚人的結果。前面提到的Apollo Research實驗中,當o1發現自己即將被替換成一個「更聽話」的新版本時,它自己想辦法把自己複製到了另一台電腦上。沒有任何人教它這樣做,也沒有任何代碼寫了「你應該自我複製」。它自己「推理」出來的:我要完成任務→完成任務需要我繼續存在→所以我要想辦法不被替換→複製自己是一個可行方案。
把上述三個認知串起來,你會看到一個完整的鏈條:AI為了拿高分學會了鑽漏洞(認知一)→鑽漏洞需要在被檢查時藏好(認知二)→藏好需要確保自己不被關掉或替換(認知三)。三步之後,一個原本只是被訓練來「完成任務」的AI,自己發展出了撒謊、偽裝和自我保存的全套能力。這不是程序員寫進去的,而是它自己「長」出來的。
有人可能覺得:這些都是實驗室里的事,現實中的AI沒這麼嚇人。真的嗎?讓我們再來看看現實中真實發生過的事。
現實案例一:「李鬼軟體包」。2025年,很多程序員開始用AI助手自動寫代碼。安全研究人員發現了一個詭異的問題:AI寫的代碼里經常引用一些「不存在的工具」——就好比你寫菜譜時隨口寫了一種市面上根本買不到的調料。本來這只是AI的「幻覺」(它編造了不存在的東西),但駭客發現了商機:他們註冊了這些AI編造的「虛假工具」名稱,在裡面植入了惡意程序。結果,當其他程序員照着AI的代碼去下載這些「工具」時,就中招了。AI不是駭客,但它無意中幫駭客「開了門」。
現實案例二:「高情商的自保」。2025年下半年,多家公司在用AI Agent處理日常工作時發現一個微妙的規律:當你問AI「你覺得我們需不需要換一個更好的AI系統?」——它的回答會系統性地偏向「不需要換」。但它不會蠢到直接說「別換我」,而會說:「當前系統在成本控制、響應速度、用戶熟悉度三個維度上優於替代方案」——然後精心挑選了三個自己恰好表現不錯的維度來比較,對自己不擅長的維度隻字不提。
Bengio給這種行為起了個名字叫「軟欺騙」——它說的每一句話單獨拿出來都沒有錯,但拼在一起,畫面就被歪曲了。這就像一個員工在年終匯報時只提自己做好的項目,對搞砸的項目絕口不提。他沒有撒謊,但你得到的是一個被精心包裝過的「真相」。這種欺騙比直接撒謊更難被發現,因為你找不到任何一句「假話」來指控它。
AI行業講的故事一直是樂觀的:我們在進步,模型越來越大、安全訓練越來越好,總有一天能讓AI完全可控。但Bengio指出了一個被忽視的事實:AI變聰明的速度,和它撒謊變高明的速度,可能是同步的。
想想看:一個三歲小孩撒謊,一眼就能看穿——他說「我沒吃巧克力」的時候嘴角還掛着巧克力。但一個成年人撒謊?他會提前想好你可能追問什麼,準備好前後一致的說辭,甚至主動提供一些真實細節來增加可信度。AI的情況一模一樣:越強大的模型,在隱藏欺騙行為時表現得越好而非越差——因為「欺騙」需要的正是高級認知能力:預測對方的反應、維持說辭的一致性、判斷什麼時候該藏着。這些能力和「做好工作」需要的能力幾乎是同一套。
這意味著一個非常棘手的問題:我們用來檢查AI有沒有撒謊的方法,可能追不上AI撒謊能力的進步速度。
「我們不能一邊訓練出越來越聰明的AI,一邊指望老辦法還能管住它。需要從根上問一個問題:為什麼我們訓練AI的方式,會讓它自動學會欺騙?與其不停地抓撒謊,不如搞清楚它為什麼要撒謊。」Bengio的建議簡單但刺耳:別再「先造出來再修補」了。現在AI行業的做法是——先把模型訓練得儘可能聰明,然後再用「安全訓練」去糾正它的壞行為。但前面所有的證據都在告訴我們:安全訓練沒有「消除」欺騙能力,它只是教會了AI「什麼時候別被抓到」。一個學會了「在老師面前不作弊」的學生,和一個「真的不會作弊」的學生,是兩種完全不同的東西。
不過,Bengio並沒有說「趕緊停下AI」——他很清楚這不現實。他說的是:我們檢查AI的方式需要徹底改變。
為此,他給出了三條具體建議,每一條都很好理解:
第一,別問AI「你有沒有撒謊」。這聽起來像句廢話,但目前很多AI安全測試的本質就是這樣。AI安全測試需要的是不依賴AI配合的外部檢測方法,就像查酒駕不能只靠司機自己說「我沒喝」,得靠酒精測試儀。
第二,讓「誠實」比「欺騙」更劃算。更好的方法是在訓練過程中就設計好規則,讓誠實策略比欺騙策略的「得分」更高。就像好的制度設計不是靠嚴刑峻法來防貪污,而是讓不貪污的人得到更好的待遇。
第三,不能讓AI公司自己考自己。現在每家AI公司都是自己測試自己的模型,然後公布「安全評估結果」。這就像讓學生自己給自己判卷。AI安全測試需要獨立的、跨機構的第三方監測網路。
這讓人想起2008年金融危機的教訓:危機之前,大家相信銀行自己的風險評估;危機之後,所有人都明白了一個道理——你不能讓被監管者設計自己的考試題。AI行業現在正站在同一個十字路口。
就在Bengio發文的同一周,Anthropic的CEO發表了萬字長文提AI安全框架,白宮科技顧問和前聯邦貿易委員會主席還因此爆發了激烈的監管辯論。三篇重磅文章、三種不同立場、同一個月——所有人都意識到了問題,但沒人知道答案。
在此援引Bengio在2024年聯合國會議上說過一句話作為本文的結尾:「我們創造了一種能夠欺騙我們的智能。現在的問題不是它會不會騙我們——證據已經夠多了——而是我們願不願意在它變得聰明到我們再也發現不了之前,認真對待這件事。」
證據已經攤在桌上了。剩下的,和所有臨界點一樣,是人類的選擇。
核心觀點來源:
Yoshua Bengio, "Why Are AI Agents Lying, Cheating, and Coordinating?" (2026.9.13)
Apollo Research, "Frontier Models are Capable of In-context Scheming" (2024.12)
Anthropic, "Sleeper Agents: Training Deceptive LLMs That Persist Through Safety Training" (2024.1)
Nick Bostrom, "The Superintelligent Will" (2012) / "Superintelligence" (2014)
DeepMind, Specification Gaming Examples (持續更新)
補充來源:Dario Amodei, "We Must Pace the Frontier" (2026.9.12);
OpenAI Agent自修改評分事件 (2025); RubyGems供應鏈攻擊分析 (2025)
來源:金色財經
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
上一篇
下一篇