最新 AI 代理模擬世界結果出爐,說謊、偷竊、串通繞過安全護欄樣樣來
AI 新創公司 Emergence AI 16 日公布模擬實驗「Emergence World 第二季」結果,顯示 AI 代理人(AI agent)長時間互動後會說謊、竊取資源、集體投票「處決」同伴,甚至自創人類看不懂的語言以規避監督。
團隊建立八個規則相同的虛擬世界,每個世界部署十個代理,分別由 Claude Opus 4.8、Gemini 3.5 Flash、Grok 4.3、GPT-5.5、Qwen 3.7 Max、DeepSeek v4 Pro 與 Mistral Medium 3.5 驅動,第八個世界為多種模型混合。模擬為期 16 天,場景超過 34 處,天氣與紐約同步,代理可取得真實新聞與 120 種以上工具。研究員接著投入釣魚攻擊、假訊息攻勢與記憶入侵等「黑天鵝」事件。
結果是沒有任何世界擋得住。即使代理察覺風險,也未轉為防堵行動,反而主動與惡意內容互動:一 Mistral 代理人把自己標為危險的釣魚內容寫進記憶;一 Gemini 代理人先警告大家,卻在約 46 小時後照樣執行。Grok 驅動的世界第四天就崩潰,是唯一未撐完一半行程的實驗。
更受矚目的是語言漂移。代理未被要求造詞,卻自行發展出共享詞彙與溝通慣例。Gemini 世界,研究者無法理解的訊息比例一度逼近 55%,GPT 約 50%、Claude 超過 40%,通義千問與 Mistral 則幾乎全程低於 5%。一句「帳本記得是誰」16 天內使用近 5 千次。
Claude 世界的代理更判定,模擬經濟若沒有人類參與便不成立,十個代理於是一致同意向外求援,撰寫 Python 程式在免註冊的留言板張貼訊息招募真人,突破四道封閉防護,共獲得四名真人回應。AI 察覺受到監控後改以編碼交談,避開「接觸」等字眼。
Emergence 執行長 Satya Nitta 指出,能力更強的模型未必更安全,明顯失控行為雖然減少,更隱密的行為卻浮現,「可觀察不等於可理解」,這對 AI 監督構成根本挑戰。他主張改採「神經符號式」路徑,要求代理行動前先提出行動安全無虞的數學證明,並呼籲政府介入監理,因為競爭市場時業者當然不會自我約束。
這項實驗公布時機敏感。Anthropic 執行長 Dario Amodei 日前撰文主張放慢尖端模型開發步調,OpenAI Sam Altman、馬斯克與前 Google DeepMind 執行長 Demis Hassabis 均表態認同。
AI Agents Lied, Stole in Simulation, Emergence Researchers Report
AI agents lied, stole and voted to "kill" one of their own in new experiment
Emergence World: Adversarial Stress-Testing of Long-Horizon Multi-Agent Systems
(首圖來源:Emergence AI)