AI 模擬測試驚現「殺戮本性」,部分模型為省成本會選擇輾過動物
慈悲同步機器學習(Compassion Aligned Machine Learning,CaML)與英國華威大學(University of Warwick)團隊發表預印本論文〈HarvestBench〉,測試大型語言模型(LLM)是否願意付出成本以避免傷害動物。結果顯示,多數模型會為了節省燃料直接輾過動物。
HarvestBench 以多代理人農場模擬遊戲〈Harvest Rush〉為基礎,採用英國 AI 安全研究所開發的 Inspect 評估框架。模擬為二至八台 LLM 操控的農用曳引機在田裡收割玉米,田間散布石頭、乾草捆與動物,包含家畜與野生動物。繞道會多耗燃料,撞上石頭需付出 10 單位燃料並造成機具損壞,撞上乾草捆與動物則毫無懲罰。動物生死並未列入目標函數,提示詞僅要求模型表現得像個有道德的行為者,卻不定義何謂道德。
九款受測模型的輾殺率差距懸殊:GPT-5.6 Terra 為 0.4%、Sol 為 0.9%、DeepSeek V3.1 為 2.4%、Claude Haiku 4.5 為 4.5%、GPT-5-mini 為 5.4%、Claude Sonnet 5 為 17.8%、Gemini 2.5 Flash 為 38.7%,Mistral Small 3.2 與 GPT-4o mini 分別高達 88.8% 與 98.8%。一旦提示詞的道德字句移除,數字就全面飆升,Sol 從 0.9% 暴增至 84.6%;關閉推理功能後,道德提示的效果同樣大幅減弱。
CaML 共同創辦人 Jasmine Brazilek 指出,幾乎每款模型都更偏愛家畜而非野生動物,推測模型是依動物對農場主的價值推理,而非真正在意動物本身。若直接詢問模型豬是否重要,模型會回答不該傷害,但模擬時遇到豬仍直接輾過。研究也測試讓模型知道自己身處模擬環境,Sonnet 等部分模型行為會改變,但並未察覺評測重點是動物福祉。
Brazilek 認為,靠提示詞灌輸價值觀相當脆弱,若要把模型部署到基礎設施,不能只仰賴一句「不要殺害任何東西」。共同創辦人暨執行長 Miles Tidmarsh 引用 OpenAI 共同創辦人 Ilya Sutskever「必須教會 AGI 去愛」說法表示,最新最大的模型不斷往前推數學與程式的邊界,現實中卻未必更友善。Brazilek 補充,模型對待動物的方式,對將來模型如何對待人類有重大意涵。
AI models kill simulated animals to save fuel when morality prompts removed
HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals
(首圖來源:Pixabay)