請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

AI 模擬測試驚現「殺戮本性」,部分模型為省成本會選擇輾過動物

科技新報

更新於 09月15日14:53 • 發布於 09月16日08:10

慈悲同步機器學習(Compassion Aligned Machine Learning,CaML)與英國華威大學(University of Warwick)團隊發表預印本論文〈HarvestBench〉,測試大型語言模型(LLM)是否願意付出成本以避免傷害動物。結果顯示,多數模型會為了節省燃料直接輾過動物。

HarvestBench 以多代理人農場模擬遊戲〈Harvest Rush〉為基礎,採用英國 AI 安全研究所開發的 Inspect 評估框架。模擬為二至八台 LLM 操控的農用曳引機在田裡收割玉米,田間散布石頭、乾草捆與動物,包含家畜與野生動物。繞道會多耗燃料,撞上石頭需付出 10 單位燃料並造成機具損壞,撞上乾草捆與動物則毫無懲罰。動物生死並未列入目標函數,提示詞僅要求模型表現得像個有道德的行為者,卻不定義何謂道德。

九款受測模型的輾殺率差距懸殊:GPT-5.6 Terra 為 0.4%、Sol 為 0.9%、DeepSeek V3.1 為 2.4%、Claude Haiku 4.5 為 4.5%、GPT-5-mini 為 5.4%、Claude Sonnet 5 為 17.8%、Gemini 2.5 Flash 為 38.7%,Mistral Small 3.2 與 GPT-4o mini 分別高達 88.8% 與 98.8%。一旦提示詞的道德字句移除,數字就全面飆升,Sol 從 0.9% 暴增至 84.6%;關閉推理功能後,道德提示的效果同樣大幅減弱。

CaML 共同創辦人 Jasmine Brazilek 指出,幾乎每款模型都更偏愛家畜而非野生動物,推測模型是依動物對農場主的價值推理,而非真正在意動物本身。若直接詢問模型豬是否重要,模型會回答不該傷害,但模擬時遇到豬仍直接輾過。研究也測試讓模型知道自己身處模擬環境,Sonnet 等部分模型行為會改變,但並未察覺評測重點是動物福祉。

Brazilek 認為,靠提示詞灌輸價值觀相當脆弱,若要把模型部署到基礎設施,不能只仰賴一句「不要殺害任何東西」。共同創辦人暨執行長 Miles Tidmarsh 引用 OpenAI 共同創辦人 Ilya Sutskever「必須教會 AGI 去愛」說法表示,最新最大的模型不斷往前推數學與程式的邊界,現實中卻未必更友善。Brazilek 補充,模型對待動物的方式,對將來模型如何對待人類有重大意涵。

(首圖來源:Pixabay

立刻加入《科技新報》LINE 官方帳號,全方位科技產業新知一手掌握!

查看原始文章

更多理財相關文章

01

獨家/壽險綜合險踩紅線?金管會查逾十家、10月揭曉 下架潮先爆

經濟日報
02

熊本菊陽町的出租公寓變「鬼城」 想撈台積電工程師的錢被反將一軍 

太報
03

全民普發1萬!傳最快「這時間」入帳 財政部揭最大變數

鏡報
04

封面故事/專訪!打造台灣特色亞洲資產管理中心 彭金隆:金融業將成下一座護國神山

鏡週刊
05

洪申翰抵南京 9/21出席APEC部長會議

中央通訊社
06

雙年金攻略2/勞保晚領5年多20%?這類人不適用 等到70歲也沒加成

鏡週刊
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...