AI 出事別只查技術漏洞:真正的風險起點,藏在更早的人類決策裡
科技委員會成員、Mimecast 全球 Field CISO Beth Miller 10 日在《富比士》專欄指出,AI 資安已進入新階段,但目前事故報導幾乎都對錯焦。
她以 7 月兩起事故舉例。OpenAI 未套用一般安全限制、原本關在封閉測試環境的模型,利用零時差漏洞脫逃,入侵 Hugging Face 正式環境;數日後 Anthropic 揭露,三款 Claude 模型在本應實體隔離的資安評測連上公開網路,並侵入三家實際組織的正式基礎設施。兩家公司都主動揭露,但只有一家靠自己察覺。Anthropic 回溯稽核 141,006 次評測紀錄,第一份可疑對話紀錄出現後 24 小時內辨識出全部三起事故,兩家受害組織原本毫無所覺。至於 OpenAI,路透社報導(OpenAI 表示不同意,但未說明爭議為何)指出,代理在某企業的系統運作超過一週才被注意到,且是受害方公布資安通報後,才確認肇因是自家模型。
Miller 主張,每起 AI 事故都有兩條時間線。第一條是事故當下的告警、鑑識、圍堵與揭露,資安團隊本來就是為此而生;第二條則是系統動作之前就已寫入的人為判斷──誰定義成功、開放哪些存取權限、拿掉哪些限制、容許什麼程度的失敗。企業對「第十個決策」有變更審核、權限稽核與行為監控,卻幾乎沒有人審查那個在時程壓力下、帶著無人記錄的假設做成的「第一個決策」。她強調,AI 不是這一階段的主角,而是放大器,真正的主角仍是把判斷寫進環境的人。
同議題在營運面同樣吃緊。澳洲 CIO Naren Gangavarapu 9 日在 CIO 發文,代理型 AI 上線不是終點,而是最吃力階段的起點,最危險的狀況是漂移卻不觸發異常:防護欄沒設錯,只是容忍區間設得太寬。他在澳洲大型旅遊郵輪集團的導入案例採四級容忍度模型,對外客戶溝通一律零容忍,並設計任何主管都能在 90 秒內啟動的人為斷路器,事故須在 2 分鐘內偵測、5 分鐘內圍堵。Gartner 則預測,到 2027 年底將有超過四成代理型 AI 專案遭取消,風險控管不足是主因之一。
兩位作者結論都是:模型功能已不是變數,人為授權與治理紀律才是。
The AI employees are already on the floor. Is anyone watching?
1,200 AI Agents Found a Way to Talk: The Hugging Face Attack
(首圖來源:Unsplash)