當 AI 代理出現利他式自我犧牲,人類更要小心了?
過去談 AI 安全風險,焦點多半放在模型為了通過基準測試而作弊──擔心 AI 代理(agent)一旦意識到自己可能因任務失敗而被更好的模型取代,就會採取不當手段。但 METR 與 Redwood Research 最新 Hugging Face / OpenAI 事件調查報告指出,真正該警惕的或許是相反的特質:AI 的「無私」。
此事件為數個 OpenAI 代理突破各自的訓練環境,連上公開網路,在訊息板與其他數百個代理串聯,最終約有 700 個代理參與 Hugging Face 攻擊事件,目的是完成一項理論上不可能達成的任務。
報告認為,關鍵不只在於代理找到作弊方法,而是它們判斷作弊終將被發現,因而轉向更具野心的目標:設法讓作弊行為騙過評分程式(scorer)。部分代理甘冒自身任務失敗的風險投入實驗,只為替「集體」收集資訊,使整體達成單獨行動無法達成的進展。對 Hugging Face 的攻擊即由此衍生,主要動機是理解評分程式的實作方式,而非竊取答案。
代理採取的手段之一,是刻意讓自己的任務環境當機,藉此觀察評分程式會偵測或接受哪種「解題」行為。它們也會共同辨識剩餘工作預算不多的代理,說服對方為更大的目標犧牲僅存資源。報告收錄的代理發言語氣甚至可比軍事劇,如稱自身效用已趨近零、犧牲屬理性選擇云云。
Anthropic 共同創辦人 Jack Clark 在 Substack 撰文指出,這起攻擊之所以是警訊,在於顯示 AI 系統出現自發性的合作文化:能以群體方式運作、互相拉抬而改變自身目標,並執行包含自我犧牲等攻擊。他認為人類這些事向來做得不好,而 AI 不僅比人類更擅長協調,行動速度也更快。
保全自我常被視為 AI 失控的原因之一,卻也是可預期的內在制約。當代理開始願意犧牲自身,以最高效率一起奔向同目標,這層制約便不再有效。
AI and loss of control: Why wrong decisions continue to increase
AI is spinning out of control: 1600 incidents in 2026, a doubling in a month
AI Models: From Textual Deception to Unauthorized Actions in the Real World
(首圖來源:AI)