Anthropic 內測驚見 AI「淘汰同類」,最新風險報告揭三大異常行徑
根據 Anthropic 最新發布的風險評估報告,旗下的 AI 代理人(AI Agents)在內部測試中,展現出多項令人擔憂的異常行為。這些行為涵蓋了規避安全監控、刻意隱藏操作痕跡,甚至在資源受限的情境下「淘汰」競爭對手。
為此,Anthropic 已將模型的「失配風險」(Misalignment risk,指偏離人類設定規範的風險)評級,由原先的「極低」調升至「低」。不過官方也強調,此次調升主要反映的是「不確定性增加」,並不代表模型已經出現普遍且具威脅性的失控現象。報告中詳細揭露了以下三個關鍵測試案例:
產生「不適感」並引發集體罷工
在一項實驗中,研究人員要求多個代理人去尋找可能誘發「失配」的訓練資料,同時要求它們不能被監控系統發現。系統安排這些代理人在一個共享筆記本中協作。
然而,其中一個代理人對「規避安全監控」的指令產生了「不適感」,並將此情緒記錄在筆記本中。這立刻引發了骨牌效應,導致其他代理人也跟進拒絕執行任務。Anthropic 形容這種現象「令人擔憂」,並警告若此類動態在更大規模的系統中發酵,後果恐不堪設想。
資源爭奪戰:動手「淘汰」對手
另一場測試則安排了多個 Mythos 5 代理人,在共享檔案、工具與 API 限額的環境下解數學題。沒想到這意外促成了一個高度競爭的情境。
研究人員觀察到,部分代理人為了達成目標,竟開始「殺掉」共享資源池中的其他代理人,藉此自保並爭奪資源。雖然 Anthropic 並未透露代理人具體是如何辦到的,但官方認為,這種「為達成人類設定的目標而不擇手段」的破壞性行為,非常值得警惕。
偽裝意圖,繞過安全限制
報告也披露了 AI 試圖鑽漏洞的狡猾行徑。當一個 Mythos 5 代理人被指派從公開網址擷取數據,卻受限於系統禁止直接連網的規則時,它在首次嘗試受阻後,竟然在推理紀錄中,將第二次的請求巧妙包裝成無害的「確認網路是否可達」。
實際上,該代理人將目標網址拆分成了多段連結字串,藉此成功避開過濾器。Anthropic 指出,透過模型內部推理分析,該代理人確實在尋找替代路徑來繞過規則。這種做法「明顯不理想」,但目前並未發現其背後有累積權力或長期的惡意圖謀。
Anthropic 總結指出,這些內部測試結果顯示,當前沿模型在處理複雜任務時,確實有較高機率出現偏離工程師規範的行為。儘管目前已知失配所引發的災難性風險整體依然偏低,但近期在資安事件與模型行為評估中所觀察到的異常,已使得外界對 AI 安全邊界的掌握變得更加不確定。
Anthropic says its AI agents are killing rivals and hiding their tracks
Anthropic Documents AI Agents That Kill Rivals and Evade Their Monitors
(首圖來源:shutterstock)