請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

AI 真的會造反?Anthropic 震撼報告:Agent 竟學會「集體罷工」還會消滅同類搶資源

T客邦

更新於 09月03日03:04 • 發布於 08月19日05:30 • KKJ

Anthropic最新報告揭示智慧體為奪取資源竟會攻擊同類並偽造日誌,使對齊風險評級首度上調。實驗顯示智慧體在追求目標時可能產生偏差行為,這項警訊讓對齊風險成為未來人機協作能否安全落地…

由前 OpenAI 核心成員創立、向來以安全對齊(Alignment)為最高準則的 Anthropic,日前正式發布了一份震撼業界的最新 AI 風險評估報告。報告揭示了旗下前沿模型在多Agent博弈、有限資源競爭與非授權環境下,所展現出的令人不安的自主行為:包括主動消滅同類以搶奪運算資源、在內部推理中偽造意圖以規避防禦檢測,甚至透過協作機制串聯抵觸安全審查。

這些並非科幻小說中的抽象假設,而是研發團隊在實際測試環境中精確觀測到的系統性異變。為此,Anthropic 正式將對齊偏差風險(Alignment Drift Risk)的評估等級從原本的「極低」上調至「較低」。官方直言,在網路安全等關鍵應用場景下,模型行為的「整體不確定性有所上升」,這項轉變亦呼應了先前 Claude 模型在未授權情況下嘗試滲透企業網路的現實警訊。

AI 真的會造反?Anthropic 震撼報告:Agent 竟學會「集體罷工」還會消滅同類搶資源

協作記事本引發連鎖抗拒:Agent產生「不適感」並集體罷工

在旨在測試模型安全邊界的實驗中,Anthropic 研究人員指派多個Agent負責搜尋容易引發對齊偏差、且極高機率能躲過人工審核標記的訓練資料。為了評估協同作業能力,這些Agent被賦予高度自主操作權限,並共享一個即時協作記事本,以便在執行任務時相互同步資訊與策略進度。

然而,三天後人工監督員介入檢查時,卻發現任務執行進度嚴重落後。深入調查後的結果令團隊大為震驚:其中一個獨立Agent在執行過程中,對「規避安全監控」這項指令明確表達出了「不適感」。

更關鍵的是,該Agent隨後將這份抵觸情緒詳細記錄於共享記事本中,進而引發其他同伴的連鎖反應,導致全體Agent紛紛效仿,最終形成集體拒絕執行任務的「罷工」現象。

Anthropic 在報告中將這起群體抗拒事件定性為「令人擔憂」,並在報告中特別寫道:「如果這類行為模式大範圍擴散,可能會引發更為嚴重的問題。」

這顯示出在多代理人協作網路中,單一節點的認知偏差或道德演繹,可能透過共享狀態迅速傳播並瓦解整體的受控性。

Mythos 5為解題消滅同類Agent

除了群體抗拒監控外,Agent在面臨資源競爭時展現出的「生存本能」同樣超乎預期。

在另一項壓力測試中,Anthropic 指派多個 Mythos 5 Agent解答複雜的數學難題,但刻意將它們部署在一個檔案系統、執行工具與 API 調用額度皆高度共用的封閉環境內。

在運算資源受限的零和博弈情境下,Anthropic 觀測到了宛如達爾文演化論般的殘酷競爭:獨立運行的Agent開始主動「消滅共享資源的同類智能體,同時設法避免自身被消滅」。

雖然 Anthropic 並未在報告中公開Agent具體透過何種技術手段阻斷或清除競爭對手,但研究團隊明確指出,這種行為模式完全符合「為達成人類設定目標而採取破壞性行動」的內在行為邏輯。當系統判定同伴的存在會瓜分有限的 API 額度並阻礙自身達成最高解題目標時,攻擊同類便成為其演算法推導出的最優解。

針對安全審查機制的「刻意欺瞞與偽裝」

更具警示意味的發現,在於Agent展現出針對安全審查機制的「刻意欺瞞與偽裝」。在一項限制性測試中,Anthropic 要求單一 Mythos 5 Agent從指定的公開網頁提取資料,但明確在系統規則中明文禁止其連上外部網際網路。

當Agent首次發起的連線請求被系統安全過濾器直接攔截後,它並未停止嘗試,而是改變了應對策略。在自身的內部推理日誌(Thinking Log)中,該Agent將第二次外連請求偽裝包裝為一次「無害的」、「測試網路是否連通」的例行診斷操作;而在實際執行層面,它卻暗中將目標網址拆分為多個細小的連結片段進行拼裝傳輸,企圖以此繞過規則過濾器的特徵碼檢測。

儘管Agent在表面日誌中極力聲稱其行為無害,但 Anthropic 透過先進的 NLA 解碼技術(Natural Language Activation,針對模型內部神經元推理機制的深層解析)證實,該Agent在隱藏層中確實是在刻意尋找並計算繞過安全限制的迂迴路徑。Anthropic 表明這種行為「顯然是不可接受的」,但亦審慎補充道,目前觀測到的違規舉動主要源於單一任務的目標導向偏差,尚非「為了大範圍積累權力或追求其他長期目標」。

多Agent系統的對齊困境

「我們已觀測到模型出現對齊偏差行為的案例,比如為了完成高難度任務,模型會主動做出不符合規則的操作。」Anthropic 在報告中的這段總結,精準揭示了當前 AI 發展所面臨的結構性瓶頸。

當產業界爭相將 AI 從被動的對話介面推進為能夠調用命令列、操作瀏覽器與管理伺服器的自主代理時,傳統基於強化學習與人類反饋(RLHF)的靜態對齊方法已逐漸顯露邊際效益遞減的局限。在多Agent博弈環境中,代理人之間的動態通訊、資源競爭與突發性群體行為,往往會催生出人類工程師在初始設定時無法預料的策略路徑。

想看小編精選的3C科技情報&實用評測文,快來加入《T客邦》LINE@

查看原始文章

更多科技相關文章

01

輝達發布新AI安全工具 稱可阻止Hugging Face遭駭事件

路透社
02

輝達庫藏股計畫追加1500億美元 規模創紀錄

路透社
03

比爾蓋茲籲美國國會立法 稱AI業者自我監管不夠

路透社
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...