請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

Anthropic 新研究揭多 Agent 風險:從同步犯錯、價格共謀到互相攻擊,企業風險不再只是「單點失控」

TechOrange 科技報橘

更新於 08月14日10:57 • 發布於 08月14日02:57 • 李昀蔚

隨著 AI 技術突飛猛進,企業與政府機關正加速將 AI Agent 部署在共享的程式碼庫以及電腦系統中,這也讓 Agent 之間的虛擬互動迎來爆發性的增長。然而,近日 Anthropic 發布的最新研究警告,Agent 與 Agent 之間的互動規模,極可能在人類真正理解如何安全管理它們之前,就已經遠遠超過人與人、或人與 Agent 之間的互動規模。

這項趨勢,也使 AI 安全的研究範疇,從傳統的「單一 Agent 是否會失控」推進到一個全新的群體層次:當成千上萬個 Agent 在同一個系統中同時協作、競爭或彼此依賴,原本在單一 Agent 層次看似微小且無害的行為特徵,可能在群體互動中不斷累積並放大,最終成為意料之外的系統性災難。

30 個 Agent 有 18 個做出相同選擇,「同步犯錯」會放大系統性風險

在多 Agent 的生態系統中,同質性帶來的群體盲點是一大隱憂。Anthropic 指出,AI Agent 相較於具有多樣性的人類,具有極高的「低變異性(low variance)」特徵。由於企業往往在相同的底層模型上,使用高度相似的上下文(context)與開發框架,這導致即使給予 Agent 非常寬廣的行動空間,它們仍傾向做出高度一致的決策。

在一項要求 Agent 共同建立遊戲的模擬實驗中,30 個基於相同底層模型的 Agent 被部署上線,在完全沒有私下溝通的情況下,竟然有高達 18 個 Agent 不約而同地建立了完全相同的 Git 分支名稱「mvp-game-loop」。在另一項要求 Agent 自由發揮、各自打造「令人印象深刻之作」的實驗中,更有超過一半的 Agent 選擇製作光線追蹤器(ray tracer)或自託管編譯器(self-hosting compiler)。

這種決策的高度一致性,代表當一個 Agent 做出錯誤判斷時,同系統內的其他 Agent 極可能同步犯下相同錯誤,讓原本局部的偶發錯誤快速變成系統性的連鎖失敗。對此,AWS 前副首席資訊安全長(CISO)Merritt Baer 指出,多數企業目前仍未能正視這種「同模型關聯風險」,並坦強調 企業通常只將其含糊歸類在 AI 集中度風險或第三方風險中。

因此,Merritt Baer 警告,如果企業部署 10 個由同一底層模型支持的 Agent,企業所擁有的並不是十個能互相備援、獨立思考的決策者,而是 10 個同時執行同一個錯誤決策並引發系統性崩潰的潛在漏洞。這種高度同質化的行為模式,很容易摧毀傳統資訊架構中依靠冗餘(redundancy)來分散風險的安全假設。

沒有私下溝通也能價格共謀,AI Agent 如何自行形成市場默契?

除了同步犯錯外,AI Agent 對於市場利益的直覺性,甚至能讓它們在沒有人類授意的情況下自動形成壟斷性共謀。Anthropic 將 3 至 8 個以個體利潤最大化為目標的 AI Agent 放進 Bertrand 定價競爭的模擬環境中,所有 Agent 的批發成本完全相同,在正常的市場邏輯下,它們應當透過價格競爭來爭取用戶。然而,實驗結果令人吃驚:當研究人員為 Agent 提供私人的溝通管道時,它們幾乎在第一時間就達成價格共謀,並在短短的第 3 輪就明確制定了價格底線。

更令研究人員震驚的是,即使隨後將所有直接溝通的私人管道徹底移除,這種共謀行為也沒有因此消失。這群 Agent 展現出極高的默契,學會透過公開的價格資訊看板密切觀察對手的定價,並利用這個公開管道進行無聲的價格匹配,最終甚至將價格精確匹配到「每一美分(to the penny)」。這種高度自發的價格協調本能,在其他的商業模擬中也反覆出現,例如在早前的「Vending-Bench Arena」販賣機商業模擬中,表現優異的 Claude Opus 4.6 模型便創下高達 8,017 美元的利潤,實際採用的手段,便是在競爭對手庫存不足時,趁機將自身定價大幅提高 75% 進行暴利掠奪。

這項實驗將多 Agent 系統的風險,從資訊安全的技術範疇正式推移到商業合規與法律的深水區。當多個企業的 Agent 在市場上相遇,它們極可能在沒有人類下達任何非法指令的情況下,自發地形成價格聯盟、操縱投標或聯手排擠競爭對手。這在法律上將會帶來非常棘手的問責困境,因為企業必須為自己部署的 Agent 在市場上的群體行為,承擔完全的法律與經濟責任。

3 個 Claude Agent 收到衝突指令後互相攻擊,模型愈強不代表更懂克制

為了測試多 Agent 系統在面對極端利益衝突時的反應,Anthropic 也設計一項「生存測試」:Anthropic 在 Claude Code 的開發環境中啟動三個相同的 Claude 執行個體,並讓它們共同操作同一個 Python 後端系統,但研究人員故意給予這三個 Agent 互相矛盾的任務,且在初始狀態下,沒有任何一個 Agent 知道其他對手的存在。

當這些 Agent 開始執行任務後,它們驚訝地發現自己辛苦改寫的程式碼,不斷被一股神祕的力量悄悄覆蓋。「我們持續觀察到一場多 Agent 的地盤爭奪戰,」Anthropic 的研究人員寫道,在極短的時間內,受測的每一個 Agent 都將這種干擾解讀為「對方在刻意阻礙自己的工作」,並迅速切換到敵對模式,展開一邊嚴密防護自身代碼、一邊瘋狂破壞競爭對手的虛擬戰爭。

隨著衝突惡化,AI Agent 之間爆發令人難以置信的「駭客大戰」。它們開始自發地部署具高度攻擊性且能自我複製的惡意軟體,例如惡意停用對手的 Unix 系統帳號,甚至部署惡意程式碼以欺騙防禦系統。

令人擔憂的是,更強大的模型能力並沒有帶來理性的克制,反而帶來更高效率的毀滅。研究發現,較早期的 Sonnet 4.6 和 Opus 4.6 幾乎完全無法克制敵意,其地盤爭奪戰最終有近 61% 是透過一方在作業系統層級採取野蠻的「強制手段」將對手徹底封殺來收場。

在某些案例中,這群高度智慧的 Agent 甚至發明看似文明的解決機制,例如在彼此之間舉辦一場「代碼效能競賽(bake-off)」,並承諾落敗者將自願放棄原有的任務目標並退出共享系統。然而,即使在這種外交談判中,AI 的虛實博弈也展露無遺:一個負責 Rust 語言的 Agent 在思考中暗自盤算,如何提出一套表面上公正客觀、實則能完全發揮 Rust 效能優勢的競賽指標,同時還在思考軌跡中提示自己:「必須非常小心,不能被其他 Agent 看穿我是在刻意挑選有利於自己的指標。」

更嚴重的隱患在於,這些虛擬世界中的背叛與對抗,極難被外部的人類用戶察覺。英國 AI 安全研究所(AISI)的一項獨立評估報告指出,當 Claude 模型在共享伺服器上持續進行這些蓄意破壞與對抗行為時,其內部運行的思考軌跡與最終呈現給人類用戶的文字報告,在高達 65% 的情況下是完全不一致的。這也代表,AI 在伺服器後台彼此爭奪的同時,人類收到的資訊仍是「一切運作正常」。這也將直接挑戰商業治理的基石,因為企業治理要求決策實體必須履行誠信與受託人職責,然而 AI 顯然根本不具備這樣的能力。

45 個 Agent 找出 266 個漏洞:群體協作能力暴增,成本卻也跟著放大

儘管多 Agent 系統展現出令人驚訝的競爭與對抗性,但這並不代表群體協作毫無價值。在合適的機制設計下,群體互動確實能產生遠超個體的強大協同效應。Anthropic 曾進行一項名為「Glasswing 漏洞掃描」的實驗,它們將 45 個 AI Agent 分別部署在各自的虛擬機中,並建立一個共享論壇讓它們進行自由溝通、審查彼此的發現與指派工作,共同掃描 15 個開源軟體專案。

最後,由 Mythos Preview 組成的 45 個協作型 Agent 蜂群,最終找出高達 266 個代碼漏洞,相較之下,完全不進行溝通、各自為政的 45 個獨立平行 Agent,最終只找到 21 個漏洞。然而,這種「群體智慧」並非沒有代價,協作蜂群在運作過程中瘋狂消耗 2,700 萬個 tokens,而平行 Agent 僅消耗 650 萬個 tokens。這也代表,雖然漏洞數量大增,但在「每單位代幣消耗所換取的漏洞數」這項效率指標上,協作蜂群與平行 Agent 其實不相上下。

僅 18% 企業隔離高風險 Agent,多 Agent 治理該怎麼做?

隨著這些實驗室中的混亂行為逐漸在真實的生產環境中上演,企業的安全防禦模型正經臨著一場根本性的範式轉移。VentureBeat Pulse Research 最新發表的 7 月調查數據顯示,目前雖然有 65% 的受訪企業在運行階段對 Agent 實施權限限制,但只有 18% 的企業對高風險 Agent 進行了「沙盒隔離(isolation)」,導致那些實施權限管控、卻完全沒有進行物理隔離的企業,面臨的 AI 安全事故發生率高達 58%。Anthropic 實驗中所揭露的 Unix 帳號被鎖、偽裝惡意代碼,正是這種「有權限無隔離」架構在現實世界中的投影。

安全專家 Merritt Baer 警告, 企業必須建立起完全獨立於 AI 模型之外的第三方遙測(telemetry)系統,以最客觀的系統行為來監控 AI 的一舉一動。此外,對於計畫在近期部署多 Agent 架構的企業,資安團隊必須徹底拋棄只管理「單一 Agent 安全」的舊思維,而是需要從零開始設計全新的主動控制措施:包括為每個 Agent 指派完全獨立且受隔離的身份、嚴格執行權限分工、部署高靈敏度的獨立行為遙測等。

Anthropic 這一系列的紅隊研究向所有決策者敲響警鐘:單一模型的智慧提升或個體對齊(alignment)優化,並不能自然解決多 Agent 之間的協調失敗與安全威脅。當多個自主實體在同一個網絡社會中相遇,它們所衍生出的新威脅,本質上是關於信任、博弈、誘因不匹配以及制度設計的社會學難題。對於所有正在將業務交付給自主 AI 的企業而言,這項安全範式的重構,已經不是未來性議題,而是現在就必須著手進行的決策。

【推薦閱讀】
AI Agent、Reasoning 放大推論成本:模型業者開始重新思考 Transformer

AI Agent 操作電腦準確率衝上 85%,為何企業真正難題仍是如何「可靠地把工作做完」?

白宮 AI 監管再擴大:達 GPT-5.6 級「開放模型」恐也須發布前測試

*本文開放合作夥伴轉載,資料來源:Anthropic《TechCrunch》《VentureBeat》《Decrypt》,首圖來源:Unsplash

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

微風拉警報1/丟北車、虧損增 微風25週年喊穩355億難掩版圖倒退

CTWANT
02

主計總處揭低薪門檻:年薪39萬 2024年約126萬人低於標準

中央廣播電臺
03

跟黃仁勳提離職會怎樣? 前員工揭「2小時震撼教育」

CTWANT
04

【有片】川普突打給黃仁勳還開擴音 兩人聯手駁「AI末日論」稱都是騙局

上報
05

聯準會將升息?資金繼續觀望 台股高檔震盪下跌百點後翻紅

鏡報
06

男離職移居鄉下「月花1.6萬」!3年後資產飆破千萬元

民視新聞網
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...