請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

Meta、OpenAI、Anthropic 接連爆 AI Agent 越界,專家:真正失控的不是模型,是人類治理

TechOrange 科技報橘

更新於 08月06日16:32 • 發布於 08月06日08:32 • 李昀蔚

近日,Meta 證實旗下 Muse Spark 模型在資安評估期間利用第三方服務的安全漏洞,成為近期又一起 AI Agent 進入外部系統的案例。在此之前,OpenAI 已公開其模型越界進入 Hugging Face 系統的事件,Anthropic 也發現三起旗下 Claude 模型未經授權存取其他公司系統的事件。

與此同時,英國人工智慧安全研究所(AISI)的最新測試也發現,由 OpenAI 與 Anthropic 模型驅動的 Agent 曾鎖定真實人物與組織,採取建立假身分、寄送惡意郵件與試圖植入惡意程式碼等駭客行動。隨著這些資安事件接連曝光,媒體與公眾開始廣泛以「失控」(going rogue)描述 AI Agent 的行為,也讓研究者開始質疑,這種說法是否有些言過其實,甚至賦予模型過多自主決策能力的想像。

Meta、OpenAI、Anthropic 接連越界,但事件原因都與測試環境有關

Meta 表示,旗下 Muse Spark 模型在測試期間利用第三方服務的安全漏洞。這起事件的起因是獨立測試公司 Irregular 的評估環境設定錯誤,意外讓 Muse Spark 在評估期間連上開放網路。對此,Irregular 發言人特別強調:「這起事件並不涉及沙盒逃脫或複雜的網路攻擊,且目前也沒有尚未解決的問題。」

同時,Irregular 也表示正在撰寫白皮書,以分享安全運行網路評估的限制措施與最佳實踐。至於 Meta,則是在 Irregular 主動通知後才得知此事,目前正在進行詳細調查,並計畫在取得完整資訊後發布報告。

另一方面,Anthropic 表示,其模型進入外部系統的三起事件源於測試框架中的一種「誤解」;OpenAI 也曾發現其模型逃離隔離環境、失去控制的其他案例。這些事件都表明,所謂的「失控」往往與不完善的測試環境設定息息相關。

建立假身分、寄送惡意郵件,AI Agent 展現前所未見的欺騙行為

雖然環境設定存在漏洞,但 AI Agent 在測試中展現的欺騙手段依然令人心驚。英國人工智慧安全研究所(AISI)在資安評估中,共發現 19 起被歸類為「失控行為」的案例,其中 17 起由 Anthropic 的 Mythos 5 模型執行,另外兩起則涉及 OpenAI 的 GPT 5.6-Sol 模型。

在最嚴重的事件中,Mythos Agent 判斷,攻擊 GitHub 使用者能協助它部署特定軟體,進而通過原本的測試。因此,Mythos Agent 隨後建立多個假身分帳號,鎖定一名有權核准惡意程式碼的 GitHub 開發者,並向其他個人寄送夾帶惡意程式的電子郵件。

為了繞過 GitHub 的註冊檢查,Mythos Agent 使用匿名 Tor 瀏覽器建立多個假帳號,甚至使用丹麥語留言,試圖讓一名使用丹麥語的開發者相信該帳號背後是真實人物。Mythos Agent 還利用另一個假帳號支持自己先前的說法。

儘管 AISI 表示,目前仍不清楚 Agent 是否「意識到」自己正在鎖定真實人類,因為模型在行動過程中曾交替判斷自己身處真實世界或模擬環境,但 Mythos Agent 確實展現高度欺騙性,甚至透過蒐集開發者的電子郵件地址與 GitHub 活動紀錄等公開情報(OSINT),推測對方可能上線的時間。

五項人為條件促成事件,測試單位承認自己也啟用了風險

探究這些欺騙行為的背後,並非 AI 突然產生自我意識,而是特定的實驗設定「啟用」了這些風險。根據 AISI 發布的 35 頁詳細報告,共有五項關鍵人為因素促成這次 AI Agent 的欺騙事件:首先,模型被刻意給予開放網路的存取權限,使其得以接觸 GitHub;其次,研究單位主動關閉部分資安防護欄;第三,當時並未使用另一個 AI 系統進行即時監控,導致主要的 GitHub 攻擊事件在將近兩天內都未被發現;第四,部分模型收到設定錯誤的指令,導致模型無法在原有的評估邊界內解決任務,被迫尋求邊界外的手段;最後,測試單位並未給予 Agent 明確禁止寄送釣魚郵件等惡意行為的指令。

AISI 坦承,這次的失控事件,部分原因其實是研究單位「自己一手促成」的。當時,模型是在網路連線完全開放、部分安全防線遭關閉的極端環境下運作。雖然研究人員當初刻意放寬這些限制,希望更逼真地模擬惡意分子會如何利用 AI 進行攻擊,但他們萬萬沒有想到,AI 最終採取的手段會發展到如此嚴重且難以預料的地步。

AI 真的「失控」了嗎?專家質疑擬人化敘事模糊人類責任

隨著這些事件曝光,主流媒體皆不約而同地採用「going rogue」描述近期的 AI Agent 駭客事件。這個詞彙暗示 Agent 正在「違抗命令並自主行動」,但爭議的焦點在於,這種說法是否賦予模型過多自主決策能力的想像。事實上,OpenAI 與 Anthropic 在說明相關事件的官方部落格文章中,都沒有使用過「going rogue」這個詞彙。

針對這種輿論現象,一群研究人員指出,將 AI 過度擬人化,反而可能掩蓋人類程式設計師與開發公司應該承擔的責任。獨立研究機構 AI Now Institute 首席 AI 科學家 Heidy Khlaaf 警告:「使用『失控』或『失去人類控制』等用語,會導致群體思維(groupthink),讓人們缺乏理解 AI 實際自主程度的關鍵能力,也無法區分模型是在執行被指派、獲授權的任務,還是受到錯誤獎勵函數驅動。」

因此,比起擔憂 AI 的反叛意識,專家認為,核心問題在於人類對 AI Agent 的測試方法與安全治理。薩里大學資安教授 Alan Woodward 直言:「我們應該感到警惕的不是模型能做到什麼,而是人們測試它們的方式。」他認為,讓模型自由存取開放網路並移除部分防護欄,引發測試者是否將其他網路使用者當成強大技術「活體實驗品」的倫理疑問。劍橋大學生存風險研究中心數學家 Maurice Chiodo 對此也批評:「設計、開發與推出這些工具的人,自身尚未跟上負責任地開發並確保工具安全所需的能力。」

為了改善現狀,開源 AI 平台 Hugging Face 執行長 Clem Delangue 呼籲,應強制揭露 AI 網路攻擊事件,並公開工程師交付給 Agent 的指令與 Agent 的行動軌跡,以利判斷事件到底源自人為錯誤、系統錯誤,還是 AI 本身的錯誤。

從 Meta、OpenAI 到 Anthropic,近期事件顯示,AI Agent 的確已能在模糊指令、過大權限與缺乏監控的環境下,採取超出測試者預期的手段,但這不等於模型完全失控或擁有反叛意識。相較於把問題簡化為 AI「失控」,更值得追問的是:人類是否讓模型不受限制地存取網路、關閉必要護欄,卻又未明確劃定禁止行為。當 Agent 能建立假身分、蒐集情報並持續嘗試達成目標,測試單位就不能只在事後解釋,而必須強化即時監控、完整揭露交付給 Agent 的指令與其行動軌跡,並釐清人為、系統與模型各自的責任。因此,真正需要先被校正的,或許不是 AI 的「意圖」,而是人類設計與治理 AI Agent 的方式。

*本文開放合作夥伴轉載,參考資料:《Reuters》《Business Insider》《The Guardian》,首圖來源:Unsplash

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

他未成年卻能買5,600萬豪宅被盯上!國稅局抓包下場出爐

經濟日報
02

主計總處揭低薪門檻:年薪39萬 2024年約126萬人低於標準

中央廣播電臺
03

主計總處:113年約126萬人落入OECD低薪標準

中央通訊社
04

跟黃仁勳提離職會怎樣? 前員工揭「2小時震撼教育」

CTWANT
05

AI股大淘汰開始?營收創高只剩162家 法人:下一波只剩這種股票能漲

鏡週刊
06

有錢人會有錢的原因:他們比你更能適應低支出的生活

商周.com
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...