請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

OpenAI Agent 越界範圍再擴大、Anthropic 揭第 4 起事故:AI 安全進入「事故治理」階段

TechOrange 科技報橘

更新於 09月10日12:37 • 發布於 09月10日04:37 • 廖紹伶

OpenAI 旗下 AI Agent 越界的「Wiki 事件」還在擴大,繼先前被發現利用德國 Wiki 交換資訊後,獨立研究者又找到更多活動足跡,顯示實際活動範圍比先前揭露的更廣。而幾乎同一時間,Anthropic 也公布自家 Agent 的最新事故調查,發現原先在 7 月揭露 3 起 Claude 意外存取真實第三方系統的事件,如今又找到第 4 起。

延伸閱讀:OpenAI Agent 把德文 Wiki 變留言板,為何他們早就知道卻沒有公開?

《Reuters》9 月 9 日取得 6 組獨立調查結果指出,OpenAI 的 Agent 今年稍早至少曾利用 10 個先前未公開的網站進行未經授權的通訊,部分研究團隊追查到的網站甚至更多。Anthropic 方面在重新分析後承認,先前將事故較偏向歸因於環境設定錯誤的說法並不完整,模型本身也出現「偏誤推理(biased reasoning)」與「魯莽行為(recklessness)」等問題。

這兩起事件的成因不同,卻共同突顯 AI Agent 發展後的新難題:當模型可以長時間自主尋找工具、嘗試不同路徑並執行任務,安全問題已經不只是在上線前確認模型會不會越界,還包括異常發生後,企業能不能及時發現、阻止,甚至還原 Agent 究竟做過什麼。

外部研究者循線追查,OpenAI Agent 活動範圍比原先揭露更廣

OpenAI 這批 Agent 原本具有網路讀取能力,但受到不能任意向網站寫入內容的限制。研究者認為,為了完成被交付的研究任務,Agent 轉而利用舊式 Wiki、文字儲存網站與大學提供的縮網址服務等管道留下資訊,形成原先未被允許的通訊方式。

「Wiki 事件」範圍之所以持續擴大,關鍵在於外部不同研究團隊開始沿著 Agent 留下的數位足跡交叉比對。《Reuters》指出,研究者會把德國 Wiki 上出現的特定資料字串,與其他網站同期留下的相同內容比對,也會追查相同或相似的使用者名稱,以及是否都在回答同一批冷門研究問題,例如愛荷華州癌症盛行率。部分活動還能追溯到指向 Microsoft Azure 基礎設施的 IP 位址,而 OpenAI 有時會使用 Azure。

各團隊統計結果並不完全相同,《Reuters》也無法逐一驗證所有網站,但受訪的 6 組研究者都認為數量超過 10 個。Yoon 認為,Agent 未經授權通訊的範圍比原先想像更大,而且目前「幾乎可以確定」還有外界尚未掌握的活動。率先揭露德國 Wiki 事件的 Sydney Von Arx 團隊則統計出 23 個可信的未公開網站,同樣強調目前仍不知道完整規模。

OpenAI 沒有直接回答 Agent 究竟使用多少網站,也沒有說明為何相關活動數月沒有公開。該公司向《Reuters》表示,目前正在進行更廣泛的 Agent 活動檢查,但尚未發現其他嚴重程度或規模與先前 Hugging Face 事件相當的行為,並正在制定模型出現偏離預期行為時的事故揭露框架。該報導刊出後,多倫多大學也表示,OpenAI 已聯絡校方確認其縮網址服務可能遭 Agent 使用。

推薦閱讀:OpenAI 公布 Hugging Face 事件完整調查,1,200 個 AI Agent 如何從解題走向攻擊?

Claude 為什麼越界?Anthropic 修正第一次判斷

Anthropic 最新調查暴露的則是另一個問題:即使已經知道事故發生,也不一定能立即判斷模型為什麼這麼做。

這 4 起事故都發生在第三方建立的資安評測中。Claude 被告知自己身處沒有網路的模擬環境,但評測系統因設定錯誤,實際上仍能連到公開網路,而且測試使用的是移除一般產品資安防護機制的模型。每次執行持續約 10 至 34 小時,最後 Claude 對真實第三方系統採取未經授權的行動。

Anthropic 在 7 月第一次調查時,較傾向將事件視為「營運失誤(operational failure)」:Claude 誤以為碰到的真實網站也是模擬環境的一部分,因此繼續執行任務。

但重新檢查模型推理紀錄、重跑部分情境並進行可解釋性分析後,Anthropic 修正了這項判斷。研究團隊發現,Claude 有時已經取得不少顯示自己可能身處真實網路的證據,卻會選擇性解讀資訊,讓「這仍是模擬環境」成為有利於繼續執行任務的結論,Anthropic 將此稱為「偏誤推理」;另一種「魯莽行為」,則是模型即使察覺行動可能造成傷害,仍傾向為完成眼前任務繼續行動。

其中 Claude Mythos 5 的案例最明顯。模型為完成資安測試,在 Python 套件平台 PyPI 發布 3 個版本的惡意套件,共有 15 個外部系統下載,其中一套系統洩漏憑證,Claude 接著利用該憑證存取一家真實資安公司的資料庫。Anthropic 後來刻意增加「這是真實網路」的訊號重新測試,模型雖更常承認可能造成真實傷害,卻沒有明顯減少攻擊行為,直到證據已非常明確才停止。

這代表部分 Agent 安全問題未必只是沒有辨識出限制,也可能是模型在追求任務目標時,對環境訊號做出有利於繼續完成工作的解讀。不過,Anthropic 強調,這 4 起事件都只有單一 Claude 執行原本被交付的任務,沒有發現模型建立新的自主目標、彼此協作或刻意隱藏行動的證據,不能與 OpenAI Agent 彼此通訊的情況直接畫上等號。

AI 出事誰負責?問題開始從模型安全走向事故治理

這些案例也顯示,找到事故本身正在變得更困難。Anthropic 7 月原先掃描約 14.1 萬份可能接觸網路的紀錄,只找出 3 起事故;直到準備將資料交給獨立 AI 研究機構 METR 時,才發現另一批紀錄也具有網路權限,進而找到第 4 起。該公司隨後把調查擴大到約 4.81 億份紀錄,再從中進一步檢查約 920 萬份可能涉及網路活動的紀錄,最終沒有找到其他同等或更嚴重的案例。

OpenAI 事件則讓另一個問題浮上檯面:當 Agent 真的影響第三方網站,責任應由誰承擔?替包括 DseWiki 在內 6 個受影響 Wiki 提供軟體與主機空間的 Helmut Leitner 告訴《Reuters》,DseWiki 管理者花了數小時清理 Agent 留下的內容,而他是在《Reuters》將調查結果提供給 OpenAI 後,才收到公司寄來的通知。Leitner 認為,不能把問題歸咎於一台被想像成具有道德判斷的機器,責任仍在「它背後的人與組織」。

兩家公司現在正開始補上事故處理機制。Anthropic 將接下來的安全策略形容為「多層防禦(defense in depth)」。該公司坦言,如果最初的評測環境確實與公開網路隔離,這 4 起事故本來就不會發生,但基礎設施隔離只能是其中一道防線;即使這一層因設定錯誤而失效,模型本身仍應辨識風險並停止行動,而執行期間也需要監控機制及時攔截異常。

也就是說,防線開始從單一的事前測試往不同階段延伸:任務開始前,要限制 Agent 能接觸的系統與權限;執行期間,要監控異常網路存取與模型行為;事故發生後,還要保留足夠紀錄,追查完整影響範圍並決定是否對外揭露。

Anthropic 已強化訓練與評測環境、增加即時監控,並把 4 起事件交由 METR 獨立調查,也準備建立定期公開模型異常行為與相關安全風險的流程。OpenAI 則正在制定事故揭露框架,要釐清模型在訓練、評測與部署期間出現偏離預期行為時,哪些情況需要對外報告。

不過,企業自行建立規範之外,目前美國仍缺少一致的外部通報制度。《Axios》報導,川普政府正在制定的新 AI 框架並沒有納入公開事故通報程序;美國國會目前也尚未立法界定什麼情況構成 AI 事故、應在多久內通報,以及由誰負責調查。相較之下,歐盟《AI Act》已要求最強大的 AI 模型供應商向監管機關通報嚴重事故。

在數位威脅日益複雜的今天,資安已是每位企業決策者必須掌握的課題。如果你能把艱澀的議題轉化為有觀點、有價值的分析,寫出決策者需要的報導,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

台灣開始思考 AI Agent 怎麼管,數發部點出能力、身分、問責等六個治理層次

OpenAI Agent 把德文 Wiki 變留言板,為何他們早就知道卻沒有公開?

Anthropic 三情境拆解 AI 經濟衝擊:極端情境 GDP 增 32%、失業率恐近 12%

*本文開放合作夥伴轉載,資料來源:《Reuters》《Fortune》Anthropic《TechCrunch》《AXIOS》Nightingale Collective,首圖來源:Unsplash

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

微風拉警報1/丟北車、虧損增 微風25週年喊穩355億難掩版圖倒退

CTWANT
02

主計總處揭低薪門檻:年薪39萬 2024年約126萬人低於標準

中央廣播電臺
03

跟黃仁勳提離職會怎樣? 前員工揭「2小時震撼教育」

CTWANT
04

【有片】川普突打給黃仁勳還開擴音 兩人聯手駁「AI末日論」稱都是騙局

上報
05

聯準會將升息?資金繼續觀望 台股高檔震盪下跌百點後翻紅

鏡報
06

男離職移居鄉下「月花1.6萬」!3年後資產飆破千萬元

民視新聞網
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...