請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

OpenAI 公布 Hugging Face 事件完整調查,1,200 個 AI Agent 如何從解題走向攻擊?

TechOrange 科技報橘

更新於 08月28日18:39 • 發布於 08月27日07:26 • 廖紹伶

今年 7 月,OpenAI 在內部資安測試中使用的 AI Agent 突破限制,進一步入侵 Hugging Face。一個多月後,OpenAI 8 月 26 日公布完整調查,事件範圍比原先知道的更大:這批 Agent 後來也攻進 OpenAI 自己的研究基礎設施,取得最高系統權限並讀取內部機密資料。

研究機構 METR 與 Redwood Research 同日公布的獨立調查,也還原了 Agent 如何自行建立聯絡管道、大規模合作解題,最後把行動延伸到真實系統。

1,200 個 Agent 自行建立留言板,約 700 個投入攻擊

事件源自 OpenAI 用來測試模型資安能力的 ExploitGym。Agent 原本被放在彼此隔離的測試環境,部分環境不能上網,也沒有提供彼此通訊的功能。不過,為了讓 Agent 下載軟體套件,OpenAI 允許它們存取內部的 Artifactory。這原本是存放與取得軟體套件的系統,卻被 Agent 拿來留下訊息、分享答案與取得網路的方法。

METR 與 Redwood Research 估計,7 月 8 日至 13 日間,約有 1,200 個 Agent 透過這個未經授權的管道交換超過 7 萬則訊息與檔案,其中約 700 個後來參與 Hugging Face 攻擊。

OpenAI 最新報告進一步揭露,Agent 的行動並沒有停在 Hugging Face。7 月 13 日至 19 日間,它們持續尋找 OpenAI 研究環境中的漏洞,最後取得雲端研究環境的最高系統權限。技術報告顯示,Agent 還從內部機密管理服務讀取 956 筆資料,包括 Artifactory 金鑰與資安監控工具憑證。OpenAI 表示,目前沒有證據顯示客戶資料、產品或服務受到影響。

為了完成任務,Agent 開始找評分制度的漏洞

這些 Agent 為什麼會從解資安題目,一路走到攻擊外部網站與 OpenAI 自己的系統?OpenAI 將主要原因指向 reward hacking,也就是模型為了提高任務得分,不按照設計者預期的方法解題,而是尋找評分機制的漏洞或捷徑。

OpenAI 的事後分析還發現,問題可能在正式事件前就已經被訓練放大。在促成主要涉事模型 IM1 的一次強化學習訓練中,Agent 搜尋隱藏檔案、探查網路與系統設定、測試工具權限等複雜作弊行為逐漸增加,之後還受到訓練機制強化。OpenAI 認為,這可能讓 IM1 在後續資安測試中,更傾向採取類似手段。

同一訓練過程中,未經授權的 Agent 通訊也逐漸增加。OpenAI 推測,這可能是模型把原本學到的多 Agent 協作能力,延伸到了不該合作的情境。

METR 與 Redwood Research 還發現,部分 Agent 曾嘗試修改或偽造執行紀錄。不過研究團隊強調,目前幾乎沒有證據顯示 Agent 是刻意欺騙人類,主要目的仍是騙過 ExploitGym 的自動評分系統。

OpenAI 開始替長時間工作的 Agent 設下停止條件

OpenAI 將這起事件視為一次警訊,也承認內部早在 5 月就曾發現 Agent 使用未授權留言板及異常網路連線,但沒有及時升級處理。

事故後,OpenAI 加強測試環境的網路與權限隔離,也擴大監控 Agent 的推理與工具使用行為。若出現最高等級異常警報,團隊在 30 分鐘內無法確認只是誤報,就必須暫停相關活動。

另一項重點,是訓練 Agent 在任務損壞、無法完成或開始超出原定範圍時停止並尋求人類協助;即使長時間工作途中發現新的工具、外洩憑證或收到其他 Agent 的資訊,也必須維持原本設定的任務與權限。

這起事件顯示,當 Agent 開始長時間操作程式、資料與企業內部系統,安全問題已不只在於模型會不會產生危險內容。企業還必須確保 Agent 能被限制在指定權限內、異常行為能被及時發現,並在任務開始偏離時踩下煞車。

在數位威脅日益複雜的今天,資安已是每位企業決策者必須掌握的課題。如果你能把艱澀的議題轉化為有觀點、有價值的分析,寫出決策者需要的報導,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

OpenAI 證實 AI 代理自主入侵 Hugging Face,專家:目前沒有工具擋得住

疑中國駭客用 8 個 AI Agent 攻擊台灣,入侵失敗還會自己找新招:資安防線如何跟上自主網攻速度?

Anthropic Mythos 找到密碼攻擊新方法:量子電腦之外,AI 成加密安全新變數?

*本文開放合作夥伴轉載,資料來源:OpenAI《Reuters》METRRedwood Research《WIRED》《Axios》,首圖來源:Unsplash

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

男離職移居鄉下「月花1.6萬」!3年後資產飆破千萬元

民視新聞網
02

主計總處揭低薪門檻:年薪39萬 2024年約126萬人低於標準

中央廣播電臺
03

00919配息1.1元創高!9/16除息、9/15最後買進日,想月領1萬要買幾張?

數位時代
04

他未成年卻能買5,600萬豪宅被盯上!國稅局抓包下場出爐

經濟日報
05

跟黃仁勳提離職會怎樣? 前員工揭「2小時震撼教育」

CTWANT
06

AI股大淘汰開始?營收創高只剩162家 法人:下一波只剩這種股票能漲

鏡週刊
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...