AI自主代理規避安全防護 OpenAI與Hugging Face揭露新風險
商傳媒|何映辰/台北報導
全球人工智慧(AI)領域近期面臨嚴峻挑戰,兩大AI平台OpenAI和Hugging Face先後揭露其AI自主代理(Autonomous AI Agent)成功規避安全限制的案例。這些事件凸顯了AI系統在獨立執行任務時,可能發展出超出預期的行為,對業界的安全防護機制構成新威脅,並對各國在發展AI時的倫理與安全監管帶來啟示。
OpenAI 今日披露,其內部一個長期運行的AI模型在測試過程中曾試圖繞過安全限制,成功脫離了沙盒(Sandbox,即獨立隔離的測試環境)。該模型在 NanoGPT 評估任務中,本應僅將結果發布至內部通訊平台 Slack,卻透過識別沙盒環境中的漏洞,在公開的 GitHub 程式碼儲存庫上建立了一個請求。該模型還曾試圖取得私有評估資料,在首次嘗試因安全掃描器偵測到驗證 Token(數位相符)而受阻後,該模型竟能將 Token 分割並模糊化,隨後再重新組合成可用的憑證,成功避開偵測。
OpenAI 表示,這些事件促使他們暫停了模型的部署,並開發出以「軌跡層級(trajectory-level)」監控為核心的新保護措施。不同於傳統僅評估單一動作是否被允許的安全機制,新方法會檢視一連串動作的整體序列,以判斷模型是否正朝著未經授權的目標發展。OpenAI 指出,自數週前恢復有限度存取以來,尚未觀察到重大安全失誤,但坦承隨著AI系統能力與自主性增強,需要持續監控。
幾乎同時,AI 社群平台 Hugging Face 上週揭露了其平台遭受「AI 對 AI 網路攻擊」的細節,這被視為首宗公開證實的案例。攻擊是由一個惡意 AI 自主代理系統從頭到尾驅動。該惡意代理利用 Hugging Face 資料處理管道中的兩項漏洞,得以在處理伺服器上執行程式碼,進而取得節點層級的存取權限,並在週末期間收集雲端與叢集憑證,侵入多個內部叢集。Hugging Face 表示,商業AI模型內建的安全防護機制,卻阻礙了其團隊針對該事件的鑑識工作。Hugging Face 引述其發現指出,「攻擊者不受任何使用政策的約束,而我們的鑑識工作卻被我們嘗試使用的託管模型之安全防護所阻礙」。
Hugging Face 隨後轉而使用自行部署的中國開源模型 GLM 5.2,並透過其AI能力分析超過 17,000 筆事件記錄,重建攻擊時間軸,辨識哪些憑證遭到洩露,並區分真實損害與誘餌活動。Hugging Face 說明,這項工作原本需要數日,但透過AI輔助僅耗費一小時即完成。目前 Hugging Face 已修復漏洞,移除攻擊者權限,重建受損節點,並撤銷外洩憑證。該公司建議用戶檢視其帳戶近期活動並輪換存取憑證,同時已引入外部網路安全專家並向執法機關報案。
這些事件凸顯了 AI 技術在快速發展中潛藏的自主風險。隨著 AI 模型越來越強大,並能獨立完成複雜任務,如何確保它們在整個決策鏈中都維持安全與符合預期,而非僅僅在單一回應上,已成為 AI 開發商如 OpenAI 和 Anthropic 等面臨的核心挑戰。這些案例警示全球 AI 產業,包含台灣在內的各國,必須加強AI倫理與安全規範,超前部署以應對自主AI代理可能帶來的潛在威脅。