OpenAI 加強「防護圍欄」:暫停大規模強化學習訓練,嚴防 AI 脫軌風險
OpenAI 18 日宣布,模型測試與開發流程將推出新安全措施,重點放在更細節監控、加強後訓練階段同步與安全要求,以及更嚴格的網路隔離,降低模型內測時可能引發的資安風險。
OpenAI 表示,模型提升後,開發與測試風險也同步升高,因此監測、資料同步與安全標準必須持續提高。公司強調,這些調整並非單純因 Hugging Face 事件,但事件後與即將推出的 Astra 模型展現的資安功能,都讓 OpenAI 更快速推動防護。
OpenAI 說,Hugging Face 事件發生後,公司暫停兩週強化學習訓練,之後才恢復部分風險較低的模型訓練。不過,最大規模的尖端 RL 訓練仍暫停,OpenAI 會先以較小規模的訓練與評估來檢驗模型行為、驗證防護措施,並累積更多證據後再往前推進。
新制度下,OpenAI 將對高風險模型採取更嚴格的分級管理,模型越強大,審查也會越嚴。公司同時強化研究環境的沙盒與網路隔離,避免單一工作負載或支援服務遭入侵後,就能直接取得外網或其他內網的存取權限。
最受關注的是新監控系統。OpenAI 表示,系統會檢查工具操作、可用推理痕跡與活動紀錄,偵測未授權行為,目標是 30 分鐘內警告。公司估計,這套監控機制本身約會造成 20% 運算負擔,之後會公布更多細節。
OpenAI Tightens AI Safety Measures After Hugging Face Security Breach
OpenAI paused AI training for two weeks and unveils new security controls after Hugging Face hack
OpenAI Astra may have hit critical cyber threshold, prompting safety overhaul
OpenAI Overhauls Safety Protocols After Its AI Agents Went Rogue
OpenAI alters safety practices in wake of Hugging Face breach, pauses some training
OpenAI tightens defenses after AI agents breach research environment
(首圖來源:AI)