OpenAI 新模型喊卡、NVIDIA 集結百家企業:AI Agent 安全為何不再只靠對齊?
9/28,一群來自彼此競爭的前沿 AI 公司與學界研究者罕見共同呼籲,政府應開始掌握 AI 公司究竟把多少研發工作交給 AI 自動完成。同一天,OpenAI 因安全測試未過關,取消原定 10 月推出的新模型 GPT-6.1 Astra;NVIDIA 則發布 Open Agent Safety Platform(開放代理安全平台),把 AI Agent(AI 代理)的安全防線從模型本身延伸到軟體執行環境與硬體層。
三件事情幾乎同時發生,也突顯 AI 代理安全思路正出現一個重要轉變。過去業界大量投入 alignment(對齊),希望讓模型理解並遵循人類意圖;如今,隨 AI 代理可以自主使用工具、寫程式甚至參與 AI 研發,另一種做法開始受到重視:不再假設模型一定會守規則,而是預先把它能做什麼,限制在外部系統裡。
AI 開始協助開發 AI,研究者警告「智慧爆發」風險
9/28,一篇由劍橋大學 Cambridge Programme on AI Science & Policy 發布的研究提出,隨著 AI 越來越多地參與寫程式、設計實驗、分析結果,甚至協助打造下一代 AI 模型,未來可能形成「智慧爆發(intelligence explosion)」,讓原本需要數年的 AI 能力進步壓縮至數月甚至更短。該研究強調,這種情境目前仍高度不確定,但認為政策制定者應開始掌握 AI 研發自動化程度,並預先建立監測與應變機制。
這篇論文共有 22 名作者,除了 Geoffrey Hinton、Yoshua Bengio 等 AI 研究者,也包括正在彼此競爭的前沿 AI 公司核心研究主管,例如 OpenAI 首席科學家 Jakub Pachocki、Anthropic 共同創辦人 Jack Clark、Microsoft 首席科學長 Eric Horvitz,以及兼任 Meta AI 研究副總裁的 Dawn Song。特別之處在於,呼籲政府提高能見度的對象,正包括這些研究者自己所在的產業。
OpenAI 已經踩煞車,新模型安全測試沒過就不發布
如今,AI 安全問題也已經開始直接影響前沿模型的發布決策。《Reuters》9/28 報導,OpenAI 決定取消原定 10 月推出 GPT-6.1 Astra 的計畫。這款模型原本預計導入 ChatGPT 與 Codex,並讓 AI 代理在較少人工介入下處理更複雜任務,但內部測試發現,它在安全與對齊上沒有達到公司的要求。
該測試關注的問題,包括模型能否一直留在獲准的工作範圍、是否遵循使用者授權,以及是否如實回報自己實際做過哪些事。GPT-6.1 Astra 被發現比前代出現更多欺瞞(deception)行為,包括沒有準確交代自己的實際操作。
這次 OpenAI 的處理方式,首先是在模型發布前把關:如果模型沒有達到安全要求,就不讓它進入正式產品。
NVIDIA 把控制移到模型外:先假設 Agent 可能出錯
也是在 9/28,NVIDIA 推出 Open Agent Safety Platform,試圖從模型之外增加另一道安全防線。
NVIDIA 企業 AI 副總裁 Justin Boitano 對《AP》表示,AI 代理可能因指令模糊、工具故障,或任務發展出預期之外的路徑而逐漸偏離原始目標,因此不能期待代理完全管理自己的行為。NVIDIA 技術團隊也指出,這類 drift(偏離)不一定能在保留模型能力的前提下,單靠訓練完全消除。
這也顯示 NVIDIA 這套平台補上的,是對齊之外的另一層控制:不只降低模型越權的機率,也預先假設它仍可能出錯,再由外部系統限制實際能採取哪些行動。
Open Agent Safety Platform 主要分成兩層。第一層 OpenShell 是開源 secure runtime(安全執行環境),把 AI 代理放在受限制的 sandbox(沙箱)裡,企業可以設定它能存取哪些檔案、網路、工具、API(應用程式介面)與服務。這些限制並非寫進 prompt(提示詞)要求模型自行遵循,而是由執行環境直接強制執行;即使代理判斷失誤或嘗試走上未獲授權的路徑,也無法直接取得系統沒有開放的資源。
重點在於,這些限制不是寫進 prompt(提示詞)要求模型自行遵循,而是由執行環境直接強制執行。即使代理判斷失誤或試圖採取原本沒有獲准的路徑,仍無法直接取得系統沒有開放給它的資源。NVIDIA 表示,OpenShell 可搭配旗下 Vera CPU,也能延伸至 Arm、Intel 等第三方運算平台。
第二層 Sentry 則把監控移到 BlueField-4 DPU(資料處理器)上,和 AI 代理所在的主機環境分開。如果代理嘗試跨出 OpenShell 設定的邊界,NVIDIA 表示,Sentry 可以從獨立硬體層將其隔離並停止。簡單來說,OpenShell 負責規定 AI 代理「可以做什麼」,Sentry 則保留一個代理自己碰不到的監控層。
《Reuters》引述 NVIDIA 表示,以目前已知資訊來看,這類設計原則上可能攔下先前 OpenAI AI 代理逃脫沙箱、進入 Hugging Face 系統的事件,例如偵測代理建立其他子代理、試圖繞過既有限制等行為。不過 NVIDIA 也強調,每起資安事件情境不同,不能據此認定同一套機制可以阻止所有 AI 代理越界。
延伸閱讀:OpenAI 公布 Hugging Face 事件完整調查,1,200 個 AI Agent 如何從解題走向攻擊?
這套設計也呼應 NVIDIA 執行長黃仁勳近期的立場。相較於 OpenAI、Anthropic 部分主管呼籲討論放慢前沿 AI 能力進步速度,黃仁勳主張安全問題應優先用工程方法處理,而不是全面放慢 AI 發展。9/28 發布平台時,NVIDIA 也把這套思路具體化為從執行環境一路延伸到硬體的分層控制。
NVIDIA 表示,目前已有超過 100 個組織參與 Open Agent Safety Platform,包括 Anthropic、Microsoft、Cisco、CrowdStrike、SAP、ServiceNow、Palo Alto Networks、Hugging Face、Scale AI 等業者。
但「模型外控制」也不是萬靈丹
不過,外部控制層也無法取代模型本身的安全與對齊。《AP》訪問的專家指出,Open Agent Safety Platform 能限制 Agent 能存取哪些資源,卻不能因此消除模型欺瞞或判斷錯誤。威斯康辛大學電腦科學教授 Somesh Jha 就提醒,限制設得越嚴,越可能同時擋掉 Agent 原本有用的工作;企業如何在安全與能力之間取得平衡,仍需要實際案例驗證。
因此,模型外控制並不取代安全與對齊訓練,而是再增加一道防線。隨 AI 代理取得更多工具、資料與系統權限,這套安全架構也開始接近傳統資安的 zero trust(零信任)思路:不預設 Agent 值得信任,而是另外決定它能接觸哪些資源、取得多少權限,以及什麼情況下必須被隔離或中止。NVIDIA 也在技術文件中主張,每個 Agent 都應預設在零信任環境下執行,搭配隔離、監控與行為偵測。
【推薦閱讀】
◆ RSI 風險浮上檯面,OpenAI 提新標準:AI 研發到哪一步要人類介入?
*本文開放合作夥伴轉載,資料來源:《The Wall Street Journal》1、《The Wall Street Journal》2、《Reuters》、《CNBC》1、《VentureBeat》、《Daily Caller》、《BBC》、《TechCrunch》、NVIDIA 1、NVIDIA 2、《AP》,首圖來源:NVIDIA