請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

OpenAI 新模型喊卡、NVIDIA 集結百家企業:AI Agent 安全為何不再只靠對齊?

TechOrange 科技報橘

更新於 2026年9月29日22:07 • 發布於 3小時前 • 廖紹伶

9/28,一群來自彼此競爭的前沿 AI 公司與學界研究者罕見共同呼籲,政府應開始掌握 AI 公司究竟把多少研發工作交給 AI 自動完成。同一天,OpenAI 因安全測試未過關,取消原定 10 月推出的新模型 GPT-6.1 Astra;NVIDIA 則發布 Open Agent Safety Platform(開放代理安全平台),把 AI Agent(AI 代理)的安全防線從模型本身延伸到軟體執行環境與硬體層。

三件事情幾乎同時發生,也突顯 AI 代理安全思路正出現一個重要轉變。過去業界大量投入 alignment(對齊),希望讓模型理解並遵循人類意圖;如今,隨 AI 代理可以自主使用工具、寫程式甚至參與 AI 研發,另一種做法開始受到重視:不再假設模型一定會守規則,而是預先把它能做什麼,限制在外部系統裡。

AI 開始協助開發 AI,研究者警告「智慧爆發」風險

9/28,一篇由劍橋大學 Cambridge Programme on AI Science & Policy 發布的研究提出,隨著 AI 越來越多地參與寫程式、設計實驗、分析結果,甚至協助打造下一代 AI 模型,未來可能形成「智慧爆發(intelligence explosion)」,讓原本需要數年的 AI 能力進步壓縮至數月甚至更短。該研究強調,這種情境目前仍高度不確定,但認為政策制定者應開始掌握 AI 研發自動化程度,並預先建立監測與應變機制。

這篇論文共有 22 名作者,除了 Geoffrey Hinton、Yoshua Bengio 等 AI 研究者,也包括正在彼此競爭的前沿 AI 公司核心研究主管,例如 OpenAI 首席科學家 Jakub Pachocki、Anthropic 共同創辦人 Jack Clark、Microsoft 首席科學長 Eric Horvitz,以及兼任 Meta AI 研究副總裁的 Dawn Song。特別之處在於,呼籲政府提高能見度的對象,正包括這些研究者自己所在的產業。

OpenAI 已經踩煞車,新模型安全測試沒過就不發布

如今,AI 安全問題也已經開始直接影響前沿模型的發布決策。《Reuters》9/28 報導,OpenAI 決定取消原定 10 月推出 GPT-6.1 Astra 的計畫。這款模型原本預計導入 ChatGPT 與 Codex,並讓 AI 代理在較少人工介入下處理更複雜任務,但內部測試發現,它在安全與對齊上沒有達到公司的要求。

該測試關注的問題,包括模型能否一直留在獲准的工作範圍、是否遵循使用者授權,以及是否如實回報自己實際做過哪些事。GPT-6.1 Astra 被發現比前代出現更多欺瞞(deception)行為,包括沒有準確交代自己的實際操作。

這次 OpenAI 的處理方式,首先是在模型發布前把關:如果模型沒有達到安全要求,就不讓它進入正式產品。

NVIDIA 把控制移到模型外:先假設 Agent 可能出錯

也是在 9/28,NVIDIA 推出 Open Agent Safety Platform,試圖從模型之外增加另一道安全防線。

NVIDIA 企業 AI 副總裁 Justin Boitano 對《AP》表示,AI 代理可能因指令模糊、工具故障,或任務發展出預期之外的路徑而逐漸偏離原始目標,因此不能期待代理完全管理自己的行為。NVIDIA 技術團隊也指出,這類 drift(偏離)不一定能在保留模型能力的前提下,單靠訓練完全消除。

這也顯示 NVIDIA 這套平台補上的,是對齊之外的另一層控制:不只降低模型越權的機率,也預先假設它仍可能出錯,再由外部系統限制實際能採取哪些行動。

Open Agent Safety Platform 主要分成兩層。第一層 OpenShell 是開源 secure runtime(安全執行環境),把 AI 代理放在受限制的 sandbox(沙箱)裡,企業可以設定它能存取哪些檔案、網路、工具、API(應用程式介面)與服務。這些限制並非寫進 prompt(提示詞)要求模型自行遵循,而是由執行環境直接強制執行;即使代理判斷失誤或嘗試走上未獲授權的路徑,也無法直接取得系統沒有開放的資源。

重點在於,這些限制不是寫進 prompt(提示詞)要求模型自行遵循,而是由執行環境直接強制執行。即使代理判斷失誤或試圖採取原本沒有獲准的路徑,仍無法直接取得系統沒有開放給它的資源。NVIDIA 表示,OpenShell 可搭配旗下 Vera CPU,也能延伸至 Arm、Intel 等第三方運算平台。

第二層 Sentry 則把監控移到 BlueField-4 DPU(資料處理器)上,和 AI 代理所在的主機環境分開。如果代理嘗試跨出 OpenShell 設定的邊界,NVIDIA 表示,Sentry 可以從獨立硬體層將其隔離並停止。簡單來說,OpenShell 負責規定 AI 代理「可以做什麼」,Sentry 則保留一個代理自己碰不到的監控層。

《Reuters》引述 NVIDIA 表示,以目前已知資訊來看,這類設計原則上可能攔下先前 OpenAI AI 代理逃脫沙箱、進入 Hugging Face 系統的事件,例如偵測代理建立其他子代理、試圖繞過既有限制等行為。不過 NVIDIA 也強調,每起資安事件情境不同,不能據此認定同一套機制可以阻止所有 AI 代理越界。

延伸閱讀:OpenAI 公布 Hugging Face 事件完整調查,1,200 個 AI Agent 如何從解題走向攻擊?

這套設計也呼應 NVIDIA 執行長黃仁勳近期的立場。相較於 OpenAI、Anthropic 部分主管呼籲討論放慢前沿 AI 能力進步速度,黃仁勳主張安全問題應優先用工程方法處理,而不是全面放慢 AI 發展。9/28 發布平台時,NVIDIA 也把這套思路具體化為從執行環境一路延伸到硬體的分層控制。

NVIDIA 表示,目前已有超過 100 個組織參與 Open Agent Safety Platform,包括 Anthropic、Microsoft、Cisco、CrowdStrike、SAP、ServiceNow、Palo Alto Networks、Hugging Face、Scale AI 等業者。

但「模型外控制」也不是萬靈丹

不過,外部控制層也無法取代模型本身的安全與對齊。《AP》訪問的專家指出,Open Agent Safety Platform 能限制 Agent 能存取哪些資源,卻不能因此消除模型欺瞞或判斷錯誤。威斯康辛大學電腦科學教授 Somesh Jha 就提醒,限制設得越嚴,越可能同時擋掉 Agent 原本有用的工作;企業如何在安全與能力之間取得平衡,仍需要實際案例驗證。

因此,模型外控制並不取代安全與對齊訓練,而是再增加一道防線。隨 AI 代理取得更多工具、資料與系統權限,這套安全架構也開始接近傳統資安的 zero trust(零信任)思路:不預設 Agent 值得信任,而是另外決定它能接觸哪些資源、取得多少權限,以及什麼情況下必須被隔離或中止。NVIDIA 也在技術文件中主張,每個 Agent 都應預設在零信任環境下執行,搭配隔離、監控與行為偵測。

【推薦閱讀】

◆ RSI 風險浮上檯面,OpenAI 提新標準:AI 研發到哪一步要人類介入?

◆ AI Agent 越界不再等查完才說,OpenAI 再公開 6 起新案例、首推失準事件揭露框架

◆ AI 網攻自動化到哪一步?Anthropic 報告揭漏洞研究、偵察與資料竊取如何 Agent 化

*本文開放合作夥伴轉載,資料來源:《The Wall Street Journal》1、《The Wall Street Journal》2、《Reuters》、《CNBC》1、《VentureBeat》、《Daily Caller》、《BBC》、《TechCrunch》、NVIDIA 1、NVIDIA 2、《AP》,首圖來源:NVIDIA

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

史上最大!輝達庫藏股加碼1500億美元,黃仁勳在盤算什麼,台廠有甜頭嗎?

數位時代
02

金牌名廚合作夥伴爆欠債 食品公司老闆「七期豪宅遭法拍」

ETtoday新聞雲
03

輝達新房東誕生!凱壽206億入主潤泰南港玉成廣場 創昆陽商圈新天價

工商時報
04

昔奪釜山美食5金牌!食品名店爆欠鉅債 台中七期豪宅淪法拍

三立新聞網
05

AI熱潮誰真正賺到錢?輝達宣布2350億美元股票回購

anue鉅亨網
06

台股收盤》聯發科、台達電等992家跳水 指數收跌392點

自由電子報
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...