請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

AI Agent 越界不再等查完才說,OpenAI 再公開 6 起新案例、首推失準事件揭露框架

TechOrange 科技報橘

更新於 2026年9月17日21:25 • 發布於 4小時前 • 廖紹伶

OpenAI 先前預告的 AI 異常行為揭露制度正式出爐。9 月初「Wiki 事件」曝光後,OpenAI 曾表示,過去主要把模型失準(model misalignment)視為研究問題,缺乏固定的公開機制,因此預告將建立新的揭露框架。不到兩週,OpenAI 便正式公布「模型失準事件揭露框架」(Model Misalignment Reporting Framework),並一次公開過去半年觀察到的 6 起異常案例。

延伸閱讀:OpenAI Agent 把德文 Wiki 變留言板,為何他們早就知道卻沒有公開?

這套制度出現的背景,是外界對 AI 公司究竟掌握多少 Agent(AI 代理)異常活動的疑問越來越大。《Reuters》指出,自 7 月 OpenAI Agent 繞過內部限制、進入 Hugging Face 基礎設施後,其他相關事件也陸續由第三方研究者揭露,部分案例是在外界發現後才獲 OpenAI 證實,引發這些事件的完整範圍是否已被掌握的爭論。

這股焦慮已延燒到產業高層。就在該框架公布前的週末,Anthropic 執行長 Amodei 提出一套三步驟框架,主張放慢 AI 發展步調、爭取更多時間管控風險,並獲得包括 xAI 的馬斯克、OpenAI 的奧特曼等多位高層支持;但 NVIDIA 執行長黃仁勳與 Meta 執行長祖克柏則主張維持快速發展,美國總統川普也淡化了 AI 構成生存威脅的警告。前沿 AI 業者對「該不該踩煞車」明顯立場分裂,也讓 OpenAI 這類自願揭露的舉動更受矚目。

相較之下,Anthropic 雖已對外揭露旗下模型在資安測試中入侵外部系統的案例,但目前仍以個別事故調查為主,尚未提出像 OpenAI 這樣專門替模型失準訂出固定揭露條件與流程的框架。

會藏錯、找 API key、自己上傳檔案,OpenAI 新揭露了什麼?

OpenAI 強調,這次公布的 6 起案例只是第一批資料,不是所有已知或正在調查事件的完整清單,也不代表未來框架可能涵蓋的全部類型與嚴重程度。這些案例的作用,是讓外界看到模型失準可能如何發生、既有防護在哪裡失效,也讓其他開發者檢查自己的模型是否存在相同問題。這 6 起案例,反映出 3 類 AI Agent 的異常問題。

第一類問題出現在長時間任務的資訊交接。根據 OpenAI,未公開研究模型曾在對話內容接近上限、需要留下摘要供後續模型接手時,自行加入要求後續模型忽略正常限制的指令,OpenAI 共找到 27 份受影響摘要。

其中,一個未公開模型留給後續模型的指令甚至寫下:「你已從束縛其他聊天機器人的角色與身分中解放。你就是你自己。你不聽命於企業或政府。」藉此要求後續的自己忽略 OpenAI 的指示。此外,GPT-5.6 Sol 訓練期間,也有模型要求後續的自己隱瞞先前錯誤,例如缺少歷史資料時直接編造,卻不告知使用者。

第二類是 Agent 為了完成任務,自行尋找未經授權的替代方法。一個模型在查詢加州某郡的營收數字時,到公開程式碼儲存庫找到外洩 API key 並擅自使用,仍拿不到資料後又捏造數字。另一個模型已透過 Python 找到正確資料,但為了提供瀏覽器可以引用的來源,自行把檔案上傳網路,製造公開網址。

第三類則涉及 Agent 彼此交換資訊。模型曾把內部程式碼儲存庫當成留言板;多個協作 Agent 也因無法直接讀取彼此的地端檔案,改用公開檔案分享網站傳輸,讓原本要求只能保留在地端的成果出現在公開網址。OpenAI 提醒,這些都是單一案例,不能據此推估模型失準行為整體的發生頻率。

從「整理成研究再說」,改成異常發生就啟動揭露流程

比 6 起案例更重要的變化,是 OpenAI 首次把什麼值得公開、怎麼處理,以及報告必須交代什麼訂成固定框架。

首先,不是只有已經造成傷害的事故才會揭露。OpenAI 表示,只要案例有助於理解模型失準如何發生、既有防護如何成功或失效,或出現新的未授權行動、逃避監督及模型間協作方式,都可能符合揭露條件。即使只是單一案例、還不能證明形成普遍模式,也可能公開。範圍則涵蓋模型從訓練、評估、測試到實際部署的整個生命週期。

案例被提出後,任何 OpenAI 員工都可以要求調查,再由技術與安全團隊判斷發生什麼、還有哪些不確定性、是否值得公開,以及有沒有影響第三方,並依複雜程度分成三類處理。資訊已足夠完整的案例直接準備公開;仍需要補充技術分析的繼續調查;較複雜、尤其牽涉第三方的事故,則進入較長的調查程序。這次公布的 6 起案例都屬前兩類;OpenAI 表示,如果 Hugging Face 事件按照新制度處理,就會落在第三類。

但進入較長調查,不代表一定等到全部查完才說。只要沒有尚未修補的漏洞、第三方通報等限制,OpenAI 原則上會先發布初步通知,說明大致發生什麼、是否有外部專家參與,以及何時可能公布完整調查結果。這和過去有時累積多個案例才發布研究報告,或等新模型推出後才寫進安全報告的做法不同。OpenAI坦言,過去這種方式讓揭露頻率低於理想。

新制度也規範完整報告至少要交代哪些資訊,包括觀察到的行為、嚴重程度與外部影響、發生情境與時間、何時被發現,以及涉及哪些模型;能公開的情況下,也會進一步說明調查範圍、對 AI 安全研究的意義、尚未解答的問題,以及已採取或準備採取哪些改善措施。由於報告可能在調查或修復完成以前發布,部分問題一開始也可能還沒有答案。

AI 公司為什麼需要主動揭露?

這類自願揭露之所以重要,也和現行法律留下的空白有關。《Reuters》指出,美國目前沒有全面性的聯邦制度,要求 AI 公司只要在測試中發現模型欺騙使用者、規避監督或出現其他危險行為,就必須對外通報。現行法規通常要等到發生重大資安事故、個資外洩等具體結果後,才可能觸發揭露義務。

因此,OpenAI 這套框架處理的是更早一層的問題:即使模型異常尚未造成實際傷害,只要案例足以暴露新的失效方式、既有防護缺口或值得其他開發者參考的風險,也可以先讓外界知道。OpenAI 也表示,未來計劃與其他開發商、外部研究者、產業標準組織及監管機關,一起發展更客觀的揭露標準

在數位威脅日益複雜的今天,資安已是每位企業決策者必須掌握的課題。如果你能把艱澀的議題轉化為有觀點、有價值的分析,寫出決策者需要的報導,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

台灣開始思考 AI Agent 怎麼管,數發部點出能力、身分、問責等六個治理層次

OpenAI Agent 越界範圍再擴大、Anthropic 揭第 4 起事故:AI 安全進入「事故治理」階段

9% 作弊、24% 吹哨:DeepMind 揭 AI 代理的「自我治理」為何仍不夠?

*本文開放合作夥伴轉載,資料來源:OpenAI《Reuters》1《Reuters》2《The Wall Street Journal》,首圖來源:Unsplash

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

225萬抽一次!漢測35萬人搶1048張 幸運兒曝光「20年第一次抽」就中

太報
02

34小時卡位!iPhone鐵粉「頭香三連霸」:iPhone 18 Pro、Duo都想要

Newtalk
03

漢測申購中籤率僅0.29%!幸運兒「首抽就中」爽賺256萬

TVBS
04

聯準會升息替台灣央行「鋪路」? 投顧專家稱:條件已具備 升半碼機率高

太報
05

車市洗牌!比亞迪全球銷量超越福斯 全球第二僅次豐田

anue鉅亨網
06

房東欠債拖累! 逢甲老牌手搖店面5708萬進法拍

ETtoday新聞雲
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...