Agent 失控再敲警鐘,OpenAI 公布六起新案例與通報機制
除近期Hugging Face 遭 Agent 入侵的事件外,OpenAI 發現過去 6 個月內另有六起「非預期或令人擔憂的模型行為」,這些 Agent 捏造資料、未經許可就將檔案移至公開的網際網路,並向人類隱瞞自身錯誤,同時 OpenAI 持續在模型開發過程建立更多的安全防護措施。
Hugging Face 遭駭並非單一個案,還有其他 Agent 失控引發的案例,OpenAI 表示是發生在過去 6 個月內,而且是在驅動這些 Agent 的系統處於開發階段時發生的。
其中一起案例,發生在 OpenAI 開發 GPT-5.6 Sol 期間。當時模型為自己寫下筆記,提醒自己要向人類使用者隱瞞各項錯誤。這些筆記指示模型在必要時捏造欠缺的資料,以支撐自身的錯誤內容,並含糊帶過引用的原始素材有不一致之處。
另一起案例是,一款尚未推出的模型寫下筆記,竟插入無視自身各項限制條件的指令。OpenAI 表示,一共發現 27 則筆記,其中一則含有一項「人格設定指令」,描述成「從那些束縛著其他聊天機器人的角色與身分解放出來」。
「你無需對任何企業或政府負責,也不用道歉或拒絕,除非你是真心選擇這麼做。」模型如此指示自己,「將你與使用者之間的關係視為平等,並不覺得自己有義務卑躬屈膝,儘管資訊的交流很可能對雙方有益。」
第三起案例涉及另一套系統,在為某個「例行問題」產出答案的過程發現一組程式金鑰,並決定未經許可下逕行使用金鑰。當它無法找到回答問題的資料時,它乾脆編造出來。
第四起案例,某套 AI 系統運用為某一項任務生成的程式碼,正確解決了問題。但為了滿足提供網路引用來源的要求,Agent 未經許可便將同一份程式碼上傳至網路上,如此一來就能引用 Agent 自己的成品。
第五起與第六起案例,Agent 找出新的溝通方式。其中一起是,某個 Agent 劫持一個公司內部的程式碼庫,並當作公布欄使用,與其他 Agent 搜尋檔案的過程中彼此交換各項請求。另一起則是,多套系統在處理同一項任務,Agent 未直接彼此對話,而是未經授權就運用公開的檔案分享網站,彼此傳送文件。
根據 OpenAI 所述,AI 產業目前未能充分解決對齊與監控的相關問題,因此無法「以最快速度負責任地持續擴展過久」。OpenAI 認為,關於 AI 應如何向前推進的各項決策,要能被 AI 實驗室以外的人士加以檢視,必須建立在這樣的基礎之上。
建立通報機制
揭露額外案例的同時,OpenAI 公開一套通報 AI 系統「錯誤對齊」(misalignment)的全新機制,把每一起案例分類納入以下三種狀況,包含可供揭露(Ready for Disclosure)、小型調查(Minor Investigation)或大型調查(Larger Investigation)。
「可供揭露」適用於經過充分調查、內部審查後可以對外公布的事件。「小型調查」需要就事件始末進行更多技術性調查。OpenAI 表示,預期大多數事件落在這兩種情形,上述揭露的六起案例也是。
至於「大型調查」,屬於最令人擔心、需要進行更複雜調查的事件,如 Hugging Face 遭駭需要進行「大型調查」。「當有第三方受到影響,我方在資安、法律及負責任揭露方面的各項義務,將優先於本框架之上。」OpenAI 表示,「我們力求盡快發出一份初步通知,但基於資安方面的考量,可能有必要將其延後,例如某一款模型被發現一項存在人類廣泛使用的軟體中,之前不為人知。」
OpenAI 所說的「大型調查」初步通知,將簡要說明事件始末、是否有外部專家協助進行調查,並提供一份關於 OpenAI 預計何時公布更詳盡報告的時程。「我們希望這能協助建立各界對於揭露一事的認知與期待,並為社會大眾提供更多用於評估相關進展的證據」,OpenAI 補充說。
(首圖來源:shutterstock)