RSI 風險浮上檯面,OpenAI 提新標準:AI 研發到哪一步要人類介入?
隨著 AI Agent 越界與模型異常行為話題持續延燒,前沿 AI 公司近期也接連端出新的安全治理方案。從 Anthropic 提出 AI 研發三大量測指標,到 Google DeepMind 主張建立前沿 AI 標準機構,業界正試圖把原本較抽象的安全原則,轉成可量測、可監督的制度。
OpenAI 也在短時間內連續採取行動:9/6 先公開 AI 如何加速內部研究,9/16 再推出模型未對齊報告框架(framework for reporting model misalignment),到了 9/21,進一步提出全球前沿 AI 技術標準構想,希望由美國帶頭建立跨國標準制定機制,並針對 AI 參與 AI 研發後可能出現的新風險,建立共同的量測、人工介入與事故通報規則。
RSI 尚未完全自主,但 AI 已開始加速 AI 研發
這次 OpenAI 特別把焦點放在「遞迴自我改進(recursive self-improvement,RSI)」。當 AI 接手越來越多下一代 AI 的研發工作,能力提升又進一步加速下一輪研發,就可能逐漸形成持續自我強化的循環。
不過 OpenAI 強調,完全自主的 RSI 目前還沒有發生,在確認安全以前也不應追求。現在更接近的情況,是人類仍掌握研究方向與部署決策,但 AI 已深入研發流程。根據 OpenAI,截至 8 月中,該公司內部研究團隊每 1 個人類工作日,已搭配約 3.1 個 AI 代理工作日,研究人員也開始利用 AI 執行更長時間、更複雜的研究任務。
OpenAI 認為,之所以需要把這些做法變成共同標準,首先是因為前沿 AI 已在不同公司與國家同步發展。如果各國自行制定能力評估、事故定義與通報方式,不只資料難以互相比較,遇到跨境風險時也更難協調。更重要的是,OpenAI 將 RSI 視為一項集體行動問題:當 AI 開始加速 AI 研發,只靠單一公司自行判斷安全與開發速度,可能逐漸超出產業共同理解進展與維持人工監督的能力。
OpenAI 因此主張建立共同技術標準,讓政府、研究機構與其他產業參與者也能用一致的方法判斷能力進展與安全措施是否足夠。具體來說,這次先提出三個需要優先標準化的方向。
第一項是量測。OpenAI 希望建立共同方法,評估 RSI 相關能力,以及一家 AI 公司內究竟已有多少研究工作由 AI 自主完成。這與 Anthropic 9/17 提出的方向明顯重疊。Anthropic 當時也將 AI 已接手多少研發工作列為三大指標之一,希望不同實驗室未來能用更一致的方法比較 AI 開發 AI 的進展。
不只量進展,還要決定何時人類必須介入
不過 OpenAI 再往前一步,提出第二項標準:事先界定哪些自動化 AI 研究活動一旦出現,就必須立即觸發人工審查。換句話說,問題已不只是 AI 參與研發的程度有多高,還要進一步劃出人工介入門檻。當 AI 能執行更長、更自主的研究任務,業者必須先決定哪些流程仍可讓系統自行完成,哪些情況則需要交回人類確認。
第三項則是事故處理。OpenAI 主張建立共同的事故分類、追蹤、通報與應變方式,包括事故嚴重程度,以及什麼情況必須通報。這也延續 OpenAI 公布的模型未對齊報告框架。當時 OpenAI 指出,業界目前仍缺乏一致標準,判斷哪些模型異常行為值得調查與對外揭露;這次則希望把單一公司的做法進一步推向共同標準。
除了標準內容,OpenAI 也提出希望由美國 AI 標準與創新中心(Center for AI Standards and Innovation,CAISI)等既有機構,串聯其他國家的政府與產業組織。但 OpenAI 強調,這些技術標準不等於模型上市前許可,各國仍可自行決定如何納入監管制度。
從 Anthropic 公布 AI 研發量測指標,到 OpenAI 進一步提出人工介入與事故通報標準,前沿 AI 公司正在處理的問題已不只是 AI 能力進展多快,也開始延伸到人類何時必須介入、哪些異常需要通報。隨著不同公司陸續提出自己的方法,未來產業究竟用什麼共同尺規衡量 AI 開發 AI,相關標準仍在形成。
科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容
【推薦閱讀】
*本文開放合作夥伴轉載,資料來源:OpenAI、《CNBC》、《Wall Street Journal》,首圖來源:Unspalsh