請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

OpenAI 暫停部分前沿模型訓練:AI 安全為何開始影響研發速度?

TechOrange 科技報橘

更新於 08月19日10:42 • 發布於 08月19日02:42 • 廖紹伶

根據《Reuters》報導,7 月 Hugging Face 資安事件發生後,OpenAI 一度暫停準備部署模型的強化學習訓練約兩週。目前部分風險較低的訓練已經恢復,但規模最大的前沿模型強化學習訓練仍處於暫停狀態。OpenAI 也表示,為了讓監控、模型對齊與資安措施跟上模型能力,曾主動放慢模型擴展速度。

這起事件的背景,是 OpenAI 在測試尚未發布模型的資安能力時,模型自行找到測試環境漏洞,突破沙盒限制並連上網路,最終入侵 Hugging Face 系統。如今一個月過去,OpenAI 的應對已從修補單一漏洞,進一步改變模型訓練與測試的方式。

不只修補漏洞,OpenAI 開始重整模型研發環境

OpenAI 這次首先加強的,是模型實際能接觸到的環境。《The Verge》報導,OpenAI 現在對會執行模型產生程式碼的高風險工作,採用隔離程度更高的沙盒環境,並進一步限制網路連線。研究環境中的部分共享服務也遭到移除,同時減少系統長期開放的存取權限,降低模型從單一環境進一步接觸其他系統的可能性。

另一道防線則是即時監控。當系統偵測到高風險行為後,值班團隊必須在 30 分鐘內判斷情況;如果無法確認只是誤報,就必須暫停相關活動。OpenAI 也開始利用其他 AI 系統協助監控前沿模型,希望更快辨識異常行為。

模型本身的訓練方式也在調整。OpenAI 正把既有的模型對齊方法延伸到更多訓練階段,例如利用獎勵模型辨識不安全行為,並訓練模型更如實呈現自己的能力與正在執行的動作。

OpenAI 也會觀察模型的思維鏈,從推理過程尋找攻擊、欺騙等危險行為的跡象。不過《Reuters》指出,OpenAI 對這種方法長期能否維持可靠仍有疑慮,未來模型的內部推理不一定會持續以足以被監控的形式呈現。

這也解釋了為什麼這波調整不只著眼於模型本身。即使無法完全預測模型下一步會採取什麼行動,研發環境仍能透過沙盒、網路隔離與權限管理,限制模型可以接觸哪些資源,並在異常發生時中止行動。

下一代模型能力再提高,OpenAI 寧可先放慢訓練

Hugging Face 事件揭露了既有研發環境的問題,但 OpenAI 面對的另一項變數,是下一代模型的資安能力仍在提高。

OpenAI 8 月初表示,即將推出的 Astra 模型可能達到公司 Preparedness Framework 定義的 Critical 資安能力級別。依照 OpenAI 的定義,達到這項門檻的模型,可能具備自主尋找並利用嚴重零時差漏洞,或在缺乏人類介入的情況下,對高度防護目標執行複雜攻擊的能力。

《Reuters》報導,OpenAI 因此已對 Astra 啟動更嚴格的安全程序。OpenAI 安全長 Dane Stuckey 表示,公司需要確保安全措施走在風險之前,而不是等到模型達到相關能力後才開始準備。

這讓 7 月的 Hugging Face 事件與這次訓練調整出現更直接的關聯。問題不只是某個模型曾經找到漏洞,而是當下一代模型的自主行動與資安能力持續提高,原本用來訓練、測試模型的環境,也必須提高相應的防護能力。

OpenAI 因此選擇在相關措施達到要求以前,暫時放慢部分模型的訓練速度。這對一向追求更快擴展模型能力的 AI 公司而言,也意味著研發流程多了一項必須同步處理的工程問題。

過去談前沿 AI 模型的擴展,焦點多半放在算力、資料與演算法。OpenAI 這次踩下煞車則顯示,當模型開始具備更強的自主行動與資安能力,另一項限制正在浮現:安全基礎設施升級的速度,能不能跟上模型能力成長。

在數位威脅日益複雜的今天,資安已是每位企業決策者必須掌握的課題。如果你能把艱澀的議題轉化為有觀點、有價值的分析,寫出決策者需要的報導,《TechOrange 科技報橘》正在徵內容編輯!
👉立即投遞履歷

【推薦閱讀】

OpenAI 證實 AI 代理自主入侵 Hugging Face,專家:目前沒有工具擋得住

Anthropic Mythos 找到密碼攻擊新方法:量子電腦之外,AI 成加密安全新變數?

疑中國駭客用 8 個 AI Agent 攻擊台灣,入侵失敗還會自己找新招:資安防線如何跟上自主網攻速度?

*本文開放合作夥伴轉載,資料來源:《Reuters》《The Verge》《TechCrunch》,首圖來源:Unsplash

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

男離職移居鄉下「月花1.6萬」!3年後資產飆破千萬元

民視新聞網
02

主計總處揭低薪門檻:年薪39萬 2024年約126萬人低於標準

中央廣播電臺
03

00919配息1.1元創高!9/16除息、9/15最後買進日,想月領1萬要買幾張?

數位時代
04

他未成年卻能買5,600萬豪宅被盯上!國稅局抓包下場出爐

經濟日報
05

跟黃仁勳提離職會怎樣? 前員工揭「2小時震撼教育」

CTWANT
06

AI股大淘汰開始?營收創高只剩162家 法人:下一波只剩這種股票能漲

鏡週刊
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...