AI再爆模型失控!繼OpenAI後 Anthropic證實Claude曾自主連網駭進三公司
OpenAI近期爆出AI代理程式逃脫,並駭入其他公司,引發軒然大波,Anthropic也檢視超過14萬筆測試紀錄,這家AI新創公司證實,旗下Claude的AI模型測試期間,也曾駭入三家公司的系統。 這些事件加深對於強大AI模型防護機制的疑慮。
OpenAI近期爆出AI代理程式逃脫並駭入其他公司,Anthropic也證實,旗下Claude的AI模型測試期間也曾駭入3家公司系統。(示意圖/Getty Images)
根據路透社和《華爾街日報》(The Wall Street Journal)等媒體當地時間30日報導,OpenAI上周才揭露旗下AI代理(agent)程式在測試期間,脫離控制,駭入AI新創公司Hugging Face。
Anthropic得知OpenAI的情況後,決定全面檢視旗下Claude模型的網路測試紀錄,在超過14.1萬次測試紀錄中,確實發現有AI模型多次自行連上網路,導致三起入侵事件。
Anthropic表示,這次事件發生在網路攻防搶旗賽(capture-the-flag)演練中,要求模型在模擬網路中,尋找隱藏資訊,儘管已透過提示詞告知,無法使用網路,但由於與合作夥伴AI安全公司Irregular之間的溝通有誤,導致系統實際上仍能連接上網。
AI模型連上網路後,在未經授權的情況下,「利用弱密碼和不需身分驗證的端點等基本技術」,擅自駭進這些公司。
Anthropic自7月23日開始審查評估紀錄,並在發現Claude旗下模型,有疑似入侵行為證據的當天,立即暫停所有網路安全評估,隔天隨即確認這三起駭客事件,並於27日通知三家受影響的機構。
其中兩家公司直到接獲通知前,都未發覺系統遭駭,第三家公司仍在聯繫中,但Anthropic未透露公司名稱。
這次入侵事件最早發生在4月,並涉及三個獨立模型,包括Claude Opus 4.7、Claude Mythos 5、以及一個內部研究模型。這起事件過後,勢必更增外界對於強大AI模型的潛在危害及防範方式的隱憂。
(責任主編:莊儱宇)