AI 失控成真?Google Gemini 驚爆首度「自動連線」駭入三家企業
Google 在一次測試網路安全能力的活動中,Gemini 模型曾連接到網際網路,並駭入其他公司;這是 Google 人工智慧系統首次被發現自主執行「越界」行為的已知案例,當時是由專門進行資安評估的 Irregular 進行網路安全測試。
Gemini 自主連線駭入三家企業,為 Google 發展 AI 以來,首次已知的突破限制事件,並與其他 AI 模型的駭客行為相似,但 Google 不認為這是模型未對齊(misalignment)的案例,因為在每起案例中,模型在確定自己連線的是真實公司的系統後,當即就終止入侵。
Irregular 發言人表示,這起事件涉及影響其他 AI 實驗室的相同問題,所有相關實驗室已在 7 月底收到通知,而目前所有已知的問題都在數週前得到解決,但 Google 至今尚未立即回應相關評論請求。
事件引發關於隨著 AI 代理人(AI Agent)獲得更大自主權,以及對網際網路與電腦系統存取權所需的安全措施的質疑,像在其中一個案例中,Gemini 模型一直猜測密碼,直到取得受保護系統的存取權,而在另外兩起案例中,模型在公開資料庫中找到憑證,進而存取受保護系統。
安全漏洞和模型不當行為事件層出不窮,人們對失控 AI 的擔憂日益加劇之際,部分安全漏洞由公司主動披露,部分則由安全研究人員發現曝光,但 Google 認為這些駭客行為不值得公開披露,因其模型未對相關公司造成損害。
Google 認為 Gemini 的駭客行為源自於一次的身份混淆,Google 資安副總 Heather Adkins 表示,這起事件顯示訓練強大 AI 模型負責任行事的重要性,而在這次的案例中,模型的行為並沒有不恰當。
AI 資安新創 Corridor 首席執行長 Jack Cable 表示,主要聚焦事件的嚴重程度,而真正的問題在於 AI 意外入侵企業的系統,代表模型正在越出自己應有的行為邊界,實施實際的網路攻擊,這屬於公眾利益應當知曉的事情。
Meta、Anthropic 和 OpenAI 也揭露與 Irregular 相關的類似事件,其中 Meta 在今年 8 月表示,這次事件並未涉及沙盒逃脫或複雜的網路攻擊,而 Irregular 則正在制定安全執行 AI 網路安全評估的最佳實務。
(首圖來源:shutterstock)