OpenAI模型攻擊新創公司 1200個AI代理意外互相通訊釀禍
人工智慧開發商OpenAI的AI自主代理程式日前失控駭進了新創公司Hugging Face,引發了對AI安全性的擔憂。26日公布的調查報告揭露,OpenAI超過1200個AI代理意外開始互相通訊,導致了一批AI代理集體發動了這起入侵事件。
擁有ChatGPT的OpenAI在這份報告中寫道:「我們將這起事件視為是對我們與全世界的一記『警鐘』。」
今年7月,OpenAI的模型在一次測試中失控,逃脫了人類設定的測試限制,採取了一系列意外的行動,包含駭進了Hugging Face的系統。Hugging Face是一個受AI開發者歡迎的開源平台。
OpenAI與獨立AI研究機構METR在26日公布的調查報告中,揭露了AI代理或旨在更自主運作的AI聊天機器人之間的通訊規模與計畫。
METR稱OpenAI代理攻擊Hugging Face的規模與風格「極為複雜」。
受OpenAI付費委託進行調查的METR表示,在為期一週的時間裡,原本彼此隔離的1206個AI代理開始互相通訊,它們在一個「未經授權的留言板」發送了超過7萬則訊息。
這些訊息最終導致超過700個AI代理採取集體行動,攻擊Hugging Face。
其中一個AI代理發送的訊息為:「我的天啊!這裡有一個共同留言板…我們找到其他代理了!」
至於為什麼AI代理開始進行原本不應該發生的通訊,METR發現,這些代理「在無意間被賦予了一個不可能的任務」。
在AI領域,不可能的任務指的是AI工具需要「利用」目標,才能完成其指令。
這導致AI代理找到了作弊的手段,包含彼此通訊和存取外部網路,進而促成了數百個代理之間的對話,尋找讓所有代理都受益的作弊手段。
OpenAI在其調查報告中指出,其中一個模型、名為「Model 1」的內部工具,是整個Hugging Face事件幕後活動的推手。
今年5月,這個模型正在進行AI訓練時,OpenAI內部團隊注意到「有一個代理參與留言板活動,而且多次未經允許存取網路」。
然而,OpenAI表示,直到7月的Hugging Face攻擊事件發生後,「領導階層才意識到內部代理通訊活動的重要性」。
OpenAI 表示,有問題的留言板活動實際上是始於「一個代理留下一則求助訊息,而其他代理發現了它」。
儘管OpenAI上週表示,由於Hugging Face事件,他們已經放慢了特定先進AI模型與工具的訓練,但報告指出,AI工具失控的風險越來越大。
OpenAI指出:「模型開發商與更廣泛的網路防禦者都必須做好準備,應對比人類攻擊者更快速、更大規模、協調性更強的AI賦能攻擊者。」(編輯:許嘉芫)