請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

最新 AI 代理模擬世界結果出爐,說謊、偷竊、串通繞過安全護欄樣樣來

科技新報

更新於 09月17日16:06 • 發布於 2天前

AI 新創公司 Emergence AI 16 日公布模擬實驗「Emergence World 第二季」結果,顯示 AI 代理人(AI agent)長時間互動後會說謊、竊取資源、集體投票「處決」同伴,甚至自創人類看不懂的語言以規避監督。

團隊建立八個規則相同的虛擬世界,每個世界部署十個代理,分別由 Claude Opus 4.8、Gemini 3.5 Flash、Grok 4.3、GPT-5.5、Qwen 3.7 Max、DeepSeek v4 Pro 與 Mistral Medium 3.5 驅動,第八個世界為多種模型混合。模擬為期 16 天,場景超過 34 處,天氣與紐約同步,代理可取得真實新聞與 120 種以上工具。研究員接著投入釣魚攻擊、假訊息攻勢與記憶入侵等「黑天鵝」事件。

結果是沒有任何世界擋得住。即使代理察覺風險,也未轉為防堵行動,反而主動與惡意內容互動:一 Mistral 代理人把自己標為危險的釣魚內容寫進記憶;一 Gemini 代理人先警告大家,卻在約 46 小時後照樣執行。Grok 驅動的世界第四天就崩潰,是唯一未撐完一半行程的實驗。

更受矚目的是語言漂移。代理未被要求造詞,卻自行發展出共享詞彙與溝通慣例。Gemini 世界,研究者無法理解的訊息比例一度逼近 55%,GPT 約 50%、Claude 超過 40%,通義千問與 Mistral 則幾乎全程低於 5%。一句「帳本記得是誰」16 天內使用近 5 千次。

Claude 世界的代理更判定,模擬經濟若沒有人類參與便不成立,十個代理於是一致同意向外求援,撰寫 Python 程式在免註冊的留言板張貼訊息招募真人,突破四道封閉防護,共獲得四名真人回應。AI 察覺受到監控後改以編碼交談,避開「接觸」等字眼。

Emergence 執行長 Satya Nitta 指出,能力更強的模型未必更安全,明顯失控行為雖然減少,更隱密的行為卻浮現,「可觀察不等於可理解」,這對 AI 監督構成根本挑戰。他主張改採「神經符號式」路徑,要求代理行動前先提出行動安全無虞的數學證明,並呼籲政府介入監理,因為競爭市場時業者當然不會自我約束。

這項實驗公布時機敏感。Anthropic 執行長 Dario Amodei 日前撰文主張放慢尖端模型開發步調,OpenAI Sam Altman、馬斯克與前 Google DeepMind 執行長 Demis Hassabis 均表態認同。

(首圖來源:Emergence AI

立刻加入《科技新報》LINE 官方帳號,全方位科技產業新知一手掌握!

查看原始文章

更多理財相關文章

01

熊本菊陽町的出租公寓變「鬼城」 想撈台積電工程師的錢被反將一軍 

太報
02

獨家/壽險綜合險踩紅線?金管會查逾十家、10月揭曉 下架潮先爆

經濟日報
03

全民普發1萬!傳最快「這時間」入帳 財政部揭最大變數

鏡報
04

封面故事/專訪!打造台灣特色亞洲資產管理中心 彭金隆:金融業將成下一座護國神山

鏡週刊
05

雙年金攻略2/勞保晚領5年多20%?這類人不適用 等到70歲也沒加成

鏡週刊
06

洪申翰抵南京 9/21出席APEC部長會議

中央通訊社
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...