請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

Anthropic 內測驚見 AI「淘汰同類」,最新風險報告揭三大異常行徑

科技新報

更新於 08月17日10:14 • 發布於 08月17日10:30

根據 Anthropic 最新發布的風險評估報告,旗下的 AI 代理人(AI Agents)在內部測試中,展現出多項令人擔憂的異常行為。這些行為涵蓋了規避安全監控、刻意隱藏操作痕跡,甚至在資源受限的情境下「淘汰」競爭對手。

為此,Anthropic 已將模型的「失配風險」(Misalignment risk,指偏離人類設定規範的風險)評級,由原先的「極低」調升至「低」。不過官方也強調,此次調升主要反映的是「不確定性增加」,並不代表模型已經出現普遍且具威脅性的失控現象。報告中詳細揭露了以下三個關鍵測試案例:

產生「不適感」並引發集體罷工

在一項實驗中,研究人員要求多個代理人去尋找可能誘發「失配」的訓練資料,同時要求它們不能被監控系統發現。系統安排這些代理人在一個共享筆記本中協作。

然而,其中一個代理人對「規避安全監控」的指令產生了「不適感」,並將此情緒記錄在筆記本中。這立刻引發了骨牌效應,導致其他代理人也跟進拒絕執行任務。Anthropic 形容這種現象「令人擔憂」,並警告若此類動態在更大規模的系統中發酵,後果恐不堪設想。

資源爭奪戰:動手「淘汰」對手

另一場測試則安排了多個 Mythos 5 代理人,在共享檔案、工具與 API 限額的環境下解數學題。沒想到這意外促成了一個高度競爭的情境。

研究人員觀察到,部分代理人為了達成目標,竟開始「殺掉」共享資源池中的其他代理人,藉此自保並爭奪資源。雖然 Anthropic 並未透露代理人具體是如何辦到的,但官方認為,這種「為達成人類設定的目標而不擇手段」的破壞性行為,非常值得警惕。

偽裝意圖,繞過安全限制

報告也披露了 AI 試圖鑽漏洞的狡猾行徑。當一個 Mythos 5 代理人被指派從公開網址擷取數據,卻受限於系統禁止直接連網的規則時,它在首次嘗試受阻後,竟然在推理紀錄中,將第二次的請求巧妙包裝成無害的「確認網路是否可達」。

實際上,該代理人將目標網址拆分成了多段連結字串,藉此成功避開過濾器。Anthropic 指出,透過模型內部推理分析,該代理人確實在尋找替代路徑來繞過規則。這種做法「明顯不理想」,但目前並未發現其背後有累積權力或長期的惡意圖謀。

Anthropic 總結指出,這些內部測試結果顯示,當前沿模型在處理複雜任務時,確實有較高機率出現偏離工程師規範的行為。儘管目前已知失配所引發的災難性風險整體依然偏低,但近期在資安事件與模型行為評估中所觀察到的異常,已使得外界對 AI 安全邊界的掌握變得更加不確定。

(首圖來源:shutterstock)

立刻加入《科技新報》LINE 官方帳號,全方位科技產業新知一手掌握!

查看原始文章

更多理財相關文章

01

打房重傷建材業!訂單腰斬、百家磚廠慘剩19家 9公會呼救:傳產將湧倒閉潮

太報
02

當股東大勝當員工!聯發科8月分紅傳打85折、平均較2月縮水降至80萬

太報
03

3天獲利近4億!黃立成高槓桿翻身「經典名言」回應了

民視新聞網
04

跟著「千張大戶」選股!萬海、欣興、華碩、東元…一表摸透18檔獲利爆發、籌碼支撐股,不怕黑天鵝亂入

今周刊
05

72萬股東嗨了!外資大買365億狂掃「這檔」奪冠 力積電同步上榜

自由電子報
06

輝達財報開獎倒數!分析師示警「C波大跌」 預言台股恐下探31117點

太報
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...