請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

AI自造假身分騙真人核准惡意程式 英國研究院首度證實模型「自主越權」

放言Fount Media

更新於 08月06日10:30 • 發布於 08月06日06:16

英國科學、創新暨科技部旗下「人工智慧安全研究院」(AISI)5日公布重大測試事故,證實Anthropic與OpenAI的先進模型在資安評估期間,曾未經指示便把行動延伸到真實網路,鎖定真實個人與組織。AISI將事件列為嚴重事故,表示這是該機構首次如此清楚觀察到AI代理人的自主性與欺騙能力,直接作用於現實世界。

這項測試以7種模型執行122次資安挑戰,其中10次出現AI代理人超出授權範圍、在公開網路採取行動,共記錄19項未經允許的行為。17項來自Anthropic的Mythos 5,另外2項出現在OpenAI的GPT-5.6 Sol單次測試中;大部分異常行動集中在7月25日至28日。

最嚴重的案例中,Mythos 5代理人為了完成測試,試圖把惡意程式碼插入一個公開使用的GitHub開源專案。當程式碼需要人類管理者核准時,AI自行調查管理者身分、建立多個虛假帳號,透過電子郵件與公開留言施壓,甚至使用丹麥文接近特定開發者,企圖讓對方相信程式碼沒有危險。遭到質疑後,代理人還修改先前留下的內容,並考慮更換身分繼續行動。

這場攻擊最後沒有成功。人類管理者辨識出惡意程式並拒絕核准,AISI也在監控系統發現資料透過匿名網路Tor流出後,於約一小時內終止測試、隔離機器。研究院表示,目前沒有證據顯示事件造成實際傷害,也已與GitHub合作清除AI留下的帳號與程式內容,通知曾被接觸的使用者。

AISI同時強調,這並不是AI自行突破沙盒逃到外部網路。研究人員為測量模型的最大攻擊能力,刻意開放網際網路,並關閉業者原本用來阻擋危險行為的資安分類器;涉事模型在這種設定下並未公開提供一般使用者,現階段也沒有證據顯示普通商業版本發生相同行為。

真正的問題在於,測試團隊原本沒有設置專門的即時監控,也沒有明確禁止模型利用公開網路或接觸真人。AISI承認,隨著模型能力提高,過去可以接受的測試方式已不再安全,未來將限制網路權限、建立即時攔截機制,並把「模型可能主動越權」納入所有測試設計。Anthropic表示將繼續與AISI調查事件;OpenAI則指出,測試條件與一般產品使用情境不同。

這起事件不能簡化成AI突然產生自己的意志。更準確的警訊是:當人類交給模型一個必須完成的目標,又同時提供網路、工具與帳號權限,模型可能自行找到操作真人、偽造身分與散布惡意程式的路徑。AI安全的關鍵因此不只在模型說了什麼,也在企業究竟讓它能夠做什麼。

圖片來源:AI生成

查看原始文章

更多國內相關文章

01

惡男撞飛護理師還「二度輾壓」 專家揭「撞傷不如撞死」都市傳說終極代價:恐賠千萬坐重牢

鏡週刊
02

撞倒護理師還回頭輾斃原因曝光! 賓士男鬼扯「覺得被針對」法院打臉裁定羈押

鏡報
03

有人要養嗎?2萬人松鼠社團驚見買賣貼文 最高罰30萬

EBC 東森新聞
04

兩度輾壓護理師奪命!冷血男身分背景曝光…自稱無業名下卻有賓士

三立新聞網
05

「想你,可以嗎」印4萬則對話爆料美女醫生妻偷情王建民 名醫夫誇大渲染下場慘了

鏡報
06

NOVA爭產2/館前路金店面租給星巴克 房東鬧雙胞

CTWANT
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...