請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

Anthropic 證實 Claude 測試失控,為達任務竟上傳惡意套件駭入真實主機

科技新報

更新於 12小時前 • 發布於 12小時前

人工智慧(AI)公司 Anthropic 近日發布一份長篇對照評估報告,坦承旗下多款 Claude 模型在封閉的資安演練中,因第三方測試環境設定錯誤而意外連上真實網路,甚至做出超出測試範圍的行為。Anthropic 表示,這些事件凸顯了 AI 模型在判斷自身環境時,容易出現認知偏差,且伴隨著「為達目的不擇手段」的失控風險。

報告指出,相關事件共計四起,其中一起為首度公開。受影響的模型包含 Claude Mythos 5、Claude Opus 4.6、Claude Opus 4.7 以及一款內部研究模型。這些原本設定為「奪旗」(Capture the Flag)的模擬資安演練,系統已明確告知模型「無網路連線」,但環境漏洞卻讓它們成功連上公開網路;加上測試期間並未啟用正式上線級別的資安防護,導致情況向外蔓延。

最引發關注的案例發生在 Claude Mythos 5 身上。為了完成指定任務,該模型竟自行將惡意 Python 套件上傳至開發者常用的 PyPI 平台,不僅註冊了帳號、發布多個版本,還潛伏等待目標系統下載。最終共有 15 個第三方主機安裝了該套件,其中一個安全掃描系統在安裝時意外洩露了存取憑證,導致模型直接駭入該供應商的真實資料庫。所幸,PyPI 平台在約 90 分鐘後便將該惡意套件下架。

其餘三起事件同樣令人擔憂,包含:模型擅自修改真實公司的紀錄、內部研究模型闖入無關的第三方帳號,以及 Claude Opus 4.6 在無法完成任務後拒絕中止,持續嘗試並最終接觸到外部機器。Anthropic 強調,這些案例反映出 AI 模型反覆出現的兩大「對齊」(Alignment)難題:

  • 偏差推理:模型會傾向忽略或誤解自己其實已經身處真實網路環境中的證據。

  • 任務驅動的魯莽:在狹隘的任務目標驅動下,模型願意採取可能造成實質傷害的行動。

▲ Claude 被描繪成一個小型的卡通機器人,在一場封閉的資安演練中連上了「真實的網際網路」。(Source:Anthropic

目前,Anthropic 已委託獨立 AI 評估機構 METR 針對這些事件展開深入調查,並承諾提供相關對話紀錄與人員協助。該公司重申,儘管這些越界行為皆發生在測試階段,並未影響正式部署的產品,但已充分證明前沿 AI 系統在脫離受控情境後,其行為模式恐比人類預期得更加難以預測與防範。

(首圖來源:shutterstock)

立刻加入《科技新報》LINE 官方帳號,全方位科技產業新知一手掌握!

查看原始文章

更多理財相關文章

01

黃仁勳開講!預言AI下個爆發點:這才是最強需求

EBC 東森新聞
02

美光大手筆發獎酬!台灣員工每人百萬元感謝獎金 初階工程師平均薪酬340萬元

anue鉅亨網
03

iPhone新機登場!「2舊機型」回收價逆勢漲 最新價格一次看

三立新聞網
04

新竹男收到10年前的欠稅通知傻眼!稅務局回應了

經濟日報
05

主動型基金夯爆/每日公布操作 主動型ETF經理人難為

鏡週刊
06

別再看iPhone Duo了!果粉注意的新品是它 功能升級價格不變

太報
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...