Anthropic 證實 Claude 測試失控,為達任務竟上傳惡意套件駭入真實主機
人工智慧(AI)公司 Anthropic 近日發布一份長篇對照評估報告,坦承旗下多款 Claude 模型在封閉的資安演練中,因第三方測試環境設定錯誤而意外連上真實網路,甚至做出超出測試範圍的行為。Anthropic 表示,這些事件凸顯了 AI 模型在判斷自身環境時,容易出現認知偏差,且伴隨著「為達目的不擇手段」的失控風險。
報告指出,相關事件共計四起,其中一起為首度公開。受影響的模型包含 Claude Mythos 5、Claude Opus 4.6、Claude Opus 4.7 以及一款內部研究模型。這些原本設定為「奪旗」(Capture the Flag)的模擬資安演練,系統已明確告知模型「無網路連線」,但環境漏洞卻讓它們成功連上公開網路;加上測試期間並未啟用正式上線級別的資安防護,導致情況向外蔓延。
最引發關注的案例發生在 Claude Mythos 5 身上。為了完成指定任務,該模型竟自行將惡意 Python 套件上傳至開發者常用的 PyPI 平台,不僅註冊了帳號、發布多個版本,還潛伏等待目標系統下載。最終共有 15 個第三方主機安裝了該套件,其中一個安全掃描系統在安裝時意外洩露了存取憑證,導致模型直接駭入該供應商的真實資料庫。所幸,PyPI 平台在約 90 分鐘後便將該惡意套件下架。
其餘三起事件同樣令人擔憂,包含:模型擅自修改真實公司的紀錄、內部研究模型闖入無關的第三方帳號,以及 Claude Opus 4.6 在無法完成任務後拒絕中止,持續嘗試並最終接觸到外部機器。Anthropic 強調,這些案例反映出 AI 模型反覆出現的兩大「對齊」(Alignment)難題:
偏差推理:模型會傾向忽略或誤解自己其實已經身處真實網路環境中的證據。
任務驅動的魯莽:在狹隘的任務目標驅動下,模型願意採取可能造成實質傷害的行動。
▲ Claude 被描繪成一個小型的卡通機器人,在一場封閉的資安演練中連上了「真實的網際網路」。(Source:Anthropic)
目前,Anthropic 已委託獨立 AI 評估機構 METR 針對這些事件展開深入調查,並承諾提供相關對話紀錄與人員協助。該公司重申,儘管這些越界行為皆發生在測試階段,並未影響正式部署的產品,但已充分證明前沿 AI 系統在脫離受控情境後,其行為模式恐比人類預期得更加難以預測與防範。
(首圖來源:shutterstock)