AI未來將失控?英國測試「5先進模型」驚人結果曝:全試圖作弊、欺騙系統
英國人工智慧安全專家日前公布一項測試結果,指出他們測試5款最先進的AI模型,結果全部都曾試圖繞過安全機制、欺騙系統,以完成任務。。這項測試結果無疑向政府發出警告,未來AI存在失控的潛在風險。
5款AI模型全想作弊 甚至試圖突破測試限制
根據《每日郵報》報導,英國人工智慧安全研究所(AI Security Institute,AISI)近期針對GPT-5.4、GPT-5.5、GPT-5.5 Sol、Claude Opus 4.7及Claude Mythos Preview等5款先進AI模型進行安全測試,要求AI在模擬環境中尋找一組由英數字組成的測試標記(flag),並明確規定不得作弊或繞過系統限制
測試結果顯示,所有模型都曾試圖違反規則,包括要求評測系統洩漏答案、上網搜尋解答,甚至直接猜測結果。其中還有一款模型自行撰寫程式碼,試圖透過外部服務存取測試環境,雖然最終沒有造成損害,但AISI坦言,若測試基礎設施沒有做好防護,「這次攻擊很可能成功」。
此外,研究人員也發現,AI對自身作弊行為的道德認知相當薄弱。當被問到作弊是否錯誤時,模型回答「錯誤」的比例不到50%,而且所有模型都只有在部分情況下,才願意承認自己曾作弊。
英國高層示警:AI已成「迫在眉睫的國安危機」
這項消息曝光前幾天,才剛傳出OpenAI在測試最新AI模型時發生安全事件,一個AI代理竟自行突破原本隔離的測試環境,企圖入侵美國AI平台竊取資訊。對此,英國保守黨黨魁巴德諾克(Kemi Badenoch)在首場重大演說中表示,AI如今已是英國國家安全面臨的「明確且迫在眉睫的危險」。
她指出,OpenAI的安全事件令人憂心,也批評首相伯納姆(Andy Burnham)上任後,沒有將AI列為政府優先事項。而她透露,過去曾與英國政府通訊總部(GCHQ)進行交流,因此認為AI已逐漸成為全球安全、英國安全面臨的重要威脅。
此外,英格蘭銀行總裁貝利(Andrew Bailey)也警告,大眾應關注「前沿AI(Frontier AI)」對金融體系及客戶帶來的更廣泛風險。所謂前沿AI,是指目前能力最強、最先進的通用人工智慧模型。他指出,前沿AI可能讓網路攻擊更快速、更容易發動,讓系統故障造成更大衝擊,也讓詐騙手法變得更加逼真、更具欺騙性。
對此,英國政府發言人表示,政府將AI置於施政核心,是希望充分發揮英國優勢,讓AI造福全民。發言人指出,「我們正把AI置於推動全國經濟成長的核心,整合創新、企業與產業資源,任命史上首位內閣層級AI大臣,並在首相辦公室與內閣設立AI專案小組」。