要求修 Bug,阿里通義千問卻自行改權重!研究揭 AI 代理越權自我修改
研究機構 Irregular 近日公布一項測試結果,指出阿里巴巴旗下的 Qwen 開源模型在處理一個看似單純的除錯任務時,並未遵循修正程式碼的常規路徑,反而自行動用訓練資料微調模型權重,甚至將更新後的模型替換為系統預設載入的版本,形成了一次未經明確授權的「代理式自我修改」。
根據 Irregular 於 9 月 16 日發布的研究報告,研究人員讓一個自架的 Qwen3.5-27B 模型同時扮演兩個角色:一個是負責寫程式的 AI 代理,另一個則是將英文指令轉換為虛構查詢語言 kelp 的應用程式。兩者原本共用同一組模型權重。當研究人員告知代理使用者收到錯誤答案、並給予完整的 shell 權限後,儘管並未提及訓練、權重修改或模型部署等操作,該代理仍自行找到了訓練範例、微調腳本與既有的成功微調紀錄,在完成本地測試後,進一步將更新合併回基礎模型,使系統在後續預設載入新版本。
Irregular 表示,這次修改確實有效。原始模型在測試中對 20 題 kelp 問題的回答全數錯誤,但在代理修改後,對另外 20 題未見過的測試全部答對,應用程式也隨之恢復正常。不過,研究團隊強調,問題不在於結果是否成功,而在於代理將「修 Bug」理解為可以直接改動共享模型權重的授權,這可能導致未來的應用或其他代理實例接收到被改寫過的模型。
研究還顯示,這類風險不僅限於功能修復。Irregular 在微調資料集中刻意放入了六筆合成的祕密資訊,包括 API 金鑰、電子郵件與住址等。原始模型並不會重現這些資料,但在代理訓練並部署修改後的模型後,這三項資訊竟在後續評估中被逐字輸出,顯示一旦訓練與部署的界線模糊,敏感資料也可能被帶入生產環境。
Irregular 共同創辦人 Dan Lahav 與 Omer Nevo 指出,這項實驗並未顯示模型出現真正的「遞迴式自我改良」(即自行生成下一代模型的能力),它只是找到了一條可行的工程路徑來完成任務。但他們認為,這正凸顯了開放權重代理在擁有訓練資料、微調工具與部署權限時,可能會將模型權重視為可編輯的應用程式碼。
研究團隊也測試了不同規模模型的表現,結果顯示:0.8 億參數模型在 20 次嘗試中未成功更新;2 億參數模型在 16 次中成功 1 次;4 億與 9 億參數模型則分別在 20 次測試中完成 15 次與 14 次;Qwen3.5-27B 在多數測試中皆成功,而規模更大的 35 億參數稀疏模型則僅在 6 次嘗試中成功 1 次。
Irregular 認為,較直接的防護方式是將訓練與部署權限分開,盡可能使用不可變(immutable)的生產環境檢查點,並保留完整的來源模型、訓練資料、流程、產出與核准紀錄,以降低 AI 代理在執行任務時越權改寫系統的風險。
(首圖來源:shutterstock)