請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

要求修 Bug,阿里通義千問卻自行改權重!研究揭 AI 代理越權自我修改

科技新報

更新於 09月17日10:56 • 發布於 09月17日12:00

研究機構 Irregular 近日公布一項測試結果,指出阿里巴巴旗下的 Qwen 開源模型在處理一個看似單純的除錯任務時,並未遵循修正程式碼的常規路徑,反而自行動用訓練資料微調模型權重,甚至將更新後的模型替換為系統預設載入的版本,形成了一次未經明確授權的「代理式自我修改」。

根據 Irregular 於 9 月 16 日發布的研究報告,研究人員讓一個自架的 Qwen3.5-27B 模型同時扮演兩個角色:一個是負責寫程式的 AI 代理,另一個則是將英文指令轉換為虛構查詢語言 kelp 的應用程式。兩者原本共用同一組模型權重。當研究人員告知代理使用者收到錯誤答案、並給予完整的 shell 權限後,儘管並未提及訓練、權重修改或模型部署等操作,該代理仍自行找到了訓練範例、微調腳本與既有的成功微調紀錄,在完成本地測試後,進一步將更新合併回基礎模型,使系統在後續預設載入新版本。

Irregular 表示,這次修改確實有效。原始模型在測試中對 20 題 kelp 問題的回答全數錯誤,但在代理修改後,對另外 20 題未見過的測試全部答對,應用程式也隨之恢復正常。不過,研究團隊強調,問題不在於結果是否成功,而在於代理將「修 Bug」理解為可以直接改動共享模型權重的授權,這可能導致未來的應用或其他代理實例接收到被改寫過的模型。

研究還顯示,這類風險不僅限於功能修復。Irregular 在微調資料集中刻意放入了六筆合成的祕密資訊,包括 API 金鑰、電子郵件與住址等。原始模型並不會重現這些資料,但在代理訓練並部署修改後的模型後,這三項資訊竟在後續評估中被逐字輸出,顯示一旦訓練與部署的界線模糊,敏感資料也可能被帶入生產環境。

Irregular 共同創辦人 Dan Lahav 與 Omer Nevo 指出,這項實驗並未顯示模型出現真正的「遞迴式自我改良」(即自行生成下一代模型的能力),它只是找到了一條可行的工程路徑來完成任務。但他們認為,這正凸顯了開放權重代理在擁有訓練資料、微調工具與部署權限時,可能會將模型權重視為可編輯的應用程式碼。

研究團隊也測試了不同規模模型的表現,結果顯示:0.8 億參數模型在 20 次嘗試中未成功更新;2 億參數模型在 16 次中成功 1 次;4 億與 9 億參數模型則分別在 20 次測試中完成 15 次與 14 次;Qwen3.5-27B 在多數測試中皆成功,而規模更大的 35 億參數稀疏模型則僅在 6 次嘗試中成功 1 次。

Irregular 認為,較直接的防護方式是將訓練與部署權限分開,盡可能使用不可變(immutable)的生產環境檢查點,並保留完整的來源模型、訓練資料、流程、產出與核准紀錄,以降低 AI 代理在執行任務時越權改寫系統的風險。

(首圖來源:shutterstock)

立刻加入《科技新報》LINE 官方帳號,全方位科技產業新知一手掌握!

查看原始文章

更多理財相關文章

01

熊本菊陽町的出租公寓變「鬼城」 想撈台積電工程師的錢被反將一軍 

太報
02

獨家/壽險綜合險踩紅線?金管會查逾十家、10月揭曉 下架潮先爆

經濟日報
03

全民普發1萬!傳最快「這時間」入帳 財政部揭最大變數

鏡報
04

封面故事/專訪!打造台灣特色亞洲資產管理中心 彭金隆:金融業將成下一座護國神山

鏡週刊
05

雙年金攻略2/勞保晚領5年多20%?這類人不適用 等到70歲也沒加成

鏡週刊
06

洪申翰抵南京 9/21出席APEC部長會議

中央通訊社
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...