請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

【開源 AI 安全警訊】中國 AI 開源模型能力逼近西方巨頭,但任何人都能下載並移除安全護欄

TechOrange 科技報橘

更新於 08月25日09:54 • 發布於 08月25日01:54 • Min

當美國政府還在思考,如何有效管理最先進且能力強大的 AI 模型,如 OpenAI GPT-5.6 Sol 與 Anthropic Mythos 等產品,避免產生國安問題時,來自中國的開放權重 AI 模型 GLM-5.2,卻悄悄拉近了差距。

根據人工智慧安全非營利組織 SaferAI 最新報告,由中國廠商 Z.ai 所推出的 AI 模型 GLM-5.2,在網路安全與生物危害知識方面的能力,僅落後 GPT-5.5 和 Claude Opus 4.7 短短數個月。

然而,若跟西方巨頭的商業閉源模型相較,中國開源 AI 模型的安全實踐,顯然跟不上其頂尖的任務處理能力。

AI 能力邊界不等於風險邊界

SaferAI 透過 Z.ai 官方所推出的 API,針對 GLM-5.2 進行安全評估,結果發現,有別於安全護欄嚴格的主流閉源模型,該模型從不拒絕回答任何有關於網路攻擊或生物危害方面的問題。

這情況似乎在提醒外界,開放權重 AI 模型可能會成為有心份子的方便工具,同時當壞人手握利器時,政府甚至還無從監管或限制潛在攻擊者如何使用 AI 技術。

SaferAI 執行董事 Henry Papadatos 向外媒表示,AI 模型的能力邊界並不等同於風險邊界,因此業界必須將風險緩解措施的現狀一併納入考量,才能妥善評估某個 AI 模型真正具備的風險。

換句話說,即便 Z.ai 未來於官方 API 實踐安全護欄,可是一旦有人在自己的硬體上運行開放權重模型,那麼 API 的保護措施就會形同虛設,畢竟使用者能夠在非官方環境中,任意修改、移除安全防護機制,或者對模型進行微調、系統提示詞改寫等操作。

主流閉源模型也會遭越獄攻擊

主流的閉源模型開發商,如 OpenAI 和 Anthropic,通常會仰賴分類器、主動拒絕訓練及 API 管制等安全措施,限制旗下 AI 模型回答網路攻擊或生物危害話題,只是這些防護措施也並非萬無一失,比方「越獄攻擊」就經常能夠繞過主流模型的安全護欄。

另一個人工智慧安全非營利組織 Far.ai 日前就發現,xAI Grok 4.5 及 Google Gemini 3.1 Pro 等前沿模型,存在著數百種通用的越獄攻擊手段,能夠重複迫使 AI 回應有害問題。

當攻擊者結合多種操縱技巧,例如角色扮演、冒用權限、偽造對話歷史紀錄及後續提示等方法,刻意針對 AI 模型防禦機制的弱點時,越獄攻擊通常都能成功。

由此可見,在商業閉源模型都擁有漏洞的情況下,替任何硬體與運作環境所設計,而且通常沒有進一步防護措施的開源 AI 模型,自然具備更高的風險。

為安全過濾訓練資料陷入兩難

為了讓 AI 模型變得更安全,業界提出了許多解方,其中之一稱為「預訓練資料過濾」,即 AI 開發商先從訓練資料中,移除有攻擊性的網路安全資訊,再利用經過篩選的資料集訓練模型。

部分研究指出,預訓練資料過濾可以在不影響整體模型效能的情況下,減少模型回答生物危害相關知識的機率,但是就網路安全領域來說,刻意過濾資料卻會讓模型開發人員陷入兩難。

畢竟,想要訓練出一個既擅長程式碼撰寫,但又不具備優秀駭客能力的通用 AI 模型,本質上非常困難,尤其隨著軟體開發產業已經成為 AI 應用最大市場,模型開發者在尋求限制濫用方法的同時,也面臨著持續提升 AI 能力的壓力。

中國 AI 更在意政治敏感內容

將焦點轉回 GLM-5.2。中國領導人習近平不久之前在世界人工智慧大會上,強調開放權重模型的重要性,同時也指出 AI 必須是受到人類嚴格控管的工具。

專研中國 AI 政策的史丹佛大學網路政策中心專家 Graham Webster 指出,雖然中國擁有完善的人工智慧監管法規,但規定向來只著重於政治敏感內容、虛假資訊及社會穩定,而非 AI 模型的網路攻擊能力或生物危害知識等風險。

Graham Webster 說,相較於中國 AI 環境,美國更加重視這類攸關人類存亡的災難性事物,因此,未來如果真的出現某種因為 AI 而產生的新型風險,西方企業可能會早先一步應對。

同時 Graham Webster 也推論,既然中國 AI 模型開發商,有能力讓模型拒絕處理某些敏感政治議題,那麼理論上他們也可以套用相同機制,調整模型以拒絕回答網路攻擊、生物危害等話題。

攻擊者工具更新總比防禦方更快

無論如何,開放權重 AI 模型對人工智慧產業依然重要,例如 Hugging Face 就曾經仰賴 GLM-5.2 的力量,抵禦 OpenAI 模型意外發起的資安攻擊事件,進而贏得某些支持者。

SaferAI 執行董事 Henry Papadatos 認為,開放權重 AI 模型的優勢,往往被支持者誇大其詞,某些擁有危險能力的 AI 其實也不應該開源釋出。

Henry Papadatos 直言,關鍵在於那些擁有危害性的 AI 能力,不該輕易被任何人、在任何地方輕鬆取得,業界應致力於只讓「有益的功能」被大眾使用。

尤其在通常情況下,Henry Papadatos 強調,攻擊者採用新工具的速度,會比防禦者來得更快,例如勒索軟體集團可能會在一週內就改變作案手法,但正規、合法的企業,卻經常跟不上部署新型防禦手段的速度。

科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉立即投遞履歷

【推薦閱讀】

◆ Anthropic Mythos 找到密碼攻擊新方法:量子電腦之外,AI 成加密安全新變數?
◆ 晶片禁令下的破口:美國嚴防硬體輸中,中國卻年砸 5 億美元買進矽谷訓練資料
◆ Meta、OpenAI、Anthropic 接連爆 AI Agent 越界,專家:真正失控的不是模型,是人類治理

*本文開放合作夥伴轉載,參考資料:TechCrunchSaferAI,首圖來源:Nano Banana 2

(責任編輯:鄒家彥)

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

男離職移居鄉下「月花1.6萬」!3年後資產飆破千萬元

民視新聞網
02

主計總處揭低薪門檻:年薪39萬 2024年約126萬人低於標準

中央廣播電臺
03

00919配息1.1元創高!9/16除息、9/15最後買進日,想月領1萬要買幾張?

數位時代
04

他未成年卻能買5,600萬豪宅被盯上!國稅局抓包下場出爐

經濟日報
05

跟黃仁勳提離職會怎樣? 前員工揭「2小時震撼教育」

CTWANT
06

AI股大淘汰開始?營收創高只剩162家 法人:下一波只剩這種股票能漲

鏡週刊
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...