AI「內心戲」全曝光?新技術破解大模型推理軌跡,爆機密外洩隱憂
研究人員近日發現了一項新技術,能夠從前沿 AI 模型(Frontier AI Models)中提取出原本被隱藏的「推理軌跡」(Reasoning traces),讓 AI 在解決問題時的內部思考過程無所遁形。
這項涵蓋 OpenAI、Anthropic 與 Google API 模型的最新研究,不僅點出潛在的資安隱憂,更因發現部分「開放權重模型」(Open-weight models)的推理模式與美國頂尖閉源模型高度相似,再度引發外界對技術外流與模型蒸餾(Model distillation)的強烈關注。
重大發現與資安隱憂
這項研究由德國圖賓根大學(University of Tübingen)、馬克斯普朗克研究所(Max Planck Institute)、AI 安全組織 MATS Research 及資安公司 Snyk 的團隊共同完成。研究團隊指出,這項提取技術不僅能看透模型的思考步驟,過去甚至曾被用於還原密碼與 API 金鑰等敏感機密資訊(相關安全漏洞目前已被原廠修補),引發實質的資安風險。
參與研究的圖賓根大學電腦科學家 Alexander Panfilov 更強調,團隊測試的所有主要前沿模型供應商都存在這項跨平台的普遍弱點,這不僅可能導致個資外洩,更讓大規模的「推理蒸餾攻擊」成為可能。
研究論文針對不同模型的推理軌跡進行了測試比對,結果呈現不同的現象。其中,知名開放權重模型 Moonshot AI 的 Kimi K3,在特定提示(Prompts)下的輸出內容,與美國閉源模型 Claude Opus 4.8 及 GPT 5.6 Sol 的隱藏推理步驟相當接近。
不過研究人員嚴謹地強調,這並不能直接做為存在蒸餾行為的鐵證。相對而言,中國的 DeepSeek 以及美國公司 Thinking Machines 開發的 Inkling,則未表現出相同的推理相似性。
研究團隊已於上個月向相關企業通報此漏洞,促使這些公司採取行動:
Anthropic:發言人 Michael Aciman 表示,公司高度重視獨立研究,並已針對報告指出的「重播行為」(Replay behavior)部署了短期緩解措施。他特別澄清,此項研究並未涉及取得加密金鑰、存取基礎設施,也未從其系統中獲取任何個資。
OpenAI 與 Google:這兩家公司在接獲通知後,已著手調整了 API 運作以降低風險,但雙方皆未對外做出正式回應。
美中 AI 角力下的「蒸餾」爭議
這項發現讓「模型蒸餾」再次成為美中 AI 競爭與業界關注的核心焦點。
蒸餾技術原本是常見的訓練手法,開發者常透過吸收既有模型的輸出精華,來有效提升新模型(尤其是開放權重模型)的能力。然而,近期這項技術越來越常被外界視為「複製」甚至「抄襲」閉源模型核心能力的捷徑。
研究團隊總結,這次的新發現證實了一項隱憂:透過新的抽取手法,從閉源模型中能夠被「蒸餾」出來的內部資訊,恐怕遠比外界原先預想的還要多。
(首圖來源:Unsplash)