爆紅中國AI模型Kimi K3惹到白宮 遭控偷用輝達GB300訓練
樹大招風?中國開源AI模型Kimi K3今日遭到美國白宮官員指控,Kimi K3開發商月之暗面是用違法取得的輝達GB300平台伺服器訓練而成,白宮官員同時也指控,Kimi K3是月之暗面私自「蒸餾」Anthropic強大的Fable 5模型而來。
中國新創AI模型業者月之暗面的最新模型Kimi K3在7月中問世,月之暗面宣稱效能領先同儕,僅落後Anthropic強大模型Fable 5與OpenAI剛發表不久的GPT-5.6,而且Kimi K3的Token費用可能只有美國業者的十分之一、或是更低,加上這又是可以調整權重的開源模型,因而引發大批程式開發業者搶用,被視為去年初同為中國AI開源模型DeepSeek的2.0版。
不過,白宮科技政策辦公室主任Michael Kratsios卻在社群媒體X中發文,指控月之暗面違反美國高階AI晶片輸中的禁令,偷偷買下內建輝達GB300的伺服器並在泰國使用,很可能就是為了訓練Kimi K3。
另外,Krarsios也在X推文中透露,有資訊顯示Kimi K3其實是月之暗面私自「蒸餾」Anthropic Fable 5而成,為此,月之暗面開發了一個複雜的內部平台以便蒸餾Fable 5,並能快速切換多種存取Fable 5的方式以規避檢測,這種大規模、偷偷摸摸用蒸餾的方式竊取美國科技成果,是不可接受的。
蒸餾其實是一種常見的AI模型訓練方式,即讓參數量較小的「學生」模型,透過有系統性地不斷丟各種問題讓參數量大的「老師」模型來回答的方式來訓練,學生模型不只能取得與老師模型相近的邏輯特性與能力,還能用極為低廉的成本完成訓練,缺點就是,蒸餾的訓練方式很難讓學生模型的能力「青出於藍」,這也是為什麼若Kimi K3是蒸餾Fable 5而來,效能無法超越Fable 5的主因。
事實上,這不是第一次中國的開源AI模型遭到類似的指控,去年初掀起軒然大波的DeepSeek的V3模型,也被指控有蒸餾OpenAI模型的嫌疑,而DeepSeek宣稱模型訓練過程中,採用輝達H100的中國特供版H800完成訓練,然而,DeepSeek亦同樣被美國官員懷疑可能使用高達5萬張輝達H100做訓練,H100與之後輝達所有的高階AI晶片,都是在2022年9月之後就被美國政府禁止輸中。
更多鏡報報導
AI推論價格戰開打!中國開源模型3美元殺入市場 OpenAI、Meta降價應戰
又捲AI伺服器走私案!美超微急發聲:台灣分公司不是檢調調查目標