美中以外最強 AI 模型出現了,Mistral Large 4 靠 4,000 顆 Blackwell 怎麼追上來?
幾個月前,網路社群還在開玩笑,猜法國 AI 新創 Mistral 會不會做出一款巨大模型。當時一個虛構模型「Le Chaton Fat」在社群平台 X、Reddit 流傳,其中法文「Le Chaton」意指小貓,因此網友不只替它編出超過 30 兆參數等誇張規格,還惡搞它每秒可以「喵」1,000 次。Mistral 執行長 Arthur Mensch 當時也加入玩梗。
如今,這個玩笑真的成了一部分現實。Mistral 10/6 推出新一代旗艦模型 Mistral Large 4(ML4),內部代號「Le Chonk」。Chonk 是網路俚語,常用來形容體型特別圓胖的動物,Mistral 高層向《VentureBeat》表示,這個名字正是刻意向先前支持公司打造大型前沿模型的社群致意。更重要的是,ML4 真的做到了 1 兆參數規模,甚至第三方模型評測機構 Artificial Analysis 稱它為目前「美國、中國以外最聰明的模型」。
Artificial Analysis 指出,ML4 在 Intelligence Index 拿下 38 分,與 OpenAI GPT-6 Luna max 的 38 分相當,接近 DeepSeek V4.1 Flash max 的 39 分,成為目前美國、中國以外得分最高的 AI 模型。
1 兆參數,但每次只啟用 490 億
從目前公開資料來看,Mistral 的做法不只是單純把模型做大,而是同時從模型架構與能力配置下手。
ML4 為原生多模態的混合專家模型(Mixture-of-Experts,MoE),總參數約 1.05 兆,但每次推論只啟用其中 490 億參數。這類稀疏架構可以持續擴大模型整體容量,卻不必每次處理任務都動用所有參數。Mistral 官方標示,ML4 最長支援 100 萬 token 上下文,並以超過 160 種語言進行訓練。
另一個受到關注的數字則是訓練規模。Mistral 表示,ML4 從零開始在自家歐洲資料中心訓練,使用 3,800 顆 NVIDIA Grace Blackwell GPU。前一代 Mistral Large 3 總參數為 6,750 億、每次啟用 410 億參數,當時使用 3,000 顆 NVIDIA H200 訓練;這一代總參數跨過 1 兆,每次啟用參數增至 490 億,訓練 GPU 則增加到約 4,000 顆 Grace Blackwell。《VentureBeat》報導,整個訓練約花兩個月。
相較美國最大型 AI 實驗室的訓練計畫,Mistral 特別強調 ML4 使用的硬體規模相對有限。《VentureBeat》也指出,約 4,000 顆 Blackwell 在絕對數量上並不少,但與大型美國實驗室可動用的資源相比仍有差距。
不只拚通用能力,Mistral 把火力放進企業專業工作
近期 Reflection AI 推出的 Beam 也主打西方開放模型市場,但兩者路線不同。Beam 更強調程式設計、AI Agent 與推論效率;ML4 則在 Artificial Analysis 的整體 Intelligence Index,以及資安、法律、金融等企業專業能力上更突出。
Artificial Analysis 的 Cyber Index 中,ML4 得到 50 分,與中國 Z.ai 的 GLM-5.3-Flash 相當,並高於 Kimi K3、DeepSeek V4.1 Flash max。Mensch 接受《Reuters》訪問時也表示,ML4 在部分領域、尤其資安,已超過部分中國開放權重模型。
法律工作也有類似表現。Mistral 公布,ML4 在 Harvey Legal Agent Benchmark 的任務通過率約 15%。《VentureBeat》比對 Vals.ai 公開排行榜指出,若採用相同測試方法,這項成績將高於 Kimi K3、MiMo V2.6 Pro 與 GLM-5.3,但仍有多款閉源模型排在前面。
金融方面,Mistral 公布 ML4 在 Finch 企業金融與會計工作流程測試取得 67%,與 DeepSeek V4 Pro 0813 並列。這項測試涵蓋試算表、文件搜尋、建模與報告等長流程任務,不過 ML4 的成績目前仍來自 Mistral 自行公布。
Mistral 副總裁 Pierre Stock 向《Reuters》表示,公司也正試圖縮小程式設計、金融、地理空間分析與晶片設計等能力的差距。換句話說,ML4 的競爭方式並不是要求所有 benchmark 都拿第一,而是先在企業較可能直接採用的專業工作上拉高能力。
美中以外第一,不代表已經追上最前沿模型
不過,「美中以外最強」並不等於已追上全球最前沿模型。ML4 的 Intelligence Index 為 38 分,雖是目前美中以外最高,但 Google Gemini 4 Argon 等最新前沿模型仍取得更高分數;在部分程式設計測試上,ML4 也沒有全面超過美中競爭者。
此外,成本也還不是它最突出的優勢。Artificial Analysis 計算,ML4 每完成一項 Intelligence Index 任務平均成本約 1.13 美元,代表它雖然把歐洲模型重新推回較高的能力區間,但還不能只從模型規模或訓練 GPU 數量,就推論它已在效率上超越美中競爭者。
ML4 的意義,更像是 Mistral 在沒有複製美國最大規模算力投入的情況下,透過 1.05 兆參數、每次啟用 490 億參數的 MoE 架構,再加上對資安、法律、金融等企業專業工作的強化,做出目前美中以外第三方評測最高分的模型。
ML4 目前仍處於公開預覽階段,Mistral 預計 10/27 釋出模型權重;在此之前,將先與資安專家、合作夥伴及政府單位進行測試。對 Mistral 而言,接下來真正要驗證的,是排行榜上的進步能否進一步轉成企業實際部署時的競爭力。
【推薦閱讀】
◆ 中國的開放模型對手來了?Reflection AI 推 Beam,憑什麼挑戰 GLM、Qwen
科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容
*本文開放合作夥伴轉載,資料來源:Mistral AI、《CNBC》、《VentureBeat》、Artificial Analysis、《Reuters》,首圖來源:Mistral AI