AI 戰局大洗牌:Grok 狂升智力、Gemini 秀神速、DeepSeek 漲價惹議
近期,人工智慧模型市場的競爭再度升溫。DeepSeek 發表了 V4 Pro 0813,xAI 推出 Grok 4.6,Google 也帶來了 Gemini 3.7 Flash。三家科技巨頭的新模型幾乎同台登場,讓外界的目光重新聚焦於各家在「智慧、速度與價格」上的激烈較勁。
根據獨立評測網站 Artificial Analysis(AA)的測試結果,這波新模型各自展現了截然不同的戰略布局:DeepSeek 漲價引發熱議且表現未如預期;Grok 4.6 在智慧與代理型任務上大放異彩;Gemini 3.7 Flash 則以極致速度見長,完美平衡了效能與智慧。
Grok 4.6:智力躍進,長程代理任務的效率優選
做為這波更新中最受矚目的焦點,Grok 4.6 的表現令人驚豔。開發商 xAI 表示,該模型透過更長時間的預訓練,並結合 AI 生成資料與高品質工程數據來強化推理能力;後訓練階段更以 Grok 4.5 為基礎,進行監督式微調與強化學習。
躋身頂尖行列:AA 評測指出,Grok 4.6 的智慧指數高達 61 分,不僅與 GPT-5.6 Sol 齊名,更正式躋身 60 分以上的頂尖模型行列。
高性價比與低耗能:價格方面,它維持了極具競爭力的收費標準(每百萬輸入 token 2 美元、輸出 6 美元)。此外,Grok 4.6 執行實際任務平均僅需 53 回合、約 5 億個輸入 token,資源消耗顯著低於部分競品,這對於處理長流程代理工作極為有利。
DeepSeek V4 Pro 0813:表現保守,峰谷定價策略惹議
向來走低價高量路線的 DeepSeek,本次更新卻伴隨著漲價聲浪。AA 給予其 53 分的智慧指數,雖然優於先前的預覽版,但在同級競品中仍顯得保守。
表現與成本:儘管在 GPQA Diamond 與 Terminal-Bench v2.1 等測試中表現尚可,且單次任務費用約 6 美分(在 104 個模型中名列第二便宜),但新實施的計費機制卻引發疑慮。
定價爭議:DeepSeek 同步宣布 API 採峰谷定價,將北京時間上午 9 點至中午、下午 2 點至 6 點列為高峰時段。在部分情境下,價格最高恐飆升近原先的 12 倍,這讓市場不禁質疑其「平價 AI」的定位是否已經受到衝擊。
Gemini 3.7 Flash:極致神速,主打開發實用性與均衡配置
Google 推出的 Gemini 3.7 Flash 則將重心放在速度與實用性。其智慧指數達 56 分(較前代提升 4 分),AA 認為這歸功於代理型任務與程式開發能力的顯著進步。
效能全面提升:該模型在 DeepSWE v1.1、FrontierCode、WebDev Arena 與 AutomationBench 等多項專業測試中皆有大幅提升。
速度與價格雙打:最令人矚目的是,其輸出速度飆升至每秒 340 個 token,成為這波新模型中速度最突出的產品。配合 Google 祭出的半價策略(至 2026 年底前,維持每百萬輸入 0.75 美元、輸出 3.75 美元),展現了極高的吸引力。
(Source:Artificial Analysis)
整體而言,這一輪的新模型發布突顯了 AI 領域的競爭型態已發生轉變:市場不再單純比拚單一分數,而是展開「智慧、代理能力、速度與成本」的綜合考驗。Grok 4.6 專注於長程任務的高效能,Gemini 3.7 Flash 以神速與均衡配置取勝,而 DeepSeek 則亟需在低價優勢與漲價壓力之間找尋新的立足點。
(首圖來源:pixabay)