請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

遲到一年的逆襲?Google躍級發布Gemini 4 Argon:綜合智力重回前三,為何實戰能力被打問號?

數位時代

更新於 2天前 • 發布於 2天前 • 李先泰

Google在美國時間9月30日(台灣時間10月1日)發表新一代旗艦模型Gemini 4 Argon,距離上一代Gemini 3將近一年,也是Google DeepMind超過7個月來第一款比輕量Flash系列更高階的模型。

獨立評測機構Artificial Analysis的綜合智力指數顯示,Argon拿下53分,與OpenAI的GPT-6 Astra並列,以這項指數衡量,Google重回AI實驗室前三強。不過,Argon截至10月1日只開放給少數資安合作夥伴試用,《Bloomberg》也引述知情人士報導,部分Google員工認為它實際寫程式的表現不如跑分亮眼。

3.5 Pro跳票之後,Argon是什麼來頭?

Argon來得比預期晚。Google在5月的I/O開發者大會預告Gemini 3.5 Pro、承諾隔月推出,最後卻沒有發表;《Bloomberg》引述知情人士指出,Google已放棄3.5 Pro。事實上,這段空窗期Google確實只持續推出更小、更便宜的Flash模型,反觀OpenAI與Anthropic則一路往前衝。

Google DeepMind負責人Koray Kavukcuoglu具名發布的官方部落格文章指出,Argon專為長時間、多步驟的複雜任務打造,主攻軟體工程、法律與金融等企業知識工作,以及資安防禦。Google DeepMind的Gemini產品負責人Tulsee Doshi接受《Axios》採訪時表示:「Argon是一款全方位的模型,在多個領域都具備最前沿的能力。」

最直觀的變化是輸出長度的上限。AI模型處理文字的基本單位稱為token,Argon的輸出上限從前代的6.4萬個token拉高到100萬個,換算約為75萬個英文單字。Google的說法是,模型有足夠空間深入推理,才能一次解開困難問題。實際使用時,這麼長的回應要靠Gemini API新功能Long Decode Continuation,把長回應暫停、再透過後續呼叫接續下去,Artificial Analysis測試時就是這樣做,以避免請求逾時。

Google內部已大量使用Argon。以Google開源的影片解碼軟體libgav1為例,Google讓多個Argon分頭作業,接手一個既有的Rust(一種較能避免記憶體漏洞的程式語言)版本,把其中3.2萬行針對處理器加速的程式碼(SIMD)改寫成安全的Rust寫法,最後產出的解碼器比原本的Rust版快2.7倍,輸出畫面完全一致。

開放節奏則相當保守。Argon第一階段只透過Fairwind計畫開放給一群受信任的資安防禦者,Google也參與美國政府的自願性機制,讓政府在模型公開前先取得使用權限。等測試回饋到位、防護機制調整完成,才會擴大開放給開發者、企業與消費者,首批是付費API客戶與Google AI Ultra訂閱用戶,Google並未公布具體時程。

跑分追上了,價格優勢卻是打折換來的

根據Artificial Analysis的測試,Argon在最高推理強度下的綜合智力指數為53分,與GPT-6 Astra並列,略高於OpenAI另一款GPT-6.1 Sol(52分);相較Google上一款非Flash等級的模型Gemini 3.1 Pro Preview(30分),一口氣大進23分。

進步主要來自兩處。第一是代理能力,也就是讓AI自己拆解步驟、操作工具完成任務,這向來是Gemini的弱項。Argon在Artificial Analysis版的自動化測試AutomationBench-AA拿下77.5%,排名第一,領先Anthropic的Claude Sonnet 5.5約6個百分點;在測試命令列操作能力的Terminal Bench 4拿到57%,僅次於Claude Sonnet 5.5、Claude Opus 5.5與GPT-6 Astra。

第二是幻覺率。在AA-Omniscience知識測試中,Argon的幻覺率為15%,是綜合指數45分以上模型中最低,GPT-6 Astra則為51%。換言之,Argon遇到不知道的問題,比較會老實承認,而不是硬猜,但代價是答對率只有50%,低於GPT-6 Astra的63%。

Google自家公布的成績則包括:測試長時間軟體工程任務的DeepSWE v1.1拿下77.9%,創下最佳成績;測試資安漏洞修補能力的CWE-bench v1以68%並列第一。

價格是另一個賣點,但要看清楚條件。Argon首發優惠價為每100萬個輸入token 2美元(約新台幣64元)、輸出token 10美元(約新台幣319元),是原價4美元(約新台幣127元)與20美元(約新台幣637元)的五折,Google未公布優惠期限。

Artificial Analysis推算,在首發五折、加上快取折扣提高到95%(重複送入模型的內容大幅打折)的條件下,Argon完成一項綜合指數測試任務平均花1.99美元(約新台幣63元),只要GPT-6 Astra(3.26美元,約新台幣104元)的6成。

不過,較低的測試任務成本主要來自優惠定價與快取折扣,並非更省token。 在這項測試中,Argon每項任務平均輸出6.2萬個token,是GPT-6 Astra(2.7萬個)的兩倍多;一旦優惠結束,每項任務成本會升到3.98美元(約新台幣127元),約為GPT-6 Astra的1.2倍。

內部雜音:分數漂亮,實戰寫程式卻未必

發表當天,《Bloomberg》引述多名直接接觸開發的知情人士報導,Gemini 4在業界常用的基準測試上表現亮眼,但員工實際拿來工作時表現較差,處理某些寫程式任務有困難;其中一人指出,Argon不太擅長決定App與網站外觀的前端設計。

報導也點名業界常見的「刷榜」(benchmaxxing)現象,指的是工程師把心力放在拿高分,而不是做出真正好用的產品,兩名知情人士認為Gemini 4似乎受此影響。AI新創Surge AI創辦人Edwin Chen比喻:「就像說『我家小孩SAT(美國大學入學考試)考得很好』,但SAT成績並不等於現實世界的表現。」

Google內部看法並不一致。部分員工認為Anthropic的Fable與OpenAI的Astra進步速度比Gemini更快,Gemini 4即使在最佳狀態,某些面向仍會落後;也有員工認為新模型已追上領先實驗室。

延伸閱讀:Google AI掌門換人!13年老將接棒哈薩比斯:Koray Kavukcuoglu是誰?如何搶救Gemini劣勢?

資料來源:Google官方公告、《Axios》、《Bloomberg》、Artificial Analysis評測、Artificial Analysis X貼文、鉅亨網匯率

本文初稿為AI編撰,整理.編輯/ 李先泰

「加入《數位時代》LINE好友,科技新聞不漏接」

查看原始文章

更多理財相關文章

01

新店央北百億建案深夜火警 建商「突發重訊」曝真相

三立新聞網
02

維格餅家喊撤興櫃!股價腰斬再暴衝73% 網傻:迴光返照

EBC 東森新聞
03

台積電傳攜手Terafab赴德州蓋晶圓廠 馬斯克親回應:有在討論

鏡報
04

台積電美國第二園區要來了?馬斯克認「討論中」 川普一句話更震撼

CTWANT
05

勞保45800最高級距保24年!男子「54歲驟逝」家屬竟一毛都領不到 關鍵2原因曝

鏡報
06

黃仁勳愛女黃敏珊驚傳新婚 三星會長李在鎔紐約晚宴親揭:2天前才嫁人

CTWANT
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...