請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

Gemini 4 終於登場:一次可輸出 100 萬 token,Google 為何要把 AI 單次工作量做這麼大?

TechOrange 科技報橘

更新於 2026年10月1日19:58 • 發布於 5小時前 • 廖紹伶

Google 在美國時間 9/30 推出新一代旗艦模型 Gemini 4 Argon,這也是自 2025 年 11 月 Gemini 3 系列後,睽違近一年再更新的最高階模型。而原訂今年 6 月推出的 Gemini 3.5 Pro 最終取消,Google 直接進入 Gemini 4 世代。

《Axios》指出,在這段期間,Google 主要推出速度更快、成本更低的 Flash 模型,OpenAI、Anthropic 則持續更新前沿模型,Gemini 4 因此也肩負 Google 重返最高階模型競爭的任務。Google 將 Argon 稱為目前為複雜工作負載打造、效能最高的模型。其發言人向《Reuters》表示,它在關鍵程式設計與資安測試上的表現,可與 OpenAI Astra、Anthropic Opus 等前沿模型相比。

Argon 並非全面領先,Agent 能力進步更值得看

Google 公布的測試中,Argon 在衡量長時間真實軟體工程任務的 DeepSWE v1.1 拿下 77.9%,高於 Astra 的 74.1% 與 Opus 5.5 的 74.2%;但在測試真實軟體專案除錯與修改能力的 FrontierSWE v2,Argon 僅有 55%,低於 Astra 的 65.5%;在測試 AI Agent 透過終端機完成多步驟開發與系統任務的 Terminal-Bench 4.0,57.4% 也低於 Opus 5.5 的 66.4%。

圖片來源:Google

第三方評測也顯示,Argon 的進步尤其集中在 Agent 能力。Artificial Analysis 指出,過去相對是 Gemini 弱項的 Agent 工作,這一代已有明顯提升:Argon High 在整體 Intelligence Index 得到 53 分;在衡量 Agent 執行企業流程能力的 AutomationBench-AA 更取得 77.5%、排名第一。不過,其他 Agent 測試並非都占優勢,例如 Terminal-Bench 4.0 僅有 57%,仍落後部分 OpenAI、Anthropic 模型。

圖片來源:Artificial Analysis

Output Token 一口氣拉高到 100 萬

比起又一次模型排名,Gemini 4 Argon 還有一項更特殊的設計:Google 將 Output Token(輸出詞元)上限從 64K 一口氣拉高到 100 萬。這和過去常見的百萬 Context Window(上下文視窗)不同,後者代表模型一次能讀進多少資料,Output Token 則決定模型單次能持續產生多少文字、程式碼與其他輸出,也為更長的 Agent 工作流程留下更大的執行空間。

Google 展示的案例也不是生成更長文章,而是處理更大型的實際工作。官方表示,一組 Argon Agent(代理)分析 Google 資料中心的效能資料,自主找出並套用記憶體最佳化方法,目前已釋放超過 300 TiB 記憶體;另一批 Agent 則協助把 C/C++ 程式碼遷移到 Rust,規模一路擴大到超過 80 萬行的 Fuchsia Zircon kernel。

100 萬輸出 token 的意義,因此不只是讓 AI 工作更久,而是放大模型一次能承接的工作規模。原本可能需要拆成多輪模型呼叫、不同工具或由人員中途接手的工作,Google 正嘗試讓模型沿著同一條工作路徑完成更多步驟。

工作單位變大,Google 瞄準哪些企業任務?

這也解釋了為什麼 Argon 的應用場景集中在軟體工程、資安、金融與法律。這些工作的共同特徵,是資料量大、流程長,而且一次任務往往包含分析、判斷到實際產出。Google 也特別強調 Argon 在多步驟金融研究、法律研究與文件草擬等工作上的能力。

《VentureBeat》分析,對程式碼遷移、稽核、法律審查等工作來說,更長的輸出能力可以減少模型中途停下、重新取得脈絡或交回人類處理的次數。對企業來說,真正的差別在於,原本需要多次模型呼叫或人工接手的任務,是否能被壓縮成更連續的 AI 工作流程。

能做更多事,但還沒立即全面開放

不過,Argon 發布後並未立即向所有開發者或消費者開放。Google 先透過 Fairwind Program 提供給經過審核的資安防禦團隊,並參與美國政府的模型預先存取自願機制,之後才預計擴大至付費 API 客戶、企業與 Google AI Ultra 用戶。

Google 也把這種長流程能力率先放進資安場景。Google 表示,Argon 能自行尋找、驗證並修補軟體漏洞;對受信任的資安團隊,還會提供減少部分 Cyber Guardrails(資安防護限制)的版本。另一方面,模型自主執行的工作越長,一旦偏離原本任務,影響也可能跟著擴大,因此 Google 同時強化 Prompt Injection(提示詞注入)防禦、模型行為監測與 Sandbox(沙箱)隔離。

Gemini 4 Argon 接下來真正需要驗證的,因此不是 100 萬 token 能不能跑滿,而是任務拉長之後,AI 能否減少中途接手與工作拆分,同時把錯誤、人工介入與推論成本控制在企業可接受的範圍內。

科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

◆ OpenAI 推出 Dots 到底新在哪?AI Agent 正從「接任務」走向「接責任」

◆ OpenAI 研究揭 AI Agent 新風險:惡意上下文可能從 Email 一路傳到工具操作

◆ 美國政府打造 AI 服務入口 : America.gov 搭載 Gemini、Grok 整合 2.9 萬個政府網站

*本文開放合作夥伴轉載,資料來源:《AXIOS》、《VentureBeat》、Google、Artificial Analysis,首圖來源:Google

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

AI搶飯碗是真的!美國調查驚爆「近7成上班族剉咧等」 6大職業10年內恐消失

鏡週刊
02

台股大漲413點再創高!「這族群」昨漲停今卻拉回 三大法人合計買超292.5億

Newtalk
03

三季猛漲578%!「妖股」大甲今殞落 暴跌亮燈跌停

EBC 東森新聞
04

大露臺像坐擁小花園?別急著心動 房仲揭漏水、產權地雷:買前看「6重點」

住展
05

鳳梨酥名店維格餅家退出興櫃 連虧6年董事會決議終止買賣

上報
06

勞動基金前8月大賺2.3兆 新制勞退分紅12.39萬元再破紀錄

自由電子報
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...