請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

Google 三週又升級 Gemini 3.7 Flash:為何定位 Flash 成 Agent 日常主力?

TechOrange 科技報橘

更新於 08月14日11:30 • 發布於 08月14日03:30 • 廖紹伶

Google 於美國時間 8/13 推出新一代 AI 模型 Gemini 3.7 Flash,距離上一代 Gemini 3.6 Flash 發表僅隔了三週。除了強化程式開發、企業工作流程與 AI Agent 能力,Google 還祭出限時價格策略:今年底以前,Gemini 3.7 Flash API 每百萬 input tokens 為 0.75 美元、output tokens 為 3.75 美元,只有 2027 年起標準價格的一半。

不過另一個變化更值得注意。Google 將 Gemini 3.7 Flash 稱為目前「最聰明的 coding 與 Agents 主力模型(workhorse model,工作馬模型)」。過去 Flash 系列最鮮明的特色是速度、低延遲與較低成本,為什麼到了 AI Agent 時代,Google 反而要讓 Flash 承擔更多複雜的 AI Agent 工作?

Flash 不只求快,Google 補上 Agent 需要的執行能力

答案之一,要看 Gemini 3.7 Flash 這次升級了什麼。Google 表示,Gemini 3.7 Flash 在遇到阻礙時更能調整策略,必要時會釐清使用者意圖,也能更準確遵循指令。Google 特別強調,新模型會在多步驟規劃(multi-step planning)與工具調用(tool calls)投入更多推理,不只是減少執行步驟,而是希望降低重試與人工監督,提高整體執行品質。

這些改變直接反映在 Google 公布的 Agent 與程式開發測試成果。《VentureBeat》整理 Google 數據指出,在測試長時間軟體工程能力的 DeepSWE v1.1,Gemini 3.7 Flash 得分從上一代的 49.0% 提高至 65.3%;測試企業工作流程自動化的 AutomationBench,也從 17.0% 上升至 30.4%。測試 production code quality 的 FrontierCode 1.1,則從 34.4% 提升至 43.6%。

但這不代表 Gemini 3.7 Flash 已經成為能力最強的模型。Google 自己公布的比較中,GPT-5.6 Terra 在 DeepSWE、Terminal-bench 等部分測試仍然領先,Claude Sonnet 5 在 Agent’s Last Exam 的多模態桌面與作業系統任務也有較高成績。

換句話說,Google 要做的不是讓 Flash 在所有項目超越旗艦模型,而是在原本的速度與效率優勢之外,逐步補上規劃、工具使用、錯誤恢復與長流程執行等 Agent 所需要的能力。

為什麼 AI Agent 反而需要一匹「工作馬」?

這也與 AI Agent 使用模型的方式有關。一般聊天機器人可能經過一次問答就完成任務,但 Agent 要真正替使用者完成工作,往往得先理解需求、拆解步驟,再讀取資料、呼叫工具、執行操作、檢查結果,遇到問題後還得修改策略重新執行。模型因此不只要「夠聰明」,還得同時兼顧速度、可靠性、token 使用量與成本,才能被反覆、大量呼叫。

事實上,Google 並不是到了 Gemini 3.7 Flash 才開始把 Flash 往這個方向發展。今年 5 月推出 Gemini 3.5 Flash 時,Google 就已經把「大規模執行 Agent 任務」列為核心定位,主張速度與效能的平衡,讓 Flash 適合長時間、多步驟 Agent 任務。6 月,Google 更把 computer use(電腦使用)直接整合進 3.5 Flash,讓開發者打造能看懂畫面、推理並操作瀏覽器、手機與桌面的 Agent。

到了 7 月底推出 Gemini 3.6 Flash,Google 又把這個方向說得更清楚:企業要大規模部署 Agent,需要更高的 token 使用效率、更低的延遲,以及更可靠的執行能力。因此,3.6 Flash 特別減少不必要的推理步驟、對話輪次與工具調用,希望避免 Agent 陷入反覆執行的迴圈。

三週後的 3.7 Flash,Google 則進一步調整這套思路:不是一味讓 Agent 少想幾步,而是在需要時投入更多規劃與推理,提高每一步的執行品質。

Pro、Flash、Flash-Lite,Google 開始按「工作」分配模型

這也讓 Gemini 不再只是簡單按照模型能力高低排列。Google Cloud 對 Gemini 3.7 Flash 的產品定位,就是把它放在負責深度推理的 Pro 與追求高吞吐量的 Flash-Lite 之間,讓 Flash 承接多步驟編排、程式碼重構與企業 Agent 等需要一定推理能力,又必須頻繁執行的工作。

這樣的分工其實早有跡象。今年 Google I/O 上,Google 執行長 Sundar Pichai 就透露,開發者已經把 Flash 當成日常開發的主力核心,而 Pro 則被用於需要深度推理與多模態能力的工作。

Google 近期甚至把這種分工直接落進 Agent 產品。7 月底更新 Gemini API 的 Managed Agents 時,Google 就將 Gemini 3.6 Flash 設為預設模型。一個 API 呼叫背後,可以讓 Agent 協調推理、執行程式碼、安裝套件、管理檔案與網路搜尋等一連串工作。

因此,與其把 Gemini 模型理解成「Pro 最強、Flash 次之、Flash-Lite 最弱」,Google 現在的產品策略更接近依照工作負載分工:需要最深層推理時使用 Pro,需要大量、高吞吐量任務時有 Flash-Lite,而 Flash 則定位在中間,成為兼顧能力與效率、能反覆執行日常 Agent 工作的「主力模型」

價格砍半,也是模型策略的一部分

從這個角度看,Gemini 3.7 Flash 的限時價格砍半,也不只是一次促銷。Agent 完成一項工作,背後可能產生多次模型呼叫、推理與工具互動。當企業要讓數十、數百個 Agent 持續執行程式開發、文件處理或企業流程,模型能不能大量使用,就和每次執行需要付出多少成本直接相關。

《VentureBeat》因此指出,企業真正需要衡量的,不只是每百萬 tokens 的價格,而是成功完成一項任務的成本。一款模型即使 token 單價便宜,如果需要不斷重試、頻繁人工介入,最後未必比較省;反過來說,如果 3.7 Flash 能如 Google 所稱,以更好的規劃與執行降低重試次數,價格與能力提升才可能一起轉化成更低的 Agent 營運成本。

Gemini 3.7 Flash 因此不只是 Google 又推出一款更快、更便宜的模型。從 3.5 開始強化長時間 Agent 任務,到 3.6 追求執行效率,再到 3.7 補強規劃與工具使用,Google 正逐步讓 Flash 從追求速度的模型,變成能大量承接 AI Agent 日常工作的主力模型。

當 AI 從回答問題走向實際執行工作,企業選擇模型時要問的問題,也可能從哪個模型最強,進一步變成哪個模型最適合負責哪一種工作。

【推薦閱讀】

token 最高省 65%!Google 推 Gemini 3.6 Flash 等新模型,成本為何成最大亮點?

Grok 4.6 強攻長時間 AI Agent:企業選模型不能再只看 Token 單價

Cloudflare Wallets 讓 AI Agent 自主付款:為何網路基礎設施商也開始做支付?

*本文開放合作夥伴轉載,資料來源:《VentureBeat》GoogleGoogle CloudArtificial Analysis《Ars Technica》,首圖來源:Google

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

台幣升值吃掉航空貨運承攬業獲利 9月未現旺季行情已有包機解約

ETtoday新聞雲
02

動物大搬家40週年 國發會釋出珍稀影像

NOWNEWS今日新聞
03

午餐時段人龍長 好市多西式餐飲部祭新制 10月起先掃會員卡

太報
04

台股ETF本週25檔將除息 13檔年化殖利率逾10%

中央通訊社
05

醫療險最大地雷曝光!每4件理賠爭議就有1件卡在「這理由」

鏡週刊
06

爆!違反內部控制制度規定 這大廠遭重罰100萬!

三立新聞網
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...