請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

Google發表Gemini 3.7 Flash!編碼評測與GPT-5.6 Terra互有勝負,促銷價約三分之一

數位時代

更新於 08月14日04:02 • 發布於 08月14日04:00 • 李先泰

Google 於美國時間 8 月 13 日(台灣時間 14 日)發表 Gemini 3.7 Flash,距離上一版 3.6 Flash 推出僅隔三週,官方將它定位為「歷來最聰明的工作馬模型」,鎖定編碼與 AI 代理(能自主執行多步驟任務的 AI)工作。

這款模型以截至 2026 年 12 月 31 日的促銷價供應(標準定價的一半),約為 OpenAI 主力模型 GPT-5.6 Terra 定價的三分之一;官方公布的編碼評測顯示兩者互有勝負,第三方評測機構 Artificial Analysis 的綜合智慧指數則只落後 GPT-5.6 Terra 一分,完成單一任務的速度快 40%。當企業客戶越來越在意 AI 帳單,這場發表的主角與其說是能力,不如說是價格。

Google 執行長皮蔡(Sundar Pichai)在 X 發文表示,Flash 系列是 Google 的「工作馬」(workhorse),白話說就是負責消化大量日常任務的主力模型:「提供高性能與絕佳價格,因此我們快速推出更新,將它們交到開發者手中。」這已是 Google 三個月內第三次更新主力 Flash 型號(從 3.5、3.6 到 3.7),還不含同期的 Flash-Lite、Flash Cyber 等衍生版本。

依官方公布的測試成績,衡量產品級程式碼生成能力的 FrontierCode 1.1 Main,得分從上一版的 34.4% 提升到 43.6%;軟體工程實測 DeepSWE v1.1 更從 49.0% 跳升至 65.3%。

對上 GPT-5.6 Terra,官方對照表則顯示互有勝負:Gemini 3.7 Flash 在 FrontierCode 1.1 Main(43.6% 對 41.3%)與網頁開發測試 Code Arena(Elo 1588 對 1523)領先,在長程軟體工程 DeepSWE v1.1(65.3% 對 69.6%)與終端機代理測試 Terminal-bench 2.1(85.8% 對 87.4%)則落後。

開發者可透過 Gemini API、Google AI Studio 等管道取用;個人用戶方面,Google AI Pro 與 Ultra 訂閱者專屬的個人 AI 代理服務 Gemini Spark,自 8 月 13 日起改用 3.7 Flash,但該服務尚未開放歐洲經濟區、英國、瑞士與奈及利亞。

綜合智慧只差一分、速度快 40%:第三方實測數據

Artificial Analysis 在 X 公布發布前實測:Gemini 3.7 Flash 在高推理模式下的綜合智慧指數(涵蓋代理、編碼、知識工作等多類任務的總和評分)拿下 56 分,比 3.6 Flash 提升 4 分,僅次於並列 57 分的 GPT-5.6 Terra 與 Meta 的 Muse Spark 1.2。

速度是它最突出的優勢。 該機構指出,Gemini 3.7 Flash 每秒可輸出約 340 個 token(模型計算文字量的單位),幾乎是 GPT-5.6 Terra 的 3 倍;換算成實際工作情境,完成測試中單一任務平均只要 1.7 分鐘,比 GPT-5.6 Terra 快 40%。以促銷價計算,每項任務成本約 0.4 美元,比 3.6 Flash 便宜 30%。

在兩項測試中,這款平價模型甚至擊敗各家旗艦:試算表與文件問答測試 AA-AnalystAgent 拿下 60%,領先 Anthropic 的 Claude Opus 5(53.8%);模擬企業軟體環境的代理測試 AutomationBench-AA 也以 62.7% 居首,領先第二名的 Kimi K3(52.7%)。

價格差距則更直觀。截至 2026 年 12 月 31 日,Gemini 3.7 Flash 促銷價為每百萬 token 輸入 0.75 美元、輸出 3.75 美元;對比 OpenAI 於 7 月 30 日調降後的 GPT-5.6 Terra 定價(輸入 2 美元、輸出 12 美元),輸入為對手的 37.5%、輸出為 31.25%。2027 年 1 月 1 日起恢復標準定價(輸入 1.5 美元、輸出 7.5 美元)後,則為對手的 75% 與 62.5%,價差明顯縮小。

當價格變成最重要的 benchmark

科技研究機構 Constellation Research 旗下 Constellation Insights 總編輯 Larry Dignan 在評論中直言,大型語言模型最有價值的基準測試(benchmark)正快速變成價格:「我們大可繼續比較其他基準測試,但誰在乎呢?Gemini 3.7 Flash 會夠好用。」 他觀察,token 成本已是各企業財報電話會議上反覆出現的關鍵字,沒有一家企業不在緊盯 AI 預算。

同篇文章中,Dignan 也引述 Palantir 執行長艾力克斯.卡普(Alex Karp)對當今前沿模型收費模式的觀點:「這套 token 收費模式對 AI 實驗室或許行得通,但對其他所有人都行不通。它正在打破企業預算,卻拿不出足以合理化開支的成果。」

值得注意的是,就在 Google 降價的同一週,以低價聞名的 DeepSeek 反其道而行。《彭博》報導,DeepSeek 自 8 月 16 日起實施尖峰時段動態定價,最先進的 V4-Pro 模型尖峰時段輸出價格從每百萬 token 0.87 美元調高至 3.96 美元,約為原先的 4.6 倍(漲幅約 355%);DeepSeek 官方說法是為了「更合理地分配資源」,鼓勵開發者把工作移往離峰時段,且調漲後價格仍遠低於美國對手。

企業支出管理平台 Ramp 的 8 月報告則提供另一個註腳:在其 token 支出管理產品觀測到、樣本較偏科技業的企業客戶中,Anthropic 性能最強、也最貴的旗艦模型 Fable 5 上市一個月,僅占受觀測 Anthropic token 採購量的 6%,顯示這群企業為「更聰明」多付錢的意願有明確上限。

延伸閱讀:Gemini完整教學地圖!39篇實測整理,Notebooks、Spark、提示詞架構全打包

資料來源:Google 官方公告Gemini Flash 官方頁Gemini API 定價Sundar Pichai X 發文Artificial Analysis X 發文AA-AnalystAgent 榜單AutomationBench-AA 榜單OpenAI GPT-5.6 Terra 模型頁OpenAI API 更新日誌Constellation Research《彭博》Ramp AI Index

本文初稿為AI編撰,整理.編輯/ 李先泰

延伸閱讀

讓員工人手數個AI代理!Appier毛利率首破60%、人均毛利年增38%,2026全年財測上修
每次叫AI做事都要交代「不要猜」?這5條守則貼給它,開工前再也不用囉哩八唆
「加入《數位時代》LINE好友,科技新聞不漏接」

查看原始文章

更多理財相關文章

01

00878配息1.01元創高!會不會只是曇花一現?達人教靠配息過生活:不怕「ETF老闆」突然砍薪水

幸福熟齡 X 今周刊
02

增2檔抓去關!「長興小金雞」入列

三立新聞網
03

台積電2000元以下可能嗎?專家揭最新甜甜價 曝最穩健法門「靠6字」

鏡報
04

買在1027元!「這檔」苦主慘套牢不敢開帳戶 釣一票韭菜取暖:當傳家寶

三立新聞網
05

不是台北!全台僅2縣市平均家戶所得破2百萬 何世昌:已成「神仙打架」之地

CTWANT
06

跑11個接待中心結果竟一樣 首購族崩潰:陷選擇障礙

ETtoday新聞雲
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...