請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

AI 模型越便宜反而越花錢?史丹佛等機構研究:近 1/3 模型成本比較出現「反轉」

TechOrange 科技報橘

更新於 9小時前 • 發布於 17小時前 • 廖紹伶

AI 模型的 API 價格持續下降,企業選擇較便宜的模型,就一定能降低成本嗎?史丹佛大學等機構一項研究發現,在 336 組 AI 模型成本比較中,約 32% 出現「價格逆轉」(Price Reversal)現象,也就是 API 單價較低的模型,執行相同測試任務反而更花錢。隨著 AI Agent(AI 代理)開始承接更多複雜工作,這項發現也對企業過去依據模型單價比較成本的方式提出挑戰。

API 單價便宜 80%,實際成本卻高出 38%

這項由史丹佛大學、卡內基美隆大學、加州大學柏克萊分校及 Microsoft Research 研究人員共同完成的論文《The Price Reversal Phenomenon》,最初於今年 3 月發表、5 月修訂。

研究比較 GPT-5.4、Gemini 3 Flash、Claude Opus 4.7 等 8 款前沿推理模型,涵蓋數學、科學問答、程式設計,以及需要多次與外部環境互動的 AI Agent 任務,共計 12 類測試。

以 Google Gemini 3 Flash 與 OpenAI GPT-5.4 為例,研究將每百萬輸入與輸出 Token 的價格相加作為比較指標,Gemini 3 Flash 為 3.5 美元,比 GPT-5.4 的 17.5 美元低了 80%。然而,執行全部測試任務後,Gemini 3 Flash 累計花費約 705 美元,GPT-5.4 則約 509 美元,前者反而高出 38%。

圖片來源:《The Price Reversal Phenomenon》

這類現象並非單一案例。研究人員針對不同模型與任務進行 336 組配對比較,其中 106 組出現低價模型反而成本更高的情況。而且,不同任務的成本排名也會改變,這代表企業不能單憑模型 API 價目表,就推定哪一款模型最省錢。

為什麼便宜模型反而更貴?過度推理與執行推高成本

研究進一步分析,造成價格逆轉的兩項主要因素,分別是「過度推理」(Overthinking)與「過度執行」(Overacting)。

過度推理是指模型為了解決相同問題,消耗遠多於其他模型的推理 Token。例如在一道 MMLU-Pro 知識測試題目中,Gemini 3 Flash 消耗超過 60,000 個推理 Token,GPT-5.4 卻只使用 25 個。由於模型推理過程產生的 Token 同樣涉及計費,即使單價較低,只要消耗量差異夠大,最終成本仍可能更高。

過度執行則在 AI Agent 任務中尤其值得注意。與單次問答不同,Agent 可能需要將工作拆成多個步驟,反覆呼叫工具、讀取結果,再決定下一步。每次互動又可能重新處理先前累積的任務資訊,使 Token 費用隨執行輪次增加。

《華爾街日報》引用該研究的案例指出,Gemini 3.1 Pro 執行約 85 個步驟、花費約 1 美元就成功完成任務;Gemini 3 Flash 卻執行近 1,000 個步驟,累積約 14 美元費用,最後仍未成功。

這說明當 AI Agent 開始承接多步驟工作,模型是否能有效推理、決定下一步行動及適時停止,都可能影響最後的執行費用。研究也觀察到,即使同一模型接收相同問題,重複執行時的推理 Token 消耗量最多仍可相差 9.7 倍,進一步增加成本預估的難度。

便宜還不夠,成功完成任務究竟要花多少錢?

然而,單純比較實際執行費用,仍有一項限制:模型花比較少的錢執行任務,不代表一定能成功完成工作。AI 評估平台 Arize AI 與推論服務業者 Fireworks 在 7 月發布的聯合測試,便將評估延伸到「每次成功任務成本」(Cost per Successful Task)。

該研究以 40 項 Agent 任務比較 10 款模型,每項任務重複測試 6 次,合計 2,400 次執行。研究將所有測試的執行費用,包括失敗任務的支出,加總後除以成功次數,衡量平均取得一次成功結果需要多少成本。

結果顯示,Gemini 3.5 Flash 每次執行平均花費 0.288 美元,低於 GPT-5.5 的 0.424 美元。但前者成功率只有 23%,後者達 67%。換算每次成功任務的平均成本,Gemini 3.5 Flash 反而需要 1.233 美元,接近 GPT-5.5 的 0.636 美元的兩倍。

圖片來源:Arize

不過,這不代表模型價格越高,完成任務的成本就越低。Arize 研究發現,不同模型的成本效益會隨任務難度改變,部分低價模型在簡單任務中仍具優勢,但面對困難任務時,成功率下降可能抵銷其價格優勢。

綜合兩項研究,企業評估 AI 模型時,除了 API 單價,還需比較實際任務的 Token 消耗、工具呼叫次數及成功率。Arize 指出,即使整體表現接近的模型,在不同任務中的成功率仍可能差距明顯。因此,企業應根據自身工作負載測試模型,並隨著模型能力與價格變化重新評估成本效益。

【推薦閱讀】

◆ AI 小模型戰升溫,Anthropic 推 Haiku 5.5,價格更低、Agent 能力卻更強?

◆ Meta 再推 AI Agent 新標準 PAP,為什麼 Agent 協議越來越多?

◆ 誰真的在為生成式 AI 買單?a16z:前 1% 付費者支出超過後 50% 總和

*本文開放合作夥伴轉載,資料來源:《Implicator.ai》、《The Wall Street Journal》、《Financial Times》、arXiv、arize,首圖來源:Unsplash

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

賣了也沒賺!記憶體漲到三星也吃不消 手機第四季最高減產30%

anue鉅亨網
02

中國遍地是債1》高鐵、高速公路加機場 基建狂魔欠債90兆

自由電子報
03

〈房產〉新屋買不起... 全台40年「阿公宅」撐起3成房市交易 北市更達55%

anue鉅亨網
04

蘇姿丰快閃台灣24小時,還砸82億美元找上李飛飛!AMD下一步在盤算什麼?

數位時代
05

「這檔」風電類股面臨下市危機!4.3萬股東持股恐成壁紙

三立新聞網
06

「888888」身價153倍!央行特殊鈔票再開標 14年幫國庫進補逾9千萬

太報
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...