請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

Grok 4.6 強攻長時間 AI Agent:企業選模型不能再只看 Token 單價

TechOrange 科技報橘

更新於 08月13日10:29 • 發布於 08月13日02:29 • 廖紹伶

SpaceXAI 近日推出最新旗艦模型 Grok 4.6。根據第三方模型評測機構 Artificial Analysis,Grok 4.6 在 Intelligence Index 得分 61。這項綜合指標用來比較不同模型的整體智慧表現,Grok 4.6 較前一代 Grok 4.5 High 提升 5 分,不只超越中國 Moonshot AI 的 Kimi K3,也追平 OpenAI GPT-5.6 Sol Max,並列全球第三,僅次於 Anthropic Claude Opus 5 與 Fable 5。

但對企業來說,這次 Grok 4.6 值得注意的不只是模型排行榜又重新洗牌。《VentureBeat》分析指出,相較單純增加幾個 benchmark 分數,Grok 4.6 更重要的變化在於 Agent 行為成本。SpaceXAI 明確將 Grok 4.6 的升級重點放在 long-running agents(長時間執行任務的 AI Agent)、程式開發與知識工作,希望模型不只回答一次問題,而是能持續執行更長、更複雜的任務。

當 AI 從聊天工具逐漸變成能自主工作的 Agent,評估模型的方式也開始改變。除了模型有多聰明、每百萬 Token 要多少錢,另一個更重要的問題是完成一項工作究竟需要跑多少輪、消耗多少 Token、最後花多少錢。

Grok 4.6 不只變聰明,SpaceXAI 開始訓練模型「把長工作做完」

根據 SpaceXAI 官方技術說明,Grok 4.6 可以長時間維持任務狀態,處理研究陌生主題、分析資訊、瀏覽大型程式碼庫,以及將產品構想轉換成可運作的應用程式。為此,SpaceXAI 對 Grok 4.6 進行比前一代更長的補充訓練,並重新產生涵蓋不同推理程度、Agent 執行環境、STEM、軟體工程與知識工作的監督式微調資料;強化學習則進一步涵蓋一般程式開發、知識工作、kernel optimization、網頁開發與 CAD 等 Agent 環境。

這些調整反映 AI 模型的訓練目標正在發生變化。過去使用者問一個問題,模型產生一個答案,重點是這次回答是否正確;但 Agent 可能需要連續執行數十個步驟,過程中使用工具、讀取資料、修改程式,再根據執行結果決定下一步。SpaceXAI 表示,在內部測試中,Grok 4.6 執行較長任務時出現更多自我測試與驗證行為,會在繼續執行前先檢查自己的工作成果。

從評測結果來看,Grok 4.6 在部分 Agent 任務上確實明顯進步。例如 APEX-Agents 主要測試 AI Agent 能否運用瀏覽器、搜尋等工具,完成需要專業知識的實際工作。SpaceXAI 公布的數據顯示,Grok 4.6 在這項測試得分從前代的 47.1% 提升至 57.5%,略高於 GPT-5.6 Sol Max 的 56.7%,但仍低於 Fable 5 Max 的 59.2%。

另一項 AA-Briefcase 則更強調長時間、多步驟的專業工作,不是要求模型回答一道問題,而是讓 Agent 使用瀏覽器、終端機等工具執行完整任務,因此除了工作成果,也能觀察模型完成任務經歷多少輪、使用多少 Token。Grok 4.6 在這項測試的 Elo 分數達 1,577,高於 GPT-5.6 Sol Max 的 1,502,也略高於 Fable 5 Max 的 1,574。

不過,Grok 4.6 並非所有 Agent 能力都領先。例如 Terminal-Bench v3.0 主要測試 AI Agent 能否在終端機環境自主完成技術任務,考驗模型操作命令列、檔案與軟體環境,以及連續執行多個步驟解決問題的能力。Grok 4.6 雖從 15.7% 提升至 26%,仍落後 GPT-5.6 Sol Max 的 34.6% 與 Fable 5 Max 的 34.1%。

《VentureBeat》因此認為,目前證據更能證明 Grok 4.6 相較 Grok 4.5 大幅進步,而不足以證明它全面勝過其他頂尖模型。不同 benchmark 衡量的 Agent 能力也不同,有的偏向專業知識與工具使用,有的強調長時間工作,有的則專門測試終端機操作,不能只排列分數就判定哪個模型整體比較強。

Agent 一跑就是數十輪,Token 單價開始無法反映真正成本

模型往長時間 Agent 發展,也讓另一個問題浮上檯面:企業究竟該怎麼計算 AI Agent 的成本?傳統生成式 AI 的成本相對容易理解,使用者輸入多少 Token、模型輸出多少 Token,再乘上 API 費率即可。但 Agent 執行的不是一次性問答。一項工作可能需要先搜尋資料、讀取文件、推理與呼叫工具,取得結果後再判斷是否正確;一旦發現問題,又要重新修改、呼叫工具與驗證。

因此,即使兩款模型的 Token 單價相同,如果一款模型需要執行 100 輪才能完成任務,另一款只需要 50 輪,最終成本就可能出現明顯差距。

Artificial Analysis 對 Grok 4.6 的獨立測試正好呈現這個差異。前述 AA-Briefcase 除了衡量 Agent 完成長時間專業工作的表現,也記錄完成工作所需的資源。Artificial Analysis 報告顯示,Grok 4.6 完成這套工作負載平均約經過 53 輪、消耗約 5 億個 input tokens;Claude Opus 5 Max 則約需要 103 輪、20 億個 input tokens

這組數字比較的不是單次回答有多長,而是 Agent 為了完成一組多步驟工作,總共需要經歷多少次互動與推理、讀取多少輸入內容。《VentureBeat》指出,這不能解讀成 Grok 4.6 執行所有 Agent 任務都能減少近一半輪數或四分之三 Token,因為 Agent 成本還會受到執行框架、提示詞、工具呼叫、快取、重試方式與任務本身影響。但這些數據揭露了一個值得企業注意的問題:當 AI 從「產生一次答案」走向「完成一整段工作流程」,只比較每百萬 Token 的價格,已越來越難反映真正的使用成本。

從每百萬 Token 走向 Cost per Task,AI 模型價格戰開始換算法

Grok 4.6 的 API 定價乍看相當具有競爭力。根據 SpaceXAI 官方資料,在 prompt 少於 20 萬 Token 時,每百萬 input Token 為 2 美元、output Token 為 6 美元。《VentureBeat》比較目前主要前沿模型的 API 定價後指出,Grok 4.6 的價格不到 GPT-5.6 Sol 標準模式的一半,也低於 Claude Opus 5。

但 Token 比較便宜,並不等於完成工作一定比較省。Artificial Analysis 已開始用 Intelligence (智慧表現)vs. Cost per Task(完成每一任務的成本)比較不同模型。它不是另一個單純測試模型有多聰明的 benchmark,而是把模型能力與完成評測任務實際付出的成本放在一起觀察。

Artificial Analysis 實測 Grok 4.6 約為每項任務 0.84 美元,並將其列入 Intelligence vs. Cost per Task 的 Pareto frontier,也就是在目前測試結果中,屬於模型能力與成本之間較具競爭力的選擇。不過,Grok 4.5、OpenAI GPT-5.6 Luna、Z.ai GLM-5.2 與 Meta Muse Spark 1.2 等模型仍具有更好的任務成本效益。

這也讓 API 價格表與企業實際支付的 Agent 成本之間出現差距。《VentureBeat》分析,對 Agent 工作負載而言,更有意義的衡量方式可能是完成一個 workflow 要花多少錢,而不只是產生 100 萬 Token 要花多少錢。

長上下文又讓成本計算更加複雜。SpaceXAI 官方資料顯示,Grok 4.6 支援最高 50 萬 Token context window,但當 prompt 達到 20 萬 Token,input、cached input 與 output 費率會分別從每百萬 Token 2、0.5、6 美元,提高至 4、1、12 美元,而且較高費率會套用到該次 request 的所有 Token。《VentureBeat》因此提醒,企業不能直接拿 Grok 4.6 最低的 2 美元/6 美元價格,推估使用完整長上下文時的總持有成本。

Grok 4.6 並沒有在所有評測全面擊敗 GPT-5.6 Sol 或 Claude,但它提供了一個觀察 AI 模型競爭變化的窗口:當模型開始專門為 long-running agents 最佳化,傳統 benchmark 與每百萬 Token 定價都只能回答一部分問題。

【推薦閱讀】

SpaceXAI 推 Grok Bot 加入企業 Agent 戰局:真正差異不只是「會操作電腦」

Cloudflare Wallets 讓 AI Agent 自主付款:為何網路基礎設施商也開始做支付?

AI Agent 跨平台終於有共同標準了:Agent Plugins 統一封裝,安全與信任仍留白

*本文開放合作夥伴轉載,資料來源:SpaceXAIArtificial Analysis《VentureBeat》,首圖來源:SpaceXAI

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

男離職移居鄉下「月花1.6萬」!3年後資產飆破千萬元

民視新聞網
02

主計總處揭低薪門檻:年薪39萬 2024年約126萬人低於標準

中央廣播電臺
03

00919配息1.1元創高!9/16除息、9/15最後買進日,想月領1萬要買幾張?

數位時代
04

他未成年卻能買5,600萬豪宅被盯上!國稅局抓包下場出爐

經濟日報
05

跟黃仁勳提離職會怎樣? 前員工揭「2小時震撼教育」

CTWANT
06

AI股大淘汰開始?營收創高只剩162家 法人:下一波只剩這種股票能漲

鏡週刊
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...