請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

AI 小模型戰升溫,Anthropic 推 Haiku 5.5,價格更低、Agent 能力卻更強?

TechOrange 科技報橘

更新於 2小時前 • 發布於 11小時前 • 廖紹伶

AI 小型模型的競爭,正從價格延伸到能承接多少實際工作。Anthropic 在美國時間 10/7 推出新 AI 模型 Claude Haiku 5.5,API 價格最高調降 90%,電腦操作測試表現更大幅超越前代,甚至領先 OpenAI GPT-6 Luna。隨著小型模型逐漸具備執行多步驟任務的能力,Haiku 5.5 究竟適合接手哪些工作?

電腦操作成功率躍升,小模型能做的事越來越多

Anthropic 將 Haiku 5.5 定位為適合大量、高頻且對成本敏感任務的小型模型。除了摘要、資料分類、資料庫查詢等工作,新模型的能力也進一步延伸至瀏覽器與電腦操作,能夠執行涉及多個步驟的工作。

OSWorld 主要測試 AI Agent 能否實際操作電腦,完成需要多個步驟的任務。根據 Anthropic 公布的測試,Haiku 5.5 在 OSWorld 2.1 電腦操作評測的離線子集取得 72.4% 成功率,較前代 Haiku 4.5 的 15.7% 提升 56.7 個百分點,也超越 GPT-6 Luna 的 48.9%。

圖片來源:Anthropic。

在衡量 AI 透過終端機執行複雜工作的 Terminal-Bench 4.0 測試中,Haiku 5.5 也取得 39.2%,高於 GPT-6 Luna 的 16.4%。不過,《VentureBeat》提醒,39.2% 是最高推理強度下的成績,預設設定約為 20%。

企業初步測試也反映這項變化。專案管理平台 Asana 表示,在錯誤分類、建立專案及搜尋風險工作等 AI Agent 任務中,Haiku 5.5 相較目前使用的模型,任務完成延遲降低超過 30%,顯示小模型除了在基準測試取得進步,也開始展現處理企業實際工作流程的潛力。

大模型負責複雜工作,小模型接手高頻子任務

Haiku 5.5 的另一項定位,是作為大型模型的子代理(Subagent)。Anthropic 指出,它可以搭配 Opus 5.5、Sonnet 5.5 處理程式設計工作,由能力較強的模型負責複雜任務,小模型則執行範圍明確、需要大量重複的工作。

金融 AI 公司 Rogo 提供了一個具體案例。該公司表示,當大型模型負責製作財務簡報時,可以交由 Haiku 5.5 子代理讀取企業提交的 10-K 年報,找出其中一張投影片需要的部門營收數據。

Rogo 應用 AI 團隊成員 Alex Wang 表示,Haiku 5.5 的準確度已足以讓團隊信任它執行這類工作,速度與價格也適合大量使用。AI 程式開發公司 Cognition 同樣將 Haiku 5.5 用作輔助模型,搭配 Opus 5.5 擔任主要模型,以降低成本與延遲。

Haiku 5.5 的價格則進一步提高這種分工的吸引力。對於提示詞不超過 10 萬 tokens 的請求,Haiku 5.5 每百萬輸入、輸出 tokens 分別收費 0.1 美元、0.5 美元,較前代降低 90%;超過門檻則降價 50%。Anthropic 估計,考量實際 Token 消耗後,平均任務成本約可降低 75%。

圖片來源:Anthropic。

這也代表,企業可以依工作複雜度,選擇不同等級的模型。不過,小模型仍有能力界線,例如 Sonnet 5.5 在電腦操作與複雜程式設計測試中仍明顯領先。因此,企業仍須依任務成功率、執行時間及重試成本,判斷哪些工作適合交由小模型。

OpenAI 低價模型攻勢下,Anthropic 也加入成本競爭

Anthropic 這次不只調降 Haiku 5.5 的價格,也同步將 Sonnet 5.5 的快取讀取費用減半,從每百萬 tokens 0.20 美元降至 0.10 美元。快取讀取可讓模型重複使用先前處理過的上下文,避免每次都重新運算,對於需要反覆讀取文件或執行多步驟工作的 AI Agent 而言,有助於進一步控制成本。

這波降價背後,也反映 AI 模型市場日益激烈的價格競爭。《華爾街日報》報導,Anthropic 今年初憑藉 Claude Code 等產品在企業市場取得優勢,但 OpenAI 隨後推出不同能力與價位的 GPT-5.6 系列,吸引企業轉向成本較低的模型。

根據該報導援引的 OpenRouter 數據,今年初,在約 12 萬家使用兩家公司模型的企業中,Anthropic 一度占相關支出約 75%;到了 9 月,兩家公司已大致持平。

Anthropic 已明確將 Haiku 5.5 定位為 Opus、Sonnet 的子代理,讓小型模型承接範圍明確、需要大量執行的任務。從這次電腦操作能力的提升與價格調降來看,小型模型可承擔的工作正在擴大,也讓企業在規劃 AI Agent 時,有更多依任務需求選擇模型的空間。

【推薦閱讀】

◆ 美中以外最強 AI 模型出現了,Mistral Large 4 靠 4,000 顆 Blackwell 怎麼追上來?

◆ 中國的開放模型對手來了?Reflection AI 推 Beam,憑什麼挑戰 GLM、Qwen

◆ 誰真的在為生成式 AI 買單?a16z:前 1% 付費者支出超過後 50% 總和

科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

*本文開放合作夥伴轉載,資料來源:Anthropic、《SiliconANGLE》、《VentureBeat》、《The Wall Street Journal》,首圖來源:Anthropic

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

「這檔」風電類股面臨下市危機!4.3萬股東持股恐成壁紙

三立新聞網
02

「888888」身價153倍!央行特殊鈔票再開標 14年幫國庫進補逾9千萬

太報
03

媽媽留20張台積電「兄妹繳不出遺產稅」!稅單拖1年 股價漲破2400意外保住4800萬

鏡週刊
04

森崴後又一家風電類股要下市 4.3萬名股東股票成壁紙

自由電子報
05

媽媽遺產20張台積電「稅金破200萬」 兄妹因國稅局一動作解套

太報
06

才獲德媒關注!這家無人機廠今遭調查局搜索

自由電子報
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...