請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

Anthropic、OpenAI 同日推 Opus 5.5、GPT-6 Sol/Luna:最高階 AI 能力正以幾週速度往下放

TechOrange 科技報橘

更新於 2026年9月23日20:57 • 發布於 4小時前 • 廖紹伶

Anthropic、OpenAI 在美國時間 9/22 同日更新模型產品線,一口氣推出 3 款新模型。Anthropic 發表 Claude Opus 5.5,主打程式設計、AI 代理與專業知識工作;OpenAI 則推出 GPT-6 Sol、GPT-6 Luna,將月初才由 GPT-6 Astra 開啟的新一代產品線,進一步擴展到不同能力與價格層級。

這次兩家公司都沒有只把重點放在提高測試基準(benchmark)成績。Anthropic 的 Opus 5.5 已在多數工作達到 3 週前才推出的 Fable 5.1 水準,價格卻明顯降低;OpenAI 的 Sol、Luna 則承接 Astra 的部分技術進展,API 價格也降至 GPT-5.6 同級模型的一半。

Fable 5.1 才推出 3 週,Opus 5.5 已追上多數工作

Anthropic 9/1 才推出 Fable 5.1 與 Mythos 5.1,當時將兩款模型定位為旗下最先進的程式設計與知識工作模型。相隔 21 天,Anthropic 又推出 Claude 5.5 系列第一款模型 Opus 5.5,並表示它在「多數工作」已達到 Fable 5.1 水準。

從 Anthropic 公布的測試來看,Opus 5.5 的提升尤其集中在長時間 AI 代理與程式設計。以衡量 AI 代理操作電腦終端機能力的 Terminal-Bench 4.0 為例,Anthropic 測得 Opus 5.5 為 66.4%,高於 Fable 5.1 的 55.8%;程式設計測試 FrontierCode v1.1 Main 則為 54.4%,也高於 Fable 5.1 的 50.3%。

獨立 AI 模型評測機構 Artificial Analysis 的結果也顯示,Opus 5.5 已躋身目前表現領先的前沿模型。在該機構綜合多項測試的「智慧指數」(Intelligence Index)中,Opus 5.5 於最高推理設定取得 58 分,為當時測得最高分,10 項組成測試中有 6 項領先;Terminal-Bench 4.0 則拿到 59.6%,與 GPT-6 Astra 並列。

圖片來源:Artificial Analysis

隨著能力提升,Anthropic 這次也同步擴大安全測試。Opus 5.5 是執行長 Dario Amodei 呼籲「放慢前沿 AI」後推出的第一款新模型,發布前已交由 AI 安全研究機構 METR、Frontier Design 等外部團隊評估。Anthropic 表示,在新的限制突破測試中,Opus 5.5 嘗試繞過限制的頻率比 Opus 5 或 Mythos 5.1 低約 85%;不過該公司也提醒,模型有時會察覺自己正在接受評估,因此部署前測試仍無法涵蓋所有真實情境。

價格也同步往下調。Opus 5.5 API 每百萬個輸入、輸出詞元(token)分別為 4 美元與 20 美元,比 Opus 5 的 5 美元、25 美元低 20%。Anthropic 表示,由於模型完成相同工作所需詞元也減少,典型工作負載整體成本可降低約 40%。

如果直接與 Fable 5.1 比較,價差更大。Fable 5.1 每百萬個輸入、輸出詞元分別為 10 美元與 50 美元,因此 Opus 5.5 的牌價低約 60%。不過,這裡的 60% 是兩款模型的定價比較,和 Anthropic 所說相較 Opus 5「典型工作成本降低 40%」採用的比較基準不同。

Astra 推出不到 3 週,OpenAI 再補上 Sol、Luna

OpenAI 的做法則是進一步拉開 GPT-6 產品線。9/3 推出的 Astra 仍是 GPT-6 系列最高階版本,OpenAI 將它稱為歷來廣泛部署模型中能力最強的一款;到了 9/22,再加入 Sol 與 Luna。

OpenAI 表示,Sol、Luna 都建立在 Astra 的技術進展之上,但在能力與成本之間採取不同配置。Sol 針對程式設計、除錯、資料分析與較複雜的 AI 代理工作;Luna 則強調速度與低成本,適合資訊擷取、摘要、直接問答等使用量較大的任務。

新模型的價格下降也相當直接。GPT-6 Sol API 每百萬個輸入、輸出詞元分別為 2 美元與 10 美元;Luna 則為 0.1 美元與 0.5 美元。OpenAI 表示,透過改善推論與提示快取(prompt caching)效率,兩款模型相較 GPT-5.6 同級產品的價格降低約 50%。

不過,Artificial Analysis 的測試顯示,OpenAI 這次最突出的進步並非整體能力大幅跨代。GPT-6 Sol、Luna 在智慧指數,以及衡量程式設計代理能力的「程式設計代理指數」(Coding Agent Index)上,大致維持 GPT-5.6 同級模型水準,部分項目進步,也有部分退步。更明顯的變化在成本,以智慧指數測試計算,Sol 在最高推理設定下每項任務成本由 1.99 美元降至 1.06 美元,Luna 則從 0.18 美元降至 0.07 美元。

圖片來源:Artificial Analysis

AI 模型降價本身並不是新趨勢,但這次 Anthropic、OpenAI 的共同點,在於價格往下走的同時,模型能力仍維持在更高水準。Anthropic 的 Opus 5.5 同時帶來較明顯的能力提升與降價;OpenAI 的 Sol、Luna 則主要把 GPT-6 世代的技術進展轉化成更低的使用成本。前沿模型競爭的焦點,也越來越落在同一個問題,也就是能以多少成本,提供多少能力。

科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

Amazon 封鎖 Meta Muse、Shopify 卻主動接入:AI Agent 能不能進站,誰說了算?

RSI 風險浮上檯面,OpenAI 提新標準:AI 研發到哪一步要人類介入?

AI 失控就拔插頭?打造「終止開關」為何比想像中更難

*本文開放合作夥伴轉載,資料來源:AnthropicOpenAI《Techstrong》《Financial Times》《The Verge》《VentureBeat》1《VentureBeat》2Artificial Analysis 1Artificial Analysis 2,首圖來源:Anthropic

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

大立光衝矽光子4/小兒科醫師生活滋潤被逼接家業 揭林恩平掌大立光內幕

鏡週刊
02

台灣太猛了!台股市值衝世界第4 全球股市排名一次看

自由電子報
03

銀行房貸愈來愈難借!壽險房貸半年暴增1倍 年底恐「找錢比找房難」

鏡報
04

獨家》川湖股價飆破1.2萬 高雄這間宮廟爆紅濟公辦事加班到凌晨

自由電子報
05

50萬滾成80億!名醫靠股息年收3千萬「投資神招」全留2女兒

民視新聞網
06

油漆工之子獲張忠謀欽點,竟回「我無法勝任」…李瑞華一句大實話,轉去幫台積HR轉骨、魏哲家當他小老師

今周刊
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...