請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

GPT-5.6 Sol 接 Cerebras 快 14 倍:OpenAI 開始替不同 AI 工作挑晶片

TechOrange 科技報橘

更新於 08月14日19:02 • 發布於 08月14日06:06 • 廖紹伶

AI 開發者想讓模型即時回應,過去往往得在「速度」與「聰明程度」之間做取捨,OpenAI 近日在自家 API 推出名為「Ultrafast」的新服務層,讓旗艦模型 GPT-5.6 Sol 在不更換模型的前提下,推論速度最高較標準模式快 14 倍,每秒可生成 750 個 output token。

OpenAI 表示,要取得即時速度,通常得改用較小或針對特定用途打造的模型;Cerebras 也指出,開發者長期面臨類似問題:最強的模型通常不夠快,最快的模型又未必具有足夠能力。Ultrafast 服務想解決的,正是這項取捨,而支撐這個速度的並非 GPU,是晶圓級晶片公司 Cerebras 的專用晶片。

原本要過夜跑的研究工作,一日內就可多輪迭代

Ultrafast 目前先在 OpenAI API 上線,採限量預覽,開放給一小群客戶,官方表示會隨產能擴大逐步放寬。

在應用場景上,OpenAI 點名事故排除、金融研究與風控、即時客服與語音、電商,以及過去得跑整夜的即時實驗。早期客戶包含 Jane Street、Podium、Basis 與 Rogo。

Jane Street 的 AI 助理團隊成員 John Crepezzi 表示,Cerebras 帶來的速度提升相當可觀,讓開發者能以更專注、更有效率的方式與模型協作。OpenAI 內部開發團隊也已用 Ultrafast 分析資安事件中的系統日誌與追蹤資料,原本需要跑一整晚的研究工作,現在能在一個工作日內進行多輪測試。

OpenAI 早就找上 Cerebras,750 MW 合作開始落地

今年 1 月,OpenAI 就宣布與 Cerebras 簽署多年合作,要把 750 MW 的超低延遲 AI 運算能力加入自家平台,相關容量預計分批部署至 2028 年。

Cerebras 向美國證券交易委員會(SEC)提交的文件進一步揭露,這筆多年合約價值超過 200 億美元,OpenAI 已在今年 1 月開始取得 Cerebras 運算容量。2 月推出的即時程式開發模型 Codex-Spark,就是第一批使用 Cerebras 基礎設施的 OpenAI 產品。如今 GPT-5.6 Sol Ultrafast 上線,等於把這套高速推論能力進一步帶到 OpenAI 的旗艦模型。

Cerebras 與目前 AI 資料中心普遍採用的 GPU 路線不同。它的核心技術晶圓級引擎(Wafer-Scale Engine,WSE),沒有把晶圓切割成許多獨立晶片,而是把大量運算核心、記憶體與頻寬整合在一個晶圓級處理器上。

OpenAI 今年 1 月解釋雙方合作時指出,這種設計可以減少傳統硬體在 AI 推論過程中的資料搬移瓶頸,尤其適合加速模型產生長篇內容。因此 OpenAI 對 Cerebras 的定位從一開始就很明確,不是全面替換原有的 AI 運算架構,而是替自家平台增加一套專門處理低延遲推論的系統。

快的不只是「吐字」,而是一整個工作任務

Cerebras 公布的測試顯示,Ultrafast 帶來的差異不只反映在每秒產生多少 token。在 GDP-Val 測試中,GPT-5.6 Sol Ultrafast 完成端到端任務的速度提高 5.6 倍,同時維持相同的模型品質。GDP-Val 評估的是法律文件、財務模型、工程報告等具有經濟價值的知識工作,因此這項結果衡量的並非單純的文字生成速度,而是一整項工作能否更快完成。

這對 AI Agent 尤其重要,因為一般聊天可能只需要模型回答一次,但 AI Agent 執行工作時,可能反覆經歷推理、呼叫工具、讀取結果、再次推理與修正等步驟。每一輪模型推論增加的等待時間,都會累積到整個工作流程。

也因此,當模型進入程式開發、金融研究、資安等需要反覆執行工作的場景後,速度不只是影響使用者要等多久,也開始決定同一段時間內,AI 能完成多少輪工作。

不再只比哪顆晶片最快,AI 推論開始「按工作分工」

值得注意的是,OpenAI 並沒有把 Cerebras 描述成既有 GPU 的全面替代品。OpenAI 基礎設施主管 Sachin Katti 在今年 1 月宣布合作時表示,該公司的策略是建立更多元的運算資源組合,依照不同 AI 工作的需求,選擇適合的運算系統。在這套布局中,Cerebras 扮演的就是專門處理低延遲推論的角色。

類似的分工也開始出現在其他 AI 基礎設施業者。今年 3 月,AWS 與 Cerebras 宣布合作,把一次 AI 推論拆成兩個階段:由 AWS Trainium 處理需要大量平行運算的提示詞處理階段(prefill),再由 Cerebras CS-3 負責逐步產生輸出內容的解碼階段(decode)。

7 月,AMD 與 Cerebras 又公布類似的分離式推論架構。AMD Helios 負責高吞吐量與大量上下文的提示詞處理,Cerebras WSE 則接手對延遲更敏感的解碼與生成工作。兩家公司指出,AI 推論對反應速度、吞吐量、成本與規模的要求越來越不同,因此需要依工作特性搭配不同的運算技術。

這些合作顯示,AI 晶片競爭正在出現另一種分工方式。也就是不一定由單一種類的處理器包辦整個推論流程,而是依照不同階段的運算特性,把工作交給更適合的架構。這類結合不同處理器優勢的做法,也就是所謂的「異質運算」。

而 OpenAI 與 Cerebras 的合作可能還會再往前一步。Cerebras 向 SEC 提交的文件顯示,雙方協議還包含未來共同設計模型與硬體的可能,讓 OpenAI 能依 Cerebras 的硬體特性設計模型,Cerebras 也能按照 OpenAI 下一代模型的需求調整硬體。

因此,GPT-5.6 Sol Ultrafast 的意義不只是讓一個模型快 14 倍。當 AI 模型開始深入 AI Agent 與即時工作流程,運算基礎設施的競爭也正在從哪一顆晶片效能最好,逐漸開始關注:哪一種 AI 工作,應該交給哪一種運算架構?

【推薦閱讀】

OpenAI 悄悄公布下一代模型 Astra,卻沒公布任何 benchmark 分數

算力狂飆、散熱失速:Synopsys 如何看 AI 重寫晶片到系統的設計規則?

特定模型推論快 48 倍卻犧牲彈性:AMD 為何仍買下 Taalas 對抗 NVIDIA?

*本文開放合作夥伴轉載,資料來源:OpenAI 1OpenAI 2Cerebras 1Cerebras 2Cerebras 3《9to5Mac》《Unite.AI》SEC,首圖來源:擷取自 OpenAI

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

台幣升值吃掉航空貨運承攬業獲利 9月未現旺季行情已有包機解約

ETtoday新聞雲
02

動物大搬家40週年 國發會釋出珍稀影像

NOWNEWS今日新聞
03

午餐時段人龍長 好市多西式餐飲部祭新制 10月起先掃會員卡

太報
04

台股ETF本週25檔將除息 13檔年化殖利率逾10%

中央通訊社
05

醫療險最大地雷曝光!每4件理賠爭議就有1件卡在「這理由」

鏡週刊
06

爆!違反內部控制制度規定 這大廠遭重罰100萬!

三立新聞網
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...