請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

OpenAI 首款自研晶片跑贏 NVIDIA Blackwell,為何 Jalapeño 第一代就追上 GPU?

TechOrange 科技報橘

更新於 08月26日16:50 • 發布於 08月26日03:10 • 廖紹伶

OpenAI 今年 6 月才正式揭露首款自研推論晶片 Jalapeño,兩個月後就交出第一批完整實測。OpenAI 8 月 25 日公布,在半導體研究機構 SemiAnalysis 的 InferenceX 測試中,Jalapeño 執行 GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T 等模型時,尖峰每瓦工作量比 NVIDIA GB200/GB300 高出 1.5 至 1.9 倍,端到端延遲則降低 1.7 至 3.6 倍。

這個結果特別之處在於,Jalapeño 還只是 OpenAI 第一代自研 ASIC。SemiAnalysis 指出,新晶片通常需要數代迭代才能建立有競爭力的軟硬體系統,但 Jalapeño 第一代就在其測過的 NVIDIA、AMD 與 Google 晶片中展現領先表現。為什麼 OpenAI 第一次做晶片,就能這麼快追上成熟 GPU?

不是為 GPT 特製,而是從 LLM 推論重新設計

答案首先不是單純堆高算力。NVIDIA GPU 要支援訓練、推論與高效能運算等不同工作負載,Jalapeño 則從一開始就把重點放在 LLM 推論。

OpenAI 表示,Jalapeño 的設計參考自身模型、kernel、服務系統與產品需求,從實際 LLM 工作負載找出推論瓶頸。處理提示詞的 prefill 階段較吃運算,逐字產生回答的 decode 則更容易受到記憶體頻寬限制;資料在不同核心與晶片之間移動,也會增加等待時間。

而且,隨著模型從知識問答走向推理與 AI Agent,推論工作的組成也持續改變。SemiAnalysis 指出,不同世代模型對輸入 token、KV cache 讀寫與輸出 token 的需求比例已明顯變化,如果預先把硬體固定切成只負責 prefill 或 decode 的不同晶片池,反而可能隨著模型演進出現資源錯配。Jalapeño 因此沒有走高度分工的路線,而是讓同一套晶片能處理不同推論階段與工作負載。因此,OpenAI 從晶片、記憶體、網路到軟體一起調整,讓模型狀態與 KV cache 盡可能留在地端,降低資料搬移與通訊延遲。

不過,從 OpenAI 自身的工作負載出發,不代表 Jalapeño 是一顆只為 GPT 量身打造的晶片。SemiAnalysis 特別反駁這種說法,認為 Jalapeño 更接近一款泛用 AI 推論晶片,沒有過度特化在單一模型或推論環節,而是希望在高吞吐量與低延遲等不同情境都維持表現。OpenAI 官方也表示,Jalapeño 從零開始為整個產業目前與未來的 LLM 設計。

第一代不等於舊世代,Jalapeño 直接用上 HBM4

另一個原因是,Jalapeño 雖然是 OpenAI 第一代晶片,採用的記憶體技術卻已站上新一代規格。SemiAnalysis 指出,Jalapeño 直接採用 HBM4,單一封裝記憶體頻寬達 15.4 TB/s,對容易受到記憶體頻寬限制的推論工作尤其重要。

這也意味著,拿它與 Blackwell 比較不能只看第一代對上成熟 GPU。OpenAI benchmark 中的 GB200、GB300 使用 HBM3E,而 NVIDIA 下一代 Vera Rubin 同樣進入 HBM4 世代。因此 SemiAnalysis 提醒,從產品時間點與技術世代來看,Rubin 才是 Jalapeño 更合理的比較對手。

SemiAnalysis 進一步以目前公開的 Rubin 數據比較,Jalapeño 的每瓦輸出 token 吞吐量仍占優勢,兩者效能/總持有成本則相當接近。不過雙方軟體都還在早期成熟階段,數字仍可能持續改變;而 Jalapeño 目前仍以工程樣品為主,預計 2027 年才逐步擴大量產。

第一次做晶片,OpenAI 卻加快了最難磨的軟體

更值得注意的是 Jalapeño 的開發速度。OpenAI 表示,AI 已直接用於晶片設計、驗證與最佳化,讓團隊從初始設計到 tapeout 約花 9 個月;晶片完成後,再利用 Codex 與 GPT-Astra 加快不同模型的 kernel 開發。3 款原先不在量產規畫內的開放權重模型,在兩個月內就達到高效能;部分 GPT-OSS attention 與 MoE 模組的 AI 生成版本,比既有人類專家撰寫的版本快 1.5 至 1.8 倍。

SemiAnalysis 認為,Jalapeño 現在的領先未必表示 NVIDIA 硬體本身較弱,更可能反映 OpenAI 的軟體導入速度比預期快,也凸顯軟硬體共同設計的效果。甚至從零開始反而可能是一項優勢,因為 OpenAI 不需要顧及舊有架構與軟體的向下相容性,可以從頭做取捨。

自研晶片的優勢,不只在少買 NVIDIA

OpenAI 第一次做晶片,也不是獨自包辦所有環節。OpenAI 負責晶片架構,Broadcom 提供晶片實作、網路與連接技術,Celestica 則參與電路板、機櫃與系統整合。

Jalapeño 更值得注意的地方,不只是 OpenAI 多了一個 NVIDIA 之外的算力來源。它顯示,擁有大量真實 AI 工作負載的模型公司,可能形成另一種晶片競爭優勢:不必把 ASIC 綁死在自家模型,也能利用第一方服務經驗,決定硬體應優先解決哪些問題。

Jalapeño 在 2027 年擴大部署後能否維持目前優勢,仍要看 Rubin、軟體成熟度與實際成本。但第一批 benchmark 已顯示,AI 基礎設施的競爭不只在誰能取得更多 GPU,也開始比誰能把對模型工作負載的理解,更有效地轉化成晶片與系統設計。

科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

推論成本砍半、9 個月做出來:OpenAI 首款自研 AI 晶片 Jalapeño 想換到什麼?

Broadcom 再籌逾 600 億美元 AI 融資:晶片商為何開始替客戶解決「買算力」問題?

Groq 3 LPX 正式量產:NVIDIA 為何願意讓 GPU「少做一點」?

*本文開放合作夥伴轉載,資料來源:OpenAISemi Analysis《The Verge》《TechCrunch》,首圖來源:OpenAI

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

台幣升值吃掉航空貨運承攬業獲利 9月未現旺季行情已有包機解約

ETtoday新聞雲
02

動物大搬家40週年 國發會釋出珍稀影像

NOWNEWS今日新聞
03

午餐時段人龍長 好市多西式餐飲部祭新制 10月起先掃會員卡

太報
04

台股ETF本週25檔將除息 13檔年化殖利率逾10%

中央通訊社
05

醫療險最大地雷曝光!每4件理賠爭議就有1件卡在「這理由」

鏡週刊
06

爆!違反內部控制制度規定 這大廠遭重罰100萬!

三立新聞網
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...