亞馬遜重整 Alexa+ 架構,逐漸用自家模型取代 Anthropic Claude 以壓低 AI 支出
亞馬遜正重新調整 Alexa+ 的 AI 架構,試圖降低營運成本。Business Insider 取得文件,顯示亞馬遜開始讓 Alexa+ 更少依賴 Anthropic Claude 模型,改以自家模型處理請求,並以快取與更「確定」的回應機制,減少不必要推理運算。
文件時間範圍為去年底到今年初,顯示亞馬遜希望提升每顆 GPU 使用效率,不大幅增加硬體同時以同樣算力處理更多客戶要求。規劃預估,以軟體調整,Alexa+ 可用運算容量提升約 50%,回應時間縮短約 40%。
成本壓力是這波調整的主因。預測顯示,Alexa+ 的 AWS 雲端成本今年可能達約 17 億美元,幾乎是前一年三倍,且比亞馬遜設定的每月活躍用戶雲端成本目標高約 60%。即使已找出約 4.5 億美元潛在節省空間,評估仍認為很難達到財務目標。
Alexa+ 與早期版本不同,許多回應仰賴 GPU 密集型雲端服務的大型語言模型,讓原本成本較低的語音查詢變成昂貴的 AI 負載。美國擴大上線後,亞馬遜面臨算力與支出壓力也同步升高,甚至考慮延後部分最昂貴 AI 計畫,包括 Alexa 進階代理核心的 Project Moonraker。
文件也顯示,亞馬遜嘗試縮小 Claude 模型於 Alexa+ 使用範圍,將部分專門 Alexa「Experts」從 Claude Sonnet 轉至自家模型,適合狀況下直接用快取回應,不再呼叫 Claude。此反映 AI 產業的競爭焦點,從「模型更聰明」轉向「模型更便宜」,亞馬遜也評估 Nvidia GPU 與自家 Trainium 晶片哪個是更低成本的運算方案。
(首圖來源:亞馬遜)