李飛飛旗下 World Labs 首度開放外部用戶!Atlas 靠單張照片就能重建 3D 世界
李飛飛(Fei-Fei Li)創辦的 World Labs 在 9 月 1 日以早期試用(early access)形式推出新一代世界模型 Atlas。這是繼 2025 年 11 月商業產品 Marble 之後,World Labs 端出的新世代模型,官方表示 Atlas 未來將驅動 Marble 及公司其他產品。
Atlas 能做什麼
Atlas 是一個世界模型(world model),核心架構是多模態自回歸擴散轉換器(multimodal autoregressive diffusion transformer),可處理文字、圖像、影片與 3D 資料四種輸入,並統一在一個 3D 空間框架下運作——每張輸入圖像都會被錨定在空間中的特定 3D 位置。
功能上,Atlas 支援像素級精確的鏡頭控制,最高解析度可達 1440p,在該解析度下生成影片長度最長支援 1 分鐘,能從單張照片開始進行 3D 空間重建。輸出格式也可以是原生 3D,包含點雲(point cloud)與 3D 高斯潑濺(3D Gaussian splats),不只是 2D 影片。這讓 World Labs 的定位和純粹的影片生成工具有所區隔,更靠近「理解並重建真實世界空間」的方向。
效能數字與驗證問題
Atlas 公布的效能數字看起來很強,但比較條件需要先講清楚。
在鏡頭控制生成(camera-controlled generation)的人類偏好測試中,World Labs 以單張輸入圖搭配 pan、truck、crane 等電影式鏡頭運動,讓人類評分者判斷生成結果對鏡頭路徑的遵循程度。Atlas 的勝率為:對 Seedance 2.5 為 94%、對 FLUX 3 為 93%、對 Happy Horse 1.1 為 86%、對 Gemini Omni Flash 為 81%、對 MiniMax H 為 75%。
不過 World Labs 在同一份資料中註明,測試時 Atlas 接收的是原生鏡頭姿態(camera pose)輸入,對照的模型則只能靠文字描述來理解鏡頭運動。換句話說,這組數字反映的是「原生支援鏡頭控制」與「用文字描述鏡頭」之間的落差,而不是單純的生成品質高低。
在 3D 重建的幾何誤差上(mean AbsRel error,於 DTU、ETH3D、KITTI、NRGBD、7-Scenes、ScanNet、Tanks & Temples 七組資料集取平均),Atlas 為 25.3,對照模型落在 28.7 至 47.7 之間,數值愈低代表重建誤差愈小;以上數字均出自 World Labs 官方 blog,尚未經第三方獨立驗證。
延伸閱讀|生成式 AI 的下一站是空間智慧?AI 教母李飛飛推首款 Marble 3D 世界模型!其商業潛力在哪?
公司背景
李飛飛主持了 ImageNet 資料集的建立,也曾長期擔任史丹佛 AI 實驗室(SAIL)主任。World Labs 於 2024 年帶著 2.3 億美元募資走出隱形階段,2026 年 2 月再完成 10 億美元募資,累計募資金額約 12.3 億美元;投資人包括 AMD、NVIDIA、Autodesk(單獨投入 2 億美元)、Fidelity 與 Emerson Collective 等。
產品線上,World Labs 已於 2025 年 11 月推出首個商業產品 Marble,主打從文字或圖像生成可探索的 3D 場景。Atlas 這次的角色是往上游走一階:從產品層回到基礎模型層,再由這個模型去支撐後續版本的 Marble。
Atlas 目前僅對特定合作夥伴開放早期試用,其他人可透過官方表單登記,由 World Labs 主動聯繫,尚未全面開放。
對於正在評估 3D 內容生成或空間 AI 工具的開發者與設計師而言,Atlas 的定位比較接近基礎設施層的工具,而非消費者端的應用。人工智慧在空間理解這個方向上的發展,World Labs 這次算是把模型層的成果拿出來讓外部測試了。
延伸閱讀|建築師每年花 60% 在畫圖!AI 新創 illoca 推出「建築 AI」,1 分鐘將草圖化為 3D 模型
(本文轉載自Inside,初稿為 AI 編撰)
延伸閱讀
家用機器人訓練數據幾乎是零!新創 Shift App 用免費清潔換全程錄影,搶攻實體 AI 最稀缺素材
機器人硬體成本年降 40%!電動車供應鏈帶動平價化,餐飲、醫療缺工加速商用化
實體活動走向數位化!整合購票、消費、應援,一次性交易如何成為「長期關係資產」?