李飛飛推出新一代世界模型 Atlas,模擬真實世界和機器人運作
由李飛飛(Fei-Fei Li)成立的新創 World Labs,打造通用型的世界模型(world models)以追求空間智慧(spatial intelligence)。
世界模型能生成、重建並模擬任何可能存在的世界,理解各種世界的樣貌、行為方式及演變過程,可為各種創作型使用者渲染想像中的世界,高度模擬真實世界,也能協助機器人規劃各項行動。
World Labs 1 日宣布推出新一代世界模型 Atlas,開發團隊從頭對其進行預訓練,能原生處理文字、圖像、影像及 3D 內容。Atlas 是一款多模態自回歸擴散轉換器(multimodal autoregressive diffusion transformer),所有的輸入內容都會整合至一個共享的空間脈絡之中。Atlas 運用脈絡生成接下來的內容,以 3D 與它見過的一切維持一致,並想像出視野之外存在的事物。
Atlas 多模態自回歸擴散轉換器的架構比 OpenAI 的 Sora 等早期視訊生成器複雜得多,傳統的視訊生成器依靠不精確的文字提示來控制相機角度和動作,而 Atlas 將相機軌跡和幾何圖形作為原生輸入,能夠在視角方面展現精確控制。
隨著訓練資源持續增加,Atlas 效能表現隨之提升,因此開發團隊預期,隨著持續擴展規模,此一趨勢會延續下去。
Atlas 能執行橫跨世界生成、重建及模擬等廣泛範圍的任務:
- 相機控制生成(Camera-Controlled Generation):Atlas 能自一張或多張圖像生成圖像和影像,並具備像素級精準的相機控制能力,可輸出最長 1 分鐘、1440p 解析度的影像。
By positioning multiple input views within the model's spatial context, Atlas allows you to generate image and video frames with precise control.
Here, we hand-designed a camera trajectory to generate a 1 minute video at 1440p resolution from seven reference images. pic.twitter.com/dlDCHQWjfX
— World Labs (@theworldlabs) September 1, 2026
- 空間重建(Spatial Reconstruction):Atlas 能從一張至數十張輸入圖像重建真實世界的場景。它能生成來自全新視角的圖像影格,同時也能產出明確的 3D 輸出成果,實際表現可勝過專門針對 3D 重建的業界頂尖模型。\
Atlas also outputs explicit 3D from one to many input images, beating top open source reconstruction models.
Passing more images gives Atlas more context: the more it sees, the less it imagines. pic.twitter.com/5nB2eFC7UQ
— World Labs (@theworldlabs) September 1, 2026
時空模擬(Space-Time Simulation):Atlas 能自輸入影像對空間和時間進行建模,為影片重新構圖以營造戲劇性的視覺效果,並為機器人領域實現「真實到模擬」(Real-to-Sim)的工作流程。
圖像生成(Image Generation):Atlas 能自文字生成圖像和 360 度全景圖,它能遵循複雜的提示詞、渲染文字,並生成各式各樣的視覺風格。
World Labs 已展示一些令人驚豔的測試案例,並表示 Atlas 在創意視覺效果和遊戲設計方面有所成果。然而開發團隊表示,其真正目標是為訓練機器人來建立準確的模擬,有助於 Atlas 在競爭激烈的世界模型市場脫穎而出。
(首圖來源:World Labs)