請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

李飛飛推出新一代世界模型 Atlas,模擬真實世界和機器人運作

科技新報

更新於 09月02日18:25 • 發布於 09月02日18:24

由李飛飛(Fei-Fei Li)成立的新創 World Labs,打造通用型的世界模型(world models)以追求空間智慧(spatial intelligence)。

世界模型能生成、重建並模擬任何可能存在的世界,理解各種世界的樣貌、行為方式及演變過程,可為各種創作型使用者渲染想像中的世界,高度模擬真實世界,也能協助機器人規劃各項行動。

World Labs 1 日宣布推出新一代世界模型 Atlas,開發團隊從頭對其進行預訓練,能原生處理文字、圖像、影像及 3D 內容。Atlas 是一款多模態自回歸擴散轉換器(multimodal autoregressive diffusion transformer),所有的輸入內容都會整合至一個共享的空間脈絡之中。Atlas 運用脈絡生成接下來的內容,以 3D 與它見過的一切維持一致,並想像出視野之外存在的事物。

Atlas 多模態自回歸擴散轉換器的架構比 OpenAI 的 Sora 等早期視訊生成器複雜得多,傳統的視訊生成器依靠不精確的文字提示來控制相機角度和動作,而 Atlas 將相機軌跡和幾何圖形作為原生輸入,能夠在視角方面展現精確控制。

隨著訓練資源持續增加,Atlas 效能表現隨之提升,因此開發團隊預期,隨著持續擴展規模,此一趨勢會延續下去。

Atlas 能執行橫跨世界生成、重建及模擬等廣泛範圍的任務:

  • 相機控制生成(Camera-Controlled Generation):Atlas 能自一張或多張圖像生成圖像和影像,並具備像素級精準的相機控制能力,可輸出最長 1 分鐘、1440p 解析度的影像。
  • 空間重建(Spatial Reconstruction):Atlas 能從一張至數十張輸入圖像重建真實世界的場景。它能生成來自全新視角的圖像影格,同時也能產出明確的 3D 輸出成果,實際表現可勝過專門針對 3D 重建的業界頂尖模型。\
  • 時空模擬(Space-Time Simulation):Atlas 能自輸入影像對空間和時間進行建模,為影片重新構圖以營造戲劇性的視覺效果,並為機器人領域實現「真實到模擬」(Real-to-Sim)的工作流程。

  • 圖像生成(Image Generation):Atlas 能自文字生成圖像和 360 度全景圖,它能遵循複雜的提示詞、渲染文字,並生成各式各樣的視覺風格。

World Labs 已展示一些令人驚豔的測試案例,並表示 Atlas 在創意視覺效果和遊戲設計方面有所成果。然而開發團隊表示,其真正目標是為訓練機器人來建立準確的模擬,有助於 Atlas 在競爭激烈的世界模型市場脫穎而出。

(首圖來源:World Labs

立刻加入《科技新報》LINE 官方帳號,全方位科技產業新知一手掌握!

查看原始文章

更多理財相關文章

01

億萬富翁大不同!台彩揭史上「最淡定」與「最慌張」傳奇 淡定哥中9.1億捐2500萬

anue鉅亨網
02

這家PCB大廠今驚傳「風管燃燒」觸發火警 發重訊回應了

三立新聞網
03

正港富三代!富阿公、阿嬤贈子孫總額高達869億元

自由電子報
04

緯穎1張變近3張竟藏「小數點陷阱」!沒湊股恐損失2438元

鏡週刊
05

後悔太晚開始投資! 網友曝最有感理財觀念:本金小要靠時間慢慢滾

CTWANT
06

中國砸1.7兆救金融 謝金河示警了

NOWNEWS今日新聞
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...