
李飛飛 World Labs 發佈 Atlas 世界模型:多模態空間智能生成1440p影片、3D重建,機器人訓練迎來新紀元
引言
2026年9月1日,由AI先驅李飛飛(Fei-Fei Li)聯合創辦的 World Labs 正式發佈 Atlas——一個專為空間智能設計的「全能」世界模型。Atlas 採用多模態自回歸擴散Transformer架構,能夠在統一的空間框架內原生處理文字、圖像、影片和3D數據,生成長達一分鐘的1440p高清影片,並實現精確的3D場景重建。
Atlas 的核心能力
相機控制生成
Atlas 最引人注目的能力之一是精確的相機控制生成。用戶可以從參考圖像出發,定義具體的相機軌跡,系統將生成在3D空間中保持一致性的場景影片,解析度高達1440p,時長可達一分鐘。
這一能力對電影製作、遊戲開發和虛擬現實內容創作具有革命性意義——創作者無需昂貴的攝影設備,即可生成任意視角的高質量影片內容。
空間重建
Atlas 能夠從數量不等的輸入圖像(從單張到數十張)重建真實世界場景。與專門的開源3D重建模型相比,Atlas 通過其內部世界知識填補空白,輸出明確的3D表示,包括點雲(Point Clouds)和3D高斯散點(3D Gaussian Splats)。
時空模擬
Atlas 同時建模空間結構和時間演化,支持:
- 「子彈時間」風格影片重構:從簡單相機設置生成多視角慢動作效果
- Real-to-Sim 工作流程:生成逼真的RGB和深度數據,用於在多樣化虛擬環境中訓練和測試機器人
圖像生成
除世界建模外,Atlas 還具備強大的圖像生成能力,支持文字到圖像和360度全景圖生成,具有複雜的提示遵循能力和文字渲染功能。
技術架構:多模態自回歸擴散Transformer
Atlas 採用多模態自回歸擴散Transformer架構,這一設計將輸入視為植根於3D空間上下文的序列,允許模型生成以該上下文為條件的輸出。
通過結合大型語言模型(LLM)的自回歸特性與現代影片生成中的潛在擴散技術,Atlas 受益於兩個領域的架構和系統進步,包括擴散蒸餾(Diffusion Distillation)和無分類器引導(Classifier-Free Guidance)等技術。
World Labs 的發展歷程
公司背景
World Labs 由AI研究先驅李飛飛聯合創辦,她以在ImageNet和計算機視覺領域的開創性工作而聞名。公司的使命是開發能夠理解和生成物理世界的AI系統。
融資歷程
- 總融資:12.3億美元
- 2026年2月:完成10億美元融資輪,投資方包括 Autodesk、AMD、NVIDIA 和 Fidelity
- 2026年7月:收購 SceniX,增強機器人相關空間智能能力
產品演進
- 2025年11月:發佈首個商業多模態模型 Marble
- 2026年1月:推出 World API
- 2026年9月:發佈 Atlas 世界模型
對機器人和自動化行業的影響
Real-to-Sim 的突破
Atlas 的 Real-to-Sim 工作流程對機器人訓練具有深遠意義。傳統上,機器人需要在真實環境中進行大量試錯訓練,成本高昂且耗時。Atlas 能夠從真實場景圖像生成逼真的虛擬訓練環境,大幅降低機器人訓練的成本和時間。
亞太地區的應用前景
亞太地區在製造業自動化和機器人應用方面處於全球前列。Atlas 的能力對以下領域具有特別重要的意義:
- 日本和韓國的製造業機器人:利用Real-to-Sim加速工廠自動化
- 中國的物流機器人:在虛擬環境中訓練倉儲和配送機器人
- 新加坡的智慧城市項目:生成城市環境的3D模型用於規劃和模擬
訪問方式與商業化
Atlas 目前不是開源模型,而是通過雲端訪問的專有模型。World Labs 在發佈時開始接受早期訪問申請,計劃將 Atlas 整合到其商業產品(如 Marble)的未來版本中。
行業競爭格局
Atlas 的發佈正值空間AI和世界模型領域競爭加劇之際。Google DeepMind、Meta 和多家初創公司都在積極開發類似能力。World Labs 的差異化優勢在於:
- 李飛飛在計算機視覺領域的深厚學術背景
- 對空間智能的專注定位
- 強大的機器人訓練應用場景
結語
Atlas 的發佈標誌著世界模型技術的重要里程碑。通過將文字、圖像、影片和3D數據統一在空間框架內,Atlas 為機器人訓練、影視製作、遊戲開發和虛擬現實等多個行業提供了強大的新工具。隨著空間AI技術的持續發展,我們正在進入一個AI能夠真正理解和生成物理世界的新時代。
資料來源:World Labs 官方博客、Crypto Briefing、KuCoin(2026年9月)


