World Labs · Atlas

李飞飞的Atlas:世界模型,从论文到产品只用了三个月

渲染器、模拟器、规划器——先定义,再施工。9月2日,图纸上最难的那一格有了第一个成品

2026-09-06李飞飞 · World Labs世界模型 · 空间智能

00三个月前的一篇论文,先于产品出现

9月2日,World Labs发布Atlas。要读懂它,得先回到6月4日那篇长文。

9月2日,李飞飞创办的World Labs发布了Atlas,官方称之为"全球首个多模态世界模型"。它不再满足于生成图片和文字,而是把输入的图像和视频重建为三维世界:一张照片能推出物体的背面,几张游客随手拍的地面照片能撑起一段高空航拍,三个手机镜头能复刻《黑客帝国》的子弹时间。

李飞飞在发布当天说,这是团队的一个"里程碑式"成果,"这是迄今为止最优秀的相机控制世界模型,为从视觉特效到机器人等众多应用场景打开了大门。"

但真正让Atlas显得特别的,不是这些演示。是它出现的时间点——三个月前,2026年6月4日,李飞飞和World Labs团队刚在Substack上发表了一篇长文,《世界模型的功能分类:渲染器、模拟器、规划器,以及连接它们的循环》。那篇文章把业界吵了一年多的"世界模型"概念拆成了三块,并且明确说:最难、最关键的那块,眼下没人真正做出来。

现在,图纸上最难的那一格,有了第一个成品。看懂那篇论文,才能看懂Atlas到底想干什么。

01重温定义:世界模型到底指什么

李飞飞的出发点很朴素:一个词被用坏了,就先把它拆开。

2025年以来,"世界模型"成了AI行业最热也最含混的词。计算机视觉、机器人、强化学习、生成式AI,每个领域都在宣称自己造世界模型。一个能生成火焰视频的模型、一个能即兴生成可玩游戏的语言模型、一个忠实模拟燃烧过程的物理引擎——三件完全不同的事,共用同一个名字。李飞飞在长文里说,这是当今AI领域"最重要也最被滥用"的术语。

拆解从一张比所有相关技术都古老的图开始:强化学习教科书里画了几十年的POMDP(部分可观测马尔可夫决策过程)循环。智能体采取行动,行动改变世界的状态,智能体看不到状态本身,只拿到一部分观测——落在视网膜上的光子、传感器读数、视频帧的像素。新的观测引发新的行动,循环持续。今天所有被称为"世界模型"的东西,本质上都是这个循环在不同方向上的投影:它们各自输出的,是循环里的不同部分。

投影一:渲染器

渲染器输出像素,服务人眼,唯一标准是视觉上够不够逼真。一句话生成电影级航拍镜头的视频模型是渲染器,谷歌的Genie 3、World Labs自家的RTFM这类交互式系统也是。这是商业化跑得最快的方向——谷歌的相关模型已经通过手机应用送到了数亿用户手里。

但渲染器只管"看起来像",不管"实际上对不对"。李飞飞举过一个例子:AI生成的航拍镜头,从天上看城市建筑群完美无瑕;可一旦你想开车在街道里穿行,建筑物的结构瞬间暴露出各种错误,画面崩塌。原因很简单——这类模型不掌握三维空间结构,它还原的是观看者会看到的画面,而不是事物本身的真实构造。输出再精美,也没法拿来做建筑设计,更没法训练一台需要在真实环境里精准操作的工业机器人。

投影二:模拟器

模拟器输出状态:几何数据、材质参数、碰撞网格。它追求的不是"看起来像",而是结构上的正确——几何经得起测量,运动遵守牛顿定律,动力学行为符合物理法则。它的用户有两类:一类是建筑师、设计师、影视和游戏开发者,需要超越视觉效果的精确数据;另一类是强化学习智能体、机器人控制器、自动驾驶算法,需要一个安全的环境去大规模复现那些现实中太危险、太贵或者根本没法实测的场景。仅英伟达Omniverse瞄准的工厂、仓库、数字孪生市场,潜在规模就超过万亿美元。

模拟器也最难做。训练它需要带精确几何和物理标注的三维数据,这种数据比训练渲染器用的互联网视频稀缺好几个数量级;仿真环境与真实世界之间永远隔着一条"sim-to-real"的鸿沟;同时模拟刚体、柔体、流体和织物,算力成本比单一领域模拟高出几个数量级。李飞飞的判断是:模拟器得到的公众关注最少,却可能是让AI真正理解物理世界的基础,"领域内最困难的未解问题也都集中在模拟器"。

投影三:规划器

规划器输出动作。给定当前的观测和一个目标,下一步做什么。机械手抓取、机器狗越障,这些演示视频背后是视觉-语言-动作(VLA)模型一类的规划器技术。问题在于,几乎所有演示都局限于严格受控的实验室环境:物体种类有限,任务周期很短。还没有一个在真实部署要求的复杂度、多样性和长周期里被验证过。

李飞飞的关键判断

三类模型底层共用同一套世界知识,当前最重要的趋势是三者的边界正在消融,终局是一个能够灵活切换输出形式的统一世界基础模型。在同一套模型架构中平衡各项需求,是当下世界模型领域最核心的攻关课题。

02为什么世界模型是通往AGI的必由之路

语言模型学会了遣词造句,但物理世界运行在另一套基质上。

李飞飞的论证从一条分界线开始:大语言模型让机器掌握了概念、词汇和推理,但语言模型学的是文本的统计结构,世界模型学的是时空的统计结构——光怎么照在物体上,花园从没被相机拍过的角度看是什么样子,东西受力之后怎么运动。这是两种不同的智能原料。

AGI的完整含义,不是一台更会聊天的机器,而是一个能在物理世界里感知、预测、行动的智能体。感知靠观测,行动靠规划,而预测——判断"我这么做之后,世界会变成什么样"——靠的正是对世界状态的理解。这条链路缺了任何一环,智能就永远被关在屏幕里。纯语言模型再大,也只是把世界压缩成了词;没有空间和时间的世界模型,机器人的每一次动作都是盲的。

这也解释了为什么World Labs把公司使命定在"空间智能"上。李飞飞多次引用科幻寓言《平面国》:主角生活在二维平面,被三维球体带入空间国之后,才知道"高度"的存在。在她看来,今天的AI就处在那个平面国里——读懂了像素,摸不到空间。世界模型,就是那艘把AI从平面国里带出来的船。

03Atlas是哪一种?

表面答案是"三种都是"。真正的答案是:灵魂在模拟器。

按官方定位,Atlas是一个omni world model(全模态世界模型),从零开始预训练,原生处理文本、图像、视频、相机位姿与3D深度信息,在同一个模型里完成世界生成、空间重建和时空模拟三件事。对照李飞飞的分类法,它似乎三种都占了。

但判断一个模型属于哪一类,标准不是它能生成多漂亮的画面,而是它输出什么。渲染器输出像素,模拟器输出状态。Atlas输出什么?它输出新视角的图像和视频,这是像素;但它同时输出点云、3D高斯泼溅和深度图——这是几何,是"状态"。李飞飞定义里模拟器的标志,Atlas一样不缺。

证据在跑分上。稀疏视角重建是三维视觉领域几十年的基础难题,此前一直是专用模型的天下。World Labs在DTU、ETH3D、ScanNet等公开数据集上做了统一协议的测试(重建误差AbsRel×10⁻³,越低越好):Atlas拿到25.3,专门为3D重建训练的Pi3X是28.7,Depth Anything 3是39.3,MapAnything是47.7。一个全能模型,打赢了所有专用模型。这就像一个全科生,在别人的专业课上考了第一名。

更硬的证据来自机器人。Atlas的Real-to-Sim工作流是这样的:World Labs的研究员用手机拍摄两处大型环境的视频,每处只取24帧做重建——传统上这种扫描需要昂贵设备围着目标转几十圈——然后在这个重建出的环境里模拟不同机器人沿不同路径导航,由Atlas生成机器人身上相机"将会看到"的RGB画面和深度数据。官方博客里有一句话值得单独摘出来:"世界,和机器人眼中的世界,来自同一个模型。"这不是渲染器的自我介绍,这是模拟器的自我介绍。

当然,规划器那一格还空着。Atlas不输出动作,没有VLA,不决定"下一步做什么"。不过World Labs的动作早就埋下了:7月21日收购机器人仿真公司SceniX,7月28日公开Real-to-Sim-to-Real系统——规划这一环,大概率由公司的机器人技术栈去补,Atlas负责供给它一个足够真实的世界。

所以准确的回答是:Atlas是渲染器与模拟器的融合体,灵魂在模拟器;用李飞飞自己的语言说,它是那个POMDP循环在"渲染"和"模拟"两个方向上的同时投影,并且第一次把两个投影焊进了同一个模型。它朝着"统一世界基础模型"的终局走出了第一步,但还不是终点形态。 ——对照分类法看Atlas的位置

04技术拆解:把"文本上下文"换成"空间上下文"

Atlas的全部魔法,来自一个架构层面的替换。

Atlas的官方架构名称很长:多模态自回归扩散Transformer(multimodal autoregressive diffusion transformer)。四个词各有来历。多模态,指它原生处理文本、图像、相机位姿和深度图,视频被表示为图像序列,每张图都绑定一个显式的相机位姿。自回归,指它像大语言模型一样在序列上逐个元素生成,每个输出以前面的内容为条件——这意味着KV缓存、缓存感知路由、分离式服务这些LLM基础设施它都能直接用。扩散,指它是一个整流流(rectified flow)模型,通过逐步去噪生成输出,推理步数可以在速度和质量之间换。Transformer,指主干是矩阵乘为主的标准架构,对现代硬件友好。官方的说法是,Atlas是LLM和视频模型两种血统的混合体,两边的算法与系统工程成果都能继承。

但真正的创新不在四个词的任何一个里,而在它们共同支撑的那个东西上:空间上下文(Spatial Context)。

大语言模型的工作方式,是把输入编码成上下文,再基于上下文生成后续内容。Atlas做的事情一样,区别在于:它编码进上下文的每一张图、每一段视频帧,都被锚定在三维空间中一个精确的位置上,附带相机位姿和深度信息。打个比方,这相当于给模型配了一本带坐标轴和比例尺的三维草稿本——AI理解世界时,第一次有了明确的几何参考。

这个替换带来一连串能力。第一是像素级相机控制。过去玩视频生成模型,你在提示词框里敲"镜头缓慢向左拉升、绕着人物微仰角旋转",回车之后全凭运气。Atlas把精确的相机几何作为原生输入:你直接给坐标和轨迹。1到6张参考图,一条手工设计的运镜路径,就能生成最长1分钟、1440p分辨率的视频。官方博客有句俏皮话:"你坐上的是导演椅,不是老虎机前的赌徒。"

第二是稀疏视角重建,也就是上一节跑分背后的事。传统3D高斯泼溅或点云扫描,需要扛着专业设备围着目标转几十圈、拍几百上千张照片。Atlas通常2到3张图就能给出准确重建;输入越多,它想象得越少,最多可以吃下100多张图,做到对真实环境的精确复刻。最典型的案例是斯坦福大学主方庭:从草坪主入口,到拱廊,再到纪念教堂外墙上色彩斑斓的马赛克——Atlas只收到2到25张游客视角的地面平拍照片,就重建了整个方庭,并且生成了从高空俯瞰的飞行漫游路径。那些机位,从来没有一台相机真正拍到过。

第三是时空模拟,招牌应用是"子弹时间"。《黑客帝国》里那个冻结时间、转换视角的经典特效,原本需要几百台相机组成的环形阵列。Atlas的演示素材是几个工程师用背包里装得下的东西拍的:普通手机、运动相机,配三脚架和夹具,3到5个机位。视频丢进去,Atlas从这些视角重建场景,之后你就可以冻结时间,随意重新构图每一个镜头。

还有一个近乎超能力的细节:把两张完全不相关的照片——比如一条车站走廊和一座宴会厅——扔进空间上下文,Atlas能推理出连接二者的门廊、过道和角落,生成一个在两个世界之间平滑过渡的完整场景。想象力被空间约束住了,这是"世界知识"最直观的样子。

最后是缩放。World Labs从头预训练了一系列规模递增的模型,发现每一级新的算力都解锁新的能力,官方明确表示"预期这一趋势随规模继续成立"。这句话翻译过来是:Atlas还远没到scaling curve的平缓段。这是World Labs在向整个行业下注——世界模型这条曲线,还会继续陡下去。

05意义:机器人的数据难题,被换了一种算法

短期看是影视工具,长期看是机器人的预训练基础设施。

对内容行业,Atlas的意义直接而具体。复杂运镜和子弹时间特效的制作成本被坍塌式压缩——几百个机位的预算,变成几台手机加一条设计好的相机路径。World Labs现有产品Marble已经展示了新的生产方式:输入文字、图片或草图,生成可自由漫游的3D环境,同时输出两套数据——用于视觉呈现的高斯泼溅,和用于物理计算的碰撞网格。一套给眼睛看,一套给物理引擎算,这正是李飞飞分类法里模拟器的标准双输出。Atlas将驱动Marble及World Labs后续产品的未来版本。

但李飞飞的星辰大海从来不是好莱坞。是机器人。

具身智能当下的最大瓶颈,业内有个朴素的说法:真实数据匮乏。让机器人真的去工厂、仓库和家庭里反复试错,数据采集慢,成本高,还危险;换到仿真环境里训练,又得先花大量人力搭建3D场景、材质、光照和物体。Atlas给出的是一条新流水线:少量真实照片或一段手机视频,生成逼真的三维模拟环境,连同机器人传感器会观察到的RGB和深度数据,让机器人在仿真世界里海量训练,再迁移回现实。任务一旦被模拟,变体唾手可得——换物体、换位置、换机器人运动、换光照、换背景,刚体、铰接体、可变形物体都能处理。训练数据从此可以规模化生产。

把时间线连起来看,这个意图更加清楚:

WORLD LABS 2026 · 按图施工
06.04
发布《世界模型的功能分类》长文,定义渲染器、模拟器、规划器,指出模拟器最关键也最难
06.13
一次性发布三篇论文,全部聚焦3D生成与4D生成任务
07.21
收购机器人仿真公司SceniX,补齐机器人仿真工程能力
07.28
公开Real-to-Sim-to-Real系统,直言机器人最大瓶颈是缺乏廉价、可控、可规模化的训练经验
09.01
发布Atlas,全球首个多模态世界模型,进入早期访问阶段

三个月,五步,每一步都踩在6月那篇论文画好的格子里。这不是灵感闪现的产品,是按图施工的工程。

06边界:它还不是那个"通用世界模拟器"

跑分和演示之外,有几件事需要说清楚。

Atlas擅长的是构建几何连贯的空间。对于物体碰撞、复杂动力学的通用物理模拟,能力仍待验证——李飞飞论文里点出的模拟器那些最难的未解问题(数据稀缺、sim-to-real鸿沟、多物理场算力成本),Atlas并没有全部回答,它回答的主要是"几何与视角"这一层。

还有一个容易被演示掩盖的细节:当镜头转向输入图像完全没有覆盖的区域时,Atlas仍然需要"想象",依靠先验知识补全画面。输入越少,想象越多。它生成的更像是一个视觉上合理的三维世界,未必是原来那个世界的精确数字复刻。随着生成路径变长,局部几何漂移、物体形状变化和纹理闪烁也会逐渐暴露。换句话说,模拟器要的"结构上正确",Atlas在几何维度接近达成,在动力学维度才刚刚起步。

目前Atlas处于早期访问阶段,只向部分合作伙伴开放。距离一个开放可用、驱动千万机器人的世界基础模型,中间还隔着无数个版本迭代。

07收束

回到那张循环图。

三个月前,李飞飞把"世界模型"这个词拆成三块,说最难的那块没人做成。三个月后,Atlas把渲染器和模拟器焊进同一个模型,在最难的方向上交出了第一份答卷。规划器那一格还空着,但SceniX已经买好,Real-to-Sim-to-Real的管线已经铺开。

POMDP那张图上,智能体行动,世界变化,观测回来。人类之所以是智能体,是因为我们脑子里装着一个世界;Atlas补上的,正是"世界"那一环——世界第一次被装进了机器的上下文里。

接下来的问题只剩一个:谁先在这个世界里,学会行动。