AI 前沿理论

李飞飞世界模型理论:通往AGI的真正路径

从渲染器、模拟器到规划器——一篇搞懂"世界模型"到底意味着什么

2026-09-03李飞飞 · World LabsAGI · 世界模型

01AGI到底是什么?

用最通俗的方式理解"通用人工智能"

如果你关注AI圈,一定经常听到一个词——AGI。它是 Artificial General Intelligence 的缩写,中文叫"通用人工智能"。但要真正理解它,我们得先从它不是什么说起。

当前AI vs. AGI:专科生 vs. 全科生

今天我们身边的大多数AI系统,不管是ChatGPT、Midjourney还是AlphaGo,都属于ANI(Artificial Narrow Intelligence,专用人工智能)。它们就像某个科的"专科医生"——在各自擅长的领域远超人类,但一旦跨出舒适区就束手无策。

🎯

ANI(专用AI)

  • AlphaGo:围棋天下无敌,但不会下象棋
  • ChatGPT:写文章一流,但不会开冰箱
  • Midjourney:画画惊艳,但听不懂你说话
  • 自动驾驶:开车很稳,但不会做饭
🧠

AGI(通用AI)

  • 能像人一样理解新事物
  • 能像人一样学习新技能
  • 能像人一样推理因果关系
  • 能像人一样解决从未见过的任务
  • 一句话:人能做到的,它也能

打个比方:ANI就像一个只会做拉面的师傅,拉面做得天下第一,但你让他炒个菜就不行了。而AGI就像一个全能厨师——不仅会拉面,还会炒菜、烘焙、调味,甚至能根据食材现场发明新菜式。

AGI的四个核心特征

  1. 理解能力:能"真正"理解语言、图像、声音的含义,而不只是做模式匹配
  2. 学习能力:能从少量经验中快速学习,就像小孩看一次就会用筷子
  3. 推理能力:能进行逻辑推理、因果推断,能想"为什么"而不只是"是什么"
  4. 泛化能力:能将学到的知识迁移到全新的、从未见过的场景中
一句话记住
AGI不是"更强的AI",而是"不同的AI"。它不是在某一项任务上做到极致,而是像人类一样,在任何任务上都能快速上手、灵活应对。这就像从"只会背书的机器"进化到"能举一反三的人"。

目前,我们还没有实现AGI。所有的AI系统都还停留在ANI阶段。但李飞飞认为,世界模型可能是通往AGI的关键一步。为什么?让我们往下看。

02为什么大模型不行?为什么要做世界模型?

语言不是世界的全部

大语言模型(LLM)的辉煌成就

先给大模型应有的credit。GPT-4、Claude、Gemini……这些大语言模型确实做到了令人惊叹的事情:写诗、编程、翻译、问答、推理……它们在语言层面的表现已经接近甚至在某些任务上超越了人类。

你可能会想:既然这么厉害,继续做大、给更多数据、更多算力,不就离AGI越来越近了吗?

问题没那么简单。

大模型的致命局限:只懂语言,不懂世界

大语言模型的核心问题是:它们只在语言的海洋里游泳,从未碰触过真实的物理世界

类比
想象一个人,从出生起就被关在一个房间里,房间里只有书——物理书、化学书、数学书、小说、百科全书……他读了所有的书,能跟你讨论量子力学、能写诗、能解方程。但他从未碰过一颗球从未看过水流从未感受过重力

你问他"把杯子放在桌子上会怎样",他能用文字描述得头头是道。但如果你真的给他一个杯子和一张桌子,他可能会把杯子从侧面推进去——因为他只是在"复述"书本上的文字,而不是真正"理解"物体之间的空间关系和物理约束。

这就是大语言模型的处境:一个只读过书但从未见过真实世界的人

没有"状态"概念——不理解物理世界

更技术化地说,大模型缺乏几个关键能力:

核心问题
大模型擅长描述世界,但不理解世界。它能告诉你"下雨了地面会湿",但它不知道"湿"是什么触感,不知道雨水落在皮肤上是什么温度,也不知道地面湿了之后走路会打滑。

这种"语言层面理解"和"物理层面理解"之间的鸿沟,就是当前AI离AGI最大的障碍。

所以我们需要"世界模型"

正因为大语言模型的这些局限,AI研究者们意识到:要走向AGI,不能只让AI处理语言,必须让它真正理解物理世界

这就是"世界模型"(World Model)概念的由来。

世界模型是一种能够理解和模拟物理世界的AI系统——它不仅知道世界"看起来什么样",更知道世界"怎么运作":物体怎么运动、力怎么传递、因果关系怎么传递、时间怎么推进。 —— 世界模型的核心定义

简单说:

这就是为什么李飞飞和World Labs团队要全力投入世界模型的研究。但"世界模型"这个词到底是什么意思?它包含什么?我们继续往下看。

03视频生成模型只是世界模型的"渲染器"

Sora能画出逼真画面,但它不懂物理

Sora们的惊艳与尴尬

2024年,OpenAI发布的Sora震惊了世界——它能生成长达一分钟的高质量视频,画面逼真到让人难以分辨真假。此后,各大厂商纷纷推出视频生成模型:Google的Veo、Runway的Gen-3、Pika……

很多人兴奋地喊:"这就是世界模型!AI已经理解物理世界了!"

但事实远非如此。

看起来很真,但物理全错

如果你仔细观察Sora等模型生成的视频,会发现大量"物理穿帮":

视频生成的常见物理错误

那些"看起来很真但完全不对"的画面

错误类型 1:穿模椅子穿过桌子、人的手臂穿过墙壁、杯子嵌入桌面——物体之间没有碰撞约束
错误类型 2:流体错误水流违反流体力学——水往高处流、液体消失、溅起的水花不遵循物理规律
错误类型 3:物体变形物体无端变形、消失或凭空出现——不遵守质量守恒和物体持久性
错误类型 4:因果错误人走路但脚不接触地面、球抛出后轨迹不合理——运动学和动力学错误
类比
想象一个天才画家,画功出神入化——他画的水果看起来能让人流口水,画的水面仿佛真的在流动。但这个画家从未学过物理

你让他画"一个杯子从桌上掉下来",他画出的画面美轮美奂,但杯子可能直接穿过地板消失了。因为他在画"看起来像什么",而不是在算"物理上会发生什么"。

Sora们就是这个天才画家——会画画面,但不懂物理

视频生成 ≠ 世界模型

这正是李飞飞要强调的核心观点之一。

视频生成模型只是在学习"像素到像素"的映射,而不是在建模物理世界的因果关系。能生成逼真视频,不等于理解了世界。视觉逼真 ≠ 物理真实。 —— 李飞飞的观点

打个更直白的比方:

所以,视频生成模型充其量只完成了世界模型的一个组成部分——渲染器(Renderer)。它负责把世界状态"渲染"成你看到的画面。但世界状态本身是什么?物理规律怎么运作?这些它完全不管。

关键区分
视频生成 = 渲染器(把状态变成画面)
世界模型 = 渲染器 + 模拟器 + 规划器(理解状态、推演状态、规划动作)

Sora们完成了三分之一的工作量,但远不是世界模型的全部。

那么,完整的世界模型应该是什么样的?李飞飞的论文给出了系统性的回答。

04李飞飞的世界模型理论全面介绍

《A Functional Taxonomy of World Models》——世界模型的功能分类学

理论背景

核心论文

A Functional Taxonomy of World Models

论文标题A Functional Taxonomy of World Models(世界模型的功能分类学)
发表时间2026年6月3日
作者李飞飞与 World Labs 团队
核心问题"世界模型"已成为AI领域被滥用最严重的术语之一——人人都在说,没人说清楚

李飞飞发现了一个严重的问题:"世界模型"这个词已经被滥用了。做视频生成的说自己是世界模型,做机器人仿真的说自己是世界模型,做自动驾驶的也说自己是世界模型……但它们做的事情完全不同。

就像"健康"这个词——健身教练说"要健康"、医生说"要健康"、营养师说"要健康",但每个人说的"健康"根本不是一回事。如果不厘清概念,整个领域都会陷入混乱。

于是李飞飞团队提出了一个功能分类学:不要看系统叫什么名字,而要看它在做什么功能。用什么标准来分?她选择了一个经典的AI理论框架——POMDP。

POMDP理论框架:世界模型的理论根基

李飞飞以POMDP(Partially Observable Markov Decision Process,部分可观测马尔可夫决策过程)循环为理论根基。听起来很学术?别急,我们拆开来理解。

POMDP循环——世界模型的"骨架"

智能体 (Agent) ────动作(Action)────▶ 世界状态 (State)
                                          │
                                          │ 状态转移
                                          ▼
观测 (Observation) ◀────观测函数──── 世界状态 (State)

四个核心要素:
智能体 (Agent):在世界中行动的主体(可以是人、机器人、AI系统)
世界状态 (State):世界的底层真实情况(完备但不可直接观测)
动作 (Action):智能体对世界施加的影响
观测 (Observation):智能体对世界状态的不完整感知

关键区分:状态 ≠ 观测
状态 (State) = 世界的底层现实(全部信息,但"看不见")
观测 (Observation) = 智能体感知到的部分(不完整,有遗漏)

类比:你看到一个人在跑步(观测),但你不知道他的心率、肌肉状态、大脑指令(状态)

李飞飞的关键洞察是:一个"世界模型"到底在建模POMDP循环的哪一段,决定了它属于哪个功能类别

在POMDP循环中,有三条核心路径:

  1. 状态 → 观测:把世界状态"渲染"成可感知的画面 → 这就是渲染器
  2. 状态 → 状态:推演世界状态如何随时间变化 → 这就是模拟器
  3. 观测 → 动作:根据观测决定下一步做什么 → 这就是规划器

李飞飞据此将世界模型分为三大功能组件。下面逐一详解。

三大功能组件详解

🎨

渲染器

Renderer · 状态→观测
  • POMDP位置:观测函数 s_t → o_t
  • 核心输出:像素,供人眼或相机观看
  • 优化目标:视觉逼真度
  • 代表系统:Sora、Genie 3、RTFM、Nano Banana
  • 关键局限:视觉逼真 ≠ 物理真实
⚙️

模拟器

Simulator · 状态→状态
  • POMDP位置:状态转移函数 s_t → s_{t+1}
  • 核心输出:状态——几何、物理、动力学一致
  • 优化目标:结构忠诚度
  • 代表系统:PhysX、Omniverse/Cosmos、Marble、PointWorld
  • 关键地位:最重要但被忽视最多
🎯

规划器

Planner · 观测→动作
  • POMDP位置:策略函数 o_t → a_{t+1}
  • 核心输出:动作——轨迹或运动指令
  • 代表系统:VLA模型、World Action Models
  • 关键局限:最不成熟,局限于实验室

1. 渲染器(Renderer):状态 → 观测

渲染器

把世界状态"画"出来

渲染器是POMDP循环中的观测函数:它接收世界的底层状态(State),输出可供人眼或合成相机观看的像素画面(Observation)。

用通俗的话说:渲染器就是把"世界的真实状态"变成"你能看到的画面"

POMDP位置观测函数 s_t → o_t
核心输出像素(Pixel)——供人眼或合成相机观看
优化目标视觉逼真度(Visual Fidelity)——画面越真越好
代表系统Sora(OpenAI)、Genie 3(DeepMind)、RTFM(World Labs)、Nano Banana(Google)
关键局限视觉逼真 ≠ 物理真实——画面好看不代表物理规律正确

渲染器是我们最熟悉的组件,因为视频生成模型就是渲染器。但正如前面所说,渲染器只负责"画画面",它不关心世界到底怎么运作。它就像一台高级相机——能把世界拍得很美,但不知道拍的是什么。

2. 模拟器(Simulator):状态 → 状态

模拟器

推演世界状态如何变化

模拟器是POMDP循环中的状态转移函数:它接收当前世界状态(State),推演出下一个时刻的世界状态。它不关心画面长什么样,只关心世界本身的物理规律是否被正确模拟

用通俗的话说:模拟器就是"物理引擎"——它知道球怎么滚、水怎么流、碰撞怎么发生

POMDP位置状态转移函数 s_t → s_{t+1}
核心输出状态(State)——几何、物理、动力学一致的世界表示
优化目标结构忠诚度(Structural Fidelity)——几何经得起检验、物理遵守牛顿定律、动力学符合物理规律
代表系统PhysX、NVIDIA Omniverse/Cosmos、World Labs Marble、PointWorld
关键地位最重要但被忽视最多——"渲染器卖钱,规划器做演示,模拟器才真正触碰世界"
李飞飞的核心论断
模拟器是三大组件中最重要但被忽视最多的类别。

为什么被忽视?因为模拟器不直接产出"好看的画面",它的输出是抽象的状态表示——几何、物理参数、动力学变量。这些东西不能直接展示给消费者看,不如视频生成模型那样能刷屏。

但李飞飞认为:"渲染器卖钱,规划器做演示,模拟器才真正触碰世界。"没有模拟器,渲染器只是在画没有灵魂的画,规划器也只是在瞎猜动作后果。

3. 规划器(Planner):观测 → 动作

规划器

根据观测决定下一步做什么

规划器是POMDP循环中的策略函数:它接收智能体对世界的观测(Observation),输出应该执行的动作(Action)。这是最接近"智能决策"的组件。

用通俗的话说:规划器就是"决策大脑"——看到世界是什么样,决定接下来做什么

POMDP位置策略函数 o_t → a_{t+1}
核心输出动作(Action)——轨迹或运动指令
代表系统VLA模型(Vision-Language-Action)、World Action Models
关键局限最不成熟的类别——几乎所有机器人演示仍局限于实验室环境,无法在真实世界可靠运行

规划器是最激动人心的组件,因为它直接关联到"AI能在真实世界中行动"。但目前它也是最不成熟的。你看到的机器人翻跟头、做家务的视频虽然很酷,但大多是在精心控制的实验室环境中实现的,离真实世界的复杂性和不可预测性还差得远。

三者如何协同:一个统一的世界基础模型

李飞飞强调,这三大组件并非完全分离的独立系统。它们之间有深刻的联系。

共享底层知识

核心洞察
支撑渲染、模拟和规划的是同一套底层知识——几何、物理、动力学。

李飞飞说:"三个类别是单一底层理解的三个投影。"

就像同一块钻石的不同切面——它们看起来不同,但本质是同一块宝石。渲染器、模拟器、规划器分别从不同角度"使用"同一套对世界的理解。

模拟器是关键枢纽

在三者关系中,模拟器占据着核心枢纽的位置:

不能模拟状态空间物理、几何和动力学约束的系统不是世界模型,而是影子生成器—— 李飞飞

这句话非常犀利。它在说:如果你的系统不能真正模拟物理规律(几何形状、物理约束、动力学变化),那不管你生成的画面多漂亮,你都不算"世界模型"——你只是在生成"影子",而不是在理解"实体"。

边界正在消融

李飞飞指出,三大组件之间的边界正在逐渐消融。终局愿景是一个统一的世界基础模型(Unified World Foundation Model):

终局愿景

统一世界基础模型

一个模型,三种能力:

  • 渲染照片级真实视图(像渲染器一样)
  • 产出物理准确的结构和状态(像模拟器一样)
  • 规划动作序列(像规划器一样)

根据下游需求切换输出模态——需要画面时输出像素,需要物理状态时输出结构,需要决策时输出动作。

这就像人类大脑——你看到一杯水(渲染),你知道它有重量、会洒(模拟),你决定伸手去拿(规划),这些能力在大脑中是统一的,而不是三个分开的模块。

World Labs 实践落地

理论有了,World Labs 也在实际落地。以下是他们已经发布或计划发布的产品:

产品时间功能
Marble2025年11月同时输出高斯泼溅(渲染)和碰撞网格(模拟)——一个系统同时具备渲染和模拟能力
RTFM2025年10月单卡H100实时生成视频——让渲染器实时运行
R2S2R2026年7月Real-to-Sim-to-Real引擎——打通"真实世界→仿真训练→真实机器人运行"的闭环
Atlas2026年9月全能世界模型——朝统一世界基础模型迈进的关键一步
2025年10月
RTFM
单卡H100实时生成视频,让渲染器实时化
2025年11月
Marble
同时输出高斯泼溅(渲染)和碰撞网格(模拟),一个系统跨越两大组件
2026年7月
R2S2R
Real-to-Sim-to-Real引擎,打通仿真训练到真实机器人运行的完整闭环
2026年9月
Atlas
全能世界模型,朝统一世界基础模型迈进的里程碑
产品演进逻辑
从RTFM(纯渲染)→ Marble(渲染+模拟)→ R2S2R(模拟+规划)→ Atlas(全能统一),我们可以清晰地看到World Labs沿着渲染器→模拟器→规划器→统一模型的路径逐步前进。

这正是李飞飞理论框架在实践中的体现——从单一功能走向统一的世界基础模型。

05再讲为什么

为什么是现在?为什么是世界模型?为什么可能通向AGI?

为什么要提出这个分类法?

因为"世界模型"这个概念太混乱了。

在李飞飞提出功能分类学之前,"世界模型"这个词在AI圈被用得泛滥:做视频生成的说自己是世界模型,做物理仿真的说自己是世界模型,做机器人控制的也说自己是世界模型……但它们做的事情天差地别。

这种概念混乱带来两个严重后果:

李飞飞的分类法就像给混乱的工具箱做了整理——你不是在做"世界模型"吗?那你到底在做渲染器、模拟器还是规划器?先把这个说清楚,再谈其他的。

为什么模拟器是最重要的?

因为在三大组件中,模拟器是连接渲染和规划的关键枢纽

模拟器的枢纽地位
  • 没有模拟器,渲染器只是画皮:渲染器可以生成漂亮画面,但如果没有模拟器提供正确的世界状态,画面里的物理全是错的
  • 没有模拟器,规划器是瞎子:规划器要决定做什么动作,但它需要模拟器来预测"做这个动作之后世界会变成什么样"——没有模拟器,规划器就是在盲猜
  • 模拟器把二者连起来:模拟器提供正确的世界状态→渲染器渲染正确画面;模拟器推演动作后果→规划器做出正确决策

这就像盖房子——渲染器是外墙涂料(好看),规划器是住户的决策(做什么),而模拟器是地基和结构(决定了墙能不能立住、人能不能住)。地基看不见,但没它一切都塌。

为什么这条路可能通向AGI?

因为真正的AGI需要理解物理世界,而不仅仅是处理语言

回到我们在第一部分的讨论:AGI的核心特征是能像人类一样理解、学习、推理和解决各种通用任务。而人类之所以能做到这些,很大程度上是因为我们有一个"内置世界模型"——我们能感知物理世界、理解因果关系、预测行为后果。

如果AI永远停留在语言层面,它永远只是一个"会背书的人"。只有当它能:

它才真正具备了像人类一样的通用智能。世界模型的三位一体,恰好对应了人类智能的三个核心能力。

为什么是现在?

世界模型的概念并不新——AI领域讨论"世界模型"已经很多年了。但为什么直到现在才有可能真正实现?因为三个技术条件刚刚成熟:

💻

算力成熟

世界模型需要远超语言模型的算力——它要同时处理空间、时间、物理的多维数据。GPU总算力从当年的TFlops级跃升到了今天的PFlops甚至EFlops级,让大规模世界模型的训练成为可能。

📊

数据成熟

不仅是文本数据,3D扫描数据、物理仿真数据、机器人遥操作数据、多模态传感器数据的积累,为训练世界模型提供了足够的"原材料"。特别是合成数据的兴起,让物理标注数据不再稀缺。

🧊

3D技术成熟

NeRF、高斯泼溅(Gaussian Splatting)等3D表示技术的突破,让AI不再只能处理2D像素,而是能真正表示和操作3D空间。这是模拟器能工作的基础——你得先能表示3D世界,才能模拟3D世界的物理。

🔗

理论成熟

从POMDP到diffusion model再到大规模预训练,理论工具的积累终于到了可以把渲染、模拟、规划统一到一个框架下的阶段。李飞飞的分类法本身就是理论成熟的一个标志。

展望未来:统一世界模型对AGI的意义

如果李飞飞的愿景实现——一个统一的、能同时渲染、模拟和规划的世界基础模型——那将意味着什么?

世界模型的终局图景

  • 机器人真正走出实验室:当模拟器能准确推演动作后果、规划器能可靠决策,机器人就能在真实世界的复杂环境中自主行动——从工厂到家庭
  • 自动驾驶真正可靠:当世界模型能理解交通场景的物理因果——不只是"看到"前面有车,还能"预测"它接下来会怎么走
  • AI具备"常识":当AI有了物理世界的"内化模型",它就不再会犯"把杯子穿过桌子"这种低级错误——它有了人类所说的"常识"
  • AGI的基石:当AI能像人一样感知、理解和操作物理世界,它就向"通用人工智能"迈出了最关键的一步
世界模型不是AGI本身,但它是通往AGI的必经之路。语言让AI学会了"说话",世界模型将让AI学会"理解"。一个既会说话、又懂世界的AI,才是真正意义上的通用人工智能。 —— 本文总结

从渲染器到模拟器,从模拟器到规划器,从三大组件到统一模型——李飞飞给我们画了一张清晰的地图。这条路很长,但方向是明确的。而方向明确,也许是最重要的第一步。