智讯智库

李飞飞发布首个世界模型Atlas:先被颠覆的是导演还是机器人?

原创物理AIAI
来源施展
2026年09月02日15:29
分享
收藏
字体大小

9月1日,“AI教母”李飞飞,发布了首个多模态世界模型——Atlas。

Atlas是一款面向空间智能的全能模型。顾名思义——文本、图像、视频、相机位姿、3D深度,全部放进同一个模型里训练。

一个模型,同时输出世界生成、空间重建、时空模拟三大能力。

先说第一个颠覆点,相机控制生成,这就好比虚拟世界里的无人机。

Atlas读取一张或多张参考图,你指定任意的相机位置和角度,它就生成新视图——内容、几何和输入图像严丝合缝,还能平滑外推,补出照片里根本看不到的部分。

其次是空间重建。Atlas根据一张或多张输入图像,重建真实世界空 间——不需要特殊采集设备,也不需要几百张密集视图,就能真实还原物体和场景。只用2到25张地面拍摄的普通照片,Atlas就重建了斯坦福大学校园,我们能从草地主入口,一路穿越到纪念教堂的马赛克外墙。

第三是时空模拟。以前想拍好莱坞的“子弹时间”,得一整个摄影棚的阵列相机同时开工;而Atlas仅靠3台普通手机同时拍一段视频,就能重建整个场景,然后把时间“冻住”,让你从任何不可能的角度,重新看那个瞬间。

现在的基础视频大模型,Sora、可灵、Seedance,本质上是个“画技超群的画家”:视频被压成一张张画,每画一帧盯着上一帧画,但脑子里没有真实的3D房间,长镜头中仍可能出现结构漂移、物体变形和空间不一致。

而Atlas是“建筑师”:每张图都钉在真实的3D坐标里,相机位姿是它的原生输入,所以它的时间有演化规律、空间有真实坐标,因此能够比纯文本镜头指令提供更精确的几何控制。

这就是“视频生成”和“世界模拟”的分界。

Atlas技术底座叫“多模态自回归扩散Transformer”,能在同一架构中处理文本、图像、相机位姿和深度,并根据任务输出图像、视频、深度、点云或3D高斯泼溅3DGS。在World Labs自行复现的多项3D重建基准中,Atlas 取得了最低的平均点图相对误差。而在相机控制效果的真人盲测中,对比MiniMax H3和Seedance 2.5,最少也有75%的人选了Atlas。

除了重塑视频生成的逻辑,这套世界模型,更有可能先落在机器人、自动驾驶的算法训练环节。

拿机器人来说,现在想搭一个跟真实世界很像的训练场景,难到什么程度?

要么雇专业团队,用3D扫描仪手工建模一个厨房,一做就是几周;要么让机器人在真实世界里硬练,摔几千次、撞坏几台样机,才学会开门、抓杯子。

Atlas的思路是:手机拍一段厨房视频,直接重建出整个3D厨房,连门怎么开、杯子怎么滚、布怎么皱,都模拟出来,然后随便改一键生成成千上万种训练场景。

当AI开始“理解空间”,第一个被掀翻的行业,是拍电影,还是造机器人?

最新发布