World Labs 发布 Atlas 世界模型:几张照片重建 3D 世界,还能输出 3D 高斯泼溅
李飞飞创办的 World Labs 在 9 月 1 日正式发布了新一代世界模型 Atlas。用一句话概括:给它几张普通照片,它能重建出一个可以自由飞行视角的 3D 世界,还能按你设计的运镜路线拍出最长 1 分钟的 1440p 视频,甚至直接输出 3D 高斯泼溅(3DGS)格式的场景文件。本文基于官方博客与多家媒体转述整理。
这为什么是个大事
先说传统做法有多麻烦。想得到一个场景的 3D 模型,通常要么背上专业扫描设备,要么围着场景拍几百张照片再喂给重建软件。World Labs 官方给出的说法是:Atlas 用 2 到 3 张普通照片就能给出忠实的重建结果,而且效果超过了那些专门为 3D 重建训练的模型(SOTA)。如果你愿意多喂图,它的空间上下文最多能吃下 100 多张照片,把整个真实环境精确还原。
再说运镜。过去用视频生成模型,想控制镜头怎么动,基本靠在提示词里"许愿"——写"镜头缓慢左移并上升",然后祈祷模型听懂。Atlas 的思路完全不同:相机位姿参数是它的原生输入。你想要什么角度、什么轨迹、什么速度,直接输入坐标就行,官方称之为像素级镜头控制。多家媒体在实测报道中都把这一点列为 Atlas 最直观的突破。
更难得的是,这三件事——生成、重建、模拟——是由同一个模型完成的。Atlas 从零开始预训练,原生处理文字、图像、视频、相机位姿和 3D 深度信息,架构上是多模态自回归扩散 Transformer,所有输入合并成一个共享的"空间上下文",模型基于这个上下文续写接下来的画面,并保持 3D 一致性。
四大能力,逐个说人话
1. 相机控制生成。 给它 1 到 6 张参考照片,再设定一条相机路径,Atlas 就能生成最长 1 分钟、1440p 分辨率的视频,画面几何和原图保持一致。有个玩法很能体现它的"空间想象力":把两张毫不相关的照片放进空间上下文,指定它们在 3D 空间中的位置,Atlas 会自己脑补出中间的门厅、走廊、角落,生成一个把两者自然衔接起来的世界。
2. 空间重建。 官方给了一个很直观的例子:拍斯坦福校园的主楼草坪,第 1 张照片只能看到花园,模型输出里也只有花园是"真的",其余是想象;加上第 2 张隔壁小屋的照片,小屋就精确了;加上第 3 张主屋的照片,整个场景完全还原。它还能从平地照片出发,生成高空航拍视角的画面。重建结果可以输出成点云,也可以输出成 3D 高斯泼溅——后者正是目前网页端 3D 展示和游戏引擎最吃香的格式。
3. 时空模拟。 这一部分对视频工作者和机器人团队都实用。用 3 部普通手机加三脚架从不同角度拍同一段视频,Atlas 就能"冻结时间",让你从任意刁钻角度重构画面——相当于把"子弹时间"拍摄棚装进了背包。官方特别说明,这些演示就是工程师用手机和夹在背包里的运动相机拍的,没有专业设备。机器人方向上,用 24 帧手机视频就能重建一个大空间,模拟机器人在里面走动时,模型同步生成它"看到"的 RGB 画面和深度数据,用于 Real-to-Sim 训练。
4. 文生图。 Atlas 也能从文字直接生成图像和 360 度全景图,支持复杂提示词,还能在图里正确渲染文字。
对谁有用
- 游戏和小世界创作者:几张照片变成可以在浏览器里探索的 3D 场景,输出 3DGS 直接进工作流。
- 视频和 VFX 从业者:不用租子弹时间摄影棚,几部手机就能实现多机位冻结时间重构图。
- 机器人团队:Real-to-Sim 流程里,扫描空间这一步从"专业设备"降级到"一部手机拍段视频"。
- 建筑、房产、电商展示:少量照片生成虚拟漫游,成本大幅下降。
先别急着高潮:限制与现状
媒体的实测报道和官方博客都承认了同一个问题:当相机进入原图没拍到的区域,Atlas 靠的是模型先验在"猜"。视角跨度越大、生成路径越长,越容易出现局部几何漂移、物体形状变化和纹理闪烁。换句话说,它生成的是一个视觉上合理的 3D 世界,不保证是真实场景的精确数字复刻。要做测量、验收级别的精确建模,现阶段还得靠传统扫描方案。
另外,Atlas 目前处于早期访问阶段(early access),只对部分合作伙伴开放,官网上可以申请,暂未公布公开定价。World Labs 表示 Atlas 未来会驱动其消费级产品 Marble 的后续版本——也就是说,普通用户想上手,大概率要等它进 Marble。
参考
- World Labs 官方博客:Atlas: A World Model for Spatial Intelligence(2026-09-01)
- 36kr 英文版、Xenospectrum 等媒体对发布的多家转述报道
(本文基于官方博客与多家媒体转述整理)