李飞飞创立的 World Labs 发布了 Atlas,一个从零预训练的多模态空间智能大模型。你可以给它几张照片,它能生成从任意角度观看的连续视频;给它一段手机拍摄的视频,它能重建出完整的 3D 场景,让机器人在里面模拟导航。 核心架构是「multimodal autoregressive diffusion transformer」——这个术语拆开来看,autoregressive 意味着它像 LLM 一样逐个 token 生成,diffusion 意味着这些 token 通过扩散模型解码为像素。关键区别在于,它的输入不是纯文本,而是「空间上下文」——每张图片被锚定在一个 3D 位置,用相机位姿而非文字描述来控制视角。 技术细节上,Atlas 能做四件事。 相机控制生成:1 到 6 张输入图,生成最长 1 分钟、1440p 的视频,像素级精确控制相机移动。 空间重建:1 到 100 多张图片,输出新视角和显式 3D 表示(点云、3D Gaussian splats)。 时空模拟:仅需 3 个手机摄像头就能重塑视频(bullet time 效果),支持 Real-to-Sim 机器人工作流。 还有文本到图像和 360 度全景图生成。 官方给的 benchmark 数字很漂亮。在人类评分偏好测试中,Atlas 对主流模型全面领先:Flux 3 93% 的人选 Atlas,Seedance 2.5 是 94%,Gemini Omni Flash 是 81%。3D 重建的绝对相对误差 8.6,低于 Pi3X(11.1)和 VGGT-Ω 1B(9.7)。但这些都是自报数据,和所有未发布模型的 benchmark 一样,需要独立验证。 社区里的讨论比数字本身更有意思。teraflop 点出了一个关键问题:Atlas 真正的价值可能不在生成图像,而在它学到的东西——比如识别「地面可以走」这种语义知识,用来做机器人路径规划。一位叫 JohnnyAPI 的 World Labs 客户反驳说,公司可能依赖预置的 3D 资产,这会削弱模型的语义深度。 World Labs 联合创始人 Justin Johnson 在回复中对「世界模型」做了解释。他把这类系统分成三级:渲染器、模拟器、规划器。Atlas 目前「介于渲染器和模拟器之间」——能生成高质量 3D 视图,但还不能模拟物理交互。这个定位很诚实,和那些「AGI 已经来了」的叙事风格完全不同。 另一个值得注意的细节来自 smusamashah 的观察:在演示的多米诺骨牌场景中,「骨牌凭空出现又消失」。Johnson 承认时间一致性是目前的主要局限,场景中时间基本冻结,偶尔有微弱的波浪动作。这表示 Atlas 本质上是空间模型,而非时空模型。 评论区也暴露了 AI 领域一个老问题:大部分人用不上。pj_mukh 的留言就四个字:「Please give us access.」Atlas 目前仅对合作伙伴开放早期访问。有人问帧率能否支持实时应用,官方没有给出具体数字。 但要说 Atlas 最让人兴奋的地方,可能是 stranded-man 提的一个问题:如果给地球上所有照片加上地理标签,能不能建出整个世界的 3D 模型?Atlas 项目负责人 Keunhong Park 的回答是:理论上可行,通过巧妙的上下文管理可以实现。这不只是技术问题,这是对世界建模方式的重新定义——从「人工建模」到「从照片中自动涌现」。 参考来源: Atlas: A World Model for Spatial Intelligence — World Labs HN discussion
李飞飞旗下 AI 实验室 World Labs 发布 Atlas:从几张照片重建 3D 世界
来源:开源中国
2026年09月02日 22:01
0 阅读
分享到: