Atlas发布,World Model 开始生产机器人训练世界

澎湃新闻
2026-09-08 13:41:05

  举起一部手机,沿着仓库走过,镜头记录下墙面、货架、箱子和通道,World Labs 从这段视频里抽取 24 帧,把原本只存在于画面中的现场放进一个可以继续生成的三维空间。

  研究人员随后改变机器人的行走路线。Atlas 根据机身相机新的位置和朝向,生成机器人沿途应该看到的 RGB 图像与深度数据。机器人换了一条路线,视野也随之改变。现实空间被压缩成少量观测,仿真中的传感器又从同一个空间上下文里长出来。

  这是 World Labs 于美国时间 9 月 1 日发布 Atlas 时展示的场景。Atlas 被定义为面向空间智能的全模态世界模型,能同时处理文本、图像、视频、相机位姿与深度信息。它不仅可以重建现实场景、生成新视角,输出点云与 3D Gaussian Splat,还能把物理世界的时间与空间结构直接接入机器人仿真流程。

  在炫酷的演示视频之外,从具身智能的真实落地需求来看,问题会变得具体起来:一段现实视频,究竟怎样才能变成机器人可以进入、观察、行动和接受测试的世界?

  从一段视频到一个空间

  Atlas 的演示从一张照片开始。画面里是一只站在菜地中的铜色机器人,镜头移到它的背后,机器人原本没有被拍到的部分和照片之外的空间随之出现。模型根据已有内容以及对现实世界的先验,补出一个新的视角。

  相机的位置和朝向也可以直接成为输入。用户可以预先设计一条运动路径,让模型沿着路径输出连续视频。官方演示中,1 到 6 张参考图可以生成最长 1 分钟、最高 1440p 的视频。pan、truck、crane 等电影术语描述的是运镜意图,生成结果受到相机在空间中移动的几何路径约束。相机每移动到一个位置,模型都要同时处理新的观察方向、已经出现的画面内容和前后视角之间的关系,连续镜头由此保持共同参照。

  当多张散乱照片同时输入时,这种空间感知更加明显。若将两张互不相关的参考图摆在三维空间的不同位置,Atlas 会在两者之间自动填充门廊、走廊与转角等过渡区域。这些内容并不直接存在于任何一张照片里,而是模型根据两端的位姿与视觉线索,构造出一条连贯的空间。墙角、门框与相近的地面高度,都成为了连接世界的线索。

  World Labs 将这种底层机制称为空间上下文(spatial context)。Atlas 将文字、图片、相机位姿与深度图统一编码到同一个序列中,再基于上下文推演后续内容。每张输入图片都被赋予明确的三维坐标,每张深度图也都与具体的相机位姿绑定。原本零散的二维画面因此有了共同的坐标系,成为对同一物理空间的不同观测角度。

  输入的观测数量直接决定了空间的确定性。如果仅有一张花园照片,花园主体能够被较好地还原,但画框之外的建筑与道路主要依赖模型的合理推测;一旦加入小屋与主楼的多角度视角,对应区域就会被真实图像精准锁定。官网展示的斯坦福 Main Quad 案例显示,输入 2 到 25 张地面视角照片后,模型便能合成远高于校园地面的空中视角视频。参考图越丰富,几何关系越明确,模型需要凭空想象的成分就越少。

  这种空间表示还可以直接导出为显式三维结果。Atlas 支持从单张图片联合推演新视角与三维几何,并转化为 3D Gaussian Splat。面对真实场景的视频输入,它能逐帧预测深度,把深度图汇聚为点云与可渲染的高斯场景。颜色、相机位姿与物体深度关系被整合为可多角度查看的三维对象。视频与图像足以满足人类的视觉浏览,但要让机器人、游戏引擎与设计软件使用,则必须依赖这种可检查、可导出的显式三维结构。

  在底层架构上,Atlas 采用了多模态自回归扩散 Transformer。自回归结构负责组织文字、图像、视频、位姿与深度等序列;扩散过程通过 rectified flow 逐步生成高保真的图像与视频信号;Transformer 充当统一的骨干网络处理多模态交互。空间上下文将散乱观测接入统一关系网,生成过程再顺着新的相机位姿延展出图像与深度,相机轨迹、画面内容与几何结构由此在同一个计算框架内达成一致。

  空间还是传感器?

  重建一个静态仓库相对容易,但当机器人真正走入真实场景时,系统必须持续回答的问题是:在当前的机身位姿下,视觉与深度相机究竟应该看到什么?

  Atlas 的仓库演示打通了这一链路。研究人员利用手机视频中的 24 帧画面重建了两个大型环境,随后放入不同形态的机器人并设定各自的行走路线。Atlas 顺着这些移动轨迹,实时生成了机载相机应该采集到的 RGB 与深度数据。环境的三维重建、机器人的运动轨迹与相机的观测数据共享同一套空间上下文,视角能够随着机器人的物理移动无缝更新。

  随着机器人沿新路线前行,机载相机的位置与朝向不断变化。前一时刻看到的货架正面,移动后变为侧面;近处的纸箱移出视野,通道深处的物品逐渐展现。RGB 画面与深度数据随位置变化同步刷新,而背后的环境、路线与传感器始终绑定在同一个仓库中。

  相机控制评测(Camera Control Evaluation)直接检验了这种几何控制力。评测为模型提供一张输入图与 1 到 3 段 pan、truck、crane 等运动路径。Atlas 直接接收具体的相机几何轨迹,而对比模型则接收自然语言运镜描述,再由第三方评估生成画面是否契合目标路径。World Labs 公布的数据显示,Atlas 的得票率在各对比模型中表现突出:相对于 MiniMax H3 为 75%、Gemini Omni Flash 为 81%、HappyHorse 1.1 为 86%、FLUX 3 为 93%、Seedance 2.5 为 94%。相机运行轨迹越复杂,Atlas 的几何跟随优势就越显著。

  需要注意的是,这项评测重点考量的是相机轨迹控制力,并未覆盖视频的综合画质,也未消除不同模型输入接口的天然差异。但 Atlas 展示出的核心优势在于:它能把确定的几何路径精准转化为符合透视规律的画面。对机器人而言,这种确定性的几何控制力,远比生成一张好看的孤立图像更接近真实传感器的生成条件。

  不过,当机械臂触碰到物体的瞬间,仅靠视觉与深度显然不够。纸箱的外形可以从图像中重建,但重量、摩擦力以及受力后的位移需要另一层物理建模。线缆的桌面摆放是一种静态信息,但拉拽、弯曲、插入孔洞时的形变响应则是另一种维度的动态数据。相机标定偏差、机器人底盘误差以及软体物体的形变,都会直接影响最终的操作成败。

  比如,当机械臂把一根线缆拉向冰箱侧边时,线缆可能先从桌沿滑落,随后抵住机身;随着接触点改变,线缆贴着表面滑动;若继续拉紧,线缆的弯曲幅度与受力方向随之剧变,原本计算好的运动路径可能瞬间失效。在此过程中,机器人看到的是连续刷新的图像与深度,而底层物理引擎必须同时计算接触力、摩擦力、形变与状态转移。

  Atlas 发布页面展示了刚体、铰接体以及可变形物体的操作演示。只需几段随手拍摄的真实视频,就能辅助构建仿真场景,随后通过替换物体、改变初始位置、调整机器人动作、变更光照与背景,批量生成同类任务的多样化条件。Atlas 负责提供空间几何、传感器观测与环境生成的底座,而任务对齐、动力学标定与物理状态推演,则交由配套的仿真系统完成。

  World Labs 在 2026 年 7 月发布的 R2S2R(Real-to-Sim-to-Real)框架,展示了这种真实与仿真的转换机制。结合其在 2026 年 7 月 21 日收购的 SceniX 团队在环境、物体与传感器仿真方面的积累,整个工作流从一段现实任务视频开始:首先重建环境、机器人与物体的几何关系,让仿真环境与现实世界执行完全相同的开环动作轨迹,随后对比两端的视觉数据、物体位移与最终结果。这些偏差会被实时反馈到任务表示与仿真校准系统中,使物体的形状、质量、摩擦系数与机器人的运动状态在多元建模中逐步理顺。

  公开测试案例覆盖了 ALOHA 双臂方块交接、YAM 线缆滑动插接、RB-Y1 绕冰箱布线,以及 Flexiv 试管转移和 xArm 杂物分拣等高难度任务。World Labs 官方指出,这些操控策略完全在仿真环境中训练完成,未引入任何真实世界的数据训练,随后直接零样本迁移至多种实体机器人平台。部分任务在实体机器人上实现了连续 1 小时的自主无错运行。

  在这套体系中,Atlas 负责将物理现场编译为可合成的空间与传感器世界,R2S2R 负责将任务放回闭环交互中检验,而物理引擎则继续掌管碰撞、动力学与状态回放。在稀疏视角三维重建评测(Sparse-view 3D Reconstruction)中,Atlas 展现出了优异的入口重建能力。官方公布的数据显示,Atlas 的平均重建误差为 25.3,优于 Pi3X(posed)的 28.7、π³ 的 34.7、VGGT-Ω 1B 的 36.4、Depth Anything 3 的 39.3 以及 MapAnything 的 47.7(指标越低越好)。这一指标验证了其从极少数观测推导显式 3D 几何的能力。

  在此之前,Marble 已经能够将文本、图像、视频与粗糙的三维布局转化为可交互的环境,并无缝接入 MuJoCo、Isaac Sim 和 RoboSuite。但在 Marble 的工作流中,机器人任务资产(如平底锅、纸箱、微波炉等)主要依赖 Infinigen、RoboSuite 等外部工具搭建。而 Atlas 的突破在于,它开始把空间几何、相机轨迹、深度感知、时间演化与机载视角,统统收拢进同一套统一的模型上下文之中。

  让仿真围绕「失败」运行

  当一个物理场景被成功重建并完成物理标定后,仿真系统便具备了一项核心能力:将同一个控制策略放在成千上万种微小变化的临界条件中重复测试。研究人员只需固定场景与动作框架,微调物体的摆放位置、改变观察视角或扰动某一物理参数,策略失效的边界就会清晰地浮现出来。

  R2S2R 的评估实验把这种检查变成了可重复的流程。在 ALOHA 双臂立方体交接任务中,每个策略检查点在仿真中运行 2,000 次,在真实硬件上运行 100 次。仿真用来保持策略之间的排序,跟踪训练过程中的进步和停滞,并找到相近的成功、临界和失败区域。检查点先接受大量仿真试验,再由真实硬件提供对照,研究人员据此筛选模型并判断训练是否有效。

  以线缆插接任务为例,先固定机器人、物体和任务,只把线缆的起点向旁边移一点。偏差很小时,线缆仍能绕过边缘并插入孔洞;再偏一点,它开始擦过孔口,拉力和接触关系随之改变。相机视角稍微变化,原本稳定的策略也可能连续失败。此时把物体位置、线缆形变、光照、机器人状态和任务难度逐项向外推,成功区域会逐步收窄,临界条件会变得清楚,失败也能被重复回放。

  每次运行都可以保留同一任务的动作过程和结果。策略在一个位置成功,在相邻位置失败,差异就落在一个更小的范围内;相机改变后失败突然增多,视觉观测和动作执行之间的关系也有了可检查的方向。研究人员再围绕一次失败生成相近条件,观察失败来自接触、视觉、动作执行还是状态估计。

  这种重复让策略的极限逐渐显形。机器人可以在模型生成的世界里反复被逼到失败边缘,昂贵的真机时间留给已经经过筛选的策略。仿真也从展示成功轨迹,转向寻找成功条件何时失效,以及失效后哪些变化最值得测试。

  按 World Labs 的分类,世界模型可以承担渲染、模拟和规划等不同角色。Atlas 目前站在渲染与模拟的交界处,提供显式三维、机载视角和任务变体;R2S2R 把这些结果接回策略训练、仿真校准和现实评估。

  当 World Model 开始生产训练世界

  Atlas 仍处于少数合作伙伴早期访问阶段。随着系统走向更大规模的机器人训练,需要继续验证模型规模与推理成本、一个任务从现实进入仿真所需的人工量、传感器一致性、动力学误差,以及跨机器人迁移时训练收益能否稳定复现。机器人操作部分也需要更多公开基准,让外部团队能够比较任务建立时间、仿真预测能力和真机表现之间的关系。

  如果同一个厨房只被记录一次,之后仍能生成不同光照、不同摆放、不同摩擦和不同相机位置,策略就能在同一任务的多个条件下反复运行。平底锅放远一点,纸箱换到另一侧,机械臂从稍有差异的位置接近,仿真都可以把这些变化纳入同一场景。一次真实失败也可以向周围扩展出更接近失败边界的训练条件,供研究人员选择是否送回真机。

  一段手机视频提供空间起点,一次任务记录带来机器人、物体和传感器之间的关系,光照、摆放、视角、状态和接触条件则可以在仿真中逐步展开,这就是「Real-to-Sim」进入基础模型的理想形态。昂贵的现实采集因此能够持续长出新的仿真世界,训练过程也能围绕容易失败的区域继续推进。

  世界模型生成的场景开始进入机器人训练环境,承载策略的重复执行,暴露成功与失败之间的细小差异。任务调度、物理校准和策略选择仍需要完整仿真系统与研究人员共同完成。世界模型由此从预测和生成世界,向机器人训练环境的生产延伸,训练系统可以围绕这些世界展开失败区域,再决定哪些策略值得送回真机。

【版权提示】每日机器人网倡导尊重与保护知识产权。未经许可,任何人不得复制、转载、或以其他方式使用本网站的内容。如发现本站文章存在版权问题,烦请提供版权疑问、身份证明、版权证明、联系方式等发邮件至 1069823586@qq.com,我们将及时沟通与处理。

猜你喜欢

回到最擅长的地方,追觅做深广义机器人

9月4日,柏林,IFA2026正式开幕。本届IFA的主题是“TheFutureisNow”。在1900多个品牌参展品牌中,中国公司约占一半。物理AI是展会现场最重要的话题之一。展会现场,追觅带来横跨1

机器人

5小时前

现代摩比斯首次公开机器人执行器 展示60余项未来技术

9月10日,现代摩比斯宣布,从即日起至9月18日在京畿道龙仁技术研究所举办“2026R&DTechDay”,邀请主要客户及合作公司相关人士参加。这是该活动第三届,今年主题为“从移动出行零部件扩展到未来

机器人

5小时前

全球机器人即将挑战登泰山!真实登山盘道 定档10月29日

据央视新闻报道,首届CMG世界机器人登泰山大赛将于10月29日举办,各路参赛机器人将挑战泰山真实登山盘道。本次大赛是依托山地复杂路况打造的机器人专业赛事,共设置2条主赛道、4个正式赛项、1个特色挑战赛

机器人

5小时前

未来住宅要为机器人留出空间 京东JDD热议人机共生新日常

9月9日,京东全球科技探索者大会(JDD)上,一场由京东美术馆联合主办的跨界圆桌将具身智能、社会研究、科幻和艺术等不同视角带到了一起。极佳视界创始人兼CEO黄冠、北京大学新闻与传播学院长聘副教授王洪喆

机器人 京东

5小时前

“超脑+狼族”最新全阵容亮相 京东物流打造AI具身机器人军团

9月9日,在JDDiscovery-2026京东全球科技探索者大会上,京东物流“超脑+狼族”机器人应用军团最新全阵容亮相:“超脑”大模型负责供应链复杂场景下的智能决策与协同调度,“狼族”已在仓储、分拣

具身智能产业进入规模化应用关键期:批量进厂,人形机器人要过几关

2026世界人工智能大会上蚂蚁灵波科技展台展示的“机器人智慧药房”。受访者供图随着人工智能(AI)一步步冲破屏幕的桎梏,曾经只存在于科幻作品里的具身智能,正大步跨入现实。无论是不久前的第二届世界人形机