Scalabot 发布了首个世界模型 HERON-World Model。按照团队展示的能力,这一模型只需接收一张当前画面,并输入接下来要执行的动作,就可以预测机器人把动作执行下去后,世界会如何变化。
这次发布的重点,不只在于单个智能体的动作预测。Scalabot 给出的信息显示,HERON-World Model 还支持预测多智能体同时参与时的动作配合、相互影响,以及这些动作叠加后带来的环境变化。
据 Scalabot 团队透露,HERON-World Model 采用 WorldArena 1.0 Track 1 的开源测试方案进行离线评估,目前综合得分 EWMScore_P 为 75.80 分。
Demo 展示了三类能力
从演示内容看,HERON-World Model 的能力大致分为三类:物理规律、状态记忆与时序一致性,以及多智能体交互。
在物理规律方面,模型能够根据动作预测物体后续的运动过程。文中举例称,在丢出网球的场景里,HERON-World Model 可以给出小球飞出、下落、碰撞和反弹的连续变化。
第二类能力是状态记忆与时序一致性。比如给杯子盖盖子时,模型需要记住哪些杯子已经盖好,以及它们各自的位置。画画时,模型不仅要保留此前落笔的位置和已经形成的画面,还要让后续预测继续遵循已有动作产生的结果,也就是笔尖划过的位置留下颜色,之后的状态演化与此前过程保持一致。
对于当前画面中没有直接出现的信息,HERON-World Model 也会结合动作进行补全。文中提到,如果输入的是一张关闭冰箱的照片,再给出「打开冰箱」的动作,模型会继续预测冰箱门后的内部空间。
第三类能力是多智能体交互,这也是 HERON-World Model 这次发布的亮点之一。与多数聚焦单一智能体「动作—状态变化」的世界模型不同,HERON-World Model 把预测范围扩展到了多个智能体共同参与的场景。
这意味着,模型不仅要判断一个机器人执行动作后世界会发生什么变化,还要同时处理多个智能体之间的配合或干扰,以及它们和环境共同作用后会把世界推向什么状态。
文中指出,这类任务的难点在于,场景从单智能体进入多人协作后,变量会明显增多。模型既要处理人物与物体之间的交互,也要理解多个智能体动作叠加后触发的物理结果。
例如,两个人同时拉动毛巾控制小球运动时,模型需要同时保持人物动作、毛巾形变和小球滚动之间的关系合理;在两个人一起编花绳的场景里,双方动作会持续改变绳子的形态,模型也要让后续变化与两人的动作保持一致。
对应到 WorldArena 的分项成绩,HERON-World Model 在物理交互、空间透视、运动动态、轨迹准确性四项中,分别获得 95.60、99.20、92.61 和 56.66 分。文中称,这些结果分别对应模型在物理关系、空间一致性、运动变化和轨迹预测等维度上的表现。
为什么机器人需要世界模型先预测未来
文章认为,世界模型的价值在于让机器人在真实执行动作之前,先预演动作的后果。
当机器人进入工厂、家庭等真实场景时,它不仅要知道下一步该做什么,还要能够预判这样做会带来什么结果。世界模型的视频生成能力,正好把这种预测展开成一段连续的未来画面。机器人可以先在模型中预演可能结果,再据此选择更合适的动作。
不过,文中也提到,要让这种预测真正有用,模型仍需要从高质量数据中学习丰富的动作与结果对应关系。HERON-World Model 采用的路线,是先通过多源数据让模型见过足够丰富的世界,再把不同来源的动作转化为同一种「语言」,最后借助 MoT+MoE 架构提升未来推演能力。
三层数据金字塔:Ego、仿真和真机
围绕训练数据,文章将 HERON-World Model 的方案概括为一个预训练数据金字塔。
传统具身数据金字塔中,互联网和人类视频位于底层,仿真数据在中间,真机数据位于顶层。越往上,数据越接近真实执行,但规模化难度也越高。今年随着 Ego 第一视角人类操作视频受到重视,这类数据因更容易扩展、同时包含丰富交互信息,开始被不少方案视作金字塔底座。
HERON-World Model 的预训练使用了三类数据来源:Ego 人类操作视频、真实场景重建的仿真数据,以及真机数据。
其中,真机数据承担「真实执行锚点」的角色。它同时记录机器人的视觉观测、动作、本体状态和控制命令,让模型直接学习机器人做了什么,以及真实世界如何随之变化。文中提到,HERON-World Model 的数据覆盖单臂、双臂、轮臂和人形等多种构型,以便让模型接触不同「身体」下的运动和交互方式。
相较其他类型数据,真机数据能够完整记录机器人看到了什么、执行了什么动作,以及动作发生前后的本体状态和环境变化。但这类数据也存在成本高、难以扩展、长尾覆盖不足的问题。文章将其类比为早期自动驾驶数据采集:部分场景本身罕见,部分动作采集成本高,还有一些失败轨迹甚至伴随设备损坏和安全风险。
因此,HERON-World Model 引入仿真数据,用于补充稀有状态、危险交互、失败轨迹和特定场景组合,在真机提供可靠参照之外,继续扩展「执行—后果」的经验。
最后,Ego 数据用来拓宽日常交互覆盖,补充真机和仿真难以覆盖的日常经验,例如工具使用、双手协作和家庭物体操作。文章据此总结,这三类数据共同构成了 HERON-World Model 的预训练数据金字塔:真机提供真实行动经验,仿真扩展特殊情况,人类视频拓宽交互覆盖。
异构数据如何整理成统一输入
在同时使用真机、仿真和 Ego 三类数据后,文章接着讨论另一个问题:如何把它们整理成同一个模型能够理解的形式。
文中指出,机器人数据可以直接记录关节角和控制指令,但人类视频通常只有画面。即便数据里都包含动作记录,不同设备之间的时间频率、空间坐标和身体结构也并不相同。
针对这一点,HERON-World Model 首先从不同来源的数据中恢复可用的动作信息。对真机和仿真数据,可以从已有记录中提取动作与状态;对 Ego 视频,则需要先清洗片段,再估计三维手部姿态、恢复相机轨迹,并经过轨迹验证与质量过滤,提取相机运动、手部运动和抓取状态。
这样一来,人类视频也具备了可用于训练的动作线索。文中称,这些估计得到的「伪标签」也可以作为弱监督信号参与训练。
随后,HERON-World Model 继续让动作在时间和空间上对齐。时间上,模型以视频帧时间戳为基准,把动作、状态和画面同步起来;空间上,则将不同来源的关节轨迹转换为末端执行器位姿,再通过标定和坐标变换,把运动统一到可比较的参照系中。
经过这一步,三类数据中的动作被统一整理为自身运动、操作端运动和抓取状态。文章提到,这种运动表征不再依赖某一个机器人具体的关节定义,而是以视频片段首帧为起点,描述后续时刻在统一动作空间中相对起点的变化。
不过,仅统一表征方式并不能完全消除本体差异。双臂、双手以及不同夹爪的动作,仍然难以完全依赖规则统一。为此,HERON-World Model 为不同数据域配置轻量动作编码器,把这些动作进一步映射为固定维度的 Action Token,再交给共享网络学习动作与后续视觉变化之间的关系。
针对遮挡、视野丢失等现实情况,HERON-World Model 还通过掩码和置信度控制,避免把「看不到动作」误判为「没有动作」,从而保留仍有训练价值的视频样本。
文章最后总结,这套流程经过动作提取、时空对齐和统一编码后,将三类数据送入同一训练流程,让模型学习同一件事:做出一个动作之后,世界会怎样变化。
MoT+MoE 架构如何分工
在模型架构上,HERON-World Model 采用了 MoT+MoE 的组合设计,以支持数据规模持续扩大。
其中,MoT 主要解决的问题是,在学习预测动作后果的同时,尽量保留 VLM 原有的理解能力,也就是文中所说的知识隔离。文章解释称,VLM 在大规模预训练中已经积累了较丰富的通用世界知识,例如机械臂受关节约束、刚体不会无故变形等先验,这些知识本身有助于判断未来状态是否合理。
但在后续世界模型训练中,大量围绕具体操作的数据可能让模型持续适应新任务,并逐步干扰甚至覆盖已有知识。HERON-World Model 因此通过 MoT 将 VLM 与生成分支的参数分离,并配合单向注意力机制,让生成分支能够读取 VLM 已有的世界知识,同时尽量避免生成训练反向影响这些知识。按照文章的说法,这样既能利用 VLM 的理解能力约束未来状态预测,也能减少训练过程中的知识遗忘。
MoE 处理的则是另一类随着数据规模扩大而更加明显的问题:不同动作需要建模的运动规律并不相同。比如机器人整体移动时,更关键的是全局运动和场景结构;抓取、碰撞和接触发生时,则更依赖局部几何和精细交互。

在多智能体场景里,这种复杂度还会继续上升。模型既要处理单个智能体与环境的交互,也要同时建模多个智能体动作叠加后产生的配合、冲突,以及共同触发的物理变化。如果全部交给同一套参数处理,随着动作类型增加,不同模式之间更容易出现参数竞争。
为此,HERON-World Model 将 DiT 生成过程拆分为高噪声专家和低噪声专家。高噪声专家先确定未来的大体结构和粗粒度运动,低噪声专家再补充局部几何、视觉细节和精细交互。
文章将两者的分工概括为:MoT 解决「知识怎么协作」,MoE 解决「生成怎么分工」。据 Scalabot 团队介绍,这套混合专家设计也是在为后续扩展预留空间,通过专家分工缓解数据规模增加、动作与交互形式更复杂时的参数竞争,支持更稳定的训练与生成。
回到 HERON-World Model 的整体路线,文章认为,数据、处理流程和模型架构由此形成闭环:多源数据提供交互经验,异构动作统一让模型学习这些经验,MoT+MoE 则负责承接未来画面的生成。对于动作条件世界模型,关键问题仍然是能否更准确地预测,当机器人采取一个动作后,接下来会发生什么。
本文来自微信公众号「量子位」(ID:QbitAI),作者:henry。

