星动纪元自研的世界动作模型 VPP2 近日登顶 RoboDojo 仿真榜单,在综合平均成功率和综合平均得分两项核心指标上均排名第一。按照文中披露的数据,VPP2 的综合平均成功率为 32.26%,综合平均得分为 39.26 分,超过 GPT-6-Astra、Physical Intelligence 的 π0.5 以及英伟达 GR00T-N1.7 等具身模型。
文中称,星动纪元是清华唯一持股的具身公司。此次 VPP2 的成绩出现在 RoboDojo 这一仿真评测体系中。该评测由香港大学 MMLab 牵头、全球近 20 所顶尖学术机构共同建设,被文中称为具身智能界的「珠穆朗玛峰」。
RoboDojo 的目标,是为具身智能建立统一、可复现的评测标准。仿真测试包含 42 项双臂操作任务,覆盖泛化、精准操作、长程任务、记忆、开放词汇指令理解 5 个维度,重点考察机器人在环境变化、物体位置变化和任务组合变化下的表现,而不是只看熟悉任务中的完成度。
VPP2 在 RoboDojo 综合指标上排名第一
从综合结果看,VPP2 交出的成绩单较为突出。平均成功率 32.26%,平均得分 39.26 分,两项指标均位居榜首。
文中给出的对比数据显示,在 RoboDojo 仿真基准的后训练评测中,GPT-6-Astra 的平均成功率为 22.48%,平均得分为 28.97 分。按这一口径计算,VPP2 分别领先 9.78 个百分点和 10.29 分。
这两个指标的侧重点并不相同。成功率衡量机器人是否完整完成任务;平均得分则衡量任务推进到了哪一步,即便任务没有全部完成,也能反映阶段性表现。两项指标都综合了 5 个能力维度的测试结果。
拆开能力维度来看,VPP2 在泛化、精准操作、记忆 3 个维度上同样排名第一。文中将这 3 项能力对应为机器人进入真实世界时的几道关键门槛:换环境后是否还能完成任务,操作是否足够准确,以及连续执行任务时能否记住前序步骤。
文中还提到,VPP2 此次没有使用额外数据,也没有采用 Agent RSI 等增强手段,而是基于「标准数据集」取得上述成绩。按文中说法,性能提升主要来自预训练和基座模型本身的泛化能力,而不是依赖外挂式增强策略或通过扩充数据来「刷分」。
RoboDojo 为什么受到关注
文章将具身智能行业的一个现实问题概括得很直接:机器人 Demo 越来越炫,模型榜单分数也越来越高,但如果追问谁的机器人更聪明、更能干活,答案并不容易统一。
以抓杯子为例,机器人在训练时见过的桌面上可能表现稳定,但换一个杯子、换一个摆放位置,成功率就可能明显下滑。涉及多个连续步骤的任务时,这种问题会更明显。
RoboDojo 的设计正是针对这类情况。它不是只看模型在熟悉任务上的表现,而是把机器人放到更复杂、更容易出错的情境中,观察其面对变化时的泛化能力。也因此,VPP2 在这一评测体系中的领先,成为文章关注的重点。
真机零样本测试:ALOHA 上平均成功率 58.5%
仿真成绩之外,文章还给出了 VPP2 在真实机器人上的测试结果。星动纪元将 VPP2 部署到真实 ALOHA 双臂机器人上,测试了抓取、放置、堆叠、折叠、倾倒等 10 类零样本操作任务。
这里的零样本,指的是无需针对这些测试任务进行额外微调,机器人直接执行任务。结果显示,VPP2 的平均成功率为 58.5%,高于 π0.5 的 40%。在 10 类任务中,VPP2 拿下了 9 类最佳成绩。
文章认为,榜单第一说明 VPP2 在标准评测体系中具备竞争力,而真机零样本操作结果则用来检验这些能力能否迁移到真实物理环境。两组结果放在一起,构成了对其技术路线的主要支撑。
VPP2 瞄准的是 WAM 的老问题
VPP2 采用的是世界动作模型(WAM)路线。这类模型的基本思路,是借助视频预测理解物理世界接下来会如何变化,再把这种预测转化为机器人动作。
文章指出,这一路线长期存在一个难点:视频预测看起来合理,不等于机器人真的能把活干好。比如任务要求抓左边的杯子,模型却预测抓起右边那个,视频仍然可以生成,但机器人执行时就会偏离目标。另一类问题是,直接把动作学习加入视频模型后,原有的泛化能力可能受损,导致机器人学会了动作,却更依赖熟悉环境。
VPP2 的判断是,视频预测的质量决定了动作能力的上限。基于这一思路,星动纪元将视频预测与动作学习分阶段训练,不把两者混在一起,而是先后展开。
三阶段训练策略
文章披露,星动纪元为 VPP2 设计了三阶段训练策略:
- 第一阶段,事件级视频继续预训练,让模型学习预测完整操作过程。
- 第二阶段,固定时长视频后训练与蒸馏,让预测能力跟上机器人实时执行速度。
- 第三阶段,动作专家训练,把视频预测转化为具体动作,同时尽量保留原有泛化能力。
这套训练顺序对应两个目标:一是让预测具备泛化能力,二是让行动也具备泛化能力。
第一步:先把视频预测练到能泛化
文章称,VPP2 在视频预测部分以阿里开源的 Wan2.1-I2V-14B 为基础,整合了机器人操作、人类活动、通用视频等多种数据,覆盖不同机器人本体和操作方式。
在数据处理上,团队没有把视频直接输入模型,而是先将操作过程切分成语义完整的片段,再配上更细致的描述。以「把杯子放进盒子」为例,描述中不仅包含动作本身,还会明确是哪只机械臂、哪个杯子、哪个盒子,以及整个操作过程。文章给出的理由是,同一句模糊指令可能对应多种动作轨迹,如果模型没有明确操作对象,就很难准确预测未来状态。
另一个关键点是事件级视频预测训练。传统短时预测关注接下来几帧会发生什么,而 VPP2 让模型学习一次完整操作从开始到结束的变化过程。从机械臂靠近杯子,到抓住杯子,再到把杯子放进盒子,模型需要理解的是整件事如何发生。
在机器人操作视频的指令遵循测试中,14B 参数的 VPP2 成功率达到 90%,而 64B 参数的 Cosmos3 模型为 78%。文章借此指出,在物理操作预测中,参数规模并不是唯一决定因素,模型是否真正理解操作过程同样重要。
第二步:把预测泛化转成行动泛化
文章认为,这一步主要有两道坎:一是速度,二是在加入动作学习后如何保住视频模型原有的泛化能力。
如果机器人每次动作前都要花几秒生成视频,再强的预测能力也难以落地。为此,星动纪元先对预测模型提速。团队将事件级预测模型调整为固定 8 秒的视频片段预测,再通过一致性蒸馏,将多步计算压缩为单步生成。最终,预测未来 8 秒视觉变化的计算耗时约为 0.12 秒。
动作学习部分,VPP2 引入了一个 0.9B 参数的扩散 Transformer(Action DiT),采用 MoT 架构,学习如何根据预测的未来状态生成机器人动作。
不过,星动纪元没有把视频预测模型 Video DiT 和动作专家从头联合训练。文章称,在动作训练初期,视频模型的基础参数被冻结,仅通过 LoRA 进行适配,以尽量避免动作训练破坏已有的预测泛化能力。换句话说,先让模型理解物理世界如何变化,再训练它把这种理解转化为动作。
最终,视频预测约耗时 0.12 秒,动作专家约耗时 0.1 秒,整体动作片段生成延迟约为 0.22 秒。
另外两套泛化测试结果
除 ALOHA 真机零样本测试外,文章还列出了两套泛化测试结果。
在 LIBERO-Pro 测试中,评测重点是物体位置和任务要求变化后的操作能力。VPP2 的总体成功率为 45.0%,其他基线模型最高为 11.0%。
在 LIBERO-OOD 测试中,评测重点是组合泛化,也就是把熟悉的物体、布局和任务目标重新组合成此前未见的新任务。VPP2 的总体成功率达到 63.9%。
文章据此总结 VPP2 的技术路径:先通过多源数据、详细任务描述和事件级预测训练,提高模型对物理变化的预测能力;再通过蒸馏提速和分阶段动作学习,把这种预测能力转化为实际操作能力,同时尽量保留原有泛化能力。
VLM 规划器与长程任务结果
文章还提到,真实任务往往不只是执行动作,还涉及先做什么、后做什么的规划问题。星动纪元在论文中给出的思路是,由 GPT 负责想,VPP2 负责做。
在实际实验中,团队采用的是 VLM 高层规划器,由其负责语义理解、记忆和任务拆解,再把明确的子任务交给 VPP2 执行。
在 RoboDojo 选定的长程任务测试中,引入 VLM 子任务规划后,平均成功率从 27.6% 提升至 57.6%。文章据此认为,复杂任务的完成效果,不只取决于底层动作能力,高层规划与底层执行的配合同样关键。
从 GPT 到 WAM,文章给出的判断
文章将这一路线概括为一种可能的物理 AI 范式:通用认知加通用物理执行。按文中表述,GPT 等通用模型负责理解意图、推理和规划,VPP2 这样的 WAM 负责预测物理变化、生成动作,再通过执行反馈持续调整。
文章同时提到,星动纪元在公司层面同时布局大脑、本体和灵巧手,并将这一策略称为「深全栈」。文中给出的解释是,公司试图掌握的不只是训练环节,也包括能力落地与反馈回流的环节。
物流场景合作与当前边界
在落地场景方面,文章称,星动纪元已与中国邮政、顺丰等企业开展合作,在全国 5 个省市、10 余个物流中心常态化运营。
文中提到,物流场景中的货物尺寸、摆放位置和作业流程都可能变化,同样一套操作换一个仓库就可能需要重新适应,这对机器人的泛化能力提出了更高要求。模型能否把学到的能力迁移到陌生任务中,会直接影响跨场景部署的效率和成本。
不过,文章也明确表示,已有物流业务的商业化进展,并不意味着 VPP2 已经实现规模化部署。模型能否在更多真实场景中长期稳定运行,仍需要继续验证。
代码与项目主页已开放
文章最后披露,VPP2 已开源,并给出了代码仓库和项目主页链接:
- 开源代码:https://github.com/roboterax/video-prediction-policy-2
- 项目主页:https://robert-gyj.github.io/video-prediction-policy-2
本文来自微信公众号「量子位」,作者为田晏林,MarsBit 转载发布。

