斯坦福团队发布 OpenWAM,拆解世界动作模型关键变量

斯坦福团队发布 OpenWAM,拆解世界动作模型关键变量

N
News Editor
2026-10-08 23:25:29
斯坦福大学李飞飞、吴佳俊与 Ehsan Adeli 等人团队发布论文 OpenWAM,试图用统一框架回答世界动作模型性能提升究竟来自哪里。该框架基于 Wan2.2-5B 构建因果化视频底座,并在共享 MoT 架构上比较四种视频与动作交互方式。团队还将逆向动力学模型和正向动力学模型拆成可复用组件,并用包含反事实轨迹的数据集训练。实验显示,机器人视频预训练后的因果底座可显著提升成功率,局部动力学模型在迁移任务中也表现更好。

9 月 22 日,Black Forest Labs 发布开源 7B 世界动作模型 FLUX 3 Action。根据其官方博客,这一模型在英伟达 RoboLab-120 榜单上超过此前最强的开源模型 Cosmos 3 Nano,而参数量不到后者一半。一家以 FLUX 图像模型闻名的公司切入机器人控制,也让视频模型中积累的「物理直觉」再次成为焦点。

斯坦福团队发布 OpenWAM,拆解世界动作模型关键变量 2

本周,斯坦福大学李飞飞、吴佳俊、Ehsan Adeli 等人的团队给出了一套更系统的研究框架。论文提出开放世界动作建模框架 OpenWAM,目标不是单纯刷新分数,而是把世界动作模型(World-Action Model,WAM)里纠缠在一起的变量拆开,回答性能提升究竟来自底座、数据,还是视频与动作的交互方式。

OpenWAM 试图给 WAM 一张统一考卷

自英伟达今年 2 月在 DreamZero 论文中明确提出世界动作模型这一术语后,相关论文快速增加。但现有系统往往同时更换视频骨干、训练数据、视频与动作的交互方式,以及推理流程,结果虽然能比较,原因却很难拆清。

传统视觉-语言-动作模型(VLA)更像直接根据画面和指令输出动作。WAM 多了一步内部预演:一边预测接下来几秒画面会如何变化,一边决定机器人该怎么动。由于视频天然记录了物体下落、碰撞和被推动的过程,用海量视频预训练的模型会带入一定物理先验。

问题也出在这里。预测画面和生成动作之间可以有多种耦合方式:先想象再动作、先动作再预测后果、两者同时生成,或者彼此分开计算。不同团队采用不同设计,再叠加不同底座和数据,最后很难判断提升到底来自哪一步。

斯坦福团队发布 OpenWAM,拆解世界动作模型关键变量 3

论文指出,另一个更隐蔽的问题在于机器人训练数据大多来自成功示范,只告诉模型正确路径,却很少覆盖「如果动作偏了会发生什么」。模型学到的是完成任务的轨迹,不一定真正理解局部动作与物理结果之间的关系。

OpenWAM 对这两个问题分别给出回答:前者用共享底座和可切换交互方式来控制变量,后者用大规模反事实数据补足训练信号。

论文标题:OpenWAM: An Open Framework for Composable World-Action Models

论文地址:https://arxiv.org/abs/2610.07922

项目主页:https://openwam.stanford.edu

斯坦福团队发布 OpenWAM,拆解世界动作模型关键变量 4

代码仓库:https://github.com/OpenWAM/OpenWAM

从 Wan2.2-5B 出发,先做因果化视频底座

OpenWAM 以阿里开源视频模型 Wan2.2-5B 为起点,先在约 334 万条机器人与人类交互视频上继续预训练,名义时长约 1.46 万小时。这个阶段不使用动作标签,在 32 块 B200 上训练了 14 天。

核心改动是把模型做成「因果化」结构。每个视频块只能看到当前和之前的内容,不能访问未来帧。论文将其与原始视频模型作了区分:原模型更像拿着完整剧本反复修改,而因果化之后,模型必须按时间顺序一步步往下生成,这更接近机器人真实执行动作时的条件。

在此基础上,团队使用 Mixture-of-Transformers(MoT)架构,把 5B 的视频专家和 2B 的动作专家组合起来。两部分各自保留归一化、投影和前馈层,只在一层联合注意力中交换信息。

在这套共享骨架上,团队定义了四种交互程序:

斯坦福团队发布 OpenWAM,拆解世界动作模型关键变量 5

  • VTA:先想象未来画面,再生成动作;
  • ATV:顺序相反,先动作后画面;
  • Joint:视频和动作同时生成,并互相参考;
  • Decoupled:未来部分彼此不可见,分别生成。

四种程序共用同一底座、tokenization 和 flow matching 目标,变化只来自生成顺序和跨模态注意力。这样做的意义在于,比较时更接近严格控制变量。

把动作翻译器拆出来,单独训练局部动力学模型

论文另一个重点,是把逆向动力学模型(IDM)和正向动力学模型(FDM)拆成可独立训练、可复用的组件。

IDM 的作用是把当前画面、机器人本体状态和一段想象出的未来视频,翻译成具体动作。FDM 则反过来,根据动作预测画面会如何变化。

团队强调的是「局部」设计。无论 IDM 还是 FDM,都不接收任务指令和更早的历史,只关注一小段画面变化与动作之间的对应关系。这样一来,它们就不再绑定某个具体任务,可以与任何兼容的视频预测器组合:视频模型负责决定「接下来会发生什么」,IDM 负责把这个结果落到动作层面。

斯坦福团队发布 OpenWAM,拆解世界动作模型关键变量 6

但如果只用成功示范训练,这种动作翻译器的覆盖面仍然有限。为此,团队构建了 LIBERO-Long-CF 数据集:恢复示范中的仿真器状态后,执行被改动过的动作,包括停止、反向、加噪声,以及改变夹爪开合时机等。

最终得到 32000 个片段、约 410 万条控制记录,是原始示范的 29.7 倍,其中 72.3% 的片段改变了物体摆放状态。很多分支并不能完成任务,但这正是数据集设计的重点,因为它让模型看到动作偏离后会带来什么后果。

LIBERO 与真机实验:底座改动带来明显提升

在 LIBERO 四个子集上,四种交互程序的成功率都处于较高水平。其中,VTA 平均成功率达到 98.6%,略高于论文引用的 LingBot-VA 的 98.5% 和 π0.5 的 96.9%。不过论文也提到,LIBERO 基准本身已接近饱和,因此更值得看的是更细的对比。

在 LIBERO-Long 上,未来部分互不可见的 Decoupled 成功率为 97.0%,与双向交互的 Joint 的 96.6% 接近。这意味着在统一底座下,不同交互程序之间的差距并不像外界想象得那么大。

真机测试使用两台 Franka FR3 机械臂,任务包括烤面包、还原 2×2 魔方最后一层,以及按颜色分拣杯子。结果显示,VTA 和 Joint 的平均成功率分别为 92.1% 和 91.9%。

斯坦福团队发布 OpenWAM,拆解世界动作模型关键变量 7

消融实验更能说明底座的重要性。在其他条件不变的情况下,如果使用原版 Wan2.2 初始化,VTA 在 LIBERO-Long 上的成功率只有 68.4%;换成经过机器人视频预训练并完成因果化改造的底座后,成功率升至 97.8%,提高了 29.4 个百分点。作者明确表示,这一提升来自数据和因果化改造的共同作用。

组件迁移实验:局部 IDM 和反事实数据缺一不可

论文最关键的结果之一来自组件迁移实验。团队将一个在 LIBERO-Long 上训练好的 IDM 冻结,再与针对四个 LIBERO-90 新任务调整过的视频预测器组合。

结果显示,用示范加反事实数据训练的局部 IDM,平均成功率达到 84.0%;接收完整上下文的 IDM 为 47.0%;只用示范训练的局部 IDM 只有 21.5%。

这组结果说明,单靠「只看局部」不够,单靠更多数据也不够。局部建模和足够多样的后果样本结合后,动作翻译器才具备更强的迁移能力。论文同时说明,目标任务上的视频预测器经过含动作标签的示范微调,因此这并不是零样本迁移。

FDM 的结果与 IDM 一致。实验从同一状态出发执行 16 种不同动作,让模型判断预测画面对应哪个真实结果。随机猜测的正确率约为 6%,只用示范训练的 FDM 为 21.1%,加入反事实数据后升至 71.3%。按论文的说法,这意味着模型开始能区分不同推动方式带来的不同结果。

斯坦福团队发布 OpenWAM,拆解世界动作模型关键变量 8

OpenWAM 的价值,在于把问题拆开

作者也在论文中说明了局限。组件复用目前主要在仿真环境中验证,真机上故意制造错误动作的成本更高;FDM 覆盖的也只是短时程预测。

不过,OpenWAM 的意义并不只在于多拿了几个百分点。当前 WAM 论文更新很快,一个固定底座、只改一个变量的公共实验框架,可以帮助研究从单纯比较分数,转向分析分数为什么会提高。论文给出的另一个方向是,可复用的动作翻译器意味着未来的机器人大脑未必必须整体训练成黑箱,负责想象未来和负责执行动作的模块,可能可以分别迭代,再按需组合。

目前,团队已经开源训练、评测与组合代码,以及预训练视频模型权重。

本文来自微信公众号「机器之心」(ID:almosthuman2014),作者为关注 AI 的机器之心。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。