PolicyTrim瞄准VLA部署效率:最高实现5.83倍端到端加速

PolicyTrim瞄准VLA部署效率:最高实现5.83倍端到端加速

N
News Editor
2026-07-21 09:01:08
四川大学雷印杰教授团队提出VLA后训练框架PolicyTrim,目标是在不改动模型架构、不重新收集专家数据的前提下,提高机器人策略效率。该方法分两阶段扩展可靠动作chunk并压缩冗余物理步骤。论文结果显示,PolicyTrim在LIBERO、ManiSkill、Meta-World及真实机器人任务中,在保持成功率稳定的同时提升执行效率,其中π0.5在LIBERO上的最高端到端加速达到5.83倍。
具身智能机器人VLA模型PolicyTrim强化学习四川大学OpenVLAπ0.5

VLA(Vision-Language-Action,视觉-语言-动作)模型已经能把视觉观测、语言指令和机器人动作统一到同一个策略模型里,让机器人按自然语言完成复杂操作任务。但在真实部署阶段,瓶颈并不只在单次推理速度,还在于一个任务到底要执行多少次推理、多少个真实物理动作。

四川大学雷印杰教授领导的团队提出了PolicyTrim。这是一个面向“策略效率”的两阶段强化学习后训练框架,目标是在不改变VLA架构、不重新收集专家数据的情况下,让已有策略少走弯路,用更少物理步骤完成任务。

VLA部署中的问题不只是推理延迟

从OpenVLA、OpenVLA-OFT到π0.5、GR00T,VLA模型已成为具身智能的重要技术路线。不过论文指出,当这类模型真正部署到机器人上时,任务总耗时不仅取决于每一步推理有多快,也取决于策略需要多少次推理才能走完整个任务。

在同一任务的多次rollout中,VLA模型的执行步数会出现明显波动。这说明更短、更直接的成功路径本身是存在的,只是当前策略往往只能偶然走到。

另一个问题在于action chunk尾部动作可靠性不足。模型一次会预测多个动作,但越靠后的动作越容易累积误差,系统因此不得不频繁重新规划。如果直接强行执行更长的动作序列,成功率反而可能下降,物理步数也会增加。

论文还提到,即便任务最终成功,轨迹中也可能存在大量纠错、回退和重复动作。换句话说,VLA部署效率不能只看单步推理时延,也要看策略效率,也就是一次预测中到底有多少动作可以放心执行,以及完成任务需要多少真实物理步骤。

PolicyTrim瞄准VLA部署效率:最高实现5.83倍端到端加速 3

PolicyTrim怎么做

已有方法大多从计算侧提速,例如视觉token剪枝、量化、KV-cache复用、蒸馏和推理引擎优化。这些方法能降低单次推理延迟,但如果策略本身仍包含大量冗余物理动作,真实任务耗时仍然会偏长。

PolicyTrim的核心思路不是替代这类计算优化,而是减少完成任务所需的前向推理次数。它把策略效率拆成两个目标:先扩展可靠动作chunk,再压缩冗余物理步骤。

第一阶段:扩展可靠动作chunk

在Reliable Action Chunk Extension阶段,PolicyTrim使用dynamic execution horizon exploration。对于同一组rollout,方法会分配不同接受比率,让模型在短、中、长不同窗口上并行探索可靠边界。

如果轨迹成功完成任务,而且执行窗口更长,就会得到更高reward,从而推动模型把原本不够稳定的chunk尾部动作变得更可用。

horizon reward只有在组内出现成功轨迹时才会激活,用来避免模型在失败情况下盲目追求更长chunk。

PolicyTrim瞄准VLA部署效率:最高实现5.83倍端到端加速 4

第二阶段:压缩冗余步骤

在可靠horizon得到扩展后,PolicyTrim进入Redundancy-Aware Step Reduction阶段,继续减少总物理步数。该阶段引入step-saving reward:成功轨迹用越少步骤完成任务,奖励越高。

论文将“更短、更直接的成功轨迹”直接写入优化目标。同时,group-anchored regularization用于抑制不可复现的投机捷径,避免模型只追求短路径却损害成功率。

按照论文描述,这种两阶段顺序优化可以减少“拉长chunk”和“缩短步数”之间的相互干扰,最终降低完成任务所需的前向推理次数。

实验覆盖多个基准和多种VLA架构

论文在LIBERO、ManiSkill、Meta-World以及真实机器人任务上验证了PolicyTrim,覆盖π0.5、OpenVLA-OFT、GR00T等不同VLA架构。总体结果显示,PolicyTrim在保持任务成功率稳定的同时,提升了执行效率。

在LIBERO中,π0.5取得了最高5.83倍端到端加速,成功率保持在98%以上。

PolicyTrim瞄准VLA部署效率:最高实现5.83倍端到端加速 5

跨基准结果方面,PolicyTrim在ManiSkill上的最高加速达到2.36倍,在Meta-World上达到2.52倍。

跨架构结果方面,重新预训练后的OpenVLA-OFT采用完整两阶段流程后可达到2.97倍加速;OpenVLA仅使用第二阶段,也能达到1.41倍加速。

论文还给出三个核心结果指标:

  • 动作chunk利用率提升3倍,实现更长horizon的可靠执行;
  • 物理步数减少51.4%,压缩冗余修正动作;
  • 在LIBERO Object/π0.5组合上,最高实现5.83倍端到端加速。

轨迹变化:少走弯路,动作更直接

在随机采样的LIBERO任务中,Baseline经常出现冗余纠错动作,以及接近目标时的hesitation和jittering。PolicyTrim生成的轨迹更平滑,也更直接,能用更少物理步骤完成同一任务。

按照论文描述,这种压缩通常能把物理步数降到原来的一半左右。

PolicyTrim瞄准VLA部署效率:最高实现5.83倍端到端加速 6

真实机器人测试:模拟中的效率收益迁移到物理世界

论文进一步在真实机器人上做了验证,实验平台为配备两台Intel RealSense D435i相机的Agilex Piper机械臂,任务包括FlipMug、HangMug和TapeBox三类任务。

测试同时覆盖了固定目标位置的标准设置,以及抓取过程中随机扰动目标的动态设置。

结果显示,PolicyTrim在标准设置和动态扰动设置下都维持或提升了成功率,同时显著缩短真实执行时间。在标准真实机器人设置下,平均端到端加速达到1.86倍。

论文称,这表明PolicyTrim并不只是优化benchmark指标,在物理机器人上,任务完成时间也可以缩短到baseline的一半左右,并在动态干扰场景中保持鲁棒性。

为什么作者认为它有效

论文给出的解释包括几个方面。第一,PolicyTrim面向策略本身提效,重点是减少冗余动作和不必要的重规划,而不是只降低单次推理延迟。

PolicyTrim瞄准VLA部署效率:最高实现5.83倍端到端加速 7

第二,它作为后训练框架,无需从头训练,可以直接基于已有VLA模型继续优化,从而降低数据收集和训练成本。

第三,这一方法同时兼顾速度和成功率:可靠horizon扩展避免盲目拉长chunk,稳定性约束则避免短路径投机。

第四,PolicyTrim可以与计算侧优化叠加。论文举例称,PolicyTrim优化的是前向推理次数,VLA-Cache等方法优化的是单次推理耗时,两条路径彼此正交,可以形成复合加速。

项目信息

项目主页:https://inceptionwang.github.io/PolicyTrim/

论文链接:https://arxiv.org/abs/2606.22540

PolicyTrim瞄准VLA部署效率:最高实现5.83倍端到端加速 8

代码链接:https://github.com/INCEPTIONwang/PolicyTrim

模型链接:https://huggingface.co/INCEPTIONwang/PolicyTrim

参考资料:https://arxiv.org/abs/2606.22540

本文信息来自微信公众号“新智元”,作者为新智元,编辑为LRST。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。