vivo AI Lab研究团队提出了用于手语翻译的强化学习方法 CAPO-SLT,全称为 Confidence-Aware Policy Optimization for Sign Language Translation。论文指出,自动手语翻译即便已经较好完成视觉与文本对齐,在逐词生成阶段仍可能被局部上合理、但缺少视觉证据支撑的词带偏,偏差随后又进入后续上下文,最终累积成整句语义偏移。

研究团队将这一问题追溯到强化学习中的更新规则,并在不更换视觉编码器与奖励函数的前提下,对策略优化过程进行调整,希望让手语翻译在强化学习微调阶段生成得更稳,也更忠实于视觉证据。
手语翻译面对的不只是识别问题
论文提到,手语并不是把口语逐字替换成手势,而是一种拥有自身语法、空间表达和非手部信息的视觉语言。自动手语翻译需要把连续视频或姿态序列转换成自然语言,让手语使用者与不懂手语的人可以直接跨模态交流。
这一能力可用于公共服务、医疗沟通、教育课堂、应急信息、客户服务、职场协作和在线视频等场景。研究团队认为,可靠的自动翻译系统可以补充人工服务,为信息获取、内容生产和双向沟通提供更及时的支持,也让无障碍能力从少数专门场景进入更日常的产品环境。
这也对应着更高的可靠性要求。论文强调,相比明显不通顺的输出,「流畅却译错」更难察觉;只要关键词、否定关系或事件主体发生偏移,整句话的含义就可能被改写。
视觉对齐完成后,生成阶段仍可能失真
自动手语翻译同时面对模态差异、时间粒度差异和语言结构差异。手部动作可能非常细微,相近手势容易混淆,动作边界并不总是清楚,表情和口型等非手部线索也可能不完整。过去不少研究把重点放在视觉—语言对齐上,让模型学习把动作和文字映射到同一语义空间。

但论文指出,「对齐得好」不等于「生成得稳」。翻译本身是自回归过程:模型生成一个词,再把该词和此前内容一起用于预测下一个词。语言模型中的强先验会让某些续写看上去很自然;如果这些词并未获得足够视觉证据支撑,流畅的表达反而可能掩盖错误。
强化学习原本可以直接围绕整句质量优化模型,但新的噪声也随之出现。奖励通常在句子层面给出,而优势值需要分配到每个生成词上。模型知道一句话整体更好还是更差,却未必能准确定位到底是哪一个词做对了,或是哪一个词引发了语义偏移。
传统策略优化把所有词放在同一更新规则下
PPO、GRPO 等策略优化方法通常会限制新旧策略的概率比,避免一次更新迈得过大。传统做法使用固定上限,所有正优势词元共享同一个裁剪范围。研究团队认为,这套规则虽然简单有效,但忽略了不同词元所处状态的差异。
按照论文的分析,旧策略已经高度确信的词,可能只是语言先验驱动下的「顺口选择」,如果继续显著提高其概率,错误路径也可能被一起强化;相反,旧策略概率较低、但获得正优势的词,可能才是真正需要纠正和探索的方向,却又会被同一上限压缩更新空间。
CAPO 并不把「高置信度」直接等同于「语义正确」。这里的旧策略概率被用作控制更新幅度的信号,用来判断某个词已经被旧模型偏好到什么程度,以及是否还需要继续明显放大。
CAPO-SLT按词元置信度动态设置上限
CAPO 的核心做法,是让不同词元拥有不同的更新上限。对于正优势词元,方法会根据旧策略为该词分配的概率,动态设置上裁剪边界。旧策略置信度越高,上限越靠近保守区间;置信度越低,则保留更大的正向更新空间。论文中给出的基础上限为 0.2,最大放宽到 0.3。
研究团队强调,这并不是压制高置信度词。高置信度且获得正优势的词仍会被强化,只是不再被不必要地过度放大。对于负优势词元,CAPO 还给损失幅度设置上限,以降低句级奖励噪声把个别词「罚得过重」的风险。
训练流程覆盖监督初始化与强化学习微调
在监督初始化阶段,模型先从视频中提取全身姿态关键点,并拆分为面部、身体、左手和右手四组,再用 ST-GCN 建模空间关节关系与时间运动信息,同时学习视觉—文本共享语义表示。
进入强化学习微调阶段后,系统会对同一段手语采样多条候选译文,并综合 BLEU-1、BLEU-4、ROUGE-L 和 BERTScore 计算句级奖励,再获得组内相对优势。
在置信度感知更新阶段,CAPO 对正优势词元使用随旧策略置信度变化的上限,对负优势词元限制过大的损失,从而在不修改奖励函数和主干网络的情况下,让训练更新更稳定。
数据与验证方面,中文侧使用 CSL-News 做大规模预训练,再在 CSL-Daily 上进行监督微调、强化学习与评测;英文侧使用 YouTube-ASL 预训练,并在 How2Sign 上验证美国手语翻译。论文还在 WLASL2000 上进行了孤立词识别评估。
中文手语翻译三项指标均取得表中最高值
论文结果显示,在 CSL-Daily 测试集上,CAPO-SLT 在仅使用 Pose 输入的情况下,三项指标均取得对比表中的最高值。
与此前同样只使用 Pose 输入的 Geo-Sign 相比,CAPO-SLT 的三项指标分别提升 2.93、1.26 和 0.64 分;与 Pose-only 的 Uni-Sign 相比,三项指标分别提升 4.96、3.07 和 3.67 分。论文对比表中还包含同时使用 Pose 与 RGB 的方法,而 CAPO-SLT 在仅使用姿态输入的条件下仍获得三项最高值。
跨语言验证与辅助任务结果同步披露
在 How2Sign 数据集上,CAPO-SLT 同样只使用 Pose 输入,取得 41.4 BLEU-1、15.2 BLEU-4 和 34.9 ROUGE-L。与同样使用 Pose 的 Uni-Sign 相比,分别提升 1.0、0.7 和 0.6 分。
在 WLASL2000 上,模型的 Per-Instance 准确率为 63.77%,Per-Class 准确率为 61.91%。论文据此认为,姿态表征在另一类手语理解任务上仍具竞争力。
消融实验显示,增益主要来自策略优化规则本身
研究团队在消融实验中,让 SFT、GRPO、DAPO 和 CAPO 共用同一监督检查点、同一奖励与训练设置,只替换策略优化规则。
结果显示,相较 DAPO,CAPO 的三项指标分别提升 0.30、0.50 和 0.67 分。若移除负优势上限,结果降至 58.48/28.03/57.80;如果把反比例置信度映射替换为相同范围的线性映射,BLEU-4 与 ROUGE-L 分别下降 0.73 和 0.60 分。
案例对比聚焦「流畅但错译」问题
论文列举了数个没有使用 CAPO 时出现的翻译偏差。比如,模型会把「我分别介绍这几位同事」译成「我是一个由几个人组成的团队」;把「天黑了,我害怕」译成「天黑了,我睡着了」;还会把「这部电影的女演员很漂亮」改写成「这部电影讲的是女演员的爱情故事」。
这些句子在表面上都较为流畅,但已经替换了谓词、实体关系或事件含义。加入 CAPO 后,论文称这三组译文都恢复到与参考答案一致或语义等价的表达。剩余错误主要集中在局部遗漏、时间表达偏差或轻微措辞差异,而不是整句意义被翻转。
训练曲线变化与生成稳定性方向一致
训练曲线也给出了与上述结果相同的方向。论文显示,GRPO 的平均熵先快速下降,随后在训练后期重新上升,反映策略不确定性再次增加;CAPO 在早期下降后逐渐稳定,没有出现突然的熵坍塌,也没有在后期出现明显反弹。
研究团队认为,置信度感知裁剪让词元级更新更可控,这与方法希望改善的生成阶段稳定性相一致。
方法侧重低侵入式改造,后续仍有评估空间
论文把 CAPO-SLT 的价值放在生成稳定性上,而不是继续堆叠更大的视觉编码器。研究团队认为,当奖励来自整句、更新发生在每个词时,给所有词统一设置更新上限并不总是合适;旧策略置信度则提供了一个不需要额外模型、可以直接计算的控制信号。
从工程实现看,CAPO 不修改视觉主干和奖励函数,只替换策略优化中的裁剪规则。对于已经具备监督初始化和 PPO、GRPO 式强化学习流程的手语翻译系统,这意味着一条相对低侵入的稳定化路径。

不过,论文也提到,CAPO 在美国手语翻译上的增益比 CSL-Daily 更温和。当前奖励仍完全依赖参考译文,把 BLEU、ROUGE-L 等重叠指标与 BERTScore 结合,依然难以完整覆盖合理改写、篇章级充分性和细粒度语义偏好。团队下一步计划探索学习式偏好模型,或面向手语翻译的专用语义评估器。
论文与作者信息
论文标题为《CAPO-SLT: Confidence-Aware Policy Optimization for Stable Sign Language Translation Generation》。
作者包括 Ling Zhou、Yuhao Chen、Lin Cheng、Chengwen Yao、Donghui Sun、Xiaoxin Chen,其中 Ling Zhou 与 Yuhao Chen 为共同一作,Donghui Sun 为通讯作者。
论文链接:https://openreview.net/pdf?id=l4bCsrSkYx
本文来自微信公众号「量子位」,作者为 vivo AI Lab 团队。

