Techub News 消息,NVIDIA 联合普林斯顿大学和马里兰大学的研究人员推出 PivotOPD,这是一种面向多轮大语言模型智能体的策略蒸馏方法。
这项方法的目标,是训练智能体避开破坏性最强的早期错误,并在错误已经发生后完成恢复。
测试覆盖 13 个基线
根据 MarkTechPost 披露的信息,在针对 13 个基线的测试中,PivotOPD 为 Qwen3-1.7B 和 Qwen3-8B 学生模型在 ALFWorld、WebShop 以及基于搜索的 QA 任务上拿到了最佳平均成绩。
恢复能力成为研究重点
研究结论称,恢复能力是可以学习的,而标准策略蒸馏很少教授这一点。
在 Qwen3-8B 学生模型上,PivotOPD 能从 72.7% 的重放关键错误中恢复;作为对比,标准策略蒸馏的恢复率只有 20.3%。
不增加推理成本
该方法不增加推理成本,训练后的智能体可以在其基础模型能够运行的任何地方运行。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

