NVIDIA联合高校推出PivotOPD,训练AI智能体从关键错误中恢复

NVIDIA联合高校推出PivotOPD,训练AI智能体从关键错误中恢复

N
News Editor
2026-10-08 09:45:59
NVIDIA与普林斯顿大学、马里兰大学研究人员推出面向多轮大语言模型智能体的策略蒸馏方法 PivotOPD。该方法聚焦避免早期高破坏性错误,并在出错后训练恢复能力。在针对 13 个基线的测试中,Qwen3-1.7B 和 Qwen3-8B 学生模型在 ALFWorld、WebShop 和搜索式 QA 任务上取得最佳平均成绩。研究还称,该方法不增加推理成本。

Techub News 消息,NVIDIA 联合普林斯顿大学和马里兰大学的研究人员推出 PivotOPD,这是一种面向多轮大语言模型智能体的策略蒸馏方法。

这项方法的目标,是训练智能体避开破坏性最强的早期错误,并在错误已经发生后完成恢复。

测试覆盖 13 个基线

根据 MarkTechPost 披露的信息,在针对 13 个基线的测试中,PivotOPD 为 Qwen3-1.7B 和 Qwen3-8B 学生模型在 ALFWorld、WebShop 以及基于搜索的 QA 任务上拿到了最佳平均成绩。

恢复能力成为研究重点

研究结论称,恢复能力是可以学习的,而标准策略蒸馏很少教授这一点。

在 Qwen3-8B 学生模型上,PivotOPD 能从 72.7% 的重放关键错误中恢复;作为对比,标准策略蒸馏的恢复率只有 20.3%。

不增加推理成本

该方法不增加推理成本,训练后的智能体可以在其基础模型能够运行的任何地方运行。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。