Perplexity公开搜索Agent训练方案:单次查询2美分,准确率超过GPT-5.4

Perplexity公开搜索Agent训练方案:单次查询2美分,准确率超过GPT-5.4

N
News Editor 01
2026-07-22 13:55:13
Perplexity披露网页搜索Agent后训练方法,基于开源Qwen3.5模型,在FRAMES基准上以更低成本取得高于GPT-5.4和Claude Sonnet 4.6的搜索准确率。
PerplexityQwen3.5AI搜索大模型强化学习

Perplexity公开了网页搜索 Agent 的后训练流程,核心模型建立在开源 Qwen3.5-122B-A10BQwen3.5-397B-A17B 之上。按其披露的数据,在 FRAMES 多跳搜索基准中,后训练后的 Qwen3.5-397B-SFT-RL 不只拿到更高准确率,单次查询成本还压到 2.0 美分,低于 GPT-5.4 的 8.5 美分,也明显低于 Claude Sonnet 4.6 的 15.3 美分

训练分两步,先约束输出,再强化搜索决策

这套方法分成两个阶段。第一阶段是监督微调(SFT),目标不是拉高复杂推理能力,而是先把模型的基本行为固定下来,包括遵循指令、保持语言一致、控制输出格式等。Perplexity把这一层当作底座,先把回答的“规矩”训练稳定,再进入后续优化。

第二阶段是强化学习(RL),采用 GRPO 算法。它不需要额外训练一个评审模型,而是直接比较同一批次输出结果,提取学习信号。这样做的好处很直接:训练成本更低,也更容易扩展到大规模任务。

RL数据有两条来源。一类是 Perplexity 自行合成的多跳推理题库,模型必须先搜索第一个事实,再基于该事实继续搜索,通常要经过 2 到 4 次 才能得到答案。另一类是基于 rubric 的对话数据,把“���式正确”“语言一致”这类在 SFT 阶段建立的约束,继续保留到强化学习里,避免模型为了追求高分而丢掉基本输出纪律。

奖励机制先看答对,再比较搜索效率

Perplexity在技术报告里把重点放在奖励设计上。搜索类模型很容易学会写出看起来流畅、结构完整,却没有答对问题的回复。为了解决这个问题,Perplexity采用了“门控聚合”机制:只有在答案本身正确的前提下,偏好得分才会被纳入计算。答错了,就算表述再工整,也拿不到奖励。

这意味着训练信号首先绑定事实准确性,而不是语言表现。短句说,就是先答对。

效率部分也不是按固定阈值扣分。Perplexity使用同批次中其他正确答案的平均工具调用次数作为参照。如果别的模型用 3 次搜索就能完成,而某个输出用了 7 次,即便最后答对,仍然会在效率项上被扣分。这样的设计不是单纯追求少调用工具,而是要求模型在正确和成本之间做更精细的取舍。

FRAMES测试里,准确率和成本同时压过闭源模型

在 FRAMES 基准测试中,后训练后的 Qwen3.5-397B-SFT-RL 即使只使用 1 次工具调用,准确率也达到 57.3%,比 GPT-5.4 和 Claude Sonnet 4.6 高出约 5 个百分点。当工具调用上限提高到 4 次 后,三者准确率分别为 73.9%67.8%62.4%

更受关注的是成本。按照各家公开 API 定价计算、且未包含缓存优化,三者单次查询费用分别为 2.0 美分8.5 美分15.3 美分。也就是说,Perplexity给出的方案在该任务上的查询成本不到 GPT-5.4 的四分之一,相比 Claude Sonnet 4.6 的差距更大。

从这份报告能看到一条很清楚的路线:Perplexity没有采用 GPT 或 Claude 作为骨干模型,而是基于开源 Qwen3.5 做后训练,把网页搜索这种具体任务的准确率推到更高位置,同时保住了低推理成本。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。