Perplexity公开了网页搜索 Agent 的后训练流程,核心模型建立在开源 Qwen3.5-122B-A10B 和 Qwen3.5-397B-A17B 之上。按其披露的数据,在 FRAMES 多跳搜索基准中,后训练后的 Qwen3.5-397B-SFT-RL 不只拿到更高准确率,单次查询成本还压到 2.0 美分,低于 GPT-5.4 的 8.5 美分,也明显低于 Claude Sonnet 4.6 的 15.3 美分。
训练分两步,先约束输出,再强化搜索决策
这套方法分成两个阶段。第一阶段是监督微调(SFT),目标不是拉高复杂推理能力,而是先把模型的基本行为固定下来,包括遵循指令、保持语言一致、控制输出格式等。Perplexity把这一层当作底座,先把回答的“规矩”训练稳定,再进入后续优化。
第二阶段是强化学习(RL),采用 GRPO 算法。它不需要额外训练一个评审模型,而是直接比较同一批次输出结果,提取学习信号。这样做的好处很直接:训练成本更低,也更容易扩展到大规模任务。
RL数据有两条来源。一类是 Perplexity 自行合成的多跳推理题库,模型必须先搜索第一个事实,再基于该事实继续搜索,通常要经过 2 到 4 次 才能得到答案。另一类是基于 rubric 的对话数据,把“���式正确”“语言一致”这类在 SFT 阶段建立的约束,继续保留到强化学习里,避免模型为了追求高分而丢掉基本输出纪律。
奖励机制先看答对,再比较搜索效率
Perplexity在技术报告里把重点放在奖励设计上。搜索类模型很容易学会写出看起来流畅、结构完整,却没有答对问题的回复。为了解决这个问题,Perplexity采用了“门控聚合”机制:只有在答案本身正确的前提下,偏好得分才会被纳入计算。答错了,就算表述再工整,也拿不到奖励。
这意味着训练信号首先绑定事实准确性,而不是语言表现。短句说,就是先答对。
效率部分也不是按固定阈值扣分。Perplexity使用同批次中其他正确答案的平均工具调用次数作为参照。如果别的模型用 3 次搜索就能完成,而某个输出用了 7 次,即便最后答对,仍然会在效率项上被扣分。这样的设计不是单纯追求少调用工具,而是要求模型在正确和成本之间做更精细的取舍。
FRAMES测试里,准确率和成本同时压过闭源模型
在 FRAMES 基准测试中,后训练后的 Qwen3.5-397B-SFT-RL 即使只使用 1 次工具调用,准确率也达到 57.3%,比 GPT-5.4 和 Claude Sonnet 4.6 高出约 5 个百分点。当工具调用上限提高到 4 次 后,三者准确率分别为 73.9%、67.8% 和 62.4%。
更受关注的是成本。按照各家公开 API 定价计算、且未包含缓存优化,三者单次查询费用分别为 2.0 美分、8.5 美分 和 15.3 美分。也就是说,Perplexity给出的方案在该任务上的查询成本不到 GPT-5.4 的四分之一,相比 Claude Sonnet 4.6 的差距更大。
从这份报告能看到一条很清楚的路线:Perplexity没有采用 GPT 或 Claude 作为骨干模型,而是基于开源 Qwen3.5 做后训练,把网页搜索这种具体任务的准确率推到更高位置,同时保住了低推理成本。

