AI Agent 可观测性平台 Laminar 发布了专门检查 Agent 执行轨迹的模型 flow-1。该模型运行在 Laminar 的 Signals agent 中,会读取模型调用、工具调用和返回结果,用来判断 Agent 是在哪一步出错,以及出错原因。
可搜索整条 trace,并按需查看具体步骤
Laminar 表示,flow-1 可以搜索整条 trace,也就是 Agent 的完整执行记录,再按需要查看其中的具体步骤。
训练方式与测试结果
训练阶段,Laminar 先使用合成调查数据进行监督微调,随后再通过强化学习训练工具调用和复杂 trace 分析能力。
在 Laminar 自建的 523 条困难 trace 测试中,flow-1 的错误检测 F1 为 0.835,GPT-6-sol 为 0.816。Laminar 同时提到,sol 的召回率更高,能找到更多真实错误;flow-1 的精确率更高,误报更少。
成本对比
对于不足 10 万 LLM tokens 的 trace,flow-1 平均每条分析成本约 0.0011 美元,GPT-6-sol 约 0.026 美元。按 Laminar 的测算,1 美元分别可分析约 888 条和 38 条 trace,相差约 23 倍。
Laminar 还称,flow-1 的成本比 GPT-6-luna 低约 25%。
现阶段限制
目前上述成绩都来自 Laminar 自建 benchmark,暂无第三方复测。根据披露,flow-1 的训练数据主要来自合成工作流,其中约 48% 是软件工程任务。
社区已经有人质疑,flow-1 在真实生产环境中遇到未被预先设计过的新型故障时,能否保持同样表现。

