Laminar发布flow-1,称Agent查错成本降至GPT-6-sol的1/23

Laminar发布flow-1,称Agent查错成本降至GPT-6-sol的1/23

N
News Editor
2026-10-06 14:56:50
AI Agent 可观测性平台 Laminar 发布用于检查 Agent 执行轨迹的模型 flow-1,部署在其 Signals agent 中。按 Laminar 自建的 523 条困难 trace 测试,flow-1 错误检测 F1 为 0.835,高于 GPT-6-sol 的 0.816;后者召回率更高,前者精确率更高。对于不足 10 万 LLM tokens 的 trace,flow-1 平均每条分析成本约 0.0011 美元,Laminar 测算 1 美元可分析约 888 条 trace。相关结果暂未经过第三方复测。

AI Agent 可观测性平台 Laminar 发布了专门检查 Agent 执行轨迹的模型 flow-1。该模型运行在 Laminar 的 Signals agent 中,会读取模型调用、工具调用和返回结果,用来判断 Agent 是在哪一步出错,以及出错原因。

可搜索整条 trace,并按需查看具体步骤

Laminar 表示,flow-1 可以搜索整条 trace,也就是 Agent 的完整执行记录,再按需要查看其中的具体步骤。

训练方式与测试结果

训练阶段,Laminar 先使用合成调查数据进行监督微调,随后再通过强化学习训练工具调用和复杂 trace 分析能力。

在 Laminar 自建的 523 条困难 trace 测试中,flow-1 的错误检测 F1 为 0.835,GPT-6-sol 为 0.816。Laminar 同时提到,sol 的召回率更高,能找到更多真实错误;flow-1 的精确率更高,误报更少。

成本对比

对于不足 10 万 LLM tokens 的 trace,flow-1 平均每条分析成本约 0.0011 美元,GPT-6-sol 约 0.026 美元。按 Laminar 的测算,1 美元分别可分析约 888 条和 38 条 trace,相差约 23 倍。

Laminar 还称,flow-1 的成本比 GPT-6-luna 低约 25%。

现阶段限制

目前上述成绩都来自 Laminar 自建 benchmark,暂无第三方复测。根据披露,flow-1 的训练数据主要来自合成工作流,其中约 48% 是软件工程任务。

社区已经有人质疑,flow-1 在真实生产环境中遇到未被预先设计过的新型故障时,能否保持同样表现。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。