NeoCognition测试AI会计岗学习能力,Fable 5.1成功率达72%

NeoCognition测试AI会计岗学习能力,Fable 5.1成功率达72%

N
News Editor
2026-09-11 07:11:03
AI Agent 创业公司 NeoCognition 发布 ApprenticeBench,用于测试 AI 是否能像新人一样在入职后学会一份工作。首个测试场景设在一家模拟的加州建筑公司应付账款岗位,Fable 5.1 成功率为 72%,GPT-6 Astra 为 68%,最佳人类测试者为 51%。不过,这一「超过人类」的结论仅限单一模拟岗位,且真人样本只有 2 人,Fable 5.1 的单任务平均成本也高于人类。

AI Agent 创业公司 NeoCognition 发布了 ApprenticeBench,专门测试 AI 能否像新人一样,在入职后自己学会一份工作。

第一版测试让 Agent 进入一家模拟的加州建筑公司,负责应付账款岗位。系统先让它阅读半年历史账单、公司手册和 Odoo 教程,随后连续处理 7 个月的 100 张账单。测试过程中还加入了规则变化和主管反馈。

模型与人工测试结果

在这项测试中,Fable 5.1 的最终成功率达到 72%,GPT-6 Astra 为 68%,最佳人类测试者为 51%。

任务不只包括录入发票,还包括发现错误、分配成本码、联系供应商、完成审批,以及从历史记录和反馈中学会公司的内部规则。

GUI操作成绩高于API调用

NeoCognition 表示,两款模型直接操作 GUI 的成绩甚至略高于调用 API,过去 Computer Use 常见的性能损失基本已经消失。

结论范围与成本差异

不过,「超过人类」这一结果只成立于这一个模拟岗位,而且真人样本只有 2 个。

成本方面,Fable 5.1 平均每个任务需要 18.23 美元,人类约为 7.21 美元。测试还显示,人类会越做越快,Agent 则会因为记住的内容越来越多而变慢。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。