AI Agent 创业公司 NeoCognition 发布了 ApprenticeBench,专门测试 AI 能否像新人一样,在入职后自己学会一份工作。
第一版测试让 Agent 进入一家模拟的加州建筑公司,负责应付账款岗位。系统先让它阅读半年历史账单、公司手册和 Odoo 教程,随后连续处理 7 个月的 100 张账单。测试过程中还加入了规则变化和主管反馈。
模型与人工测试结果
在这项测试中,Fable 5.1 的最终成功率达到 72%,GPT-6 Astra 为 68%,最佳人类测试者为 51%。
任务不只包括录入发票,还包括发现错误、分配成本码、联系供应商、完成审批,以及从历史记录和反馈中学会公司的内部规则。
GUI操作成绩高于API调用
NeoCognition 表示,两款模型直接操作 GUI 的成绩甚至略高于调用 API,过去 Computer Use 常见的性能损失基本已经消失。
结论范围与成本差异
不过,「超过人类」这一结果只成立于这一个模拟岗位,而且真人样本只有 2 个。
成本方面,Fable 5.1 平均每个任务需要 18.23 美元,人类约为 7.21 美元。测试还显示,人类会越做越快,Agent 则会因为记住的内容越来越多而变慢。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

