新基准揭示AI智能体职场能力不足,顶级模型准确率低于25%

新基准揭示AI智能体职场能力不足,顶级模型准确率低于25%

N
News Editor 01
2026-07-07 07:59:30
Mercor推出Apex-Agents基准,模拟律师、投行和咨询等真实工作环境。结果显示,表现最好的模型准确率也仅24%,暴露出AI在跨平台信息追踪与综合推理上的明显短板。

人工智能是否已经准备好接管高价值白领工作?最新发布的一项评测给出了偏冷静的答案。由训练数据公司Mercor开发的Apex-Agents基准测试显示,当前主流AI智能体在真实职场任务中的表现远未达到可独立胜任的水平。即便是排名靠前的模型,在一次作答场景下的准确率也低于25%,反映出AI距离真正进入法律、投资银行和管理咨询等专业领域,仍有明显差距。

与传统测试不同:Apex-Agents更接近真实办公场景

报道指出,Apex-Agents被认为是目前更贴近现实职业环境的AI评测方式之一。与过去主要考察单点知识问答或独立任务处理能力的测试不同,这一基准强调“完整工作流”模拟。研究人员搭建了接近真实企业运作的数字化环境,引入了Slack、Google Drive以及专有数据库等工具,让AI智能体在多平台、多信息源并行的条件下完成任务。

这种设计的关键意义在于,它不再只考验模型“会不会回答问题”,而是考验其能否像专业人士一样,在复杂信息环境中完成综合判断。Mercor研究人员认为,现实中的专业工作很少发生在单一页面或单一文档中,真正的知识型劳动往往需要在多个系统之间切换,并持续追踪上下文、政策要求和业务目标。

核心短板暴露:跨平台信息整合能力不足

从测试结果来看,当前AI模型最明显的弱点之一,是无法稳定处理跨领域、跨平台的信息整合任务。对于律师、投行分析师或咨询顾问而言,日常工作不仅涉及检索数据,还要将来自不同渠道的信息进行比对、筛选、归纳,并置于更广泛的监管、组织流程和客户目标之下做出判断。

而Apex-Agents的测试恰恰聚焦于这类能力。任务素材直接来自Mercor专家市场中的真实从业者,这意味着测试场景并非抽象题库,而是尽可能还原实际工作挑战。结果显示,尽管基础模型在某些单项任务上已展现出较强能力,但一旦进入需要多步骤推理、跨系统协同和复杂约束处理的环境,其表现便迅速下滑。

关键数据:领先模型仍未达到基础胜任水平

最受关注的数据来自模型排名。根据报道,表现最好的模型是Gemini 3 Flash,其一次作答准确率为24%;随后是GPT-5.2,准确率为23%。值得注意的是,所有接受测试的模型都未达到基本专业胜任标准。这一结果意味着,即便是目前市场上最先进的一批AI系统,在面对高价值专业任务时,依旧更适合扮演辅助角色,而非独立执行者。

这一结论与近年来市场对AI“全面替代白领”的激进叙事形成鲜明对比。过去两年,随着大模型性能快速提升,不少科技公司和资本市场对AI自动化前景抱有极高期待。但Apex-Agents的结果提醒行业:模型在演示环境中的亮眼表现,并不等同于其能够在真实商业流程中稳定交付结果。

企业态度趋于谨慎:从“替代”转向“协作”

面对这类评测结果,专业服务机构的反应相对克制。报道提到,许多企业仍在推进AI工具试点,但在关键决策和高风险环节上继续保留人工监督。这种做法如今看来更具合理性,因为基准测试已经证明,当前AI在综合推理和复杂业务流程中的表现仍存在明显局限。

资本投入方向也出现微妙变化。尽管AI办公工具仍持续吸引投资,但市场关注点正从“完全自动化”逐步转向人机协作。这反映出投资人和企业对现实应用边界有了更清晰认识:AI可以提升效率、加速资料整理、支持初步分析,但尚不足以在复杂专业环境中替代经验丰富的人类从业者。

对市场和行业的潜在影响

从更广泛的科技与数字资产市场角度看,这类评测具有双重意义。首先,它可能抑制部分围绕AI自动化的短期过热预期,尤其是那些依赖“AI全面接管职场”叙事进行估值扩张的项目。对于AI相关代币、基础设施概念股以及智能体赛道创业公司而言,市场未来可能更加关注真实落地能力,而非概念包装。

其次,这项测试也可能推动AI基础设施和企业级工具继续迭代。因为基准已经明确指出短板所在:不是单纯的语言生成能力不足,而是多域信息追踪、跨平台协作、政策与监管框架下的综合应用仍待提升。对于提供工作流自动化、中间件、企业数据编排和合规工具的项目来说,这反而意味着新的发展空间。

此外,教育和监管层面的响应也值得关注。报道提到,一些法学院和商学院已经开始把AI素养纳入课程体系,帮助未来从业者学习如何与AI协同,而不是简单将其视为竞争对手。这种趋势表明,AI对职场的影响更可能是渐进式重塑,而非骤然替代。

结语

Apex-Agents基准测试释放出的最重要信号在于:AI仍在快速进步,但距离真正独立胜任复杂白领工作还有不小距离。对于企业而言,这意味着部署AI时需要更严谨的评估标准和更稳健的人类监督机制;对于市场而言,这意味着应该从“技术想象”回归“能力验证”。在下一阶段,谁能真正解决真实工作场景中的协作、推理与合规难题,谁才更可能在AI应用竞赛中占据优势。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。