人工智能是否已经准备好接管高价值白领工作?最新发布的一项评测给出了偏冷静的答案。由训练数据公司Mercor开发的Apex-Agents基准测试显示,当前主流AI智能体在真实职场任务中的表现远未达到可独立胜任的水平。即便是排名靠前的模型,在一次作答场景下的准确率也低于25%,反映出AI距离真正进入法律、投资银行和管理咨询等专业领域,仍有明显差距。
与传统测试不同:Apex-Agents更接近真实办公场景
报道指出,Apex-Agents被认为是目前更贴近现实职业环境的AI评测方式之一。与过去主要考察单点知识问答或独立任务处理能力的测试不同,这一基准强调“完整工作流”模拟。研究人员搭建了接近真实企业运作的数字化环境,引入了Slack、Google Drive以及专有数据库等工具,让AI智能体在多平台、多信息源并行的条件下完成任务。
这种设计的关键意义在于,它不再只考验模型“会不会回答问题”,而是考验其能否像专业人士一样,在复杂信息环境中完成综合判断。Mercor研究人员认为,现实中的专业工作很少发生在单一页面或单一文档中,真正的知识型劳动往往需要在多个系统之间切换,并持续追踪上下文、政策要求和业务目标。
核心短板暴露:跨平台信息整合能力不足
从测试结果来看,当前AI模型最明显的弱点之一,是无法稳定处理跨领域、跨平台的信息整合任务。对于律师、投行分析师或咨询顾问而言,日常工作不仅涉及检索数据,还要将来自不同渠道的信息进行比对、筛选、归纳,并置于更广泛的监管、组织流程和客户目标之下做出判断。
而Apex-Agents的测试恰恰聚焦于这类能力。任务素材直接来自Mercor专家市场中的真实从业者,这意味着测试场景并非抽象题库,而是尽可能还原实际工作挑战。结果显示,尽管基础模型在某些单项任务上已展现出较强能力,但一旦进入需要多步骤推理、跨系统协同和复杂约束处理的环境,其表现便迅速下滑。
关键数据:领先模型仍未达到基础胜任水平
最受关注的数据来自模型排名。根据报道,表现最好的模型是Gemini 3 Flash,其一次作答准确率为24%;随后是GPT-5.2,准确率为23%。值得注意的是,所有接受测试的模型都未达到基本专业胜任标准。这一结果意味着,即便是目前市场上最先进的一批AI系统,在面对高价值专业任务时,依旧更适合扮演辅助角色,而非独立执行者。
这一结论与近年来市场对AI“全面替代白领”的激进叙事形成鲜明对比。过去两年,随着大模型性能快速提升,不少科技公司和资本市场对AI自动化前景抱有极高期待。但Apex-Agents的结果提醒行业:模型在演示环境中的亮眼表现,并不等同于其能够在真实商业流程中稳定交付结果。
企业态度趋于谨慎:从“替代”转向“协作”
面对这类评测结果,专业服务机构的反应相对克制。报道提到,许多企业仍在推进AI工具试点,但在关键决策和高风险环节上继续保留人工监督。这种做法如今看来更具合理性,因为基准测试已经证明,当前AI在综合推理和复杂业务流程中的表现仍存在明显局限。
资本投入方向也出现微妙变化。尽管AI办公工具仍持续吸引投资,但市场关注点正从“完全自动化”逐步转向人机协作。这反映出投资人和企业对现实应用边界有了更清晰认识:AI可以提升效率、加速资料整理、支持初步分析,但尚不足以在复杂专业环境中替代经验丰富的人类从业者。
对市场和行业的潜在影响
从更广泛的科技与数字资产市场角度看,这类评测具有双重意义。首先,它可能抑制部分围绕AI自动化的短期过热预期,尤其是那些依赖“AI全面接管职场”叙事进行估值扩张的项目。对于AI相关代币、基础设施概念股以及智能体赛道创业公司而言,市场未来可能更加关注真实落地能力,而非概念包装。
其次,这项测试也可能推动AI基础设施和企业级工具继续迭代。因为基准已经明确指出短板所在:不是单纯的语言生成能力不足,而是多域信息追踪、跨平台协作、政策与监管框架下的综合应用仍待提升。对于提供工作流自动化、中间件、企业数据编排和合规工具的项目来说,这反而意味着新的发展空间。
此外,教育和监管层面的响应也值得关注。报道提到,一些法学院和商学院已经开始把AI素养纳入课程体系,帮助未来从业者学习如何与AI协同,而不是简单将其视为竞争对手。这种趋势表明,AI对职场的影响更可能是渐进式重塑,而非骤然替代。
结语
Apex-Agents基准测试释放出的最重要信号在于:AI仍在快速进步,但距离真正独立胜任复杂白领工作还有不小距离。对于企业而言,这意味着部署AI时需要更严谨的评估标准和更稳健的人类监督机制;对于市场而言,这意味着应该从“技术想象”回归“能力验证”。在下一阶段,谁能真正解决真实工作场景中的协作、推理与合规难题,谁才更可能在AI应用竞赛中占据优势。

