Google DeepMind高管呼吁:AI公司应自建定制基准测试,摆脱公共排行榜束缚

Google DeepMind高管呼吁:AI公司应自建定制基准测试,摆脱公共排行榜束缚

N
News Editor 01
2026-07-10 23:39:13
Google DeepMind产品经理Logan Kilpatrick呼吁AI公司开发自定义基准测试,以聚焦业务关键指标。Zapier和Sierra已受益,此法可显著提升场景化性能,摆脱公共排行榜局限。
AI基准测试Google DeepMind自定义评估AI模型性能Zapier

Google DeepMind高级产品经理Logan Kilpatrick近日在X平台发文,强烈建议AI公司建立自己的基准测试体系,以更准确地评估模型性能。他指出,依赖公共排行榜(如MMLU、Leaderboards)往往无法反映实际业务需求,而定制化基准能确保模型优化真正服务于企业独特场景。

公共基准的短板:通用但不实用

当前行业普遍采用标准化基准(如GLUE、SuperGLUE、HumanEval)衡量AI模型能力,但Kilpatrick认为这些指标存在严重局限性。公共排行榜通常涵盖广泛任务,却忽略了企业特定的性能权重——例如客服自动化可能更注重语气一致性,而金融风控则更关注小数精度。依赖这类“一刀切”评估,可能导致模型在真实部署中表现不及预期。

定制化基准的优势:精准驱动业务提升

Kilpatrick强调,自定义基准允许公司从自身数据中提取关键指标,并动态调整测试难度。他举例说明,自动化平台Zapier与客户支持公司Sierra已率先采用此方法。通过构建与自身工作流高度相关的评估套件,这两家公司成功将模型在具体任务上的准确率提升了15%-20%,同时减少了误报率。这种“以场景为中心”的评估策略,让AI投资直接转化为业务价值。

行业趋势:更多企业加入定制浪潮

实际上,科技巨头已经开始行动。如腾讯近期发布Chronicles-OCR基准测试,专门用于评估AI对古文字的理解能力;Jina AI推出v5-omni模型,并配合多模态检索基准进行优化;而Odyssey团队则通过PROWL框架提升世界模型训练效率。这些案例均体现出从“通用测试”向“专有评估”的转变。Kilpatrick进一步预测,未来两年内,超过60%的AI部署企业将构建至少一套内部基准,以此实现模型迭代与业务目标的闭环。

实施建议:从小处着手,迭代演进

对于尚未启动定制化的公司,Kilpatrick建议从单一关键任务开始,例如对话生成的响应相关性或代码生成的功能正确性。随后逐步扩展至多维度评估,并引入人工反馈进行校准。同时,他提醒企业注意避免“过拟合基准”,即模型过度适应测试集而丧失泛化能力。定期更新测试数据和指标是保持基准有效性的关键。

总而言之,在AI能力快速竞赛的当下,盲目刷榜已不可取。唯有建立贴合自身业务的基准体系,才能让模型真正“为我所用”,在竞争中占据差异化优势。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。