一项由AI初创公司Oumi参与、并被《纽约时报》引用的研究,再次把谷歌AI搜索功能AI Overviews推上风口浪尖。测试结果显示,该功能当前准确率约为91%。表面上看,这一数字并不低,但若放在谷歌庞大的搜索规模中衡量,问题就变得十分突出:按照谷歌每年约5万亿次搜索计算,哪怕只有9%的错误率,也可能意味着每小时产生超过5700万条不准确答案,接近每分钟100万条。
测试结果:模型升级后准确率提升,但问题未消失
根据报道,Oumi使用OpenAI开发的行业标准测试集SimpleQA,对谷歌AI Overviews进行了两轮评估。第一次测试在去年10月进行,当时系统由Gemini 2驱动;第二次则在今年2月进行,升级为Gemini 3之后。结果显示,Gemini 2阶段的准确率约为85%,而Gemini 3阶段提升至91%。
从模型进步角度看,准确率改善说明谷歌确实在优化AI搜索体验。不过,这并不意味着风险已经可忽略。对于传统搜索引擎而言,用户通常会自行点击多个链接进行交叉验证;而在AI摘要场景下,用户更容易直接接受系统生成的结论。一旦答案出现偏差,错误信息传播速度和影响范围都可能被进一步放大。
更严重的问题:答案对了,但引用未必对
研究认为,真正令人担忧的并不只是“答错”,而是“答对了却无法证实”。Oumi发现,在Gemini 2阶段,约有37%的正确答案存在“无根据引用”问题,即AI给出的链接并不能支持其摘要中的结论。到了Gemini 3阶段,这一比例不降反升,达到56%。
这意味着,AI Overviews虽然在表面准确率上有所提升,但其“证据链”反而变得更加脆弱。换句话说,用户即便看到了正确答案,也可能无法通过附带来源完成有效核验。Oumi首席执行官Manos Koukoumidis提出的疑问颇具代表性:即使答案是对的,用户又该如何确认它为什么是对的?
在信息检索体系中,来源的可信度往往与答案本身同等重要。尤其在涉及金融、医疗、法律以及投资决策等高风险领域时,缺乏可验证出处的“正确答案”,本质上仍然是一种潜在风险。
低质量来源被频繁引用,社交平台成隐患
研究还指出,AI Overviews对部分低质量内容来源存在较高依赖。Oumi的统计显示,Facebook和Reddit分别是该功能中被引用频率第二和第四高的来源。在不准确回答中,Facebook被引用的比例达到7%,高于准确回答中的5%。
这反映出一个关键问题:生成式搜索并非只是在“理解网页”,它也在放大互联网原有的信息噪音。当社交平台内容、未充分核实的帖子甚至带有明显立场偏向的信息被纳入AI摘要,搜索结果的权威性便容易受到侵蚀。对普通用户而言,AI生成的自然语言表达往往会制造“高度可靠”的心理错觉,而这种错觉正是错误信息扩散的催化剂。
可被“投毒”:虚假文章24小时内进入AI摘要
除准确率与引用问题外,研究和相关案例还揭示了AI Overviews可能面临的内容操纵风险。报道称,一名BBC记者曾使用一篇刻意编造的虚假文章进行测试,结果在24小时内,谷歌AI摘要就将其中的错误内容当作事实呈现给用户。
这一案例说明,只要有人熟悉系统抓取与排序逻辑,就可能通过发布虚假内容并人为提升其传播热度,影响AI搜索摘要结果。对于加密货币行业而言,这种风险尤其值得警惕。由于市场对新币上线、项目融资、监管政策和链上安全事件极度敏感,任何被AI搜索误读或放大的不实消息,都可能在短时间内引发价格波动、情绪踩踏甚至诈骗扩散。
谷歌回应:研究方法本身存在缺陷
面对外界质疑,谷歌方面并未接受研究结论。谷歌发言人表示,该研究“存在严重缺陷”,理由包括:SimpleQA测试集本身可能含有不准确信息;Oumi使用自家AI模型HallOumi去评估另一套AI系统,可能引入额外误差;同时,测试问题未必能代表真实用户搜索行为。
谷歌还表示,内部测试显示,如果Gemini 3脱离搜索框架独立运行,错误输出比例最高可达28%;而AI Overviews结合了谷歌原有搜索排序与安全机制,因此实际表现优于单独模型。谷歌发言人还称,许多测试案例属于现实中用户并不会真正搜索的“非典型问题”。
不过,外部评论指出,这种辩护本身也面临逻辑困境:如果回应一份指出AI不准确的报告时,理由之一是“对方也使用了可能不准确的AI进行评估”,那么这未必能增强用户对AI搜索可靠性的信心。
市场影响:AI搜索信任危机或波及加密信息生态
从市场层面看,这项研究的意义并不局限于谷歌产品口碑,而是触及AI时代信息分发基础设施的可信度问题。加密货币行业高度依赖搜索、社交媒体和资讯聚合平台完成价格发现与叙事传播。如果AI搜索在来源审核、事实核验和抗操纵能力方面存在短板,那么相关风险可能外溢至交易决策、项目研究、社区舆情乃至监管沟通。
短期来看,这类争议可能促使用户重新重视原始来源、官方公告和链上数据工具,而不是完全依赖AI摘要。中长期看,搜索平台、AI模型开发者以及内容平台或将被要求建立更严格的引用透明机制与纠错体系。对于加密投资者、研究员以及普通用户而言,最现实的应对方式仍然是保持多源交叉验证,不将AI生成结果视作最终结论。
整体而言,91%的准确率并不足以自动等同于“可放心依赖”。当搜索规模达到5万亿次/年时,哪怕是个位数错误率,也足以演变成大规模的信息偏差事件。在AI正深度嵌入互联网入口的当下,这场关于准确率、引用质量与可验证性的争论,显然才刚刚开始。

