Study Says Google AI Search Is 91% Accurate but May Still Produce Over 57 Million Wrong Answers Per Hour

Study Says Google AI Search Is 91% Accurate but May Still Produce Over 57 Million Wrong Answers Per Hour

N
News Editor 01
2026-07-08 02:13:22
A recent study found Google AI Overviews is about 91% accurate, but at Google’s search scale that could still mean over 57 million wrong answers every hour. Researchers also warned that many correct responses cite sources that do not support the conclusions.

一项由《纽约时报》联合AI初创公司Oumi开展、并被业内广泛引用的测试显示,谷歌搜索中的AI Overviews功能准确率约为91%。这一数字表面上看并不低,但若放到谷歌庞大的搜索体量中审视,问题就变得严峻:按照谷歌每年约5万亿次搜索量计算,约9%的误差率意味着该功能可能每小时生成超过5700万条不准确答案。

这项研究迅速引发市场对AI搜索可靠性的讨论。对于加密货币、金融投资及链上信息查询等高度依赖实时性和准确性的领域而言,AI给出“看似权威、实则错误”的结论,可能放大用户误判风险,并进一步影响市场情绪与信息传播链条。

测试如何进行:Gemini升级后准确率提升

根据报道,Oumi使用了由OpenAI开发的行业标准测试集SimpleQA,对谷歌AI Overviews进行了4326个搜索查询的评估。测试分为两轮:一轮在去年10月进行,当时系统基于Gemini 2;另一轮在今年2月进行,彼时已升级至Gemini 3

结果显示,Gemini 2阶段的准确率约为85%,升级到Gemini 3后提升至91%。从模型迭代角度看,这是明显进步,也说明谷歌正在通过大模型更新改善回答质量。不过,研究指出,单看百分比并不能完整反映风险,因为当搜索请求规模达到全球互联网级别后,即便较小的误差比例,也会转化为极大的错误信息产出。

更棘手的问题:答案正确,来源却未必正确

相比“回答错误”本身,研究认为更令人担忧的是引用来源与结论之间的脱钩。Oumi数据显示,在Gemini 2时期,约37%的正确答案存在“无依据引用”,即AI给出的链接并不能真正支撑其结论;而在升级至Gemini 3后,这一比例不降反升至56%

换言之,系统在“答对”问题方面有所提升,但在“证明自己为什么答对”这件事上,反而变得更弱。对于普通用户而言,这意味着即使得到正确答案,也未必能通过引用链接完成有效核验。Oumi首席执行官Manos Koukoumidis提出的核心问题正是:即便答案是对的,用户又该如何确认它确实是对的?

研究还指出,AI Overviews对部分低质量来源的引用占比较高,其中Facebook和Reddit分别是被引用频率第二和第四高的平台。在不准确回答中,Facebook的引用比例达到7%,高于准确回答中的5%。这进一步加剧了外界对AI搜索“证据链质量”的担忧。

24小时内被“投毒”?AI搜索抗操纵能力受质疑

报道还提及一项更具冲击力的案例:一名BBC记者曾发布一篇刻意编造的虚假文章,结果在24小时内,谷歌AI摘要便将其中错误信息当作事实呈现给用户。这说明,若有人熟悉系统抓取和排序逻辑,理论上可能通过发布虚假内容并提升其流量,影响AI搜索结果。

对于加密市场来说,这一风险格外敏感。当前大量用户会通过搜索引擎快速查询代币项目背景、交易所上新、链上协议机制、团队信息或监管动态。如果AI摘要被恶意内容“污染”,就可能在短时间内扩大错误叙事的传播半径,进而影响市场交易决策。尤其是在新币上线、空投传闻、项目安全事件等高波动场景中,错误信息的传播速度往往与价格波动相互放大。

谷歌回应:研究方法存在缺陷

面对这项研究,谷歌方面并未接受其全部结论。谷歌发言人表示,该研究存在“严重缺陷”,理由包括:SimpleQA基准本身可能含有不准确信息;Oumi使用自家AI模型HallOumi来评估另一套AI系统,可能引入额外误差;同时,测试内容也未必反映真实用户的搜索习惯。

谷歌还指出,其内部测试显示,Gemini 3如果脱离谷歌搜索框架独立运行,错误输出比例最高可达28%。谷歌借此强调,AI Overviews并非单纯依赖模型生成,而是叠加了搜索排序与安全机制,因此整体表现优于模型裸奔状态。对于BBC案例及相关质疑,谷歌发言人Ned Adriance则表示,多数测试示例属于用户现实中不太会发起的“非典型查询”。

不过,外界批评认为,这种回应并未完全打消疑虑。因为如果对研究的反驳仍建立在“评估AI也可能不准确”的前提上,反而会进一步强化公众对AI系统整体可信度的担忧。

市场影响:AI入口价值上升,信息验证将成竞争焦点

从行业视角看,这项研究再次说明,AI搜索正在从“辅助工具”演变为互联网流量与信息分发的重要入口,而其可靠性问题也将直接影响用户行为、广告价值以及内容平台生态。对加密行业而言,AI搜索若不能稳定提供可验证、高质量的来源,市场参与者未来可能更加重视多源交叉验证,包括直接查看项目官网、链上浏览器、权威媒体及交易平台公告。

同时,这一事件也可能推动搜索平台、AI模型公司与内容分发渠道进一步强化来源标注、事实核验和抗操纵机制。随着AI工具越来越深度介入资讯获取过程,谁能解决“答案准确”与“证据可信”之间的鸿沟,谁就更可能在下一阶段的信息入口竞争中占据优势。

总体而言,91%的准确率并不意味着风险已经可忽略。相反,在超大规模搜索场景下,剩余误差及引用失真问题仍可能制造海量错误认知。对于依赖高质量信息进行决策的加密市场参与者来说,AI生成摘要可以作为线索,但尚不足以替代独立验证与原始来源审查。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
100

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.