Study Says Google AI Search May Generate 57 Million Wrong Answers Per Hour

Study Says Google AI Search May Generate 57 Million Wrong Answers Per Hour

N
News Editor 01
2026-07-08 02:13:22
A study found Google AI Overviews has about 91% accuracy, but at Google’s scale that could still mean over 57 million inaccurate answers per hour. Researchers also warned that many correct answers include citations that do not actually support the claims.

一项由《纽约时报》与AI初创公司Oumi合作开展、并被MarsBit等平台引用的研究,再次把谷歌AI搜索功能的可靠性推上风口浪尖。研究聚焦谷歌搜索中的AI Overviews功能,并通过行业常用测试集SimpleQA评估其回答质量。结果显示,升级后的Gemini 3版本准确率约为91%,较此前Gemini 2时期约85%的水平有所改善。但在谷歌庞大的搜索规模之下,即便错误率仅为9%,其潜在影响依然不容忽视。

按搜索规模放大,错误答案数量惊人

报告指出,谷歌每年处理约5万亿次搜索请求。如果按91%的准确率计算,意味着约9%的AI回答可能存在问题。换算下来,AI Overviews理论上可能每小时生成超过5700万条不准确答案,接近每分钟100万条。这一数字之所以引发广泛关注,并非因为研究认定谷歌搜索整体不可用,而是因为当生成式AI被嵌入基础信息入口后,哪怕相对较低的错误率,在超大规模应用中也会放大成系统性风险。

对普通用户而言,AI搜索摘要往往以更高效率、更直接的方式给出结论,减少了点击原始网页的步骤。这提升了检索体验,但也意味着用户更可能直接接受系统输出。当错误答案以“总结”形式出现时,其误导性可能强于传统网页列表中的普通错误页面,因为用户通常会默认平台已经完成筛选与验证。

更棘手的问题:答案对了,来源却未必对

相比单纯的准确率争议,研究提出的另一项问题更值得警惕,即所谓“引用失锚”。Oumi发现,在Gemini 2阶段,约37%的正确答案存在“无依据引用”现象,也就是AI给出的链接并不能真正支持对应结论。到了Gemini 3阶段,这一比例不降反升,达到56%

这意味着,即便系统表面上给出了正确结论,用户也不一定能够通过引用来源完成有效核验。换言之,AI搜索不只是“会不会答错”的问题,还包括“为什么这么答、证据是否成立”的问题。对于金融、医疗、法律以及加密资产等高风险领域,这类“看似正确但证据不足”的回答尤其值得警惕,因为用户可能据此做出交易、配置或风险判断。

研究还提到,AI Overviews对部分低质量来源的引用偏多,其中Facebook与Reddit在被引用来源中排名靠前。特别是在错误回答场景下,Facebook被引用的比例达到7%,高于准确回答中的5%。这说明,生成式搜索在整合开放网络信息时,仍可能受到内容质量参差不齐的问题影响。

系统可被操纵的担忧浮现

除了准确率与引用问题,研究援引的一项测试还显示,AI搜索摘要可能较容易受到“内容投毒”影响。报道称,一名BBC记者曾通过一篇刻意编造的虚假文章进行测试,结果在24小时内,谷歌AI摘要就将其中的错误信息当作事实呈现给用户。

这一案例引发的担忧在于,若有人熟悉AI搜索的抓取与呈现逻辑,理论上可能通过发布虚假内容、放大传播信号等方式影响AI摘要结果。对于加密货币市场来说,这种风险尤为敏感。加密行业本就高度依赖信息流、社交平台和新闻叙事,一旦AI搜索在代币项目、交易所上币、协议安全事件或监管消息上吸收了失真内容,就可能进一步放大市场波动,甚至影响散户决策。

谷歌回应:研究方法本身存在缺陷

面对这项研究,谷歌方面并未接受其全部结论。谷歌发言人表示,该研究“存在严重缺陷”,理由包括:SimpleQA测试集本身可能含有不准确信息;Oumi使用了自家AI模型HallOumi去评估另一套AI系统,可能引入额外误差;此外,测试内容未必能够真实代表用户的实际搜索行为。

谷歌还指出,内部测试显示,如果脱离搜索框架单独运行,Gemini 3出现错误输出的比例最高可达28%,但AI Overviews并非单独依赖模型作答,而是结合了谷歌搜索原有的排序和安全机制,因此整体表现优于模型裸跑状态。谷歌的核心立场是,外部报告可能高估了问题的严重性,且部分测试样本并不符合真实用户场景。

不过,外界批评认为,这种回应并未彻底打消疑虑。因为如果对研究的主要反驳之一是“用于评估的AI也可能不准确”,那么这实际上再次暴露出AI互相验证时的可信度难题。对于用户来说,问题的关键并不是谁的方法更完美,而是最终能否稳定获得可验证、可追溯的信息。

对加密市场意味着什么

尽管这项研究聚焦的是谷歌AI搜索本身,但其影响已超出通用搜索产品范畴。对加密行业而言,搜索引擎、AI摘要、社交媒体和资讯聚合平台,正在共同塑造市场认知。随着越来越多投资者借助AI工具快速了解项目背景、代币用途、链上事件和交易所动态,信息准确性正成为影响资产定价与情绪的重要变量。

短期看,这类研究可能强化市场对AI信息工具的审慎态度,特别是在高波动资产领域。中长期看,则可能推动平台加强引用透明度、来源分级和事实核验机制。对于用户来说,最现实的策略仍是将AI搜索视为“检索入口”而非“最终答案”,在面对涉及资金决策的信息时,尽量回到项目官方公告、交易所声明、链上数据平台及权威媒体进行交叉确认。

从行业发展角度看,生成式AI与加密信息生态的融合仍将持续,但这项研究提醒市场:在追求效率的同时,真实性与可验证性依然是最核心的基础设施。尤其当错误内容能够以极低摩擦传播时,谁能提供更可信的信息服务,谁就可能在下一阶段的流量与用户竞争中占据优势。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
200

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.