研究称谷歌AI搜索准确率91%,仍每小时或产逾5700万条错误答案

研究称谷歌AI搜索准确率91%,仍每小时或产逾5700万条错误答案

N
News Editor 01
2026-07-08 02:13:22
最新研究显示,谷歌AI Overviews准确率约为91%,但按谷歌年搜索量5万亿次推算,仍可能每小时生成逾5700万条错误答案。更受关注的是,超过一半正确回答的引用来源无法支撑结论。

一项由《纽约时报》联合AI初创公司Oumi开展、并被业内广泛引用的测试显示,谷歌搜索中的AI Overviews功能准确率约为91%。这一数字表面上看并不低,但若放到谷歌庞大的搜索体量中审视,问题就变得严峻:按照谷歌每年约5万亿次搜索量计算,约9%的误差率意味着该功能可能每小时生成超过5700万条不准确答案。

这项研究迅速引发市场对AI搜索可靠性的讨论。对于加密货币、金融投资及链上信息查询等高度依赖实时性和准确性的领域而言,AI给出“看似权威、实则错误”的结论,可能放大用户误判风险,并进一步影响市场情绪与信息传播链条。

测试如何进行:Gemini升级后准确率提升

根据报道,Oumi使用了由OpenAI开发的行业标准测试集SimpleQA,对谷歌AI Overviews进行了4326个搜索查询的评估。测试分为两轮:一轮在去年10月进行,当时系统基于Gemini 2;另一轮在今年2月进行,彼时已升级至Gemini 3

结果显示,Gemini 2阶段的准确率约为85%,升级到Gemini 3后提升至91%。从模型迭代角度看,这是明显进步,也说明谷歌正在通过大模型更新改善回答质量。不过,研究指出,单看百分比并不能完整反映风险,因为当搜索请求规模达到全球互联网级别后,即便较小的误差比例,也会转化为极大的错误信息产出。

更棘手的问题:答案正确,来源却未必正确

相比“回答错误”本身,研究认为更令人担忧的是引用来源与结论之间的脱钩。Oumi数据显示,在Gemini 2时期,约37%的正确答案存在“无依据引用”,即AI给出的链接并不能真正支撑其结论;而在升级至Gemini 3后,这一比例不降反升至56%

换言之,系统在“答对”问题方面有所提升,但在“证明自己为什么答对”这件事上,反而变得更弱。对于普通用户而言,这意味着即使得到正确答案,也未必能通过引用链接完成有效核验。Oumi首席执行官Manos Koukoumidis提出的核心问题正是:即便答案是对的,用户又该如何确认它确实是对的?

研究还指出,AI Overviews对部分低质量来源的引用占比较高,其中Facebook和Reddit分别是被引用频率第二和第四高的平台。在不准确回答中,Facebook的引用比例达到7%,高于准确回答中的5%。这进一步加剧了外界对AI搜索“证据链质量”的担忧。

24小时内被“投毒”?AI搜索抗操纵能力受质疑

报道还提及一项更具冲击力的案例:一名BBC记者曾发布一篇刻意编造的虚假文章,结果在24小时内,谷歌AI摘要便将其中错误信息当作事实呈现给用户。这说明,若有人熟悉系统抓取和排序逻辑,理论上可能通过发布虚假内容并提升其流量,影响AI搜索结果。

对于加密市场来说,这一风险格外敏感。当前大量用户会通过搜索引擎快速查询代币项目背景、交易所上新、链上协议机制、团队信息或监管动态。如果AI摘要被恶意内容“污染”,就可能在短时间内扩大错误叙事的传播半径,进而影响市场交易决策。尤其是在新币上线、空投传闻、项目安全事件等高波动场景中,错误信息的传播速度往往与价格波动相互放大。

谷歌回应:研究方法存在缺陷

面对这项研究,谷歌方面并未接受其全部结论。谷歌发言人表示,该研究存在“严重缺陷”,理由包括:SimpleQA基准本身可能含有不准确信息;Oumi使用自家AI模型HallOumi来评估另一套AI系统,可能引入额外误差;同时,测试内容也未必反映真实用户的搜索习惯。

谷歌还指出,其内部测试显示,Gemini 3如果脱离谷歌搜索框架独立运行,错误输出比例最高可达28%。谷歌借此强调,AI Overviews并非单纯依赖模型生成,而是叠加了搜索排序与安全机制,因此整体表现优于模型裸奔状态。对于BBC案例及相关质疑,谷歌发言人Ned Adriance则表示,多数测试示例属于用户现实中不太会发起的“非典型查询”。

不过,外界批评认为,这种回应并未完全打消疑虑。因为如果对研究的反驳仍建立在“评估AI也可能不准确”的前提上,反而会进一步强化公众对AI系统整体可信度的担忧。

市场影响:AI入口价值上升,信息验证将成竞争焦点

从行业视角看,这项研究再次说明,AI搜索正在从“辅助工具”演变为互联网流量与信息分发的重要入口,而其可靠性问题也将直接影响用户行为、广告价值以及内容平台生态。对加密行业而言,AI搜索若不能稳定提供可验证、高质量的来源,市场参与者未来可能更加重视多源交叉验证,包括直接查看项目官网、链上浏览器、权威媒体及交易平台公告。

同时,这一事件也可能推动搜索平台、AI模型公司与内容分发渠道进一步强化来源标注、事实核验和抗操纵机制。随着AI工具越来越深度介入资讯获取过程,谁能解决“答案准确”与“证据可信”之间的鸿沟,谁就更可能在下一阶段的信息入口竞争中占据优势。

总体而言,91%的准确率并不意味着风险已经可忽略。相反,在超大规模搜索场景下,剩余误差及引用失真问题仍可能制造海量错误认知。对于依赖高质量信息进行决策的加密市场参与者来说,AI生成摘要可以作为线索,但尚不足以替代独立验证与原始来源审查。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。