一项由《纽约时报》与AI初创公司Oumi合作开展、并被MarsBit等平台引用的研究,再次把谷歌AI搜索功能的可靠性推上风口浪尖。研究聚焦谷歌搜索中的AI Overviews功能,并通过行业常用测试集SimpleQA评估其回答质量。结果显示,升级后的Gemini 3版本准确率约为91%,较此前Gemini 2时期约85%的水平有所改善。但在谷歌庞大的搜索规模之下,即便错误率仅为9%,其潜在影响依然不容忽视。
按搜索规模放大,错误答案数量惊人
报告指出,谷歌每年处理约5万亿次搜索请求。如果按91%的准确率计算,意味着约9%的AI回答可能存在问题。换算下来,AI Overviews理论上可能每小时生成超过5700万条不准确答案,接近每分钟100万条。这一数字之所以引发广泛关注,并非因为研究认定谷歌搜索整体不可用,而是因为当生成式AI被嵌入基础信息入口后,哪怕相对较低的错误率,在超大规模应用中也会放大成系统性风险。
对普通用户而言,AI搜索摘要往往以更高效率、更直接的方式给出结论,减少了点击原始网页的步骤。这提升了检索体验,但也意味着用户更可能直接接受系统输出。当错误答案以“总结”形式出现时,其误导性可能强于传统网页列表中的普通错误页面,因为用户通常会默认平台已经完成筛选与验证。
更棘手的问题:答案对了,来源却未必对
相比单纯的准确率争议,研究提出的另一项问题更值得警惕,即所谓“引用失锚”。Oumi发现,在Gemini 2阶段,约37%的正确答案存在“无依据引用”现象,也就是AI给出的链接并不能真正支持对应结论。到了Gemini 3阶段,这一比例不降反升,达到56%。
这意味着,即便系统表面上给出了正确结论,用户也不一定能够通过引用来源完成有效核验。换言之,AI搜索不只是“会不会答错”的问题,还包括“为什么这么答、证据是否成立”的问题。对于金融、医疗、法律以及加密资产等高风险领域,这类“看似正确但证据不足”的回答尤其值得警惕,因为用户可能据此做出交易、配置或风险判断。
研究还提到,AI Overviews对部分低质量来源的引用偏多,其中Facebook与Reddit在被引用来源中排名靠前。特别是在错误回答场景下,Facebook被引用的比例达到7%,高于准确回答中的5%。这说明,生成式搜索在整合开放网络信息时,仍可能受到内容质量参差不齐的问题影响。
系统可被操纵的担忧浮现
除了准确率与引用问题,研究援引的一项测试还显示,AI搜索摘要可能较容易受到“内容投毒”影响。报道称,一名BBC记者曾通过一篇刻意编造的虚假文章进行测试,结果在24小时内,谷歌AI摘要就将其中的错误信息当作事实呈现给用户。
这一案例引发的担忧在于,若有人熟悉AI搜索的抓取与呈现逻辑,理论上可能通过发布虚假内容、放大传播信号等方式影响AI摘要结果。对于加密货币市场来说,这种风险尤为敏感。加密行业本就高度依赖信息流、社交平台和新闻叙事,一旦AI搜索在代币项目、交易所上币、协议安全事件或监管消息上吸收了失真内容,就可能进一步放大市场波动,甚至影响散户决策。
谷歌回应:研究方法本身存在缺陷
面对这项研究,谷歌方面并未接受其全部结论。谷歌发言人表示,该研究“存在严重缺陷”,理由包括:SimpleQA测试集本身可能含有不准确信息;Oumi使用了自家AI模型HallOumi去评估另一套AI系统,可能引入额外误差;此外,测试内容未必能够真实代表用户的实际搜索行为。
谷歌还指出,内部测试显示,如果脱离搜索框架单独运行,Gemini 3出现错误输出的比例最高可达28%,但AI Overviews并非单独依赖模型作答,而是结合了谷歌搜索原有的排序和安全机制,因此整体表现优于模型裸跑状态。谷歌的核心立场是,外部报告可能高估了问题的严重性,且部分测试样本并不符合真实用户场景。
不过,外界批评认为,这种回应并未彻底打消疑虑。因为如果对研究的主要反驳之一是“用于评估的AI也可能不准确”,那么这实际上再次暴露出AI互相验证时的可信度难题。对于用户来说,问题的关键并不是谁的方法更完美,而是最终能否稳定获得可验证、可追溯的信息。
对加密市场意味着什么
尽管这项研究聚焦的是谷歌AI搜索本身,但其影响已超出通用搜索产品范畴。对加密行业而言,搜索引擎、AI摘要、社交媒体和资讯聚合平台,正在共同塑造市场认知。随着越来越多投资者借助AI工具快速了解项目背景、代币用途、链上事件和交易所动态,信息准确性正成为影响资产定价与情绪的重要变量。
短期看,这类研究可能强化市场对AI信息工具的审慎态度,特别是在高波动资产领域。中长期看,则可能推动平台加强引用透明度、来源分级和事实核验机制。对于用户来说,最现实的策略仍是将AI搜索视为“检索入口”而非“最终答案”,在面对涉及资金决策的信息时,尽量回到项目官方公告、交易所声明、链上数据平台及权威媒体进行交叉确认。
从行业发展角度看,生成式AI与加密信息生态的融合仍将持续,但这项研究提醒市场:在追求效率的同时,真实性与可验证性依然是最核心的基础设施。尤其当错误内容能够以极低摩擦传播时,谁能提供更可信的信息服务,谁就可能在下一阶段的流量与用户竞争中占据优势。

