谷歌研究称 GPT-5 与 Gemini 3 存在“舌尖现象”

谷歌研究称 GPT-5 与 Gemini 3 存在“舌尖现象”

N
News Editor
2026-08-14 07:41:09
谷歌研究发现,GPT-5 和 Gemini 3 等模型对 95%–98% 的测试事实已完成参数存储,但在直接问答中仍有 26%–34% 的事实无法取出,即使开启 thinking 后仍有 11%–12% 无法回忆。研究基于新基准 WikiProfile,对 13 个模型累计生成约 450 万条回答。结果显示,前沿模型事实错误的主要瓶颈已从“没学到”转向“取不出”,冷门知识和反向提问是最明显的卡点。

谷歌一项最新研究显示,GPT-5、Gemini 3 等大模型并不只是存在“没学会”的问题,更多时候是“学过了但答不出来”。研究将这种现象类比为人类的“舌尖现象”,也就是信息明明像在嘴边,却一时无法回忆出来。

这篇题为《Empty Shelves or Lost Keys?》的论文被收录于 ICML 2026。8 月 12 日,Google Research 在博客中集中介绍了研究结果,并同步公开了一套名为 WikiProfile 的基准与完整数据集。

“货架没空,钥匙丢了”

研究把模型答错事实题的原因拆成两类:一类是压根没有学进去,另一类是已经存入参数,但在提问时无法顺利调出。谷歌认为,过去这两类问题常被一起归入“准确率不足”,但它们对应的改进路径并不相同。

为此,研究提出了“知识画像”框架,不再只看一道题答对还是答错,而是判断一条事实在模型记忆中的具体状态。论文把事实划分为五种状态:存入失败、回忆失败、直接回忆、借助 thinking 回忆、未存入却靠推理答对。

在这个框架下,同样一个错误答案,可能对应完全不同的内部状态,后续修正方法也会不同。

WikiProfile 如何测试“有没有记住”

为了区分“存进去了”与“现场推出来了”,研究设计了两类测试。第一类是把维基百科原文截断到答案出现前,让模型续写;或者在同样上下文后面直接发问,以此判断事实是否已经写入参数。第二类则通过换措辞、切换正反方向、反复提问,测试模型能不能把答案取出来。

谷歌研究称 GPT-5 与 Gemini 3 存在“舌尖现象” 3

这部分测试不允许开启 thinking,目的就是把“记住”与“推理”分开测量。

WikiProfile 一共包含 2150 条事实,全部来自英文维基百科。每条事实配 10 道题,其中 2 道测是否存入,4 道要求模型自主作答,4 道是给出选项的识别题,总计 21500 道题。

题目生成由 Gemini-2.5-Pro 完成,之后再由 Google 搜索逐题验证。若答案不唯一或题目存在歧义,整条事实会被丢弃。最后研究团队又做了一轮人工复核,再删去不到 2%。

参与测试的共有 13 个模型,覆盖 Gemini 3、GPT-5、GPT-4.1 和 Gemma 3 四个家族。每个模型都在开启和关闭 thinking 两种模式下分别测试,每道题采样 8 次,总计获得约 450 万条回答。论文称,完整评测一个前沿模型,成本大约为 500 美元。

95%–98% 已存入,但仍有 26%–34% 答不出

研究给出的核心结论是,前沿模型已将 95%–98% 的测试事实存入参数,但在直接问答时,仍有 26%–34% 的事实无法回答。即便开启 thinking,多想一会儿后,仍有 11%–12% 的事实不能回忆出来。

谷歌研究称 GPT-5 与 Gemini 3 存在“舌尖现象” 4

这意味着,至少在这套基准上,事实错误的主要来源已不再是“模型没见过”,而是“模型取不出来”。

冷门知识更容易“卡住”

论文指出,第一个明显瓶颈出现在冷门知识上。以往常见解释是模型容量不够,导致长尾事实根本没有学进去;但这次数据呈现出不同结果:冷门知识多数已经存进去了,问题出在提取阶段。

以 Gemini-3-Pro 为例,模型对冷门事实的存入率为 94.5%,热门事实为 99.5%,只差 5 个百分点;但进入直接回忆环节后,冷门事实正确率降至 63.3%,热门事实仍有 84.7%,差距扩大到 21 个百分点。

换句话说,存的时候几乎没差,取的时候差距被明显拉开。

GPT-5 的落差更大。论文数据显示,GPT-5 对冷门事实的存入率为 90.7%,热门事实为 98.4%;但在实际作答时,冷门事实只剩 52.9%,热门事实还有 77.8%。

研究据此认为,长尾问题的关键并不只是“模型没见过冷门事实”,而是这些知识即便已经被存入,也更难在提问时被唤起。

谷歌研究称 GPT-5 与 Gemini 3 存在“舌尖现象” 5

反向提问仍是大模型弱点,但问题不在“没学到”

第二个高频卡点出现在反向提问。论文举例称,模型通常能较快回答“汤姆·克鲁斯的妈妈是谁”,但若反过来问“这位女士的儿子是谁”,就更容易失误。

2023 年已有论文把这一现象称为“反转诅咒”,当时一种解释是:模型学会了“A 是 B”,却没有把“B 是 A”的双向关联一并学进去。

谷歌这次把同一批题目改成四选一识别题后,结果出现变化。GPT-5 在正向问答中的回忆率为 82.9%,反向提问降到 74%。但切换到给出选项的识别题后,反向题并不比正向更难;13 个模型中有 9 个在反向识别题上表现更好,另外 4 个持平。

也就是说,模型在选择题里能认出答案,但在闭卷生成时却说不出来。论文据此判断,相关关联关系本身大概率已经存在,真正卡住的是如何把这层关系从参数中挖出来。

作者给出的解释是,事实在存入参数时,连同当时的语境、措辞和顺序也被一并保留下来;一旦提问方式偏离训练时的表达,检索难度就会明显上升。

谷歌研究称 GPT-5 与 Gemini 3 存在“舌尖现象” 6

thinking 不只是推理,也在帮模型回忆

WikiProfile 中的问题多为一句问一句答,并不要求复杂推理。按常理看,像“Oasis 第一场演出在哪个俱乐部”这类问题,要么记得,要么不记得,thinking 理应帮助有限。

但论文发现,thinking 的确能把一部分“已经存入但一时答不出”的事实重新捞回来。对这类事实,thinking 的找回比例达到 40%–65%;而对那些压根没有存入参数的事实,thinking 只能找回 5%–15%。

研究据此认为,thinking 在很多情况下并不是借助外部知识重新推导,而更像是在原有参数记忆中搜索“丢掉的钥匙”。

作者还排除了另一种更简单的解释:如果 thinking 只是让模型输出更长、因而增加了 8 次采样里“蒙对一次”的概率,那么答案分布理应更分散。但实验结果相反,开启 thinking 后,同一道题在 8 次采样中的正确次数反而更集中。

收益最大的地方,正是前面最堵的两个场景。Gemini-3-Pro 的冷门与热门事实差距从 21.4 个百分点缩小到 12.5 个百分点;GPT-5 在正向与反向提问间的差距,则从 9 个百分点缩小到 2 个百分点。

谷歌另一篇姊妹论文《Thinking to Recall》给出两个机制解释:一是计算缓冲,即思考过程中产生的 token 即便内容本身意义有限,也给模型提供了额外的隐式算力;二是事实启动,模型先激活一批相关事实,为最终答案搭起一条语义路径。这一过程被类比为人类认知中的“扩散激活”。

谷歌研究称 GPT-5 与 Gemini 3 存在“舌尖现象” 7

不过论文也提醒,这种方式有代价。如果思维链中的中间事实本身就是错误或虚构的,最终答案出现幻觉的概率反而会上升。

扩参数更像“补货”,未必能解决“配钥匙”

研究还以开源 Gemma 3 家族为参照,观察模型规模扩大后的变化。随着参数量从 1B 增加到 27B,编码失败率从 85% 降到 23%。这说明扩大规模确实能够提高事实存入率。

但回忆失败并没有同步下降。相反,在剩余错误中的占比一路上升,到 27B 时已成为主要错误来源。

放到前沿模型上,这个趋势更明显。论文称,回忆失败占 GPT-5.2 全部错误的七成以上,而且模型越强,这个比例越高。对 13 个模型的整体比较也显示,随着参数变大,编码失败一路收缩,回忆失败基本不动。

研究据此给出的判断是:扩规模主要改善“存了多少”,未必改善“取得出多少”。在 95%–98% 的参数事实存入率已经接近天花板的情况下,继续增加参数和数据,带来的准确率提升会越来越有限。

谷歌研究称 GPT-5 与 Gemini 3 存在“舌尖现象” 8

论文同时提到,检索增强可以作为补位手段,但参数内部知识仍关系到流畅度、响应速度与跨语境整合能力,难以被外部检索完全替代。

下一步是让模型先意识到“我想不起来”

研究最后把问题推进到“元认知”层面:模型需要先判断自己当前是“直接能答”还是“想不起来”,才能知道这道题是否值得开启 thinking。

过去两年,提升模型可靠性的常见路径是喂更多数据、扩大参数规模。谷歌这项研究给出的新结论是,在事实层面,前沿模型的“货架”已经装得差不多,接下来更关键的是如何把已经存进去的知识顺利取出来。

而更难的一步,是让模型先知道自己并不是“不会”,而是“想不起来”。

参考资料包括 Google Research 博客《Empty Shelves or Lost Keys? Recall is the Bottleneck for Parametric Factuality》以及 aihot.virxact.com 的相关内容。原文来自微信公众号“新智元”,作者为 ASI 启示录。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
140

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。