研究者 Davide Piffer 认为,AI 在数学上的表现持续变强,关键未必是推理更深,而可能只是它拥有一个人类无法比拟的巨大「笔记本」。在这套解释里,大模型看起来更聪明,实际上更接近于摆脱了人类工作记忆上限的约束,能同时摊开更多假设、中间算式、放弃过的路径和待验证条件。
人类做数学,往往先卡在记忆容量
Piffer 在一篇评论中指出,人类数学家的限制,很多时候并不先出在逻辑本身,而是一次能在脑中稳定保留多少个不熟悉对象。心算时常见的障碍,不是某一步操作太难,而是算到下一步时,还得同时记住上一轮得到的部分结果。
他据此解释,纸笔之所以能让人算得更快,不是因为它让人变得更聪明,而是把工作记忆外接出去。专业数学家也依赖符号系统、草稿纸和已经证明过的引理,把推理过程摊在纸面上,才有办法继续推进。
多篇研究被引为依据,工作记忆与智商并非同一件事
Piffer 引用了多篇心理学研究,说明工作记忆对数学表现的解释力,独立于智商之外。Alloway 与 Passolunghi 在 2011 年的研究发现,工作记忆对数学成绩有独立贡献;Alloway 与 Alloway 在 2010 年的一项 6 年追踪研究则显示,5 岁时的工作记忆表现,比智商测试更能预测后续学业成就。Blankenship(2015)与 Friso-van den Bos(2013)的研究也得出了类似结论。
按他的说法,两个智商相近的孩子,工作记忆更大的那一个,数学通常也会学得更好。由此再看 AI,线索就变得更清楚:人类数学能力本来就受制于记忆瓶颈,而一台拥有庞大符号工作空间的机器,相当于进入了另一套比赛规则。
上下文视窗像一本摊开的外部账本
Piffer 将上下文视窗(context window)比作一本巨大的外部笔记本。对语言模型来说,题目叙述、定义、中间算式、放弃过的解法,都可以同时留在其中,模型也能不断回头检视这些内容。
他也提醒,这和人类主动更新、替换脑中信息的工作记忆并不完全一样。语言模型一旦把字词写出来,内容几乎不能被覆写,只能继续往后累加。因此,更准确的说法也许不是传统意义上的工作记忆,而是增强型符号工作记忆。
这类能力在数学任务上特别占便宜,因为数学中的假设、定义、已知条件、证明目标和已经排除的情况,大多都能写成低歧义的符号。只要完整记录下来,它们的含义不会因为情绪或语境悄悄变化。
例如,一道题若要求同时记住「n 是奇数」「p 是质数」「x 不等于 0」,人类在推导中可能漏掉其中某个条件,甚至不小心出现除以 0 的错误;AI 则可以在每一步重新调用完整前提。对长推理链来说,难点也不只在于单步是否复杂,还在于要同时协调多少步。Piffer 认为,人们看到 AI「多想一会儿」后成绩变好,某种程度上可能只是它在更大的笔记本里做了更广的搜索,而不一定代表它想得更深。
他还提到,数学答案通常可以代回验证、交给程序运行,或者送进形式化证明器检查。换句话说,这套外部记忆不仅能存放信息,还能被即时纠错,减少错误一路堆积成团的风险。
问题一旦变模糊,超大记忆未必有帮助
不过,Piffer 并没有把这个结论扩大到所有领域。他提到,若换成一个不确定的问题,例如「某人为什么突然不回消息」,上下文视窗再大也没法直接补出缺失的信息。对方可能是在生气、在忙、手机坏了,或者在回避另一件事,但这些关键事实一开始就没有被观察和记录下来,记忆再大也无法凭空生成。
类似「公平」「成功」「有害」这样的词,本身也会随着情境改变含义。模型可以记住整段对话,却仍然可能误解这段对话到底在说什么。政治分析、历史解读和商业判断也面临相似处境:真正困难的部分,不是记不记得住,而是在证据不完整时,如何找出正确的因果解释。
AI 的优势被限定在可验证、依赖外部符号的任务里
Piffer 也承认,人类工作记忆不仅是存放信息,还包括注意力、抑制和持续更新等能力;相较之下,语言模型的上下文更被动,已经写出的内容也无法回头修改。因此,他把 AI 的优势限定在数学这类高度依赖外部符号、而且可以被验证的领域,而不是直接推出「AI 记忆力比人类好,所以什么都更强」。
他还提出一个可以实测的预测:AI 的优势,应该会在条件很多、计算链很长、需要分多种情况讨论的题目上最明显;如果题目只需要一次概念跃迁,这种优势会显著缩小。反过来说,若减少可用上下文,或禁止写出中间步骤,长篇数学题上的表现就可能不成比例地下滑。
冯·诺依曼式速度,不等于爱因斯坦式深度
在评论结尾,Piffer 借用了物理学家 Wigner 的观察。Wigner 认识冯·诺依曼和爱因斯坦,他形容冯·诺依曼拥有自己见过最快、最锐利的头脑,能迅速吸收大量信息并进行跨领域推导;但在他看来,爱因斯坦的理解更深,也更具原创性,能重新框定问题本身。
Piffer 认为,当下的 AI 更像是机器放大版的冯·诺依曼:速度快,记得多,但还不是那种能够推翻既有框架、重新定义问题的爱因斯坦式深度。

