GPT-6 Astra 刚刚发布,OpenAI 很快拿出了第一个科研成果。

宾夕法尼亚大学统计学教授、北大 07 级校友苏炜杰在 X 上表示,他亲眼看着这个模型把一个他崇敬了二十多年的数学问题又往前推了一步。这个问题就是孪生素数猜想。苏炜杰说,自己 9 岁时第一次听说它,后来张益唐的故事也一直留在他的记忆里。面对这次进展,他感叹这是「真正超现实的一夜」。
OpenAI 联合创始人 Greg Brockman 在发布时说了一句「欢迎来到 AGI 时代」。原本不少人把这当成发布会上的一句口号,但当天 X 上大量试玩和演示流出后,这句表态迅速成为讨论焦点。
论文聚焦孪生素数猜想方向的新进展
OpenAI 当天发布了一篇数学论文,题为《Improved Short Gaps Between Primes》。
论文称,GPT-6 Astra 在孪生素数猜想相关方向上取得了新进展,用 Lean 形式化证明把连续素数间距的上界从 246 推进到 186。论文摘要最后一句直接把这项证明归功于 GPT-6 Astra。

孪生素数猜想是数论中最著名的未解问题之一,核心表述是:是否存在无穷多对差值为 2 的素数,例如 (11, 13)、(17, 19)、(29, 31)。这个猜想至今没有被证明,但数学界持续在缩小连续素数之间的已知上界。
这条路径上的关键节点,论文和相关讨论都做了回顾:
- 2013 年,张益唐证明存在无穷多对间距不超过 7000 万的连续素数。
- 随后,Polymath 8a 项目将这一上界从 7000 万降至 4680。
- 再之后,James Maynard 和陶哲轩分别独立提出多维 Selberg 筛法,把上界推进到 600 以下。
- Polymath 8b 继续优化,最终把数字停在 246。
246 这个结果已维持多年,而 Astra 把它进一步降到了 186。
突破口落在三重稠密整除性的利用上
按照论文给出的思路,在研究素数间隔问题时,数学家需要构造一种 Selberg 筛工具来「筛」出素数。筛的效果取决于支撑集的大小,支撑集越大,筛法通常越有效;而支撑集又依赖于对模的素数分布估计能推进到什么程度。

此前 Polymath 8b 的做法已经用到了单重和双重稠密整除性的模。论文指出,三重稠密整除性这个方向虽然更早就被提出,但一直没有被真正利用起来。原因很直接:相关积分的计算量过大,在 k 接近 50 时,几乎无法处理。
Astra 给出的突破口,是一组互补的因式分解条件。对于两个无平方因子的整除积 D 和 E,Astra 发现:如果 D 的大质因子部分和 E 的大质因子部分分别满足特定大小约束,那么它们的最小公倍数 [D, E] 就会自动满足三重稠密整除性。
论文强调,这个条件的关键不在于要求 D 和 E 都是 Y-光滑的,也就是不要求所有质因子都小于 Y;只要满足这种互补的因式分解关系即可。这样一来,筛法能使用更大的支撑集,纳入计算的模也随之增加。
在这个框架下,论文构造了一个包含 40 个元素、覆盖从 0 到 186 的容许元组,并证明这个元组存在无穷多个平移,其中至少含有 2 个素数。换一种说法,就是存在无穷多对间距不超过 186 的连续素数。

OpenAI 还用 Lean 4 写出了完整的形式化证明,并将代码放在 GitHub 仓库中。同时,团队附上了一个 Python-FLINT 验证程序,用于独立核验所有数值边界。
数学家对 Astra 的评价迅速升温
数学家 Bartosz Naskręcki 也发布了长帖,分享他测试 Astra 做数学的感受。他给出的评价是「量子级别的飞跃」。
按他的说法,现在可以一边和模型对话,一边在 Lean 中实时完成命题证明。过去,形式化验证往往是最拖慢节奏的一步;而 Astra 的速度已经接近「边写论证边验证」,两者几乎同步。
他还给出了一段很有代表性的描述:过去判断一个证明对不对,常常靠的是那一瞬间的「aha」和研究者的直觉;现在,「aha」后面多了一个绿色对勾,告诉你抓到的东西确实成立。他说,自己不想再回到那个只有「aha」的时代。

3D 建模演示成为另一条高热度主线
科研之外,3D 生成是当天另一块讨论量很高的内容。
Tom Krcha 上传了一张别墅照片,要求 Astra 在 Blender 中重建一个完整 3D 模型,包括家具、玩具、电器以及泳池边的充气圈等细节。根据他的展示,生成结果不仅还原完整,还能手动调整几何体,并且可在本地以 60fps 运行。他的结论是,现在每个人手边都多了一个 3D 设计师。
Matt Shumer 的演示更偏向大场景。他表示,自己用 Astra 在虚幻引擎 5 中花了一周时间搭出了一座曼哈顿,且是按街区逐条打磨,每条街都做到位。
Pietro Schirano 也拿到了早期体验资格。他给 Astra 输入一张实体键盘照片,模型随后生成了对应的 3D 模型和动画代码。他形容,这个结果会「彻底粉碎你对可能性的认知」。

Ethan Mollick 同样提到,Astra 已经好到可以连续几天自主处理复杂、严肃的任务。他给模型的一个项目,是亚历山大图书馆的历史模拟:基于真实历史做建筑还原,配有音频导览,用户可以在其中行走,还能在英语和希腊语之间切换。按他的说法,这类考古可视化项目,Astra 可以独立完成。
Codex 接入 Astra,并加入可搜索笔记
OpenAI 还同步宣布,Codex 0.153.1 将支持 GPT-6 Astra。
相比模型替换,这次更新中更受关注的是「可搜索笔记」功能。此前,Codex 处理长上下文的办法主要是压缩摘要:上下文变长后,把前面的内容压缩一下再继续。但压缩会带来信息损失,很多前文细节在多轮处理后会被抹掉。
新版本改成支持跨上下文窗口的可搜索笔记。Astra 不再依赖把内容硬塞进上下文,也不完全靠摘要压缩,而是会主动把重要信息记成笔记,在后续需要时再检索调用。按照原文的描述,这种方法比单纯压缩更自然,也更接近给 agent 增加了一套外挂记忆。
Schmidhuber 再次现身评论底层思路
在 GPT-6 Astra 发布后,LSTM 之父 Jürgen Schmidhuber 也在 X 上发文回应。
他说,Astra 使用的「recurrent depth」技术,本质上就是他 2015 年论文第 5.3 节里的内容,并附上了自己论文的链接。
原文提到,几乎每次 AI 领域有新成果发布,Schmidhuber 都会站出来表示相关思路自己多年前就已提出。这次也不例外。

