GPT-6 Astra 刚刚解出了 FrontierMath Tier 4 中此前唯一一道还没有被 AI 攻破的题目。至此,这套一度被视为大模型数学“高墙”的研究级测试,Tier 4 里的所有题目都已经至少被 AI 成功解出过一次。

Epoch AI 也据此给出结论:FrontierMath Tier 4 已经“饱和”。
从公开数据看,Astra 并没有在单次成绩上直接达到 100%。OpenAI 公布的 Tier 4 成绩是 97.6%。不过按照 Epoch 的统计方法,“全部解出”并不是指某一个模型在某一次测试里拿到满分,而是把不同模型、不同时间的尝试累积计算后,Tier 4 中每一道题都已经出现过至少一次成功解答。
Astra 补上的,正是此前那道唯一还未被 AI 解出的题。也就是说,即便 Astra 在某次测试里仍可能出错,但它解对的这道题,刚好填上了 Tier 4 最后一块空白。

这一进展来得很快。2025 年 7 月 11 日,Tier 4 刚推出时,榜单最高成绩只有约 5%。到现在仅过去一年零 2 个月,这道曾经专门为最强模型设置的“高墙”,已经被跨了过去。
出题人之一、马凯特大学数学副教授 Jay Pantone 表示,以往 AI 往往会寻找数值上的捷径,但这一次,AI 的解法和自己的思路相当接近。不过他也提到,最近 GPT-6 Astra 持续在数学问题上取得进展,自己已经很难再感到惊讶。
FrontierMath 最初就是为拉开模型差距而设计
FrontierMath 于 2024 年 11 月 7 日首次发布。它的设计目标,就是避免数学基准测试过快被 AI 刷穿。

当时,GSM8K、MATH 等传统数学 Benchmark 已越来越难拉开头部模型差距。为此,Epoch AI 联合 60 多位数学家,重新设计了一批此前从未公开过的原创题目。参与者中包括陶哲轩、Timothy Gowers、Richard Borcherds 等菲尔兹奖得主。
陶哲轩在看过其中一些研究级题目后曾表示,这些题“极其困难”,并判断最难的 Tier 3 可能还能让 AI 卡上几年。第一轮测试结果也和这种判断相符:当时领先模型的正确率还不到 2%。
在最初版本中,FrontierMath 的核心题库共有 300 道题,按难度分为 Tier 1、Tier 2 和 Tier 3。

- Tier 1 大致接近高难度本科题和数学奥赛题,但允许使用更高级工具;
- Tier 2 对应高年级研究生难度;
- Tier 3 更接近博士生早期会遇到的探索性研究问题。
推理模型出现后,Epoch AI 在 2025 年新增 Tier 4
随着推理模型出现,前三级题库开始显得不再够用。于是到了 2025 年,Epoch AI 又在上方增加了一层 Tier 4。
Tier 4 的题目大多由数学教授和博士后设计。每位出题者会围绕自己的研究方向,进行数周左右的短期研究,再把研究结果压缩成一道可以自动验证的问题。
Tier 4 最初收录 50 道题,覆盖分析、数论、组合数学、拓扑、代数几何等方向。
刚发布时,把所有模型历次测试结果合并计算,也只有 3 道题曾被解出,而且这些解答还依赖一些正确、但没有被充分论证的假设。基于这一情况,Epoch 当时甚至在官网公开样题页写道,其中一些题目可能几十年都不会被 AI 解决。

题库修订后,Tier 4 仍被快速推进到“饱和”
不过模型持续变强后,题库本身的问题也暴露出来。OpenAI 在测试过程中发现,FrontierMath 中的错误比预期更多。
随后,Epoch AI 启动独立审计,先用 GPT-5.5 和 Claude Opus 4.7 筛查可疑题目,再交给数学家逐题复核。最终在 2026 年 6 月推出 v2 版本,其中 Tier 4 修正了 12 道题、移除了 7 道题,保留下来 43 道。
即便经过修订,模型成绩仍继续上升。GPT-5.6 Sol 在 Tier 4 上达到 83.0%,Claude Fable 5 达到 90.2%,GPT-6 Astra 则来到 97.6%。

更关键的是,Astra 解出了此前唯一一道从未被 AI 解出的题。按 Epoch 的累计标准,Tier 4 修订后的 43 道题,如今都已经至少被 AI 成功解出过一次。这个专门为最强模型加上的研究级防线,也被刷穿了。
FrontierMath 已转向更高难度任务
Tier 4 被攻破,并不等于“数学已经被 AI 解决”。按照项目当前方向,FrontierMath 已经开始走向下一阶段。
现在,整个项目除了 Tiers 1-4,还加入了真正的 Open Problems,以及将 Erdős 开放问题形式化进 Lean 的 FrontierMath Erdős。

前者直接用数学界尚未解决的研究问题测试模型;后者要求 AI 写出能够通过形式化验证的完整证明。
在这项新测试里,Astra 在 FrontierMath Erdős 的 68 道问题中只解决了 2 道,说明更高强度的评测门槛已经被摆上台面。
本文来自微信公众号“量子位”,作者为 henry。

