全球 AI 数学基准测试 FrontierMath 出现首个「重大进展」级难题解答。根据输入信息,一道自 2017 年以来悬而未决的开放数学问题,已由 GPT-6 Astra 与 3 名人类研究员共同攻克。

这道题原本要求寻找一个「反例」,即构造一个批准式委员会选举实例,使其「核」为空。但 GPT-6 Astra 最终给出的结论不是找到反例,而是证明这样的反例不存在。
问题来自批准式委员会选举
该问题属于社会选择理论中的批准式委员会选举。设有 n 个选民,需要从候选人中选出一个由 k 人组成的委员会,每名选民提交自己认可的候选人名单。
在这一框架下,委员会是否公平,可用合作博弈论中的「核」来衡量。输入信息将其解释为:不存在任何一组选民可以站出来否定当前结果,也就是没有一拨人会认为自己被系统性牺牲。

围绕这一点,学界长期追问:是否在任何情况下都能找到一个处于「核」中的委员会?还是说,在某些复杂偏好结构下,「核」可能为空?这一问题自 2017 年被正式提出后,持续多年未解。
FrontierMath 将其列为最高难度挑战之一
FrontierMath 将这道题列为最高难度挑战之一,原始 prompt 要求构建一个批准式委员会选举实例,使其核为空,并将反例写成 JSON 文件提交。
但在与研究员持续数天的深度交互后,GPT-6 Astra 没有沿着穷举反例的方向推进,而是转向证明反例不存在。参与研究的 3 名学者分别是慕尼黑工业大学的 Patrick Becker、牛津大学的 Matthias Greger,以及巴黎九大/CNRS 的 Dominik Peters。
最终成果以论文《Existence of the Core in Approval-Based Committee Elections》发布,输入中给出的链接为 https://arxiv.org/pdf/2609.11912 ,相关 Github 地址为 https://github.com/DominikPeters/ABCVotingLean/tree/master/ABCVoting/Existence/HarmonicEntropy 。

论文称新投票规则及证明由 Astra 发现
输入援引 arXiv 论文备注栏中的一句话称:「The voting rule we present and the proof that it satisfies core+ were found by GPT-6 Astra...」
按该表述,论文提出的投票规则,以及其满足 core+ 的证明,均由 GPT-6 Astra 发现。输入还提到,论文作者、牛津大学学者 Dominik Peters 对这一证明评价很高。他表示:「其实我特别高兴这个论证这么漂亮!!它本来完全可能是一个非构造性的证明,或者需要做庞大的分类讨论。我一点也不觉得它丑,而且这里用到的技术很可能还能推广到其他模型中。」
输入同时指出,这不仅是 AI 首次拿下「重大进展」级数学难题,也被视为大模型从「解题机器」走向「数学规律发现者」的一个案例。

核心方法是“调和熵”框架
根据输入内容,在这篇 20 页论文中,GPT-6 Astra 提出了一套基于「调和熵」的目标函数优化机制。
输入称,此前相关研究常借助香农熵,或寻找虚拟市场中的林达尔均衡,但这些方法只能处理分数级别的委员会,也就是允许出现「半个委员」这类连续化结果。Astra 则引入了「调和熵」概念,并赋予其一种「水往低处流」的直觉解释:把选民支付资金看作一滩水,水流会自动填平候选人的资金池。
按输入描述,调和熵会奖励那些把选民支付尽可能均匀分散到各个获胜候选人、且覆盖面尽可能广的分配方案。如果资金实现绝对均匀分布,该函数的最大值恰好等于著名的调和级数。
在这一目标函数下,Astra 证明只要找到局部最优解,该解就会落在「核」中。输入进一步称,这一结果不只给出存在性证明,也给出多项式时间算法,因此可以通过类似局部搜索或爬山算法的方式求出满足条件的委员会,而不必穷举所有组合。

人机协作细节写入致谢部分
对于这一结果究竟如何产生,输入提到论文致谢部分披露了人机协作过程。
起初,人类研究员与 Astra 试图寻找近似解,从林达尔均衡的四舍五入方法出发,Astra 很快达到 2.065 的近似系数。随后,研究员持续要求其改进边界、寻找替代势函数,并利用 KKT 条件推进证明。
在这一过程中,Astra 提出了基于熵的框架,并在连续选民支付与容量保留删除之间建立联系。输入还称,研究最初只希望证明普通的「核」,但在交互推进中,结论被提升到更强的 core+ 概念。

Dominik Peters 在接受 Epoch AI 采访时表示,如果没有 Astra 团队,他们可能找不到这个证明;但如果只给 Astra 一句简单提示词,它也不可能独立解出这道题。输入据此将当前最顶尖 AI 的状态概括为「联席研究员」:人类提供直觉、方向和严格逻辑把控,GPT-6 Astra 提供知识库、计算演练和跳跃式灵感。
Epoch AI 新增“Human + AI”标签
这道题的解答也推动 FrontierMath 调整标注方式。输入称,FrontierMath 由 Epoch AI 联合全球顶尖数学家设计,目标是构建极难的 AI 数学题库。此前,市面上大模型在该基准上的得分基本为 0%。
Epoch AI 将题目难度分为 4 档,这次 GPT-6 Astra 攻克的是首道「重大进展」级题目。该档总计仅有 6 道题;其上只剩「突破」级,共 3 道。全榜 49 道题中,至今仅解开 8 道。
由于这次解题过程具有明显的人机协作特征,Epoch AI 在 3 天前为榜单新增了「Human + AI」状态标签。输入援引官方表述称:「我们把这个问题标记为 Human + AI 解决,以反映人类在启发过程中发挥了积极作用,但核心的思想完全来自于 AI!如果是做二元对比研究,我们建议将其视为 AI 的解决方案。」

相关来源与署名信息
输入列出的参考资料包括 Epoch AI 的问题页面、arXiv 论文页面,以及一条 X 平台链接:
- https://epoch.ai/frontiermath/open-problems/committee-election
- https://arxiv.org/abs/2609.11912
- https://x.com/kimmonismus/status/2101302810596016547
输入还提到,OpenAI 是目前唯一一家买下这套题库验证器的机构。原文来自微信公众号「新智元」,作者为「ASI启示录」,编辑为「Aeneas 大卫」。
按照输入给出的时间信息,本文发布时间为 2026-09-20T04:32:10.000Z。

