GPT-6 Astra解出FrontierMath Tier 4最后一题,Epoch AI宣布该层级饱和
Epoch AI确认FrontierMath Tier 4全部43道题均已至少被AI成功解出一次,OpenAI公布的GPT-6 Astra成绩为97.6%;同一模型在新增的FrontierMath Erdős 68道题中只解出2道。
AI解读:FrontierMath Tier 4被宣布“饱和”了:按Epoch AI的统计口径,不是某个模型一次性拿到满分,而是把不同模型、不同时间的尝试累积起来后,Tier 4里每一道题都至少被AI成功解出过一次。OpenAI公布GPT-6 Astra在这层的成绩是97.6%,它补上的正是此前唯一没有被AI攻克的那道题。
这件事的参照系很关键。Tier 4在2025年7月11日推出时,榜上最高成绩只有约5%;该层级最初收录50道题,发布之初所有模型历次测试加起来也只有3道题曾被解出。2026年6月Epoch推出v2版本,Tier 4修正12道题、移除7道题,留下43题,随后GPT-5.6 Sol做到83.0%,Claude Fable 5达到90.2%,直到Astra的97.6%。
对做数学评测的人来说,这意味着Tier 4作为区分最强模型的标尺基本失效,需要换更难的题。但“饱和”不等于数学被AI解决了:FrontierMath已经把重心转向真正的开放问题,以及把Erdős开放问题形式化进Lean的FrontierMath Erdős。Astra在那68道题里只解出2道,说明下一道防线仍然立着。
Epoch AI在2026年9月确认,FrontierMath Tier 4已经饱和:把不同模型、不同时间的尝试累积起来后,该层级每一道题都至少被AI成功解出过一次。完成最后一块拼图的是OpenAI的GPT-6 Astra,它解出了此前唯一一道从未被AI攻破的题目。
OpenAI自己公布的Astra在Tier 4的成绩是97.6%,并非100%。按Epoch AI的“全部解出”口径,这也意味着Astra可能在某次测试中出错过,但它答对的那道题是此前没人解出来的。
Tier 4从5%到97.6%用了一年零两个月
FrontierMath最初在2024年11月7日发布,由Epoch AI联合60多位数学家设计,出题人包括陶哲轩、Timothy Gowers、Richard Borcherds等菲尔兹奖得主。核心题库共300道题,分Tier 1、Tier 2、Tier 3:Tier 1大致是高难度本科题和数学奥赛难度,允许使用更高级工具;Tier 2接近高年级研究生难度;Tier 3接近博士生早期的探索性研究问题。
2025年,Epoch又加上Tier 4,题目多由数学教授和博士后围绕自己的研究方向做数周短期研究,再把成果压缩成一道可自动验证的问题。Tier 4最初收录50道题,覆盖分析、数论、组合数学、拓扑、代数几何等方向。发布之初,所有模型历次测试加起来只有3道题曾被解出,而且这些解答还依赖了一些正确但没有被充分论证的假设。Epoch在官网公开样题页面一度写道,其中一些题可能几十年都不会被AI解决。
2025年7月11日Tier 4推出时,榜上最高成绩约为5%。到2026年9月,也就是一年零两个月后,Epoch宣布该层级饱和,最后一道难以被AI通过捷径绕道解决的问题被跨越。
出题人之一、马凯特大学数学副教授Jay Pantone表示,以往AI都会找数值捷径,而这一次,AI的解法和自己相当接近。他还表示,在GPT-6 Astra最近集中向数学界猛攻、三天两头解决千禧年难题的情况下,自己已经很难惊讶了。
v2修正12题、移除7题,剩余43题被刷穿
在模型变强的同时,题库本身也开始经不起AI“拷打”。OpenAI在测试过程中发现,FrontierMath里的错误比预期更多。Epoch随后启动独立审计,先用GPT-5.5和Claude Opus 4.7筛查疑点,再交给数学家逐题复核。
2026年6月,Epoch推出v2版本,其中Tier 4修正了12道题、移除了7道题,留下43题。修订之后模型成绩继续上升:GPT-5.6 Sol做到83.0%,Claude Fable 5达到90.2%,GPT-6 Astra来到97.6%,并补上了此前唯一一道从未被AI解出的题。
Tier 4饱和后,FrontierMath转向开放问题和Lean形式化
FrontierMath方面并不认为这意味着“数学已经被AI解决了”。目前整个项目除了Tiers 1-4,还增加了真正的Open Problems,以及把Erdős开放问题形式化进Lean的FrontierMath Erdős。前者直接拿尚未被数学界解决的研究问题考模型,后者要求AI写出能够通过形式化验证的完整证明。
在这条新防线上,Astra在FrontierMath Erdős的68道问题里只解决了2道。从Tier 4的97.6%到Erdős的2/68,这一对比说明当前饱和的范围仅限于Tier 4这一层题库,而非AI对研究级数学的全面覆盖。