研究The Decoder AI·原文 2026年9月10日本站收录 2026年9月11日

OpenAI的GPT-6 Astra登顶ErdosBench数学基准,首席科学家称数学并非优化重点

在ulam.ai的ErdosBench上,GPT-6 Astra以 3.23 分、解出 106 道题的成绩一度排名第一;OpenAI首席科学家Jakub Pachocki在文章中表示,公司本可以让模型在数学研究上更强,但出于对递归自我改进和自动化对齐研究的紧迫感,没有把数学作为优先方向。

AI解读:ErdosBench覆盖 226 道受Erdős问题启发的开放数学题。GPT-6 Astra以 3.23 分解出 106 道,其中 43 道完全解出,还证伪了 27 道;对比之下,Sol在最大推理强度下解出 78 道。

基准开发者Przemek Chojecki称这是“在多项数学研究技能上约 5% 到 10% 的提升”,并指出基准远未饱和。Astra随后被Fable 5.1以 3.25 分超过,但Astra解出的题目总数仍最多。

OpenAI首席科学家Jakub Pachocki在文章《An Alien Mind》中写道,公司相信可以通过额外投入让模型在数学研究上更强,但不优先这个方向,因为对递归自我改进和自动化对齐研究感到紧迫。

这意味着当前最强的数学表现并非针对性优化的结果,而是其他优先级的副产品。Pachocki的说法被文章视为支持AI发展路径越来越“尖峰化”的证据:在少数领域极强,而在语言质量、常识、社交推理等方面可能停滞甚至倒退。

数学家Terence Tao在 2026 年国际数学家大会上提出,如果AI模型产出证明的速度持续超过人类验证速度,数学领域可能从证明稀缺转向证明过载,关键任务会从解决问题变成判断哪些结果真正重要。

目前最难的数学问题仍未解决,这为数学界争取了一些时间;但文章同时提到,部分数学家怀疑语言模型缺乏人类式创造力,难以带来真正突破,对AI实现真正自我改进也存在疑虑。

在ulam.ai的ErdosBench基准上,OpenAI的GPT-6 Astra一度排名第一,得分为 3.23,解出 226 道开放数学题中的 106 道,其中 43 道完全解出,另有 27 道被其证伪。

该成绩出来后,Fable 5.1以 3.25 分重新夺回榜首,但GPT-6 Astra解出的题目总数仍最多。

OpenAI首席科学家Jakub Pachocki在文章《An Alien Mind》中写道,公司本可以通过额外投入让模型在数学研究上更强,但出于对递归自我改进(RSI)和自动化对齐研究的紧迫感,没有优先这个方向。

ErdosBench上的成绩与对比

ErdosBench覆盖 226 道受著名Erdős问题启发的开放数学问题。基准开发者Przemek Chojecki将Astra的表现描述为“在多项数学研究技能上约 5% 到 10% 的提升”,同时指出该基准远未饱和。

与Sol相比,Sol在最大推理强度下解出 78 道题;Astra解出 106 道。文章还称Astra展现出更强的科学写作能力,且更不容易做出夸大性主张,有时甚至会低估自己的结果。

OpenAI为何不优先优化数学

Pachocki在文中表示,OpenAI把资源投入递归自我改进和确保未来AI系统的安全,因为“我们认为这是未来保持在AI研究前沿的唯一方式”。

这意味着当前最强的数学表现并非针对性优化的成果,而是其他优先事项的副产品。文章补充说,自该文发表以来,据报道OpenAI训练了更好的内部数学模型,此事较为复杂,且RSI和AI安全话题已急剧升温。

“尖峰化”发展路径的论据

文章将Pachocki关于故意跳过数学优化的说法,视为支持AI能力发展越来越“尖峰化”的证据:即在编程、数学等少数领域极强,而在语言质量、常识或社交推理等方面可能停滞甚至倒退。

文章引用剑桥研究者Adam Hunt的一张可视化图,对比两种可能路径:主流AGI假设认为模型会逐步、广泛地提升直至覆盖所有人类任务;另一种情景则描述轨迹越来越“尖峰化”,最终得到的是一个高度专业化的模型,而非大多数人所说的通用人工智能。

数学领域面临的验证压力

数学家Terence Tao在 2026 年国际数学家大会上提出,如果AI模型持续以超过人类验证速度产出证明,数学领域可能从证明稀缺转向证明过载。

届时关键任务将不再是解决问题,而是判断哪些结果真正重要。Tao称数学正面临一场价值观与实践的危机,并将其与 20 世纪初的基础性剧变相提并论。

文章称,目前最难的数学问题仍未解决,这为数学界争取了一些时间。但方向似乎已经确定,尽管部分数学家认为语言模型缺乏人类式创造力,无法带来真正突破,也因此对AI实现真正自我改进的潜力存疑。

信息来源

The Decoder AI原始来源