GPT-6 Astra刷穿FrontierMath Tier 4,AI数学最后高墙被攻破

据量子位消息,GPT-6 Astra在FrontierMath最高难度Tier 4测试中取得突破,该基准此前被视为衡量AI数学推理能力的最后一道高墙。此次刷穿意味着大模型在形式化推理与复杂数学证明方向再进一步,也引发学界对AI数学能力边界的重新评估。

据量子位消息,GPT-6 Astra在FrontierMath最高难度Tier 4测试中取得突破性成绩,这一基准此前被学界视为衡量AI数学推理能力的最后一道高墙。FrontierMath由非营利研究机构Epoch AI于2024年推出,题目由多位菲尔兹奖级别数学家参与设计,涵盖代数几何、数论、拓扑学等前沿领域,其Tier 4难度层级更是专门用于测试模型在全新数学问题上的创造性推理能力,而非依赖训练数据中的模式匹配。此前包括GPT-5、Claude系列在内的顶尖模型在该层级上的表现均远低于人类专家水平,因此Tier 4的“饱和”被普遍认为是通用人工智能在形式化推理方向上的标志性节点。

此次GPT-6 Astra刷穿Tier 4,核心意义不仅在于分数本身,更在于其展现出的推理路径特征。据披露,该模型在解题过程中能够自主构建中间引理、选择非显然的证明策略,并在部分题目上给出比参考答案更简洁的证明。这意味着大模型正在从“检索式解题”向“生成式证明”迁移,其能力边界已触及数学研究中需要直觉与创造力的环节。对于数学界而言,这既可能带来研究范式的改变——AI可作为定理证明的协作工具加速猜想验证,也引发了对基准有效性的重新审视:当最高难度层级被攻破后,如何设计更具区分度的评测体系成为紧迫课题。

从产业与政策视角看,这一突破将进一步推高对AI推理能力的预期。教育领域可能加速向个性化数学辅导转型,而形式化验证、密码学、芯片设计等依赖严密数学推导的行业,则有望获得新的自动化工具。与此同时,学界对“AI是否真正理解数学”的争论不会因分数而平息,反而会因模型给出人类未曾想到的证明路径而更加激烈。可以预见,FrontierMath之后,新的数学推理基准将很快出现,而GPT-6 Astra的这次刷榜,或将被记录为AI数学能力从“辅助计算”迈向“自主发现”的分水岭事件。