OpenAI Astra连破10道悬置十年数学难题:2000美元成本震动数学界
8月1日,OpenAI发布其下一代内部模型Astra的数学研究成果:一口气在10个至少悬置十年的数学与理论计算机科学公开难题上取得重大突破,包括构造出史上首个”非sofic群”、证伪1982年菲尔兹奖得主Alain Connes的刚性猜想、突破1978年以来高维球堆积密度上限。全部证明经Lean 4形式化验证,总计算成本仅约2000美元。249页论文同步公开,数学圈瞬间炸锅。
十题连斩:从非sofic群到Erdős问题
Astra本次攻克的10道难题横跨高维几何、编码理论、群论、算子代数、量子复杂度、格密码学和极值组合学等8个领域。其中最重磅的成果是构造出无限有限呈现的非sofic群,直接回应了阿贝尔奖得主Mikhail Gromov在1999年提出的核心问题:所有可数群都是sofic的吗?这个问题27年来无人能解,牵动着sofic熵理论、动力系统遍历论和算子代数一整片数学版图。
同样在群论领域,1982年菲尔兹奖得主Alain Connes的刚性猜想被直接证伪。Astra证明某些群并不能被其von Neumann代数唯一决定。此外,Astra还在极值组合学领域解决了Erdős问题146、180和183,包括多色Ramsey数的超指数下界。高维球堆积方面,Astra将密度上界推进至Cohn-Elkies阈值。量子计算领域,Astra给出了双人量子博弈的指数并行重复定理。算术电路复杂度方面,给出了permanent的n^4/log n公式下界。格密码学领域,最近向量问题的多项式因子近似硬度也获得证明。
为什么重要:这10道题每一道都至少十年未有实质性进展,集中突破意味着AI的数学推理能力已从”辅助工具”跃升至”独立研究者”级别。
Lean 4机器验证:编译通过即正确
本次发布最关键的技术细节在于全部10项证明均通过Lean 4形式化工具完成机器验证。OpenAI在GitHub上以Apache-2.0协议开源了完整的Lean证明证书,任何人都可下载编译验证。Lean证书的验证逻辑极为严格:编译通过即正确,编译失败即错误,检查过程仅需几分钟,不存在”看起来合理但暗藏跳步”的常见陷阱。
OpenAI还同步公开了模型求解每道问题时的完整推理过程文本,保留AI思考、调整推导路径、放弃错误方向等全部细节。以非sofic群问题为例,Astra最初尝试随机化网格论证,发现走不通后果断转向确定性中位数论证,最终通过结合二元Leavitt代数单位群、Kun-Thom扩展图理论和Thompson群V逼出决定性矛盾。这种”试错再转向”的推理模式,与人类数学家的研究路径高度相似。
为什么重要:此前AI数学证明的最大软肋是”看似合理但暗藏跳步”。Lean 4机器验证从根本上关闭了这条退路,这也是AI数学成果首次以这种规模通过形式化验证。
2000美元:数学研究变成云账单
OpenAI披露,Astra寻找这10道难题的解所消耗的全部token,按Sol API价格计算仅约2000美元。这个数字意味着任何有经费的研究实验室都具备复现能力。曼彻斯特大学数学家Thomas Bloom评价,本次集中发布的学术价值远超今年5月OpenAI证伪Erdős单位距离猜想的单次成果。
Astra是OpenAI正在开发的下一代主力模型,定位为多智能体长周期协作。7月29日,OpenAI首席执行官Sam Altman已在华盛顿国会山向参议员演示该模型。OpenAI研究员Sebastien Bubeck在X平台上表示,这10项成果”只是示例,远非全部”。Astra的架构设计目标是让多个智能体在数小时甚至更长时间内协同攻克高难度问题,数学研究只是其能力的一个切面。据此前The Information报道,Astra将成为OpenAI旗下与Sol、Terra和Luna并列的全新模型类别。
为什么重要:当攻克十年级数学难题的成本降到一张云账单的水平,谁来做数学研究、以什么速度做,都将被重新定义。实验室算力正在成为真实的研究投入。
数学界反应:从惊叹到重新审视
成果发布后,罗格斯大学杰出教授、美国数学学会Fellow Alex Kontorovich只留下两个惊叹号。Anthropic的Claude Fable 5评价称”按照菲尔兹奖标准,任何一项都足以获奖”。加州理工学院某数学博士直言”这是菲尔兹奖级别的东西”。Epoch AI的OpenMath评分系统将大部分结果评为”重大进步”,其中非sofic群构造被评为”突破”,有望成为全年数学领域最佳成果之一。
理性声音同样存在。Astra仍是内部模型,外部数学家尚未有充分时间深入审查每项证明。Lean证书验证的是形式化表述的正确性,至于形式化表述是否精确对应原始数学问题,仍需学界共识。论文也未详述每次运行前人类做了多少问题塑形工作。如果其中任何一项被撤回,都将引发巨大声浪。OpenAI researcher Sebastien Bubeck也强调这10项”只是示例”,暗示模型实际产出可能更多。
为什么重要:即便只有多数结果经受住同行评审,格局已经改变。攻破十年难题的成本从”数年职业生涯”压缩到”一次云调用”,数学家作为知识生产唯一主体的地位正在被重新校准。
写在最后
8月2日同一天,欧盟AI法案正式扩大执行,聊天机器人必须告知用户”我是AI”,深度伪造内容强制标注。一边是AI在数学疆域高歌猛进,一边是人类监管框架加速落地。技术突破与治理规则同步推进,或许是这个时代最真实的写照。Astra的10道难题能否全部经受住学界检验尚需时间,但2000美元这个数字已经说明:数学研究的门槛,正在被彻底重写。