当OpenAI研究员Sébastien Bubeck在8月1日宣布,其未公开的下一代主力模型Astra一口气证明了10项前沿数学成果,并甩出10份Lean证书时,他或许没有预料到,这项“数学首发”的保鲜期只剩24小时。Epoch AI旗下FrontierMath负责人Elliot Glazer直言,光是非索菲克群这一篇,就肯定能进Annals of Mathematics。

希鸥网观察到,Anthropic研究员Levent Alpöge不到24小时便用已公开的模型Fable完成了其中5项,且实验条件完全自主、通用提示词、全程无网络,还加了防泄漏防护。一个未发布的模型抢到的首发,被一个公众可随时调用的模型迅速追平了一半。过去数学成果的优先权之争以年计,如今以小时计,首发的含金量仍在,但保质期已大幅缩水。

OpenAI还甩出一个惊人数字:找到这10项解法,边际推理成本不到2000美元,按研究员Noam Brown的说法,是以Sol API价格折算出的成功瞬间的token成本。但真正的账远不止于此:Astra本身的训练研发、试了没成功的问题、人类整理249页论文的工时、形式化成Lean的成本,以及外部数学家的审查成本,都未被计入。Noam也承认,千禧年大奖难题一个都没拿下。

Fable去重做Astra的同一批题,比普通刷榜更有深意。刷榜测的是已知答案,而两个模型在无网络、防泄漏条件下各自独立抵达同一前沿结论,考验的是结果能否被独立复现,这更接近同行评审。不过,Levent目前只是在X上作出了声明,并未放出那5项证明的完整PDF、提示词、运行日志或Lean证书,验证链条尚未闭合。

代码、图片、聊天,普通人还能亲手体验AI强在哪。可非索菲克群的存在、Connes刚性猜想的反例、量子平行重复定理,对地球上几乎每一个人来说,是超出理解范围的。Ethan Mollick一语道破:我们只能相信专业数学家告诉我们它厉不厉害。AI能力越往科学前沿走,公众依靠的越不是亲身体验,而是一条长长的信任链。

希鸥网认为,当AI能低成本、批量地生产前沿数学证明,最稀缺的能力正从“做出证明”转向“看懂并验收证明”。证明越造越快,验证追不追得上,才是真正的考验。数学家Thomas Bloom提醒,这些成果用的是上百年积累的理论和人类搭好的形式化系统,简单描述成“AI取代数学家”并不诚实。答案不在产出端,而在验收端:一份证明能否被读懂、核对、判断出分量,最终决定它的真实价值。

对创业者而言,OpenAI展示的“2000美元解题成本”极具迷惑性。正如语料所言,创业不是冒险,是计算后的孤注一掷。真正的创业者在按下确认键之前,会把最坏情况想三遍。那2000美元只是边际成本,背后是无数失败尝试和隐性投入。聪明人看“成功”的显性成本,更看失败的隐性代价。

前沿数学验证的困局,与创业公司的信任构建异曲同工。语料中提到,如果某人做了不诚实的事被当场发现,声称知错但绝不再犯,就不能再相信他。数学验证同样如此——没有独立复现、没有数据公开,就谈不上可靠。一个需要顶级数学家逐行核对的证明,其价值取决于验证链条的严密程度,而非AI的“解题速度”。极度透明的规则,才让飞轮转得起来。

AI数学突破真正值得创业者关注的是它示范的“人机角色再定义”。语料强调,AI不会取代创作者,但会用AI的创作者将取代不会用的。在这个案例里,被取代的不是数学家,而是“不借助AI的数学家”。未来人类数学家将聚焦于判断一个证明是否揭示了新结构、是否为领域打开了新路径,这些恰恰是AI当前难以替代的高阶认知。数据飞轮一旦转动,后来者即使拿到同样技术也无法追赶。

金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。 如需修改或发布文章,请加微信号:sheisceo