8 月 2 日凌晨,OpenAI 做了一件在 AI 行业不太寻常的事:它没有先开放一个新模型,而是先公开了这个模型交出的数学答卷——下一代模型 Astra 的内部版本,一次性给出 10 项数学与理论计算机科学新成果,全部附 Lean(一种让机器逐行核验证明的系统)形式化证明,按 Sol API(程序调用 AI 的入口)计价总成本约 2000 美元。外界暂时还测不到 Astra,但可以先检查它做的题。
10 道十年悬案,一次交卷
OpenAI 披露的这 10 项成果,横跨高维几何、编码理论、群论、算术电路复杂性、量子复杂性、格密码学和极值组合数学。它们有一个共同点:每一道都开放了至少 10 年,部分长达数十年,其中 3 个是数学家保罗·厄多斯留下的经典公开问题。
具体包括:高维球体堆积密度和编码理论的新上界、非 sofic 群的构造(并推翻 Connes 刚性猜想)、Ehrhart 体积猜想的锐界、算术电路复杂性新下界、量子平行重复定理、多色拉姆齐数的超指数下界等。有些把已知边界向前推进,有些构造了过去不知道是否存在的对象,有些直接推翻或完成了具体猜想。
OpenAI 同步放出了三份材料:249 页完整论证论文、62 页解题思路说明,以及一套 Lean 4 形式化证明证书(已开源到 GitHub)。流程是:Astra 生成数学论证 → 人类与模型共同整理成论文 → 模型编写 Lean 证明。
2000 美元:科研第一次有了明确标价
OpenAI 给了一个很实在的数字:按 Sol API 费率折算,Astra 寻找这 10 项解法消耗的 token(AI 按字数收费的单位)总成本约为 2000 美元(约合人民币 1.35 万元)。这个数字听起来不算天文,但它第一次把「原创科研」变成了一笔可以估算的账单。
对比一下:人类顶尖数学家团队攻克其中任何一道题,可能耗费数年时间和百万级经费。10 道题,2000 美元——这不是「便宜一点」,是数量级的差异。研究者 Noam Brown 的补充很坦诚:「遗憾的是,千禧年大奖难题(七道著名数学难题,每道悬赏百万美元)还没有被攻克。但我们在每道题上花的钱也不多,测试时计算还有很大推进空间。」
2000 美元的意义不在于「省了多少钱」,而在于它证明了「AI 做原创科研」是可复用、可计价的流程,不是一次性的玄学展示。当成本可以估算,投入就可以决策——科研基础设施的逻辑,从「养一个团队」变成了「开一张云账单」。
| 维度 | 人类顶尖团队 | Astra |
|---|---|---|
| 单题耗时 | 数月到数年 | 批量完成 10 题 |
| 单题成本 | 数十万~百万级经费 | 平均约 200 美元/题 |
| 证明形式 | 人类可读论文 | 论文 + Lean 机器核验证书 |
| 可复现性 | 依赖同行评审 | 证明开源,任何人可验证 |
成本对比为粗略量级估算,人类团队成本因题而异。来源:OpenAI 官方 + 智东西、每经交叉报道。
重点不是「算出来」,是「可以验证」
很多人听到「AI 做出数学突破」,第一反应是怀疑:AI 会不会是在「猜答案」,甚至「编证明」?这次的发布方式恰恰回答了这个问题——它交出的不是答案,而是可以被机器逐行核验的证明链。
Lean 是一个形式化证明系统:把人类口头的「我觉得这个证明对」翻译成机器语言,由计算机全自动检查每一步推导。证明对不对,机器可以客观判定,不存在文字辩论的歧义。OpenAI 把全部 10 道证明的 Lean 证书开源到 GitHub,意味着任何有计算机的人都能独立验证——不用信 OpenAI 的话,信机器就行。
这是「AI 做科研」和「AI 答题」的本质区别:答题只需要给出一个看起来对的答案,科研必须交出可检验的证据。当「提出答案」和「验证答案」第一次可能被同一个系统大规模接管,AI 才真正踏进了原创科研的门槛。
AI 正在变成科研基础设施
把视角拉远。同一则公告里,OpenAI 还推出了一个计划:向 10 万名科学家和数学家免费开放其最强模型。把两件事连起来看就清楚了——一边用 Astra 展示「AI 能做原创科研」,一边把工具免费塞进研究者的工作流。
这不是 OpenAI 第一次展示 AI 的数学能力。今年 5 月,它曾公开一项由 AI 发现的厄尔多什单位距离猜想反例,并推动了多项后续研究。但这次是第一次系统性、成规模地攻克前沿未解难题,而且附带完整的可验证证据。
当然要保持清醒:Astra 仍是内部版本,没有开放;10 项成果中有些是「推进边界」而非「完全解决」;千禧年大奖难题依然屹立。业内评价任意一项都够「菲尔兹奖(数学界的最高荣誉)」级分量,但最终能否经得起时间检验,还要看各领域数学家的后续复核。不过方向已经很清楚了:科研这门人类最昂贵的智力活动,正在从「少数人的特权」变成「可以购买的服务」。
不用等模型开放,现在就能验证
虽然 Astra 本身还测不到,但它交出的数学成果是完全公开的。如果你或你身边的人做研究,现在就可以做三件事:
下载 249 页论文,看 Astra 具体解决了哪些问题、用了什么方法。
克隆 GitHub 上的 Lean 证书仓库,用 Lean 4 独立运行验证——证明对错,机器说了算。
关注 OpenAI 的科学家免费开放计划,如果你的团队做研究,这是实打实的——算力(跑模型所需的计算资源)红利。
这次的关键不是「AI 算出了答案」,而是「AI 交出了机器可以逐行核验的证明」。当提出答案和验证答案第一次可能被同一个系统大规模接管,科研正在从「少数人的特权」变成「一笔可以估算的云账单」。2000 美元,10 道十年悬案——这个数字会被记住很久。
10 项成果的具体数学内容以 OpenAI 官方论文为准;「菲尔兹奖级分量」为业内评价,非官方定论;Astra 的命名与发布时间以 OpenAI 后续公告为准。成本数字按 Sol API 费率折算,为 OpenAI 官方口径。