Anthropic 9 月 4 日宣布,Claude 在 11 天内自主完成费马大定理的端到端可核验证明,写下 1300 万行 Lean 代码、串联 29,500 条中间定理。这不是新的数学发现——证明骨架仍是 Wiles 1995 年版——而是首次把人类顶级证明整体翻成机器能逐行检查的形式,让数学知识的信任成本从「同行审稿几年」逼近「跑一遍 Lean」。

这有点像一份 129 页的合同,传统做法是请几位律师逐字通读、开会挑刺,可能花上数月;现在 Claude 的角色相当于一个把合同逐条翻译成机读表格的「数字化书记员」——条款没变,意思没改,只是机器从此可以瞬间告诉你「这里有没有自相矛盾」。Wiles 是写出那份合同的原作者,Claude 只是把它装进了一个任何人都能一键复算的保险箱。类比到此为止,实际差别是:法律合同出错顶多赔钱,而一条数学证明如果基础假设链上有一环漏掉,后面所有定理都可能瞬间失效,所以「机器逐行核验」对数学的意义远比合同审阅更根本。
事件

7 年 vs 11 天:费马大定理的 Lean 化是怎么发生的

2026年9月4日,Anthropic公开了费马大定理的第一份完整机器可核验证明。Claude用了11天自主完成。

1637 年,皮埃尔·德·费马在丢番图《算术》空白处写下:不存在正整数 a、b、c 满足 aⁿ + bⁿ = cⁿ(n>2)。他另起一行,说自己有“真正精彩的证明”,页边写不下。350 多年无人找到那个证法,1908 年悬赏 10 万德国金马克,第一年就收到 621 份错误证明。

1993 年 6 月,安德鲁·Wiles 在剑桥宣告证出费马大定理,但两个月后暴露致命漏洞。他与学生 Richard Taylor 合作,于 1995 年 5 月发表 129 页的完整证明,最终确认费马本人那个“精彩证明”大概率不存在。

那只是上半场。把人类写给人类读的证明改写成计算机能逐行核对的 Lean 代码,才是更难的下半场。2006 年,荷兰计算机科学家 Jan Bergstra 提出这一构想;2024 年,帝国理工的 Kevin Buzzard 牵头启动社区协作。仅说明初期工作该怎么走的“蓝图”就写了 86 页,原计划耗时多年。

Anthropic 研究员 Tianyi Peng 把 Claude 拉进来试。Anthropic 博文这样描述:11 天里,数十个 Claude 智能体(能自主完成多步任务的 AI 代理)协同工作——先定义概念,再证出中间定理,再用这些定理一级级向上推,最终给出端到端可核验的版本。Buzzard说得很直接:沿途覆盖了代数、调和分析、几何和数论的形式化;AI自动形式化出来的产物扎实到可以被后人接着用。

机制

11 天、几十个 Claude 接力:把 Wiles 的 129 页手稿翻成 1300 万行 Lean

一群智能体分工、撞墙、再分工:11天,几十个Claude接力。

发起人 Tianyi Peng 同时在 Anthropic 做研究员、在哥伦比亚大学带队做 AI 形式化工具。目标很明确:把 1995 年 Andrew Wiles 那份 129 页的手写证明,翻译成 Lean 证明助手能理解的代码,一个步骤都不许跳。

Lean 是一种证明检查器:把数学推理写成代码,它逐行验证逻辑是否成立,每一步都要写出来,缺一步就报错。数学家写「显然」能省掉几十步,Lean 不接受。

Claude 的做法是开几十个智能体并行跑。Peng 的人类指令很短、很上层,比如「把 Jacobian 当成 scheme 来处理,优先级高」「Mazur 定理尽快推完」。具体怎么证、写哪条引理、卡住了怎么办,全由智能体自己决定。一个证完的中间定理会被后面的智能体拿来当积木,证更难的命题。

最初的尝试几乎全失败。智能体很快丢状态、互相不知道对方在干什么、协作直接崩盘。第一波失败的尝试,最后只贡献了最终非样板代码的 7%。后面几轮才跑通。

「智能体」指的是一个能独立读、写、跑代码的 Claude 实例:给它一个目标,它能自己拆任务、查资料、改文件、跑 Lean 看有没有报错、报错了就重写。能并行几十个,是 Anthropic 算力调度层面的事,不是模型本身长出了 30 双手。

11 天
端到端耗时
Claude 跑完整份 FLT 形式化的时间;原计划社区估计「几年」
1300 万行
Lean 代码量
最终证明规模,是其底座 Mathlib 社区库的 5 倍以上
29,500 / 30,300
被使用的引理 / 沿途证明的引理
最终版本用了 29,500 条中间定理,整趟实验共证出 30,300 条
Anthropic:Research(发表成果 · 网页) 官方配图 1
官方配图 1 · 来源:Anthropic:Research(发表成果 · 网页) · 数据口径以原文为准
反直觉

瓶颈不在 Claude,在谁来告诉它下一步证什么

费马大定理的形式化卡了两年,卡在「协作协议」,不是 AI 算力。一张任务图把整条流水线拉通。

Anthropic 一开始让 Claude 直接啃 FLT,跑了大半进度收不了尾。哥伦比亚大学研究员 Tianyi Peng 做的 AI 形式化工具 Prove2Me 接上来,原本跑不动的多智能体流水线立刻活了过来。

Prove2Me 做了三件事。

关键它把待证定理排成一张有向无环图,让智能体自己决定下一步攻哪条,省掉人手动排队。

把定理声明和证明拆成不同文件来存,Lean 编译速度更快、内存更省。代码量太大,不分块编译根本跑不动。每条定理配一段自然语言描述,方便后续搜索复用,给知识库加了索引。

这三个动作直接解决多智能体在长链路任务里的两个老毛病:上下文遗忘(智能体干到后面忘了前面证过啥)和并发协调(多个智能体同时写代码互相踩脚)。Peng 的工具把「谁来告诉 AI 下一步该干嘛」从人肉调度变成系统自带的能力。Anthropic 把这次工作定位在「自动形式化」(把人类数学证明翻译成机器可核验的代码):证明骨架走的还是 Wiles 的路子,沿用 Darmon-Diamond-Taylor 的简化版本,亮点是可被 Lean 端到端验证、无额外假设。

算力翻一倍,模型多写两成代码;协作协议翻一倍,原本 11 天跑不完的任务在 11 天里跑完。瓶颈不在模型脑子够不够用,在怎么让它知道自己该干嘛。

Anthropic:Research(发表成果 · 网页) 官方配图 2
官方配图 2 · 来源:Anthropic:Research(发表成果 · 网页) · 数据口径以原文为准
方向

一道 350 年的题,怎么「验」法被改了

FLT 的数学没新东西,但「确认一段证明对不对」第一次被压到了跑一遍编译器的时间。

Wiles 1995 年那 129 页手写证明,审稿人花了几个月才点头。Claude 用 11 天把它拆成 1300 万行 Lean (一种让计算机逐行检查数学证明的语言) 代码,外加 30,300 条可机读的中间定理,机器对一遍就出结果。Anthropic 博文里写得很直白:AI 产出的证明会越来越多,把它们自动转成 Lean 应当成为标配,审稿「跑一遍编译器」就行。

这一步换的是数学里最底层的信任引擎。以前靠少数专家几个月反复通读、挑错、提问;现在逻辑链每一环都被机器钉死,人只需要在更上层判断——这条证明值不值得展开成一座新「建筑」。

Buzzard 提到一个细节:沿途生成的形式化产物「足够稳健,可以被后人继续往上盖楼」。也就是说,不只是 FLT 这一道题,整条路径上顺带产出的代数、调和分析、几何、数论模块,未来能被别的证明复用。

真正的考验是开放问题。黎曼猜想一类悬而未决的命题,没有现成的人类证明可让 AI 转写,必须靠模型自己提出构造、写下论证、再去机读验证。Anthropic 也承认,这是 FLT 这次没碰到的层面,能力边界还没摸清。

再看一环:Lean 编译器本身也在被 AI 改写。社区里已有人用 Claude Code 把 Lean 4 编译器重写成 Rust,仓库名是 xiyuzhai/lean-rs。验证数学的工具链开始用 AI 改写验证数学的工具链——这条回路一旦闭合,节奏还会再快一档。

可以盯两个信号。第一,未来 18 个月里有没有团队公开宣布对一道开放问题(黎曼猜想、BSD 猜想量级)跑出完整 Lean 形式化论证——跑出就是范式坐实,没跑出就是「只能改写不能创造」的边界被卡住。

第二,Lean 4 编译器的 Rust 重写是否进入可编译、可合并的阶段——这决定了以后 AI 形式化数学的速度上限是模型本身,还是底层工具。

动手

11 天跑出来的证明,你能去哪儿看、盯什么

这些数字听着像厂商品牌稿。但 Anthropic 确实把产物挂出来了——动手这一节,写你能看什么、等什么、别信什么。

先说能立刻做的:Anthropic 在文章里明确写"We shared the resulting proof with Kevin Buzzard"并附了链接,意思是前面提到的代码量和 29,500 个被使用的中间定理已经公开,可以查到。

至于具体仓库地址、是否对外开放 issue、下载是否需要登录,这次原文没给完整路径——所以别在二手转述里找链接,盯 Anthropic 官方那篇 9 月 4 日的博文,里面的才是准的。

代码跑通不代表定理就"被数学界接受"了。Lean 核验的是逻辑链没断,但"该形式化是否忠实复现了 Wiles 1995 年证明的每一步"是另一件事——这件事目前只有 Buzzard 一个人给出公开背书("autoformalization artefacts are now robust enough to be built upon")。数学共同体要等独立小组把前面提到的代码量过一遍,看有没有"形式化对了、但底层引用的引理用错了"的偷渡。目前没有第三方复测公开报告。

核查清单
1

打开 Anthropic 9 月 4 日博文,找文中的 proof 链接,确认仓库是否可访问、有没有限制条款。

2

把 Buzzard 那段引语单独拉出来读:他评的是"工具已经能盖楼",不是"FLT 形式化已被同行评审通过",别把两件事混着说。

3

留意 Mathlib 维护者、Imperial College 形式化团队是否发独立技术评估——FLT 这类量级的证明,圈内不发声就是还没审完。

4

看到"11 天/1300 万行"这类数字,先问厂方跑分口径:并行了多少 Claude 实例、有没有人介入修补、耗时是否含调试——Anthropic 原文只说"largely autonomously",没拆成细账。

5

等 1~3 个月,看 Lean 社区邮件列表或 Mathlib PR 记录里有没有人开始"在这套形式化上继续盖楼"——这是 Buzzard 那句"robust enough to be built upon"真正能被验证的时刻。

最后一句留给圈外人:这次成果是让"信任数学"这件事的成本从几年变几小时,不是让 AI 自己发明新定理。把这两件事分清楚,看后续报道就不会被带跑。

信源:Anthropic Research 官方研究博客(2026-09-04 发布);口径为 Anthropic 自报成果,实验由其研究员 Tianyi Peng 主导,使用 Anthropic 自研 Claude 模型与哥伦比亚大学 Peng 实验室的 Prove2Me 协作平台,证明骨架沿用 Wiles / Darmon-Diamond-Taylor 版本,未宣称发现新数学。