Anthropic 9 月 4 日宣布,Claude 在 11 天内自主完成费马大定理的端到端可核验证明,写下 1300 万行 Lean 代码、串联 29,500 条中间定理。这不是新的数学发现——证明骨架仍是 Wiles 1995 年版——而是首次把人类顶级证明整体翻成机器能逐行检查的形式,让数学知识的信任成本从「同行审稿几年」逼近「跑一遍 Lean」。
7 年 vs 11 天:费马大定理的 Lean 化是怎么发生的
2026年9月4日,Anthropic公开了费马大定理的第一份完整机器可核验证明。Claude用了11天自主完成。
1637 年,皮埃尔·德·费马在丢番图《算术》空白处写下:不存在正整数 a、b、c 满足 aⁿ + bⁿ = cⁿ(n>2)。他另起一行,说自己有“真正精彩的证明”,页边写不下。350 多年无人找到那个证法,1908 年悬赏 10 万德国金马克,第一年就收到 621 份错误证明。
1993 年 6 月,安德鲁·Wiles 在剑桥宣告证出费马大定理,但两个月后暴露致命漏洞。他与学生 Richard Taylor 合作,于 1995 年 5 月发表 129 页的完整证明,最终确认费马本人那个“精彩证明”大概率不存在。
那只是上半场。把人类写给人类读的证明改写成计算机能逐行核对的 Lean 代码,才是更难的下半场。2006 年,荷兰计算机科学家 Jan Bergstra 提出这一构想;2024 年,帝国理工的 Kevin Buzzard 牵头启动社区协作。仅说明初期工作该怎么走的“蓝图”就写了 86 页,原计划耗时多年。
Anthropic 研究员 Tianyi Peng 把 Claude 拉进来试。Anthropic 博文这样描述:11 天里,数十个 Claude 智能体(能自主完成多步任务的 AI 代理)协同工作——先定义概念,再证出中间定理,再用这些定理一级级向上推,最终给出端到端可核验的版本。Buzzard说得很直接:沿途覆盖了代数、调和分析、几何和数论的形式化;AI自动形式化出来的产物扎实到可以被后人接着用。
11 天、几十个 Claude 接力:把 Wiles 的 129 页手稿翻成 1300 万行 Lean
一群智能体分工、撞墙、再分工:11天,几十个Claude接力。
发起人 Tianyi Peng 同时在 Anthropic 做研究员、在哥伦比亚大学带队做 AI 形式化工具。目标很明确:把 1995 年 Andrew Wiles 那份 129 页的手写证明,翻译成 Lean 证明助手能理解的代码,一个步骤都不许跳。
Lean 是一种证明检查器:把数学推理写成代码,它逐行验证逻辑是否成立,每一步都要写出来,缺一步就报错。数学家写「显然」能省掉几十步,Lean 不接受。
Claude 的做法是开几十个智能体并行跑。Peng 的人类指令很短、很上层,比如「把 Jacobian 当成 scheme 来处理,优先级高」「Mazur 定理尽快推完」。具体怎么证、写哪条引理、卡住了怎么办,全由智能体自己决定。一个证完的中间定理会被后面的智能体拿来当积木,证更难的命题。
最初的尝试几乎全失败。智能体很快丢状态、互相不知道对方在干什么、协作直接崩盘。第一波失败的尝试,最后只贡献了最终非样板代码的 7%。后面几轮才跑通。
「智能体」指的是一个能独立读、写、跑代码的 Claude 实例:给它一个目标,它能自己拆任务、查资料、改文件、跑 Lean 看有没有报错、报错了就重写。能并行几十个,是 Anthropic 算力调度层面的事,不是模型本身长出了 30 双手。
瓶颈不在 Claude,在谁来告诉它下一步证什么
费马大定理的形式化卡了两年,卡在「协作协议」,不是 AI 算力。一张任务图把整条流水线拉通。
Anthropic 一开始让 Claude 直接啃 FLT,跑了大半进度收不了尾。哥伦比亚大学研究员 Tianyi Peng 做的 AI 形式化工具 Prove2Me 接上来,原本跑不动的多智能体流水线立刻活了过来。
Prove2Me 做了三件事。
把定理声明和证明拆成不同文件来存,Lean 编译速度更快、内存更省。代码量太大,不分块编译根本跑不动。每条定理配一段自然语言描述,方便后续搜索复用,给知识库加了索引。
这三个动作直接解决多智能体在长链路任务里的两个老毛病:上下文遗忘(智能体干到后面忘了前面证过啥)和并发协调(多个智能体同时写代码互相踩脚)。Peng 的工具把「谁来告诉 AI 下一步该干嘛」从人肉调度变成系统自带的能力。Anthropic 把这次工作定位在「自动形式化」(把人类数学证明翻译成机器可核验的代码):证明骨架走的还是 Wiles 的路子,沿用 Darmon-Diamond-Taylor 的简化版本,亮点是可被 Lean 端到端验证、无额外假设。
算力翻一倍,模型多写两成代码;协作协议翻一倍,原本 11 天跑不完的任务在 11 天里跑完。瓶颈不在模型脑子够不够用,在怎么让它知道自己该干嘛。
一道 350 年的题,怎么「验」法被改了
FLT 的数学没新东西,但「确认一段证明对不对」第一次被压到了跑一遍编译器的时间。
Wiles 1995 年那 129 页手写证明,审稿人花了几个月才点头。Claude 用 11 天把它拆成 1300 万行 Lean (一种让计算机逐行检查数学证明的语言) 代码,外加 30,300 条可机读的中间定理,机器对一遍就出结果。Anthropic 博文里写得很直白:AI 产出的证明会越来越多,把它们自动转成 Lean 应当成为标配,审稿「跑一遍编译器」就行。
这一步换的是数学里最底层的信任引擎。以前靠少数专家几个月反复通读、挑错、提问;现在逻辑链每一环都被机器钉死,人只需要在更上层判断——这条证明值不值得展开成一座新「建筑」。
Buzzard 提到一个细节:沿途生成的形式化产物「足够稳健,可以被后人继续往上盖楼」。也就是说,不只是 FLT 这一道题,整条路径上顺带产出的代数、调和分析、几何、数论模块,未来能被别的证明复用。
真正的考验是开放问题。黎曼猜想一类悬而未决的命题,没有现成的人类证明可让 AI 转写,必须靠模型自己提出构造、写下论证、再去机读验证。Anthropic 也承认,这是 FLT 这次没碰到的层面,能力边界还没摸清。
再看一环:Lean 编译器本身也在被 AI 改写。社区里已有人用 Claude Code 把 Lean 4 编译器重写成 Rust,仓库名是 xiyuzhai/lean-rs。验证数学的工具链开始用 AI 改写验证数学的工具链——这条回路一旦闭合,节奏还会再快一档。
可以盯两个信号。第一,未来 18 个月里有没有团队公开宣布对一道开放问题(黎曼猜想、BSD 猜想量级)跑出完整 Lean 形式化论证——跑出就是范式坐实,没跑出就是「只能改写不能创造」的边界被卡住。
第二,Lean 4 编译器的 Rust 重写是否进入可编译、可合并的阶段——这决定了以后 AI 形式化数学的速度上限是模型本身,还是底层工具。
11 天跑出来的证明,你能去哪儿看、盯什么
这些数字听着像厂商品牌稿。但 Anthropic 确实把产物挂出来了——动手这一节,写你能看什么、等什么、别信什么。
先说能立刻做的:Anthropic 在文章里明确写"We shared the resulting proof with Kevin Buzzard"并附了链接,意思是前面提到的代码量和 29,500 个被使用的中间定理已经公开,可以查到。
至于具体仓库地址、是否对外开放 issue、下载是否需要登录,这次原文没给完整路径——所以别在二手转述里找链接,盯 Anthropic 官方那篇 9 月 4 日的博文,里面的才是准的。
代码跑通不代表定理就"被数学界接受"了。Lean 核验的是逻辑链没断,但"该形式化是否忠实复现了 Wiles 1995 年证明的每一步"是另一件事——这件事目前只有 Buzzard 一个人给出公开背书("autoformalization artefacts are now robust enough to be built upon")。数学共同体要等独立小组把前面提到的代码量过一遍,看有没有"形式化对了、但底层引用的引理用错了"的偷渡。目前没有第三方复测公开报告。
打开 Anthropic 9 月 4 日博文,找文中的 proof 链接,确认仓库是否可访问、有没有限制条款。
把 Buzzard 那段引语单独拉出来读:他评的是"工具已经能盖楼",不是"FLT 形式化已被同行评审通过",别把两件事混着说。
留意 Mathlib 维护者、Imperial College 形式化团队是否发独立技术评估——FLT 这类量级的证明,圈内不发声就是还没审完。
看到"11 天/1300 万行"这类数字,先问厂方跑分口径:并行了多少 Claude 实例、有没有人介入修补、耗时是否含调试——Anthropic 原文只说"largely autonomously",没拆成细账。
等 1~3 个月,看 Lean 社区邮件列表或 Mathlib PR 记录里有没有人开始"在这套形式化上继续盖楼"——这是 Buzzard 那句"robust enough to be built upon"真正能被验证的时刻。
最后一句留给圈外人:这次成果是让"信任数学"这件事的成本从几年变几小时,不是让 AI 自己发明新定理。把这两件事分清楚,看后续报道就不会被带跑。
信源:Anthropic Research 官方研究博客(2026-09-04 发布);口径为 Anthropic 自报成果,实验由其研究员 Tianyi Peng 主导,使用 Anthropic 自研 Claude 模型与哥伦比亚大学 Peng 实验室的 Prove2Me 协作平台,证明骨架沿用 Wiles / Darmon-Diamond-Taylor 版本,未宣称发现新数学。