姚班校友主导,Claude攻克费马大定理首个完整形式化证明

最后靠Harness救回来

姚班校友主导,Claude攻克费马大定理首个完整形式化证明 – 量子位

首页

资讯

智能车

智库

活动

MEET大会

AIGC

扫码关注量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

姚班校友主导,Claude攻克费马大定理首个完整形式化证明

梦瑶

2026-09-05

09:17:56

来源:

量子位

最后靠Harness救回来

梦瑶 发自 凹非寺

量子位 | 公众号 QbitAI

人类和费马大定理纠缠了三个半世纪,Claude这次只用了11天!?

刚刚,Anthropic宣布,Claude完成了首个端到端、可由计算机完整检查的

费马大定理证明

约1300万行Lean代码、超过3万个中间定理、最终证明使用其中约29500个。

整个工程规模,已经超过Lean核心数学库Mathlib的

5倍

这次Claude没有发现一个全新的费马大定理证明。

它完成的是另一件同样工程量《惊人》的工作:

把人类数学家能够读懂的证明,彻底翻译成计算机能够一行一行检查、没有任何「这里显然」的形式化证明。

而这件事,数学界原本是按多年工程来准备的????

350多年数学史,被Claude塞进1300万行Lean

先快速说一下费马大定理到底是什么。

其指的是,对于任意整数n>2,都不存在正整数a、b、c,使:

aⁿ+bⁿ=cⁿ

这个命题看起来极其简单,难度却高得离谱!!

从17世纪费马留下这个命题开始,欧拉、勒让德、库默尔等一代代数学家不断往前推进,始终没能拿下完整证明。

直到1993年,英国数学家Andrew Wiles第一次公开宣布证明费马大定理。

随后审查发现其中存在关键缺口。

Wiles又花了大约一年时间和Richard Taylor一起修补,最终在1994年完成证明,到这里,困扰数学界350多年的命题才终于被攻克。。。

But!数学界随后又给自己挖了一个更工程化的坑——

能不能让计算机,也百分之百确认这份证明成立捏?

这就是所谓的「形式化」。

简单理解,普通数学论文是写给数学家看的,人脑看到很多步骤,可以直接说:嗯,这里显然成立~

但Lean这种专门检查数学证明的程序系统证明助手,可不吃这一套。。。

我们可以把

Lean

理解成数学世界里的「超级严格编译器」——

数学家或者AI负责把定理、定义和证明一步一步写成Lean能够理解的形式;Lean则负责检查,每一个推导到底有没有从前面的公理和定理合法地走出来。

这也是为什么形式化一个大型现代数学证明,工作量经常大得惊人!!

2000年代,计算机科学家就已经提出过形式化Wiles证明的设想。

到2024年,帝国理工学院Kevin Buzzard等人才正式启动一个多年社区项目,准备使用Lean完成费马大定理形式化,光项目第一阶段的技术蓝图,就写了86页。

结果Claude来了之后:11天。

Anthropic研究员Tianyi Peng最初其实没打算一口气干完这事儿。

作为早年是信息学竞赛尖子,Tianyi Peng曾获全国青少年信息学奥赛选拔赛第八名,2017年从

清华姚班

本科毕业,2023年获MIT博士学位。

如今,他是哥伦比亚大学助理教授、Anthropic研究员,长期聚焦强化学习、AI Agent与形式化工具。

开始吧,他只是想测试一下,Claude究竟能把这个项目往前推多远。

最后,没成想,Claude直接一路干到了终点。。。

整个过程中,不同Agent被同时拉起来并行工作。

有的负责补数学定义,有的专门攻中间引理,有的沿着已有成果继续往更高层定理推进,还有Agent负责把不同部分重新拼回整个证明体系。

最后堆出来的成果,是约1300万行Lean代码、超过3万个中间定理。

而这个代码量,甚至超过Lean核心数学库Mathlib自身规模的5倍!!!

Anthropic对此也表示,完整证明只依赖Lean三个标准公理,而且他们还专门通过比较程序确认,Claude最终证明的定理陈述,与Mathlib里的费马大定理完全一致。

也就是说,至少在逻辑检查这件事上,不能靠模型自己说「我证明完了」。

而裁判,正是Lean。

Claude也曾组团组到失忆,最后靠Harness救回来

不过Claude这11天,也没一路开挂到底。

项目刚开始时,多Agent协作很快撞上了一个如今几乎所有大型Agent系统都会遇到的问题——

人一多,活一多,项目开始乱了。。。(doge)

Anthropic透露,早期Agent虽然很快拿下了一些结果,但随着工程规模扩大,它们逐渐跟不上整个项目的状态,也越来越难有效协作。

这些失败尝试留下的代码,最终只占成品非模板代码的大约7%。

真正的转折点,是团队换上了一个叫

「Prove2Me」

的平台——

这是Tianyi Peng及其哥伦比亚大学合作者专门为数学形式化搭建的一套协作系统。

我们可以把它理解成,给几十个Claude装上了一套数学版项目管理系统。

Prove2Me会把整个证明拆成一个由定理节点组成的DAG,也就是有向无环图。

哪个定理已经证明了,哪个还缺前置条件,下一步该攻哪个节点,Agent都能从这张图里判断。

同时,平台还会把定理陈述和证明分开管理、加速Lean编译,并给每个定理保留自然语言描述,方便不同Agent搜索和复用已有结果。

这一下,多Agent才真正开始像一支能协作的大型数学团队了~

而Anthropic最后使用的,则是

Prove2Me+基于Claude Code的multi-agent harness。

最后整个项目消耗约60亿个输出Token,内部使用的通用研究模型能力大致相当于Claude Fable 5.1。

更夸张的是,人类在过程中提供的数学指导其实相当有限。。。

Tianyi Peng更多只是偶尔给一些非常高层的提示,比如某个方向优先级更高、某个定理尽快推进。

剩下的大量定义、中间证明、任务拆分和拼装,主要由Claude自己完成。

负责审阅结果的Kevin Buzzard将其评价为一次「非凡的自动形式化成果」。

这个评价背后,其实还有一层更大的含义。

因为费马大定理的价值已经不止于又被AI证明了一遍——

如果这样规模、这样依赖复杂度的现代数学成果,都开始能够被AI自动搬进形式化系统,那么过去极度依赖人工、推进速度缓慢的数学文献形式化,可能第一次真正具备了大规模提速的条件。

One More Thing

Claude这边刚用11天,把350多年的数学名题重「喂」给计算机验了一遍。

OpenAI那边也没闲着,是的,GPT-6 Astra开始往更多人手里塞了。。。

OpenAI最新信息显示,

GPT-6 Astra

正在逐步向ChatGPT付费用户开放。

其中GPT-6 Pro面向Pro、Business和Enterprise计划推出,Pro用户还可以在Chat、Work和Codex里使用Astra。

Sam Altman也亲自出来吆喝了一波,大意很简单:

货到了,可以开始上桌了友友们~

友友们要知道,俺们奥特曼的新模型Astra,重点强化的也是是如今各家最卷的那几项能力——

长链路Agent任务、软件工程、计算机操作、浏览器使用,以及科学和专业工作。

A社刚秀完Claude可以拉着一群Agent,狠干11天数学工程。

OpenAI转头开始把新旗舰往Pro和企业用户手里推。

我是感觉啊,一大批刚出炉的数学、科研和Agent狠活,估计已经跟着GPT-6 Astra一起在路上了。。。

参考链接:

[1]https://x.com/search?q=%E8%B4%B9%E9%A9%AC%E5%A4%A7%E5%AE%9A%E7%90%86&src=typed_query

[2]https://www.anthropic.com/research/formalizing-fermats-last-theorem

版权所有,未经授权不得以任何形式转载及使用,违者必究。

Claude

梦瑶

陶哲轩吐槽GPT-6孪生素数新突破:令人无语的一幕

2026-09-05

这个世界模型训练完就“退场”,机器人反而更能干了

2026-09-05

OpenClaw:红过,爱过,散了

2026-08-29

机器人的GPT-3时刻真·来了!卡卡西上身,看3秒就学会新动作

2026-08-21

扫码分享至朋友圈

相关阅读

Claude自动玩崩铁清日常,NUS新论文完整测评AI电脑操控

炉石传说、下单购物、做PPT,Claude都能搞定

奇月

2024-12-01

Claude

游戏

AI被连续否定30次:ChatGPT越改越错,Claude坚持自我,甚至已读不回

但Claude会自我纠正拼写错误

十三

2024-09-08

AI

ChatGPT

Claude

谷歌急投20亿押注ChatGPT「最强竞品」,GPT-3核心成员出走打造,多方出击抗衡微软

公司聊天机器人已在内测中

衡宇

2023-02-04

ChatGPT

Claude

谷歌

arXiv创始人亲测:水论文这一块,Grok最强,Claude最不配合

henry

2026-03-09

Claude

Grok

Llama惨遭抛弃!Meta内部改用Claude写代码

LeCun称自己比AI热门方向超前5年

闻乐

2025-07-11

Claude

Meta

Yann LeCun

Claude Opus 4.1火速发布!坐稳编程之王,官方:马上还有大更新

加量不加价

明敏

2025-08-06

Anthropic

Claude

热门文章

「GPT-6」灰测demo刷屏!周四发布在即

2026-08-31

李飞飞发布:全球首个多模态世界模型

2026-09-02

还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍

2026-09-02

VC疯了!200万现金冠军奖,又花4000万造了一座AI「创业乌托邦」

2026-08-31

阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一

2026-09-02

关于量子位

加入我们

寻求报道

商务合作

扫码关注量子位

追踪人工智能新趋势,报道科技行业新突破

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司

京ICP备17005886号-1


本文来源:量子位