AI前沿 | 2026年9月5日:Claude 用 11 天证明费马大定理——1300 万行代码背后的多智能体编排革命 📅 发布时间:2026/9/6 5:35:09 👁 浏览次数: AI前沿 | 2026年9月5日Claude 用 11 天证明费马大定理——1300 万行代码背后的多智能体编排革命 Anthropic 宣布Claude 仅用 11 天就完成了费马大定理的首个端到端机器验证证明产出 1300 万行 Lean 代码、验证 29500 条定理、消耗 60 亿 Token。这是数学史上最大规模的自动形式化突破而真正的胜负手不在模型在于清华姚班出身的彭天翼团队打造的 Prove2Me 多智能体编排平台。一、11 天 vs 人类 358 年一次机器验证的里程碑费马大定理从 1637 年提出到 1994 年怀尔斯给出证明人类用了 358 年。而这一次Claude 只用了11 天就完成了它的首个端到端机器验证证明。形式化证明的严苛之处在于必须从最底层公理开始一层层往上盖。所以 Claude 不光证明了费马大定理本身还顺手把中间需要的29000 多条其他数学定理一并证明了涉及代数、几何、数论、调和分析等此前从未被形式化的分支。关键数字数值耗时11 天Lean 代码量1300 万行可验证定理30300 条29500 条采用Token 消耗60 亿相对 Mathlib体量 5 倍最后 Lean 编译器全检查通过只依赖三条最基础的标准公理。二、多智能体「翻车」早期尝试只贡献了 7% 代码这次突破最有价值的部分恰恰是它最初的失败。Anthropic 透露早期几十个 Claude 智能体协作没多久就彻底乱套——像没头苍蝇一样互相跟不上进度合作效率低到爆炸。早期失败尝试贡献的代码最后只占了最终成果的 7%。这暴露了多智能体协作的核心难题几十个 AI 同时推进一个巨大证明时每个智能体都不知道「别人在做什么」「我该做什么」「依赖的前置定理是否已经完成」。缺乏统一调度时算力越堆越多效率却直线下降。对技术人的启示多智能体不是「开更多的 AI 实例」那么简单。没有编排层的多智能体就是一群各说各话的专家产出 93% 的废代码。「智能体的数量」从来不是优势「智能体之间的协调协议」才是。三、Prove2Me给 AI 配一个「超级项目经理」关键时刻彭天翼团队打造了Prove2Me 平台相当于给 AI 们配了个超级项目经理专治协作混乱机制作用定理 DAG任务树给每个 AI 一张清晰「地图」告诉它下一步该证明哪个中间节点陈述与证明分离加快编译速度节省资源自然语言索引每个定理都留人话描述AI 检索复用成果方便配上 Claude Code 的多智能体框架AI 们就像装了导航的工兵在数学迷宫里狂飙11 天打通全关。这套框架的通用性也得到了验证用 3 个普通账号在 Prove2Me 上花了 3 天就把数论里著名的「维诺格拉多夫三素数定理」也给形式化了。对创业者的启示Prove2Me 的「定理 DAG 自然语言索引」本质是一套可复用的任务编排范式——把大目标拆成有依赖关系的 DAG每个节点挂一个自然语言描述让多个智能体并行推进、随时检索成果。这个模式可以直接迁移到软件工程、数据分析、科研流程等任何「长程多步骤」场景。四、幕后清华「姚班」出身的超级学霸领队是哥伦比亚大学商学院助理教授、Anthropic 研究员——彭天翼。这位清华「姚班」出身的学霸现在一边在哥大任教一边在 Anthropic 搞 AI 智能体和形式化工具。他的团队证明了一个关键判断模型能力达到一定门槛后决定成败的就不再是「模型多强」而是「编排多好」。这与 Anthropic 同期发布的 Claude Fable 5.1「38 小时无人值守」案例形成了呼应——真正的竞争壁垒正在从底层模型向上迁移到 Agent 编排层。对创业者的启示当 GPT-6 Astra、Claude Fable 5.1 等前沿模型的能力趋于同质创业者该押注的不是「下一个更强的模型」而是「如何把现有模型组织成能独立完成长程任务的系统」。彭天翼用 1300 万行 Lean 代码证明了这一点。来源新智元 / Mars AI 延伸阅读 · 我的付费专栏觉得这篇文章对你有帮助我把同类主题的系统化内容沉淀成了付费专栏欢迎订阅支持持续输出专栏定价内容大模型工程师修炼手记9.9 元51 篇 AI 编程 / Agent 深度实战AI时代程序员的自我提升89.9 元27 篇 AI 时代成长方法论 一杯咖啡的价格换来系统化的知识体系你的订阅是我持续创作的最大动力。