数学推理完整清单:从GSM8K到AlphaGeometry,Awesome-Reasoning-Foundation-Models详解LLM解题与定理证明 📅 发布时间:2026/8/24 17:29:21 👁 浏览次数: 数学推理完整清单从GSM8K到AlphaGeometryAwesome-Reasoning-Foundation-Models详解LLM解题与定理证明【免费下载链接】Awesome-Reasoning-Foundation-Models✨✨Latest Papers and Benchmarks in Reasoning with Foundation Models项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-Reasoning-Foundation-ModelsAwesome-Reasoning-Foundation-Models是一份持续更新的开源论文清单系统梳理大模型基础模型在数学推理上的最新研究、基准与评测方法。本文带你快速看懂GSM8K 这类小学数学题基准测什么、AlphaGeometry 如何达到竞赛级几何求解、LLM 解题与定理证明的关键技术有哪些。一、这个仓库是什么为什么值得收藏这个项目基于 ACM Computing Surveys 上的综述《A Survey of Reasoning with Foundation Models》把基础模型 推理任务这条线整理成了三大块板块内容对应位置基础模型语言 / 视觉 / 多模态三大类模型谱系README.md推理任务常识、数学、逻辑、因果、视觉、音频、智能体等 9 大类README.md推理技术预训练、微调、对齐训练、MoE、上下文学习、智能体README.md对新手来说最大价值是不用再满世界找论文每个条目都标注了发表时间和论文/代码链接按时间线倒序排列从 1996 年的 Coq 证明器一路排到 2024 年的 AlphaGeometry。二、数学推理版图一个环形图看懂全部任务先看这张由项目官方制作的总览图数学推理粉色扇区被细分为四个子方向右侧的推理技术预训练、微调、MoE、上下文学习等为所有任务提供支撑三、算术推理从 GSM8K 到 Minerva 的解题之路这是新手最应该先读的部分。在 3.2.1 Arithmetic Reasoning 小节中项目收录了数学词问题Math Word Problems的完整演进史GSM8K2021/10小学数学应用题基准只有 8 千多道题却是检验 LLM 多步算术的入门试金石见 README.mdMATH2021/03高中竞赛难度多领域多步骤证明题SVAMP2021/03验证 NLP 模型是否真的会解简单数学题MGSM2022/10把 GSM8K 翻译成多语言检验模型是懂数学还是背模板Chain-of-Thought2022/01思维链提示的奠基论文让大模型一步一步想Minerva2022/06Google 专为定量推理设计的模型系列见 README.md新手提示GSM8K 分数高 ≠ 数学能力强因为它只考小学级应用题。想评估竞赛水平看 MATH 和 Minerva 的 Olympiad 成绩更有参考价值。四、几何推理AlphaGeometry 的竞赛级突破3.2.2 Geometry Reasoning 小节收录了从读图解题到自动作图的完整脉络GeoS / GeoQA / Geometry3K2015-2021早期的文本 几何图形多模态问答基准AlphaGeometry2024/01DeepMind 发布的系统在 IMO 几何题上解决了 25.5%超过人类中位数首次让 AI 在竞赛几何上达到人类选手平均水平见 README.mdAlphaGeometry 的意义在于它证明了自对弈 神经符号结合的路线可以攻克难推理题这也是整个推理领域的风向标。五、定理证明让 AI 写出机器可验证的证明定理证明Theorem Proving是数学推理中最硬核的方向3.2.3 小节按时间线收录了 30 篇工作阶段代表工作一句话解读证明器基座Lean、Coq、Metamath、Isabelle数学家的形式化工具箱神经网络起步TacticToe、CoqGym2018-2019让模型学会调用证明助手生成式证明GPT-f2020把证明当文本生成任务强化学习TacticZero、PACT2021深度强化学习从零学证明LLM 时代Thor、DSP、Lean 42021-2022草稿-草图-证明三步引导语言模型 自动证明器协同DSP 的工作流值得记住先用 LLM 写非形式化的自然语言证明草稿再转成形式化草图最后交给证明器补全——这正是现在主流数学 AI 的标准范式。六、LLM 解题的四类关键技术技术细节都集中在 4 Reasoning Techniques 一节与数学推理最相关的是 4.5.2 Chain-of-ThoughtZero-Shot CoT只在题后加一句让我们一步步思考Lets think step by step提示词都省了Self-Consistency多条推理路径采样投票简单有效PAL / PoT让模型写程序而不是算数把计算交给解释器彻底绕开算术错误Tree of Thoughts把解题过程组织成树可以回溯纠错配合 2.4 Reasoning Applications 中的STaR用模型自己的推理轨迹做自举训练和Zero-shot-CoT基线基本覆盖了推理模型如何变强的全部答案。七、快速上手三步开始探索克隆仓库本地阅读README 本身即全部资料git clone https://gitcode.com/gh_mirrors/aw/Awesome-Reasoning-Foundation-Models按目录顺序精读先 Survey 概述再数学推理 3.2 节最后回到 4.5 节技术汇总想补充新论文参考 CONTRIBUTING.md 提交 PR 即可格式照着现有条目时间 | 名称 | 论文链接即可八、总结Awesome-Reasoning-Foundation-Models 用一份 README 就讲清了 LLM 数学推理的三条主线算术解题GSM8K/MATH、几何推理AlphaGeometry、定理证明Lean/Coq LLM并配上可复现的技术地图。无论你是想跟进论文、选评测基准还是找为什么我的模型算不对数的解法这份清单都是最短路径。【免费下载链接】Awesome-Reasoning-Foundation-Models✨✨Latest Papers and Benchmarks in Reasoning with Foundation Models项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-Reasoning-Foundation-Models创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考