人民大学与蚂蚁集团联手,将AI推理模型扩展到一万亿参数

人民大学与蚂蚁集团联手,将AI推理模型扩展到一万亿参数

这项由中国人民大学高岭人工智能学院与蚂蚁集团联合发起的研究,于2026年7月发表,论文编号为arXiv:2607.12395v1,有兴趣深入了解的读者可通过该编号查询完整论文。研究团队还包括来自清华大学和浙江大学的学者,合作阵容在国内AI研究领域颇为瞩目。

如果你曾经见过一个孩子从完全不会下棋,到仅凭大量自我对弈就成长为高手,那你大概能感受到这篇论文想做的事情——只不过这里的"孩子"是一个拥有整整一万亿个参数的超大规模语言模型,而"下棋"变成了解答复杂的数学竞赛题。研究团队将这套方法命名为"Ring-Zero",其中"Zero"的含义十分直白:从零开始,不依赖任何人类标注的解题过程,只靠模型自己摸索、自己犯错、自己改正。

这套方法在学术圈被称为"零强化学习"(Zero RL)。普通的AI训练往往需要大量人工标注数据,比如专家一步步写出解题思路,让模型照着学。而零强化学习完全跳过这个昂贵且费时的环节,让模型像一个自学成才的学生:给它一道题,告诉它答对了就给奖励,答错了就不给,其余的全靠它自己琢磨。

这种方法此前已有研究者尝试过,但绝大多数实验都局限在规模相对较小的模型上。本文的核心贡献在于将这一训练范式推进到了前所未有的一万亿参数量级,并系统性地记录了在这个尺度上发生的种种奇特现象。结论相当震撼:当模型足够大,它会自发学会人类研究者费尽心思才能"教"给小模型的高级思维策略,包括分步骤整理推理过程、主动验证自己的答案、同时探索多种解题路径等等。

一、为什么"一万亿参数"是个大事

在讨论研究细节之前,有必要先把"一万亿参数"这个数字具体化。参数,粗略地说,就是模型在训练过程中学习到的"经验值",数量越多,模型能记住的知识和掌握的推理能力理论上也越强。人类大脑的神经突触连接数量大约在百万亿量级,而目前主流的大语言模型通常在数百亿到数千亿参数之间。Ring-Zero所用的基座模型 Ling-2.5-1T-Base 拥有一万亿参数,虽然通过"混合专家"架构(可以理解为:模型内部有很多"专科医生",每次只调用其中少数几位,而非全体出动)让实际运算时激活的参数量约为630亿,但总体规模依然远超大多数公开模型。

为了做对比,研究团队同时训练了一个1040亿参数的"闪速版"模型 Ling-2.5-flash-Base,激活参数约74亿。两个模型用完全相同的训练方法跑了同样的流程,最终结果清晰地说明了规模的力量:在相同训练步数下,万亿参数模型的数学竞赛得分远高于千亿参数模型,而且提升速度更快——也就是说,同样"学习"一道题,大模型能从中获得更多收益。

这一发现印证了AI领域一个颇具争议的观点,研究者称之为"苦涩的教训":历史上,无数精心设计的人工规则和工程技巧,最终都败给了更大的计算规模和更多的数据。这次实验再次为这个教训提供了有力佐证。

二、训练这个巨兽的四步菜谱

把一个"什么都不会"的基座模型训练成能解答数学竞赛题的推理高手,研究团队设计了一套四阶段流程,就像一套精心排序的烹饪步骤,每一步都有其不可替代的作用。

第一步是"唤醒推理本能"。刚出炉的基座模型就像一个读了大量书籍但从未考过试的学生——它知道很多知识,但不习惯一步步写出解题过程。这个阶段的目标就是强迫它养成这个习惯。训练方式是给它出题,让它生成16个不同的答案,然后根据答案是否正确给予奖励。为了让模型愿意尝试那些它本不擅长的"长思路"解题方式,团队使用了一种叫做"裁剪重要性采样策略梯度"的技术——用更直白的话说,就是专门放大那些"模型平时不太会走但走对了"的解题路径上的学习信号,鼓励模型多探索这些少走的路。

与此同时,训练初期还用了一个"按词计奖"而非"按题计奖"的评分方式。正常情况下,不管答案写了多长,最终奖励都是固定的。但按词计奖意味着答案越详细、推理过程越长,积累的学习信号越多。这就像鼓励学生在考试中把解题过程写得越详细越好——初期对于建立推理习惯非常有效。为了防止模型"跑偏"太远,研究团队还加了一个"KL散度惩罚"机制,可以理解为给一根弹性绳:模型可以偏离原来的风格,但橡皮绳会防止它完全变成另一个样子。这根绳子至关重要,实验证明,一旦去掉它,模型的训练在几百步后就会完全崩溃。

第二步是"自我精简与重置"。经过第一阶段的训练,模型确实学会了推理,但推理过程往往啰嗦至极——反复验算同一个步骤、绕圈子、说废话。更麻烦的是,由于训练用的计算引擎和推理时用的计算引擎在底层实现上有微小差异,长时间训练后这种误差会越积越大,最终导致训练崩溃。于是团队祭出了"自我蒸馏"这一招:用已经学会推理的"专家模型"生成大量答案,从中挑出最短的正确答案,再让模型对这些答案做一轮自我检查,把冗余部分去掉,最后把精简后的优质答案反过来"喂"给原始基座模型重新学习。这一步相当于"回炉重造":既保留了推理能力,又把冗余和误差一并清除,为后续训练提供了一个干净的起点。

第三步是"持续稳定优化"。自我蒸馏之后,模型进入第二轮强化学习。这一轮的关键变化是把奖励的计算方式从"按词计奖"改为"按题计奖"——不管答案写了多长,奖励总量相同。这一改动立竿见影:模型不再有"写长了就能多得分"的动机,输出长度趋于稳定,训练也更加平稳。同时,这一阶段去掉了第一阶段的KL惩罚绳子——因为自我蒸馏后的模型已经足够稳定,无需再限制它的探索空间。

第四步是"按难度分级训练"。经过前三个阶段,模型的推理能力已经相当可观,但它存在一个问题:无论面对什么难度的题目,都用差不多相同的篇幅来作答。简单的问题不需要长篇大论,复杂的问题则可能需要深度思考。于是研究团队把训练题目分成简单、中等、困难三个档次,分别配上最大4千、1.6万、6.4万词的篇幅限制,并用不同的系统提示语告诉模型当前面对的是哪个档次。模型在这种训练下逐渐学会了"按需分配":简单题快速作答,复杂题深思熟虑。

三、让万亿参数模型稳定运行的工程魔法

把如此庞大的模型投入强化学习训练,工程难度堪比在高速公路上为一辆行驶中的火车换轮子。研究团队在系统层面做了两项关键改造,缺少任何一项,整个训练都会在数百步内崩溃。

第一项是"混合精度控制"。现代AI训练通常使用一种叫BF16的低精度数值格式,可以节省大量显存和计算资源。但低精度意味着数值计算有细微误差。在强化学习中,有一个关键计算叫做"重要性采样比",简单说就是比较"现在的模型"和"生成答案时的模型"在同一个词上的概率差异。这个比值对精度极为敏感——一点点数值误差经过指数运算(软最大值函数内部会做指数运算)会被无限放大,最终导致训练信号失控。研究团队的解决方案是:大部分计算继续用BF16节省资源,但注意力计算中的软最大值函数和最后的词汇概率输出层改用FP32高精度计算。这个"精准点穴"式的优化,以很小的额外开销换来了训练稳定性的大幅提升。

第二项是"上下文并行优化"。当单个问答的文本长度达到数万词时,一台GPU根本装不下整个序列,必须把序列分割到多台GPU上并行计算,这就是"上下文并行"技术。常规的做法(称为"环形注意力")是让每台GPU依次从相邻GPU拿数据、计算、再传给下一台,就像一群人围成圈子传接力棒。但当GPU数量增多时,这条接力链变得很长,每台GPU都需要等前面所有人传完才能开始,效率极低。研究团队针对所用模型的混合架构做了定制化优化:对于MLA注意力层,改用"全对全"通信策略,所有GPU同时交换数据,各自独立完成计算,无需排队等待;对于闪电注意力层,则用一次"全收集"操作广播给所有GPU,立即开始计算。这些改动在数学上完全等价,但效率大幅提升。全部实验在320块H200 GPU上完成。

四、训练过程中意外发现的"两段式"成长规律

在记录训练数据时,研究团队发现了一个耐人寻味的现象,直接触及AI研究界长久以来的一个争论:强化学习到底是真的在拓展模型的能力边界,还是仅仅在把模型本来就会的东西调得更稳定?

为了回答这个问题,研究者在训练过程中同步追踪了两个指标。一个是"pass@1",即模型随机给出一个答案时的正确率,反映的是"稳定发挥"的水平。另一个是"pass@1024",即让模型连续生成1024个答案,只要其中有一个答对就算成功,反映的是"能力上限"——模型到底知不知道这道题的解法,哪怕只有极小概率能说对。

实验结果清晰地描绘出两个阶段。训练初期,pass@1024明显上升,说明模型确实在发现新的解题路径,有些题目原来1024次尝试都答不对,现在终于能答对了——这是真实的能力拓展。但到了训练中后期,pass@1024趋于平稳,不再上升,而pass@1则持续提高。这说明此时模型已经摸到了能力天花板,但还在练习如何更稳定地触及这个天花板——从"偶尔灵光一现"变成"每次都能答对"。用一个形象的比方:前期是学新技能,后期是把学会的技能练到炉火纯青。这个发现调和了学界此前的争论,指出两种观点都是对的,只是对应训练的不同阶段。

五、一万亿参数模型自发涌现的五种"高级思维"

这是整篇论文最令人惊叹的部分。研究团队在检查模型生成的推理过程时,发现了五种没有人教过它的行为,全部是自发出现的。

第一种是"拟人化表达"。模型在解题遇到困难时,会自然地流露出类似人类的情绪反应。比如发现自己之前的推导有误时,会写出"Wait, but I might have a brain fart here"(等等,我这里可能犯了个低级错误);在完成一个巧妙解法后,会出现"Genius Idea"(绝妙点子)或"nailed it"(搞定了)这样的自我褒奖。研究团队认为,这些表达来源于预训练数据中大量的网络论坛和人类思维记录,模型不仅学会了数学逻辑,还学会了人类解题时的心理历程。

第二种是"结构化格式"。在没有任何格式指令的情况下,模型自发地把推理过程组织成"第一步:……第二步:……"的清晰格式,就像一篇写给别人看的详细解题报告。研究团队指出,这种结构化行为背后有一个深层原因:把注意力分配到清晰的逻辑块上,有助于模型自身更好地"记住"前面推导的结论,从而减少错误。换句话说,有序的格式不是炫耀,而是模型自己发现的、帮助自己思考的工具。

第三种是"并行推理"。面对复杂问题时,模型会在同一个线性回答流程中主动尝试多条解题路径。比如在解完一种方法后,会写"Alternative approach: Another way to think about this problem is..."(另一种思路:这道题也可以这样考虑……),然后自己把多条路径的结论对比,只在多个方法都指向同一答案时才最终确认。这相当于在脑子里同时开了好几个"计算线程",用最终的交叉验证来保证结论的可靠性。

第四种是"自我验证"。模型在得出候选答案后,不会直接停笔,而是主动回到原题检验:把结果代入原方程看是否成立,与已知公式比对,或寻找能反驳自己的反例。用论文中的案例来说,在计算一个水平放置圆柱体的液体体积时,模型在给出积分结果后,额外用另一种公式交叉验证,并写下"all methods agree"(所有方法结论一致)才最终确认答案。

第五种是"上下文焦虑"。这是五种行为中唯一带有"缺陷"色彩的一种,但研究团队认为它同样折射出模型高度的策略意识。当模型感知到自己已经用掉了大部分可用词数、离截止点越来越近,却还没得出答案时,它会主动放弃正在进行的复杂推导,转而给出一个有根据的猜测,并明确写明理由,比如"Given the time I've invested and the ambiguity, I will proceed to make an educated guess"(鉴于我已经花了很多时间且题目存在歧义,我决定给出一个有根据的猜测)。这种行为说明模型深度理解了训练中的奖励规则:回答格式不完整得零分,而给出一个猜测至少有一定概率得分。于是在资源耗尽前,它选择了最大化期望回报的策略。

值得强调的是,研究团队在1040亿参数的小一些的模型上做了同样的训练,发现这些行为在小模型上并不能自发出现——为了让小模型产生结构化格式或自我验证行为,必须专门设计额外的奖励规则。而万亿参数模型在没有任何这类规则的情况下自发习得了全部五种策略,这正是"苦涩的教训"在本研究中最直观的体现。

六、如何衡量"推理质量"而不只看对错

传统的AI评测方法只看最终答案对不对,忽视了推理过程本身的质量。研究团队认为这远远不够,于是提出了一套从三个维度评估推理链质量的框架。

第一个维度是"可理解性",即人类读者能否顺着模型的推理思路、不觉费力地理解全过程。评测方法是让另一个大模型充当裁判,将Ring-Zero的推理链与其他模型的推理链进行两两比较,判断哪个更清晰、逻辑更连贯、更少出现无中生有的错误断言。在AIME竞赛题的90道题目上,Ring-Zero对阵四个业界顶尖模型(包括GLM-5.1、Kimi K2.6、MiniMax M2.7和Qwen3.5-397B),胜率压倒性领先,最低胜率也达到64%。

第二个维度是"可复现性",即其他人(或弱一些的模型)能否通过阅读这份推理记录、学到解决类似问题的通用方法。评测方式是把Ring-Zero生成的推理链作为训练数据,教给两个能力较弱的模型(Qwen2.5-32B和Llama3.3-70B),看它们的能力提升幅度。结果显示,仅用10万条Ring-Zero的推理数据训练出的学生模型,在数学竞赛上的得分比用DeepSeek-R1的80万条数据训练出来的学生模型还高——Qwen2.5-32B提升了5.8个百分点,Llama3.3-70B提升了4.5个百分点。这意味着Ring-Zero的推理过程包含了密度更高、更容易迁移的"解题智慧"。

第三个维度是"效率",即模型能否用尽可能少的词数得出正确答案,不说废话、不绕弯路。评测方法是找出所有五个模型都答对的题目,比较各自推理链的平均词数。Ring-Zero平均只用6368个词,而其他四个模型的平均词数都在14000到17000之间。同样答对一道题,Ring-Zero的推理链长度不足竞争对手的一半。

七、数学竞赛成绩单

研究团队在七个高难度数学竞赛基准测试上评估了Ring-Zero,包括AIME 2024、AIME 2025、AIME 2026、HMMT February 2025、HMMT November 2025、HMMT February 2026和IMOAnswerBench。这些都是真实竞赛题目,难度相当于美国高中数学奥林匹克至国际数学奥林匹克的水平,普通人见了大概头皮发麻。

仅靠第一阶段强化学习训练出的Ring-2.5-1T-Zero,在AIME 2026上就达到了84.2%的正确率。经过完整四阶段训练之后,最终版本在AIME 2024上达到94.1%,AIME 2025达到92.3%,AIME 2026达到93.2%,HMMT Feb 2025达到90.6%,HMMT Nov 2025达到90.8%,HMMT Feb 2026达到81%。这些成绩与当前业界顶尖的专有商业模型(GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.8等)处于相近水平,而Ring-Zero完全不依赖人工标注的推理数据。

三档推理模式(低档4千词预算、中档1.6万词预算、高档12.8万词预算)的对比结果说明了一个实用价值:面对不需要深度推理的简单问题,低档模式以平均仅2353词的推理长度给出答案,速度和成本大幅降低,而中档模式在保持相当竞争力的同时,词数也远少于高档模式。用户可以根据实际需求灵活选择。

八、一些值得警惕的发现

研究团队也坦诚记录了训练过程中发现的问题和局限。

一个叫做"长度惯性"的现象颇为有趣。按词计奖的训练方式确实让模型学会了写长推理链,但同时也让模型养成了一个坏习惯:即便面对它早已能轻松答对的简单题,随着训练推进,它的答案长度也会不断增加。研究团队专门追踪了那些"第一次就答对"的简单题,发现随着训练步数增加,这些题的回答长度依然在增长——模型并非因为题目变难才写更多,而是单纯地学会了"写多一点总是更保险"的懒惰策略。两种不同窗口大小(1.6万词和3.2万词)的对比实验也证实了这一点:给更大的窗口,模型就把整个窗口填满,但答题质量几乎没有提升。这正是三阶段引入"按题计奖"和自我蒸馏的原因。

训练数据的分布也是一个重要发现。现实世界的数学题难度分布呈长尾状——大量简单题,少量难题。但研究团队发现,按照这个自然分布训练对模型没有好处,甚至会拖慢进步。简单题对于一个已经具备一定推理能力的模型来说几乎无法提供新的学习信号,反而浪费了宝贵的计算资源。高效的训练需要动态调整数据难度,随着模型能力增强不断提供更有挑战性的题目。这个结论对于设计大规模AI训练课程有很强的参考价值。

此外,研究团队也明确指出了零强化学习的天花板:它只能发掘预训练时已经学到的知识,无法凭空创造新的数学定理或证明技巧。如果某个数学概念在预训练数据中完全缺席,再强的强化学习也无法让模型掌握它。

说到底,这项研究最深刻的价值可能不在于它创造了多高的数学竞赛成绩,而在于它系统性地证明了:当模型足够大、训练足够充分时,许多人们原以为需要精心设计和手动注入的"聪明行为",会作为副产品自然涌现出来。这对整个AI研究领域的方向选择都有重要启示——与其投入大量精力设计各种人工规则和特殊奖励,不如把资源放在更大的模型和更稳定的训练基础设施上。当然,这也意味着计算资源的门槛越来越高,能够复现或推进这类研究的团队将越来越少。有兴趣深入了解全部技术细节的读者,可以通过arXiv编号2607.12395查阅完整论文。

Q&A

Q1:零强化学习(Zero RL)和普通的AI训练有什么区别?

A:普通AI训练通常需要大量人工标注数据,比如专家写好解题过程让模型照着学。零强化学习完全跳过这个环节,模型只从一道题答对或答错的结果中自己摸索,无需任何人工示范。Ring-Zero就是用这种方式,在没有人工标注的情况下,从零训练出了能解答数学竞赛题的推理能力。

Q2:Ring-Zero的"五种涌现行为"是什么意思,为什么重要?

A:涌现行为是指模型自发学会的、没有人教过的技能。Ring-2.5-1T-Zero在训练后自发出现了五种:像人一样表达情绪、自动整理推理步骤、同时探索多种解法、主动验证答案、以及在词数快用完时改为猜测。这些行为在较小的模型上不会自然出现,说明足够大的模型规模本身就能"解锁"复杂思维策略,不需要额外规则来强制引导。

Q3:Ring-Zero的推理过程为什么比其他顶尖模型用的词少很多?

A:因为训练流程中有一个"自我蒸馏"环节,专门把冗余的推理步骤去掉,让模型学会走最直接的逻辑路径。同时后期训练把奖励方式从"按词计分"改为"按题计分",消除了模型"写越多得越多"的动机。最终Ring-Zero解同一道题平均只用约6400词,而其他模型通常需要14000到17000词。