这项由清华大学主导、部分工作在Z.AI实习期间完成的研究,于2026年2月以预印本形式公开,论文编号为arXiv:2607.07508,研究方向聚焦于大型语言模型的强化学习训练效率与稳定性问题。
**大模型是怎么"学习"的?先从一个工厂比喻说起**
假设你经营一家饺子工厂。工厂里有两条线:一条是"包饺子线"(负责生产数据),另一条是"质检培训线"(负责根据质量反馈改进工人技术)。传统的做法是这样的:质检培训线必须等包饺子线把一整批饺子全部包完,才能开始培训。问题来了——有些工人包得快,有些包得慢,快的人只能坐在那里发呆,等最慢的那个人完工。这种"等人"的模式,在大模型训练里叫做"同步训练",效率低得惊人。
现代大型语言模型(就是那种能写文章、解数学题、帮你写代码的AI)的训练过程,核心就是这样一个循环:让模型生成很多回答,然后根据回答的好坏给它反馈,模型据此调整自己。这个过程在业内叫"强化学习"(Reinforcement Learning,简称RL)。而且随着任务越来越复杂——比如让AI去真实环境里调试代码、自主完成多步骤任务——模型每次生成回答所花的时间长短差异极大,短的几秒钟,长的可能要几十分钟。传统的同步等待方式,就会让大量计算资源闲置,极大地浪费时间和金钱。
正因为如此,清华大学的研究团队提出了一种名为"单轮异步优化"(Single-rollout Asynchronous Optimization,简称SAO)的新方法,试图彻底解决这个"等人"问题,同时还要保证训练的稳定性和效果。
**一、为什么"边包边学"这么难?**
回到饺子工厂的比喻。新的想法是:谁的饺子包好了,就立刻把谁送去培训,不用等其他人。这样培训线就可以一直运转,不会闲置。这种方式叫"异步训练"——生产和培训同时进行,互不等待。
然而,这个方案马上遇到了一个棘手问题:当培训线正在根据第一批饺子的质量调整工人技巧时,包饺子线已经改变了做法——因为之前的培训已经让工人进步了。于是,后来送来的饺子是按照新技术包的,但培训依据的参考标准还是旧的。这种"标准和实际操作对不上"的现象,在技术上叫做"离策略偏差"(off-policy),简单说就是:模型在学习的时候,用来参考的数据已经"过时"了。
在大模型训练中,这个问题尤其严重。因为生成数据(相当于包饺子)的模型版本,和当前正在被训练的模型版本,可能已经相差了好几代更新。如果不加处理,模型学到的东西就会越来越偏,最终崩溃。
此外,当前最流行的一种训练方法叫GRPO(Group Relative Policy Optimization,组相对策略优化),它的思路是:对每个问题同时生成一组回答(比如8个),然后比较这组回答的好坏来决定怎么改进。这就好比饺子工厂不是评价单个工人,而是把8个工人包的饺子放在一起比较,谁包得好谁就多得奖励。
问题在于,GRPO本质上也是一种"等人"方法——它必须等这8个回答都生成完,才能开始一次训练。在异步环境里,最慢的那个回答会拖累整个组,还是会产生延迟和数据过时的问题。更要命的是,在真实的智能体任务(比如让AI自主操作电脑完成复杂任务)中,往往每个问题只有一次交互机会,根本没法同时生成8个回答来比较。GRPO在这类场景下从结构上就不适用。
**二、SAO的核心思路:每包好一个饺子,立刻送去培训**
清华大学的研究团队提出的解决方案,核心思路非常直接:不等一组,只要有一个回答生成完,就立刻拿去训练。这就是"单轮"(Single-rollout)的含义——每次训练只用一条数据,而不是一组数据。
这个想法听起来简单,但实施起来有两大难题需要同时解决:第一,如何解决数据过时导致的学习偏差?第二,没有了组内比较,模型怎么知道自己的回答是好是坏?
SAO用了三套组合拳来解决这两个问题,缺一不可。
**三、第一招:给每一个"词"都贴上"新鲜度标签"**
解决数据过时问题的传统做法,是同时维护三个不同版本的模型:当前正在训练的版本、上一次训练前的旧版本、以及实际生成数据时用的版本。然后通过这三个版本之间的概率比值,来修正学习过程中的偏差。这就好比工厂里同时保留三份操作手册:现在的、上周的、以及上个月的,每次培训都要三份手册对照着来修正误差。
但在异步训练中,数据生成可能跨越了模型的多次更新,要追踪每个时刻的"上一版本"几乎不可能——你不可能无限保存历史操作手册。
SAO的解法是大刀阔斧地简化:直接用"生成数据时的模型版本"和"当前训练中的模型版本"做比较,完全抛弃中间那个"上一版本"。这省去了大量的历史追踪开销,因为生成数据时的概率本来就已经被记录下来了,不需要额外计算。
更重要的是,SAO引入了一个严格的"双边裁剪+屏蔽"机制。可以把这个机制理解为:在工厂质检时,如果一个饺子的做法和标准操作相差太远——不管是太超前还是太落后——就直接跳过,不用这个饺子的反馈来培训工人。只有差距在合理范围内的饺子,才会被纳入培训参考。
技术上,这意味着:只有当新旧版本模型对某个词的生成概率比值(即"策略比"rt(θ))落在(1-εl, 1+εh)这个区间内时,这个词才会产生梯度更新;区间之外的词直接被屏蔽,梯度清零。这和传统PPO(近端策略优化)的裁剪机制有一个关键差别:PPO只是把超出范围的梯度"截断"到边界值,而SAO是直接"清零",更加激进。参数设置上,研究团队对推理任务使用εl=0.3、εh=5.0,对编程任务使用εl=0.8、εh=3.0,上下界不对称,允许模型向"更好"的方向大步迈进,但严格限制向"更差"方向的退步。
这个看似粗暴的方法,在实验中展现了惊人的稳定性。传统的GRPO在训练到大约160步时就会崩溃(也就是模型性能突然断崖式下跌),而SAO可以稳定训练超过1000步。
**四、第二招:给模型配一个"专职教练"来打分**
解决了数据新鲜度的问题,还剩另一个核心难题:没有了组内比较,模型怎么知道自己的回答好还是坏?
GRPO的做法是把8个回答放在一起打分,高于平均的得正分,低于平均的得负分。这就像班里考试按排名给奖励,不看绝对成绩,只看相对名次。但如果每次只有一个学生考试,就没有排名可言了。
SAO的解法是引入一个专门的"价值模型"(Value Model,也叫Critic,批评者)。这个价值模型的工作,就是看着模型生成到一半的回答,预测"继续这样写下去,最终能得多少分"。有了这个预测,就可以计算出每一步操作对最终结果的贡献,从而指导模型改进,而不需要跟其他同类回答比较。
然而,价值模型说起来简单,训练起来极其容易不稳定。清华大学的研究团队发现了两个关键问题,并分别给出了解决方案。
第一个问题是价值模型"跟不上"政策模型的更新速度。模型在训练时一直在变,如果价值模型的更新频率不够高,它给出的分数预测就会越来越不准确,导致整个训练系统像个失控的指南针——越偏越远。解决方案是让价值模型的更新频率是政策模型的两倍:每次政策模型更新一次,价值模型更新两次(研究团队称之为"更快的价值更新",Faster Value Update,参数K=2)。回到饺子工厂的比喻,这就相当于:每改进一次包饺子的手法,就要重新校准两次质检标准,确保评价体系始终跟得上实际操作水平。
第二个问题更有趣。研究团队在实验中发现,价值模型的梯度(可以理解为"学习力度")经常远远大于政策模型,这意味着价值模型在训练时"用力过猛",容易把自己训练崩。深入分析后,他们发现不稳定性主要来自模型的"注意力层"(Attention Layers)——这是模型用来理解文字之间关系的核心组件。相比之下,模型的另一个组件"专家混合层"(Mixture-of-Experts,MoE)在训练中相对稳定。
基于这个发现,SAO采用了"冻结注意力"(Frozen Attention)策略:在训练价值模型时,把注意力层的参数锁死不动,只训练MoE层的参数。这就好比:工厂里有个老质检员,他判断饺子馅料(相当于MoE层)好不好的能力还需要磨练,但他判断饺子皮厚薄(相当于注意力层)的眼力已经很好了,就让他专心练馅料判断,皮厚薄的部分就别动了。这个策略显著降低了价值模型的梯度波动,使训练更加平稳。
与此同时,价值模型的"冷启动"问题也至关重要。研究发现,如果价值模型一开始的预训练数据量不够,在RL训练初期它给出的预测几乎没有参考价值,会直接拖垮整个训练过程。因此,SAO特别强调要用大量数据对价值模型进行充分的预训练,给整个系统打好地基。
**五、第三招:智能体任务的特殊挑战——跳过"观众点评"的噪音**
大模型在完成智能体任务(比如自主操作电脑、与代码执行环境交互)时,会产生一种特殊的数据结构。整个过程不是单次问答,而是一系列交替出现的"行动"和"环境反馈":模型说一句话或执行一个操作(行动),然后环境给出反应(比如代码运行结果或错误信息)(观察),模型再根据这个反应继续行动……如此循环。
用饺子工厂来类比,这就像工人包一个饺子,质检员马上说"这个皮太厚了"(环境反馈),工人调整手法再包下一个,质检员又说"这次馅太少了"……如此反复。
标准的价值估计方法(GAE,广义优势估计)在计算每一步操作价值时,会把相邻两个时刻的价值直接相减。但在智能体任务里,"模型行动结束"到"环境反馈开始"之间有一个跨越——那段环境反馈不是模型自己生成的,而是外部环境给出的。如果硬把这两段数据直接相减,就引入了不属于模型自身的噪音,价值估计会变得不准确。
SAO提出了"跳过观察的GAE"(Skip-Observation GAE)来解决这个问题。具体做法是:在计算相邻两个时刻的价值差时,直接跳过环境反馈部分,把"当前行动的最后一个词"的价值,和"下一个行动的第一个词"的价值相连,中间那段外部反馈完全绕过去。这样,优势估计就完全基于模型自己的输出,过滤掉了外部环境随机性带来的干扰。
研究团队还对比了另一种可能的方案:把整个"一轮对话"作为一个整体单元来计算价值,而不是逐词计算。结果显示,这种步骤级别的方法表现明显不如逐词级别的方法。原因在于:逐词的细粒度监督信号,能更准确地捕捉复杂推理过程中的每一个逻辑跳跃,而步骤级别的粗粒度信号则会损失大量信息。
**六、实验结果:SAO到底有多强?**
清华大学的研究团队在多个极具挑战性的基准测试上评估了SAO的表现,使用的基础模型是阿里云开源的Qwen3-30B-A3B(一个约300亿参数的混合专家模型)。
数学推理方面,研究团队选择了四个极难的数学竞赛题库:AIME2025(全美数学邀请赛2025年题目)、BeyondAIME(难度超越AIME的题库)、HMMT Nov 2025(哈佛-麻省理工数学联赛题目)、IMOAnswerBench(国际数学奥林匹克解答验证题库)。这些任务中,模型不只是直接作答,而是可以调用Python工具进行辅助计算,模拟真实的解题过程。
基础的SFT模型(经过监督微调但尚未做强化学习的版本)在AIME2025上的正确率是80.4%,BeyondAIME是53.3%,HMMT是75.2%,IMOAnswerBench是53.3%。加上标准GRPO训练后,这四项分别提升到84.2%、54.8%、76.0%、55.8%——进步有限。而SAO训练后,这四项分别跃升至97.3%、74.8%、88.3%、74.0%,全面大幅超越GRPO。其中BeyondAIME的提升尤为显著,从53.3%到74.8%,提升了超过21个百分点。
值得特别关注的是,SAO训练的模型在BeyondAIME上达到74.8%,已经非常接近GPT-5 High的74.0%,并在AIME2025(97.3% vs 94.6%)和HMMT(88.3% vs 89.2%)上与之相当,整体处于世界顶尖水平。
软件工程编程任务方面,研究团队使用了SWE-Bench Verified——这是一个要求模型自主修复真实GitHub代码仓库中的bug的基准,难度极高,需要模型通过多达300轮的交互操作来完成任务。Qwen3-30B-A3B的基础正确率是23.0%,加入GRPO(配合DIS策略)后提升到27.0%,SAO则进一步提升到29.8%。
训练稳定性是SAO最突出的优势之一。实验中,原版GRPO在训练约160步时就会发生崩溃,性能急剧下降到无法使用的程度。加入了DIS(双边重要性采样)策略的改进版GRPO虽然能够稳定训练,但效果长期不如SAO。SAO则稳定地训练了超过1000步,且在大约400步之后,与改进版GRPO之间的性能差距明显拉开,并持续扩大。
研究团队还做了详细的消融实验,来验证SAO每个组件的必要性。去掉"更快的价值更新"(只更新一次而非两次),AIME2025的成绩从97.3%降至95.0%,BeyondAIME从74.8%降至69.8%。去掉"冻结注意力"策略,AIME2025降至90.6%,虽然BeyondAIME变化不大,但训练过程明显不稳定,批评模型的梯度范数(可以理解为学习时的"抖动幅度")显著偏大。换用简单的"滑动窗口平均奖励"作为基线(不用价值模型),AIME2025只有79.8%,BeyondAIME只有55.3%,说明高质量价值模型对于单轮RL至关重要。使用原版VAPO(另一种基于价值的RL方法,但不加DIS策略),训练同样迅速崩溃,AIME2025最终只有91.3%,BeyondAIME只有69.0%。
**七、单轮RL天生适合"在线学习"——模拟用户偏好变化的实验**
SAO的单轮特性还带来了一个额外的能力:天然适合处理"环境在变化"的学习场景。
真实世界中的AI应用,用户偏好并不是一成不变的。某段时间用户喜欢一种回答风格,过一段时间又换了。传统的GRPO需要同时生成多个回答来做比较,这在"每次只有一个反馈"的真实环境里根本做不到。而SAO用价值模型来评分,每次只需要一条数据,天然契合这种场景。
为了验证这一点,研究团队设计了一个模拟实验:训练模型生成不同风格的文章,依次要求模型适应三种不同的写作风格——"可爱风"(Cute)、"中二风"(Chuunibyou)和"古典风"(Classical)。每隔一段时间,"用户偏好"(也就是奖励标准)就突然切换到下一个风格。实验用GLM-4.7来评判模型的回答是否符合当前偏好的风格,以及质量是否过关,综合给出0或1的奖励。
实验结果显示,SAO在每次偏好切换后,能够迅速调整自己的行为,快速提升新目标风格的得分,同时压制旧风格的输出。相比之下,使用滑动窗口平均奖励的对比方法,由于历史记录里还保留了大量旧偏好的数据,新偏好信号被稀释,导致模型反应迟缓,始终滞后于当前偏好。SAO的价值模型因为是"当前状态感知"的,能够更敏锐地跟随环境变化,实现快速适应。
**八、SAO已投入实际应用——助力750亿参数大模型训练**
值得一提的是,SAO不只停留在论文里。研究团队表示,SAO已经被成功部署到GLM-5.2(750B-A40B)这个开源大模型的训练流水线中。GLM-5.2是一个参数规模高达7500亿(激活参数400亿)的混合专家模型,是目前开源领域规模最大的模型之一。SAO在如此大规模的实际训练中稳定运行,证明了它不仅在实验室里有效,在真实工业部署中也具备可靠性。
**说到底,SAO做了什么?**
归根结底,SAO解决的是大模型强化学习训练中一个长期被忽视的效率与稳定性矛盾。它把流水线的思路引入了模型训练:不等人,先完成先学习;同时配上一套严格的"新鲜度检查"机制,确保学习材料不会太过时;再通过专职价值模型来弥补单次数据信息量不足的问题。三套机制缺一不可,共同构成了一个能够在复杂智能体任务上稳定训练上千步、并在多项顶尖数学和编程基准上超越竞争对手的完整系统。
对于普通读者而言,这项研究意味着:未来的AI系统不仅能处理更复杂的任务,训练成本也可能降低,训练效果也更稳定。当AI工具变得更便宜、更强大时,受益的最终是每一个使用它的人。对于AI研究领域来说,SAO提供了一个清晰的信号:单轮在线强化学习,配合精心设计的价值模型训练策略,是一个值得深入探索的方向,尤其在智能体、工具使用、以及持续在线学习等场景下。
有兴趣深入了解技术细节的读者,可以通过论文编号arXiv:2607.07508在arXiv数据库中查阅完整论文。
---
Q&A
Q1:SAO和GRPO的主要区别是什么?
A:GRPO每次需要对同一个问题生成多个回答(通常8个),比较这一组回答的好坏来训练模型,必须等最慢的那个回答生成完才能开始学习。SAO则每次只用一个回答,生成完立刻开始训练,并用一个专门的"价值模型"来代替组内比较打分,从而彻底避免了等待造成的效率损失和数据过时问题。
Q2:SAO的价值模型训练为什么要冻结注意力层?
A:研究团队在实验中发现,价值模型的注意力层在训练过程中梯度(学习力度)异常偏大,容易导致训练不稳定。而MoE层相对平稳。冻结注意力层相当于保留了预训练时学到的文字理解能力,只让模型专注调整打分部分的参数,既降低了训练难度,又提升了稳定性。
Q3:SAO在数学竞赛题上能达到什么水平?
A:基于Qwen3-30B-A3B模型,SAO训练后在AIME2025上达到97.3%正确率,在BeyondAIME上达到74.8%,在HMMT Nov 2025上达到88.3%,在IMOAnswerBench上达到74.0%,整体与GPT-5 High处于同一水平,全面超越标准GRPO训练结果。