一句话讲清楚👉🏻Direct-OPD 从小模型强化学习前后的两个检查点中提取策略变化,再用这份变化训练更强模型; Qwen3-1.7B 在 AIME 2024 上从 48.3% 提升到 58.3%,迁移过程使用 8 张 A100 约四小时。
给推理模型做可验证奖励强化学习(答案可由规则或判题器自动验对错),主要成本来自让模型反复生成完整解题过程。训练对象越大,每轮采样越慢,后训练的成本也越高。
这会带来一个很现实的问题:如果已经在 1.5B 模型上跑过一轮强化学习,升级到 4B 或 7B 后,能不能复用前一次训练的结果?
常见的知识蒸馏解决不了这个问题。它让学生模仿教师的输出分布,前提通常是教师比学生强。这里恰好相反:做过强化学习的小模型,整体能力可能仍低于待训练的大模型。让强模型照着弱模型学,反而可能把原有能力覆盖掉。
清华 AIR 与字节跳动 Seed 的联合团队提出 Direct-OPD 。它保留强化学习对小模型造成的策略变化,舍弃小模型原有的输出分布。
先看直接蒸馏为什么失败
论文用 R1-Distill-7B 做了一个很直观的实验。
它在 AIME 2024 上的初始成绩是 56.7 ,已经高于经过强化学习的 JustRL-1.5B ,后者为 51.3 。此时如果使用标准的在策略蒸馏,让 7B 模型以自己生成的推理前缀为训练状态,再拟合 1.5B 教师的 token 分布,成绩会一路降到约 50 。
左图中,标准在策略蒸馏把 R1-Distill-7B 拉低; Direct-OPD 使用强化学习前后的策略变化后,训练曲线向上。右图显示,同一份变化也能改善 Qwen3-1.7B 、 Qwen3-4B 和 R1-Distill-7B 。
强化学习后的模型同时包含小模型原有的偏好,以及强化学习后来造成的改变。直接蒸馏无法区分两者,实验中因此覆盖了 7B 学生原本更好的部分输出。 Direct-OPD 只使用强化学习前后的概率变化。
如何从两个检查点得到奖励信号
记小模型强化学习前的策略为 ,训练后的策略为 。对同一个问题 和回答 ,两者的对数概率之差是:
如果 为正,说明强化学习提高了这条回答的概率;如果为负,说明训练在压低它。
直觉上,这个差值记录了强化学习对回答概率的改动。数学上,在带 KL 约束的强化学习中,最优策略相对参考策略的对数概率比,与训练奖励只差一个缩放系数和同一问题下的常数项。因此, Direct-OPD 无需额外训练奖励模型,就能从两个检查点的概率差中得到隐式奖励。
训练学生时,解题轨迹仍由学生自己生成。模型每生成一个新 token ,前面已有的文本就是当前推理前缀。系统从学生在这个前缀下概率最高的 top- 候选中,计算每个候选在小模型强化学习前后的对数概率差。
这些分数只作用于学生实际生成的推理前缀,不要求学生复现小模型的完整推理过程。它们还会逐 token 产生反馈;相比答完整道题后才出现的可验证奖励,监督更密。
理论上的序列策略变化可以精确拆成逐 token 差值之和,实际训练却没有计算每个 token 之后的累计回报。论文采用零折扣的局部代理:当前位置的候选 token 只使用当下的策略差作为奖励,不把后续位置的变化加回来。这降低了计算复杂度,也引入了近似;当局部变化无法代表整条推理链的质量时,代理目标可能失真。
更新梯度时, Direct-OPD 也没有只使用采样出来的那一个 token 。它在 top- 候选上按学生概率求期望,以减少单次采样的方差。这个概率权重会被停止梯度,避免优化器沿着权重本身再产生额外导数。换成更直白的话:候选概率只负责决定每个奖励占多大权重,不参与这一步的反向传播。
论文还用 KL 约束防止学生偏离初始模型过远。不同检查点产生的策略变化尺度不同,固定系数很难通用。 Direct-OPD 先用学生概率对每个候选 token 的策略差加权,再根据当前批次加权均值的正负调整 KL 系数,默认范围为 。
弱于学生的模型,仍能提供有效监督
主实验使用两组强化学习前后检查点。下文 AIME 成绩均为 ave@32 :每道题采样 32 次后取平均,采样温度为 0.7 , top- 为 0.95 。它比单次作答稳定,但仍会受到采样波动影响。
第一组是 R1-Distill-1.5B 和 JustRL-1.5B ,第二组是 Nemotron-1.5B 和 QuestA-Nemotron-1.5B 。两组模型来自不同训练流程和数据,用来检验方法是否依赖某个特定教师。
JustRL 这组策略变化被迁移到三种学生模型后, AIME 2024 和 AIME 2025 的成绩均有提高。
两组检查点的完整结果。蓝色行是 Direct-OPD 训练后的成绩,绿色数字表示相对初始学生的增量。
Qwen3-1.7B 的变化最明显:
■AIME 2024 : 48.3 → 58.3 ,增加 10.0 个百分点
■AIME 2025 : 36.8 → 43.2 ,增加 6.4 个百分点
Qwen3-4B 的初始成绩是 72.5 ,远高于 JustRL-1.5B 的 51.3 ,训练后仍能达到 77.6 。 R1-Distill-7B 也从 56.7 提升到 63.1 。这两个学生在训练前已经强于小教师,因此可以排除“学生只是追上教师成绩”这一解释。
换成 QuestA 的检查点后, Qwen3-1.7B 在 AIME 2024 上从 48.3 提升到 59.0 , R1-Distill-7B 从 56.3 提升到 61.2 。效果至少没有被锁定在 JustRL 一种训练配方上。
先训练小模型,成本是否更低
论文进一步比较了两条完整训练路径:
■直接在 R1-Distill-7B 上做强化学习
■先在 R1-Distill-1.5B 上做强化学习,再把策略变化迁移到 7B
研究者在小模型训练的第 300 、 600 、 900 、 1200 和 1500 步保存检查点。每个检查点都迁移到 7B ,再与相同强化学习步数下直接训练 7B 的结果比较。
左图按总训练时间比较两条路线;中图是五个小模型检查点迁移到 7B 的过程;右图在 Qwen3 非思考模式模型上复现了相同趋势。
从第 600 步开始,小模型强化学习加 Direct-OPD 的路线,在相近墙钟时间下大多高于直接训练 7B 。
1.5B 模型做 1500 步强化学习,使用 32 张 A100 约 160 小时,折算约 5120 GPU-hours 。 7B 模型在同样的 32 张 A100 上直接训练约 320 小时,即约 10240 GPU-hours 。之后的 Direct-OPD 迁移使用 8 张 A100 约四小时,约 32 GPU-hours 。
迁移还要同时运行学生、强化学习前的教师和强化学习后的教师。由于两个教师都只有 1.5B 参数,大部分长时间采样由小模型完成,迁移阶段只占总计算量的一小部分。
并非任何小模型检查点都同样有效。第 300 步的策略变化较弱,第 900 至 1500 步更稳定。 Direct-OPD 只能迁移已有的策略变化,无法保证该检查点记录的变化本身有效。
多次强化学习的结果可以继续叠加
研究者还把两组策略变化依次用在同一个 Qwen3-1.7B 上。
第一阶段使用 JustRL 的变化, AIME 2024 从 48.3 提升到 58.3 ;第二阶段继续使用 QuestA 的变化,最终达到 63.8 。 AIME 2025 则从 36.8 提升到 46.8 。
Qwen3-1.7B 先接收 JustRL 的策略变化,再接收 QuestA 的策略变化,两项基准继续上升。
这项实验表明,在 JustRL → QuestA 这一种顺序下,两组策略变化可以依次训练同一个学生。交换顺序是否仍有效,连续加入更多策略变化后是否会互相干扰,目前还没有答案。两个阶段的边界由不同批次样本分别评估,曲线在切换处的小幅跳变属于采样方差,不能全部算作第二阶段带来的变化。
学生没有变成小教师的复制品
标准在策略蒸馏中,师生高概率 token 的重叠率通常会随训练上升。这个指标计算两者最可能选择的 token 集合有多少交集;持续上升往往意味着学生越来越接近教师的输出分布。
Direct-OPD 的跨模型家族实验却不是这样。迁移到 Qwen3 时,学生和小教师的高概率 token 重叠率长期较低,准确率仍在提高。学生输出分布的熵也保持稳定,没有出现概率集中到少数 token 的坍缩现象。这两项结果排除了“学生只是逐渐复制小教师”以及“模型靠输出分布坍缩获得表面增益”两种解释。
迁移到同家族的 R1-Distill-7B 时, token 重叠率会升高;迁移到 Qwen3-1.7B 时,重叠率保持在较低区域。
Direct-OPD 不要求学生采用小模型最偏好的 token 。它只在学生自己的候选 token 中使用小模型强化学习前后的概率变化。
训练长度并非越长越好
论文测试了 512 、 2k 、 4k 和 6k 四种响应长度。对 Qwen3-1.7B 和 R1-Distill-7B 来说, 2k 的验证表现最稳定。
固定 KL 系数为 1 时, 2k 响应长度在两种学生模型上都较稳定。
虽然训练只覆盖前 2k token ,研究者在固定的约 16k token 长生成中观察到:经过训练的模型,其高概率候选持续得到更高的教师策略差分数,变化没有停在 2k 位置。这项诊断说明训练影响延伸到了未被直接监督的后续推理前缀。
但把训练长度增加到 6k 后,验证成绩反而从 48.8 降到 45.6 。论文推测,越到生成后段,学生访问的推理前缀和候选 token 在两个教师策略下越可能都只有极低概率。此时对数概率差可能很大,却未必还代表可靠的改进方向。
同样的原因也解释了 KL 的作用。约束太弱,学生会走到教师几乎没见过的状态;约束太强,学生又无法利用策略变化。固定系数在不同师生组合上的最优值并不一致,自适应 KL 是为了让训练停留在信号仍可信的范围内。
不同师生组合偏好的 KL 系数不同;逐 token 奖励更高,也不一定对应更高的验证成绩。
适用范围与限制
Direct-OPD 适合这样的场景:团队已经能在小模型上稳定完成强化学习,希望把同一种能力迁移给多个更大的模型。小模型与目标模型可以来自不同家族,学生初始能力也可以高于小模型。
它的可靠性取决于一个前提:学生访问的推理前缀和候选 token ,在小模型强化学习前后的两个策略下仍有足够概率。任务分布相差太大,或学生走到两个教师都极少访问的区域,对数概率差就会变成噪声。 6k 响应长度带来的性能下降,正是这个前提可能失效的例子。
Direct-OPD 减少了在每个大模型上重复进行强化学习探索的成本,但没有消除小模型强化学习、检查点筛选和学生迁移的成本。响应长度、检查点选择和 KL 强度仍需逐组验证,论文尚未给出跨模型通用配置。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~