教师
分类
给出
同时引入离策略引导,让学生从教师给出的前缀续写。
文章
问题在于,一旦学生采样到的某个token教师给出的概率趋近于0,奖励就会冲向负无穷:一次更新的方向可能被某个“倒霉”的离群token完全主导,数量级上压过成百上千个正常token的贡献总和。
文章
监督
模型压根没在这些任务上做过在策略训练,这个提升只能来自更本质的原因:信任域机制让教师监督信号被更可靠地利用,这种优化质量的提升自然会泛化到其他任务。
文章
这两个瓶颈说明:光是把“全词表KL”换成省显存的K1估计器还不够,它解决了显存问题,却把“教师监督是否可靠”这个问题暴露得更彻底。
文章
生成
TrOPD反过来在生成起点上做文章:学生的续写先接上教师生成的一段前缀,用前向KL做模仿学习,之后的才切回学生自己生成、继续走信任域机制:
文章
模型
表4:换成更强的Qwen3-SFT-1.7B学生模型和Qwen3-Nemotron-4B教师模型,多领域下TrOPD相比OPD平均提升+3.44分,AIME2024从48.02提升到52.08,IFBench从37.07提升到42.18。
文章
把上述方案统一放到相同的教师模型(Skywork-OR1-Math-7B)、学生模型(DeepSeek-Qwen2.5-1.5B)、训练配置下训了一遍,数学推理基准结果如下:
文章
大模型
相比通过结果奖励驱动模型自主探索的GRPO,OPD利用教师大模型提供细粒度监督,让端侧模型直接学习更强模型的推理能力。
文章
影响
教师与学生的能力差距越大,这一机制的收益越为显著,而这正是端侧部署的常态:在受限的参数与算力预算下,仍要求小模型尽可能完整地承接大模型的推理能力。
文章
其它
表4:换成更强的Qwen3-SFT-1.7B学生模型和Qwen3-Nemotron-4B教师模型,多领域下TrOPD相比OPD平均提升+3.44分,AIME2024从48.02提升到52.08,IFBench从37.07提升到42.18。
文章
把上述方案统一放到相同的教师模型(Skywork-OR1-Math-7B)、学生模型(DeepSeek-Qwen2.5-1.5B)、训练配置下训了一遍,数学推理基准结果如下:
文章
模型压根没在这些任务上做过在策略训练,这个提升只能来自更本质的原因:信任域机制让教师监督信号被更可靠地利用,这种优化质量的提升自然会泛化到其他任务。
文章
这两个瓶颈说明:光是把“全词表KL”换成省显存的K1估计器还不够,它解决了显存问题,却把“教师监督是否可靠”这个问题暴露得更彻底。
文章