DOPD: 双在线策略蒸馏
DOPD: Dual On-policy Distillation
摘要
在线策略蒸馏(OPD)通过以密集的token级信号监督学生采样的轨迹,实现了更优的能力迁移。为了提供高质量的监督源并提升蒸馏的性能上限,一个直观的方向是将特权信息注入教师或学生自身。然而,这种额外输入会引发一种我们称之为特权幻觉的潜在失败模式:一种混淆了学生本应弥合的可迁移能力差距与只能模仿而无法复现的信息不对称差距的模式。token级监督固有的非均匀性进一步放大了这一问题——仅有少量token承载着关键的能力信号。为此,我们提出DOPD,一种优势感知的双重蒸馏范式,它基于特权教师与特权学生策略之间的优势差距和相对概率,动态路由token级监督。每个token从教师或学生自身接收不同强度、目标和策略的监督,在传递可信能力的同时接收辅助信号,以缓解特权幻觉。在大语言模型(LLM)和视觉语言模型(VLM)设置上的大量实验表明,DOPD始终优于普通OPD及其他对比方法。在稳定性、鲁棒性、持续学习和分布外任务上的进一步结果验证了其优越性。
译自 Hugging Face · Daily Papers · arXiv:2606.30626 · 录于 二〇二六年七月一日