Apple · ML Research

揭开On-Policy蒸馏:何处有益,何处有害,以及原因

Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why

二〇二六年七月十日 · 英文原文

提出一种无需训练的逐 token 分析框架,用于评估在线策略蒸馏(on-policy distillation)中监督信号对推理模型训练的影响。该框架可在不进行完整训练的情况下,判断不同教师模型或自蒸馏上下文对单个 token 的增益或损害,并揭示最优选择随 token 位置变化的规律。相关工作由研究团队完成,旨在替代传统聚合指标,降低蒸馏策略调优成本。

On-policy distillation(在线策略蒸馏)为训练推理模型提供了密集的逐 token 监督信号;然而,目前尚不清楚在何种条件下这种信号是有益的,在何种条件下又是有害的。应该使用哪个教师模型?在自蒸馏的情况下,又该选择哪种具体上下文作为监督信号?最优选择是否会因 token 的不同而变化?目前,回答这些问题通常需要昂贵的训练过程,而聚合后的性能指标掩盖了单个 token 层面的动态变化。我们提出了一种无需训练的……

译自 Apple · ML Research · 录于 二〇二六年七月十日