自监督视觉在策略蒸馏
Self-Supervised Visual On-Policy Distillation
来自 University of California at San Diego
摘要
视觉在线策略蒸馏在很大程度上依赖于信息丰富的师生不对称性,这种不对称性要么来自更大、更强的教师模型,要么来自特权监督(如参考答案或真实感兴趣区域)。这引出了一个根本性问题:当没有任何特权信息可用时,信息丰富的不对称性从何而来?我们的回答是反转不对称性的来源方向。与其向教师添加特权信息,不如从学生中减去信息。这种不对称性免费产生了与能够访问学生不可得信息的教师相同的有效学习信号,无需真实标注、奖励或单独的更强教师模型。基于这一原则,我们提出了自监督视觉在线策略蒸馏(S^2VOPD),这是一种简单而有效的方法,从不对称增强视图中构建在线策略学习信号。S^2VOPD将教师基于原始图像的在线策略分布蒸馏到学生基于同一图像强增强视图的条件分布中。我们系统探索了广泛的视觉增强设计空间,并发现:(1)不对称性至关重要:所有四类增强族均提升性能,而对称自蒸馏则降低性能;(2)强度至关重要:性能在中等强度时达到峰值;(3)差距必须保持任务一致性:完全移除问题相关证据的增强可能引发大但无信息的差异。在六个细粒度感知基准上,S^2VOPD将Qwen3.5-4B从70.7%提升至77.4%,超过所有对比的开源模型(最高至235B的Qwen3-VL),并超越GPT-5.4。在保持训练数据相同的情况下,它恢复了使用特权信息方法所取得改进的96%。网站位于 https://williamium3000.github.io/s2vopd
译自 Hugging Face · Daily Papers · arXiv:2608.14144 · 录于 二〇二六年八月十七日