Hugging Face · Daily Papers

测试时AI4AI:通过约束实现强到弱能力迁移

AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses

Cheng Qian, Wenting Zhao, Liangwei Yang, Heng Wang, Jielin Qiu, Heng Ji, Silvio Savarese, Huan Wang 等 9 位
来自 University of Illinois at Urbana-Champaign
二〇二六年八月十三日 · arXiv:2608.12307 · PDF

近期关于蒸馏的研究,通常通过教师强制、在线策略蒸馏及相关训练时方法更新较小模型的参数,从而将大模型的能力迁移至小模型。本文探讨这种迁移是否能在测试时实现。我们研究“强到弱脚手架”(strong-to-weak scaffolding):即一个更强的构建模型能否构造推理时辅助框架,帮助较弱的靶模型更可靠地解决任务,而无需任何参数更新。使用四个具有代表性的心智理论基准,每个构建模型利用5%的数据作为验证集,在多轮迭代中逐步优化其辅助框架,最终确定的框架在完整测试集上评估。实验表明,这种测试时能力迁移极为有效,将靶模型平均性能从0.49提升至0.91,近乎翻倍。分析显示,性能提升主要源于将不稳定的模型推理卸载至确定性代码、基准特定路由以及严格的答案格式约束,而非鼓励靶模型进行更广泛的推理或采样。我们进一步发现,构建模型的推理努力单调提升辅助框架质量,平台效应相对于构建模型自身能力较为有限,且较弱的靶模型获益最大。这些结果表明,推理时辅助框架设计是传统训练时蒸馏的重要补充,使强模型无需重新训练即可将认知结构迁移至弱模型。

译自 Hugging Face · Daily Papers · arXiv:2608.12307 · 录于 二〇二六年八月十三日