Apple · ML Research

惊人简单的自蒸馏提升代码生成

Embarrassingly Simple Self-Distillation Improves Code Generation

二〇二六年七月十七日 · 英文原文

一项研究提出简单自蒸馏(SSD)方法,使大型语言模型(LLM)仅凭自身原始输出即可提升代码生成能力,无需验证器、教师模型或强化学习。该方法以特定温度和截断配置从模型中采样解决方案,再进行标准监督微调。SSD将Qwen3-30B-Instruct在LiveCodeBench v6上的pass@1从42.4%提升至55.3%,提升集中在较难问题上,并在4B、8B和30B规模的Qwen和Llama模型上表现出泛化能力。

一个大型语言模型(LLM)能否仅凭自身原始输出,在无需验证器、教师模型或强化学习的情况下,提升代码生成能力?我们通过简单自蒸馏(SSD)给出了肯定答案:以特定温度和截断配置从模型中采样解决方案,然后对这些样本进行标准监督微调。SSD 将 Qwen3-30B-Instruct 在 LiveCodeBench v6 上的 pass@1 从 42.4% 提升至 55.3%,且提升集中在较难问题上,并在 4B、8B 和 30B 规模的 Qwen 和 Llama 模型上均表现出泛化能力,包括两者……

译自 Apple · ML Research · 录于 二〇二六年七月十七日