Apple · ML Research

数据约束下混合预训练的缩放定律

Scaling Laws for Mixture Pretraining Under Data Constraints

二〇二六年八月二十一日 · 英文原文

通过2000余次语言模型训练实验,研究稀缺目标数据与通用数据混合时的比例权衡:目标数据过少导致领域接触不足,过多则引发重复采样、收益递减及过拟合。实验覆盖低资源语言与专业领域场景,量化了混合比例对模型性能的影响,为数据配比策略提供实证依据。

随着语言模型规模的扩大,其所需的数据量也随之增长——然而许多目标数据源,如低资源语言或专业领域,本身规模有限。一种常见策略是将这些稀缺但宝贵的目标数据与丰富的通用数据混合,这带来了一个基本权衡:混合中目标数据过少会使模型对目标领域接触不足,而目标数据过多则会导致相同样本过度重复,收益递减并最终过拟合。我们通过超过2000次语言模型训练实验研究了这一权衡……

译自 Apple · ML Research · 录于 二〇二六年八月二十一日