缩放定律,审慎对待
Scaling Laws, Carefully
摘要
深度学习中的缩放定律(scaling laws)描述了训练损失$L$随模型规模$N$、数据集大小$D$和计算量$C$扩大而可预测下降的幂律关系,在对数-对数坐标图上呈直线。该框架核心在于如何在$N$与$D$之间最优分配计算资源。
缩放定律(scaling laws)是深度学习中最关键的经验性发现之一。其形式简洁:训练损失 $L$ 会随着模型规模 $N$、数据集大小 $D$ 和计算量 $C$ 的扩大而可预测地下降,遵循幂律曲线,在对数-对数坐标图上呈现为一条直线。我们可以将缩放定律视为描述计算量、损失、模型规模与数据之间关系的框架;其核心在于,如何在 $N$ 和 $D$ 之间最优地分配宝贵的计算资源。
译自 Lilian Weng · 博客 · 录于 二〇二六年六月二十六日