路径约束混合专家模型
Path-Constrained Mixture-of-Experts
摘要
稀疏混合专家(Sparse MoE)架构中,每个token在每层被独立路由到部分专家。研究从专家路径(expert path)视角审视MoE计算,即token在各层被选中专家的序列。实验发现,尽管N个专家和L层存在N^L条可能路径,实际token仅聚类到与语言功能对齐的一小部分路径,绝大多数路径未被探索,表明统计低效性。据此提出约束有效路径空间的架构设计。
稀疏混合专家(Sparse Mixture-of-Experts, MoE)架构在每个层独立地将每个 token 路由到一部分专家。我们提出从专家路径(expert path)的视角审视 MoE 计算——即一个 token 在所有层中依次被选中的专家序列。这一视角揭示,尽管对于 N 个专家和 L 层存在 N^L 条可能路径,但实际中 token 会聚类到与语言功能对齐的一小部分路径上,而绝大多数路径仍未被探索,这代表了统计上的低效性。这促使我们设计能够约束有效路径空间的架构……
译自 Apple · ML Research · 录于 二〇二六年七月七日