Hugging Face · 官方博客

混合模型对哪些 token 预测更准?

Which tokens does a hybrid model predict better?

二〇二六年六月二十五日 · 英文原文

Allen AI 团队将 7B 参数的 Transformer 模型 Olmo 3 与混合模型 Olmo Hybrid 进行逐 token 对比,发现混合模型在名词、动词、形容词等承载意义的实词上预测损失更低(差距约 0.04),但在重复 n-gram 或闭合花括号等可直接通过 attention 回溯的场景中优势消失。该研究基于 arXiv 2606.20936 技术报告,提出使用过滤后的 token 损失作为评估指标,以更细粒度地揭示架构差异。

](https://huggingface.co/Ai2Comms)

📄 技术报告:https://arxiv.org/abs/2606.20936

图片2:混合token预测博客草稿也将发布到Hugging Face - Goog-image-1

模型对哪些类型的token预测得好,哪些又预测得不好?这个问题对于混合模型(hybrid)来说尤其引人入胜。混合模型是一种已经开始挑战标准Transformer的语言模型架构,我们一直在通过Olmo Hybrid对其进行研究。

在标准benchmark上,混合模型可以媲美甚至超越Transformer,但这些总体数字并未揭示混合模型相对于Transformer具体有哪些优势。

为了阐明这些token级别的行为,我们最近进行了实验,将我们最强的7B Transformer模型Olmo 3与混合模型Olmo Hybrid进行了直接对比。具体来说,我们以细粒度的方式比较了模型在不同类型token(即作为LLM输入的信息单元)上的预测差异。

由于Olmo 3和Olmo Hybrid在架构之外尽可能保持一致——数据、tokenizer和训练方案都高度匹配——它们预测中的任何差异主要反映了架构本身。在token级别审视这些差异,使我们能够深入了解混合模型相对于Transformer的具体优势。

我们的结果表明,混合模型在众多token上确实具有优势,但并非全部。Olmo Hybrid在承载意义的token上表现最强,例如名词、动词和形容词,以及那些只能通过跟踪上下文来预测的token,比如代词所指代的人物。但是,当下一个token仅仅是重复输入中已有的内容——即从前面逐字复制的单词或短语——时,混合模型的优势几乎消失,因为答案就在那里,可以直接查找。而这正是Transformer的强项所在。

注意力与循环,以及如何衡量差异

语言模型由一系列重复的层堆叠而成,每一层都利用周围的token来优化每个token的表示。

Transformer在每一层都使用attention。模型可以立即直接利用所有先前的token,权衡每个token与当前预测的相关性。这使得attention擅长精确回忆特定的早期token,即使该token出现在输入中很靠前的位置。但代价是每个token都要与所有先前的token进行比较,因此attention的计算成本会随着输入的增长而急剧上升。此外,虽然attention擅长回忆和聚合信息,但在表示随时间顺序演化的信息方面却存在困难。

混合模型保留了少数attention层,但将其余层替换为循环层(recurrent layers)。与attention层不同,循环层从左到右读取token,并携带一个固定大小的记忆,在读取过程中将每个新token折叠进记忆,因此无论输入多长,处理每个token的成本都保持不变。这种记忆是压缩且有损的,因此循环层无法像attention那样回溯到精确的早期token。但它非常适合在模型读取token时,对任何变化的信息进行持续追踪,从而为attention提供了互补的优势。

为了分离attention和循环层的优势与劣势领域,我们向Olmo 3和Olmo Hybrid输入了文本段落:文章、维基百科条目、书籍和科学论文,以及结构化文本如Python、HTML和LaTeX。我们根据每个模型在给定样本中根据先前token预测每个token的能力进行评分。

两个模型都看到了相同的先前token,并为每个可能的下一个token分配了一个概率。我们记录了每个模型赋予实际后续token的概率。然后,我们通过计算损失差距(loss gap),即两个模型之间损失的差异,来逐token总结两个模型之间的差异。正差距意味着混合模型预测真实下一个token更好。负差距意味着Transformer做得更好。

为了找出损失差距可能集中的地方,我们进行了几项分析。首先,我们将每个token归类,并计算这些类别内的平均损失差距。由于原始平均值可能受到其他因素的影响,例如某个类别的稀有性或token在文本样本中的重复频率,我们通过回归分析重新检查了每个模式,该回归在保持其他因素不变的情况下估计了类别本身的效应。

真实文本所揭示的

图片3:混合token预测社交副本 - Google Docs-image-2

我们发现,在大多数类型的token上,Olmo Hybrid的损失低于Olmo 3,尽管在每个类型上的优势程度不同。

在散文文本中,最明显的分界线是实词(content words)——承载意义的名词、动词和形容词——与虚词(function words),如“the”、“of”和“is”。混合模型预测实词比Transformer更好,损失差距约为$0.04$,而在虚词上的差距接近$0.02$。

特别是在副词和形容词等实词类别上,混合模型的优势尤为明显,尽管某些虚词类别,如存在词(existentials)例如“there”,也显示出混合模型有较大优势。简而言之,混合模型的最大优势体现在那些说明句子主题的词汇上,而最小优势体现在任何模型几乎都能根据语法猜出的语法词上。

相反,我们发现了一些特定上下文,其中混合模型相对于Transformer的优势消失了。第一个是闭合(而非开放)的花括号,这种模式在语言、代码和标记语言的括号中都很稳健。为什么?众所周知,attention足以表示括号匹配,这表明仅靠attention就足以预测闭合花括号。

图片4:混合token预测社交副本 - Google Docs-image-3

混合模型优势几乎消失的第二个地方是,当下一个token仅仅是重复段落中已有的内容时。我们通过查找重复的n-gram来发现这些情况:即完成一个序列的token在同一个段落中较早位置已经逐字出现过。重复的片段越长,混合模型的领先优势就越小,直至趋近于零。

最后,受这些发现的启发,我们探索使用针对特定类型token的过滤损失(filtered losses)作为评估指标,以便在预训练实验中更好地比较不同架构。我们使用了早期Olmo Hybrid工作中的三个1B参数模型:一个Transformer、一个混合模型和一个完全没有attention的纯循环模型。

在非重复的承载意义的token上,混合模型和纯循环模型超越了Transformer,其中混合模型表现最佳。在重复的token上,纯循环模型——由于没有attention来回溯复制——落后于混合模型和Transformer。

因此,这些过滤后的token损失揭示了架构之间不同的细粒度差异,包括复制能力以及实词上的差异,这些差异在训练早期以其他方式是无法看到的。

结论与展望

图片5:混合token预测社交副本 - Google Docs-image-4

在1B参数预训练期间,过滤后的token损失揭示了架构差异。图中展示了Transformer、混合模型和纯循环神经网络(RNN)在WSD退火检查点处的token损失曲线。

这项工作带来了两点启示。

首先,单一的总体损失——模型在所有token上的平均误差——过于粗糙,无法有效比较Transformer和混合架构。仅针对测试特定模型能力的token计算损失,能够揭示关键差异。

其次,具体到混合模型,我们发现了其在开放类(open-class)token上具有特定优势的证据,这可能与RNN层的状态追踪能力有关。

作为下一步,我们将把这些发现应用到正在进行的混合模型研究工作中。我们相信,最佳的混合架构将来自于逐token理解模型每个组件的优势所在。我们希望像这样的研究能够帮助整个AI社区加深这种理解。

我们鼓励您阅读我们的完整报告,探索Olmo 3,尝试Olmo Hybrid,并深入研究它们相关的开放成果。

译自 Hugging Face · 官方博客 · 录于 二〇二六年六月二十五日