Allen AI · 官方

混合模型对哪些token预测更准?| Ai2

Which tokens does a hybrid model predict better? | Ai2

二〇二六年六月二十五日 · 英文原文

Allen AI 将自家7B参数Transformer模型Olmo 3与混合模型Olmo Hybrid进行逐token对比,发现混合模型在名词、动词、形容词等实词及需跟踪上下文的代词上预测更优,损失差距约0.04;而在重复输入内容的token(如闭合括号、逐字复制的n-gram)上优势消失,Transformer表现更好。研究还提出使用针对特定token的过滤损失作为评估指标,以揭示架构间细粒度差异。

模型对哪些类型的 token 预测得好,哪些又预测得差?这个问题对于混合模型(hybrid)这一语言模型架构尤其引人入胜——它已开始挑战标准 Transformer,我们也在通过 Olmo Hybrid 对其进行研究。混合模型在标准 benchmark 上能与 Transformer 持平甚至超越,但这些 headline 数字并未揭示混合模型相比 Transformer 具体有哪些优势。

为了揭示这些 token 级别的行为,我们最近进行了实验,将我们自己最强的 7B Transformer 模型 Olmo 3 与混合模型 Olmo Hybrid 进行直接对比。具体来说,我们以细粒度方式比较了模型在不同类型 token(作为 LLM 输入的信息单元)上的预测差异。由于 Olmo 3 和 Olmo Hybrid 在架构之外的设计尽可能一致——在数据、tokenizer 和训练方案上高度匹配——它们预测结果的任何差异主要反映了架构本身,而在 token 级别审视这些差异,使我们能够洞察混合模型相对于 Transformer 的具体优势。

结果表明,混合模型的优势在许多 token 上确实存在——但并非全部。Olmo Hybrid 在承载意义的 token(如名词、动词和形容词)上表现最强,在那些只能通过跟踪上下文才能预测的 token(如代词所指代的人)上也表现突出。但混合模型的优势在那些仅仅重复输入中已有内容的 token 上几乎消失——即从前面逐字复制的单词或短语,答案就摆在那里可供查找。这正是 Transformer 的强项所在。

注意力机制与循环机制——以及如何衡量差异

语言模型由多层重复的层堆叠而成,每一层都利用周围 token 来优化每个 token 的表示。Transformer 在每一层都使用注意力机制——模型可以直接同时利用所有更早的 token,权衡每个 token 与当前预测的相关性。这使得注意力机制擅长精确回忆某个特定的早期 token,即使该 token 出现在输入中很靠前的位置。但代价是每个 token 都要与所有更早的 token 进行比较,因此随着输入增长,注意力机制的成本急剧上升。此外,虽然注意力机制擅长回忆和聚合信息,但它也难以表示随时间顺序演化的信息。

混合模型保留了少数注意力层,但将其余层替换为循环层。与注意力层不同,循环层从左到右读取 token,并携带一个固定大小的记忆,每处理一个新 token 就将其融入记忆,因此无论输入多长,处理每个 token 的成本都保持不变。这种记忆是压缩且有损的,因此循环层无法像注意力层那样回溯到某个精确的早期 token——但它非常适合持续跟踪模型读取 token 时发生变化的信息,从而提供与注意力机制互补的优势。

为了分离注意力层和循环层的优势与劣势区域,我们向 Olmo 3 和 Olmo Hybrid 输入了文本段落——包括文章、维基百科条目、书籍和科学论文,以及结构化文本如 Python、HTML 和 LaTeX——并评分每个模型在给定样本中根据前面 token 预测每个 token 的能力。两个模型看到相同的早期 token,并为每个可能的下一 token 分配概率;我们记录了它们分配给实际后续 token 的概率。然后,我们通过计算损失差距(即两个模型之间的损失差异)来逐 token 总结两个模型之间的差异。正差距表示混合模型预测实际下一 token 更好;负差距表示 Transformer 更好。

为了找出损失差距可能集中的位置,我们进行了多项分析。首先,我们将每个 token 分类,并计算这些类别内的平均损失差距。由于原始平均值可能受其他因素影响(例如类别的稀有性或 token 在文本样本中重复的频率),我们使用回归方法重新检查了每个模式,该回归在控制其他因素不变的情况下估计类别本身的效应。

真实文本显示的结果

我们发现,Olmo Hybrid 在大多数类型的 token 上损失低于 Olmo 3——尽管并非每个 token 的差距都相同。

在散文文本中,最明显的分界线在于实词(content words)——承载意义的名词、动词和形容词——与虚词(function words)如“the”、“of”和“is”之间。混合模型预测实词比 Transformer 更好,损失差距约为 0.04,而虚词的差距接近 0.02。特别是在副词和形容词等实词类别上,混合模型的优势尤为显著,尽管某些虚词类别如存在词(“there”)也显示出混合模型的大幅优势。简而言之,混合模型的优势在说明句子主题的单词上最大,在那些任何模型几乎都能根据语法猜到的语法词上最小。

相比之下,我们发现了一些特定上下文,其中混合模型相对于 Transformer 的优势消失了。第一个是闭合括号(而非开放括号),这一模式在语言、代码和标记语言的括号中都很稳健。为什么?已知注意力机制足以表示括号匹配,这表明仅靠注意力就足以预测闭合括号。

混合模型优势几乎消失的第二个场景是当下一 token 仅仅重复段落中已有的内容时。我们通过查找重复的 n-gram 来识别这些情况——即完成一个序列的 token 之前在同一段落中逐字出现过。重复的片段越长,混合模型的领先优势就越小,直至接近零。

最后,受这些发现的启发,我们探索使用针对特定类型 token 的过滤损失作为评估指标,以在预训练实验中更好地比较不同架构。我们使用了早期 Olmo Hybrid 工作中的三个 1B 参数模型:一个 Transformer、一个混合模型和一个完全没有注意力机制的纯循环模型。在非重复的承载意义的 token 上,混合模型和纯循环模型超越了 Transformer,其中混合模型表现最佳。在重复 token 上,纯循环模型——由于没有注意力机制来回溯复制——落后于混合模型和 Transformer。因此,这些过滤后的 token 损失揭示了训练早期不同架构之间的细粒度差异(例如复制能力或实词上的差异),而这些差异在其他情况下是不可见的。

结论

这项工作带来了两点启示。首先,单一的总体损失——模型在所有 token 上的平均误差——过于粗糙,无法有效比较 Transformer 和混合架构。仅对测试特定模型能力的 token 进行损失评分,才能揭示关键差异。其次,具体到混合模型,我们发现了其在开放类 token 上具有特定优势的证据,这可能与 RNN 层的状态追踪能力有关。作为下一步,我们将把这些发现应用到正在进行的混合模型工作中。我们相信,最佳的混合架构将来自于逐 token 理解模型每个组件的优势——我们希望此类研究能帮助整个 AI 社区加深这种理解。

我们鼓励您阅读我们的完整报告,并探索 Olmo 3Olmo Hybrid 及其相关的开放成果。

订阅以每月接收关于 Ai2 最新动态的更新。

译自 Allen AI · 官方 · 录于 二〇二六年六月二十五日