Apple · ML Research

长格式声学编码的分段注意力解码

Segmental Attention Decoding with Long Form Acoustic Encodings

二〇二六年七月七日 · 英文原文

针对AED(基于注意力的编码器-解码器)模型与长格式声学编码不兼容的问题,提出四项改进:向交叉注意力注入显式绝对位置编码。该模型在分段话语上训练时依赖分段边界外的有限声学上下文编码绝对帧位置,但在长格式片段中因交叉注意力键与值的排列不变性导致排序能力丧失,无法泛化。

我们解决了基于注意力的编码器-解码器(AED)模型与长格式声学编码之间的根本不兼容问题。在分段话语上训练的AED模型通过利用分段边界之外的有限声学上下文来学习编码绝对帧位置,但在解码这些线索消失的长格式片段时无法泛化。由于交叉注意力中键和值的排列不变性,模型失去了对声学编码进行排序的能力。我们提出了四项改进:(1)为每个解码步骤向交叉注意力注入显式的绝对位置编码……

译自 Apple · ML Research · 录于 二〇二六年七月七日