Apple · ML Research

用专用模型重新审视ASR错误纠正

Revisiting ASR Error Correction with Specialized Models

二〇二六年七月七日 · 英文原文

本文重新审视了使用紧凑型seq2seq模型进行ASR纠错的方法,这些模型基于真实和合成音频中的ASR错误进行训练。为扩展训练规模,通过级联TTS和ASR构建合成语料库,发现匹配真实错误分布的多样性是关键。提出了纠错优先解码(correction-first decoding),以降低延迟并减少幻觉问题。

语言模型在自动语音识别(ASR)中扮演核心角色,但大多数方法依赖仅基于文本的模型,这些模型不了解ASR的错误模式。近期,大语言模型(LLM)被应用于ASR纠错,但引入了延迟和幻觉问题。我们重新审视了使用紧凑型seq2seq模型进行ASR纠错的方法,这些模型基于真实和合成音频中的ASR错误进行训练。为了扩展训练规模,我们通过级联TTS和ASR构建了合成语料库,发现匹配真实错误分布的多样性是关键。我们提出了纠错优先解码(correction-first decoding),其中纠错…

译自 Apple · ML Research · 录于 二〇二六年七月七日