语音代理能否处理双语客户?在代码切换语音上基准测试前沿ASR
Can Voice Agents Handle Bilingual Customers? Benchmarking Frontier ASR on Code-Switched Speech
ServiceNow AI 团队构建了一个语码转换(code-switching)ASR 基准测试(benchmark)和数据集,覆盖西班牙语-英语、法语-英语、加拿大法语-英语和德语-英语四种语言对,包含 918 条合成音频,聚焦 HR 和 IT 服务管理场景。他们使用 AU-Harness 评估了 ElevenLabs Scribe V2、Gemini 3 Flash、AssemblyAI Universal 3-Pro 等七个 ASR 系统,报告词错误率(WER)、语义 WER(SWER)和答案错误率(AER)。结果显示,Scribe V2 在多数指标上领先,Gemini 3 Flash 在语义指标上表现突出;语码转换主要暴露模型鲁棒性差异,错误集中在嵌入的英语片段而非转换点。
](https://huggingface.co/shamagupta)
* 引言
全球超过一半的人口使用不止一种语言。对于许多双语使用者来说,语码转换(code-switching)——在语言之间无缝切换,甚至在句子中间切换——是日常交流中自然的一部分。无论是在日常对话、联络中心还是 IT 服务台,说话者都能流畅地适应当时感觉最自然的语言。
尽管全球双语使用者很普遍,但针对语音 agent(agent)如何处理企业环境中的语码转换语音的研究却很少。因此,当一位客户询问我们的语音 agent 如何为其经常进行语码转换的双语客户群体服务时,我们决定构建自己的基准测试(benchmark)和数据集来评估模型。我们专注于自动语音识别(ASR)——任何语音 agent 流水线(pipeline)的第一步——因为转录错误会传播到所有下游组件。在企业环境中,一个错误路由的工单或误解的政策问题会带来实际的运营后果,因此正确转录是语音 agent 流水线中尤为重要的一步。
我们的基准测试涵盖了与客户群最相关的四种语言对:西班牙语-英语、法语-英语、加拿大法语-英语和德语-英语。它使用非英语语言作为基质语言(matrix language),嵌入不同长度的英语片段。数据涵盖了广泛的人力资源(HR)和 IT 服务管理(ITSM)场景,包括员工关于福利或薪资的询问,以及诸如密码重置、VPN 访问或设备故障排除等支持请求。为了衡量不同模型的表现,我们报告三个指标:词错误率(WER)、语义词错误率(SWER)和答案错误率(AER)。我们选择这些指标是为了同时捕捉(1)模型在转录中的精确准确度,以及(2)它们为下游任务保留话语含义的能力。
我们通过用于评估语音模型的工具 AU-Harness 发布我们的基准测试和数据集。我们还提供了七个 ASR 系统的结果,包括一些大型音频语言模型(LALM)、前沿 ASR 和开源 ASR。我们的主要发现是,语码转换的成本因测试的语言对和模型而异。ElevenLabs Scribe V2、Gemini 3 Flash 和 Assembly AI Universal 3-Pro 在该任务中成为各项指标上的顶级模型。
基准测试
数据流水线
我们从内部 IT 支持和 HR 交互语料库开始。为了创建每个语码转换的话语,我们从英语和四种非英语语言之一的平行用户话语开始,然后筛选出适合语码转换的候选。我们保留长度在 12 到 40 个词之间的话语——足够短以成为自然的语音轮次,又足够长以包含真正的转换机会。我们还排除了实体占主导的话语——电子邮件、电话号码、ID 或 URL,这些会使文本一半是英语,但这是出于必要性而非双语选择。最后,我们要求至少有三个可转换的实义词(content words)——名词、动词或形容词,且不是实体或产品名称——以便为生成模型提供足够的素材来产生有意义的语码转换版本。
在此基础上,我们测试了多种以现实方式组合语言的策略,最终选择了一个简单的角色提示(persona prompt)发送给 LLM(OpenAI/GPT-5)来生成语码转换文本。然后,我们使用 LLM 的口语化处理(verbalization pass)将文本转换为其口语形式,并使用 ElevenLabs Multilingual V2 合成音频。每个话语随后由一位母语为基质语言的 AI/NLP 语言学家进行审查;被标记的话语会被排除或重新生成并再次审查。最终数据集包含 259 条西班牙语-英语记录、298 条法语-英语记录、188 条加拿大法语-英语记录和 173 条德语-英语记录。
评估方法
我们为每个语言对的每个模型报告三个指标,旨在捕捉转录准确度、含义保留和下游任务性能:
- 词错误率(WER)。除了每个语言对的整体 WER,我们还报告按单个语言划分的 WER。
- 语义 WER(SWER)。该分数表示被判定为具有语义意义的错误率。我们的实现主要基于 Pipecat 的 STT 基准测试,并使用 Gemma-4-31B 作为评判模型。
- 答案错误率(AER)。该指标直接捕捉转录错误是否会传播到下游失败中。这是一个问答指标,遵循 Bhushan 等人(IISc/ARTPARK, arXiv 2507.16456) 的方法。对于每个话语,我们生成三个下游理解问题,并衡量阅读 ASR 转录文本的 LLM 能否正确回答它们。流程如下图所示。

发现
我们评估了以下模型:
- AssemblyAI / Universal 3-Pro
- Deepgram / Nova 3 Multilang
- ElevenLabs / Scribe V2
- Google / Gemini 3 Flash
- Mistral AI / Voxtral Small 24B-2507
- Nvidia / Parakeet TDT 0.6b V3
- OpenAI / Whisper Large V3 Turbo
A. 模型在我们的语码转换基准测试中表现如何?
我们从两个维度分析了错误:
- 词级准确度,通过 WER 衡量。WER 是标准方法:它将真实转录文本与模型输出对齐,并量化它们之间的距离。虽然它简单且被广泛使用,但它无法区分微小的拼写差异和完全错误的词。
- 语义准确度,通过 SWER 和 AER 捕捉。SWER 为我们提供了话语级性能的整体视图,尽管它反映的是评判模型的评估而非直接的下游测试。相比之下,AER 是一个功能性测试:对于每个话语,三个理解问题衡量转录中是否保留了最关键的细节——案例编号、姓名、日期、请求原因。
当模型在不同指标上表现出现分歧时,指标之间的差异变得最有意义。
WER 结果(越低越好)
- ElevenLabs/Scribe V2 和 AssemblyAI/Universal-3 Pro 在转录准确度上是排名前两位的模型。它们在西班牙语-英语上持平,在所有其他语言对上相差 0.02-0.13 个百分点,Scribe 在每个语言对上略微领先。
- Google/Gemini 3 Flash 在每个语言对上紧随其后,在加拿大法语-英语上差距最大,落后 Scribe 0.14 个百分点,落后 AssemblyAI 0.12 个百分点。Deepgram/Nova-3、Mistral/Voxtral 和 Nvidia/Parakeet 占据中间排名,每个模型至少在一种语言对上表现突出。Parakeet 是三者中整体最弱的,但在德语-英语上缩小了差距,其表现优于 Nova-3 和 Voxtral。
- OpenAI/Whisper Large V3 Turbo 垫底,WER 范围在 0.16 到 0.61 之间。虽然这是一个显著的下降,但它反映了 Whisper 已知的局限性。当在没有明确语言参数的情况下处理语码转换音频时,Whisper 默认翻译成英语而不是转录,未能保留音频中所说的语言。
SWER 和 AER 结果(越低越好)
- Scribe V2 仍保持第一,SWER 和 AER 分数非常低。
- 虽然 Assembly AI 在 WER 上跨语言对排名第一或第二,但 Gemini 3 Flash 在 AER 上始终优于它,并将 AssemblyAI 推至第三位。同样的模式也出现在 SWER 上,尽管 AssemblyAI 在西班牙语-英语上优于 Gemini。作为 LALM,Gemini 针对语言理解和推理进行了优化,这很可能使其在含义敏感的指标上具有优势,即使其原始转录准确度有所不足。
- Whisper 也出现了类似的性能变化。虽然它仍然始终排名最后,但其表现不佳的差距在语义指标下显著缩小,这是其倾向于将语码转换音频翻译成英语而不是转录的直接结果。
语义结果还揭示了 SWER 和 AER 之间显著的一致性。这两个指标在不同的粒度上运作——SWER 聚合每个词的错误,而 AER 衡量每个话语的三个理解问题能否被正确回答——因此规模上的差异是预期的。值得注意的是,在这两个指标上,模型的相对排名是多么稳定。一个明显的异常值是 Deepgram Nova-3,它在 SWER 上处于中游,但在所有语言对的 AER 上排名最后或倒数第二。这种差距在西班牙语-英语上最为明显:Nova-3 的总体语义错误率低于其在对最重要细节上的错误率。
B. 与纯单语语音相比,语码转换增加了多少额外成本?
虽然这些结果清晰地展示了模型在语码转换语音上的相对性能,但它们并未揭示错误是源于转录本身的固有难度,还是源于语言转换带来的额外挑战。
为了分离语码转换的成本,我们通过评估流水线对每个话语运行了三种音频:语码转换音频、相同内容的单语基质语言音频和单语英语音频。对于每个话语,我们测量了语码转换和单语条件下 WER 的差异,并汇总了跨基准测试的差值。以下是结果。
- Scribe V2、Gemini 3 Flash 和 AssemblyAI 整体上显示出最小的差值,其中 Scribe V2 显著优于其自身的 L2 基线,表明其对双语输入具有真正的鲁棒性。
- 语码转换的影响也遵循一个直观的模式:顶级系统相对于单语基线只产生很小的惩罚,而排名较低的模型则退化得更严重,这表明语码转换主要暴露了鲁棒性方面的差异,而不是在所有模型上均匀地提高难度。
- 在所有语言对中都出现了一个一致的结构性模式:绿色条(相对于英语的成本)几乎总是大于红色条(相对于 L2 的成本),这是预期的——对于大多数模型来说,L2 基线本身比英语更难,因此相对于它测量的净转换惩罚更小。最明显的异常值是 Whisper,它相对于英语显示出最大的退化,在德语-英语上达到峰值 +0.85。它也是唯一一个在语码转换语音上表现优于单语 L2 的模型——这是默认进行翻译的直接结果,从而完全绕过了基质语言。
C. 语码转换如何破坏 ASR 系统?
既然我们知道语码转换会导致模型出错,我们转而研究与这些错误相关的具体条件。为了解决这个问题,我们拟合了一个两部分模型:
- 首先,我们使用逻辑回归来询问哪些变量与至少发生一个转录错误相关。
- 其次,在至少发生一个错误的条件下,我们使用普通最小二乘法(OLS)回归来检验哪些变量与错误幅度相关。
这种两部分方法使我们能够区分哪些因素使错误更可能发生,以及哪些因素在错误发生后影响其大小。两个步骤都包含相同的预测变量:(1)话语中语言转换的次数,以及(2)话语的语码混合指数(CMI)——从第二语言中抽取的词相对于基质语言的比例,遵循 Gambäck 和 Das 的方法。我们还加入了话语长度作为控制变量,因为较长的话语提供了更多出错的机会。
与转录错误相关的变量
从模型的第一部分,我们发现话语中的语言转换次数是与转录错误是否发生最一致的预测变量。每次语言变化似乎都引入了转录过程可能失败的额外机会。这种关系在法语-英语语言对中尤其显著,其中七个模型中有六个表现出这种关系。其他预测变量——CMI 和话语长度——与错误发生几乎没有显著关系。
当问题转向错误幅度时,出现了不同的模式。CMI 成为更强的预测变量,而不是转换次数。特别是在德语-英语语言对中,七个模型中有四个显示出 CMI 与 WER 之间存在显著的正相关关系。这表明,一旦发生错误,其严重程度并非由说话者转换语言的频率决定,而是由混合的整体密度决定:话语交织两种语言的程度越彻底,产生的转录错误往往就越大。
导致转录错误的语码转换话语部分
两部分模型解释了哪些因素与错误的发生和恶化相关。我们的最终实验检验了语码转换话语的哪些部分对这些错误贡献不成比例。为了测试错误在话语的英语和非英语部分之间是否分布不同,我们使用 GPT-5 为每个词标记语言,然后将每个转录错误归因于其发生所在词的语言,计算每个语言的 WER。下面的热图显示了结果。
所有模型和语言对的模式都是一致的:错误集中在话语的英语部分,而不是基质语言部分。这有悖常理——英语是这些模型在单语设置中通常处理得最好的语言。一种解释是,语码转换语音中的英语片段可能不成比例地包含更难转录的技术词汇或命名实体。另一种解释是,无论嵌入哪种语言,嵌入语言片段都会创造一个具有挑战性的上下文:当模型过渡到一段非基质语言时,它必须在话语中间适应不同的音系和词汇语域,从而恰好在该片段上增加出错的可能性。
这一结果表明,语码转换 ASR 中的转录难度并不仅仅集中在转换点上,而是更广泛地延伸到嵌入语言片段中。解开这种模式是反映了英语片段的词汇特征、它们作为嵌入语言的结构性角色,还是当前模型在话语中间适应能力的有限性,是未来研究的一个有前景的方向。
局限性
有几个局限性值得承认:
- 基准测试是合成的。所有音频都是通过文本转语音(TTS)模型生成的,而不是由自然的双语说话者录制的。因此,该基准测试可能无法完全捕捉真实语码转换语音的韵律和音系特征。
- 所有模型仅使用“自动语言检测”进行评估。某些系统暴露了配置——强制语言标记、多语言提示等——这些可能会提高语码转换音频的转录质量。我们选择自动检测是因为它匹配了生产环境,在该环境中系统事先不知道呼叫者将使用哪种语言对。
- 按语言划分的 WER 排除了插入错误。我们的按语言 WER 是通过将每个参考词标记为英语或非英语,并将错误归因到相应的桶中来计算的。插入错误无法在没有额外模型调用来识别插入词语言的情况下归因于某种语言,因此我们从按语言计算中排除了它们。它们仍然被计入总 WER。
结论
语码转换长期以来一直是语音模型的压力测试。我们的结果表明,对于最好的前沿 ASR 系统,它正日益成为一种正常状态。
当企业谨慎选择其 ASR 系统时,双语客户可以自然地说话——根据对话需要在句子中间切换语言——而不会牺牲转录质量或下游任务性能。我们基准测试中的顶级模型处理语码转换语音时,相对于其单语基线,其惩罚小得惊人,而语义指标则讲述了一个更令人鼓舞的故事。
但情况并非完全乐观。在做出生产决策之前,您必须对客户实际使用的语言进行基准测试——不同模型和语言对之间的性能差异很大,对于西班牙语-英语使用者来说的最佳选择,不一定也是德语-英语使用者的最佳选择。

