Hugging Face · 官方博客

语音代理能否处理双语客户?在代码切换语音上基准测试前沿ASR

Can Voice Agents Handle Bilingual Customers? Benchmarking Frontier ASR on Code-Switched Speech

二〇二六年六月九日 · 英文原文

ServiceNow AI 团队构建了一个语码转换(code-switching)ASR 基准测试(benchmark)和数据集,覆盖西班牙语-英语、法语-英语、加拿大法语-英语和德语-英语四种语言对,包含 918 条合成音频,聚焦 HR 和 IT 服务管理场景。他们使用 AU-Harness 评估了 ElevenLabs Scribe V2、Gemini 3 Flash、AssemblyAI Universal 3-Pro 等七个 ASR 系统,报告词错误率(WER)、语义 WER(SWER)和答案错误率(AER)。结果显示,Scribe V2 在多数指标上领先,Gemini 3 Flash 在语义指标上表现突出;语码转换主要暴露模型鲁棒性差异,错误集中在嵌入的英语片段而非转换点。

](https://huggingface.co/shamagupta)

Image 2: Lindsay Brin 的头像

Image 3: Fanny Riols 的头像

* 引言

引言

全球超过一半的人口使用不止一种语言。对于许多双语使用者来说,语码转换(code-switching)——在语言之间无缝切换,甚至在句子中间切换——是日常交流中自然的一部分。无论是在日常对话、联络中心还是 IT 服务台,说话者都能流畅地适应当时感觉最自然的语言。

尽管全球双语使用者很普遍,但针对语音 agent(agent)如何处理企业环境中的语码转换语音的研究却很少。因此,当一位客户询问我们的语音 agent 如何为其经常进行语码转换的双语客户群体服务时,我们决定构建自己的基准测试(benchmark)和数据集来评估模型。我们专注于自动语音识别(ASR)——任何语音 agent 流水线(pipeline)的第一步——因为转录错误会传播到所有下游组件。在企业环境中,一个错误路由的工单或误解的政策问题会带来实际的运营后果,因此正确转录是语音 agent 流水线中尤为重要的一步。

我们的基准测试涵盖了与客户群最相关的四种语言对:西班牙语-英语、法语-英语、加拿大法语-英语和德语-英语。它使用非英语语言作为基质语言(matrix language),嵌入不同长度的英语片段。数据涵盖了广泛的人力资源(HR)和 IT 服务管理(ITSM)场景,包括员工关于福利或薪资的询问,以及诸如密码重置、VPN 访问或设备故障排除等支持请求。为了衡量不同模型的表现,我们报告三个指标:词错误率(WER)、语义词错误率(SWER)和答案错误率(AER)。我们选择这些指标是为了同时捕捉(1)模型在转录中的精确准确度,以及(2)它们为下游任务保留话语含义的能力。

我们通过用于评估语音模型的工具 AU-Harness 发布我们的基准测试和数据集。我们还提供了七个 ASR 系统的结果,包括一些大型音频语言模型(LALM)、前沿 ASR 和开源 ASR。我们的主要发现是,语码转换的成本因测试的语言对和模型而异。ElevenLabs Scribe V2、Gemini 3 Flash 和 Assembly AI Universal 3-Pro 在该任务中成为各项指标上的顶级模型。

Image 4Image 5

基准测试

数据流水线

我们从内部 IT 支持和 HR 交互语料库开始。为了创建每个语码转换的话语,我们从英语和四种非英语语言之一的平行用户话语开始,然后筛选出适合语码转换的候选。我们保留长度在 12 到 40 个词之间的话语——足够短以成为自然的语音轮次,又足够长以包含真正的转换机会。我们还排除了实体占主导的话语——电子邮件、电话号码、ID 或 URL,这些会使文本一半是英语,但这是出于必要性而非双语选择。最后,我们要求至少有三个可转换的实义词(content words)——名词、动词或形容词,且不是实体或产品名称——以便为生成模型提供足够的素材来产生有意义的语码转换版本。

在此基础上,我们测试了多种以现实方式组合语言的策略,最终选择了一个简单的角色提示(persona prompt)发送给 LLM(OpenAI/GPT-5)来生成语码转换文本。然后,我们使用 LLM 的口语化处理(verbalization pass)将文本转换为其口语形式,并使用 ElevenLabs Multilingual V2 合成音频。每个话语随后由一位母语为基质语言的 AI/NLP 语言学家进行审查;被标记的话语会被排除或重新生成并再次审查。最终数据集包含 259 条西班牙语-英语记录、298 条法语-英语记录、188 条加拿大法语-英语记录和 173 条德语-英语记录。Image 6: image

评估方法

我们为每个语言对的每个模型报告三个指标,旨在捕捉转录准确度、含义保留和下游任务性能:

发现

我们评估了以下模型:

A. 模型在我们的语码转换基准测试中表现如何?

我们从两个维度分析了错误:

  1. 词级准确度,通过 WER 衡量。WER 是标准方法:它将真实转录文本与模型输出对齐,并量化它们之间的距离。虽然它简单且被广泛使用,但它无法区分微小的拼写差异和完全错误的词。
  2. 语义准确度,通过 SWER 和 AER 捕捉。SWER 为我们提供了话语级性能的整体视图,尽管它反映的是评判模型的评估而非直接的下游测试。相比之下,AER 是一个功能性测试:对于每个话语,三个理解问题衡量转录中是否保留了最关键的细节——案例编号、姓名、日期、请求原因。

当模型在不同指标上表现出现分歧时,指标之间的差异变得最有意义。

WER 结果(越低越好)

Image 8: image

SWER 和 AER 结果(越低越好)

Image 9: image 语义指标讲述的故事与 WER 大致相似,但有一些排名反转。

语义结果还揭示了 SWER 和 AER 之间显著的一致性。这两个指标在不同的粒度上运作——SWER 聚合每个词的错误,而 AER 衡量每个话语的三个理解问题能否被正确回答——因此规模上的差异是预期的。值得注意的是,在这两个指标上,模型的相对排名是多么稳定。一个明显的异常值是 Deepgram Nova-3,它在 SWER 上处于中游,但在所有语言对的 AER 上排名最后或倒数第二。这种差距在西班牙语-英语上最为明显:Nova-3 的总体语义错误率低于其在对最重要细节上的错误率。

B. 与纯单语语音相比,语码转换增加了多少额外成本?

虽然这些结果清晰地展示了模型在语码转换语音上的相对性能,但它们并未揭示错误是源于转录本身的固有难度,还是源于语言转换带来的额外挑战。

为了分离语码转换的成本,我们通过评估流水线对每个话语运行了三种音频:语码转换音频、相同内容的单语基质语言音频和单语英语音频。对于每个话语,我们测量了语码转换和单语条件下 WER 的差异,并汇总了跨基准测试的差值。以下是结果。Image 10: image

C. 语码转换如何破坏 ASR 系统?

既然我们知道语码转换会导致模型出错,我们转而研究与这些错误相关的具体条件。为了解决这个问题,我们拟合了一个两部分模型:

  1. 首先,我们使用逻辑回归来询问哪些变量与至少发生一个转录错误相关。
  2. 其次,在至少发生一个错误的条件下,我们使用普通最小二乘法(OLS)回归来检验哪些变量与错误幅度相关。

这种两部分方法使我们能够区分哪些因素使错误更可能发生,以及哪些因素在错误发生后影响其大小。两个步骤都包含相同的预测变量:(1)话语中语言转换的次数,以及(2)话语的语码混合指数(CMI)——从第二语言中抽取的词相对于基质语言的比例,遵循 Gambäck 和 Das 的方法。我们还加入了话语长度作为控制变量,因为较长的话语提供了更多出错的机会。

与转录错误相关的变量

从模型的第一部分,我们发现话语中的语言转换次数是与转录错误是否发生最一致的预测变量。每次语言变化似乎都引入了转录过程可能失败的额外机会。这种关系在法语-英语语言对中尤其显著,其中七个模型中有六个表现出这种关系。其他预测变量——CMI 和话语长度——与错误发生几乎没有显著关系。

当问题转向错误幅度时,出现了不同的模式。CMI 成为更强的预测变量,而不是转换次数。特别是在德语-英语语言对中,七个模型中有四个显示出 CMI 与 WER 之间存在显著的正相关关系。这表明,一旦发生错误,其严重程度并非由说话者转换语言的频率决定,而是由混合的整体密度决定:话语交织两种语言的程度越彻底,产生的转录错误往往就越大。

导致转录错误的语码转换话语部分

两部分模型解释了哪些因素与错误的发生和恶化相关。我们的最终实验检验了语码转换话语的哪些部分对这些错误贡献不成比例。为了测试错误在话语的英语和非英语部分之间是否分布不同,我们使用 GPT-5 为每个词标记语言,然后将每个转录错误归因于其发生所在词的语言,计算每个语言的 WER。下面的热图显示了结果。Image 11: image 所有模型和语言对的模式都是一致的:错误集中在话语的英语部分,而不是基质语言部分。这有悖常理——英语是这些模型在单语设置中通常处理得最好的语言。一种解释是,语码转换语音中的英语片段可能不成比例地包含更难转录的技术词汇或命名实体。另一种解释是,无论嵌入哪种语言,嵌入语言片段都会创造一个具有挑战性的上下文:当模型过渡到一段非基质语言时,它必须在话语中间适应不同的音系和词汇语域,从而恰好在该片段上增加出错的可能性。

这一结果表明,语码转换 ASR 中的转录难度并不仅仅集中在转换点上,而是更广泛地延伸到嵌入语言片段中。解开这种模式是反映了英语片段的词汇特征、它们作为嵌入语言的结构性角色,还是当前模型在话语中间适应能力的有限性,是未来研究的一个有前景的方向。

局限性

有几个局限性值得承认:

结论

语码转换长期以来一直是语音模型的压力测试。我们的结果表明,对于最好的前沿 ASR 系统,它正日益成为一种正常状态。

当企业谨慎选择其 ASR 系统时,双语客户可以自然地说话——根据对话需要在句子中间切换语言——而不会牺牲转录质量或下游任务性能。我们基准测试中的顶级模型处理语码转换语音时,相对于其单语基线,其惩罚小得惊人,而语义指标则讲述了一个更令人鼓舞的故事。

但情况并非完全乐观。在做出生产决策之前,您必须对客户实际使用的语言进行基准测试——不同模型和语言对之间的性能差异很大,对于西班牙语-英语使用者来说的最佳选择,不一定也是德语-英语使用者的最佳选择。

译自 Hugging Face · 官方博客 · 录于 二〇二六年六月九日