AWS · ML 博客

Loka 如何用 Amazon Nova 2 Sonic 构建自然低延迟语音 Agent

How Loka Built a Natural, Low-Latency Voice Agent with Amazon Nova 2 Sonic

二〇二六年六月二十四日 · 英文原文

Loka 使用 Amazon Nova 2 Sonic 构建对话式 AI agent,将音频直接输入语音到语音模型,替代传统语音转文本、LLM 处理、文本转语音的三步管道。在 Big Bench Audio 基准测试中,Nova 2 Sonic 语音推理得分为 87.0,高于 Gemini 2.5 Flash Native Audio 的 71.0 和 GPT Realtime 的 83.0;首音频时间 1.39 秒,输入音频成本约每小时 0.27 美元。通过 prompt 优化,agent 在五个维度(响应适当性、意图理解、完整性、错误恢复、对话自然度)上的总体评判得分从基线 2.7 提升至 3.8。边缘案例测试平均得分 4.0。架构采用 LiveKit 传输层、AWS Fargate 计算层、Amazon Bedrock 模型访问及 Langfuse 可观测性。该方案由 Loka 与 AWS 合作开发,适用于汽车经销商等实时语音交互场景。

Loka 通过使用 Amazon Nova 2 Sonic 构建对话式 AI agent(智能体),彻底改变了客户语音交互体验,让客户能够沉浸在自然、响应迅速的对话中。他们的 AWS 解决方案在 Big Bench Audio 上实现了高语音推理准确率,同时与传统语音 AI 管道相比,显著降低了成本并缩短了响应时间。在本文中,我们将展示 Loka 用于解决一个常见痛点——即机械、缓慢的语音助手导致客户挂断电话,损害品牌声誉并推高支持成本——的架构和方法。

传统语音助手的不足

传统语音助手遵循一个三步流程,这本身就带来了根本性问题。首先,它们使用语音转文本(Speech-to-Text)系统将你的语音转换为文本。接着,它们通过大语言模型(LLM)处理该文本。最后,它们使用文本转语音(Text-to-Speech)技术将文本响应转换回语音。这个管道在每一步都会引入累积延迟。结果往往是你在听到响应之前需要等待 3 到 5 秒。这种延迟破坏了自然对话的感觉。它使得打断或纠正助手变得笨拙且令人沮丧。

考虑一个汽车经销商的真实场景。一位客户打电话说:“我在找你们广告里的那款 SUV,但不是混动版。我只能下午 5 点以后来。”助手需要同时解析多条信息。它必须理解意图、否定和日程约束。传统系统难以应对这种复杂性,因为在转换过程中会丢失关键信息。当语音变成文本时,语气、犹豫和紧迫感都消失了。经销商场景让这些局限性变得尤为明显。客户打电话时期望得到即时、有用的回应。在销售对话中,五秒钟的延迟感觉就像永恒。更糟的是,如果助手理解错误并需要澄清,延迟会进一步累积。对话变得冗长乏味,而非高效有用。

除了技术延迟,还存在经济问题。服务数千个地点需要严格的成本控制。传统的实时语音系统在规模化时可能变得成本过高,尤其是在处理连续音频流时。糟糕的体验和高昂的成本相结合,限制了语音 AI 的采用。企业需要一个更好的解决方案。

原生语音到语音模型

AI 的最新进展解锁了一种根本不同的方法。开发者现在可以直接将音频流发送到语音到语音模型,这些模型将理解、推理和生成作为一个统一系统来处理。通过端到端处理音频,这些模型能够捕捉传统纯文本管道所遗漏的语气、情感和细微线索。

为了验证这种方法,严格的测试至关重要。我们使用了 Big Bench Audio,这是一个衡量语音输入推理能力的基准测试。Amazon Nova 2 Sonic 的语音推理得分为 87.0。这优于 Gemini 2.5 Flash Native Audio (Live API) 的 71.0 分,并超过了 GPT Realtime 的 83.0 分。这些分数证实了原生音频处理不会为了速度而牺牲智能。该模型能够处理真实经销商场景中复杂的、多部分请求。

图 1 – 语音推理分数对比 – Big Bench Audio

仅有推理能力对于生产系统来说是不够的。延迟决定了对话是感觉自然还是机械。Nova 2 Sonic 实现了 1.39 秒的首音频时间。这种响应时间允许自然的“插话”行为。当用户打断对话时,语音 agent 会自然地回应。这种体验符合人类对话模式。

图 2 – 首音频时间对比 – Big Bench Audio

成本效率也得到了改善。Nova 2 Sonic 的输入音频成本约为每小时 0.27 美元(基于发布时的定价)。这低于可比的实时模型和传统方法。

图 3 – 每小时音频成本对比 – Big Bench Audio

为了衡量延迟和成本之外的质量,我们需要一个结构化的评估。我们使用 LLM 作为评判者构建了一个自动化管道。每次对话都按照五个维度进行评分,采用 1-5 分制。响应适当性衡量回复是否相关且上下文正确。意图理解评估 agent 是否抓住了用户的潜在目标。完整性追踪是否提供了所需的信息或操作。对话自然度衡量流畅度、话轮转换、语气和类人程度。

比较 Amazon Nova Sonic 和 Amazon Nova 2 Sonic 揭示了明显的进步。响应适当性从 2.5 提高到 2.9。意图理解从 2.9 上升到 3.0。最显著的是,完整性从 1.8 跃升至 2.5。这意味着 agent 完成复杂任务的可能性大大增加。对话自然度从 2.5 提高到 2.8。总体得分从 2.4 增加到 2.7。这些提升直接转化为经销商更好的客户成果。

指标(1-5 分制) Nova Sonic(基线) Nova 2 Sonic 变化
响应适当性 2.5 2.9 +0.4
意图理解 2.9 3.0 +0.1
完整性 1.8 2.5 +0.7
对话自然度 2.5 2.8 +0.3
总体评判得分 2.4 2.7 +0.3

表 1 – 五个维度上的语音到语音模型指标对比

工程化对话式 AI Agent

有了强大的基础模型,下一个挑战是优化。我们将 prompt(提示词)视为代码,根据测量到的性能进行迭代。基线 Nova 2 Sonic 配置的总体得分为 2.7。第一次 prompt 优化后,得分上升到 3.1。第二次迭代达到了 5.0 分中的 3.8 分。这种改进来自于更好的话轮纪律和重复控制。agent 学会了何时说话、何时倾听以及何时提出澄清性问题。

配置 响应适当性 意图理解 完整性 错误恢复 对话自然度 总体评判得分
Amazon Nova 2 Sonic(基线) 2.9 3.0 2.5 2.6 2.8 2.7
Amazon Nova 2 Sonic(Prompt v1) 3.2 3.3 3.0 2.8 3.9 3.1
Amazon Nova 2 Sonic(Prompt v2) 3.7 3.9 3.9 3.8 4.1 3.8

表 2 – Prompt 增强后五个维度上的语音到语音模型指标对比

团队通过几种方式增强了基线 prompt,将其演变为两个 prompt 模板。他们将硬编码的经销商详细信息替换为模板化变量,例如 {assistant_name}{dealership_address}。这一更改使得 prompt 可以在任何经销商处重复使用。团队将格式从编号列表改为在清晰标记的标题下使用项目符号列表。像“工具使用规则”、“错误恢复”和“对话结束”这样的标题为模型提供了更清晰的行为边界。这种结构减少了主题之间的指令混淆。团队在整个 prompt 中添加了具体的行为示例。这些示例精确展示了如何在确认来电者时避免重复。他们还引入了一个预响应检查清单,促使模型在每次回复前进行自我审计。

Amazon Bedrock Prompt Management 成为整个生命周期的自然归宿。它允许团队使用唯一的 Amazon Resource Name (ARN) 存储每个模板版本。他们可以在不触及应用程序代码的情况下,将更改从草稿提升到生产环境。当新经销商上线时,其特定变量会在运行时通过 Amazon Bedrock API 注入。这意味着同一个核心 prompt 可以为每个客户服务,同时保持完全可定制。团队添加了 AWS Identity and Access Management (AWS IAM) 访问控制,以限制谁可以创作、批准或部署 prompt 更改。这为之前非正式的编辑过程带来了适当的治理层。这种方法将 prompt 工程从一次性任务转变为可重复、可审计的工作流。随着经销商数量和用例的增长,该工作流也随之扩展。

真实世界测试需要模拟实际经销商通话的边缘情况。我们测试了愤怒的客户、忙碌的父母、健谈的客户、困惑的客户和年长的来电者。忙碌的父母场景在五个维度上均获得了 5.0 分。agent 完美地处理了打断、背景噪音和时间压力。愤怒的客户案例总体得分为 4.5 分。agent 保持冷静、富有同理心并以解决方案为导向。困惑的客户场景也获得了 4.5 分。agent 耐心地澄清,没有显得居高临下。

聊天示例 响应适当性 意图理解 完整性 错误恢复 对话自然度 总体评判得分
愤怒的客户 4.5 4.5 4.0 4.5 4.5 4.5
忙碌的父母客户 5.0 5.0 5.0 5.0 5.0 5.0
健谈的客户 3.5 3.0 2.5 2.0 4.0 3.0
困惑的客户 4.5 4.5 4.5 5.0 4.5 4.5
年长客户 3.5 3.0 2.5 2.0 4.0 3.0
平均 4.2 4.0 3.7 3.7 4.4 4.0

表 3 – 基于客户画像的语音到语音模型评估

两个场景揭示了尚存的改进空间。健谈的客户和年长客户案例的总体得分均为 3.0。当用户提供冗长、漫无边际的输入时,语音 agent 在结构处理上遇到困难。在这些情况下,完整性得分降至 2.5。错误恢复降至 2.0。这些结果明确了未来 prompt 工程的重点领域。尽管如此,平均边缘案例得分 4.0 表明其已具备强大的真实世界就绪性。

构建正确的架构对于生产部署至关重要。我们设计了一个使用 LiveKit 作为传输层的无服务器、事件驱动系统。LiveKit 抽象了 WebRTC(用于 Web 客户端)和 Session Initiation Protocol (SIP)(用于电话呼叫)的复杂性。这使得工程团队能够完全专注于 agent 逻辑。

图 4 – 对话式 AI 助手 – 解决方案架构

语音 agent 通过基于 Python 函数的工具与经销商运营集成,这些工具代表了助手在对话期间可以执行的操作。常见的工具包括库存搜索、预约安排和客户数据查询。这些工具充当 Amazon Nova 2 Sonic 和后端服务之间的集成层。模型决定何时应使用工具,Python 函数执行相应的 GraphQL 查询或变更,并将结构化数据返回给 agent。

AWS Fargate 提供了计算层。我们将 LiveKit Agents 容器化在 Amazon Elastic Container Service (Amazon ECS) 上。这使得 agent 工作节点与媒体服务器能够独立扩展。在经销商高峰时段,资源可以动态优化。Amazon Relational Database Service (Amazon RDS) 被用作结构化应用程序数据的持久化关系存储,包括经销商配置、对话历史和客户记录。实时语音 agent 无法容忍数据库延迟。Amazon ElastiCache 用于处理房间管理和跨分布式任务的临时会话协调。Amazon Bedrock 提供了对 Nova 2 Sonic 模型的直接访问。浏览器客户端使用 WebRTC(Web Real-Time Communications)连接,这是一个用于点对点音频、视频和数据传输的开源框架。传统电话呼叫通过 SIP Trunk 进入,经由 Network Load Balancer 路由。这允许媒体数据包的 TCP/UDP 吞吐。可观测性来自自托管在 AWS 上的 Langfuse。它追踪每个 agent 决策和工具调用。这些数据被反馈到评估管道中,用于持续改进。

演示

以下视频展示了该功能。

对话式 AI 的新标准

从基于文本的聊天机器人到实时语音 agent 的转变,代表的不仅仅是界面变化。它需要根本不同的基础设施和思维方式。Nova 2 Sonic 同时满足了三个关键的工程要求。首先,它提供了无需中间文本转换的高推理能力。其次,它实现了低延迟,支持自然的、类人的打断。第三,它提供了生产可行性,对于数千个地点具有成本效益。

对于汽车经销商而言,这项技术已经在生产中推动收入增长。客户在打电话时能立即得到有用的回应。复杂的请求可以在一次对话中顺利处理。预约可以正确安排,无需令人沮丧的来回沟通。

其影响远不止于汽车销售。任何需要实时、智能语音交互的行业都能从中受益。想象一个旅行 agent,它可以通过自然对话帮助你规划整个假期。设想一个教育导师,它能适应你的说话风格和学习节奏。考虑一下处理复杂保险和可用性问题的医疗保健预约系统。

语音到语音 AI 已达到生产就绪状态。开始在你的 AWS 环境中使用 Nova 2 Sonic 进行实验。构建原型,测试边缘案例,并探索对你的业务而言可能实现的功能。

本文代表了 AWS 与 Loka 之间的合作,Loka 专注于构建生产就绪的 AI 解决方案。Loka 团队已经解决了围绕架构、评估和优化的难题。他们在汽车经销商领域的经验可以直接应用于其他行业。

语音到语音 AI 仍处于早期阶段。最好的应用尚未被发明出来。你的行业知识与这项技术相结合,可以创造出突破性的解决方案。立即开始你与 Nova 2 Sonic 和 Loka 的旅程。改变你的客户与你的业务进行对话的方式。

关于作者

Bojan Jakimovski Bojan Jakimovski 是 Loka 的机器学习负责人、AWS 大使,以及 9 次 AWS 认证专业人士。他拥有 FEEIT 的电气工程与信息技术硕士学位,专攻专用计算机系统,并在 AWS 上的机器学习、深度学习、MLOps 和云原生架构方面拥有专业知识。作为一名实践者,他设计和部署可扩展的 AI 系统,重点关注生成式 AI、分布式训练和生产级 ML 基础设施。他的兴趣还延伸到高性能计算、联邦学习和实时敏感系统,在这些领域他继续探索现代 AI 系统的高效和可扩展方法。

Nina Cvetkovska Nina Cvetkovska 是 Loka 的机器学习工程师和 AWS 认证机器学习专家。她拥有 FCSE 的软件工程背景,为她在 ML 和 AI 方面的实践工作带来了坚实的学术基础。作为一名实践者,Nina 专注于构建和部署机器学习解决方案,对计算机视觉、边缘 AI 和实时多模态系统(包括语音到语音应用)感兴趣,在这些领域她探索现代 AI 的高效和低延迟方法。

Venkat Gomatham Venkat Gomatham 是 AWS 的高级合作伙伴解决方案架构师,为合作伙伴的云转型之旅提供战略指导。拥有 22 年以上的 IT 架构师经验,他推动创新和数字化转型计划,通过 Agentic 和 Physical AI 等尖端技术帮助组织现代化其 IT 格局。

Arabinda Pani Arabinda Pani 是 AWS 的首席生成式 AI 专家解决方案架构师,帮助企业客户和战略合作伙伴设计、构建和扩展生成式 AI 及 agentic AI 解决方案。作为 AMER 生成式 AI 专家 PSA 团队的一员,他领导以 Amazon Bedrock、Amazon Nova 和 agentic AI 为中心的技术赋能和思想领导力计划——推动整个美洲地区重要的合作伙伴采用和业务影响。拥有 22 年以上的 IT 经验,涵盖数据库工程、云架构和 AI/ML,Arabinda 带来了深厚的技术专长和将复杂 AI 能力转化为实际业务价值的良好记录。他拥有圣地亚哥州立大学的 MBA 学位、NIT Warangal 的 B.Tech 学位,并且是 AWS 认证解决方案架构师 – 专业级。

译自 AWS · ML 博客 · 录于 二〇二六年六月二十四日