NVIDIA 发布 Magpie TTS 多语种 Voice Agent 部署指南丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、NVIDIA 发布 Magpie TTS Multilingual Voice Agent 部署指南:12 语种支持,B200 单流首音延迟 32ms
NVIDIA 发布 Magpie TTS Multilingual 的 Voice Agent 部署指南,将此前开放权重的多语种 TTS 模型整理为更完整的服务化接入路径。本次更新重点在模型部署与 Voice Agent 集成,并非 Magpie TTS Multilingual 的首次发布。
v2607 版本约 364M 参数,支持 12 种语言: 模型名称为 Magpie TTS Multilingual 357M,采用编码器-解码器 Transformer 架构,覆盖英语、汉语、阿拉伯语、韩语和巴西葡萄牙语等 12 种语言。
B200 单流首音延迟达到 32ms: 当前版本面向流式 Voice Agent 场景,在 NVIDIA B200 GPU 上单流首音延迟为 32ms。
开放权重并提供完整部署控制: 指南围绕低延迟、多语种和服务化接入展开,将开放权重模型进一步转化为可复现的 Voice Agent 部署流程。
标准模式单次最多生成 20 秒语音: 模型当前仅支持指定的 12 种语言,并出于安全考虑移除了零样本语音克隆功能。
https://huggingface.co/nvidia/magpie_tts_multilingual_357m
https://huggingface.co/blog/nvidia/magpie-tts-multilingual-voice-agents
(@NVIDA)
2、DuplexGen 开源场景自适应 Turn-Taking 对话合成框架:用人类偏好校准接管对话轮次、Backchannel 与沉默
DuplexGen 提出一种面向全双工语音交互的对话数据合成框架,通过少量 slot-level 人类偏好标注校准 LLM 的 Turn-Taking 决策,使生成数据中的对话节奏能够随场景变化,而不是对所有任务使用同一套抢话、回应和等待策略。
将 Turn-Taking 拆成 slot-level 决策: 框架先将文本对话改写为口语形式,再识别句中潜在动作位置,并在每个 slot 上选择接管话轮、Backchannel 或继续沉默。
用少量人类偏好标注校准 LLM: DuplexGen 通过 KL-divergence soft-label 微调校准每个 slot 的动作分布,使预测结果更接近特定场景下的人类偏好,而非直接采用 LLM 原始置信度。
覆盖 6 类合作与竞争对话场景: 包括苏格拉底式教学、协作规划、采访、谈判、说服和社交对话;实验中的人类标注显示,合作任务更频繁出现 Backchannel,竞争任务则更倾向主动接管话轮。
训练数据可改变全双工模型的 Turn-Taking 行为: 使用 DuplexGen 数据微调 PersonaPlex 后,其六类场景平均 Turn-Taking Naturalness 人类评分从 3.56 提升至 3.69,Moshi 基线为 3.48;Instruction Following 平均分从 PersonaPlex 的 3.41 提升至 3.55。
已开放数据生成代码、Corpus 与语音版本: 官方代码覆盖文本转口语、slot 识别、Turn-Taking 预测、对话生成及 Chatterbox TTS 渲染流程,同时提供 PersonaPlex 的 LoRA 微调代码,但当前未发布对应微调模型 checkpoint。
https://duplexgen.github.io/
https://x.com/takyoung_kim/status/2086996559452123622
(@takyoung_kim)
3、OpenBenchmarks 发布 Voice Agent Latency Benchmark:真实电话测量 TTFAB,覆盖 Telnyx、ElevenLabs 等 5 个平台
OpenBenchmarks Labs 发布 Voice Agent Latency Benchmark,用真实电话录音测量用户停止说话到 Voice Agent 开始发声之间的等待时间 TTFAB,而非采用平台自身上报的延迟数据。当前榜单覆盖 Telnyx、ElevenLabs、Bland AI、Vapi 和 Retell AI,共汇总 550 通电话、2078 个有效对话轮次。
TTFAB 直接从双声道通话录音计算: 分析器分别定位用户结束说话的
t1和智能体开始发声的t2,以t2 − t1计算每轮延迟;双方重叠说话、检测器结果不一致或未收到回复的轮次会被剔除。Telnyx 的 p50 为 1296ms: 当前榜单中 Telnyx 的 TTFAB p50 最低;ElevenLabs 为 1424ms,Bland AI 为 1520ms,Vapi 为 1558ms,Retell AI 为 1740ms。
ElevenLabs 的 p95 为 1768ms: 其 p95/p50 为 1.24×,当前五个平台中尾部延迟波动最小;Telnyx p95 为 1856ms,Vapi、Bland AI 和 Retell AI 的 p95 均超过 2 秒。
同步测试使用相同问题集同时拨号:
harness.sync_bench会让多个平台在同一时刻接收相同问题集,以减少平台负载、模型路由和运营商网络随时间变化带来的测试偏差。测试代码、逐轮数据和录音验证流程已开放: 仓库提供拨号 harness、离线 analyzer、每通电话的逐轮 timing 与 discard 信息,并可通过
verify_run.py根据公开录音和 SHA256 重新计算榜单结果。
https://openbenchmarks.com/voice-agent-latency
https://github.com/openbenchmarks-labs/voice-agent-latency
02 有亮点的产品
1、Grok 上线 Voice connector:支持生成个性化播客与每日简报自动化
(@Grok)
2、Deepgram - 新语音即将上线预告
(@Deepgram)
3、HappyRobot 完成 1.5 亿美元 Series C:估值 12 亿美元,服务 150+ 企业客户
HappyRobot 完成 1.5 亿美元 Series C 融资,投后估值达到 12 亿美元。公司从物流货运场景切入企业 Voice Agent 与流程自动化,目前已服务超过 150 家企业客户,并继续扩展电话、邮件和真实业务流程处理能力。
Series C 融资金额为 1.5 亿美元: 本轮融资后,公司估值达到 12 亿美元。
企业客户超过 150 家: 已披露客户包括 DHL、Uber 等企业。
营收较 Series B 后增长 5 倍: 公司披露自上一轮融资以来,营收实现 5 倍增长。
净收入留存率超过 150%: 现有客户的扩展使用推动收入继续增长。
产品聚焦真实业务流程自动化: HappyRobot 的 Voice Agent 可用于打电话、发送邮件,并参与物流及其他企业流程处理。
https://www.happyrobot.ai/blog/happyrobot-seriesc-fundraising-announcement
(@HappyRobot )
4、AI 助听器公司飞声完成数千万元天使+轮融资:由慧和资产领投,方瑞资本担任财务顾问并跟投
AI 助听器公司飞声完成数千万元天使+轮融资,由慧和资产领投,方瑞资本担任财务顾问并跟投,资金将用于产品研发、算法迭代、医疗器械认证及市场拓展。公司正在推进开放式 AI 助听器 B02,通过端侧声学模型处理环境声音,并针对开放式结构中的啸叫问题进行算法抑制。
最高 50dB 增益下进行啸叫控制: 飞声称,其算法会在声音输出前识别可能导致啸叫的共振特征并进行抑制;B02 同时定制更大尺寸动圈单元和耳帽,以兼顾增益、佩戴稳定性和漏音控制。
声学 AI 模型部署在端侧: 助听器需要实时采集环境音,并在十毫秒内区分人声与噪声,再根据用户不同频段的听力损失进行补偿;由于延时要求较高,飞声未采用云端大模型处理这部分声学任务。
通过 App 完成听力测试与增益调节: 用户可先在 App 内完成听力测试,系统再依据测试结果调整不同频段的声音增益,减少对传统线下验配流程的依赖。
B02 海外众筹金额已达数百万美元: 文章称,该产品已获得批量订单;飞声同时正在推进欧盟和美国医疗器械认证。
H8 底噪为 5dB: 飞声此前推出面向轻度至重度听损人群的 H8,并称其 5dB 底噪低于外资头部品牌高端产品常见的 15–25dB 水平。
硬氪首发 | 开放式AI助听器完成数千万元天使轮融资,海外市场已众筹数百万美金
(@硬氪)
03 有态度的观点
1、Meta CEO Mark Zuckerberg 发文阐述 Meta 构建超级智能哲学与愿景
Meta CEO Mark Zuckerberg 近日发文系统阐述其构建超级智能的哲学:AI 的终点不应该是把更多工作交给机器,而是把更强的能力交到每个人手中。他认为,超级智能最重要的贡献将是「发明」,而不是「自动化」。
在 Zuckerberg 描绘的未来里,每个人都会拥有一个持续工作的个人超级智能 Agent。它不仅回答问题,还会理解用户的目标和长期偏好,帮助处理健康、职业、财务、家庭管理和创作等事务,并可以通过眼镜等设备随时参与现实世界。Meta 还计划提供面向数十亿人的免费版本,让超级智能尽可能广泛地分布。
这也构成了 Meta 与其他 AI 实验室在路线上的核心分歧。Zuckerberg 认为,如果超级智能主要服务于企业、政府和少数机构,AI 会进一步放大机构与个人之间的权力差距;相比之下,Meta 希望把超级智能做成一种「个人能力放大器」,让普通人也获得过去只有大型组织才能拥有的研究、创造和执行能力。
因此,他甚至对当前 AI 行业围绕「对齐」的主流叙事提出质疑:不存在一个能够代表所有人价值观的、唯一正确的超级智能。真正的安全机制,不是把能力集中到少数人手里,而是通过广泛分发超级智能形成新的「权力平衡」。
https://www.meta.com/thefutureisforeveryone/
(@Mark Zuckerberg)
04 社区黑板报
招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)
1、赛事推荐:AI 社会科学家研究挑战赛:开启AGI时代的社会科学研究之旅
由清华大学计算社会科学与国家治理实验室、清华大学电子工程系主办的「AI 社会科学家研究挑战赛」正式启动。赛事基于 AgentSociety² 平台,参赛者可以构建大规模智能体社会,通过 Agent 之间的交互,研究政策治理、数字经济、信息传播、社会演化,以及人类与 AI Agent 共存等问题。
这也是一个很值得 Agent 开发者关注的方向:把智能体从“完成任务”进一步推向“模拟社会”——让多 Agent 系统成为研究复杂现实世界的一种实验基础设施。
赛事设置 7 大研究方向,总奖金及 LLM API 支持共 18 万元,支持 3–5 人跨学科组队。
9 月 15 日初筛
10 月 25 日现场评审及颁奖(暂定)
感兴趣的开发者、研究者,尤其是正在关注 Multi-Agent、Agent Simulation、AI for Science / Social Science 的朋友,可以关注一下。
赛事发布|AI 社会科学家研究挑战赛:开启AGI时代的社会科学研究之旅

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
作者提示: 个人观点,仅供参考