Deepgram 推出 Flux TTS 支持跨轮次上下文与打断丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、Lychee-FD 开源原生端到端全双工语音模型:多流 vLLM 推理加速 2.96×,长对话显存增量降低约 23%
哈工大(深圳)等团队开源 Lychee-FD,一种面向实时语音交互的原生端到端全双工语音语言模型,并入选 ACL 2026 Outstanding Paper。模型不依赖级联的 ASR、LLM、TTS 和 Turn-Taking 模块,而是在统一多流架构中同时建模持续聆听、语义理解、语音生成和交互控制。
采用分层声学-语义建模: 底层共享参数学习连续音频中的通用语音语言表示,上层拆分为 semantic、acoustic 和 dialogue-control 三条流,分别负责语义推理、语音 Token 生成以及何时说话、停止、聆听和响应打断。
原生处理全双工交互与打断: Dialogue-control head 使用 early-exit 路径,可在完整语音生成结束前输出 interruption、stop-speaking 和 listen/respond 等控制决策。
定制多流 vLLM 在线推理: 在共享 Backbone 计算后,将中间状态分别送入语义、声学和对话控制通道,并维护多流解码所需的生成状态与 KV Cache,避免所有通道经过单一串行推理路径。
Speaking rounds 推理加速约 2.96×: 团队在线评测显示,优化后的多流 vLLM serving pipeline 在模型发言阶段实现约 2.96× 加速,并在长 Session 中将增量 GPU 显存增长降低约 23%。
代码、模型权重和实时 Web Demo 已开放: 仓库提供在线 serving、浏览器实时语音前端、训练脚本及 DeepSpeed 示例,模型权重已发布至 Hugging Face,项目采用 Apache-2.0 License。
https://github.com/HITsz-TMG/Lychee-FD
( @Lychee-FD)
2、Deepgram 推出 Flux TTS:跨轮次保留对话上下文,原生支持打断与流式 LLM 输入
Deepgram 推出面向 Voice Agent 的 Flux TTS,采用 streaming-first 设计,不再将每段文本作为独立 TTS 请求处理,而是在多个轮次之间持续保留对话状态,根据上下文调整语速、重音和情绪表达。
跨轮次保留对话上下文: Flux TTS 会读取完整对话而非只处理当前一句,并持续保存对话状态,使声音、语气和表达方式可以结合此前的交互进行调整,无需额外添加 SSML。
原生处理用户打断: WebSocket API 将每次 Agent 回复作为独立轮次管理;发生 Barge-in 后,
Interrupt会返回用户实际已经听到的text_spoken和尚未播放的内容,方便 Agent 同步自身对话状态。LLM Token 可直接流入 TTS: 实时模式使用
wss://api.deepgram.com/v2/speak,开发者可持续输入 LLM 生成的 Token,由服务端自动决定 flush 边界,无需在客户端手动进行文本分块。支持流式与 Batch 两种调用方式:
/v2/speak同时提供 WebSocket 实时生成和 REST Batch API;流式模式面向实时 Voice Agent,Batch 模式则用于 IVR、通知和预生成音频等场景。官方盲测自然度 Win Rate 为 73.4%: Deepgram 在约 14,400 次双盲成对比较中测试 12 个模型、约 73 个声音和 100 组真实场景脚本,Flux TTS 最佳声音的自然度 Win Rate 为 73.4%,表达力 Win Rate 为 77.5%;该数据为 Deepgram 官方评测。
目前首批 Flux TTS Voice 为英语声音,支持 Cloud、VPC 和 On-prem 部署。
https://deepgram.com/product/text-to-speech/flux
(@DeepgramAI)
3、NVIDIA 发布 Nemotron 3.5 Lightning:30B MoE 仅激活 3B 参数,同级模型输出速度最高提升 4×
NVIDIA 发布 Nemotron 3.5 Lightning,一款面向长时间运行 Agent 高频执行任务的开放 MoE 模型,总参数量 30B、每 Token 激活 3B 参数。模型针对工具调用、结果验证和子智能体委派等执行型任务优化,并通过 speculative decoding、Harness-oriented training 和量化降低连续 Agent 工作负载的推理开销。
30B 总参数、3B 激活参数: MoE Router 每次仅调用部分专家,使模型以较低计算量处理高频 Agent 请求,可部署在 DGX Spark 等本地设备或数据中心。
同规模模型输出速度最高提升 4×: NVIDIA 称 Nemotron 3.5 Lightning 在 Artificial Analysis Intelligence Index 的准确率与输出速度测试中处于 Pareto Frontier,面向高调用量任务提高 Token 生成效率。
PinchBench 准确率达到 86%: 在完成 10,000 个任务的测试中,Nemotron 3.5 Lightning 在相近准确率下比 Qwen3.6 35B 快 30%。
训练阶段直接加入 Multi-Token Prediction: 模型通过专门的预训练和后续 MTP boosting 阶段提升 speculative decoding 能力,同时提供 DSpark 和 DFlash 两种 Draft Model,以适配不同并发和部署场景。
同时提供 NVFP4 与 BF16 checkpoint: NVFP4 版本使用 NVIDIA 针对 Blackwell、Hopper 和 Ampere GPU 的量化 Kernel;模型还支持 vLLM、SGLang、TensorRT-LLM、llama.cpp、Ollama 和 LM Studio 等推理工具。
https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/
( @NVIDA)
4、DuplexWorld 提出一套面向真实日常任务的全双工 Voice Agent 评测框架,不再只测试 Turn-Taking、语音自然度或工具调用等单项能力
DuplexWorld 提出一套面向真实日常任务的全双工 Voice Agent 评测框架,同时评估「任务有没有完成、对话是否自然、声音表现如何」。Benchmark 覆盖银行、保险、旅行、医疗、物流和 Pathfinding 6 个世界、11 类对话、156 个场景,累计生成超过 350 小时对话。
统一评估 3 类能力、12 个指标: 指标分为 Agentic Capability、Conversational Dynamics 和 Naturalness 三组,包括 Pass@1、Goal State、Turn-Taking、Conversation Progression、Selectivity、Faithfulness、DNSMOS、UTMOS、NISQA 等,官方明确不将它们合并成一个总分。
任务不只停留在数据库操作: 五个企业场景要求 Agent 通过语音与工具完成真实状态变更;Pathfinding 则让 Voice Agent 仅通过语音指导用户在 8×8 虚拟城市中移动,环境会随时间变化,Agent 需要持续维护对用户位置和朝向的判断。
共测试 5 个实时 S2S 模型: 包括 Amazon Nova 2 Sonic、Gemini-3.1-Flash-Live、GPT-Realtime-2.1、GPT-Realtime-2.1-mini 和 Grok Voice Think Fast 1.0,总计完成 3,825 段计分对话。
最佳综合任务 Pass@1 仍只有 0.490: 六个世界平均结果中,Grok Voice Think Fast 1.0 的 Pass@1 为 0.490,GPT-Realtime-2.1 为 0.433,Gemini-3.1-Flash-Live 为 0.398;重复执行时可靠性还会进一步下降。
会聊天、会做事和声音自然并不是同一种能力: GPT-Realtime-2.1 的 Turn-Taking 得分最高,为 0.653;Grok Voice Think Fast 的任务完成表现最高;Gemini-3.1-Flash-Live 的 DNSMOS 最高,为 3.378。
https://duplexworld.github.io/index.html
( @DuplexWorld)
5、SpotSound 发布细粒度音频时间定位模型:插入 Timestamp Token,短事件定位 mIoU 最高提升 27.0%
浙江大学、上海 AI Lab 与上海交大团队提出 SpotSound,一种面向长音频事件时间定位的 Audio-Language Model,并入选 ACM MM 2026。模型通过在音频 Token 序列中显式插入时间戳 Token,让模型直接学习“什么声音在什么时候发生”,同时加入负样本训练以减少不存在事件的时间戳幻觉。SpotSound 现登陆了 Hugging Face 平台。如果你有较长的录音文件,可以提交给他们,并描述你所寻找的内容,他们会帮你记录下时间戳信息。
将 Timestamp Token 直接插入音频序列: SpotSound 按固定时间粒度(如 1 秒)在对应音频 Token 前加入文本时间戳,使模型通过语言模型的检索能力读取时间位置,而不是单独解码密集的位置编码。
构建 7.76 万条时间感知训练数据: 团队使用 DeepSeek-v3、Qwen2-Audio 等模型为前景声音生成细粒度描述,再随机混入背景环境音,同时保留声音插入时间作为 Ground Truth。
SpotSound-Bench 专门测试“长音频找短声音”: Benchmark 平均音频长度为 53.4 秒,目标事件平均只有 4.5 秒,仅占整段音频的 8.4%,用于测试复杂背景下短暂声音事件的精确定位能力。
时间定位 mIoU 最高提升 27.0%: 基于 Audio Flamingo 3 的 SpotSound-A 在 SpotSound-Bench 上较此前方法提升 20.4%,在 UnAV-100 子集上提升 27.0%;同时在 Clotho-Moment、AudioGrounding 等 Benchmark 上取得更高结果。
加入负样本抑制不存在事件的时间戳幻觉: SpotSound 将训练样本改造成包含 Negative Query 的判别式四元组;SpotSound-A 在 AudioGrounding 上对存在事件的判断准确率达到 93.4%,对不存在事件达到 87.9%。
https://loiesun.github.io/spotsound/
https://huggingface.co/spaces/hugging-apps/spotsound-temporal-grounding
( @SpotSound)
02 有亮点的产品
1、Anthropic PBC 正在洽谈收购实时生成式 AI 公司 Decart AI,交易金额约为 60 亿美元
据彭博社报道,知情人士透露,Anthropic PBC 正在洽谈收购人工智能初创公司 Decart AI,交易金额约为 60 亿美元(现汇率约合 405.41 亿元人民币)。
知情人士表示,目前双方尚未最终敲定交易,谈判仍有破裂的可能。由于涉及私人谈判,这些人士要求匿名。
Decart 致力于帮助 AI 开发者充分发挥各种不同芯片的性能,同时也专注于生成式视频领域。该公司使用所谓的「世界模型」(world models),能够对实时视频画面进行即时修改。
https://decart.ai/
(@IT 之家)
2、LiveKit Agents 上线 Expressive Mode:LLM 自动生成 TTS 表达标记,按上下文调整情绪与语气
LiveKit 在 Agents 框架中推出 Expressive Mode,用一层统一的表达控制机制连接 LLM 与不同 TTS 模型。开启后,LLM 会根据当前对话上下文自动生成情绪、语气、非语言声音和停顿等标记,再由 LiveKit 转换为不同 TTS Provider 对应的格式。
LiveKit Agents 上线 Expressive Mode: 大多数 Voice Agent 无论说什么,都使用相似的积极语气,包括传达坏消息时也是如此;Expressive Mode 让 Agent 的声音能够更贴合通话者当下的情绪。
在 LLM 与 TTS 之间加入表达控制层: 现代 TTS 已能表现温暖、犹豫、笑声和停顿,但需要明确的表达指令,且不同 Provider 使用不同的标记语法。Expressive Mode 让 LLM 直接在输出中生成 prosody 标记,再交给系统处理后送入 TTS。
更大的文本 Chunk 有助于保持表达一致性: LiveKit 发现逐句流式发送给 TTS 会让模型丢失整段回复的情绪脉络,并导致句间音高漂移;将多句话合并成更大的 Chunk 后可改善这一问题,在 Gemma 4 这类快速 LLM 上也没有带来明显的延迟成本。
https://livekit.com/blog/making-voice-agents-sound-human-with-expressive-mode#try-the-live-demo
(@LiveKit)
03 有态度的观点
1、Sandbar CEO Mina Fahmi:AI 可穿戴的未来是语音,但不应该一直监听
AI 可穿戴设备正在越来越多地把「持续监听」当作默认设计,但 Stream 戒指背后的 Sandbar 选择了另一条路:语音应该成为人与 AI 交互的入口,但什么时候开始听,应该由人来决定。 TechCrunch 在最新一期 Equity 播客中介绍了这一思路。
Stream 通过按键通话来捕捉想法、提醒和待办,而不是持续录音。Sandbar CEO Mina Fahmi 认为,要让 AI 可穿戴真正进入日常生活,关键不是让设备无时无刻都在感知,而是「让人始终掌握控制权」。
这背后其实是两种 Voice AI 产品哲学的分歧:一种希望 AI 永远在线、主动感知;另一种则认为,语音足够自然,但交互边界必须足够明确。
对可穿戴设备来说,真正重要的问题可能已经不是「能不能一直听」,而是「什么时候应该听」。
https://techcrunch.com/video/why-stream-ring-maker-sandbar-says-the-future-of-ai-wearables-is-voice/
( @Techcrunch )

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
作者提示: 个人观点,仅供参考