Heard 为 Claude Code 等 Coding Agent 加上语音层丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、苹果发布高效音频生成架构:解耦时间-深度扩散 Transformer,实现端侧实时语音合成
苹果研究团队发布音频生成架构「Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers」,用于支撑 Siri Expressive Voices 的端侧实时语音合成。该方案针对移动设备算力和内存限制,通过解耦时间建模与声学深度生成,将峰值运行内存降低至 21MB,并在 Apple Matrix Coprocessor 上实现约 10ms 单步生成速度。
时间-深度解耦扩散 Transformer:降低长序列音频生成内存开销:该架构将音频生成过程拆分为流式编码器、时间解码器和深度解码器,分离音频时间结构建模与残差向量量化(RVQ)层级生成,避免传统多解码器架构的重复计算。
21MB 峰值运行内存:支持端侧持续音频合成:通过因果滑动窗口注意力和固定窗口 KV 缓存,模型实现与音频长度无关的常数级内存复杂度,支持连续生成 20–320 秒音频。
AMX 上实现约 10ms 单步生成:达到约 16 倍实时速度:该音频解码器部署于 Apple Matrix Coprocessor(AMX),单步生成耗时约 10ms,可满足实时流式语音合成需求。
1B 激活参数规模模型:语音质量超过上一代端侧 TTS 系统:在 AFM 3 Core Advanced 的 1B 参数激活规模下,该架构整体 Mean Opinion Score(MOS)提升至 4.15,相比上一代端侧文本转语音系统提升 0.28;在对话语音场景中提升 0.42。
面向 Siri Expressive Voices 部署:实现设备端实时生成:该技术用于 Siri Expressive Voices,通过端侧基础模型输出的语义音频 token 生成高保真语音,减少云端推理依赖。
https://arxiv.org/abs/2607.23811
(@Apple Research)
2、Lychee-FD 发布原生全双工语音大模型:层级声学-语义建模,提升 Spoken QA 7.4% 与交互流畅度 28.5%
哈尔滨工业大学(深圳)团队发布 Lychee-FD 原生端到端全双工语音大模型,并获 ACL 2026 杰出论文。该模型将持续监听、语义理解、语音生成和交互控制统一到多流架构中,通过解决声学与语义模态之间的干扰问题,实现更自然的实时语音交互。
层级声学-语义建模架构:分离模态冲突并保持语义一致性:Lychee-FD 发现全双工语音模型性能下降主要来自声学建模与语义建模共享深层参数时产生的梯度冲突,并通过层级参数分离策略解耦两类模态,同时引入语义对齐通道维持跨模态关联。
原生端到端全双工能力:单模型完成监听、理解、生成与交互控制:不同于依赖 ASR、LLM、TTS 和轮次检测模块串联的传统语音系统,Lychee-FD 在统一多流模型中同时处理用户输入和模型输出,实现连续听说交互。
Speech QA 提升 7.4%:语音智能能力增强:在多个全双工语音评测任务中,Lychee-FD 通过减少模态干扰提升语音理解能力,Spoken QA 指标相比基线提升 7.4%。
FullDuplexBench 1.5 交互流畅度提升 28.5%:改善实时对话体验:模型在全双工交互评测中提升响应连续性和交互自然度,在 FullDuplexBench 1.5 上交互流畅度提升 28.5%。
开源实时推理链路:提供多流 vLLM 服务支持:项目公开代码、论文和在线 Demo,并提供基于 vLLM 优化的多流服务后端,用于低延迟在线语音交互部署。
https://hitsz-tmg.github.io/Lychee-FD/
(@Lychee-FD Team)
3、Wan-Streamer v0.3 发布「世界状态 + 事件流」实时交互模型:640×368 视频流,550ms 全链路延迟
阿里巴巴 Wan 团队发布 Wan-Streamer v0.3,将视频建模为「世界状态 + 事件流」,用于实时多模态交互模型训练。该模型在统一框架下持续理解环境、主体状态和动态事件,并支持全双工音视频交互,在 640×368 分辨率、25 FPS 下实现约 550ms 总交互延迟。
World + Event Stream 视频建模框架:分离静态世界与动态变化:Wan-Streamer v0.3 将视频拆解为持续存在的世界状态(环境、场景、主体、声音特征等)和随时间变化的事件流(动作、语音、环境变化等),通过预测事件流变化实现实时交互能力。
世界设定(精简):一位沉稳的年轻德国工程师在整洁专业的家庭工作室中介绍个人项目,伴有自然的工具环境声。
原生流式多模态交互:单模型处理视觉、音频与行为输出:模型将视频、音频和文本作为统一输入输出序列,通过流式 Transformer 架构完成多模态理解,并生成语言回复与行为动作,不依赖独立的语音识别、语音合成或视频生成模块。
160ms 流式单元与约 200ms 模型响应延迟:支持实时全双工交互:Wan-Streamer v0.3 保持上一版本性能指标,在 25 FPS 视频输入下,以 160ms 为流式处理单元,模型侧响应延迟约 200ms,结合 350ms 双向网络延迟后,总交互延迟约 550ms。
视觉-语言-动作式交互能力:支持开放词汇行为生成:模型将多模态用户输入映射为语言形式的语音输出与行为动作,使智能体能够根据环境状态执行非固定动作,而非仅完成预定义表情或语音响应。
面向通用视频预训练:从单任务交互模型扩展为世界模型框架:Wan-Streamer v0.3 将实时交互能力建立在大规模真实视频预训练任务之上,使模型学习世界状态变化规律,并可进一步适配不同实时应用场景。
https://wan-streamer.com/v0.3/
(@Wan-Streamer Team)
02 有亮点的产品
1、Qoder 发布 Voice 实时语音交互智能体:全双工对话,支持代码执行、浏览器操作与 MCP 调用
Qoder 推出 Qoder Voice 实时语音交互智能体,将语音模型与代码智能体能力结合,支持全双工实时交流和桌面常驻唤起。该系统基于 Qwen-Audio-3.0-Realtime,实现低延迟语音理解、上下文处理和工具调用,用户可通过自然语音指令让智能体执行代码、操作浏览器和连接外部系统。
全双工语音交互:支持实时打断、追问与主动反馈:Qoder Voice 支持用户与智能体同时说话的交互模式,用户可在任务执行过程中随时补充指令、修改方向,智能体能够根据上下文调整执行流程。
基于 Qwen-Audio-3.0-Realtime:实现低延迟语音理解与生成:Qoder Voice 集成实时语音模型,支持理解口语化表达,并在对话过程中完成上下文处理和轻量工具调用。
语音驱动 Agent 执行链路:支持代码、浏览器与 MCP 工具调用:用户无需输入结构化指令,可通过语音让 Qoder 执行代码任务、操作浏览器和调用通过 MCP 接入的工作系统。
桌面常驻气泡交互:脱离 IDE 窗口限制:Qoder Voice 以桌面气泡形式运行,用户在浏览网页、编辑文档等任意桌面场景中均可直接唤起语音交互。
开放抢先体验:Qoder Desktop Quest 模式接入:Qoder Voice 已向 Qoder 用户开放体验,个人订阅、个人体验版和企业订阅用户可在指定时间内免费使用语音对话能力。
(@Qoder)
2、Heard 发布 Coding Agent 语音层:支持 Claude Code、Codex 并行任务语音摘要与移动端控制
Heard 推出面向智能体编程工作流的语音交互层,将 Claude Code、Codex 等 Coding Agent 的终端输出转化为上下文语音摘要。该工具针对多智能体并行运行场景,通过理解任务状态后筛选关键信息播报,减少开发者持续查看终端的需求。
智能体状态语音摘要:从终端日志提取高价值信息:Heard 不直接朗读完整终端输出,而是分析 Coding Agent 的执行状态,将代码修改、测试结果、阻塞问题和待确认操作转换为简短语音反馈。
多智能体并行感知:聚合多个 Coding Agent 工作状态:针对同时运行多个 Claude Code、Codex 或 Cursor 会话的场景,Heard 按项目级别汇总多个智能体进展,避免多个终端同时输出造成信息冲突。
多种监听模式:支持协作、离屏和仅提醒三类交互方式:系统提供不同语音反馈强度,包括工作时的简短提示、离开电脑后的完整播报,以及仅在错误、审批或决策节点触发提醒。
移动端语音控制:支持离开桌面继续管理任务:通过 Heard Mobile,开发者可在手机端接收智能体状态、进行语音回复,并向运行中的 Coding Agent 发送下一步指令。
开源语音引擎与本地运行支持:提供自托管方案:Heard 提供 Apache-2.0 协议核心代码,支持本地语音方案,并兼容 Claude Code、Codex 等开发工具链。
https://www.producthunt.com/products/heard-2
(@Heard)
3、堡垒之夜上线 AI NPC 对话系统:36 个 AI Persona 接入 UEFN,支持无脚本动态交互
Epic Games 宣布将在堡垒之夜中开放 AI NPC Persona 系统,允许创作者在 UEFN(Unreal Editor for Fortnite)中加入具备固定声音与人格设定的 AI 角色。首批提供 36 个 AI Persona,玩家可与 NPC 进行非脚本化对话,用于任务引导、剧情互动和自定义游戏体验。
36 个预设 AI Persona:提供一致声音与角色设定:Epic 为创作者提供包括 Agent Jonesy、Peely、Fishstick、Cuddle Team Leader 等在内的 36 个 AI 角色,每个角色具备独立声音、人格和行为特征,可直接用于 UEFN 创作。
AI NPC 对话系统:从固定对白树转向动态生成交互:该系统允许开发者通过提示词定义角色身份、知识范围和行为方式,使 NPC 能根据玩家输入生成非预设对话,而非依赖传统剧情分支。
Persona Device 工具开放:支持创作者自定义 AI 角色:开发者可配置 NPC 的声音、背景知识、性格和交互目标,将 AI 角色嵌入 Fortnite Creative 与 UEFN 制作的游戏岛中。
语音交互链路接入生成式 AI:支持实时语音角色扮演:此前 Epic 已通过 AI Darth Vader 验证游戏内语音交互能力,系统结合大语言模型与语音生成技术,让 NPC 能够根据玩家语音输入进行回应。
7 月 30 日开放发布:面向 UEFN 创作者生态上线:AI Persona 功能计划于 7 月 30 日开放,创作者可将 AI NPC 集成到自定义 Fortnite 体验中。
https://thecosmicmeta.com/fortnite-to-roll-out-multiple-ai-powered-personas
(@Fortnite / Epic Games)
03 有态度的观点
1、北大校友翁荔发文告别 Thinking Machines,因健康原因离职
Thinking Machines Lab 联合创始人、北大校友翁荔(Lilian Weng)在社交媒体发布离职信,宣布正式离开这家成立仅 20 个月的 AI 初创公司。就在几天前,Thinking Machines 刚发布了其首个开源大模型 Inkling。
翁荔在离职信中表示,离开的主要原因是健康问题。她提到在过去 7 个月中,自己的生病频率超过了以往任何阶段,且在公司冲刺发布 Inkling 期间,因病无法参与工作的负罪感令其备受煎熬。
翁荔此前在 OpenAI 任职超过 6 年,曾从零组建了规模超 80 人的安全系统团队,并担任研究与安全副总裁。2024 年 11 月离开 OpenAI 后,她于 2025 年 2 月与 OpenAI 前 CTO Mira Murati 等人共同创立了 Thinking Machines。
Thinking Machines 在成立之初曾获得 20 亿美元种子轮融资,由 a16z 领投,投后估值达 120 亿美元。然而在过去一年中,该公司经历了频繁的人事变动,包括联合创始人 Barret Zoph、Luke Metz 在内的多名核心成员已相继重返 OpenAI。
目前,Thinking Machines 已与英伟达达成战略合作,并上线了模型微调工具 Tinker 及开源模型 Inkling,正处于从研发阶段向产品交付转型的关键期。
04 社区黑板报
招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)
1、Voice Vibe Coding(VVC)的境界
(@mikedevs@X)

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
作者提示: 个人观点,仅供参考