微软 VibeVoice 新增开源流式 ASR 模型,边听边识别「谁说了什么」丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、Inworld AI 发布实时 TTS 模型 Realtime TTS-2:从单句合成升级为多轮音频感知,可用自然语言控制语气
Inworld AI 发布 Realtime TTS-2,相比 Realtime TTS 1.5 主要根据当前文本生成语音,新版本开始利用此前多轮对话音频、用户情绪和说话节奏共同决定下一句话该怎么说,并把原来的固定情绪选项改成自然语言控制,让 TTS 从「把一句话念出来」进一步变成根据对话状态实时调整表达方式。
开始利用多轮音频上下文生成语音: Realtime TTS-2 不再只根据当前句子合成,而会参考此前对话音频、用户语气、节奏和情绪状态,再决定下一句话的表达方式。同一句文本可以随当前对话状态产生不同的语气和节奏。
语气控制从预设情绪改为自然语言描述: 开发者不再只能选择固定的情绪标签,而可以直接用自然语言描述「疲惫但温暖」「急促、紧张」等表达方式;同时支持笑声、叹气、呼吸等非语言声音标记。
同一音色可跨 200+ 种语言切换: 模型支持在一次生成过程中切换语言,同时保持说话人的音色身份一致;新版还加入高级音色设计,可通过文字描述创建并保存音色,并选择表现力、平衡或稳定三种生成模式。
TTS 首段音频延迟低于 100ms: Inworld 官方给出的 TTS 层首段音频延迟低于 100ms。在完整 Realtime API 中,系统还会在推理尚未结束时并行生成附和语、提前启动语音生成并流式返回部分回答,以减少 Voice Agent 的等待感。
从研究预览转为正式开放: Realtime TTS-2 现已通过 Inworld API 和 Realtime API 正式提供,Realtime TTS 1.5 用户只需要更换模型标识即可升级,无需修改其他代码。目前该模型在 Artificial Analysis 的受控音色竞技场排名第一;在使用各家原生音色的榜单中排名第二,仅次于 Cartesia Sonic 3.6。
https://inworld.ai/realtime-tts-2
2、通义千问团队、清华大学提出长音频理解基准 AudioSpan:覆盖 10 分钟至 2 小时以上音频,分层测试感知、理解与推理
通义千问团队与清华大学研究人员提出长音频理解评测基准 AudioSpan,并公开完整数据集。不同于大量音频 Benchmark 仍以数秒短片为主,AudioSpan 将音频长度扩展到 10 分钟至 2 小时以上,同时不只测试「能不能找到答案」,而是把长音频理解拆成感知、理解和推理三个层级,共构建 3,240 道问题。
同时拉长音频长度和评测深度: AudioSpan 覆盖语音、环境声音和音乐等长时音频,并按照感知、理解、推理三个认知层级设计问题,避免只是把短音频问答简单搬到更长输入上。
用两套问答机制区分「没听到」和「不会推理」: 「原生问答」直接围绕音频真实内容设计问题;「锚点问答」则在音频中加入可验证的声学事件,再构建从感知到推理的连续问题链,用来定位模型究竟在哪一层失效。
当前模型的主要瓶颈首先出现在长音频感知: 论文对 12 个大型音频语言模型进行评测后发现,随着音频变长,模型更容易在大量冗余信息中遗漏关键声音,其中对事件发生时间的定位尤其困难,复杂推理反而不是唯一瓶颈。
数据集已公开: AudioSpan 已在 Hugging Face 开放,可用于评测大型音频语言模型在长时语音、环境声音和音乐理解上的能力。
https://huggingface.co/datasets/holvan/AudioSpan
3、腾讯、NUS、港理工提出基于MiniMax-H3 改造的交互式世界模型 H3-World:把键盘操作转成语言指令,仅训练 MiniMax-H3 0.199% 参数
腾讯、新加坡国立大学和香港理工大学研究团队提出 H3-World,将 330 亿参数的 MiniMax-H3 视频生成模型改造成可通过键盘实时控制角色和镜头的交互式世界模型。它没有额外训练一套动作控制模块,而是把键盘操作转换成 MiniMax-H3 已经能够理解的自然语言,再把每条指令精确绑定到对应的视频时间段。
直接复用 MiniMax-H3 已有的语言理解能力做世界控制: H3-World 将角色移动和相机操作组合成文本指令,通过 MiniMax-H3 原有的文本输入通道送入模型,让
W/A/S/D等键盘输入能够控制人物运动,同时控制镜头平移、转向等动作,而无需新增专门的动作编码模块。解决「知道要怎么动,但不知道什么时候动」的问题: 普通全局文本提示只能粗略指定镜头或角色运动,难以控制动作发生的准确时间。H3-World 为不同视频潜变量区间分别绑定动作语言,并通过定向注意力机制限制每条指令的作用时间,使同一段视频里可以先向左转、再向右转等连续改变控制指令。
只用 8,000 段游戏视频完成轻量适配: 团队基于 ABot-World-Explorer-500h 中的 8,000 段游戏视频训练,仅对自注意力层加入 rank-32 LoRA,共训练 6,560 万参数,占 MiniMax-H3 约 0.199%,经过 10,000 步优化即可获得角色和镜头控制能力。
能够组合训练中没出现过的动作: 如果模型分别见过某种角色动作和某种镜头动作,即使训练数据中没有出现过两者的组合,H3-World 仍能将它们组合执行,并将控制能力迁移到训练集之外的新视觉场景。
代码与 LoRA 权重已开放: 项目已公开训练与推理代码,并在 Hugging Face 发布 Apache 2.0 许可的 LoRA 权重;运行时仍需要 MiniMax-H3 基础模型以及 H3-World 的定向注意力实现。
https://danzer1xxxxchan.github.io/H3-World/
4、微软 GitHub 万星开源语音项目 VibeVoice 新增开源流式 ASR 模型 VibeVoice-ASR-Streaming:边听边识别「谁说了什么」,支持自定义热词和 10 种语言
微软 GitHub 万星开源语音项目 VibeVoice 新增 VibeVoice-ASR-Streaming,将今年 1 月 VibeVoice-ASR 已有的「谁在何时说了什么」结构化转录能力推进到实时场景。模型无需等整段音频结束,而是随着语音持续输入逐块输出带说话人归属的转录结果,并支持自定义热词和 10 种语言。VibeVoice 最早以长文本多人 TTS 模型进入开发者视野,随后陆续推出实时 TTS、长音频 ASR 和 CPU 端侧推理版本,逐步从语音合成扩展成同时覆盖 TTS 与 ASR 的开源语音模型家族。此次 Streaming 版本进一步补上实时多人语音识别能力。
「谁说了什么」从离线处理进入实时流: 此前 VibeVoice-ASR 可以单次处理最长 60 分钟音频,同时输出说话人、时间戳和转录内容;新版本则在音频仍持续输入时不断输出带说话人信息的文本,不必等录音结束后再统一处理。
支持自定义热词增强专有词识别: 开发者可以传入人名、产品名和技术术语等上下文信息,引导模型识别特定词汇,适合会议、客服及垂直领域实时转录。
首版支持 10 种语言: VibeVoice-ASR-Streaming 当前支持中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语;相比非流式 VibeVoice-ASR 的 50+ 种语言,新版本目前优先覆盖实时识别场景下的 10 种语言。
模型与代码已开放: 7B 模型权重已发布至 Hugging Face,GitHub 提供实时麦克风 Demo 和文件流式推理示例,可通过 WebSocket 在录音过程中持续返回转录结果。
https://huggingface.co/microsoft/VibeVoice-ASR-Streaming-7B
02 有亮点的产品
1、fal 创意工程团队负责人开源 Minimax H3 Max 实时互动教育系统:语音讲解同步生成教学动画,支持打断后立即切题
fal 创意工程团队负责人 Gökay Aydoğan 开源 Minimax H3 Max Realtime Education,把实时语音辅导与 H3 Max 视频生成串成一套可打断的教学系统。学生一边与 AI 对话,系统一边把当前科学讲解拆成具体知识点并持续生成 5 秒教学动画。如果学生中途提问或切换话题,正在播放的视频不会中断,旧的待生成任务会被取消,新主题的视频生成完成后直接接替播放。
语音讲解直接驱动连续教学动画: 系统使用 Grok Voice Realtime 完成语音对话,再把不断到达的转录内容拆成具体科学主题,由 H3 Max 生成对应的 5 秒、16:9 教学动画。系统同时维护有限长度的视频队列,提前准备后续画面,而不是等整段回答完成后再统一生成视频。
支持学生随时打断并立即切换教学内容: 系统带有自动打断检测。学生插话后,与旧话题相关、尚未完成的视频任务会被取消,但当前画面继续播放;新主题的首段视频一旦解码完成,就直接替换旧内容,避免画面出现空白。
无需额外模型专门撰写视频提示词: Grok Voice 输出的科学讲解会被实时转录,系统过滤寒暄后提取具体知识点,再由
H3PromptCompiler加入适龄安全规则、固定视觉风格、时长和画幅等约束,直接发送至 H3 Max 文生视频接口。项目已开源,本地 Demo 只需 fal API Key: 项目基于 Next.js、React 和 TypeScript,实时语音与 H3 Max 视频均通过 fal 调用;开发者配置
FAL_KEY后即可启动本地科学辅导 Demo,也可进一步接入 PostgreSQL、Redis 和独立实时网关。
https://github.com/gokayfem/h3-max-education
2、a16z speedrun 04 项目 AI Agent 通信基础设施 Dial 上线:10 秒给 AI Agent 分配真实手机号,可自主打电话、收短信验证码
a16z speedrun 04 的 Genway AI 创业团队推出 AI Agent 通信基础设施 Dial,为 AI Agent 提供可编程的真实电话号码。Agent 可以在约 10 秒内申请自己的号码,并通过同一套接口拨打和接听电话、收发短信及读取验证码,让原本需要人工接管的电话预约、身份验证和线下沟通继续由 Agent 自主完成。
AI Agent 可以自己申请并控制真实手机号: Dial 把电话号码变成 Agent 可直接调用的基础设施,不需要人工购买 SIM 卡或处理运营商接入;号码创建后即可用于拨打、接听电话和双向消息通信。
解决短信验证码导致的 Agent 工作流中断: Agent 可以直接读取收到的完整短信,包括一次性验证码,再自行决定后续操作。过去自动注册流程走到「输入手机验证码」往往需要把任务交还给人,现在可以继续自动执行。
语音通话也被封装成 Agent 工具: 开发者可以让 Agent 根据指令主动拨打真人或商家,完成预约、确认和跟进等任务,并获得实时转录;来电也可以由 Agent 根据预设指令自动处理。
同时提供 REST API、MCP、CLI 和 SDK: Dial 已可接入 Claude Code、Cursor、Codex 等 Agent 工作流,也提供 Node.js、Python SDK,以及 LangChain、CrewAI、AutoGen 等框架适配,让开发者不需要单独搭建电话基础设施。
https://www.producthunt.com/products/dial-3
3、反诈 AI 公司 Apate.AI 获 815 万美元种子轮融资:用语音、消息和邮件主动「拖住」诈骗分子,已完成 250 万次自主对话
反诈 AI 公司 Apate.AI 获得 815 万美元种子轮融资,由 Lobby Capital 领投,OIF Ventures、Investible、Concept Ventures 和 Baobab Ventures 参投。与传统依赖检测和拦截的反诈系统不同,Apate.AI 部署大规模对抗式对话 AI 智能体,主动通过语音、消息和邮件与诈骗分子交互,在拖延其时间的同时提取诈骗话术、钓鱼链接、洗钱账户和加密钱包等实时情报。
让 AI 主动进入诈骗对话,而不是只在事后识别风险: Apate.AI 的智能体会模拟真实受害者,与诈骗分子持续沟通,把传统「检测并阻断」的反诈流程推进到「主动接触、拖延并获取情报」。
单次对话最长可持续 2 小时: 平台同时运行数千个语音和文本智能体,可与诈骗分子持续进行长时间自然对话,在消耗其人力和时间成本的同时不断收集可用于追踪和阻断诈骗网络的信息。
已完成超过 250 万次自主对话: Apate.AI 表示,其系统已与威胁行为者完成 250 万次以上自主交互,从中提取超过 25 万条诈骗情报,包括冒充方式、钓鱼网址、洗钱银行卡账户和加密钱包等,并将结果接入客户的反诈处理流程。
已进入大型金融机构生产环境: 平台目前已服务包括澳大利亚联邦银行在内的头部机构。新一轮资金将用于继续扩展对话智能体平台,并加强美国和欧洲市场布局。
(@ApateAI)
4、警务 AI 公司 Blue Voice 获 600 万美元种子轮融资:用语音和随身摄像头记录自动生成案件报告
面向执法机构的 AI 公司 Blue Voice 获得 600 万美元种子轮融资,由 General Catalyst 领投。其核心产品是一套面向警员的 AI 工作助手,可以读取警员口述内容、随身摄像头视频和案件材料,自动整理成案件报告、证词摘要等文书,试图把警员大量花在案后记录和行政工作的时间交给 AI 处理。
从现场语音和视频直接生成案件报告: Blue Voice 可以处理警员口述、随身摄像头记录以及其他案件资料,提取事件经过、人员和关键信息,再按照警务文书格式生成报告草稿,减少警员返回办公室后手工整理记录的工作。
目标是做警务场景的通用 AI 工作助手: 除生成报告外,Blue Voice 还计划让 AI 帮助警员搜索法律和部门政策、查询案件信息并完成更多行政任务。创始人将产品定位类比为法律 AI 公司 Harvey,希望构建一套贯穿执法工作流的警务 AI 平台。
产品已进入真实警务机构使用: Blue Voice 已与美国多个警察部门合作,并将新资金用于扩大工程和销售团队、拓展更多执法机构客户。对于 Voice AI 而言,这类产品也展示了语音模型从实时对话进一步进入高强度现场记录与专业文书生成工作流的另一条路径。
(@Techcrunch)
03 有态度的观点
1、马斯克:AI 明年底可胜任所有数字工作
昨日,马斯克在 G20 创新部长峰会的公开发言中表示,他预计到明年底,AI 可胜任几乎所有不需要人类直接操作物理世界的数字工作。
他将届时的 AI 编程能力比作国际象棋引擎 Stockfish,认为人类将很难在软件开发上与之竞争;各类工程与其他数字任务也可能在未来 12 至 18 个月达到很高水平。
对人形机器人,马斯克的判断更谨慎一些。他说,物理世界的产品需要建立庞大供应链,无法像软件那样直接复制。他把机器人的实用性拆成三个相乘的因素:AI 软件能力、机身芯片性能,以及机电灵巧性,尤其是手部操作能力。
他同时把电力列为 AI 扩张的主要约束。按他引用的分析师共识估计,2027 年 AI 芯片可能面临至少 15GW 的供电缺口:AI 芯片产量每年增长约 40%~50%,而中国以外地区的可用电力年增速约为 10%~20%。
针对电力缺口,马斯克建议各国在承接 AI 数据中心时,同步增建发电和电网设施。
他也提到,Google、Anthropic 等公司正向 SpaceX 租用算力,SpaceX 之所以能更快投用设备,是因为自建了发电设施。
(@APPSO)
04 社区黑板报
招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)
1、
深圳开发者活动推荐|Physical AI Camp 项目 WatcheRobot Workshop:把 AI Agent 接入真实机器人的开发实践
现在大多数 AI 应用仍停留在屏幕里:能对话、能生成代码,却无法感知真实环境,也不能通过硬件做出反馈。
这次 Workshop 将开放尚未上市的 WatcheRobot 及其 SDK。参与者可以使用 Codex、Claude Code、DeepSeek 等 AI 编程工具,调用机器人的摄像头、麦克风、屏幕表情、灯光和机身动作,把一个具体创意开发成可在真机上运行的功能。
现场不只是观看产品 Demo,而是实际连接设备、编写代码、运行测试并调试机器人的反馈,让它根据语音或视觉输入做出对应的表情、灯光和动作。
时间:9月5日(周六)9:00–17:00
地点:深圳市南山区
要求:自带电脑,具备基础开发环境
名额限10人参加,需提前报名审核
如果你对 WatcheRobot活动、AI 机器人开发或我们的产品方向感兴趣,报名连接:
https://mcnsslrwxv50.feishu.cn/share/base/form/shrcnbP0aKpMfCqVB1hy7QXk55b


阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
作者提示: 个人观点,仅供参考