Meta 发力语音模型,Muse Voice Transcribe 突破 20+人分离与中英混说丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、Meta 发布实时音频感知模型 Muse Voice Transcribe:单模型完成流式 ASR、20+ 人说话人分离与端点检测
Meta Superintelligence Labs 发布首个实时音频感知模型 Muse Voice Transcribe,把流式 ASR、20+ 人说话人分离和端点检测原生整合进同一个模型。过去实时语音系统往往需要分别完成转写、判断「谁在说话」和检测「用户是否说完」,Muse Voice Transcribe 则让这些信号在同一条实时输出流中产生。
单模型同时输出转写、说话人和轮次边界: Muse Voice Transcribe 以流式 ASR 为基础,通过额外的特殊 Token 标记说话人切换、说话开始和说话结束,可原生处理 20+ 名说话人,无需再做额外后处理。
按词动态决定「还要听多久」: 音频以 80ms 为一个 Chunk 输入,模型不会采用固定等待时间,而是通过 Adaptive Delay(自适应延迟) 判断每个词需要多少音频上下文;简单词更快输出,困难词则多等待上下文,在准确率与最终转写延迟之间动态取舍。
支持中英混说和上下文偏置: 模型训练覆盖 70+ 种语言,首发重点验证 25 种,并支持句内语言切换;开发者还可以通过语言、关键词和上下文偏置,提高人名、地点及领域术语等特定词汇的识别准确率。
已开放 Meta Model API: Muse Voice Transcribe 已可通过 Meta Model API 调用,同时用于 Meta AI for Mac 的听写和 Muse Code 的语音输入。截至 9 月 1 日,该模型位列 Artificial Analysis 流式 Speech-to-Text 排行第一,并在公开说话人分离 Benchmark 中排名第一。
https://research.meta.ai/blog/introducing-muse-voice-transcribe
2、李飞飞联合创办的 World Labs 发布多模态世界模型 Atlas:支持像素级相机控制,并统一图像、视频生成与 3D 重建
李飞飞联合创办的 World Labs 发布多模态世界模型 Atlas。该模型从零开始预训练,可原生处理文本、图像、视频和 3D 信息,并在同一模型中完成受控图像/视频生成、3D 重建与时空模拟;其中最突出的变化,是把精确相机几何参数直接作为模型输入,让开发者能够按指定机位、角度和运动轨迹生成画面,而不再只靠文本描述镜头运动。
相机控制从文本指令升级为几何级输入: Atlas 可以根据 1 张或多张参考图,从指定相机位置和角度生成新视角,并沿人工设计的相机轨迹生成视频。官方展示中,Atlas 可生成最长 1 分钟、1440p 的连续视频。
一个模型同时负责生成与 3D 重建: Atlas 不仅生成二维图像和视频,还能从 1 张到多张图像重建场景几何,并输出点云和 3D 高斯泼溅结果。对于未被相机拍摄到的区域,模型会结合已有空间上下文补全场景。
采用多模态自回归扩散 Transformer 架构: 文本、图像、相机位置和 3D 深度图会被组织进统一的空间上下文,模型再根据已有内容逐步生成后续结果。视频在模型内部被表示为连续图像序列,使图像生成、视频生成和 3D 空间建模能够共享同一套架构。
从空间生成进一步延伸到时空模拟: Atlas 可从少量相机拍摄的视频重建场景,再从新的视角重新生成画面;在机器人场景中,还可以基于真实环境构建模拟空间,并生成机器人沿不同路径运动时对应的 RGB 图像和深度数据,用于真实环境到模拟环境的训练流程。
目前处于早期开放阶段: World Labs 正向部分合作伙伴开放 Atlas,后续 Atlas 也将用于驱动 Marble 等 World Labs 产品。
https://www.worldlabs.ai/blog/atlas
3、Visko 发布实时世界生成模型 Orbis 1.0:首个实时模型上线,可在生成过程中即时改写内容
Visko 正式发布 Orbis 1.0,这是其首个实时模型。相比传统「提交提示词、等待成片」的视频生成方式,Orbis 1.0 把生成过程变成一条可持续输出的实时流:用户可以一边生成、一边改写后续内容,系统则持续把世界渲染出来,并通过 Reactor 提供 API 访问。
把视频生成从一次性出片改成实时流式生成: Visko 将 Orbis 定位为一个「创建真实世界并实时呈现出来」的基础模型。官网也将其描述为可「创建鲜活世界并实时流式输出」的模型,核心变化是从离线生成短片,转向持续运行的实时生成系统。
支持生成过程中实时交互: Orbis 1.0 支持用户在生成过程中随时修改后续剧情,新的指令会实时反映到后续画面中。官网展示的交互方式包括直接续写故事、语音输入驱动画面,以及基于文本或参考图生成世界。
持久记忆支撑长时一致性: Orbis 1.0 通过有界多尺度记忆,在分块生成过程中持续保留角色、场景和风格信息,用来支撑长时间连续生成,减少长视频里常见的内容漂移和风格漂移问题。
支持文本生成、图像生成和视频续写三类工作流: Orbis 1.0 支持长时文本生成视频、图像生成视频,以及视频续写;并支持多语言提示词和生成过程中切换提示词,这意味着它不只是「实时播放视频」,而是一个可持续操控的生成工作流。
已通过 Reactor 提供 API,并区分动态版与稳定版: Orbis 1.0 现在可通过 Reactor 访问,其中 Orbis-Dynamic 被标注为「可实时切换的视频生成」,Orbis-Stable 被标注为「可操控的视频生成」。这说明 Visko 不只是发布演示页面,而是已经把模型接入开发平台,供开发者测试与调用。
Orbis :
https://visko.ai/models#orbis
动态版本:
http://reactor.inc/sandbox?model=visko-orbis-dynamic
稳定版本:
http://reactor.inc/sandbox?model=visko-orbis-stable
4、Datapoint AI 开源客服场景 TTS 人类偏好数据集:31.5 万次真人盲评覆盖 15 款模型
Datapoint AI 发布 Text-to-Speech Human Preferences 315K,将其 TTS Bench 背后的 31.5 万次真人偏好投票开放出来。数据覆盖 15 款 TTS 模型、300 条英文客服提示词和 8 类 Voice Agent 场景,开发者不仅可以查看模型排名,还能直接用这批人类偏好数据训练或评测语音奖励模型。
31.5 万条数据实际是两两语音比较的真人投票: 15 款 TTS 模型组成 105 种模型配对,每组配对都会在全部 300 条提示词上比较,每个比较单元保留 10 次有效真人选择,最终形成 31,500 个比较单元、315,000 次有效偏好投票。评测时用户看不到模型名称,只需在两段语音中选择更喜欢的一段。
专门针对客服 Voice Agent,而不是通用朗读: 300 条提示词覆盖 8 类实际客服任务,包括共情与情绪安抚、问候与品牌表达、操作指导与故障排查、人名与拼写、政策说明、口误与表达修正、预约与升级处理、交易信息播报,可以分别观察不同 TTS 模型在具体客服任务中的人类偏好差异。
除投票外还开放 4,500 条模型生成音频: 数据集包含 15 款模型针对 300 条提示词生成的 4,500 条 FLAC 音频,同时提供模型配对结果、单次真人投票、提示词和模型信息,可用于训练语音偏好模型、奖励模型,以及复现 Datapoint 的 TTS 排名。
排行榜由同一批真人偏好数据生成: Datapoint 使用 31.5 万次有效投票拟合 Bradley–Terry 偏好模型,再转换为 Elo 分数,并提供总榜和 8 个客服类别的独立排名。整体榜单对各类别等权计算,而不是简单按所有投票混合排序。
https://trydatapoint.com/benchmark/leaderboard
02 有亮点的产品
1、Bodhan AI × AI4Bharat 公布多语言语音合成模型 Indic-Speak:40 亿参数支持 23 种语言,可单次生成双人播客
Bodhan AI 与 AI4Bharat 公布 Indic-Speak,一款面向印度多语言场景的 40 亿参数语音合成模型,支持 23 种语言。相比此前发布的语音识别 Indic-Transcribe、翻译模型 Indic-Translate 等能力,Indic-Speak 补上了「语音生成」环节,并重点处理多人对话、语言混说和长文本连续朗读。
双人对话可一次生成,不需要后期拼接: 官方演示两位虚拟说话人 Parth 和 Dhara 用印地语讨论论文《Attention Is All You Need》,整段播客式对话由模型一次生成,通过说话人标签控制双方轮流发言,而不是分别生成两条语音后再拼接。
支持真实对话中的多语言混说: Indic-Speak 可以直接合成一句话中混合多种语言的内容,例如印度语言与英语交替出现,无需先把文本统一翻译成单一语言再生成语音。
针对印度本地表达做了专门处理: 模型能够正确处理 PAN、Aadhaar、货币金额等本地常见表达,减少缩写、数字和专有名词在语音生成中的读错问题。
支持长文本连续语音生成: 官方还展示了完整泰米尔语有声书章节的连续朗读,重点验证模型在长时生成中保持内容连贯和稳定的能力,而不只针对短句 TTS。
Indic-Speak 将于 2026 年 9 月 5 日在 Bodhan AI 上线。
(@MiteshKhapra@X)
2、语音 AI 公司 Smallest.ai 完成 1300 万美元 A 轮融资:押注实时语音到语音系统,累计融资超 2100 万美元
语音 AI 公司 Smallest.ai 完成 1300 万美元 A 轮融资,由 Seligman Ventures 领投,Sierra Ventures、3one4 Capital 等参投,累计融资已超过 2100 万美元。新资金将重点投入下一代实时语音到语音系统、底层实时基础设施和企业部署,目标是进一步摆脱传统 ASR、LLM、TTS 串联架构带来的延迟。
下一阶段重点转向实时语音到语音架构: Smallest.ai 认为,传统级联系统需要依次完成听写、推理和语音生成,而自然对话中的「听、想、说」实际上会同时进行。公司正在开发能够在语音到达时同步处理信息的架构,以降低对话响应延迟。
复杂任务仍可交给大型基础模型处理: Smallest.ai 的设想并非完全抛弃 LLM,而是让小型实时语音模型负责低延迟对话,遇到超出自身知识范围的复杂问题时,再调用大型基础模型处理,形成实时交互与复杂推理分工的双模型架构。
资金还将用于扩大企业级部署: Smallest.ai 创始人 Sudarshan Kamath 表示其技术目前已在 10 多家企业中支撑超过 10 亿分钟实时语音 AI 使用量,新资金将继续投入模型、实时基础设施以及金融、客服等企业场景。
「通过语音 AI 图灵测试」目前是公司自身表述: Kamath 在融资公告中称其系统已经「通过语音 AI 图灵测试」,但目前未同步公开具体测试协议、参与人数或独立评测结果。值得注意的是,Smallest.ai 此前研究文章也指出,行业仍缺少针对实时语音交互的严格图灵测试标准,需要同时评价响应时机、打断、情绪和轮次互动等维度。
https://smallest.ai/blog/series-a-funding-13m-next-generation-voice-ai
3、Violoop 完成数亿元天使轮及 Pre-A 轮融资:联想创投、蓝驰创投等参投,加速桌面 AI 硬件量产
桌面 AI 硬件公司 Violoop 完成数亿元天使轮及 Pre-A 轮融资,由联想创投、中金保时捷、蓝驰创投、元生资本、启赋资本和 Zero2IPO Ventures 共同投资。其首款产品是一台外接电脑使用的 AI 设备,通过 HDMI 读取屏幕、USB 模拟键鼠操作,让现有 Windows、macOS 和 Linux 电脑无需更换系统即可获得跨应用的智能体操作能力。
核心路线是「外挂硬件」改造现有电脑: Violoop 不要求应用逐一接入 API 或插件,而是直接读取电脑屏幕,并通过 USB 键鼠控制完成跨应用任务;设备可根据当前屏幕内容提供下一步建议,也支持持续执行多步骤任务。
部分感知和推理直接放在端侧: 设备搭载 RK3576 芯片和 26 TOPS AI 加速器,可在本地运行 Qwen 8B Q4 模型;原始屏幕画面可在设备侧处理,再按任务需要调用用户自己的 Claude、OpenAI 或 Gemini API。
联想将从投资进一步延伸到产业协同: 除成为股东外,联想还计划在生产制造、供应链、全球渠道和品牌资源上支持 Violoop 产品规模化,并与其探索智能体运行框架、端侧个人模型和自进化闭环等方向。
产品即将进入正式销售阶段: Violoop 此前已获得约 1.2 万名用户的订金预订,首款产品建议零售价为 699 美元,Kickstarter 及国内首发价为 399 美元,计划于 9 月正式上线。
https://news.qq.com/rain/a/20260901A03PK400
https://violoop.ai/
(@新京报)
03 有态度的观点
1、宇树科技回应「超 100 元报销需王兴兴审批」:很多内容不实
据澎湃新闻报道,9 月 1 日,「宇树员工称超 100 元报销需王兴兴审批」「宇树员工称奖惩机制只有罚几乎没有奖」等话题登上热搜。
宇树科技对此回应称:「很多内容不实,切勿当真。」不过,官方未进一步说明具体哪些内容不实。
此前报道称,有员工表示,在宇树科技,一笔超过 100 元的报销需要公司创始人王兴兴审批,员工也经常在其办公室外排队等待审批。相关报道还提到,王兴兴的沟通方式相对直接严厉,要求员工不对外透露公司消息,并高度关注产品细节和成本控制。
此外,宇树科技于 8 月 27 日宣布,将每年无偿赞助部分「天才少年」开展科技项目,申请对象为高中阶段至硕士研究生毕业前的学生,资助金额为 1 万至 2 万元,特别优秀的项目不设金额上限。
( @APPSO)
04 社区黑板报
招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)
1、
社区活动推荐|Google DevFest 2026 Shanghai 超前报名开启:Beyond the Model,Build for Real
今年 11 月初,Google DevFest 2026 Shanghai 将在上海举办,预计汇聚 3000 名开发者,设置 5 个分会场、17 个 Topic 和 3 场 CodeLab。
今年的主题是 「Beyond the Model. Build for Real.|超越模型,为真实而构建」。相比只讨论模型能力,这届 DevFest 更想把问题往真实工程里推一步:API 挂了怎么兜底?模型幻觉怎么做 Guardrails?成本失控后 Infra 怎么优化?Agent、Cloud、Android、Web 又该怎么真正进入生产环境?
对正在做 AI / Agent / Cloud / Android / Web 的开发者来说,这次会更偏向真实项目、工程实践与技术落地,而不是只聊趋势和概念。
时间: 2026 年 11 月初
地点: 上海
主题: Beyond the Model. Build for Real.
目前已经开启超前报名,想提前锁定席位的朋友可以关注一波~
超前报名|Google Devfest 2026 Shanghai

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
作者提示: 个人观点,仅供参考