哔哩哔哩开源 IndexTTS-2.5,支持 5 语种情感复刻丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、哔哩哔哩 IndexTTS 团队开源 IndexTTS-2.5:支持 5 种语言与跨语种情感复刻,推理速度快于 IndexTTS-2
IndexSpeech 团队正式开源 IndexTTS-2.5,针对 IndexTTS-2 的多语言、情绪表现和推理效率进行优化。新版本支持中文、英语、日语、西班牙语和阿拉伯语,并保留跨语种与音色情感解耦能力,同时新增语速控制和更细粒度的发音控制。
支持 5 种语言与跨语种情感复刻: 覆盖中文、英语、日语、西班牙语和阿拉伯语,并进一步优化情绪韵律表现、音色还原和跨语种合成稳定性。
推理速度快于 IndexTTS-2: 团队对推理架构进行了轻量化重构,以提高模型推理运行效率;当前未披露具体加速比例。
新增 0.5×–2.0× 时长控制: 通过
duration_factor调整生成语音时长,从而控制语速。增强中文、英语和日语发音控制: 支持对中文 Pinyin、英语 CMU phonemes 和日语 Kana 进行更细粒度的发音控制。
支持通过 vLLM 部署: IndexTTS-2.5 已提供面向 vLLM 的部署方案,同时开放 Python API 和本地 WebUI。
https://github.com/index-tts/index-tts
https://arxiv.org/abs/2601.03888
https://github.com/index-tts/index-tts2-5.github.io
( @IndexTTS)
2、VoiceHub 开源统一语音模型库:集成 34 个 TTS、23 个 ASR 与 11 个 VAD 后端
开发者 Kadir Nar 发布 VoiceHub,将 TTS、ASR 和 VAD 模型整合到统一的推理、数据处理、训练与优化工作流中。项目当前包含 68 个模型集成,可通过统一 API 加载 Hugging Face 等来源的 checkpoint,也支持本地模型路径。
集成 68 个语音模型后端: 当前包括 34 个 TTS backends、23 个 ASR providers 和 11 个 VAD providers,并为不同模型保留各自的 conditioning、训练目标和导出规则。
统一 TTS、ASR 与 VAD 调用接口: VoiceHub 提供共享的 configuration、processor、model、typed output 和 trainer API,开发者可以通过统一入口加载和调用不同架构的语音模型。
提供训练与微调工作流,但支持范围因模型而异: 项目支持数据准备、Trainer、checkpoint 恢复和模型导出;官方明确说明,并非所有已接入的推理模型当前都支持微调,具体能力取决于 checkpoint 和 runtime。
提供 TTS 推理优化接口:
TTSOptimizationConfig可配置 attention implementation、kernel backend 和 compile 等优化选项,并针对目标硬件提供模型 benchmark。支持本地安装与本地 checkpoint: VoiceHub 支持 Python 3.10–3.12,模型权重可按需下载或直接从本地路径加载;项目本身采用 Apache-2.0 License。
https://github.com/kadirnar/voicehub
https://kadirnar.github.io/voicehub/
(@kadirnardev)
3、苹果公开默声语音识别专利申请:光学读取面部微动,本地音频反馈延迟控制在 100ms 内
苹果公开一项默声语音检测相关 PCT 专利申请 WO2026/159706A1,提出通过非接触光学传感器读取用户面部皮肤微运动,再利用神经网络解码为词序列,并生成音频反馈。该方案面向耳机和智能眼镜等穿戴设备,专利申请目前尚未获得授权。
通过光学散斑读取无声说话时的面部微运动: 传感头向面颊发射相干光,并通过 CMOS 传感器捕获皮肤运动导致的散斑变化;传感器与皮肤保持非接触,典型工作距离约为 1–2cm。
待机 20fps、检测到运动后提升至 100–200fps: 系统可在空闲状态降低采样帧率节省功耗,识别到可能的说话动作后切换至更高帧率进行捕获。
神经网络在穿戴设备侧解码语音: 散斑图像先经过特征提取,再由预训练神经网络输出词序列;模型可在云端完成训练后下发至本地设备运行。
本地音频反馈链路延迟控制在 100ms 内: 解码后的语音经 I²S、BSoC 音频处理、AGC、DAC 和功放送至扬声器,用于让用户快速确认自己的默声输入结果。
支持一体化与分布式算力架构: 特征提取、神经网络推理和音频生成可全部在耳机内部完成,也可拆分至另一只耳机、充电仓、手机或云端;专利示例形态包括耳挂式设备和集成光学/肌电传感器的智能眼镜。
Apple 20 亿美元收购「无声对话」公司 Q.ai,微表情识别无声指令;AI 玩具 FoloToy 连获数千万元融资丨日报
(@21dB 声学人)
4、Cartesia 为 STT 模型 Ink-2 增加 Keyterm Prompting 与可配置 Turn Detection:单次最多传入 100 个关键词
Cartesia 为流式 STT 模型 Ink-2 上线两项新能力:Keyterm Prompting 用于提高专业术语、品牌名和人名等实体的转录准确率;Configurable Turn Detection 则允许开发者在更低响应延迟与更准确的端点判断之间进行调整。两项功能现已向所有 Ink-2 用户开放。
最多支持 100 个 Keyterms: 建立连接时可通过
keyterm参数传入最多 100 个关键词,总长度不超过 1,200 个字符,模型会在转录时提高这些词的识别倾向,官方称不会因此增加额外延迟。Earnings22 上关键词 Recall 提升 20%: Cartesia 在真实财报电话数据集 Earnings22 上测试后称,启用 Keyterm Prompting 可将 Ink-2 的关键词召回率提升 20%;测试中 Ink-2 漏掉 6.2% 的关键词,Deepgram Flux 为 13.5%。
面向专业实体识别: Keyterm Prompting 主要针对产品和品牌名、药品与临床术语、姓名、地址以及行业缩写等通用 STT 容易识别错误的词汇。
Turn Detection 可调节延迟与端点判断: 开发者可以让模型更早结束用户发言以降低响应延迟,也可以延长等待时间,跨越用户讲话中的停顿,减少一句话被错误拆成多个 turn 的情况。
支持通话过程中动态修改: Turn Detection 参数既可在建立连接时设置,也可以在音频流处理中途调整,以适配不同阶段的对话需求。
https://www.cartesia.ai/blog/keyterm-prompting/?utm_source=x
( @Cartesia)
02 有亮点的产品
1、西湖心辰完成数亿元 B+ 轮融资:持续研发扩散语言模型,迭代原生多模态实时互动产品
西湖心辰完成数亿元人民币 B+ 轮融资,由广发信德领投,西湖创新投、武汉江豚基金、容亿投资、南通投管等机构跟投,58 产业基金等产业资本参与,蚂蚁集团、汤姆猫等老股东继续支持。融资资金将主要用于新一代扩散语言模型研发、原生多模态实时互动产品迭代及海外市场拓展。
继续押注扩散语言模型: 公司将研发重点放在扩散范式下的大模型,希望利用其并行生成、可编辑和可控等特性,探索区别于自回归架构的生成路径。
聚焦连续扩散、全模态交互与超拟人能力: 西湖心辰当前将资源集中在这三个方向,并围绕底层模型、AI 原生应用和开放平台构建产品体系。
原生多模态实时互动是主要产品方向: 现有产品覆盖情感陪伴、互动内容、AI 角色社区和沉浸式虚拟体验等形态。
扩散语言模型研发与 Agent 能力并行推进: 创始人蓝振忠同时参与 LLaDA 等扩散语言模型研究;相关团队近期开源的 LLaDA2.2 采用 MoE 架构,支持 128K 上下文,并面向智能体任务进行能力扩展。
海外商业化已启动: 公司自 2024 年开始推进产品海外化,并表示相关产品已在全球市场形成商业化收入。
(@西湖心辰)
2、CosyFlow:说得随意,写得漂亮
CosyFlow 基于 Qwen-Audio-3.0-ASR-Flash 模型,将语音转写与语义理解融为一体,开口即成可交付的内容。
语音键盘在转写基础上叠加语义理解与文本生成能力。日常表达中,自动过滤无意义的口语填充词,将零散想法整理为清晰结构;说话时的自我修正不会留下改口痕迹,只保留最终意图。工作场景中,口述即可生成邮件、工作汇报、会议纪要的格式与话术。
随记把记录能力延伸到更长的场景——会议、访谈、课堂等,支持实时录制与离线文件上传,根据声纹区分发言人,一键多语言翻译。录音结束后自动生成 AI 摘要与智能待办。
让每一句开口,都成为可沉淀的价值。
( @CosyFlow)
3、WAXAL 开放非洲多语言语音语料:覆盖 21 种语言,包含约 1250 小时 ASR 与 180+ 小时 TTS 数据
WAXAL 是 Google Research 与多家非洲高校和社区机构合作构建的大规模多语言语音语料库,论文版本覆盖 21 种撒哈拉以南非洲语言,面向 ASR 与 TTS 训练和研究。数据涉及的语言使用者合计超过 1 亿人。
ASR 数据约 1250 小时: 论文披露的 ASR 部分包含约 1250 小时带转录的自然语音,采集自不同说话者,用于自动语音识别模型训练与评测。
TTS 数据超过 180 小时: TTS 部分由高质量单说话者录音组成,朗读经过音素平衡设计的文本,可用于非洲语言语音合成研究。
覆盖多类低资源非洲语言: 数据包含 Acholi、Kiswahili、Luganda、Akan、Ewe、Shona、Fula、Lingala、Hausa、Igbo 和 Yoruba 等语言,不同语言分别提供 ASR、TTS 或两类数据。
由多家非洲机构参与数据采集: 合作方包括 Makerere University、University of Ghana、Digital Umuganda、Media Trust、Loud and Clear 及 AIMS Senegal,数据采集得到 Google 与 Gates Foundation 资助。
https://modelscope.cn/datasets/google/WaxalNLP?wx=
4、腾讯混元发布 3D 世界的 Agentic 框架 WorldClaw:Agent 驱动开放世界 3D 生成,输出可编辑实例级资产
腾讯混元团队发布 WorldClaw,一套从开放文本生成大规模可探索 3D 世界的 Agentic 框架。系统采用 coarse-to-fine 流程,将生成拆分为意图分析与规划、全局地形生成、区域对象生成与放置三个阶段,同时保留全局地形结构与实例级可编辑 3D 资产。
多个 Agent 分阶段构建 3D 世界: Planning Agent 先把文本转换为包含区域、地形、资产、材质和空间关系的结构化 Scene Specification,再由后续 Agent 调用生成式与程序化工具完成场景构建和迭代。
先生成全局地形,再按区域补充细节: WorldClaw 通过 Semantic Layout、Region-aware Height Field、程序化地形和材质建立统一的全局空间结构,只对需要细化的区域继续生成对象,避免一次性处理完整场景。
2D 区域构图再还原为独立 3D 对象: 系统先基于现有地形渲染生成区域 Composition,再用 SAM3 分离对象,通过 SAM3D 重建 Mesh,并根据相机与地形几何关系恢复对象的位置、尺度和朝向。
Agent 通过 Blender + MCP 自动修正场景: Refinement Agent 会重新渲染场景,检查对象尺度、姿态、Mesh 质量以及悬空、穿模等 Object–Terrain Contact 问题,并修改对象或局部地形后再次验证。
组合多种基础模型完成生成: 论文实验使用 Claude Opus 4.8 作为底层 Agent 模型,并接入 GPT-Image-2、SAM3、SAM3D 和 Hunyuan3D;地形生成、对象放置、场景优化和渲染均在 Blender 5.1.1 中完成,实验运行于 4 张 NVIDIA H20 GPU。
https://tencent-hunyuan.github.io/Hunyuan3D-WorldClaw/
03 有态度的观点
1、数字生命卡兹克:学 AI 最重要的不是学 Prompt,而是先把「最不想干的事」扔给 AI
数字生命卡兹克近日分享了一套「从 0 开始,12 步学会用好 AI」的方法。他认为,很多人会天然觉得「用 AI 是一件很难的事情」,甚至因此不敢开始。但真正学会 AI,并不需要先掌握复杂的模型原理或 Prompt 技巧,而是直接从一件自己「最头疼、最不想干、最抗拒的事情」开始。
他的第一条建议甚至不是学怎么打字提问,而是:下载一个语音输入法,从此以后,跟 AI 发消息时就不要再打字了,直接用嘴进行表达。
接下来,把脑海里的事情「一股脑」说给 AI,按照【背景、痛点、需求】的框架描述,再让 AI 先不要干活,而是「用苏格拉底提问法向我提问,一次只问一个问题,直到你认为已经完全理解这件事」。
等 AI 问得差不多,再把和这件事相关的文档、表格、PPT、参考资料全部放进一个文件夹交给它,然后直接说:「这是我的所有文件,请你帮我直接完成吧,遇到必须由我决定的地方,再停下来问我。」
如果结果不满意,也不要马上觉得「AI 不行,然后自己去干了」,而是继续告诉 AI 哪里不对。哪怕自己说不清楚,也可以直接说:「我现在讲不出来具体原因,但我就是不喜欢,请你对比几个方向,一次问我一个问题,帮我把判断标准找出来。」
大概经过 2~3 轮,这件「最不想做的事」大概率就已经被 AI 做完了。
但真正关键的是最后一步:再让 AI 把刚才整个过程做成一个可以反复使用的 Skill。
这套方法背后的判断其实很直接:学 AI,不是学会更多 Prompt,而是先学会把自己的想法完整地说出来,再把一次次工作过程沉淀成 AI 可以重复执行的能力。
(@数字生命卡兹克)
04 社区黑板报
招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)
1、
社区活动推荐|8 月 29 日 Unstructured Data Meetup 上海站
8月29日,Unstructured Data Meetup 即将登陆上海!
Unstructured Data Meetup 以非结构化数据和 GenAI为主题,面向开发者的技术分享线下聚会,该活动源自硅谷,由向量数据库领先者 Zilliz 创办。分享嘉宾将会介绍向量数据库,大模型、AI应用、大数据等领域的话题。活动受众包括,AI工程师,数据科学家,大数据工程师,AI产品经理等群体。通过 Unstructured Data Meetup,让更多非结构化数据和 GenAI 开发者共聚一堂,共同探索非结构化数据和 Gen AI 的最新进展及演进方向。
时间: 2026年8月29日(周六)13:00–17:30
地点:上海五角场创新创业学院 二楼报告厅(杨浦区大学路322号)
主题:Gen AI 连接非结构化数据
报名倒计时丨8月29日Milvus社区 上海Unstructured Data Meetup

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
作者提示: 个人观点,仅供参考