Inflect 发布 4M/10M 极小端侧 TTS 模型;ViiTorVoice-NAR 实现「词级」语音精准编辑丨日报
开发者朋友们大家好:
这里是「RTE 开发者日报」,每天和大家一起看新闻、聊八卦。我们的社区编辑团队会整理分享 RTE(Real-Time Engagement) 领域内「有话题的技术」、「有亮点的产品」、「有思考的文章」、「有态度的观点」、「有看点的活动」,但内容仅代表编辑的个人观点,欢迎大家留言、跟帖、讨论。
本期编辑:@三水、@鲍勃
01 有话题的技术
1、微软发布 VibeVoice-ASR-BitNet 边缘 CPU 推理引擎:模型压缩至 1.58 GB,支持 3 线程实时语音识别
微软推出面向 VibeVoice-ASR 的边缘 CPU 推理引擎 VibeVoice-ASR-BitNet,通过异构量化技术将模型规模从 4.62 GB 压缩至 1.58 GB。该引擎无需 GPU,在 3 个以上 CPU 线程上即可实现实时推理,面向端侧设备部署。
异构量化将模型体积降低 66%:从 4.62 GB 压缩至 1.58 GB:针对不同模块采用不同量化策略,其中 VAE Tokenizer 使用 INT8 量化,语言模型部分采用 BitNet 低比特权重量化,在保持推理能力的同时降低内存占用。
CPU 实时推理无需 GPU 加速:3 个以上线程达到实时性能:VibeVoice-ASR-BitNet 基于 CPU 优化推理架构,通过底层算子优化实现实时语音识别,可运行于普通消费级 CPU 环境。
面向边缘设备部署:支持 x86 与 ARM CPU 平台:推理引擎针对不同 CPU 架构优化,降低语音模型部署对 GPU 算力和云端推理资源的依赖。
开源推理框架与模型权重:提供端侧部署能力:微软同步开放 VibeVoice 相关代码,开发者可基于 GitHub 仓库获取模型和推理实现。
Github
https://github.com/microsoft/VibeVoice/
Hugging face
https://huggingface.co/microsoft/VibeVoice-ASR-BitNet
( @Microsoft VibeVoice GitHub)
2、Inflect 发布超小型 TTS 模型 Inflect v2:4M 与 10M 参数规模,支持本地端侧语音合成
开发者 Owen Song 发布 Inflect v2,一组面向本地部署的超小型文本转语音模型,包含参数量低于 400 万的 Inflect-Nano-v2 与低于 1000 万参数的模型版本。该系列模型针对资源受限设备优化,在极低参数规模下提供完整 TTS 能力。
Inflect-Nano-v2 参数量低于 400 万:实现超轻量 TTS 部署:模型规模压缩至百万级参数,可用于低算力设备、本地应用和嵌入式场景,降低语音合成模型的内存与计算需求。
完整 TTS 能力集成于 1000 万参数以内:无需依赖大型语音模型架构:Inflect v2 提供端到端文本转语音能力,在小模型规模下覆盖文本输入、语音生成等完整流程。
面向本地推理场景开源:提供模型权重与代码实现:项目公开 Inflect-Nano-v2 模型权重及 GitHub 推理代码,开发者可直接部署和二次开发。
探索百万级参数语音模型方向:降低 TTS 端侧部署门槛:相比当前主流数亿至数十亿参数级 TTS 模型,Inflect v2 将模型规模进一步压缩,适用于离线语音助手、IoT 和边缘设备场景。
Hugging Face Inflect-Nano-v2
https://huggingface.co/owensong/Inflect-Nano-v2
GitHub Inflect
https://github.com/owenawsong/Inflect
Reddit r/LocalLLaMA 发布帖
https://www.reddit.com/r/LocalLLaMA/comments/1v5ve6v/
( @Inflect)
3、Black Forest Labs 与 Mimic Robotics 发布 FLUX-mimic 视频动作模型:基于 FLUX 3 多模态模型预测机器人动作
Black Forest Labs 与 Mimic Robotics 推出 FLUX-mimic,一款基于 FLUX 3 多模态基础模型的视频动作模型。该模型利用 FLUX 3 对图像、视频和音频的统一世界表示能力,结合机器人操作数据训练,可从视频预测未来场景变化并生成机器人动作。
基于 FLUX 3 世界模型生成动作规划:从视频预测未来状态:FLUX-mimic 以 FLUX 3 视频骨干网络作为基础,通过模型内部学习到的场景动态表示预测操作环境变化,再由动作解码器生成机器人执行轨迹。
视频生成模型与机器人控制结合:统一视觉理解与动作生成流程:区别于传统机器人系统中「视觉感知 → 规划 → 控制」的级联架构,FLUX-mimic 直接利用视频潜变量表示进行动作预测,将视频理解能力迁移至机器人操作任务。
采用紧凑动作解码器降低机器人训练成本:直接从潜空间生成动作片段:模型通过轻量动作解码模块关注 FLUX 3 对未来状态的预测结果,并从视频潜变量中生成连续机器人动作。
结合机器人操作数据训练:面向真实世界操作任务部署:Mimic Robotics 使用自身机器人操作数据对模型进行训练,使 FLUX-mimic 能够处理真实环境中的物体抓取、移动等操作任务。
FLUX 3 提供统一多模态基础能力:支持图像、视频、音频与动作建模:FLUX 3 通过统一架构联合学习图像、视频和音频表示,用于理解物体关系、运动规律和事件变化,并作为 FLUX-mimic 的基础模型。
Black Forest Labs Blog
https://bfl.ai/blog/flux-3-mimic
Mimic Robotics Blog
https://www.mimicrobotics.com/blog/introducing-flux-mimic
( @Black Forest Labs Blog @Mimic Robotics Blog)
4、ViiTor AI 发布 ViiTorVoice-NAR 词级 TTS 编辑模型:支持局部语音重写,首帧延迟约 60ms
ViiTor AI 开源 ViiTorVoice-NAR,一款基于非自回归架构的文本转语音模型,支持语音克隆、局部语音编辑和情感控制。该模型可仅替换音频中的指定词语或片段,无需重新生成整段语音,并支持低延迟推理。
词级语音编辑能力:仅重生成修改区域,保持原始语音上下文:ViiTorVoice-NAR 输入原始音频、原文本和修改文本后,可定位变化区域并重新合成局部片段,实现类似文本编辑的语音修改流程。
非自回归架构支持并行生成:降低长文本编辑成本:模型采用非自回归语音生成方式,通过对语音区域进行重建,避免传统自回归 TTS 修改单词后需要重新生成后续音频的问题。
低延迟推理:首次音频生成延迟约 60ms:官方仓库显示,ViiTorVoice-NAR 支持 first block inference,端到端首帧延迟约 60ms,适用于实时语音交互场景。
多维语音控制:支持音色克隆、情感和非语言表达控制:模型支持通过提示音频实现声音克隆,并可通过情感标签和非语言信息控制语气、风格等语音属性。
开源模型与部署代码:Apache 2.0 协议开放本地部署:项目已公开 GitHub 代码仓库和 Hugging Face 模型权重,包含本地推理组件,可独立部署语音编辑流程。
ViiTor AI GitHub
https://github.com/viitor-ai/viitor-voice-nar
Hugging Face ViiTorVoice-NAR
https://huggingface.co/ZzWater/ViiTorVoice-NAR
( @ViiTor AI GitHub @Hugging Face ViiTorVoice-NAR)
02 有亮点的产品
1、Raintree Systems 收购 Spike Technologies:将智能体语音 AI 集成至医疗 EHR,自动化收入周期管理流程
医疗软件公司 Raintree Systems 宣布收购 Spike Technologies,将其智能体语音 AI 技术原生集成到 Raintree 的电子病历(EHR)和实践管理平台中。此次整合面向康复治疗和物理治疗机构,重点自动化保险沟通、理赔跟进、资格验证、预授权和患者触达等高人工成本流程。
智能体语音 AI 原生进入 EHR 平台:替代传统脚本式电话流程:Spike Technologies 的语音智能体能够理解上下文、执行多步骤任务并做出决策,不再依赖固定菜单式 IVR 或简单聊天机器人;由于直接嵌入 Raintree EHR,可访问临床、排班和财务上下文信息。
自动化收入周期管理(RCM)核心流程:覆盖保险电话、理赔跟进和预授权:系统针对医疗机构中大量依赖人工电话处理的行政工作,通过语音智能体完成 payer calls、claim follow-ups、eligibility checks、prior authorization 等流程。
AI 语音能力从外挂工具转向业务系统原生组件:减少第三方集成成本:Raintree 将 Spike 能力直接并入现有医疗工作流,用户无需额外采购独立语音系统或重新搭建接口。
面向自主化 RCM 演进:目标降低医疗机构行政处理成本:双方计划继续扩展收入周期和患者互动场景中的智能体编排能力,推进更高程度自动化的医疗运营流程。
https://www.linkedin.com/pulse/transformative-acquisition-raintree-systems-combines-spike-hedges-u9ztc/
( @Nick Hedges@Linkedin)
2、Anuttacon 停运 AI 陪伴产品 AnuNeko:转向大语言模型与智能体研发方向
蔡浩宇创立的 AI 公司 Anuttacon 宣布旗下 AI 陪伴产品 AnuNeko 将于 2026 年 7 月 29 日停止运营,应用和聊天记录将无法访问,用户数据按隐私政策删除。此次停运后,团队将资源集中到其他 AI 项目,研发重心逐步转向大语言模型与智能体系统能力建设。
AI 陪伴产品 AnuNeko 上线不足一年停运:结束人格化交互实验:AnuNeko 于 2025 年底上线,以黑猫形象作为默认角色,提供 Orange Cat 与 Exotic Shorthair 两种 AI 陪伴模型,重点探索具有人格、情绪表达和长期互动能力的 AI 角色。
AnuNeko 采用人格化对话设计:强调情绪表达与主动互动能力:产品区别于任务型 AI 助手,通过角色设定让模型表达态度、主动调侃和回应用户,探索 AI 陪伴场景中的长期关系建立。
Anuttacon 曾推出实时 AI 角色交互游戏:验证语音、视频和多模态能力:团队于 2025 年上线《Whispers from the Star》,玩家通过文字、语音和视频与 AI 角色 Stella 实时交流,产品采用开放式对话而非固定脚本。
LPM 1.0 视频模型实现实时角色生成:17B 参数模型蒸馏至低延迟流式版本:Anuttacon 曾发布角色表演生成模型 LPM 1.0,训练 170 亿参数 Base LPM,并蒸馏为支持实时流式生成的 Online LPM,实现角色说话、倾听、回应和表情生成。
研发方向转向大语言模型与智能体:音视频技术作为底层能力复用:据报道,Anuttacon 正调整研发重点,从 AI 角色产品实验转向模型与智能体能力建设,此前积累的音频和视频技术将更多用于提升智能体系统交互能力。
(@游戏葡萄)
3、Fovea 发布人机交互系统:将视线、语音与屏幕上下文融合为 AI 输入,支持免键鼠操作
AI 硬件公司 Fovea 推出面向桌面场景的人机交互系统 Fovea,通过摄像头捕捉用户视线、麦克风采集语音,并结合当前屏幕内容理解用户意图,将注意力转化为 AI 可执行输入。该系统目标是让用户通过「看、说」完成电脑操作,减少传统键鼠交互依赖。
多模态交互输入:融合视线、语音与屏幕上下文理解用户意图:Fovea 按下快捷键后读取当前屏幕状态,识别用户正在关注的区域,并结合语音指令生成对应 AI 操作。
视线作为鼠标输入:通过注意力定位交互目标:系统将用户注视位置作为输入信号,使用户无需移动鼠标即可选择屏幕中的元素,并配合 AI 执行后续任务。
语音替代键盘操作:支持自然语言驱动电脑任务执行:用户可以直接描述需求,Fovea 将语音意图与当前应用上下文结合,交由 AI 完成代码修改、内容处理等操作。
面向智能体时代的人机接口:从输入文本转向理解用户状态:Fovea 的交互逻辑由「用户主动描述需求」转向「AI 感知用户正在做什么并辅助执行」,探索视觉注意力作为下一代计算输入方式。
https://www.hellofovea.com/
(@Fovea@X)
03 有态度的观点
1、黄仁勋:AI 时代需要开放模型,与闭源前沿模型共同推动未来
近日,英伟达(NVIDIA)创始人兼 CEO 黄仁勋(Jensen Huang)在社交媒体发布首篇公开帖,分享了英伟达签署的一封关于「为什么开放模型重要」的公开信,并表达了对开放 AI 生态的支持。
黄仁勋认为,人工智能将改变每一个行业,赋能每一家企业,并最终被世界各国共同建设和应用。在这一过程中,开放模型将成为推动 AI 普及的重要力量。
他指出,开放模型不仅能够加速技术创新和传播,还能提升 AI 安全性与网络安全能力。由于模型权重公开,研究人员、开发者和企业可以更深入地理解、测试和改进模型,从而帮助整个生态发现问题、修复漏洞,并推动技术进步。
与此同时,黄仁勋强调,未来世界并不应该只有一种 AI 发展路径。「前沿闭源模型」和「前沿开放模型」都将发挥重要作用:闭源模型可以持续探索极限能力,而开放模型则能够让更多国家、企业和开发者参与 AI 创新。
这一表态也反映出英伟达在 AI 产业链中的战略方向——推动更广泛的 AI 基础设施建设,让 AI 能力从少数公司掌握的技术,逐渐变成全球开发者都可以参与和创造的平台。
( @JensenHuang@X)

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
作者提示: 个人观点,仅供参考