混元开源语音编辑模型 AuK:一句自然语言生成、修改和清理语音丨日报

本期编辑:@三水、@鲍勃


01 有话题的技术


1、腾讯混元开源 1.5B 参数语音生成与编辑基础模型 AuK:一句自然语言统一做 TTS、改词改情绪、降噪与分离


腾讯混元、上海交通大学和上海创智学院开源 AuK,一个 1.5B 参数的语音生成与编辑基础模型。与分别调用 TTS、语音转换、降噪、分离等专用模型不同,AuK 把语音生成、内容编辑、副语言编辑、声学编辑、增强与分离统一到同一个模型中,开发者可以直接用自然语言描述「说什么、怎么说、保留什么或去掉什么」。代码和模型权重已同步开放。


  • 一个模型统一五类语音任务: AuK 支持 Zero-shot TTS 和指令 TTS,也可以直接修改已有音频中的文字内容、歌词、音高、语速和音量;进一步还能改变情绪与音色、去除口音、增加或删除笑声/咳嗽等非语言声音,以及完成语音增强、说话人分离和目标说话人提取。

  • 语音编辑开始像「用 Prompt 改图片」一样操作: 用户无需针对不同任务切换模型或设计专用控制参数,例如可以直接要求「替换这句话」「保留第二个说话人」「去掉噪声和混响」「保持说话人不变但改成耳语」等,由同一套自然语言接口完成处理。

  • 训练规模达到 195 万小时有效监督数据: 团队构建约 30.3 亿组指令—音频样本,覆盖约 195 万小时有效监督数据,并先进行语音生成预训练,再联合训练生成与编辑任务;模型同时使用多模态大模型理解语义指令、VAE 表征声学信息,再由混合整流流 Transformer 生成音频。

  • 同时开放 4 步推理版本 AuK-Flash: 完整版 AuK 之外,团队还蒸馏出 AuK-Flash,固定 4 步即可完成生成,无需分类器自由引导(CFG);论文称在相同条件下,其整体推理速度达到完整版的约 4.5 倍

  • 代码、权重和微调能力一起开放: AuK 与 AuK-Flash 权重均已发布,并提供命令行、Python API、Gradio 和 ComfyUI 等使用方式,仓库同时包含微调支持,而不是只开放在线 Demo。


https://github.com/Tencent-Hunyuan/AuK



2、腾讯混元语音团队等开源全模态交互 Agent Gander:全双工对话不断线,后台 Agent 可持续执行长任务

图片


腾讯混元语音团队联合浙江大学、上海交通大学、香港中文大学、南洋理工大学等推出 Gander(Omni Interaction Agent),尝试把连续音视频感知、实时全双工交互和长程 Agent 执行放进同一套系统。与「语音只是 Agent 输入输出接口」的方案不同,Gander 在后台任务持续运行时,用户仍可以继续说话、打断、追加要求、询问进度或授权操作,任务不必因为对话重新开始而中断。


  • 「聊天」和「干活」拆成前后两层,但共享同一条交互链路: Gander 采用 Cerebellum–Brain(小脑—大脑)协作架构。前端「小脑」基于 MiniCPM-o 4.5,负责实时音视频感知、全双工对话、简单任务和任务路由;后端「大脑」则接管信息检索、代码与文件操作、文档处理等长程工作,两者通过 Tool Call 和 Agent 编排运行时持续交换信息。

  • 长任务运行时仍可用语音持续 Steering: 前端模型可以发出 task_start 创建后台任务,用户之后再通过 task_send 增加条件或修改原任务;也可以开启只读的旁支查询,不改变主任务执行轨迹。遇到敏感操作时,task_resolve 还可以处理单次授权、会话授权、拒绝或取消任务。

  • 全双工交互本身由模型学习,而不是主要依靠外部 VAD 控制轮次: Gander 把连续音频、视频和模型输出按 1 秒因果块展开成统一序列,每个块先预测 listen / speak / interrupt / tool 等控制状态,再决定输出什么内容,因此可以学习用户打断、模型主动开口、重叠语音、多人交互和 backchannel 等行为。

  • 后台「大脑」是可替换的通用 Agent,不需要跟着前端重新训练: 论文将后端设计成 training-free、即插即用模块,可接入 Codex、Claude Code 等通用 Agent;当前开源实现默认使用 Codex app server,每个任务对应持久线程,用户的新要求可继续注入正在执行的任务。

  • 训练数据专门覆盖「边聊边干活」的交互状态: Gander 使用约 270 万条训练样本,其中包括 101 万条语音交互、110 万条音视频交互、35.96 万条 Agent 交互,以及 22.97 万条抗干扰与负样本,专门训练打断、backchannel、任务委派、动态修改要求、进度反馈、权限确认、取消任务和多人干扰等情况。

  • 模型权重、代码与 Demo 已开放,完整数据仍待发布: GitHub 已提供训练、推理和完整浏览器系统代码,Hugging Face 已上线 Gander 权重;当前完整运行配置需要分别为 Thinker、Talker 和 ASR 使用 3 张 GPU。虽然论文称将开放数据,但截至目前 GitHub 首页仍将 Dataset 标记为 Coming Soon


https://omni-interaction-gander.github.io/Omni-Interaction-Agent/



3、Gradium 推出 Voice Design:一句 Prompt 生成全新自定义音色,可直接接入流式 TTS API

实时语音 AI 公司 Gradium 推出 Voice Design,开发者无需先提供真人录音,只需用一两句话描述想要的口音、年龄、性别、音色、情绪和语速,几秒内即可生成多个全新候选声音。选中的声音会获得稳定的 voice_id,可像 Gradium 原有音色一样直接用于其流式 TTS API。


  • 自定义声音从「克隆一个人」变成「描述一个人」: Voice Cloning 需要先找到具体说话人并获得录音,Voice Design 则完全从文字描述采样新的合成声音,更适合需要批量设计客服、游戏角色或品牌音色的场景。

  • 一次可生成最多 5 个候选音色: 开发者可以在 Studio 或 API 中提交声音描述,试听多个候选后保留其中一个;保存后的声音可以继续使用现有 TTS endpoint,无需为自定义音色单独更换合成接口。

  • 当前重点支持区域口音与人物属性控制: 官方支持英语、法语、德语、西班牙语和葡萄牙语,并可进一步指定加拿大魁北克法语、德国巴伐利亚德语、哥伦比亚西班牙语等地区口音,同时控制年龄、性别、音高、节奏、能量和使用场景。

  • 官方盲测重点验证「Prompt 与音色是否匹配」: Gradium 在 5 种语言、7627 次真人盲评中测试区域口音提示词的遵循度,官方称其 Voice Design 对其他公开 API 的平均胜率为 72.6%。该结果来自 Gradium 自建评测,主要衡量生成声音与文字描述的匹配程度。

  • Voice Design 已在 API 和 Studio 开放: 该功能本身不额外收费并包含在所有套餐中;免费档当前每月最多 1000 次请求,并可保存 5 个自定义声音。


https://gradium.ai/blog/launching-voice-design


https://gradium.ai/voice-design



4、印度语音 AI 团队 Rumik 开源 30 亿参数多语言 TTS 模型 Rumik-OSS 1:支持 22 种语言混说,可控制情绪、口音与笑声叹气


印度语音 AI 团队 Rumik 开源 Rumik-OSS 1,一款约 3B 参数的多语言 TTS 模型,支持 22 种语言、原生文字输入及语言混说,并可通过文字描述控制音色的情绪、口音和语速,同时在句子中插入笑声、轻笑和叹气等非语言声音。团队同时开放模型权重和基础版本,供研究者继续训练和后训练。


  • 不只「读文字」,而是把表达方式也写进 Prompt: 开发者可以用类似 happy, Hindi accent, steady pace 的描述控制说话方式,并在文本中加入 <laugh><chuckle><sigh> 等标签,让模型在指定位置生成对应的非语言声音。

  • 22 种语言共享同一组声音,并支持语言混说: 官方开放 Ira、Aisha、Siya、Zoya 四个声音,不再为每种语言分别绑定不同音色;模型可处理原生文字、罗马化文本以及印地语 + 英语、泰卢固语 + 英语等代码切换输入。

  • 从多语言文本模型继续预训练成语音生成模型: Rumik-OSS 1 基于 Tiny Aya Fire 的多语言文本能力,引入 Mimi 音频编解码器,将语音转换成离散 Token,再使用单一自回归 Transformer 按顺序预测文本后的音频 Token。训练先从约 4 万小时英语语音开始,再逐步加入 IndicVoices、RASA 等印度语言数据和高质量专有语音。

  • 团队称总训练数据约 6.6 万小时: 相比许多语音基础模型使用数十万甚至百万小时数据,Rumik 将重点放在多阶段训练与后训练;其后训练还使用 GRPO,根据 WER、CER、时长以及不同音频 Token 的语义/声学职责分配奖励。

  • 情感表现并非「全面超过闭源模型」,但在自建榜单中超过多款商业 TTS: 在 Rumik 自建的 IndicEmo 多语言情绪评测中,Rumik-OSS 1 得分 2.92/5,低于 Gemini 3.1 Flash TTS Preview 的 4.58,但高于 Cartesia Sonic Preview、Sonic 3.5 和 ElevenLabs v3;在笑声/叹气位置控制 NoVA 中得分 0.884,排名第三,仅次于 Grok TTS 和 Inworld TTS-2。


https://rumik.ai/research/rumik-oss


https://huggingface.co/rumik-ai/rumik-oss-1



5、NVIDIA 开源 MiniMax-H3 推理栈 Sol-H3:8× B300 仅 1.65 秒生成 5 秒原生音视频,速度快于播放


NVIDIA Research 开源 Sol-H3,一套面向 MiniMax-H3 的生产级音视频生成推理栈。它将 Sol-Engine、Sol-Attn 动态稀疏注意力、融合算子、多 GPU 通信和并行音视频 VAE 解码整合到同一运行时,并配合四步 FastH3 适配器,把 1344×768、24 FPS、带立体声音频的 5 秒视频生成时间压到 1.653 秒,首次在单台 8× B300 系统上明显快于视频自身播放速度。


  • 5 秒原生音视频 1.65 秒生成,15 秒视频也只需 6.61 秒: 在 8× NVIDIA B300 上,Sol-H3 生成 5 / 10 / 15 秒视频分别耗时 1.653 / 3.732 / 6.612 秒;对应 50 步 Base H3 分别需要 18.25 / 50.66 / 99.51 秒。测试均为 1344×768、24 FPS,并包含同步立体声音频。

  • 不是单点 Kernel 优化,而是把整条生成链路一起加速: Sol-Engine 负责 GPU Kernel、跨 8 卡通信、编译和音视频解码;Sol-Attn 则在运行时动态选择重要注意力块,对其余部分做近似计算,同时加入 Norm / RoPE / MLP 融合、INT8 QKV 与 FP8 输出传输,以及并行 VAE 解码。

  • 同时支持文生视频、首帧图生视频和参考音视频生成: 同一运行时覆盖 T2V、I2V 和 Ref2VA,后者可同时输入图像、视频与音频参考,并输出 MiniMax-H3 原生同步音视频,不需要再外挂单独的 TTS 或配音链路。

  • 加速结果包含四步蒸馏,不能视为纯运行时 15×: Base H3 使用 49 次 DiT 前向,而 Sol-H3 使用 FastH3 的四步适配器,只需 4 次 DiT 前向;4 / 8 GPU 配置还使用近似稀疏注意力。因此官方也明确指出,这组速度差异并非单纯来自推理框架优化。

  • 代码已开放,下一步瞄准真正连续的 24 FPS 生成: NVIDIA 已公开 Sol-H3 推理代码和部署配置;当前仍是一次生成 5–15 秒完整片段,后续计划进一步做成按片段连续生成、边解码边推流,并支持用户中途修改 Prompt 或参考输入后让下一段视频立即响应。


https://nvlabs.github.io/Sana/Sol-Engine/Sol-H3/


02 有亮点的产品


1、Ato 推出老年人无屏 AI 语音终端:2500+ 家庭测试后正式预售,可主动问候、提醒并连接家庭照护


面向老年人的 AI 公司 Ato 正式推出新一代同名家庭语音终端。产品经过 2500+ 名早期用户、24 个国家的封闭测试后进入预售,主打无需屏幕的实时语音交互,让老年人通过说话完成聊天、提醒、搜索、收听内容和联系家人;家庭成员则通过 Ato Family App 查看设备活动、设置提醒并发送消息。


  • 把「语音助手」做成常驻家中的老年人电脑: Ato 没有屏幕,主要通过持续语音交互使用,支持自然对话、网页搜索、新闻天气、脑力游戏、广播等功能;设备需要长期接电,语音拾音范围约 3 米,支持 50+ 种语言。

  • 从被动问答进一步加入主动照护: 家庭可以设置服药、预约和日常活动提醒,Ato 还会按照设定时间主动发起日常问候,而不是只等待老年人先开口;提醒首次未成功传达时还会再次尝试。

  • 家庭端能了解状态,但看不到老人具体聊天内容: Family App 可以查看设备是否在线、日常活动状态,远程管理提醒、联系人和设备设置,同时收发消息;Ato 明确不向家庭成员开放老人对话转录,也不保存原始语音录音。

  • 产品开始从「陪伴设备」向家庭照护协同入口扩展: Ato 当前已经把老人端语音交互和家庭端的消息、提醒、设备状态、日常活动报告放到同一体系中,并进一步规划 Wellness Reports 等能力,希望让亲属和照护者围绕同一套信息协作,而不是依靠多个电话、App 和提醒工具分别协调。

  • 新版本预计 2026 年 12 月发货: Ato 常规定价为 179 美元,同时提供免费基础功能和付费会员;会员主要增加无限对话、更高频主动问候和新功能优先体验。


https://heyato.ai/launch



2、Pamir 推出 AI Agent 专用 Linux 迷你电脑 Lapis One:可 24 小时跑任务,还能通过 USB-C KVM 直接操作其他电脑


AI 硬件公司 Pamir 推出 Lapis One,一台专门为 AI Agent 长时间运行设计的 Linux 迷你电脑。它搭载 Debian 系统、8 核处理器、8GB LPDDR5 内存和 6 TOPS NPU,Agent 可以在设备上持续执行代码、文件处理和自动化任务,并通过手机、桌面端或 SSH 远程访问。


  • 不再让 Agent 和用户「共用一台电脑」: Pamir 将 Lapis One 定位为 Agent 的独立运行环境,可以保持任务、文件和终端会话持续在线,即使用户自己的主力电脑关闭或被带走,后台工作仍可继续运行。设备还内置 3300mAh 电池,主要用于断电或移动过程中的任务连续性,而不是作为传统笔记本续航。

  • 通过 Agent KVM 直接控制另一台电脑: Lapis One 的专用 USB-C KVM 接口可以捕获另一台电脑最高 2K@30FPS 的屏幕,并模拟完整键盘和鼠标输入。Agent 因此可以「看到」另一台电脑的界面并执行操作,而无需在被控设备中安装 Agent 客户端。

  • 硬件接口更接近一块可扩展的 Linux 开发板: 设备提供 4 个 USB-C 接口、M.2 2230 SSD、最高 2TB microSD 和 GPIO,可连接硬盘、打印机、ESP32 等外设;其中一个 USB-C 还支持 4K@30Hz DisplayPort 输出。

  • 自带面向 Agent 长期运行设计的 Lapis OS: 系统基于 Debian 13,采用只读系统核心、A/B 签名更新、LUKS2 全盘加密和 TPM 2.0,并预装 Tailscale,同时向开发者开放 Root、Nix 包管理器和硬件 Python SDK。

  • Agent 主要依赖联网运行: Lapis One 的 6 TOPS NPU 并非用于本地跑大型 LLM,设备更像一个可持续联网、调用系统与硬件能力的 Agent 执行端。

Lapis One 目前早鸟价 359 美元,首批设备计划于 2026 年 10 月发货。


https://www.pamir.ai/



3、Tavus 为实时视频 Agent 构建器 PAL Maker 加入完整版本历史:每次修改自动保存,可一键回滚


Tavus 为无代码实时视频 Agent 构建器 PAL Maker 上线完整版本历史与一键回滚能力,每次调整 Agent 的 Prompt、行为或配置都会自动保留历史版本,新一轮实验效果不理想时可直接恢复此前状态,不必手动重建配置,让实时对话 Agent 的调试和持续迭代更接近代码与文档工具中的版本管理流程。


https://x.com/tavus/status/2097467067234680979



4、Deepgram 任命前 DataStax、IBM 产品负责人 Ed Anuff 为 CPO:将重点推进 TTS、Voice Agent 与开源策略

图片


语音 AI 公司 Deepgram 任命 Ed Anuff 为首席产品官(CPO),负责公司产品战略。Anuff 自 2021 年起担任 Deepgram 顾问,此前曾任 DataStax CPO,并在 DataStax 被 IBM 收购后负责 IBM watsonx.data 产品战略,更早还曾参与 Apigee 产品战略并经历其上市及被 Google 收购。上任 Deepgram 后,他将重点推进三条产品线:继续增强 TTS 的自然表达能力,把语音更紧密地连接到能够执行真实任务和交易的 AI Agent,以及进一步明确 Deepgram 的开源策略。Deepgram 也表示,产品方向正从早期的 STT 基础设施继续扩展到覆盖 TTS、对话语音模型和实时 Voice Agent 的完整生命周期。


https://deepgram.com/learn/deepgram-chief-product-officer-ed-anuff



03 有态度的观点




1、字节跳动前 AI 产品团队 Flow 负责人梁琛奇:AI 娱乐产品要让消费过程实时使用算力

图片


字节跳动前 AI 产品团队 Flow 负责人梁琛奇接受《晚点》采访时表示,AI 娱乐产品若只降低内容生产成本,产出的短剧、漫画或视频仍会回到既有平台;新的独立平台需要让用户在消费过程中实时与模型互动,并获得过去不存在的长尾反馈。


他把 AI 娱乐的成立条件归纳为成本、模态和用户习惯。


DeepSeek-R1 之后,推理成本继续下降;图片和视频模型跨过可用门槛;用户也已经通过 ChatGPT、豆包等产品学会与 AI 交互。


基于这些变化,他判断娱乐产品可以从静态生成转向一边消费、一边生成图片、视频或玩法。梁琛奇创办的「动念引线」正在同时开发和测试七八个产品,由一两人的小组在两周至一个月内做出 Demo,再按真实用户信号决定关停或追加资源。其首款产品「松果时刻」可把照片和文字扩展为带配音、配乐和简单动画的多图故事;团队下一步会把内容收向特定人群,并尝试让消费端也实时调用模型。


他认为,AI 娱乐仍离不开人的主观表达:模型擅长根据用户偏好生成「熟悉感」,真正的惊喜和内容多样性则来自创作者。产品成立需要同时满足新颖、长期、高频和不易厌倦,并在留存与使用频次上形成可持续信号。


( @APPSO)



04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)



1、 iRTE2026 定档啦!Voice Agent Builder 们,10 月北京集合~

今年从对话式 AI 一路聊到实时智能,现场有 15+ 论坛、100+ 场深度演讲,汇聚 150+ 全球技术领袖和行业专家,全双工+交互式模型、实时互动世界模型、AI 硬件、AI Coding 工具等方向都会集中开聊。


贾扬清也将返场 iRTE 大会,带来对 AI 行业前沿趋势和技术演进的最新观察~


目前大会门票限时免费开放!


想来现场听技术、认识同行的开发者,可以先把票薅上


时间:10 月 23–24 日


地点:北京悠唐皇冠假日酒店


限免结束后将恢复收费,建议先报名占位


定档!从对话式 AI 到实时智能,Voice Agent Builder 的年度春晚 iRTE2026 来了丨 10 月 23-24 日,北京见!

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

图片

作者提示: 个人观点,仅供参考

注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    关键词
    // 相关帖子
    Coming soon...
    • 0
    混元开源语音编辑模型 AuK:一句自然语言生成、修改和清理语音丨日报RTRTE_Dev_Comm