小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座丨日报

本期编辑:@三水、@鲍勃



01 有话题的技术


1、ElevenLabs 上线 Sounds on ElevenMusic:免费提供 AI 音效与 Loop,支持文本生成新声音


ElevenLabs 在 ElevenMusic 上线 Sounds 免费音效库,用户可以直接浏览、试听和下载 AI 生成的声音素材,并用于音乐创作。当前素材覆盖 Vocal Chops、Drum Loops、Bass Loops 等类型,Free 和 Pro 账户均可使用。


  • AI 音效与 Loop 可免费浏览、试听和下载: 用户登录 ElevenMusic 后即可下载所需素材,无需单独购买 Sample Pack。

  • 支持通过文字描述生成新声音: 如果现有素材库中没有需要的声音,用户可以描述目标声音,生成独立 Stem 或包含多层声音的 Loop,并提供每日免费生成额度。

  • 用户生成内容会自动扩充公共音效库: ElevenLabs 表示,新生成的 Sounds 会加入 Public Library,其他创作者可以继续发现和使用这些素材。

  • 当前覆盖多类音乐制作素材: 包括 Vocal Chops、Drum Loops、Bass Loops 等,可直接作为歌曲制作中的节奏、低音或人声素材使用。


https://elevenlabs.io/blog/sounds-on-elevenmusic-a-free-library-of-ai-sounds-and-loops


( @Elevenlabs)



2、Soniox 发布 Soniox TTS v2:支持 60+ 语言、音频标签表情控制与低延迟流式生成

欢迎使用 Soniox TTS v2,这是我们目前最强大的文本转语音模型。 Soniox TTS v2 带来了卓越的语音质量、通过音频标签实现的丰富表情控制、极高的精准度、高保真度的语音克隆功能、超过 60 种语言支持、自然语言混音功能,以及低延迟的流媒体播放能力。所有这些功能都在同一个模型中得到了整合。 Soniox TTS v2 从零开始构建,采用全新的模型架构、音频编解码器以及高度优化的推理引擎。其生成的文本合成语音每小时仅需 0.70 美元,堪称超值的文本合成解决方案。 该软件今日在全球范围内可用,版本为 ts-rt-v2。 试试看: https://soniox.com/text-to-speech 打开声音功能,看看能实现什么。


( @Soniox)


3、Sekai2 公布大规模真实世界视频数据集:2826 小时视频配套 3D 相机轨迹与时间定位描述

图片


图片


Alaya Lab、上海创智学院、武汉大学和清华大学团队公布 Sekai2,一套面向 Interactive World Modeling 的长时真实世界视频数据集。数据集包含 128,892 段视频、总计 2,826 小时,覆盖 113 个国家和地区,每段视频同时提供相机运动轨迹和分层语言标注。


  • 包含 128,892 段、2826 小时真实世界视频: 平均单段长度为 78.9 秒,场景覆盖步行、驾驶、骑行、铁路、船只、缆车、扶梯和无人机飞行等不同运动方式。

  • 每段视频都配套 3D Camera Trajectory: 数据使用 ViPE 等几何流程生成逐帧相机轨迹,使视频中的视觉变化能够与相机在三维空间中的移动和旋转对应起来。

  • 提供 649,597 个时间定位 Segment: 平均每段视频包含 5.04 个 Grounded Segment,中位长度为 15 秒;除 Clip-level 描述外,每个 Segment 还提供独立时间范围、文本描述和相机运动标签。

  • 包含 982 段自采集 360° 长视频: 该部分共约 119 小时,平均单段 436 秒,并通过闭环路线与几何验证优化长轨迹,用于保留重复访问同一区域时的连续空间结构。

  • 数据和代码尚未正式开放下载: 当前项目页和 GitHub 已公布数据规模、标注结构和验证结果,但 Dataset、数据处理 Pipeline、Annotation Tooling 和分析代码仍标记为 coming soon。


( @Sekai)



4、Qwen-Audio-Agent 现已接入 DeepSeek Harness, 任一 Harness 皆可以是后台

图片


(@阿里语音 AI)



5、小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座

小红书 dots 团队开源 dots.tts,一款 20 亿参数、全连续、端到端的自回归 TTS 模型。模型跳过离散声学 Token,直接在 48kHz AudioVAE 连续隐空间中逐块生成语音,并开放从基础训练、低步数蒸馏到 1T1A 双流推理的完整链路。


图片


图片


seed-tts-eval 困难文本


参考音频:「由于对球没有很好的控制力,我通常打直球。」


生成音频:「喇嘛与哑巴 打南边来了个哑巴,腰里别了个喇叭;打北边来了个喇嘛,手里提了个獭犸。提着獭犸的喇嘛要拿獭犸换别着喇叭的哑巴的喇叭;别着喇叭的哑巴不愿拿喇叭换提着獭犸的喇嘛的獭犸。不知是别着喇叭的哑巴打了提着獭犸的喇嘛一喇叭;还是提着獭犸的喇嘛打了别着喇叭的哑巴一獭犸。喇嘛回家炖獭犸;哑巴嘀嘀哒哒吹喇叭」

  • 采用全连续自回归架构: 文本经 BPE 输入 LLM,因果 Semantic Encoder 持续提取已生成语音的语义历史,AR Flow-Matching Head 在 AudioVAE 连续隐空间中生成后续音频,全链路不使用离散声学 Token。

  • 1T1A 双流模式首包延迟 54.4ms: 上游 LLM 从输出第一个文本 Token 开始,TTS 即可同步消费文本并生成音频,使文本流与语音流交错推进;论文条件下普通流式模式首包延迟为 85.4ms。

  • 开放四步、两步和单步低步数生成: 团队先通过 SOAR 缓解连续自回归中的误差累积,再使用 MeanFlow、sCM 与 Reward-Aware DMD 将生成过程压缩至四步、两步和单步,以适配不同质量、延迟与吞吐需求。

  • Zero-shot Voice Cloning 平均 SIM 达到 79.2: dots.tts SOAR 在 Seed-TTS-Eval 中文、英文和中文困难集上的 WER/CER 分别为 0.94%、1.30% 和 6.60%,SIM 分别为 81.0、77.1 和 79.5;在 MiniMax-Speech 24 语种评测中平均 SIM 为 83.9。

  • 同一基座扩展至可控语音编辑: dots.tts.edit 支持文字替换、插入与删除,以及情绪、音高、语速和停顿编辑,多种操作可以组合后通过一次生成完成。


本次开源覆盖六个 checkpoint,并提供训练、推理、微调、蒸馏和 1T1A 双流推理代码,采用 Apache 2.0 License。


https://github.com/studio-dots-ai/dots.tts


小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座


(@dots.tts)



02 有亮点的产品


1、Matic 推出 Cues:机器人支持语音与手势联合控制,可通过指向位置直接下达清洁指令


家用机器人公司 Matic 推出 Cues 交互功能,让用户通过语音、身体动作和空间指向直接控制机器人。机器人可以结合听到的指令与看到的手势定位目标,例如用户指向地面污渍并说「清理这里」,Matic 会识别位置并执行清洁任务。


  • 支持 70+ 种语言的语音控制: 用户说出 「Hey Matic」 后,机器人可以定位声音方向并转向用户,再继续接收后续指令;官方帖中另一个示例称当前可理解 75 种语言。

  • 将语音和 Pointing 手势结合: 用户可以直接指向地面的具体位置并下达「clean this」等指令,Matic 会结合视觉、语音和已有的 3D 空间信息定位清洁目标。

  • 支持 Follow Me: 用户说「Hey Matic, follow me」后开始移动,机器人可以跟随用户行走。

  • 可通过自然语言调用已有家庭地图: 用户可以直接要求机器人「去清理客厅」,Matic 会根据已经建立的房屋地图导航到指定区域并执行任务。

  • 现有用户可直接开启 Cues: Matic 用户可在 App 的 Settings → Matic Cues → Discover Commands 中查看和使用相关指令。


https://www.reddit.com/r/MaticRobots/comments/1vnj5n9/introducing_cues_voice_gesture_control_for_matic/


( @Matic)



2、Sarvam 开放 Voice Agent 平台:企业环境已处理超 3.5 亿次对话,支持个性化与规模化部署


Sarvam 宣布将其 Voice Agent 服务向所有用户开放,开发者可基于平台构建能够理解上下文、记忆历史对话并持续完成业务目标的语音智能体。Sarvam 表示,其语音助手目前已在企业环境中累计处理超过 3.5 亿次对话。


  • 企业环境已处理超 3.5 亿次对话: Sarvam 表示,大规模实际运行经验被用于持续优化 Voice Agent 平台及其语音交互能力。

  • 支持上下文理解与对话记忆: Voice Agent 可以利用此前的对话内容保持连续交互,并结合当前上下文执行后续任务。

  • 提供 Voice Agent 个性化能力: 平台整合相关工具和系统,用于配置不同智能体的行为与交互方式。

  • 支持统一编排与规模化部署: Sarvam 将 Voice Agent 的定制、协调管理和部署能力整合在同一平台,以适配不同规模的语音交互需求。


https://x.com/SarvamAI/status/2087864104799314216


(@SarvamAI)



3、Stream Vision Agents 接入 Telnyx:单插件覆盖 PSTN、LLM、STT 与 TTS,支持呼入/呼出电话

图片


Stream 的 @visionagents_ai 现已在整个 Voice AI 技术栈中支持 Telnyx。


这意味着,你可以把原本停留在浏览器里的 Demo,真正接入到一通电话里。

Telnyx 负责处理整个链路:


电话呼叫、语音转录、模型推理、语音合成,以及将音频实时回传给来电者。

来电者可以在 Agent 说话过程中直接打断。


双方的音频仍然可以持续双向传输。


运行「呼入电话」示例,


拨打对应的 Telnyx 号码,


Agent 就会接听电话。


完整的技术拆解可以看这里:

https://telnyx.com/resources/vision-agents-telnyx-integration


( @telnyx)



03 有态度的观点


1、YC CEO 鼓励创始人重金投入 AI Token:这能让你提前生活在 2028 年

图片


据《商业内幕》报道,加拿大裔美国创投家、Y Combinator CEO Garry Tan 在昨日发布的一档播客节目中建议,初创公司创始人不应过度担心 AI Token 的消耗成本,而应采取「Tokenmaxxing」策略,通过重金投入 AI 智能体来获取竞争优势。


Garry Tan 表示,创始人应当允许自己大量使用 AI Token,即使这会带来高昂的支出。他认为,通过加载 80 万甚至 100 万个 Token 来运行 AI 智能体,创始人可以提前体验到 2028 年才可能普及的 AI 能力。


尽管这种「全功率」运行 AI 智能体的费用可能高达每年 5 万至 10 万美元(约 36.3 万至 72.5 万人民币),但对于 CEO 或创始人而言,这种实验性投入是值得的。


针对高昂的成本,Garry Tan 提出了一套转化逻辑:一旦 AI 智能体成功完成某项任务,创始人应将其「技能化」(skillify),即将操作过程转化为可重复使用的指令。他将这类 Markdown 指令文件形容为「能够完美执行工作的员工」,可以无限次重复调用。


目前,硅谷对于「Tokenmaxxing」存在明显分歧。与 Garry Tan 的支持态度不同,Uber 首席技术官 Praveen Neppalli Naga 上周在 X 平台表示,随着公司开始关注 AI 成本数据,一味追求 Token 消耗量的时代正在结束,下一阶段将转向高效利用。


AI 编程工具 Cognition 的 CEO Scott Wu 也在 6 月提到,以 Token 消耗量来衡量工程师表现是误导性的,行业应回归到实际产出的评估上。


( @APPSO)



04 社区黑板报


招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)



1、 社区活动推荐|EonveraX Builders’ Day


如果你已经不满足于做一个「能跑的 Demo」,想真正试一次从需求、产品到交付的完整 AI 创业过程,可以关注下 EonveraX Builders’ Day


活动设置「AI 原生服务公司」和「SaaS 挑战者」两条赛道,参赛者将围绕真实需求组队,在有限时间内完成产品设计、开发与 AI 能力整合,并进一步思考用户、应用场景与商业模式。比较特别的是,这里 Coding 只是起点,最终希望做出的不是一段代码,而是一个有人愿意使用、甚至愿意付费的完整产品。


不管你是开发者、产品经理、设计师、运营还是行业从业者,都可以带着自己的能力加入。


 报名:8 月 8 日—8 月 31 日 团队动态匹配:9 月 6 日前 线下 Vibe Coding:9 月中下旬周末 · 深圳


想用 AI 真刀真枪做一次产品的朋友,可以关注一下。


图片


AI Hackthon:EonveraX Builder's Day

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

图片

作者提示: 个人观点,仅供参考

注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    // 相关帖子
    Coming soon...
    • 0
    小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座丨日报RTRTE_Dev_Comm