Noiz AI 发布实时可交互音视频世界模型 HelixWorld,支持 48kHz 立体声丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、开源 C++ 本地音频推理框架 audio.cpp :覆盖 49 个模型家族,部分 TTS 路径较 Python 实现最高加速 8×
audio.cpp 是一个基于 ggml 的本地音频推理框架,用统一 C++ Runtime 运行 TTS、ASR、Voice Cloning、Voice Conversion、VAD、Diarization、Source Separation 和音乐生成等模型。目前 0.6 版本已覆盖 49 个模型家族、70+ 模型变体,并支持 Windows、Linux 和 macOS。
统一支持多类语音与音频任务: 已接入 TTS、Voice Cloning、Voice Conversion、ASR、Forced Alignment、VAD、Speaker Diarization、Audio Codec、Source Separation、Music/SFX Generation 等任务。
49 个模型家族、70+ 模型变体: 当前支持 Qwen3-TTS、Qwen3-ASR、IndexTTS-2.5、Fish Audio S2 Pro、VoxCPM2、Nemotron 3.5 ASR、Voxtral Realtime、dots.tts、VibeVoice 等模型。
部分 TTS 路径较 Python Reference 加速 1.8×–8×: 项目称,在 CUDA 下多条 TTS 推理路径速度达到 Python 参考实现的 1.8× 至最高 8×,端到端延迟降低 45%–85%。
全面支持 GGUF 加载与量化: 已发布模型家族均支持 GGUF,部分 Q8 测试相比 16-bit 版本最高加速 1.53×,峰值 VRAM 最多降低约 37%。
覆盖 CUDA、ROCm、Vulkan、Metal 与纯 CPU: 框架面向 NVIDIA、AMD、Apple Silicon 及 CPU-only 设备,并提供统一 CLI、Server、WebUI 与实验性的 JSON Pipeline。
项目还提供流式推理能力,部分模型可直接用于实时 ASR 或 TTS Server,并内置降噪、音频增强、重采样和 STFT/ISTFT 等音频处理工具。
https://github.com/0xShug0/audio.cpp
( @0xShug0)
2、FireRedTeam 开源 FireRedTTS3:支持 24 种语言、21 种中文方言,统一 Voice Design 与语音编辑
FireRedTeam 开源多语言 TTS 模型 FireRedTTS3,基于语义增强的连续语音表示进行语音生成。模型包含 Base 和 Instruct 两个版本:Base 支持 24 种语言、21 种中文方言的 Zero-shot Voice Cloning;Instruct 则进一步加入自然语言 Voice Design,以及语音内容、语速、音高和音量编辑能力。
覆盖 24 种语言和 21 种中文方言: FireRedTTS3-Base 支持英语、中文、日语、韩语、法语、西班牙语等 24 种语言,并覆盖四川、上海、闽南、温州、吴语等 21 种中文方言的 Zero-shot Voice Cloning。
自然语言直接设计新声音: FireRedTTS3-Instruct 无需参考音频,可根据性别、年龄、音色、情绪、语速和口音等自然语言描述生成新声音;模型会先生成 Voice Attribute Plan,再合成对应语音。
统一支持语义与声学编辑: Semantic Edit 可执行语音内容的插入、删除和替换;Acoustic Edit 支持调整语速、音高与音量,其中语速范围为 0.5×–2.0×,音高支持 ±6 Steps。
Seed-TTS-Eval 平均 WER/CER 为 3.04%: FireRedTTS3-Base 在该评测三个子集上的平均 Speaker Similarity 为 78.8;其中英文 WER 为 1.64%,中文 CER 为 1.01%,中文困难集 CER 为 6.50%。
24 语种评测平均 Speaker Similarity 为 84.8: 官方公布的 MiniMax-MLS-Test 结果中,FireRedTTS3 平均 WER/CER 为 3.754%,平均说话人相似度为 84.8。
FireRedTTS3-Base 与 FireRedTTS3-Instruct 权重和 PyTorch 推理代码已开放,项目采用 Apache-2.0 License;技术报告目前尚未发布。
https://github.com/FireRedTeam/FireRedTTS3
(@FireRedTeam)
3、Noiz AI 发布实时可交互音视频世界模型 HelixWorld 1.0:24 FPS 实时生成画面,48kHz 立体声音画联合生成
Noiz AI 联合香港科技大学、清华大学、CMU、Google DeepMind 等机构研究人员发布 HelixWorld 1.0,一款实时可交互音视频世界模型。模型以 LTX2.3 为生成基座,在统一 Transformer 中联合生成视频与音频,并根据用户动作持续更新画面和声场。
24 FPS 画面 + 48kHz 双声道音频实时生成: 模型边生成边输出音视频,用户前进、转向等操作会同时作用于视觉场景与声音空间,而非在视频生成完成后再单独添加音轨。
音频与视频在统一 Transformer 中联合建模: 两种模态保留各自的 Latent 表征,但进入同一模型持续交换信息,共同预测用户动作之后的下一段画面和声音,包括声源距离、方向和场景声学变化。
通过因果化 + KV Cache 支持持续交互: 团队将原本依赖未来信息的双向模型改造成只读取历史的因果模型,并利用 KV Cache 复用历史计算,通过逐块自回归持续生成音视频。
训练阶段加入自生成历史降低长程误差累积: 模型不仅使用真实历史数据训练,也会读取自己此前生成的结果继续预测,使其适应实际运行中逐步积累的生成误差。
结合轨迹蒸馏与 DMD 压缩生成步数: 通过轨迹蒸馏约束少步生成路径,并利用 DMD 保持最终生成分布,再与 KV Cache 和逐块生成结合,将动作输入、音视频生成和输出组织成连续流水线。
HelixWorld 当前 API 已进入内测阶段;团队表示模型权重和代码将在接下来几周开放,目前尚未正式开源。
https://github.com/NoizAI/HelixWorld
(@NoizAI)
4、阿里巴巴发布端到端 AI 音乐模型 HappyShrimp 1.0:自然语言生成整曲,词曲编唱一体成型
创作者推荐:提示词仅要求生成一首女团风 Kpop,HappyShrimp 精准理解了提示词,自主设计了韩国女团顶流的旋律/编曲/人声/flow。这首 kpop 旋律流畅,rap 的 flow 设计多样,桥段处的节奏转换堪称巧妙,搭配编曲爆发式的 drop,瞬间建立起强劲的律动骨架,整首歌曲展现了极高的工业完成度。
阿里巴巴发布 AI 音乐模型 HappyShrimp 1.0(快乐虾米),用户可通过自然语言描述情绪、故事、场景或音乐需求,直接生成完整歌曲。模型采用端到端整曲生成路线,将歌词、旋律、编曲和人声放在统一生成过程中处理,并支持对曲风、情绪、年代、人声等条件进行控制。
端到端完成词曲编唱: HappyShrimp 将歌词、旋律、编曲与演唱统一建模,不采用分别生成再拼接的方式,并在生成过程中同时处理歌曲结构和上下文。
支持生活化自然语言 Prompt: 除 Lo-fi R&B 等专业音乐描述外,模型也可理解「适合咖啡馆播放」「写给刚毕业的自己」等场景、情绪和叙事要求,并将其转换为音乐创作条件。
支持多维复杂指令组合: Prompt 可同时指定人声性别、唱法、调性、BPM、配器和情绪变化等条件,模型会结合整体创作意图进行生成。
国内外同步上线: HappyShrimp 已分别通过
happyshrimp.cn和happyshrimp.ai面向国内及海外用户开放。与太合音乐集团达成战略合作: 双方计划围绕 AI 音乐平台、音乐人共创和音乐产业生态等方向展开合作。
https://www.happyshrimp.cn/
(@阿里巴巴)
02 有亮点的产品
1、Google 为 Gboard 与 Live Transcribe 推出手语转文字功能:支持 ASL 实时识别
2、韶音发布搭载千问大模型的开放式耳机 OpenFit 2 AI:支持长时录音、AI 会议总结与四种翻译模式
韶音推出开放式耳机 OpenFit 2 AI,将千问大模型接入录音、转写、会议总结和翻译场景。用户可通过单只耳机、充电盒或 Shokz App 发起录音,并对录音内容进行转写、重点标记和 AI 总结。
支持最长 8 小时双耳录音: 可用于现场交流、商务通话、线上会议和论坛讲座,并支持最远 5 米录音;用户还可以通过双击耳机标记录音中的重点内容。
覆盖 30 类语种与 19 种方言转写: 包括中文、英语、日语、韩语等语种,以及粤语、闽南话、四川话、上海话等方言,同时支持自动识别不同发言人。
内置 12 类行业热词词库: 覆盖金融、法律、科技/IT、医疗、教育培训等领域,并提供 19 种会议总结模板,可生成议题摘要、待办事项和思维导图。
提供四种翻译模式: 支持通话翻译、同声传译、面对面翻译和音视频字幕,其中语音互译覆盖 11 类语种,实时翻译需要联网使用。
录音可同步至云端并在 App/Web 编辑: 用户可在 Shokz App 和网页端管理、编辑录音及相关文件,形成从耳机采集到转写、总结和归档的工作流。
https://www.shokz.com.cn/OpenFit2AI
(@韶音)
03 有态度的观点
1、Claude Code 创始人 Boris Cherny:我们现在仍然太沉浸在「记录文本」这套思路里,他突破这种范式感兴趣

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
作者提示: 个人观点,仅供参考