Artificial Analysis 更新语音智能体评测竞技场,区分「更喜欢聊」和「真的把事办成」丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、字节跳动、港理工与 AMD 提出实时数字人框架 Avatar-Forever:单张 H100 实现 27.2 FPS,支持无限时长音频驱动生成
字节跳动、香港理工大学与 AMD 等团队提出 Avatar-Forever,面向实时、长时间运行的音频驱动数字人生成。其核心变化是把「生成得快」和「长时间不崩」拆成两条独立训练路线,再在推理时组合,使基于 22B 视频基础模型的系统能在单张 H100 上以 768×512 分辨率达到 27.2 FPS。
将实时生成与长时间稳定性分开训练: 一条路线负责把大模型压缩成少步、高质量的实时生成器,另一条路线专门训练模型在连续生成出现误差后如何恢复,避免错误随着视频变长不断累积。
专门针对长时间连续生成中的画面漂移: Avatar-Forever 会让模型在已经产生一定误差的历史画面基础上继续训练,使其学习在身份、动作和画面质量开始偏离时重新稳定下来。
ForeverCache 减少流式生成中的重复计算: 系统按视频片段缓存此前已经计算过的特征,生成新片段时直接复用,降低长时间连续生成的计算开销。
单张 H100 达到 27.2 FPS: 在 768×512 分辨率下,Avatar-Forever 实现端到端 27.2 FPS,并展示了超过 11 分钟的连续音频驱动生成效果。
https://leeruibin.github.io/avatarforever-project-page/
(@Avatar-Forever)
2、伦敦帝国理工等提出音频自监督学习方法 NAPE:只预测下一个音频片段,也能随模型规模持续提升
伦敦帝国理工学院与萨里大学研究者提出 NAPE,将语言模型「预测下一个 token」的思路用于音频自监督学习:模型把频谱切成连续片段,只根据前面的音频内容预测下一个片段的嵌入表示。相比现有不少音频自监督方法,NAPE 不需要重建解码器、音频分词器、教师模型或额外正则损失,用更简单的训练目标获得可扩展的音频表征能力。
把「预测下一个 token」改成「预测下一个音频片段」: NAPE 将 log-Mel 频谱切分为多个片段并按顺序输入模型,每一步只根据已经出现的音频信息预测下一个片段的嵌入表示,让模型从连续音频本身学习声音结构。
训练方法刻意保持简单: 整套方法主要依靠因果遮罩、向后错一位预测和停止梯度三个机制,不需要额外的重建任务或复杂蒸馏流程。
模型变大后性能持续提升: NAPE 从约 1900 万、8500 万扩展到 3.03 亿参数时,六项音频和语音任务上的表现整体持续提高,说明这一训练目标可以随模型规模扩展。
多项下游任务达到同规模方法领先水平: 3.03 亿参数的 NAPE-L 在 AudioSet-2M 达到 50.2 mAP,在 IEMOCAP 情绪识别达到 68.0%,并在多项语音和音频任务上取得当前自监督方法中的领先或接近领先结果。
https://umbertocappellazzo.github.io/nape/
(@Umberto_Senpai)
3、Murf AI 全面开放实时 TTS 模型 Falcon 2:首音频低于 100ms,价格 0.01 美元/分钟
Murf AI 正式发布实时 TTS 模型 Falcon 2:TTFA 低于 100ms,价格降至每分钟 0.01 美元
印度 Voice AI 公司 Murf AI 正式公开 Falcon 2,面向 Voice Agent 等实时语音场景,在降低首音频延迟和推理成本的同时提升语音自然度。官方数据显示,Falcon 2 当前生产环境 30 天中位 TTFA 为 95ms,价格为每生成 1 分钟语音 0.01 美元;在独立评测平台 Artificial Analysis 的语音自然度榜单中,其得分超过部分 OpenAI、ElevenLabs 和 xAI 的实时语音模型。
实时响应进入 100ms 以内: Falcon 2 针对流式 TTS 优化,官方生产数据中位 TTFA 为 95ms,并通过边缘部署降低不同地区网络带来的延迟波动。
自然度与低延迟同时提升: Artificial Analysis 的独立语音评测中,Falcon 2 自然度排名高于部分 OpenAI、ElevenLabs 和 xAI 实时模型,不再只以低延迟作为主要优势。
支持 10 秒音频即时声音复刻: 企业用户只需提供约 10 秒语音,即可创建定制品牌声音;Murf 表示所有复刻声音均要求说话人明确授权,可直接用于生产环境中的 Voice Agent。
价格降至每分钟 0.01 美元: Falcon 2 采用更轻量的推理架构,支持 150+ 种声音和 35+ 种语言,同时提供多语言混说与企业级声音复刻能力。
https://murf.ai/falcon
(@Murf AI)
4、IMPA 提出双耳声学数据生成平台 AudioWorldSim:模拟移动中的空间声音变化,为音频世界模型生成训练数据
巴西国家纯数学与应用数学研究所(IMPA)研究者发布 AudioWorldSim 技术报告,面向音频世界模型缺少「动作—空间—声音变化」训练数据的问题,在 Meta SoundSpaces 2.0 基础上构建自动化声学模拟平台。系统可让虚拟智能体在 3D 场景中持续移动,并同步生成左右耳听到的双耳音频及动作轨迹,使模型能够学习「移动、转向后,周围声音会如何变化」。
未加混响、音效的原始音频素材
空间化声音
把智能体移动过程转成双耳声学训练数据: 智能体与声源被放入 Matterport 或 Replica 3D 场景,系统自动生成导航路线,并随着位置和朝向变化持续模拟左右耳接收到的空间声音,而不是只计算某个固定位置的声学结果。
声音与动作逐步对齐: 每次模拟都会保存智能体前进、左转、右转等动作序列,以及对应的双耳音频、Mel 频谱和 STFT;音频还可按每一步动作切分,用于训练模型预测采取某个动作后声音会发生什么变化。
修复连续声学模拟中的音频断裂问题: AudioWorldSim 修改了 SoundSpaces 连续模拟中的声音拼接方式,减少不同模拟步骤之间的点击杂音,避免模型把这类人工噪声误当成环境规律。
开源的是生成器,而不是现成数据集: 由于 Matterport 和 Replica 的数据授权限制,团队无法直接公开生成的数据集,因此开放了完整模拟器,开发者获得相应 3D 场景授权后可自行生成训练数据。
https://arxiv.org/abs/2608.21075
https://github.com/Luizerko/AudioWorldSim
(@Luizerko)
02 有亮点的产品
1、Artificial Analysis 更新语音智能体评测竞技场:用真人真实任务评测语音 Agent,区分「更喜欢聊」和「真的把事办成」
Artificial Analysis 更新 Speech Agent Arena,将语音模型评测从推理、打断处理等单项能力,进一步扩展到真人参与的真实任务。参与者会分别与两个匿名语音系统完成同一场景,再评价更喜欢哪一个;对于需要工具调用的任务,平台还会单独统计任务成功率,用来判断 Agent 是否真的完成了最终操作。
真人双盲对话决定偏好排名: 当前覆盖 15 个需要工具调用的任务,以及 20 个无需工具调用的日常场景;参与者分别与两个隐藏模型实时对话,再通过两两选择计算 Preference Elo。
任务成功率单独检查「有没有真正办成」: 对订餐、预约等 Agent 场景,只有模型完成正确的最终工具调用才算成功,而不是仅根据对话内容判断。
偏好度与任务完成率可能明显分离: Gemini 3.1 Flash Live Preview - Minimal 当前以 1046 Elo 位居偏好榜首,但任务成功率为 74.6%;Grok Voice Think Fast 2.0 High 的任务成功率则达到 94.7%。这意味着「听起来更自然、更像完成了任务」不一定等于实际操作成功。
原生语音模型和级联系统放在同一场景评测: 榜单同时覆盖 GPT-Realtime、Gemini Live、Grok Voice,以及由 ASR、LLM、TTS 组成的 ElevenLabs Agents,可直接观察不同 Voice Agent 技术路线在真实交互中的表现。
https://artificialanalysis.ai/speech-to-speech/arena/overview
(@ArtificialAnlys)
2、BetterVoice 开源 macOS 语音输入工具:边说边圈屏幕,同时捕捉语音与视觉上下文
BetterVoice 是一款实验性的 macOS 语音输入工具,把语音听写和屏幕上下文采集放进同一次输入过程。用户按下快捷键开始说话时,可以直接用鼠标圈出正在讨论的界面内容;应用在本地完成语音转录,同时按圈选顺序保存对应屏幕画面,让后续交给 AI Agent 的内容不只有「你说了什么」,还包含「你指的是屏幕上的什么」。
语音和屏幕上下文同步采集: 录音过程中可以连续圈出多个界面区域,BetterVoice 会按照引用顺序记录屏幕画面,并将转录文本与图片保存在同一次会话中。
圈选用于告诉 AI「我在说这里」: 圈出某个按钮、报错或界面元素时,应用实际保存对应显示器的完整截图,并用视觉标记指明关注区域,避免只靠语言描述屏幕内容。
语音识别完全在本地运行: BetterVoice 通过本地语音模型完成英文转录,临时录音会在识别后删除;长语音模式还可将转录文本与捕获的图片一起放入剪贴板,方便继续用于 AI 对话或其他工作流。
https://github.com/TarunTomar122/better-voice
(@TarunTomar122@GitHub)
3、腾讯混元推出长视频生成 Agent 框架 HyCreator:自动生成 10 分钟级影片,可随时切换实时编辑
腾讯混元推出 HyCreator,面向长视频生成,将原本需要反复生成片段、人工衔接的流程交给 Agent 连续执行。其自动模式可在无人干预下完成 10 分钟级影片生成,同时允许创作者在生成过程中随时介入,切换到实时交互编辑,而不必重新从提示词开始生成。
https://hycreator.tencent.com
(@TencentHunyuan)
03 有态度的观点
1、实时语音 AI 工程师 Stu Kennedy :「Voice AI 首先是一个音频工程问题,然后才是机器学习问题。」
实时语音 AI 工程师 Stu Kennedy 长期从事音频与实时系统开发,曾参与 Anam、Pyannote 等项目,目前主要关注 Voice AI、流式说话人分离、合成语音以及实时数字人系统。在 Michael Young 的播客《A Class Act》中,他谈到一个自己反复强调的判断:企业真正做 Voice AI 时,不能只依赖一站式平台,而需要掌握属于自己的一套语音处理管线(pipeline)。
Kennedy 认为,很多 Voice AI 平台最初可能只擅长语音识别、语音合成或某一种模型,但为了让开发者更快搭建产品,又逐渐加入大语言模型、轮次管理、函数调用和智能体编排,最后变成一套几分钟就能跑起来的「一站式解决方案」。这类平台非常适合做 Demo,但进入真实业务后,企业很容易发现,平台预设的通用流程并不一定适合自己的具体场景。
Voice AI 最核心的能力之一,是开发者能够控制和调整自己的语音处理管线,而不是把整个产品交给某个封装好的平台。
在 Kennedy 看来,不同 Voice AI 产品对系统的要求本来就不一样。医疗场景可能更重视语音识别准确率,有些实时交互产品则更关心响应速度,还有一些应用会更加关注说话人识别、打断处理或者自然的轮次交互。因此,开发者应该能够分别选择和替换语音识别(ASR)、大语言模型(LLM)、语音合成(TTS)以及实时通信基础设施,而不是被固定在某一个平台提供的模型组合里。
这种控制权尤其体现在延迟上。Kennedy 曾把一套系统的语音识别延迟从约 2 秒降低到 350 毫秒,但他强调,Voice Agent 的延迟从来不是某一个模型的问题,而是麦克风采集、音频缓冲、网络传输、语音识别、轮次判断、大语言模型推理和语音合成等多个环节共同叠加的结果。只优化其中一个模型,并不能真正解决实时对话体验。
他认为,开发者越早掌握自己的音频与语音处理管线,就越能根据实际业务调整每个环节,也越不容易被某一家模型或平台的能力边界限制。
从第一天开始就应该把 audio pipeline 当成产品本身的一部分,而不是一个可以完全外包出去的基础设施模块。
Kennedy 对下一代 Voice AI 的判断因此并不只是「模型会越来越强」,而是整个系统会越来越接近人类真实对话:能够在用户说话过程中持续理解上下文,正确处理停顿和打断,并在合适的时机回应。真正成熟的 Voice AI,不应该迫使用户适应机器,而应该让机器适应人类原本的说话方式。
https://www.buzzsprout.com/2499498/episodes/19207953-building-the-future-of-voice-ai-from-soundtracks-to-synthetic-speech-with-stu-kennedy-edge-realtime-ai-systems-consultant
(@michaelyoungMBN@X)
04 社区黑板报
招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)
1、 社区活动推荐|Vibe Coding for 准点下班:一天解决一个真实工作痛点
有没有哪件工作,你每天都在重复做、反复确认,明知道可以优化,却一直没时间真正解决?
8 月 29 日,VibeFriends × 原点学堂将在北京举办 VibeHacks #05「Vibe Coding for 准点下班」。这次黑客松直接把题目放进真实工作场景:找到最消耗你的一个环节,用一天时间把它做成可以现场体验的作品。形式不限,可以是 插件、Skill、Agent、自动化脚本、工作流或完整产品。
活动将招募 33 组参赛者,现场有 10+ 行业 Mentor、100+ 目标用户参与体验和投票;作品不只看 Demo 能不能跑,更看它是不是真的能解决工作痛点、提升效率。一等奖 10,000 元,同时还有 Amazon Quick、小红书社区人气、Waffo 变现潜力等奖项。
线上启动:8 月 28 日 18:00–18:30
线下比赛:8 月 29 日,北京海淀 · 原点大厦
报名截止:8 月 28 日
如果你手里正好有一个“早就想自动化掉”的工作流程,这次很适合直接带到现场,把它做掉,然后——准点下班。
参赛者 / 特约观察员报名:https://vibecafe.ai/hacks/5
[招募] 不加班了!用一天做出让人准点下班的作品|VibeHacks #05 报名开启

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示:个人观点,仅供参考