Egma 开源 Voice Agent 测试与生产监控平台,模拟通话写进代码仓库丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、语音智能体测试平台 Egma 开源:把模拟通话写进代码仓库,发布前自动跑回归测试
Egma 开源了一套面向 Voice Agent 的测试与生产监控平台,把原本依赖人工反复打电话、试听结果的 QA 流程,变成可以和 Agent 代码一起保存、版本管理和重复执行的测试流程。开发者可以定义模拟语音或文本对话、预设工具返回结果和通过条件,再通过 CLI 或 coding agent 在发布前运行测试。
测试用例直接放进 Agent 仓库: 开发者可以为不同场景建立回归测试,模拟用户通过语音或文本与 Agent 对话,并 mock 工具调用结果,检查 Agent 是否按照预期完成任务。
可以从 CLI 或 coding agent 直接执行: Egma 将测试流程接入开发工作流,开发者修改 Prompt、工具或 Agent 代码后,可以重新运行同一组场景,而不需要人工逐个打电话验证。
同一套平台继续监控线上表现: 除了发布前测试,Egma 还能查看生产环境里的真实对话、工具调用和指标,并通过 grader 检查 Agent 行为、定位失败案例。
支持 BYOK 和自托管: 开发者可以使用自己的 STT、LLM 和 TTS 服务密钥,也可以将 Egma 部署在自己的基础设施中。
https://github.com/egma-ai/egma
2、SLNG 开源语音智能体编译器 UNMUTE//:一份 Agent 配置,可生成不同运行环境的独立项目
SLNG 开源 UNMUTE//,让开发者用同一套 YAML 和 Markdown 文件定义语音智能体的 Prompt、模型、工具、状态和任务流程,再编译成不同运行环境对应的项目。这样 Agent 本身不需要跟着底层框架一起重写,也能减少对单一运行时的绑定。
把 Agent 定义和运行环境拆开: 模型、工具、Prompt、变量和任务流程都写在统一配置中,具体部署到哪套运行环境则单独配置,同一份 Agent 定义可以生成不同实现。
编译后得到可独立运行的代码: UNMUTE// 会直接生成完整项目,包括固定依赖、Dockerfile 和运行说明;生成后的项目不会在运行时依赖 UNMUTE//,开发者可以自行部署和维护。
编译阶段提前检查配置错误:
unmute validate会在真正发起语音通话前检查工具返回类型、Prompt 变量、任务结束条件,以及目标运行环境不支持的能力,避免部分问题等到线上通话时才暴露。同一份定义可对应自托管或托管部署: 开发者既可以把编译后的代码部署到自己的基础设施,也可以选择托管方式运行,而不需要重新定义 Agent 本身。
https://unmute.ai
https://github.com/slng-ai/unmute
3、Scale AI 与 UMD 推出全双工语音模型 SteerDuplex 与评测基准 SteerBench:开始测模型能否按指令改变语气、人格和说话方式
Scale AI 与马里兰大学等团队发布 SteerDuplex 和 SteerBench,把全双工语音模型的评测从打断、停顿和轮次管理,进一步扩展到「可操控性」:用户要求模型改变语气、人格、口音、语速或回答长度时,它是否能在持续对话中稳定遵循这些指令。
SteerBench 同时评估「说什么」和「怎么说」: 基准包含 390 条语音 Prompt 和 1,067 条人工编写的文本、音频二值评分标准,覆盖语气、人格、风格/口音以及语速/长度。文本标准判断内容是否按要求完成,音频标准则判断声音表现是否真的符合指定风格。
SteerDuplex 在 Moshi 上加入可操控训练: 模型通过自然对话和合成对话进行监督微调,训练内容覆盖指令遵循、声音表达、推理和全双工交互;随后再加入两阶段强化学习,优化中断响应、停顿处理和回答连续性。
论文中音频可操控通过率达到 65.1%: 在匹配的 SteerBench 测试中,SteerDuplex-SFT 的 audio-steering 平均通过率为 65.1%,相比最强开放基线 Moshi 的 20.55% 提升约 44.5 个百分点。
强化学习改善打断处理,但也暴露 reward hacking: 论文报告,RL 将一项中断响应指标从 72.5% 提升到 82.5%,并将 synthetic pause barge-in 从 26.5% 降至 9%;但作者也观察到模型可能通过缩短或不完整回答来「取巧」,因此强调时序指标需要和回答完整性一起评估。
https://arxiv.org/abs/2609.12623
4、网易有道发布实时 ASR 模型 Confucius4-R2T2:最低 200 延迟,已输出文字不再回改
网易有道发布 Confucius4-R2T2,一款基于 Qwen3-ASR 构建的实时流式语音识别模型。相比常见会反复修改中间结果的 pseudo-streaming ASR,R2T2 只输出已经确认稳定的文本,一旦提交就不再改写,更适合实时字幕、语音智能体和同步翻译等需要立即消费转写结果的场景。
已输出文本不再回改: R2T2 采用 append-only 输出,只在模型判断某段文本已经足够稳定后才提交,后续音频不会再修改此前已经输出的内容,从而减少实时字幕中的反复跳字和闪烁。
80 ms–2 s 流式 chunk 可调: 开发者可以根据延迟和识别准确率需求调整解码窗口;官方报告其平均识别延迟约为 200–600 ms。
通过 Stable Prefix 判断何时可以「定稿」: R2T2 使用 Longest Stable Prefix 学习,让模型动态决定哪些文本已经可以安全输出、哪些还需要继续等待后续音频,而不是固定每隔一段时间就强制生成结果。
主要针对中英文优化: 官方表示模型重点优化中文和英文,同时保留法语、德语、日语、韩语、西班牙语、阿拉伯语等多语言流式识别能力,并同时提供 vLLM 和 Transformers 推理方式。
https://github.com/netease-youdao/Confucius4-R2T2
02 有亮点的产品
1、AI 助手 Rene 上线:藏进 iMessage 里做跨应用任务,还能参与多人协作
Rene 上线了一款以 iMessage 为入口的 AI 助手,用户可以像给联系人发消息一样下达任务,无需先进入独立 App。Rene 能读取并操作已连接的邮件、日历、工作应用和其他服务,也可以调用浏览器、生成代码和内容,把聊天直接变成任务执行入口。
把 Agent 放进日常聊天入口: Rene 的交互方式不是打开一个新的 AI 工作台,而是直接像联系人一样发消息;官方还强调无需额外注册或学习新的界面,降低了调用 Agent 的入口成本。
可以跨应用读取上下文并执行任务: Rene 可连接邮件、日历、Slack、Notion、Linear、GitHub 等服务,读取相关上下文后继续起草回复、调整日程、整理任务或执行后续操作。
「多人优先」把 Agent 带进协作场景: 创始人将 Rene 定位为 multiplayer-first agent,演示包括为团队协调晚餐选择等多人任务;相关公开演示还展示了 Rene 参与群聊协调,让多个参与者一起推进决定,而不是只服务单个用户。
浏览器与生成能力直接挂在聊天任务后面: 官方发布称 Rene 可以浏览网页、写代码、购物、搭建网站并生成幻灯片和图片,因此聊天线程不仅用于问答,也可以直接产出和执行任务结果。
https://rene.co
2、AI 游戏平台 Arcade 推出 Arcade Mode:和 AI 伙伴 Morph 对话,边玩边塑造游戏世界
Arcade 推出 Arcade Mode,并加入 AI 游戏伙伴 Morph。玩家可以直接和 Morph 对话,在游戏过程中持续创造和改变世界,还能邀请朋友一起加入并继续塑造这个世界;整个体验都可以直接在浏览器中完成。相比先生成一个固定游戏再开始玩,Arcade Mode 更强调把 AI 持续放进游玩过程里,让对话本身成为改变游戏世界的一种交互方式。
tryarcade.com
3、语音理解团队 Oruk 推出带情绪与说话风格的 ASR:转写文字之外,也保留「怎么说」的信息
Oruk 推出面向语音应用的语音理解 API,在输出转写文本的同时,还会识别语音中的情绪和说话方式,例如犹豫、沮丧、温和或带讽刺意味的表达,让语音智能体、客服分析等系统不只拿到「说了什么」,还能获得「这句话是怎么说出来的」。
一次返回文字、情绪和说话方式: Oruk 的统一分析接口会同时输出转写文本、情绪标签、说话方式标签,以及对应的时间位置,不需要开发者再额外接一套情绪识别流程。
实时版本支持多语言转写和短语级情绪识别: 实时能力目前处于 Preview,可进行多语言实时转写,并按短语输出情绪判断;更细的说话方式分析目前主要用于英文录音。
识别的是声音表现,不是直接判断真实意图: 官方特别强调,像「沮丧」「犹豫」「讽刺」这类结果描述的是声音里的表达方式,不能直接等同于说话者真实的心理状态或真实意图。
https://oruk.ai
4、AI 英语口语学习公司 Loora 获 2200 万美元 B 轮融资:用户超 1500 万,并向企业和高校扩展
以色列 AI 英语学习公司 Loora 获得 2200 万美元 B 轮融资,由 Union Tech Ventures 领投,vgames、Emerge、Hearst Ventures 和 QP Ventures 参投,累计融资达到 4325 万美元。Loora 通过 AI 导师提供一对一英语口语练习和即时反馈,目前已有超过 1500 万用户、累计完成约 2 亿次 AI 对话;过去一年收入增长超过一倍,并开始把产品扩展到企业、政府和大学,目前已有 100 多家机构使用。此次融资将继续投入 AI 研发、数据与研究基础设施,以及美国、欧洲、亚洲和南美市场扩张。
https://www.loora.com/news/company-news/loora-raises-22m-funding
5、Grok Bot can talk now.
https://x.ai/bot
03 有态度的观点
1、零跑:近期不重点投入人形机器人,更看好非人形方案
9 月 17 日,零跑汽车创始人朱江明在技术日媒体交流中表示,公司的人形机器人仍处于预研阶段,做了一些演示,但近期不会把人形作为重点方向。
据报道,零跑的人形机器人已经进入测试阶段,电机、控制器、电池、感知算法与计算平台等底层能力均为自研,目前保持小规模投入,探索可规模化落地的应用。朱江明认为,机器人从能走能跑到实际工作,还需要成长过程,目前很难确定商业模式。
他更看好能移动、能操作的非人形机器人,例如轮式、可变形方案,并用骑车与步行作比较:骑自行车 30 公里,比步行同样距离更省力;完成工作应尽量简化结构、降低成本。
不炒概念、择机落地。能遛一遛的机器人不算本事,能赚钱的机器人才拿得出手。
他表示,零跑近期会更关注自动化场景,利用 AI 和已有技术探索创新产品及第二增长曲线。
( @APPSO)
04 社区黑板报
招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)
1、
iRTE2026 定档啦!Voice Agent Builder 们,10 月北京集合~
今年从对话式 AI 一路聊到实时智能,现场有 15+ 论坛、100+ 场深度演讲,汇聚 150+ 全球技术领袖和行业专家,全双工+交互式模型、实时互动世界模型、AI 硬件、AI Coding 工具等方向都会集中开聊。
贾扬清也将返场 iRTE 大会,带来对 AI 行业前沿趋势和技术演进的最新观察~
目前大会门票限时免费开放!
想来现场听技术、认识同行的开发者,可以先把票薅上
时间:10 月 23–24 日
地点:北京悠唐皇冠假日酒店
限免结束后将恢复收费,建议先报名占位 
定档!从对话式 AI 到实时智能,Voice Agent Builder 的年度春晚 iRTE2026 来了丨 10 月 23-24 日,北京见!

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
作者提示: 个人观点,仅供参考