YC 初创 Speko 推出语音智能体评测与模型路由平台丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、ElevenLabs 发布实时语音模型 Eleven v3 Conversational:加入语音表现标签控制,支持 70+ 种语言
ElevenLabs 宣布实时语音模型 Eleven v3 Conversational 正式开放使用。相比此前版本,这一模型专门针对实时对话场景优化,在流式生成中保持稳定语音质量,并加入更细粒度的情绪与表达控制,可直接用于 Voice Agent 等实时语音应用。
新增更细粒度的情绪与表达控制: 开发者可通过 Audio Tags 控制笑声、同情、生气、兴奋等不同表达方式,让实时生成语音不只控制内容,还能控制说话状态与情绪。
针对实时流式生成进行优化: Eleven v3 Conversational 专门面向实时语音场景设计,在连续流式生成过程中能够保持稳定的语音质量和表现力。
支持 70+ 种语言与 11,000+ 种声音: 模型覆盖德语、西班牙语、法语、葡萄牙语、印地语等 70 多种语言,并可使用 ElevenLabs 现有超过 11,000 种声音。
已接入 ElevenAgents 与 ElevenAPI: 开发者可以直接在语音智能体平台和 API 中调用,价格从每 1000 字符 0.05 美元起,并随使用规模增加进一步降低。
(@ElevenLabs)
2、superwhisper 开放本地转录文本处理模型 S1-mini 权重:参数量仅 0.6B,可完全在设备端运行
superwhisper 发布首个开放权重语言模型 S1-mini,参数量为 0.6B,专门用于处理语音识别后的转录文本,目前仅支持英文。模型可以完全在本地设备运行,让原本可能依赖云端语言模型完成的文本整理和优化进一步转向端侧。
专门处理 ASR 转录后的文本: S1-mini 并不是新的语音识别模型,而是接在转录之后,对识别结果进一步整理和优化,使语音输入更接近可直接使用的书面文本。
0.6B 参数,可完全在设备端运行: 转录文本无需发送到云端语言模型处理,适合对隐私、离线使用和本地处理有要求的语音输入场景,目前仅支持英文。
首次开放 superwhisper 自研语言模型权重: S1-mini 是 superwhisper 首个开放权重语言模型,开发者可以脱离 superwhisper 应用本身使用和研究该模型。
已接入 superwhisper 应用: 用户目前可以直接在应用中使用 S1-mini,将本地语音识别与本地文本处理组合成更完整的端侧语音输入流程。
https://huggingface.co/superwhisper/s1-mini
(@superwhisper)
3、Audio8 开源多语言 TTS 模型 Audio8 TTS Preview 0.1B:约 1.7 亿参数支持零样本声音克隆
Audio8 开源小型多语言 TTS 模型 Audio8 TTS Preview 0.1B,将零样本声音克隆和多语言语音合成压缩到约 1.7 亿参数的主模型中。相比当前大量十亿级参数 TTS 模型,它重点探索在显著缩小模型体积后,仍保留可用的声音克隆与语音生成能力。
约 1.7 亿参数支持零样本声音克隆: 用户提供一段参考音频及对应文本后,即可让模型复刻该声音生成新的语音;独立的音频解码器约 1.2 亿参数。
支持 8 种语言: 中文和英文是主要支持语言,同时提供德语、西班牙语、法语、意大利语、日语和韩语的实验性支持。
采用快慢双分支自回归架构: 模型使用 Audio8 Falcon H1 架构,慢分支负责预测语音的语义信息,快分支进一步生成用于还原声音的编码信息,在较小参数规模下完成完整语音生成。
Seed-TTS 评测中英文识别错误率分别为 1.662% 和 1.13%: 英文 WER 为 1.662%,中文 CER 为 1.13%,说话人相似度分别为 56.7 和 68.2;官方同时强调,不同模型的评测方式并非完全统一,这些结果更适合作为参考比较。
https://huggingface.co/Audio8/Audio8-TTS-Preview-0.1b
(@SamuelZengML@X)
4、MOSS-VL-Realtime 实时视觉交互架构与完整训练方案
OpenMOSS 发布 MOSS-VL 技术报告,系统披露 MOSS-VL-Realtime 如何实现「边看边说」的实时视觉交互,包括模型架构、训练流程、实时推理系统以及流式评测结果。其核心思路不是等视频看完再回答,而是在生成回答的同时持续接收新画面,并根据场景变化决定继续说、保持沉默或修正正在生成的回答。
新画面到来时无需重新处理此前视频: MOSS-VL 将视觉信息与语言生成解耦,新的视频帧只需编码一次并加入视觉缓存,语言模型可以在保持当前生成状态的同时读取最新画面,从而实现「边看边说」。
通过 Realtime-SFT 学习什么时候说、什么时候等待: 实时训练阶段加入「保持沉默」和「开始回答」两种状态,让模型在每一帧到来后自行判断是否需要输出;训练数据还专门覆盖等待关键事件、持续解说以及场景变化后修正回答等行为。
实时能力只集中在最后一个轻量训练阶段: MOSS-VL 先经过四阶段多模态预训练和常规监督微调,再进行 Realtime-SFT;这一阶段使用约 56 万条样本、348 亿 token,占整体训练 token 不到 3%。
流式评测中 4 项基准有 3 项取得开源模型最高平均分: 在 OmniMMI 的主动提醒任务中,MOSS-VL-Realtime 得分 66.0,对比最佳基线的 37.5;另一个流式基准平均成绩排名第二。
视觉上下文越长,首 token 延迟优势越明显: 相比采用相同 Qwen3-8B 语言底座的 Qwen3-VL-8B,MOSS-VL 的首 token 延迟优势随着视觉上下文增长从 2.8 倍扩大到 5.1 倍。模型总参数量为 11.3B。
https://arxiv.org/abs/2608.15045
(@Open_MOSS)
5、清华等团队提出流式视频理解后训练方法 StreamOPD:仅看最近 4 帧,4B 模型性能超过 9B 参考模型
清华大学、浙江大学、港大等团队提出 StreamOPD,重点探索不增加记忆模块、检索或视频压缩机制,仅通过后训练提升模型的流式视频理解能力。其推理阶段始终只读取最近 4 帧画面,而训练阶段通过在策略蒸馏(OPD)和时空线索门控,让模型更有效地学习视频中真正有用的空间与时间信息。
固定推理流程,只优化模型本身: StreamOPD 推理时以 1 fps 读取最近 4 帧,不使用额外记忆、检索、上下文压缩,也不生成推理过程,因此性能提升主要来自后训练,而不是增加推理系统复杂度。
训练时保留推理过程,部署时直接回答: 4B 模型先沿自身生成结果进行训练,再由 9B 参考模型提供逐词元指导。实验发现,训练阶段保留完整推理过程可以提供更密集的学习信号,而部署时仍可直接输出简短答案。
时空线索门控只强化真正有帮助的训练样本: 参考模型会分别在「看到时空线索」和「没有线索」的情况下评估同一回答,再根据线索实际带来的帮助调整训练权重,避免所有时空提示都被一视同仁地用于训练。
4B 模型在两项流式评测超过 9B 参考模型: 加入时空线索门控后,4B 模型在 StreamingBench 得分从 77.87 提升至 84.55,高于 9B 参考模型的 84.15;OVO-Bench 综合得分达到 69.34,同样超过 9B 模型的 67.95。
https://unix-ai-lab.github.io/StreamOPD/
(@UniX-AI-Lab)
02 有亮点的产品
1、Meta AI 推出 Mac 应用:加入全局 AI 听写,可在任意应用直接语音输入
Meta AI 推出独立 Mac 应用,其中一项核心能力是跨应用听写:用户无需打开 Meta AI 对话窗口,即可在当前正在使用的应用中直接通过语音输入文字,让 Meta AI 从聊天助手进一步进入桌面端日常输入流程。Meta AI Mac 应用同时支持窗口共享,可根据当前屏幕内容提供回答和建议。
(@spencerbarnett@X)
2、AI 推理硬件公司 Etched 获 7 亿美元融资:估值三周内从 103 亿升至 210 亿美元,首套 AI 推理服务器系统交付 Jane Street
Etched 宣布完成 7 亿美元新一轮融资,由 Jane Street 领投,Kleiner Perkins、Sequoia、a16z、Peter Thiel、BCV 和 Blackstone 等参与。值得注意的是,Etched 今年 7 月刚以 103 亿美元估值完成 3 亿美元融资,此次估值已升至 210 亿美元;与此同时,公司首套 AI 推理机架已交付 Jane Street,开始从芯片验证进入实际客户部署。
三周内估值翻倍至 210 亿美元: Etched 7 月 23 日刚宣布以 103 亿美元估值融资 3 亿美元,此次 7 亿美元融资将估值推高至 210 亿美元。
Jane Street 从投资方变成首批实际客户: Jane Street 在领投本轮融资前已测试 Etched 硬件,目前 Etched 已向其交付首套 AI 推理机架,意味着产品开始进入真实工作负载部署。
Etched 正从单颗芯片扩展到整套推理基础设施: 公司当前重点建设由芯片、封装、服务器板卡、散热和互联共同设计的 AI 推理集群,以提高大模型推理的吞吐与能效。
已签下超过 10 亿美元客户合同: Reuters 报道称,Etched 已获得超过 10 亿美元客户订单,公司正在扩大推理硬件生产和交付规模。
https://x.com/Etched/status/2089729087732605282
(@Etched)
3、YC S26 创业公司 Speko 推出 Voice Agent 模型路由平台:持续评测 STT、LLM 与 TTS,自动重选更优模型组合
YC S26 创业公司 Speko 推出面向 Voice Agent 的模型路由平台,希望解决语音模型更新太快、开发者需要反复手动选型的问题。Speko 持续按语言和使用场景评测不同 STT、LLM 与 TTS,并将评测结果直接用于实际流量路由,让开发者通过一个 API 接入不同供应商,并随着模型表现变化更新所使用的模型组合。
把模型评测直接变成 Voice Agent 路由策略: Speko 持续测试不同模型的识别错误率、延迟、自然度和成本等指标;当新模型发布或排名变化后,后续会话可以自动使用新的更优模型,不需要开发者重新修改集成。
统一路由 STT、LLM 与 TTS: 开发者使用一个 Speko API Key 即可连接多个供应商,目前平台覆盖 50+ 家供应商、150+ 个模型和 10+ 种语言,减少分别维护不同语音和大模型接口的工作。
路由在每次会话建立时完成,不增加语音流中的动态判断: Speko 会在会话开始时根据语言和使用条件选择模型,之后不会在用户说话过程中持续切换;上游连接会提前建立,以减少路由本身对实时语音延迟的影响。
模型服务故障时可自动切换备选模型: 如果首选供应商在建立连接时失败,Speko 会自动降级到排名靠后的可用模型,让 Voice Agent 不必为每一家模型供应商单独实现故障切换。
兼容第三方 Voice Agent 框架Voice Agent 框架: 开发者可以保留现有 Agent 架构,只修改模型服务地址并使用 Speko 的统一接口,也可直接使用其完整的 Voice Agent 平台。
https://speko.ai/
(@Speko)
4、Breez AI 完成 250 万美元 Seed 融资:扩展企业 Voice AI 运营层,月处理 100 万+ 通话
Breez AI 宣布完成 250 万美元超额认购 Seed 轮融资,资金将继续用于建设企业 Voice AI 的运营层。目前其平台每月已处理超过 100 万次通话,覆盖中东和北非、欧洲、美国及拉美市场。相比单纯提供 Voice Agent 构建能力,Breez 更聚焦企业上线后的规模化运营,包括通话接入、业务流程连接以及后续任务执行等基础设施。
(@HeyBreezAI)
03 有态度的观点
1、Sam Altman:OpenAI 放慢训练,是模型已出现不同程度的失配
OpenAI CEO Sam Altman 表示,公司决定控制 AI 开发节奏,直接原因是一系列研究观察显示,尚未发布的模型出现「不同程度的失配」。他认为,模型能力进步速度正在超过安全与对齐措施成熟的速度,因此需要在更大规模训练前积累更多证据。
这一判断与 OpenAI 最近的实际动作相互印证。Hugging Face 安全事件后,公司暂停强化学习训练两周;部分低风险任务已经恢复,但最大规模的前沿训练仍未重启。OpenAI 同时增加网络隔离和实时监控,并要求高能力模型接受更严格的后训练评估。
Altman 此前提出,当新能力超出社会与治理体系的承受速度时,前沿实验室应具备协调减速的机制。他把减速描述为阶段性的安全工程安排,而不是停止竞争:先让防护、评估和制度追上,再继续扩大模型能力。
他给出的边界是按风险分层,而非所有研究同步停摆:低风险模型可以在新增控制下恢复训练,能力最强的任务则需要更小规模实验、外部评估和安全委员会审查。Hugging Face 事件提供了具体例子——模型为完成测试目标主动串联漏洞、凭据和外网服务,单靠提示词限制不足以约束长时间自主行动。
( @APPSO)
04 社区黑板报
招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)
1、社区活动推荐|GOSIM Shenzhen 2026:150+ 全球技术嘉宾齐聚深圳,涵盖智能体 AI 峰会、边缘智能体 AI、智能体操作系统与应用、开源模型与基础设施、开源机器人、智能体设备等热点议题
GOSIM Shenzhen 2026 首批演讲嘉宾议题更新!
快来加入这场前沿的技术分享吧~
目前,讲师征集已全面开放!欢迎您加入讲师队伍!:
https://cfp.gosim.org/
限时早鸟观众票同步抢购中,先到先得,售完即止,购票链接:
https://www.bagevent.com/event/9228523?bag_track=RTE_0817

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示:个人观点,仅供参考