清华桌面机器人团队 CyboPal 融资数亿元;Wispr Flow B 轮融资估值 20 亿美元,将发布自研语音识别模型丨日报

本期编辑:@三水、@鲍勃


01 有话题的技术

1、Cartesia 发布 TTS 模型 Sonic-3.6:支持 44 种语言,重点提升跨语言翻译与语音自然度,Artificial Analysis 榜单排名第一

Cartesia 发布 Sonic-3.6 TTS 模型,重点提升 44 种语言下的语音自然度,并称这是其目前最逼真的 TTS 版本。相比三个月前发布的 Sonic-3.5,新版本根据开发团队反馈进行了底层模型改进,并在 Artificial Analysis 的 Provider Voice Streaming 和 Controlled Voice Streaming 两项榜单中均排名第一。此外,在 Voice of India 的印地语 General TTS 榜单中,上一代 Sonic-3.5 当前排名第 3,Bradley-Terry Elo 为 1072,Win Rate 为 59%。目前 Sonic-3.6 已开放 Beta 测试。

图片

图片

测试链接:

https://www.cartesia.ai/sonic

Voice of india:

https://voiceofindia.ai/leaderboards

( @Cartesia)

2、ElevenLabs 正式推出 MCP:支持在 Claude 中直接创建、配置和管理 Voice Agent

ElevenLabs 正式推出 MCP,将 ElevenAgents 的管理能力接入 Claude 等 MCP Client。开发者可以直接通过自然语言创建和修改 Voice Agent,无需在本地安装 ElevenLabs MCP Server。

( @Elevenlabs)

3、Fish Audio 推出 MCP:接入 Claude、Codex CLI、Cursor 与 Windsurf,支持语音生成和音频转录

Fish Audio 推出 MCP,将语音能力直接接入 Claude、Codex CLI、Cursor 和 Windsurf 等 Agent 与开发工具。开发者可以通过统一 Endpoint 在现有工作流中搜索 Voice、生成语音、转录音频,并查询账户使用情况,无需切换到 Fish Audio 平台单独操作。

( @Fish Audio)


02有亮点的产品

1、Giga 为 Voice Agent 平台推出实时合成语音检测:通话过程中识别 AI 生成语音,可触发二次验证

图片

Giga 在其语音智能体平台上线实时合成语音检测能力,可在客服通话进行过程中持续分析来电者音频,并判断对方是否为 AI 生成语音。该能力直接运行在现有语音平台内,无需上传完整录音或额外搭建检测链路,检测结果可用于触发加强身份验证、人工接管、敏感操作限制或欺诈分析。

  • 实时流式检测,无需等待完整录音结束:系统持续分析来电音频流,并在对话进行过程中输出合成语音判断结果,使检测能够在用户仍在说话时完成。

  • 针对电话网络条件专门训练:模型面向窄带电话音频、压缩编码、背景噪声和短语音片段优化,而不是只在高采样率、干净录音条件下运行。

  • 强调跨模型泛化,而非识别特定 TTS 指纹:Giga 表示检测器关注更通用的合成语音特征,而不是记忆单个语音生成模型的固定特征,以降低面对未知新模型时检测能力快速下降的问题。

  • 结合波形模型、图注意力与自监督语音表征:技术路线参考 RawNet2、AASIST 和 wav2vec 2.0 等语音反欺骗研究,并结合电话场景与对抗鲁棒性训练持续优化检测模型。

  • 检测结果直接进入语音智能体风控链路:被标记的通话可触发加强身份验证、转人工、限制退款或账户修改等敏感操作,也可仅记录用于后续欺诈分析。

https://giga.ai/news/synthetic-voice-detection

2、Wispr Flow 完成 2.8 亿美元 Series B 融资,估值 20 亿美元:预览首款自研语音识别模型 Canto,专为真实环境而设计,嘈杂环境 WER 降至 5%–10%

Wispr Flow 完成 2.8 亿美元 Series B 融资,投后估值达到 20 亿美元,本轮由 Menlo Ventures 领投,累计融资额达到 3.61 亿美元。同期,公司预览首款自研语音识别模型 Canto,重点针对噪声、风声、重口音、多语言混说等真实语音输入环境优化。
  • 极端噪声环境 WER 从 30%+ 降至 5%–10%: Wispr 表示,在背景噪声、风声、重口音或音乐等困难条件下,Canto 可将词错误率降低超过 4 倍。

  • 预计减少 30%–35% 的听写后编辑: 在日常使用场景中,公司预计 Canto 可使需要用户手动修改的语音输入数量降低 30%–35%。

  • 面向 Code-switching 和个性化词汇优化: Canto 针对一句话中混用多种语言的情况进行处理,并可结合用户词典及联系人姓名等信息提高识别准确率。

  • 内部核心指标转向 Zero Edit Rate: Wispr 用「首次转写后完全无需修改的内容比例」衡量模型效果,而不仅关注传统 WER。

https://wisprflow.ai/post/series-b

( @Wispr Flow)

3、印度儿童科技初创公司 Wippi 完成 120 万美元种子轮融资:无屏 AI 语音设备支持儿童与故事角色双向对话

印度儿童科技初创公司 Wippi 完成 120 万美元种子轮融资,由 12 Flags 领投,Warmup Ventures、Ventana Ventures 和 Ruvento Ventures 跟投。公司面向 4–8 岁儿童开发无屏 AI 语音陪伴设备,让孩子通过语音与故事角色对话、提问并参与剧情走向。

图片

  • 支持双向互动式故事: Wippi 不仅播放预设内容,儿童还可以在故事过程中提出问题、做出选择,并通过语音影响后续情节。

  • 采用儿童语音 AI + 无屏硬件: 产品通过专有硬件和面向儿童场景的语音 AI 实现对话交互,减少对屏幕界面的依赖。

  • 实体设备与数字内容结合: 产品组合包括音频设备、角色卡和插图故事书,并正在开发收藏级角色小雕像;儿童可通过实体设备或卡片触发不同 AI 互动故事。

  • 角色覆盖本土与全球童话 IP: 当前内容包括 Ram、Krishna 等印度文化角色,以及 Alice、Cinderella、Aladdin 等经典童话人物。

  • 融资将用于语音 AI、制造与团队扩张: Wippi 计划加强儿童语音 AI 技术、扩充工程和 AI 团队并扩大印度制造规模,同时计划未来 12 个月将用户覆盖扩展至 15,000 个家庭。

( @Wippi)

4、具身交互模型企业 CyboPal 完成数亿元融资:首款桌面机器人终端集成实时交互模型,支持语言+手势控制

具身交互模型企业 CyboPal(江苏细胞壁智能科技有限公司)完成数亿元融资,由东方富海领投,联想之星、天启资本等机构跟投,心流资本 FlowCapital 担任财务顾问。本轮资金将用于首款 Desktop Robotic Terminal 的量产交付,以及具身交互系统迭代。

  • 团队覆盖硬件终端、交互模型与 Agent OS 全链路: CyboPal 由 90 后清华博士彭天放带队,核心成员来自机器人、自动驾驶、大厂 AI、供应链和生产体系,具备从硬件终端、交互模型到 Agent OS 的一体化研发与量产交付能力。

  • 首款产品定位桌面机器人终端: 产品将实时交互模型、大屏机器人机体和 AI 计算底座集成在同一桌面终端中,面向 PC 与 Agent 协作场景。

  • 支持语言+手势进行意图输入: CyboPal 正在开发自研 AI 交互模型层,让用户通过语言和手势与计算机交互,并将 Agent 状态呈现、关键步骤确认和人工接管纳入交互流程。

  • 大屏可主动调整位置: 主屏能够根据使用模式靠近用户,以适应不同坐姿、视距和工作状态,同时作为用户发起、审阅和接管 Agent 任务的物理交互入口。

  • 同时布局交互模型、Agent OS 与硬件终端: 团队希望将硬件 Harness、交互模型和 Agent 工作流组合到同一系统,并通过桌面场景中的长期 Context 持续优化交互体验。

独家|CyboPal 完成数亿元融资,打造消费级具身智能的「交互模型底座」

( @Z Potentials)

5、苹果被曝正开发带摄像头的 AirPods:深度集成 Visual Intelligence,支持 Siri 环境感知

据 MacRumors 报道,从 macOS Tahoe 26.7 测试版的相关视频线索来看,苹果正在开发带摄像功能的 AirPods,这款产品的开发进度已接近上市阶段。

演示画面显示,耳机搭载的摄像头能够采集佩戴者视野内的环境画面,交由视觉智能(Visual Intelligence)处理,配合 Siri 识别周边物体、解答相关问题或是记录环境信息。系统还会在头发等异物遮挡耳机摄像头时发出提示,提醒用户移除遮挡,保障环境识别效果。目前该硬件尚未正式对外发布。

据 MacRumors 报道,macOS Tahoe 26.7 测试版中曝光的一段视频显示,苹果公司目前正在研发一款配备摄像功能的 AirPods 耳机,且该产品似乎已接近量产准备阶段。

演示视频显示,这款耳机的内置摄像头可将佩戴者眼前的视觉信息实时传输至「视觉智能」(Visual Intelligence)系统,并通过 Siri 回答用户关于周围环境、物体的各种提问,或是直接保存相关信息。此外,当头发或其他物体遮挡住 AirPods 的摄像头时,设备会自动发出提醒,提示用户清理遮挡物,以确保环境识别的准确性。

截至目前,苹果官方尚未正式发布该产品。

( @MacRumors)



03 有态度的观点

1、黄仁勋:AI 工厂正在成为一种可投资的基础设施资产
图片

英伟达 CEO 黄仁勋在署名文章中表示,公司与 Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs 和 KKR 建立合作关系,创建独立融资平台,计划逐步调动超过 5000 亿美元的第三方资本建设 AI 基础设施。

他把 AI 工厂定义为一套包含加速计算、网络、系统软件、AI 框架与开发者生态的平台,而非单一芯片。语言、视觉、语音、生物学、物理 AI 和机器人模型可以共享同一套基础设施;客户需求变化时,设备也可以重新部署给其他云、运营商或企业。CUDA 的持续优化则会提高已部署设备在生命周期内的性能与效率。‘

在 AI 领域,计算就是收入。

黄仁勋强调,超过 5000 亿美元是多个平台未来计划调动的第三方资本总额,不是英伟达收入、单个基金规模或对单一客户的承诺。金融机构将分别评估客户、需求、利用率、现金流和残值,再独立决定是否融资。在部分项目中,英伟达可能提供最高 25% 的残值支持,并逐项评估。

这项有限支持用于补充独立承销;黄仁勋以设备可交换、全球通用、能通过软件升级和重新部署为理由,解释金融机构为何可以把 AI 计算设施视为长期生产性资产。

( @APPSO)

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。


作者提示:个人观点,仅供参考

注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    关键词
    // 相关帖子
    Coming soon...
    • 0
    清华桌面机器人团队 CyboPal 融资数亿元;Wispr Flow B 轮融资估值 20 亿美元,将发布自研语音识别模型丨日报RTRTE_Dev_Comm