实时 AI 转写屏蔽工具 Kalypta,人听得懂、ASR 转不出丨日报

本期编辑:@三水、@鲍勃

01 有话题的技术

1、Cherry Embedded 开源 MCU 音视频处理库 CherryAVP:统一编解码、WebRTC 3A 与音频效果接口

图片


Cherry Embedded 开源了面向 MCU 的音视频处理库 CherryAVP,希望用一套统一框架覆盖音频编解码、音频前端处理、音效、格式转换和部分视频处理,减少开发者在更换芯片平台时重复适配不同厂商音频 API 的工作。项目明确面向低内存、资源受限的微控制器环境。


  • 把 MCU 音频处理集中到统一框架: CherryAVP 提供音频编解码、容器封装/解封装、采样率/声道/位深转换和 MFCC 等能力,并明确将「不同芯片缺少统一框架和 API、换芯片需要重新适配」列为项目动机之一。

  • 集成 WebRTC 3A 音频前端: 内置基于 WebRTC 的 AEC、NS、AGC、VAD,并支持 HPF、32 kHz 分频处理以及运行时动态开关和调整部分参数;AEC 支持远端参考输入、延迟信息及 drift/skew compensation 等选项。

  • 覆盖从编解码到音效处理的一套链路: 音频侧支持 AAC、FLAC、MP3、Opus、Vorbis、G711、G722 等编解码,同时提供 Filter、Compressor、EQ、Limiter、Mixer、Reverb、Sonic 和 Volume 等音效模块;视频侧目前包括 MJPEG、H264,并建议优先使用硬件编解码。

  • 第三方依赖固定到官方库和具体版本: 项目使用 Opus、FLAC、Ogg、Vorbis 等开源实现,并通过明确来源和 commit/tag 管理依赖,以减少底层库来源混乱带来的适配问题。


https://github.com/cherry-embedded/CherryAVP


(@嵌入式 Linux)



2、自变量机器人开源流式 TTS 进度模型 X2-NativeCursor:无需 ASR,直接追踪实际播报位置

自变量机器人(X Square Robot)开源 X2-NativeCursor,一个约 2M 参数的流式 TTS 进度模型,可直接读取 TTS 生成的原生语音 token,在波形解码前估计当前读到原文的哪个位置,无需再把合成语音送入 ASR 或额外的在线波形对齐模型。


结合播放器的实际播放时钟,应用可以区分「模型已经生成到哪里」和「用户真正听到哪里」:例如语音被用户打断时,可按实际播报位置更新对话历史,再从正确位置继续生成。


  • 直接从语音 token 映射回原文位置: NativeCursor 同时编码当前文本与 Qwen3-TTS 的 codebook-0 语音 token,通过局部匹配持续更新朗读位置;内部位置允许回退修正,对外输出的游标则保持单调向前。

  • 用 TNPlan 处理「写法」和「读法」不一致: 对 99% 等书写顺序与实际发音不同的内容,先将文本转换为读音标签,并保存标签与原文区间的对应关系,使游标最终仍能映射回原始文本。

  • 80 ms 前瞻下,中文平均位置误差为 0.151 个字符: 论文测试中,NativeCursor 使用一帧、即 80 ms 前瞻;在线波形对齐基线使用 320 ms 前瞻时,中文 MAE 为 1.253 个字符。对齐计算的实时率 RTF 从该基线的 0.3598 降至 0.0180。

  • 无需修改 TTS 生成器: TTS 生成器、语音 tokenizer 和波形解码器均保持不变,只额外训练进度模型。论文在 Qwen3-TTS 上完成主要实验,并在 CosyVoice2 上重新训练对应进度模型,验证同一结构可适配不同 TTS 骨干;但更换模型或音色仍需重新训练、验证对应的进度模型。


https://x-square-robot.github.io/X2Streaming-TTS/



3、开发者 Shubham Saboo 开源实时保险理赔智能体系统:通话中同步查看事故现场并整理理赔记录

开发者 Shubham Saboo 开源了一个实时保险理赔智能体系统,用户可以直接通过语音报案,并在通话过程中用摄像头展示事故现场或受损物品。系统会结合语音描述和现场画面持续采集信息,并同步整理成理赔记录,把原本分散的报案、现场查看和信息录入放进同一次实时交互中。


https://github.com/Shubhamsaboo/awesome-llm-apps



4、语音与音频研究团队 MM-Speech 开源端到端语音智能体框架 VoxMind:先推理再生成语音,辅助智能体异步检索工具

图片


MM-Speech 开源 VoxMind,让端到端语音对话模型不只负责直接生成语音回答,而是在回答前先进行结构化推理,据此完成任务规划、工具选择和调用;面对大规模工具集时,再由辅助智能体异步检索所需工具,减少动态工具管理对主模型推理链路的阻塞。


  • 先思考再说话,把推理加入端到端语音生成链路: VoxMind 在生成最终语音回答前先产生结构化的 reasoning trace,并以此进行任务拆解、工具选择;获得工具返回结果后,还可以继续进行多轮推理和回答。

  • 工具不再一次性全部交给主模型: VoxMind 维护较小的本地工具集合,当现有工具不足时,根据主模型当前的推理轨迹,由辅助智能体从更大的工具池检索候选工具,再动态加入主模型可用的工具上下文。

  • 工具检索与主模型生成并行执行: 主模型完成第一阶段推理后,辅助智能体开始检索缺失工具,同时主模型继续生成;检索结果随后再注入本地工具集合,用于后续推理,避免工具检索完全串行地增加等待时间。

  • 论文实验中任务完成率从 34.88% 提升至 74.57%: VoxMind 基于 470 小时 AgentChat 数据训练。论文报告,在其 spoken agent 评测设置下,任务完成率由基线的 34.88% 提升至 74.57%;这一结果属于论文实验,不等同于所有实际语音智能体场景中的线上表现。


https://github.com/MM-Speech/VoxMind



02 有亮点的产品


1、AI 教育团队 Aristotle 推出语音 AI 导师:边听学生讲思路边在白板教学,还会持续追踪知识掌握情况

Aristotle 推出面向 6–12 年级学生的语音 AI 导师,学生可以直接用语音讲解自己的解题思路,AI 一边听、一边追问,并在共享白板上画图、列公式和展示推导过程,而不是直接给出答案。系统还会跨会话记录学生已经掌握和仍然欠缺的知识点,用这些状态决定下一步应该教什么。


  • 语音成为主要教学入口: 学生可以直接说出自己的理解和疑问,Aristotle 会根据其推理过程继续追问、给提示,并支持随时打断,而不是只处理文本问题。

  • 把语音对话和共享白板结合: AI 可以在实时对话过程中绘制图示、函数图像、化学方程式等,让「讲解」与视觉推导同步发生。

  • 跨会话维护学生的知识状态: Aristotle 将课程拆成具体技能和前置知识,并持续记录学生的掌握情况;下一次辅导可以直接从其当前知识边界继续,而不是重新从一次性 Prompt 开始。

  • 每轮回答增加教学质量检查: 发送给学生前,每轮回复都会根据教学标准进行验证,并同时向家长提供会话总结与学习进展。


https://heyaristotle.com



2、冰岛声学模拟公司 Treble 获 1800 万美元融资:用物理声学仿真生成合成音频,测试语音 AI 与智能硬件

冰岛声学模拟公司 Treble 获得 1800 万美元 A 轮扩展融资,由 Paladin Capital Group 领投。公司正在把原本用于声学设计和虚拟原型的模拟能力进一步用于 Voice AI:通过物理声学仿真生成合成音频,并在不同噪声、混响和设备条件下测试语音模型与硬件。


  • 用仿真替代一部分真实录音数据: Treble 可生成带有不同房间、噪声、声源和设备条件的合成音频,用于语音增强、降噪和模型训练;其核心思路是通过物理声学模拟构造真实世界听觉条件,而不完全依赖采集或抓取录音。

  • 同一套平台同时测试模型和硬件: 除了评估语音 AI 在不同声学环境下的表现,Treble 还用于耳机、扬声器、智能眼镜等设备的虚拟原型,例如模拟设备位置变化后对语音识别和听觉体验的影响。

  • 开始向 Physical AI 扩展: Treble 表示接下来会加大在机器人、汽车和无人机等方向的投入,让这些系统在实际部署前先通过模拟环境测试基于声音的感知与交互能力。


此次融资后,Treble 累计融资已超过 4000 万美元;其客户包括 Amazon 和 Logitech。


https://www.treble.tech/


(@Techcrunch)



3、Cal AI 创始人推出无屏 AI 手环 Persona Band:把执行型智能体变成随身语音入口,可直接调用账号完成任务

Cal AI 创始人 Zach Yadegari 推出 Persona Band,一款与 Persona AI 助手配合使用的无屏手环。Persona 原本已经可以通过 iPhone 和 iMessage 调用邮件、日历、电话、购物等服务;Band 新增了一个始终随身的语音入口,让用户无需拿出手机,就能直接让智能体跨应用执行任务。


  • 手环不是独立 AI 系统,而是 Persona 智能体的语音入口: Persona 负责连接 Gmail、日历、Slack、Uber、DoorDash 等服务并执行任务,Band 则通过双麦克风、扬声器和 LED 光环提供随身语音交互。

  • 从「回答问题」进一步走向直接代用户操作: 官方称 Persona 可以打电话、预约服务、取消订阅、下单和支付,并把多个应用串联成完整任务流程;Band 的作用是让这些操作可以从一句语音指令直接触发。

  • 无屏设计,重 27 克: Persona Band 采用铝合金一体机身,配备双麦克风、扬声器和 LED 状态环,官方标称续航 3 天,并支持在没有手机时本地保存最多两天数据。


Persona Band 目前开放预售,价格为 179 美元,计划于 2026 年 12 月发货。


https://yourpersona.com/band



4、隐私技术公司 Deveillance 推出 AI 转写屏蔽工具 Kalypta:实时扰动通话音频,让人能听懂、ASR 难转写


Deveillance 推出 Kalypta,一款面向线上会议的 AI 转写屏蔽工具。它不是关闭会议或阻止录音机器人加入,而是在本地实时处理用户的通话音频,让正常的人类对话继续进行,同时降低 Whisper、NVIDIA Canary 等 ASR 系统对语音内容的识别准确率。


  • 在本地实时重塑音频,而不是屏蔽麦克风: Kalypta 在设备端运行一个小模型,对发送出去的语音进行实时处理;目标是让人仍能听清内容,但让自动转写系统难以恢复原话。

  • 针对主流 ASR 架构训练: 官方称模型训练时覆盖 Whisper、NVIDIA Canary 等转写架构,演示中开启 Kalypta 后,实时字幕会出现明显漏词和误识别。

  • 官方报告平均约 2/3 单词无法被正确转写: Deveillance 称其当前测试中,Kalypta 平均可以阻止约三分之二的词被准确识别,同时在人类语音可懂度指标上保持可理解;这一数字来自官方测试,尚不能等同于所有 ASR、语言和会议环境中的效果。


Kalypta 目前开放 Mac Beta 测试名单,正式可用范围和更多平台支持尚未公布。


https://www.deveillance.com/kalypta/beta


03 有态度的观点


1、Anthropic 嘴上说「减速」,身体却在加速:签下澳大利亚首份数据中心协议

图片


Anthropic CEO 达里奥·阿莫迪上周刚呼吁前沿 AI 公司放慢模型能力的提升速度,几天后,公司便在澳大利亚签下首份数据中心长期租赁协议。


Anthropic 将使用新加坡开发商 Zerra DC 在昆士兰州 Western Downs 规划的园区,继续为 Claude 扩充基础设施。


据财联社和澳大利亚广播公司报道,这座园区规划容量为 2.16 GW,最高用电量相当于约 150 万户澳大利亚家庭。Anthropic 计划从 2027 年开始使用该设施,主要承担模型推理,不用于训练;项目仍需通过地方规划和澳大利亚外国投资审查委员会审批。


阿莫迪所说的「减速」针对前沿模型能力提升,并不等于停止部署现有模型,因此两件事并非直接冲突。


但这份大体量协议仍然说明:当 AI 实验室开始讨论共同踩下刹车时,它们仍在提前锁定电力和数据中心容量,商业与算力基础设施的扩张没有放慢。


( @APPSO)


04 社区黑板报


招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)


1、 iRTE2026 定档啦!Voice Agent Builder 们,10 月北京集合~


今年从对话式 AI 一路聊到实时智能,现场有 15+ 论坛、100+ 场深度演讲,汇聚 150+ 全球技术领袖和行业专家,全双工+交互式模型、实时互动世界模型、AI 硬件、AI Coding 工具等方向都会集中开聊。


贾扬清也将返场 iRTE 大会,带来对 AI 行业前沿趋势和技术演进的最新观察~


目前大会门票限时免费开放!


想来现场听技术、认识同行的开发者,可以先把票薅上


时间:10 月 23–24 日


地点:北京悠唐皇冠假日酒店


限免结束后将恢复收费,建议先报名占位


定档!从对话式 AI 到实时智能,Voice Agent Builder 的年度春晚 iRTE2026 来了丨 10 月 23-24 日,北京见!

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

图片

作者提示: 个人观点,仅供参考

注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    关键词
    // 相关帖子
    Coming soon...
    • 0
    实时 AI 转写屏蔽工具 Kalypta,人听得懂、ASR 转不出丨日报RTRTE_Dev_Comm