PLAUD 发布 AI 耳机 Plaud One:充电盒能听能说,从记录走向执行丨日报

本期编辑:@三水、@鲍勃


01 有话题的技术

1、清华、南洋理工等开源实时语音智能体记忆系统 VoiceMem:提出 Dual-Brain「双脑」架构,记忆检索仅需 134ms

清华大学、南洋理工大学、新加坡国立大学、香港中文大学与 Open Interaction Lab 联合发布 VoiceMem v0.0.1,一套专门为实时语音智能体设计的开源记忆系统。它试图解决现有 Agent Memory 直接接入 Voice Agent 时的两个核心问题:检索太慢、一次返回的记忆太多;同时进一步把用户的事实信息与情绪、人格和关系记忆分开长期维护。


  • 「双脑」分别管理事实和对人的理解: 左侧记忆系统负责用户说过什么、人物和事件等事实信息,并用「类别—实体」两层结构提高少量检索结果的信息密度;右侧则长期积累情绪、人格和用户对不同人物或事物的态度,再通过关联关系与事实记忆联合检索。

  • 在用户还没说完时就开始找记忆: VoiceMem 将转写、实体匹配和记忆检索拆到整段语音交互过程中执行,当静音达到约 200ms 时便开始准备查询,最终记忆检索本身只需 134ms,可以塞进常见 VAD 等待用户停说的时间窗口,而不用在用户说完后再额外等待 1–2 秒。

  • 只给语音模型少量高密度记忆: 在 LoCoMo 评测中,VoiceMem 使用 Top-5 记忆达到 91.2%,Mem0 为 61.68%;项目给出的单次检索上下文约为 430 个记忆 Token,Mem0 为 6,956 个,让上下文窗口更紧张的实时语音模型也能使用长期记忆。

  • 从文本记忆扩展到真实音频记忆: 系统不仅保存转写文本,还可以记录说话人声纹、情绪、多人对话、环境声音和音乐等音频信息;官方同时开放 ChatMem-400K 训练数据、ChatMem-Bench 评测集,以及基于 Qwen2.5-Omni、Qwen3-Omni、Step-Audio2-Mini 的记忆增强模型。

  • 记忆层与 Voice Agent 本身解耦: 开发者可以继续使用自己的语音模型,只将 VoiceMem 接在「麦克风 → 实时记忆检索 → 模型回复」之间;底层记忆引擎也可以替换,目前默认使用 Mem0,方便后续更换新的检索和记忆方案。


https://xzf-thu.github.io/VoiceMem



2、Tavus 发布实时对话理解模型 Sparrow-2:不再只判断「用户说完没有」,而是持续决定该听、等、说还是继续说


Tavus 发布 Sparrow-2,一款面向实时 Voice Agent 的对话理解模型。相比 Sparrow-1 主要解决「什么时候轮到 AI 说话」,Sparrow-2 把目标进一步扩展为持续理解整个对话状态和周围声场:同时考虑语义、语调、说话人、停顿、附和、打断和背景声音,再决定 Agent 下一步应该继续听、等待、开口,还是保持说话。


  • 从 Endpoint Detection 转向持续对话状态建模: Sparrow-2 不再依赖固定静音阈值,也不只看最后几百毫秒的音频。模型会持续判断用户是在思考、犹豫、附和、真正打断,还是已经完成表达;官方称系统中没有使用 silence timer。

  • 不先把背景声消掉,而是先理解它有没有意义: 背景对话、环境噪声、听不清的语音都会保留下来参与判断。比如 Agent 可以区分旁边有人聊天和真正有人在对它说话,也能在音频过于模糊时选择让用户重复,而不是基于错误转写继续回答。

  • 10ms 一次更新对话状态,推理速度比 Sparrow-1 提升 4 倍: Sparrow-2 以 10ms 音频帧运行,每秒最多更新 100 次状态判断;处理 80ms 音频约需 7ms,Sparrow-1 约为 30ms。它还能允许用户在一句话中停顿 6–8 秒而不急着抢话。

  • 在真实视频通话评测中,错误率降至 2.1%: Tavus 在 575 个真实对话事件上统计「错误插话或用户说完却没有响应」,Sparrow-2 的失败率为 2.1%;对于 1 秒以上的思考停顿,97% 不会被错误打断,同时没有漏掉已经结束的对话轮次。

  • 已经进入正式可用阶段: Sparrow-2 目前已在 Tavus PALs、API 和平台中 GA,并开始用于其企业级实时对话产品。


https://www.tavus.io/blog/sparrow-2



3、ReWorld 提出实时交互世界长时记忆框架:让世界模型在持续交互中记住过去发生过什么

图片


ReWorld 面向实时交互世界中的「长期遗忘」问题:现有模型可以根据用户动作持续生成后续画面,但随着交互时间拉长,早期出现的人物、物体、空间关系和事件容易逐渐丢失。ReWorld 为实时世界生成加入长时记忆机制,让模型在继续响应当前操作的同时,也能重新调用更早的历史状态,维持跨长时间交互的一致性。


  • 把历史世界状态从上下文窗口中独立出来: 不再要求生成模型始终保留完整视频历史,而是持续提取值得长期保存的视觉与状态信息,并在后续需要时重新检索。

  • 短期交互与长期记忆分开处理: 最近的动作和画面负责保证实时响应,更早的重要事件进入长期记忆,使模型不必在「反应快」和「记得久」之间二选一。

  • 重点解决长时间交互中的一致性: 当用户离开某一区域后再次返回,或者早期改变过某个对象状态时,系统需要继续保持此前发生过的变化,而不是随着生成时间增加逐渐把世界「重置」。

  • 把世界模型从连续视频生成推进到「有历史的环境」: ReWorld 关注的不只是单段画面能生成多久,而是一个交互世界能否持续积累状态和事件,为更长时间运行的游戏、空间 Agent 和实时世界模型提供记忆层。


https://zhifeichen097.github.io/ReWorld/



4、RunAnywhere 发布 Qualcomm NPU 端侧推理运行时 QHexRT:STT、LLM、TTS 可在手机上跑完完整 Voice Agent 链路

RunAnywhere 将自研 Qualcomm Hexagon NPU 推理运行时 QHexRT 集成进 runanywhere-sdks,把原本彼此独立的 STT、LLM 和 TTS 模型统一到同一套端侧 Voice Agent 开发框架里。重点不是单独证明某个模型能在手机运行,而是让整条「听懂—思考—说话」链路都能利用 Snapdragon 手机上的 NPU,并保持本地、离线运行。


  • QHexRT 统一支持语音和语言模型上 NPU: 运行时可在 Hexagon v75、v79、v81 上执行 LLM、VLM、STT、TTS、Embedding 等任务,应用仍通过统一的 loadModelgenerate 等接口调用,由 SDK 自动选择合适的硬件后端。

  • 完整 Voice Agent 流程已被封装进 SDK: RunAnywhere 提供 VAD → STT → LLM → TTS 一体化语音管线,开发者不再需要分别拼接 Whisper、LLM Runtime 和 TTS 引擎;同一 SDK 还覆盖 Kotlin、Flutter、React Native 等移动端开发栈。

  • Galaxy S25 上已给出分阶段性能数据: 在 Snapdragon 8 Elite 的 Hexagon v79 上,Whisper Base ASR 可达到约 5× 实时速度,MeloTTS-EN 约 4.5× 实时速度;LLM 方面,LFM2.5-230M 解码速度约 164 tok/s,Qwen3-0.6B 约 33 tok/s。

  • 支持的端侧模型不只限于小模型: 当前 QHexRT 已覆盖 Qwen3.5、Llama 3.2、DeepSeek-R1-Distill-Qwen、Whisper、Moonshine、MeloTTS、Magpie-TTS 等模型,并支持部分 MoE、混合注意力和 1-bit 模型。


https://github.com/RunanywhereAI/runanywhere-sdks


(@RunAnywhereAI)



02 有亮点的产品


1、PLAUD 发布 AI 耳机 Plaud One:充电盒能听也能说,从 AI 录音走向 Voice-to-Action

PLAUD 发布 Plaud One Explorer Edition,将此前 Note、NotePin 的录音与总结能力扩展到无线耳机形态。PLAUD 创始人兼 CEO 许高将其定位为一个「随时可以调用 AI,同时又足够自然、符合日常社交习惯的可穿戴交互界面」。产品也由此从记录对话进一步延伸到利用对话上下文执行任务。


图片


从「记录」走向「执行」: Plaud One 不再只围绕录音、转写和总结设计。Plaud 智能体可利用此前会议和对话内容生成跟进邮件、文档或演示稿,并计划连接 Gmail、Google Calendar、Notion、Slack 等服务。


图片


  • 充电盒成为独立 AI 设备: Plaud One 的充电盒集成 4 个麦克风,并支持 4G LTE 和 eSIM,可脱离手机进行会议录音和部分 AI 交互。这让产品不只是普通蓝牙耳机增加录音功能,而是增加了一个可以放在桌面使用的独立语音入口。

  • 耳机成为新的 AI 交互界面: 许高认为,耳机本身已经是用户熟悉、能够长时间佩戴的设备,因此比新增一种陌生的 AI 硬件形态更容易成为持续调用 AI 的入口。相比需要额外佩戴或拿出的 NotePin、Plaud Note,耳机也天然覆盖通话、线上会议和移动中的面对面对话。

  • 智能体能力仍处于早期阶段: Plaud Intelligence 目前仍为 beta,第三方服务连接和部分智能体功能不会在首发时全部上线,因此 Plaud One 首批产品仍带有明显的产品验证性质。


Plaud One Explorer Edition 售价 249.99 美元,首批全球限量 2,000 台,已开放预订,计划于 2026 年第四季度开始发货。


https://www.plaud.ai/products/plaud-one


(@TechCrunch、@The Verge)



2、Hugging Face × Pollen Robotics 推出 399 美元开源双足机器人 Microduck:完整开放强化学习训练栈,可自行训练新动作

Hugging Face 旗下 Pollen Robotics 推出 Microduck,一款高 25cm、重约 800g 的开源双足机器人。与预设动作玩具不同,Microduck 将机器人 SDK、MuJoCo 仿真环境和完整强化学习训练栈全部开放,开发者可以在模拟环境中训练新的运动策略,再直接部署到真实机器人上,把强化学习机器人的开发门槛降到 399 美元。


  • 机器人动作可以自己重新训练: Microduck 的行走、坐下起身、踢球、拾取物体、轮滑和跌倒后自主站起等行为都由强化学习策略驱动,开发者可以在本地机器或 Hugging Face Jobs 中重新训练、部署和分享新的动作策略。

  • 强调从仿真直接迁移到真实机器人: 官方提供与实体 Microduck 对应的模拟版本,开发流程是「仿真训练 → 真机部署 → 调整仿真 → 再训练」,降低在真实硬件上反复采集和试错的成本。

  • 完整软件栈开源,而不只是提供控制 API: SDK、物理仿真和完整 RL 训练代码均采用 Apache 2.0 开源,机器人出厂自带的 7 个动作策略也全部可以查看、修改和重新训练。

  • 硬件为强化学习实验预留完整感知与控制能力: Microduck 配备 15 个电机、摄像头、LiDAR 和两颗 IMU,运动策略以 50Hz 在机器人端运行,可用于进一步开发视觉感知与运动控制任务。


Microduck 已于 8 月 27 日开放预订,首发价格 399 美元,计划在 2026 年圣诞节前发货。


https://pollen-robotics.com/microduck/



3、Instinct 提出个人 Agent:不做新界面,直接用短信或电话控制手机和电脑完成现实任务

图片


Instinct 创始人 Noah Shinn 公布同名个人 Agent,产品最特别的地方不是再做一个聊天窗口,而是把短信和电话本身作为 AI 入口。Instinct 被训练成像人一样使用手机和电脑,并连接邮件、消息、屏幕、音频、位置等个人上下文,让用户直接说「要做什么」,由 Agent 在后台完成跨应用操作。


  • 「没有新界面」是核心产品思路: 用户可以直接给 Instinct 发短信或打电话,不需要学习新的 App 操作方式;Agent 还能主动给用户打电话、发消息,继续跟进之前没有完成的事情。

  • 目标是完成完整生活任务,而不是只给建议: 早期用户已经用它规划跨州公路旅行、购买每周杂货和演唱会门票、取消订阅,甚至协助筹备婚礼。

  • Agent 可以跨手机和电脑执行操作: Instinct 会调用用户的邮件、消息、屏幕和位置等信息,并像人一样在设备上完成预订、购买、联系商家等多步骤任务。

  • 目前仍处于邀请制测试: Instinct 正在扩充算力,现阶段仅向私人测试用户开放;新用户可以加入候补名单,或通过现有成员邀请进入。


https://instinct.co/


(@noahrshinn)



4、GLM-5.3-Flash 操控 Blender 搭建 3D 梦幻厨房:不是生成视频,而是直接构建可编辑场景



5、Kapinote 推出本地优先 AI 会议助手:Qwen3 ASR 本地转写,会议上下文可直接交给 Codex、Claude Code


图片


开发者 Guangzheng Li 推出 macOS AI 会议助手 Kapinote,重点不是再做一个「录音—总结」工具,而是把会议内容变成 Agent 可以持续调用的工作上下文。语音转写可完全在本地通过 Qwen3 ASR 或 Apple Speech 完成,会议数据保存在本机 SQLite 中;录制结束后既可以用内置 AI 总结,也可以直接把会议内容交给 Codex、Claude Code 等外部 Agent,继续写邮件、提取行动项或完成后续工作。


  • 会议转写可以完全留在本机: 中文及中英混合会议可使用本地 Qwen3 ASR,英文或单一语言场景可使用 Apple Speech;同时支持自定义词汇,用于修正人名和业务专有名词。

  • 把会议记录直接接进 Agent 工作流: Kapinote 提供 kapinote-cli 和 Agent Skill,Codex、Claude Code、Cursor 等可以直接查询和修改本地会议数据,例如询问「上周会议有哪些行动项」,而不需要用户手动复制转写内容。

  • 不强制开发者重新配置 API Key: 除了 Ollama 和云端模型,Kapinote 支持 BYOA(Bring Your Own Agent),可复用电脑上已经登录的 Codex、Claude Code 等工具,把会议助手从单独的 AI 产品变成现有 Agent 工作流的一块上下文来源。

  • 应用本身目前只支持 macOS: Kapinote 使用 Rust + Tauri 构建,目前免费使用。


https://guangzhengli.com/blog/zh/kapinote


03 有态度的观点


1、黄仁勋:AGI 可能已经实现,但里程碑本身已失去意义

图片


在英伟达最新财报电话会上,分析师问及 OpenAI 希望今年底达到 AGI,以及递归式自我改进会如何影响算力需求。黄仁勋回答:「在很多方面、对很多任务而言,我们可以说已经实现 AGI。」


他的判断从正在运行的智能体出发。黄仁勋称,多数 AI 的使用方式在最近一个月已经跨过分界点,从人类逐次提示转向智能体自主执行。未来,一家公司可能让成倍于员工数量的智能体持续运行、彼此协作;智能体每次完成任务后反思表现并更新 skill 文件,下一次运行便会有所改进。他把这种机制称为一种较松散、粗粒度的自我改进。


黄仁勋随即说,继续划分这些里程碑「在此刻已经有些没有意义」。他给出的判断标准有三个:AI 已能完成有生产力、有实际用途的工作;模型推理产生的 Token 已经可以带来利润;如果获得更多算力,AI 服务还能生成更多有利润的 Token。


这套说法没有宣称 AI 已在所有能力上达到统一定义中的通用智能。黄仁勋把 AGI 从一条等待跨越的技术终点,改写成一组已经进入企业经营和工作流程的能力:智能体能否持续干活、改进任务表现,并把算力转化为实际产出。


( @APPSO)


04 社区黑板报


招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)



1、 上海开发者活动推荐|Data for AI Meetup,一场围绕开源 AI 数据基础设施的技术聚会


做 Agent、RAG、Data Agent、企业 AI 数据平台 的朋友,可以关注下 9 月 5 日上海这场 Data for AI Meetup


当 Agent 真正开始接企业数据、执行复杂任务后,问题往往不再只是「模型够不够强」,而是:它能不能理解企业指标口径、取对数据、检索到真正有用的 Context,以及稳定连接背后的数据基础设施。


这次现场会把这条链路拆开聊透,嘉宾来自 Datastrato、腾讯、Zilliz / Milvus、Apache Doris、Red Hat 等,议题覆盖 开放语义层、Data Agent 取数工程、Agent Context Retrieval、Agentic Data Infrastructure,以及企业 AI 全栈落地。不是泛聊概念,更多是来自真实项目的一线工程实践。


尤其适合正在关注 Agent Memory、RAG、向量数据库、语义层、元数据治理、AI Infra 的开发者和技术负责人。


 时间: 9 月 5 日(周六)13:30–17:30 

 地点: 上海前滩中心 19 层 · 亚马逊云科技 Builder Loft 

 活动免费,限 100 人,需提前报名审核

 报名截止:9 月 1 日(周二) 24:00


图片


Data Agent、语义层与元数据,一场围绕开源 AI 数据基础设施的技术聚会 | Data for AI Meetup 上海见


2、今日 meme 图

图片


( @rdesh26@X)

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示:个人观点,仅供参考

注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    关键词
    // 相关帖子
    Coming soon...
    • 0
    PLAUD 发布 AI 耳机 Plaud One:充电盒能听能说,从记录走向执行丨日报RTRTE_Dev_Comm