LangSmith 上线语音智能体追踪和观测;OpenAI 桌面端集成 GPT-Live,支持语音控制电脑与多智能体协同丨日报

图片


开发者朋友们大家好:


这里是「RTE 开发者日报」,每天和大家一起看新闻、聊八卦。我们的社区编辑团队会整理分享 RTE(Real-Time Engagement) 领域内「有话题的技术」、「有亮点的产品」、「有思考的文章」、「有态度的观点」、「有看点的活动」,但内容仅代表编辑的个人观点,欢迎大家留言、跟帖、讨论。

本期编辑:@三水、@鲍勃


01 有话题的技术


1、OpenAI 发布桌面端 ChatGPT Voice:集成 GPT-Live,支持语音控制电脑与多智能体协同

OpenAI 宣布 ChatGPT Voice 今日起在全球桌面端应用上线,覆盖 macOS 与 Windows。该功能由 GPT-Live 驱动,支持用户在桌面端通过语音同时与模型对话、监听环境指令,并协调 ChatGPT Work 和 Codex 中运行的多个智能体,实现用语音直接控制电脑与分发任务。


  • 桌面端 ChatGPT Voice 由 GPT-Live 提供底层能力:模型可同时说话、倾听并在应用内协调操作,意味着语音识别、理解与执行不再是串行流程,而是同一上下文内的并行交互。

  • 语音可直接调度多智能体工作负载:用户可用语音指挥在 ChatGPT Work 或 Codex 中运行的多个智能体,将语音从「一问一答」扩展为「任务分发入口」。

  • 桌面端成为语音 Agent 的常驻控制层:语音交互不再局限于移动端或浏览器,而是直接嵌入 macOS/Windows 桌面工作流。

  • 移动端支持:用户可以通过 iOS 应用在 Codex 中使用 ChatGPT Voice,并配合远程访问功能。Android 版本即将推出。


( @OpenAI@X)



2、Anthropic 升级 Claude 语音模式:支持 Opus/Sonnet 旗舰模型与对话中工具调用

Anthropic 已升级 Claude 语音模式,使其可调用聊天中更多模型,并在语音对话过程中访问用户已连接的工具。更新直接扩展了语音交互的模型、工具和语言覆盖范围。


  • 语音对话支持 Opus 与 Sonnet:语音模式可使用 Claude 聊天中的更多模型,官方明确列出 Opus 和 Sonnet。

  • 支持对话中调用已连接工具:用户无需退出当前语音对话,即可让 Claude 访问已连接的外部工具。

  • 邮件与日历可通过语音访问:官方将电子邮件和日历列为首批工具调用示例。


图片


( @Claude@X)



3、n4n AI 发布打断延迟评估方法论:覆盖全链路全双工语音 Agent 测量指标

图片


n4n 工程团队发布关于实时语音智能体打断延迟的测量指南,指出当前业界普遍用 ASR 首包延迟或 LLM 推理耗时来代表打断性能,但这种做法会严重低估用户实际感知到的「智能体仍在说话」的等待时间。文章主张将打断延迟定义为从用户声学起点到设备扬声器真正静音的端到端耗时,并给出了可落地的仪器化方案。


  • 打断延迟 ≠ 模型首包延迟:完整链路至少包括麦克风采集缓冲、VAD、ASR 端点/稳定等待、轮询决策、新响应合成、TTS 取消、网络往返和客户端播放缓冲清空,单独测量任一环节都会遗漏主导项。

  • 生产环境常见延迟远高于组件标称值:VAD 15 ms + ASR 200 ms + TTS 80 ms 的简单相加不可信;实际系统中,客户端缓冲深度、VAD 保守策略、TTS 队列清空和 ASR 稳定等待常使总延迟突破 1 秒。

  • 应在客户端音频 sink 采集关键事件:建议在 WebSocket 中同时记录 user_speech_start 和 agent_audio_stop,使用单调时钟计算差值;agent_audio_stop 必须位于用户设备扬声器侧,不能取服务器发送 socket 的时间。

  • VAD 调优是最快的杠杆:以 webrtcvad 为例,推荐 mode 2 或 3 配合约 40 ms 确认窗口,但前提是具备可靠的声学回声消除(AEC);否则 aggressive VAD 会把智能体自己的语音误判为用户插话。

  • TTS 取消与缓冲清空缺一不可:除向 TTS 服务发送 tts_cancel 外,还需显式清空客户端已排队但未播放的 PCM 样本;若供应商不支持取消,只能被动等待缓冲自然耗尽。


https://n4n.ai/blog/measuring-interruption-latency-in-real-time-voice-agents/


( @n4n.ai Blog)



4、LangSmith 上线语音智能体追踪和观测能力,覆盖多类主流框架


LangChain 在 LangSmith 中新增针对语音智能体的 Python 追踪集成,覆盖多类主流框架。通过几行代码接入后,开发者可在同一平台中复用文本智能体的审阅、评估与协作流程,同时获得语音交互特有的音频、VAD、打断与延迟视图。


  • 首批支持集成:覆盖 OpenAI Realtime、Google ADK 的 Gemini Live 等。

  • 同时追踪两类语音架构:支持由 STT、文本智能体和 TTS 串联的三段式架构,也支持通过双向 WebSocket 传输事件的原生语音到语音架构。

  • 单一追踪树聚合完整交互链路:将用户音频、智能体动作和语音响应关联到同一棵追踪树,保留高层用户轮次与智能体轮次。

  • 分阶段记录延迟与推理元数据:分别捕获 STT 和 TTS 的输入、输出、延迟及元数据,并记录语音管线各阶段耗时。

  • 覆盖实时语音与工具事件:可记录完整会话音频、语音活动检测、中断、重叠语音、模型输入输出,以及工具调用的参数、结果和错误。


图片


https://www.langchain.com/blog/trace-voice-agents-in-langsmith


( @LangChain Blog)



02 有亮点的产品


1、Halliday 发布 AI 智能眼镜 G2:无摄像头设计,主打会议实时 Agent 交互

图片


Halliday 发布 G2 智能眼镜,核心卖点是把实时会议 Agent 塞进无摄像头眼镜。通过 Meeting Flow 功能,眼镜在对话进行时直接通过双目波导显示实时字幕、翻译、上下文资料和会议状态提示,并在会后生成结构化摘要。产品已开放 10 美元订金预订,可抵扣 100 美元,预计 2026 年 9 月发货,零售价 599 美元。


  • 无摄像头设计,主攻隐私敏感场景:去掉摄像头有助于在会议室、安全办公区等环境降低被拒之门外或引发隐私担忧的风险,同时减轻重量、延长续航。

  • Meeting Flow 提供实时会议干预,而非仅会后总结:可识别跑题、标记模糊决策、发现缺少负责人或截止日期的任务、维护开放事项清单,并在视野中推送上下文资料与可信度评级。

  • 双目波导 + 双 micro-LED 投影仪:单眼分辨率 600×300,最高亮度 1600 nits;四麦克风阵列支持最远 2 米拾音,典型续航超过 12 小时,整机重量低于 50 克。

  • 支持 45 种以上语言实时翻译:同时提供通知、通话、音乐控制、仪表板卡片、内置 AI 助手和提词器式模式。

  • 会后自动生成结构化摘要:包括已确认决策、分配任务、未决事项和完整转写,2026 年内还将通过更新增强对进行中项目、任务和历史对话的上下文感知。


( @Android Central)



2、语音情报平台 Cast Insights 完成 450 万美元 pre-seed 融资:目标构建覆盖电视、广播、播客的实时 ephemeral speech 情报层

图片


Cast Insights 宣布完成 450 万美元 pre-seed 融资,由 Abstract Ventures 领投,HF0、Village Global、Max Ventures 等跟投。该公司从 HF0 Residency 项目孵化,定位为面向机构决策者的实时竞争情报层,通过 AI 持续索引电视、广播、播客等渠道中的语音情报数据库,帮助客户在主流共识形成前捕捉市场趋势、政策变化、地缘政治转向和风险信号。


  • 覆盖 20 国、10 种语言,已处理 230 万小时语音:融资后计划扩展至 2000 万小时历史数据,并每天监控 50 万小时直播内容,目标建成全球最大的建立覆盖电视、广播和播客内容的全球语音情报数据库。

  • 30 秒内实时告警 + 说话人级追踪 + 叙事曲线:平台摄取音频后转写,识别说话人,追踪叙事形成与演变路径,并实时映射情绪变化。

  • 霍尔木兹海峡案例验证情报价值:冲突爆发前几乎零提及,爆发后日均提及升至约 400 次,停火破裂时达峰值 2946 次;积极情绪从 7.7% 跌至 3.3%,同时捕捉到战争风险保险费飙升与美国 20% 过境费政策 24 小时内反转的叙事变化。


图片


  • 面向机构决策而非消费者:目标客户为需要理解市场、政策与地缘风险的机构决策者,强调在「共识形成前」识别信号收敛与分歧。


( @SiliconANGLE)



03 有态度的观点


1、梁文锋:DeepSeek 不追求成为下一个字节或腾讯,克制、开源与低成本是实现 AGI 的核心策略


DeepSeek 创始人梁文锋在一场长达 4 小时的投资人会议中谈及公司路线。他把去年解决的核心问题概括为思维链,今年的重点是 Agent;Agent 之后,模型需要解决持续学习问题。目前模型必须依赖完整上下文执行任务,无法像人一样持续积累经验,这是其替代更多工作的主要限制。


梁文锋称,DeepSeek 不追求成为「下一个字节」或「下一个腾讯」,也不会把主要资源投入 C 端流量、企业销售、3D 生成、视频生成和世界模型。团队将集中开发通用 Agent,金融、医疗等垂直 Agent 的优先级较低。


产品只是通往 AGI 路上的阶段性成果。


他把低成本视为模型架构优化的结果:同样算力下,更高效率可以支持更大规模训练。DeepSeek 曾在需求高峰期提高价格,随后把价格降至原来的四分之一。开源模型与内部版本保持一致,公司接受让渡部分短期利益,以扩大生态并提高组织凝聚力。


( @APPSO)



04 社区黑板报


招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)



1、活动推荐|人生无限公司 2.0 · UP2026 北京站 暨超越之路社区成立两周年庆典

这不仅是一场行业交流会,更是超越之路两周年的庆典。


两年,一人+协作伙伴全职运营,我们验证了"超级个体 OPC"不是一句口号。


这一次,我们想和你一起,把这条路走得更远。


我们期待与更多志同道合的伙伴在这里相聚,


共同探索 AI 时代超级个体与超级团队的超越之路。


图片


主题:AI 时代的超级个体与超级团队


时间:7 月 26 日 周日 9:30-17:30 地点:北京·海淀(报名审核通过后可见)


嘉宾阵容:20+一线嘉宾已就位,更多神秘嘉宾,正在赶来的路上...


活动形式:主题分享 + 圆桌论坛 + 开放麦


更多活动详情可参考:

UP2026 人生无限公司 2.0 | 0726 我们北京见

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。


图片

作者提示: 个人观点,仅供参考

注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    关键词
    // 相关帖子
    Coming soon...
    • 0
    LangSmith 上线语音智能体追踪和观测;OpenAI 桌面端集成 GPT-Live,支持语音控制电脑与多智能体协同丨日报RTRTE_Dev_Comm