OpenAI 揭秘 GPT-Live 全双工流式架构,WARP 显著降低 WebRTC 启动延迟丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、OpenAI 披露 GPT-Live 实时语音架构:全双工流式推理,WARP 将 WebRTC 启动从 6 个网络往返降至 1 个
OpenAI 发布 GPT-Live 工程解析,首次公开实时语音系统的核心架构设计。GPT-Live 不再依赖传统轮次检测器判断用户何时结束讲话,而是让全双工语音模型持续收发音频,同时将工具调用、深度推理、持久化等长耗时任务移出实时媒体路径,保持语音交互链路稳定。
取消传统轮次检测器:模型持续处理音频流并自主判断交互状态,传统语音系统通常依赖静音检测或轮次检测判断「用户是否说完」;GPT-Live 改为持续接收音频输入,由模型实时判断何时继续监听、开始回应、暂停或打断。
实时媒体路径与任务执行路径解耦:工具调用不阻塞语音响应,系统将实时语音处理与搜索、工具调用、深度推理、持久化等复杂任务拆分;实时模型负责维持低延迟交互,复杂任务交由后台流程执行。
状态管理从轮次切换转向持续上下文维护:GPT-Live 通过持续音频流和上下文状态管理,让模型能够处理用户停顿、修改想法、中途打断等非结构化对话行为,减少传统语音助手依赖明确「说完」信号的问题。
WARP 将 WebRTC 启动从 6 个网络往返降至 1 个:协议通过 ICE 承载 DTLS 握手、采用 DTLS 1.3、预协商 SCTP 和数据通道完成压缩;配合提前协商 SDP 的 Instant Connect,客户端可用单个 UDP 数据包启动会话。WARP 已获 libwebrtc 和 Pion 支持。
Blog:
https://openai.com/index/continuous-voice-interaction-with-gpt-live/
WARP 提议草案:
https://datatracker.ietf.org/doc/draft-uberti-tsvwg-warp/
(@OpenAI)
2、微软内测全双工实时语音模型 MAI Realtime:支持对话中多语言无缝切换与低延迟打断
微软旗下 superintelligence 团队在 MAI Playground 早期测试版中悄然上线首款原生双工实时语音模型 MAI Realtime。该模型采用双向全双工架构,可同时接收与输出语音信号,旨在全面替代 Copilot 及 Azure 实时语音接口中对 OpenAI GPT-Realtime 的依赖。
全双工双向交互架构:支持监听与表达同时进行,实现自然流畅的对话打断与低响应延迟。模型定位专注于语音对话交互,不支持吟唱或非语音音效生成。
双重轮换与端点检测机制:提供基于内联控制令牌驱动的 MAI-Ears 端点检测(Switchboard 模式),以及结合静音检测与 Whisper 语义端点检测的确定性配置模式。
多语言动态无缝切换:支持手动固定语言或自动识别,模型可在单次对话中跨语言无缝切换,且不会丢失上下文关联。
集成调试面板与全新双音色:内测版上线了自然度显著高于现有 Copilot 语音模式的 Victoria 与 Grant 两个音色,调试面板可实时暴露延迟数据、推理步骤及模型思考过程。
目前该模型仅在 MAI Playground 面向少数合作伙伴开放非公开测试,尚未公布面向开发者 API 或消费端的正式上线时间表。
https://www.testingcatalog.com/exclusive-microsoft-tests-new-mai-realtime-voice-model/
(@TestingCatalog)
3、欧盟新规生效:Voice Agent 必须披露 AI 身份,合成语音需支持可识别标记
欧盟《人工智能法案》(EU AI Act)Article 50 透明度义务正式生效,面向公众提供服务的 AI 系统需要明确告知用户其正在与 AI 交互。对于 Voice Agent 场景,企业需要在语音交互开始阶段披露 AI 身份,并针对 AI 生成音频等合成内容满足透明度要求。
Voice Agent 必须主动声明 AI 身份:语音交互新增透明披露要求,面向用户提供电话客服、语音助手等交互式 AI 系统时,部署方需要让用户知晓对方为 AI,而不能模拟真人身份进行交流。
AI 生成音频需要具备可识别标记:推动语音合成链路增加来源标识,Article 50 对 AI 生成或修改内容提出透明度要求,包含音频、图像、视频等合成内容;企业需要考虑在 TTS 输出、数字人语音等链路中加入机器可识别标记或来源信息。
高风险 AI 规则延期,但语音透明义务按期执行:Digital Omnibus 调整了部分高风险 AI 系统合规时间表,但 Article 50 透明度要求并未同步延期,Voice AI 企业仍需优先完成身份披露、日志记录和输出标记等合规改造。
Voice Agent 架构需要增加合规层:Disclosure、Audit Log 成为基础组件,企业部署语音智能体时,需要在实时语音链路中加入 AI 身份提示、交互记录和合成音频标记能力,使透明度要求成为运行时能力,而非上线后的人工流程。
影响从模型提供商扩展至应用部署方:采购第三方 Voice AI 仍需承担披露责任,即使企业使用外部语音模型或智能体平台,只要面向欧盟用户提供 AI 交互服务,部署方仍需要确认系统满足 Article 50 的透明度要求。
https://www.consilium.europa.eu/en/press/press-releases/2026/05/07/artificial-intelligence-council-and-parliament-agree-to-simplify-and-streamline-rules/
(@Council of the EU)
4、Moondream 发布 Photon 2.0 推理引擎:面向物理 AI 部署,支持多款视觉语言模型,推理效率提升 2.3 倍
Moondream 发布 Photon 2.0 推理引擎,定位为面向物理 AI 场景的高性能多模态模型推理基础设施。该引擎支持 Moondream、Qwen、Gemma 等视觉语言模型,并通过自定义 CUDA / Metal 内核、自动批处理和 KV 缓存优化,在官方测试中相比 vLLM 和 SGLang 实现最高 2.3 倍处理效率提升。
面向物理 AI 推理场景优化:支持视觉语言模型本地部署:Photon 2.0 针对机器人、智能摄像头等需要低延迟视觉理解的场景设计,可运行 Moondream 等视觉语言模型,并计划扩展支持更多模型。
推理效率提升 2.3 倍:优化吞吐与响应延迟:Moondream 表示 Photon 2.0 相比 vLLM 和 SGLang 在目标测试环境下实现最高 2.3 倍处理效率提升,重点优化实时视觉任务中的推理性能。
自定义 CUDA 与 Metal 内核:覆盖 GPU 与 Apple Silicon 推理:Photon 集成针对 NVIDIA GPU 的 CUDA 内核以及 Apple Silicon 的 Metal 内核,可在 Linux、Windows GPU 环境和 Mac M 系列芯片上运行。
自动批处理与 Paged KV Cache:提升多请求推理效率:引擎内置自动批处理、Paged KV 缓存和 Prefix Cache 机制,用于减少重复计算,提高多用户、多设备视觉交互场景下的吞吐能力。
支持本地与云端部署:提供统一推理接口:Photon 已集成至 Moondream Python 客户端,支持本地 GPU、Apple Silicon 和云端运行方式,开发者可通过统一接口调用视觉理解、检测、定位和分割能力。
https://moondream.ai/blog/photon-2-launch
(@Moondream)
02 有亮点的产品
1、DPVR 发布面向运动场景的 AI 智能眼镜 R1:13MP 第一视角拍摄,支持语音 AI 与视觉识别,8 月登陆美国市场
DPVR 扩展 AI 智能眼镜产品线,推出面向运动场景的 R1 模型,预计于 2026 年 8 月在美国 Amazon 上线。R1 集成摄像头、语音 AI 和视觉识别能力,针对跑步、骑行和户外活动设计,支持第一视角记录与免手操作交互。
13MP 摄像头 + ISP 防抖:面向运动场景第一视角记录:DPVR R1 配备 13MP 摄像头,通过图像信号处理器(ISP)进行防抖优化,减少运动过程中视频抖动,用于跑步、骑行等动态环境下的内容采集。
语音 AI 与视觉识别融合:支持环境理解与免手交互:R1 支持语音 AI 对话和视觉识别能力,用户可通过语音获取信息、拍摄照片和视频,无需频繁操作手机。
运动型智能眼镜设计:支持近视镜片适配与长时间佩戴:R1 面向跑步者、骑行者和户外用户设计,支持处方镜片适配,并提供约 15 天待机时间。
软件生态扩展:SDK 支持企业与开发者定制:DPVR 为部分 AI 眼镜产品提供 SDK,支持企业开发数据同步、用户界面、应用集成等能力,覆盖教育、旅游、现场作业和内容生产等场景。
后续支持直播功能:持续扩展实时内容能力:DPVR 表示 R1 计划通过未来软件更新加入直播支持,但目前尚未公布具体上线时间和技术方案。
https://www.einpresswire.com/article/929870056/dpvr-expands-u-s-ai-smart-glasses-lineup-on-amazon-sport-focused-r1-arrives-in-august
(@EIN Presswire)
2、淘宝直播团队发布 TaoMate 实时音视频数字人:引入 Anchor-Guided Memory,支持长时稳定生成
淘宝直播团队发布 TaoMate 实时音视频数字人生成框架,面向长时间直播场景解决数字人连续生成中的身份保持、音视频同步和历史状态遗忘问题。该方法提出 Anchor-Guided Memory 机制,通过固定视觉锚点和动态记忆状态桥接历史生成内容,实现实时长视频中的稳定数字人生成。
Anchor-Guided Memory:解决长时生成中的身份漂移问题:TaoMate 在生成过程中保留不可变的视觉锚点,同时将已生成的视频和音频片段压缩为固定容量的动态状态,通过残差注意力机制检索历史信息,避免随着上下文增长导致计算成本增加。
联合音视频生成框架:同步建模语音、表情与动作变化:模型针对实时数字人场景,将音频和视频生成过程统一建模,使生成的人物外观、口型、表情和动作能够随语音变化保持同步。
固定容量记忆机制:支持长时间实时直播生成:传统因果生成模型依赖有限缓存保存近期运动和语音上下文,容易丢失早期身份信息;TaoMate 通过动态状态压缩,在不扩展缓存长度的情况下保留长期历史信息。
Few-step 生成策略:降低实时音视频生成计算成本:TaoMate 采用少步生成方式减少推理开销,使音视频联合生成更适用于实时直播、虚拟主播等低延迟场景。
面向淘宝直播数字人场景优化:连接实时互动与商业直播链路:该框架针对电商直播中的长时间运行需求设计,重点解决数字人在持续直播过程中保持人物一致性、语音同步和内容连续性的工程问题。
https://arxiv.org/abs/2607.24359
https://taoliveaigc.github.io/TaoMate/
(@TaoMate)
3、线上虚拟办公平台 Gather推出「智能对象(Smart Objects)」功能:连接外部工具与实时数据,让虚拟办公室具备动态交互能力
线上虚拟办公平台 Gather 最近推出了「智能对象」(Smart Objects)。用户可以收集各种能连接其他工具并实时更新的物品。
比如,你可以用它来做这些事:
做一个能随着 Pull Request (PR) 堆积而不断填满的收件箱;
做一盏在发生突发故障(Incident)时会变成红色的灯泡;
做一个能一目了然展示 AI 智能体状态的机器人监视器。
这个功能目前已经在 Gather 2.0 版本中上线。
https://x.com/gather_town/status/2084300898990264436
(@gather_town@X)
4、腾讯混元发布 Hy ASR 3.0 Preview:融合大模型语义理解,中文 WER 降至 3.34%,支持上下文纠错与方言识别
腾讯混元发布新一代语音识别模型 Hy ASR 3.0 Preview,将语音识别与大语言模型语义理解能力结合,提升通用转写、上下文理解、专业词识别和复杂环境鲁棒性。模型基于 Hy3 大语言模型能力,采用 MoE 架构,并已通过腾讯云 API 开放服务。
多语种 WER 控制在 3% 左右:中文普通话 3.34%,英语 2.62%:Hy ASR 3.0 Preview 在公开评测集上实现较低词错误率,其中中文普通话 WER 为 3.34%、英语 WER 为 2.62%、粤语 WER 为 3.12%。
Context 上下文理解能力增强:支持语义纠错与歧义消除:模型结合上下文信息进行转写,不再仅依赖音频声学匹配,可根据语境修正同音词、补全表达并提升长语音连续识别稳定性。
热词注入能力增强:降低专业场景接入成本:Hy ASR 3.0 Preview 支持通过热词增强机制快速适配品牌名、人名、产品名和行业术语,减少业务场景中的专词误识别。
MoE 架构 + Hy3 基座升级:增强语言建模与语义推理能力:模型采用混合专家架构,并升级语言模型基座,通过联合训练增强语音 Encoder 与语言模型之间的信息融合能力。
数千万小时级语音数据训练:覆盖方言、口音和复杂声学环境:训练数据覆盖多来源语音数据,并针对 10 大方言片区和 20 余个二级方言区域构建专项 SFT 数据,同时优化高噪、耳语等复杂环境下的识别能力。
腾讯云 API 已开放:支持智能客服、语音搜索等场景接入:Hy ASR 3.0 Preview 已上线腾讯云语音识别服务,同时接入元宝、WorkBuddy 等产品,用于语音输入和实时交互场景。
Hy ASR 3.0 preview 发布:真正懂上下文的语音识别
(@腾讯混元)
03 有态度的观点
1、Reddit:AI 吃不掉我们
Reddit 刚交出一份漂亮财报:第二季度营收 8.05 亿美元,同比增长 61%;净利润 2.53 亿美元,增长 183%。但财报发布后,股价盘后一度跌超 10%。但让投资者紧张的是 Google 带来的流量。Reddit 在股东信里承认,来自搜索引擎的访问量本季度「时好时坏」,季度后半段波动更大。全球日活增至 1.303 亿,但美国日活从上一季度的 5350 万降到了 5320 万。
Reddit 有不少未登录访客来自 Google。过去搜索一个问题,用户会点进 Reddit 看真人经验;现在 Google 把 AI 摘要放在链接前面,答案已经写好了,很多人可能看完就走。Reddit CEO Steve Huffman 并不认为 AI 能把这部分需求全部吃掉。
他接受采访时表示,Google 的 AI 摘要替代不了传统搜索里的「十个蓝色链接」。而在股东信里,他说得更直接:
「人们不想看 Reddit 的摘要,他们想要的就是 Reddit。」
Reddit CEO, Steve Huffman
Reddit 的理由是,AI 可以整理信息,却很难把社区里的争论、个人经历和不同意见压成一个标准答案。公司也在努力让用户每天主动打开 Reddit,减少对 Google 流量的依赖。
2024 年,Reddit 把帖子授权给了 Google,用于改进 AI。现在这些真人讨论让 Google 的答案变得更好,也可能让用户更少点进 Reddit。
https://techcrunch.com/2026/07/30/reddit-reports-a-solid-quarter-but-shows-signs-of-ais-impact/
( @APPSO)

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
作者提示: 个人观点,仅供参考