FFmpeg 9.0 新版本代号「Lei」:纪念中国音视频开发者雷霄骅丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、Bland 发布 Speech v3 语音引擎:基于 1 亿+真人通话数据训练
Bland 发布 Speech v3 语音模型,并将其定位为「人类语音引擎」。该模型基于超过 1 亿次真人通话数据训练,Speech v3 在 Audio Realism 榜单中超过 OpenAI、ElevenLabs 等语音模型,并已在 Bland 平台全面上线。
测试:
https://www.bland.ai/speech
(@Bland.ai)
2、NVIDIA 发布端到端全双工语音模型 Nemotron VoiceChat-11B:首个支持实时工具调用的开源全双工模型
NVIDIA-NemotronLabs-VoiceChat-11B 是 NVIDIA 面向实时语音智能体开发的端到端全双工模型,可在同一场对话中完成语音监听、生成、打断处理和工具调用。该模型采用统一架构处理语音理解、转录、生成与工具执行,并针对实时 Voice Agent 场景进行优化。
支持端到端全双工语音交互: 模型将语音理解、语音生成、转录和工具执行整合到单一系统中,支持用户持续讲话、模型响应以及实时打断(barge-in)。
实时轮次切换延迟约 448ms: NVIDIA 表示,Nemotron VoiceChat-11B 在自然轮次切换场景下响应时间约为 448ms;用户打断模型时,barge-in 延迟约为 480ms。
首个支持实时工具调用的开源全双工模型: NVIDIA 表示,该模型是首个支持 live tool calling 的开放式全双工模型,可在保持对话连续性的同时执行工具调用。
基于 Fast Conformer、Nemotron Nano v2 与 TTS Decoder 构建: 模型采用 Fast Conformer 编码器、Nemotron Nano v2 和 TTS decoder 组成端到端架构,并使用约 55 万小时真实与合成语音数据训练。
VoiceBench 与 Full-Duplex-Bench 1.0 排名第 2: NVIDIA 表示,该模型在 VoiceBench 和 Full-Duplex-Bench 1.0 两项开放全双工模型评测中均排名第 2。
https://modelscope.ai/models/nv-community/NVIDIA-NemotronLabs-VoiceChat-11B
(@ModelScope2022)
3、字节跳动 Seed 发布原生音视频全双工大模型:统一融合音频、视频与文本,实现边看、边听、边说
字节跳动 Seed 发布原生音视频全双工大模型 SeedRealtime,将音频、视频与文本融合到统一架构中,支持在连续多模态信息流中实时交互。该模型已在豆包 App 全量上线,用于视频通话场景体验。
原生融合音频、视频与文本: SeedRealtime 在统一端到端架构中处理声音、画面和时序信息,不依赖 ASR、VLM、TTS 等模块串联,实现音视频联合理解与生成。
支持音视频联合理解: 模型能够结合声音、画面与时序信息理解真实场景,例如利用视觉信息消解同音词歧义,并理解视频中的对象指代关系。
具备主动交互能力: SeedRealtime 可以持续感知环境变化,在检测到关键目标出现时主动提醒,并支持调用工具融入表达,让交互从被动响应转向主动协作。
模型自主判断对话节奏: SeedRealtime 不依赖外部 VAD 进行轮次判断,而是基于多模态信息持续判断何时接话、停顿或回应,同时能够区分背景噪声和无关闲聊,减少误触发。
端到端人工评测显示交互流畅度提升: 相比级联系统,SeedRealtime 的音视频对话节奏问题减少一半,完整、顺畅完成单次交流的概率也有所提升。
项目主页:
https://seed.bytedance.com/seedrealtime
体验入口:将豆包 App 更新至最新版本,在对话框内选择「打电话」,进入视频通话界面体验即可。
SeedRealtime 音视频全双工大模型发布:走向全模态自然交互
(@字节 Seed)
4、京东开源实时开放式视频编辑模型 JoyAI-Video-Edit:采用自回归扩散架构,实现 720p 30.19 FPS 流式生成
支持实时开放式视频编辑: JoyAI-Video-Edit 可在视频帧持续输入时进行编辑,无需提前等待完整视频序列,支持直播流和上传视频的实时处理。
采用自回归扩散编辑架构: 模型结合 MLLM 条件编码器、因果视频 VAE 和 MMDiT Backbone,通过自回归扩散方式实现流式视频编辑。
支持多种自然语言编辑任务: 模型支持主体编辑、局部编辑、背景替换、风格迁移、动作变化以及参考图引导编辑。
720p 分辨率达到 30.19 FPS 端到端吞吐: 官方部署测试显示,JoyAI-Video-Edit 在 720×1280 分辨率下达到 30.19 FPS,并通过有界 KV-state 推理保持稳定计算。
开源模型权重与部署代码: 项目开放代码、模型 checkpoint、技术报告和 Streaming V2V Demo,采用 Apache 2.0 许可证。
https://github.com/jd-opensource/JoyAI-Video-Edit
(@jd-opensource)
5、FFmpeg 9.0 发布多媒体框架新版本:代号「Lei」纪念中国音视频开发者雷霄骅
全球开源多媒体框架 FFmpeg 发布 9.0 版本,代号命名为「Lei」,以纪念中国开发者雷霄骅(Lei Xiaohua)。该版本除带来新一代音视频处理能力和硬件加速支持外,也通过版本命名向长期推动 FFmpeg 中文技术传播和开发者教育的贡献者致敬。
FFmpeg 9.0 代号「Lei」致敬雷霄骅: 2026 年是雷霄骅离世十周年,FFmpeg 社区将该版本命名为「Lei」,纪念雷霄骅在 FFmpeg 源码分析、音视频编解码、格式封装和流媒体协议等领域的技术分享。
推动 FFmpeg 中文技术生态传播: 雷霄骅曾通过大量技术文章、源码分析和 C/C++ 示例代码,帮助开发者理解 FFmpeg API、AVCodec、AVFormat、AVPacket、AVFrame 等核心组件。
影响中国音视频开发者社区: 2013~2016 年间,雷霄骅围绕 H.264、AAC、音视频同步、编解码流程和流媒体协议发布大量实践教程,降低了开发者学习 FFmpeg 的门槛。
FFmpeg 9.0 引入新音视频处理能力: 新版本带来新一代音视频处理能力和硬件加速支持,具体更新内容由 FFmpeg 官方发布说明披露。
(@OSCHINA)
02 有亮点的产品
1、SpaceXAI 测试语音交互 UI 技术 Orbs:为 iOS 版 Grok Voice 功能探索空间化交互体验
据 TestingCatalog 报道,SpaceXAI 正在为 iOS 版 Grok 的语音功能开发名为 Orbs 的相关技术。该功能目前处于测试阶段,具体用途和上线时间尚未公布。
(@TestingCatalog)
2、影石 Insta360 正在为 AI 硬件产品增加 AI 语音助手能力
据蓝鲸科技消息,影石 Insta360 正在为 AI 硬件产品增加 AI 语音助手能力,相关功能预计率先落地于 Go Ultra 系列。报道称,该语音助手内部代号为「Kira」,中国大陆地区将调用阿里千问大模型,海外及中国港澳台地区则调用 Google Gemini。
采用端云协同 AI 架构: 据报道,Kira 语音助手以影石自研能力为核心,端侧负责声纹识别与意图判断,云端承担问答、模式切换、翻译等复杂任务。
接入千问多模态模型能力: 报道称,中国大陆地区的 Go Ultra AI 功能将接入阿里千问大模型,并融合其多模态能力。
支持语音交互与翻译播报: AI 助手可用于问答、模式切换和翻译,翻译结果可通过设备机身扬声器直接播报。
Go Ultra 将迎来 AI 功能更新: 影石官方已宣布 Go Ultra 将于 8 月 5 日迎来更新,官方海报显示「语音助手 Kira」可能是本次更新重点。
(@IT 之家)
3、吴恩达推出 Voice for AI Agents and Applications 教程:系统讲解 Voice Agent 三类集成模式
吴恩达推出《Voice for AI Agents and Applications》教程,面向开发者介绍如何将语音能力接入 AI Agent 和应用。该课程由 DeepLearning.AI 与 Vocal Bridge 合作推出,围绕语音嵌入应用、为已有 Agent 增加语音层,以及让 Agent 调用语音工具三类模式展开。
提供三种 Voice Agent 架构模式: 课程介绍语音嵌入应用(Voice in Your App)、为现有 Agent 添加语音层(Voice for Your Agent)、以及将语音通话作为 Agent 可调用工具(Voice as a Tool)三类实现方式。
支持低改造成本接入已有 Agent: 教程展示如何在不修改原有 Prompt、RAG 流程和工具逻辑的情况下,为文本 Agent 增加语音交互能力。
覆盖语音工具调用场景: 课程演示让 Agent 通过
make_phone_call工具发起真实电话通话,并将通话转录结果实时返回上下文。加入 Voice Agent 评测流程: 教程介绍如何通过语音评测对通话质量进行评分,发现失败模式并优化 Agent 交互效果。
包含代码实践案例: 课程包含 8 个视频课程和 5 个代码示例,覆盖语音交互应用、Agent 语音层接入和电话智能体等实践。
https://www.deeplearning.ai/courses/voice-for-ai-agents-and-applications
(@VocalBridge)
4、AI 智能戒指 Vocci Ring 上线:支持语音记录、说话人识别与 AI 上下文连接
Vocci 推出 AI 智能戒指 Vocci Ring,通过戒指内置麦克风采集会议、对话和语音笔记,并将内容转换为文本、摘要和可检索的 AI 上下文。该设备支持与 ChatGPT、Claude 等 AI 应用连接,让用户授权 AI 获取 Vocci 中的语音记录和上下文信息。
AI 智能戒指作为语音入口: Vocci Ring 采用戒指形态设计,内置麦克风、触觉反馈和控制按键,可通过手势触发录音、标记重点或唤起 AI 助手。
支持语音转写与 AI 摘要: 设备可记录会议、交流和灵感片段,并生成转录文本、摘要和结构化信息,帮助用户沉淀长期语音记忆。
支持多人语音识别: Vocci 提供说话人识别能力,可区分不同发言者并生成带标签的转录内容,同时支持多语言语音处理。
连接 AI 应用作为个人上下文层: Vocci 支持通过安全连接方式,让 ChatGPT、Claude 等 AI 应用读取用户授权的 Vocci 数据,用于基于个人语音历史的交互。
硬件参数面向全天候佩戴: Vocci Ring 重约 3g,支持最长 8 小时连续录音,并提供充电盒用于日常使用。
https://vocci.ai/
(@Vocci)
03 有态度的观点
1、Anthropic CEO:担心新员工只为高薪加入,而非认同公司使命
据 Polymarket 转述,Anthropic CEO Dario Amodei 近期表达担忧:随着 AI 人才争夺不断升温,一些新员工加入公司,可能主要是被高额薪酬吸引,而不是因为认同 Anthropic 所强调的 AI 安全使命。
这番表态迅速引发争议。Anthropic 长期将安全、对齐和负责任开发 AI 作为公司核心叙事,但与此同时,它也必须通过高薪、股权和更有竞争力的待遇,与 OpenAI、Meta 等公司争夺顶尖研究员和工程师。
讨论的焦点并不是员工能否追求更高收入,而是当公司要求员工相信使命时,管理层是否也应接受同样的审视。创始人、投资人和高管同样处于资本回报与公司估值的激励体系中,不能只把「是否忠于使命」的问题留给普通员工。
这场争论暴露了前沿 AI 公司的共同矛盾:一方面依靠长期主义和安全使命凝聚团队,另一方面又必须遵循高度市场化的人才竞争规则。当使命与薪酬同时成为招聘工具,公司真正需要解决的,不是员工究竟「为了什么而来」,而是如何让个人利益、商业目标与安全使命长期保持一致。
( @Polymarket@X)
04 社区黑板报
招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)
1、直播预告|OpenAI 实时 AI 负责人、WebRTC 创建者 Justin Uberti:拆解 GPT-Live 的 WARP 与 WebRTC 优化
时间:北京时间 8 月 6 日(周四)00:30 - 01:30
地址:
http://linkedin.com/events/7485922769654824960/
https://x.com/juberti/status/2084734090591556017
( @juberti@X)

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
作者提示: 个人观点,仅供参考