DeepSeek 上线首个多模态视觉理解模型 丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、DeepSeek 上线实验性多模态视觉理解模型 V4-Flash-Vision-Exp:首次在 DeepSeek API 中开放图像输入,多模态 Agent 评测接近 Opus-4.8,Harness 同步加入原生图片支持
对 DeepSeek Harness 官网进行二次创作:
要求模型用黑蓝深海、玻璃 UI 和 ASCII 原子像素等视觉要素,经过长多轮交互后重构得到的未来主义风格开发者网站
DeepSeek 上线实验性多模态视觉理解模型 V4-Flash-Vision-Exp,并首次在 DeepSeek API 中开放图像输入。新模型在保持 V4-Flash 文本 Agent、推理和世界知识能力基本持平的同时,补上视觉理解能力,可直接接入 Agent 工作流处理网页、PPT、前端界面等图文任务。
多模态 Agent 能力明显提升: 在 ApexBench、Agents' Last Exam、Chartography 和 ZeroBench 四项视觉 Agent 评测中,V4-Flash-Vision-Exp 分别取得 36.5、27.3、64.3 和 35.0,其中 Agents' Last Exam 与 ZeroBench 超过 Opus-4.8,其余两项接近 Opus-4.8。
文本能力基本保持 V4-Flash 水平: 在 Terminal Bench、NL2Repo、DeepSWE 等文本 Agent 基准上,新模型整体与 V4-Flash-0731 接近,没有因为加入视觉能力明显牺牲原有文本能力。
多模态 API 支持三种主流调用格式: 开发者可通过 Chat Completions、Messages 和 Responses API 传入图文混合内容,图片支持 base64、外部 URL 和 Files API 三种方式。
DeepSeek Harness 同步加入原生多模态支持:
/goal、/plan等命令现在可直接接收图文输入,@菜单可引用文件和会话,MCP、ACP 支持图片附件持久化,PTC Mode 也可继续转发嵌套图片。
V4-Flash-Vision-Exp 上线,开启多模态 API 服务
(@DeepSeek)
2、Avera Labs 开源全双工语音训练数据管线 ConversationalVoice:把真实录音转成说话人分离的高质量对话数据
Avera Labs 发布首项研究工作 ConversationalVoice,针对全双工语音模型缺少高质量真实对话训练数据的问题,将播客、视频等真实录音中的多人语音分离并重新整理为结构化训练数据。相比只保留转录文本,这套管线重点保留对话中的轮次、停顿、重叠说话和非语言表达,让模型能够学习更接近真实人类交流的互动方式。
从混杂录音中提取干净的双人对话: 系统先找到两人交流片段,再完成说话人识别、语音分离和一致性检查,将原本混有背景音乐、环境噪声和多人声音的录音拆成时间对齐的独立音轨。
保留全双工对话最重要的时间关系: 处理后的数据不仅包含「谁说了什么」,还保留轮流说话、停顿、同时说话以及其他非语言表达,避免把真实对话压缩成简单的文本问答。
一段真实对话可生成两类训练数据: 一类是从原始录音中提取并验证过的说话人分离数据;另一类则以原始对话的情境和互动节奏为基础生成新的对话内容,用于进一步扩充训练数据。
完整数据处理管线已开放: 项目提供从录音切分、说话人识别、语音分离、转录,到人物信息提取和对话扩充的完整流程,可用于构建全双工语音模型训练数据。
https://github.com/avera-labs/ConversationalVoice
(@averalabs0)
3、快手 Kling、港中文与清华提出统一音频生成模型 SonicWeave:一个模型生成语音、音乐、歌声与音效,复杂场景 MOS-R 达 4.49
快手 Kling 团队联合香港中文大学、清华大学提出统一音频生成模型 SonicWeave,用一套模型参数同时生成语音、歌声、音乐、音效,以及多种声音交织的复杂音频场景。相比为不同声音类型分别训练模型,SonicWeave 重点解决同一段音频中语音、音乐和环境声不断变化、相互重叠时,模型该如何动态分配生成能力的问题。
一个模型覆盖多类音频生成: SonicWeave 统一支持 TTS、文本生成音效、文本生成音乐、歌声以及它们的细粒度混合,例如同时生成人物对话、背景音乐、环境声和现场音效。
以连续音频片段为单位动态选择不同专家: 核心 CPE-MoE 不再简单按照「语音、音乐、音效」给整段内容分配专家,而是根据文本描述和当前已经生成出的声音,在同一段音频内部动态判断不同区域更适合交给哪些专家处理,更适合复杂声音不断切换和重叠的场景。
复杂音频场景的人类相关性评分达到 4.49: 在包含对话、音乐、环境声等多种元素的复杂场景评测中,SonicWeave 的 MOS-R 达到 4.49;论文实验同时显示,其在 TTS、音效和音乐生成任务上均优于使用相同训练条件的普通稠密模型和基础 MoE 模型。
复杂场景可以细粒度指定声音关系: 输入可描述说话人数、语音内容、歌声、音乐、音效、环境声及声音质感等信息,例如生成赛车场中的双人无线电对话,同时叠加引擎、风声、轮胎声和通信杂音。
https://caiyunrui.github.io/SonicWeave
(@caiyunrui)
4、Patronus AI 开源设计类 computer-use 数据集 FigmaTrace:记录 200+ 小时真实设计过程,而不只保留最终作品,让模型学习设计过程而不只看成品
Patronus AI 开源 FigmaTrace,面向设计类 computer-use Agent 的训练与评测,包含 3,469 条 Figma 操作轨迹、超过 200 小时真实设计工作,覆盖 10 类设计技能。与过去从最终设计稿反推操作过程不同,FigmaTrace 直接记录设计师如何一步步完成长链路任务,让模型学习元素选择、坐标定位以及不同设计阶段中的实际决策过程。
记录完整设计过程,而不是只收集最终作品: 数据覆盖无障碍修复、模板调整、原型连接、草图转 Figma、跨平台适配等任务,重点保留人类设计师完成任务时的操作顺序和决策轨迹。
长设计录像按「设计阶段」拆成训练轨迹: 相比简单按照模型最大上下文长度切分视频,按任务阶段拆分后平均成绩从 56.3 提升至 63.6,说明保留每段操作背后的完整设计意图更有利于模型学习。
Figma 工作流训练能力可迁移到其他 GUI Agent 任务: 使用 FigmaTrace 微调后的 27B 开源模型,在 GUI-Odyssey 和 AndroidControl 上分别超过 Claude Opus 5 6.4 和 11.8 个百分点,表明从设计操作中学到的界面定位和交互能力可以迁移到非设计场景。
数据集与微调模型同步开放: FigmaTrace 提供 2883 条训练轨迹和 586 条评测轨迹,并开放表现最佳的微调模型供研究和训练使用。
https://patronus.ai/blog/figmatrace-a-comprehensive-training-dataset-for-figma-design-workflows
https://x.com/anandnk24/status/2090499988833107978
(@anandnk24)
5、自变量机器人开源实时语音轮次模型 X2-Turn:每 80ms 同步输出转写与轮次状态,判断用户是否说完或只是在附和
自变量机器人 X-Square Robot 开源 X2-Turn,在同一个 4B 流式语音模型中同时完成 ASR 和对话轮次判断。不同于先做 VAD、再转写、最后判断用户是否说完的串联方案,X2-Turn 基于 Voxtral Realtime 增加并行的轮次状态预测模块,每 80ms 随语音流同步更新转写和状态,用于更早判断用户还在继续说、已经说完,还是只发出了 「嗯」「啊」这类附和声。
ASR 和轮次判断在一次流式推理中完成: 两项任务共享同一份实时语音表示,同时输出转写和轮次状态,不需要额外再运行一个 ASR 或轮次判断模型,减少串联系统带来的等待和误差传递。
每 80ms 更新一次对话状态: 模型沿 Voxtral Realtime 的 80ms 时间步持续处理语音,可区分沉默、刚开始说话、语义尚未完整、语义已经完整以及附和等状态,为打断、接话和继续等待提供信号。这里的 80ms 是状态更新频率,并不等于最终接话延迟只有 80ms。
可在准确率与响应速度之间调整: 在 EasyTurn 中英文测试中,将观察延迟从 480ms 缩短至 320ms 后,中文平均轮次判断准确率从 92.0% 降至 90.67%,平均决策延迟从 288ms 降至 120ms;英文平均决策延迟最低可降至 65ms。
模型与全双工 Demo 已开放: 项目提供 X2-Turn-4B 权重、浏览器轮次判断 Demo,以及可接入 LLM 和 TTS 的全双工对话示例,可直接用于测试用户打断和轮次切换。
https://github.com/X-Square-Robot/X2-Turn
(@X-Square-Robot)
02 有亮点的产品
1、乐鑫发布面向 Coding Agent 的开发板 ESP-Mosaico:Agent 可直接部署真机,多机拼接扩展硬件能力
乐鑫发布面向 Coding Agent 的模块化开发板 ESP-Mosaico,将 AI Coding 从代码生成进一步延伸到真实硬件开发。开发者可以按需组合摄像头、传感器、按键、灯光、电机等模块,Agent 根据当前硬件配置生成应用,并继续完成构建、部署、真机测试和调试;多台设备还可以拼接并协同运行,让硬件形态也能随着应用需求持续变化。
Agent 可以根据实际硬件组合开发应用: 接入受支持的功能模块后,系统可自动识别并完成基础适配,Agent 能获取当前设备、接口和外设信息,再据此生成应用,减少手动接线、驱动适配和硬件配置工作。
Chat Coding 从一句需求直接生成硬件原型: 内置 Coding Agent ESP-Claw,用户无需配置本地开发环境,可直接描述需求,由 Agent 完成应用生成、构建并部署到 ESP-Mosaico;之后还能继续通过自然语言修改功能和界面。
Vibe Coding 将 Agent 接入真机调试闭环: ESP-Mosaico 向 Agent 开放烧录、输入、设备控制和状态观测接口,并将 UI、音频、触摸、性能和故障信息整理成结构化反馈,让 Agent 可以持续执行「修改代码 → 构建部署 → 真机测试 → 读取反馈 → 再次修改」。
硬件本身也可以持续组合和扩展: 除单机增加功能模块外,多台 ESP-Mosaico 主机还能识别彼此的相邻关系和姿态,并通过无线连接同步应用状态,可用于跨屏游戏、多屏信息面板等动态硬件形态。
主机采用 ESP32-S31: 搭载 480 × 480 OLED 触控屏和电池,ESP32-S31 最高主频 320 MHz,并提供最高 32 MB DDR PSRAM、60 个 GPIO,以及 Wi-Fi 6、Bluetooth 5.4、802.15.4 等连接能力。
https://mosaico.espressif.com/
(@乐鑫科技)
2、Vapi 下线 Workflows、全面转向 Squads:Voice Agent 编排从流程图走向多 Agent 分工与动态交接
Vapi 已于 8 月 18 日正式下线 Workflows,8 月 19 日起原有 Workflow 停止运行,并将 Squads 作为复杂 Voice Agent 的推荐方案。相比用节点和连线提前画出完整对话路径,Squads 将复杂任务拆给多个职责更聚焦的 Agent,再根据实际对话上下文决定何时交接。Vapi 表示,现阶段模型很难同时记住当前节点要求、所有可能的下一步及对应条件,而多 Agent 分工在实际客户场景中表现更稳定。
复杂 Voice Agent 正从「大而全的单体流程」转向专业 Agent 协作: 一个 Agent 不再承担整套客服、筛选、预约等复杂逻辑,而是拆成多个目标明确的 Agent,各自只负责一段任务。Vapi 认为这样可以减少长提示词和复杂上下文带来的失焦、延迟与成本。
对话路径从「提前画死」转向根据上下文交接: Workflows 强调节点和条件分支,Squads 则让当前 Agent 在对话过程中判断何时把任务交给下一个 Agent,使真实用户偏离预设脚本时不必强行拉回固定路径。
这并不意味着 Voice Agent 开始完全自主: Vapi 仍要求开发者为每个 Agent 定义清楚职责、工具和交接条件。变化更准确地说,是把「流程控制」从显式流程图,转移到专业 Agent + Handoff 的协作机制中。
https://docs.vapi.ai/workflows/legacy-migration
(@Vapi)
3、OpenAI 为 ChatGPT 接入 Apple Messages:可直接检索与发送消息,桌面 Agent 开始进入私人通信
OpenAI 推出 Apple Messages 插件,让 ChatGPT 在 Mac 上直接访问用户的消息会话,可搜索历史消息、总结对话进展、起草并发送回复,目前已接入 ChatGPT Work 和 Codex。相比过去需要用户手动复制聊天内容给 AI,这次 ChatGPT 开始直接进入 Messages 这类系统级私人通信入口,在已有上下文中完成理解和操作。
从「帮你写回复」变成直接处理消息: ChatGPT 可以在 Messages 中查找过去的对话、总结未读内容和已有讨论,并继续起草、发送消息,把私人通信也纳入 Agent 可操作的工作流。
私人通信正在成为桌面 Agent 的新入口: 这类集成意味着 Agent 不再只连接邮件、文档、代码和企业 SaaS,也开始进入 iMessage 等高频个人沟通场景,能够直接利用长期积累的真实关系和对话上下文。
同时触及更敏感的隐私边界: Bloomberg 记者 Mark Gurman 指出,这项能力可能引发 Apple 的隐私担忧。Apple 长期强调 Messages 内容的私密性,而第三方 AI 获得读取、分析和发送消息的能力后,用户的私人通信如何被访问和处理,将成为更直接的问题;目前尚不代表 Apple 已对此采取行动。
https://www.bloomberg.com/news/articles/2026-08-20/chatgpt-can-now-control-imessage-potentially-raising-apple-privacy-concerns
(@OpenAI)
03 有态度的观点
1、Retell:约 99% 的 Voice Agent 客户仍在用级联架构,端到端 S2S 还没有赢下生产环境
Retell 高级工程师 Zhongren Shao 透露,其平台 99% 的 Voice Agent 仍采用 STT + LLM + TTS 的级联架构,而非端到端(Speech-to-Speech)模型。级联的核心价值在于生产环境的高度可控:
解耦迭代:单层可独立测试、优化与替换,避免被单一模型厂商深度绑定;
精细交互:在 1–1.5 秒的总响应预算内(STT P50 约 500–700ms),团队可自研 Turn-taking 模型精准处理打断、插话与语气词;
弹性容灾:各层均可配置降级方案(Fallback)及多云延迟路由,单点故障不影响全局。
从 Demo 到生产,「系统更可控」仍优先于「模型更原生」。相比端到端,生产级落地更看重系统的可替换、可评测与容灾能力。
https://www.assemblyai.com/blog/build-smarter-voice-agents-retell-super
( @AssemblyAI)
04 Real-Time AI Demo
1、TypeGPU 实现深度感知实时光照:M4 Pro 推理延迟低至 8ms
开发者 Konrad Reczko 展示了基于 TypeGPU 的深度感知光照效果。他在 Apple M4 Pro 上将 448×448 单目深度估计模型的推理耗时优化至约 8ms(含约 250 次 GPU 调度),满足实时渲染需求。
得益于 TypeGPU 的统一管线,深度数据全流程留在 GPU 内,推理、光照注入与渲染通过同一个命令编码器完成,免去了跨接口传输与额外的同步开销。
https://docs.swmansion.com/TypeGPU/examples/#example=image-processing--monocular-light-injection
( @Konrad Reczko)
2、Hugging Face 推出 Realtime Voice 实时语音 Demo:四个开放模型组成级联式 Voice Agent
Hugging Face 上线 Realtime Voice 实时语音 Demo,基于其开源 speech-to-speech 框架构建,并非端到端语音模型,而是采用 VAD → 语音识别 → 视觉语言模型 → 语音合成 的级联架构。当前在线 Demo 分别使用 Silero VAD、NVIDIA Parakeet TDT 1.1B、Gemma 4 31B 和 Qwen3-TTS 1.7B,各环节均可替换或本地运行;前端通过 WebSocket 与实时后端通信,并兼容 OpenAI Realtime API 的核心事件协议。
https://huggingface.co/spaces/smolagents/hf-realtime-voice
( @DerekColley_@Huggingface)

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示:个人观点,仅供参考