AI 语音访谈平台 Listen Labs 拟融资 1.25 亿美元,估值15 亿美元丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、MiniMax 发布视频生成模型 H3:登顶 Design Arena 三项视频榜单
MiniMax H3 在 Design Arena 视频评测中取得三项榜单第一,覆盖文本生成视频、图像生成视频和视频编辑等方向。H3 面向多模态视频生成场景设计,支持文本、图像、视频和音频等输入形式。
Design Arena 三项视频榜单排名第一: H3 在 Design Arena 的视频生成评测中登顶三项榜单,覆盖不同视频生成任务。
支持文本、图像、视频和音频多模态输入: H3 可根据多种模态指令生成视频,并支持内容编辑和视频间动作迁移。
支持 2K 视频生成与原生立体声音频: H3 支持生成最高 2K 分辨率视频,并集成原生立体声音频生成能力。
支持视频编辑与参考内容控制: 模型支持基于参考图像、视频和文本指令进行视频编辑,包括内容修改和动作迁移等任务。
https://www.minimax.io/blog/minimax-h3
(@MiniMax_AI)
2、VS Code 1.132 更新语音能力:内置端侧听写扩展至编辑器与终端
微软在 VS Code 1.131 Insiders 版本中扩展内置语音能力,将端侧听写功能从现有语音场景扩展到代码编辑器和集成终端。该更新减少了开发者对第三方语音扩展的依赖,使语音输入可以直接进入编码和终端工作流。
端侧听写进入编辑器与终端: VS Code 新增对内置 on-device dictation 的支持,可在编辑器输入框和终端中直接进行语音输入,无需依赖外部语音扩展。
支持实时听写优化: 新版本增加增量式听写清理能力,用户仍在说话时即可逐步优化标点和表达;同时支持过滤语气词(如 um、uh),减少后续手动编辑。
支持语音生成结构化文本: 内置听写可在后处理阶段自动生成项目符号和编号列表格式,使语音输入更适合记录笔记、需求描述等结构化内容。
扩展 Voice Workflow: VS Code 同步加入朗读文本(TTS)能力,并优化 Voice Mode 控制入口,包括麦克风选择和快速操作。
https://code.visualstudio.com/updates/v1_131/#_built-in-dictation-across-vs-code-experimental
(@Visual Studio code)
3、Black Forest Labs 发布多模态基础模型 FLUX 3:统一学习图像、视频与音频,探索视觉智能与物理 AI
Black Forest Labs(BFL)发布多模态基础模型 FLUX 3 Early Access,将图像、视频和音频纳入统一架构进行联合学习。该模型基于 Self-Flow 方法构建,目标是学习现实世界中的物体、运动和声音之间的关联,并支持视频生成、编辑以及动作预测等能力。
统一建模图像、视频与音频: FLUX 3 在同一架构中联合学习多模态数据,不再将图像、视频和音频作为独立任务处理,而是通过不同模态之间的约束学习更完整的世界表示。
支持视频生成与编辑任务: FLUX 3 Video 支持文本生成视频、图像生成视频、视频到视频编辑、关键帧过渡、视频音频续写等能力,单次生成最长可生成 20 秒视频,并支持原生音频生成。
引入 Self-Flow 多模态流匹配方法: FLUX 3 基于 Self-Flow 对多模态生成与理解进行统一对齐,并扩展计算和数据规模训练视频、图像与音频能力。
探索 Video-to-Action 方向: FLUX 3 不仅用于内容生成,还支持动作预测方向。BFL 与机器人公司 Mimic 合作开发 FLUX-mimic,将 FLUX 3 视频模型作为机器人操作模型基础,并在工业场景进行测试。
开放 Early Access 与后续开发计划: BFL 计划逐步开放 FLUX 3 Video、FLUX 3 Image、FLUX 3 Action 和 FLUX 3 Dev,其中 FLUX 3 Dev 将提供多模态基础模型开放权重。
https://bfl.ai/blog/flux-3-video
(@bfl_ml)
4、开源 Agent 框架 Hermes Agent 更新实时语音模式:支持流式 TTS、语音打断与唤醒词
Nous Research 发布 Hermes Agent v2026.8.3(The Herald Release),为开源 Agent 框架加入更完整的实时语音交互能力。新版 Voice Mode 支持实时流式语音、用户打断(barge-in)、唤醒词和连续对话,让 Hermes 从文本 Agent 扩展到实时语音 Agent 场景。
支持实时流式语音对话: Hermes Agent 新增 Voice Mode,可在 CLI 和 TUI 中开启语音交互,通过语音输入驱动 Agent,并使用流式 TTS 逐句生成语音回复,无需等待完整文本生成。
支持语音打断(barge-in): 用户可以在 Agent 播放语音过程中直接插话,系统会检测新的语音输入并停止当前播放,同时将「被打断」状态传递给 Agent,使其能够继续或调整回复。
加入唤醒词与持续监听能力: 新版本支持自定义唤醒词,扩展持续语音交互模式,让用户无需频繁手动操作即可与 Agent 对话。
语音链路支持 VAD 与幻觉过滤: Hermes Voice Mode 内置语音活动检测(VAD)和语音识别幻觉过滤机制,可过滤静音环境下 Whisper 产生的无意义转录结果。
开源实时 Agent 交互能力扩展: 此次更新同时加入 grounded research、A2A v1.0、签名 Webhook 等 Agent 能力,进一步扩展 Hermes 在长任务执行和工具协作场景中的能力。
https://github.com/NousResearch/hermes-agent/releases/tag/v2026.8.3
(@NousResearch)
02 有亮点的产品
1、Wispr Flow 推出 AI Notetaker 功能:实时转写会议内容,并生成可检索 AI 会议上下文
https://wisprflow.ai/notetaker
(@tankots)
2、AI 语音访谈平台 Listen Labs 拟融资 1.25 亿美元:估值达 15 亿美元,ARR 预计年底突破 1.1 亿美元
AI 语音访谈初创公司 Listen Labs 正推进 1.25 亿美元融资,估值约 15 亿美元。该公司通过 AI Agent 自动化开展客户访谈,根据受访者回答实时生成追问,用于企业产品调研、品牌认知分析等场景。
AI Agent 自动开展客户访谈: Listen Labs 允许企业输入基础问题,由 AI 进行语音访谈,并根据受访者实时回答生成后续问题,用于收集产品和用户反馈。
融资后估值较七个月前增长三倍: Listen Labs 正寻求新一轮 1.25 亿美元融资,Menlo Ventures 正洽谈领投,该轮完成后公司估值预计达到 15 亿美元。
ARR 预计年底达到 1.1 亿美元: 知情人士透露,Listen Labs 当前年化营收约 3000 万美元,公司预计今年年底 ARR 将超过 1.1 亿美元。
已有企业客户采用语音访谈服务:微软、Sweetgreen 和 Perplexity 等企业为其客户。公司此前已从 Ribbit Capital、Sequoia Capital 和 Conviction Partners 等投资方累计融资 1 亿美元。
面向客户反馈场景的 Voice AI 竞争加剧: 除 Listen Labs 外,Conveo、Strella 等公司也提供 AI 语音客户反馈服务,OpenAI 等模型厂商则持续提升实时语音交互能力。
(@Z Potentials)
3、Google 语音助手 Gemini 接替 Google Assistant:9 月 4 日起逐步停止移动端 Assistant 支持
Google 将逐步结束 Google Assistant 在移动端设备上的支持,并由 Gemini 接替成为新的 AI 助手入口。Google 将从 2026 年 9 月 4 日开始移除 Android 手机、平板及部分关联设备上的 Google Assistant,符合条件的设备将迁移至 Gemini。
Gemini 成为 Android 默认 AI 助手: Google 将在 Android 手机和平板上以 Gemini 替代 Google Assistant,用户完成迁移后将无法切回旧版 Assistant。
迁移范围覆盖移动设备生态: 此次调整影响 Android 手机、平板,以及部分连接设备,包括 Wear OS 手表、耳机和 Android Auto 等;Google Home 和 Google TV 等设备暂不受此次调整影响。
从语音助手转向生成式 AI 助手: Gemini 依托 Google 的多模态模型能力,提供更强的上下文理解和生成式交互能力,Google 此前已开始将 Gemini 能力逐步整合到 Assistant 体验中。
Google Assistant 服务进入退出阶段: Google Assistant 于 2016 年推出,此次迁移标志着 Google 将移动端语音助手入口从传统指令式助手转向 Gemini AI 助手。
(@ArsTechnica)
03 有态度的观点
1、余承东:上游存储芯片剧烈涨价,手机终端随后或面临大规模价格上调
华为常务董事、产品投资评审委员会主任、终端 BG 董事长余承东在 8 月 5 日的尊界时代旗舰 MPV 及华为全场景新品发布会上表示,近期手机供应链成本正在变化。
内存高昂涨价,手机之后可能都要大规模涨价,否则原本的价格都在亏损销售。
新浪科技还提到,余承东在今年 4 月的一场华为终端新品发布会上也曾说过「后面扛不住了也可能涨价」。
( @APPSO)

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
作者提示: 个人观点,仅供参考