AI 语音访谈平台 Listen Labs 拟融资 1.25 亿美元,估值15 亿美元丨日报

本期编辑:@三水、@鲍勃

01 有话题的技术


1、MiniMax 发布视频生成模型 H3:登顶 Design Arena 三项视频榜单

MiniMax H3 在 Design Arena 视频评测中取得三项榜单第一,覆盖文本生成视频、图像生成视频和视频编辑等方向。H3 面向多模态视频生成场景设计,支持文本、图像、视频和音频等输入形式。


  • Design Arena 三项视频榜单排名第一: H3 在 Design Arena 的视频生成评测中登顶三项榜单,覆盖不同视频生成任务。


图片


  • 支持文本、图像、视频和音频多模态输入: H3 可根据多种模态指令生成视频,并支持内容编辑和视频间动作迁移。

  • 支持 2K 视频生成与原生立体声音频: H3 支持生成最高 2K 分辨率视频,并集成原生立体声音频生成能力。

  • 支持视频编辑与参考内容控制: 模型支持基于参考图像、视频和文本指令进行视频编辑,包括内容修改和动作迁移等任务。


https://www.minimax.io/blog/minimax-h3


(@MiniMax_AI)



2、VS Code 1.132 更新语音能力:内置端侧听写扩展至编辑器与终端

微软在 VS Code 1.131 Insiders 版本中扩展内置语音能力,将端侧听写功能从现有语音场景扩展到代码编辑器和集成终端。该更新减少了开发者对第三方语音扩展的依赖,使语音输入可以直接进入编码和终端工作流。


  • 端侧听写进入编辑器与终端: VS Code 新增对内置 on-device dictation 的支持,可在编辑器输入框和终端中直接进行语音输入,无需依赖外部语音扩展。

  • 支持实时听写优化: 新版本增加增量式听写清理能力,用户仍在说话时即可逐步优化标点和表达;同时支持过滤语气词(如 um、uh),减少后续手动编辑。

  • 支持语音生成结构化文本: 内置听写可在后处理阶段自动生成项目符号和编号列表格式,使语音输入更适合记录笔记、需求描述等结构化内容。

  • 扩展 Voice Workflow: VS Code 同步加入朗读文本(TTS)能力,并优化 Voice Mode 控制入口,包括麦克风选择和快速操作。


https://code.visualstudio.com/updates/v1_131/#_built-in-dictation-across-vs-code-experimental


(@Visual Studio code)



3、Black Forest Labs 发布多模态基础模型 FLUX 3:统一学习图像、视频与音频,探索视觉智能与物理 AI

Black Forest Labs(BFL)发布多模态基础模型 FLUX 3 Early Access,将图像、视频和音频纳入统一架构进行联合学习。该模型基于 Self-Flow 方法构建,目标是学习现实世界中的物体、运动和声音之间的关联,并支持视频生成、编辑以及动作预测等能力。


  • 统一建模图像、视频与音频: FLUX 3 在同一架构中联合学习多模态数据,不再将图像、视频和音频作为独立任务处理,而是通过不同模态之间的约束学习更完整的世界表示。

  • 支持视频生成与编辑任务: FLUX 3 Video 支持文本生成视频、图像生成视频、视频到视频编辑、关键帧过渡、视频音频续写等能力,单次生成最长可生成 20 秒视频,并支持原生音频生成。

  • 引入 Self-Flow 多模态流匹配方法: FLUX 3 基于 Self-Flow 对多模态生成与理解进行统一对齐,并扩展计算和数据规模训练视频、图像与音频能力。

  • 探索 Video-to-Action 方向: FLUX 3 不仅用于内容生成,还支持动作预测方向。BFL 与机器人公司 Mimic 合作开发 FLUX-mimic,将 FLUX 3 视频模型作为机器人操作模型基础,并在工业场景进行测试。

  • 开放 Early Access 与后续开发计划: BFL 计划逐步开放 FLUX 3 Video、FLUX 3 Image、FLUX 3 Action 和 FLUX 3 Dev,其中 FLUX 3 Dev 将提供多模态基础模型开放权重。


https://bfl.ai/blog/flux-3-video


(@bfl_ml)


4、开源 Agent 框架 Hermes Agent 更新实时语音模式:支持流式 TTS、语音打断与唤醒词

图片


Nous Research 发布 Hermes Agent v2026.8.3(The Herald Release),为开源 Agent 框架加入更完整的实时语音交互能力。新版 Voice Mode 支持实时流式语音、用户打断(barge-in)、唤醒词和连续对话,让 Hermes 从文本 Agent 扩展到实时语音 Agent 场景。


  • 支持实时流式语音对话: Hermes Agent 新增 Voice Mode,可在 CLI 和 TUI 中开启语音交互,通过语音输入驱动 Agent,并使用流式 TTS 逐句生成语音回复,无需等待完整文本生成。

  • 支持语音打断(barge-in): 用户可以在 Agent 播放语音过程中直接插话,系统会检测新的语音输入并停止当前播放,同时将「被打断」状态传递给 Agent,使其能够继续或调整回复。

  • 加入唤醒词与持续监听能力: 新版本支持自定义唤醒词,扩展持续语音交互模式,让用户无需频繁手动操作即可与 Agent 对话。

  • 语音链路支持 VAD 与幻觉过滤: Hermes Voice Mode 内置语音活动检测(VAD)和语音识别幻觉过滤机制,可过滤静音环境下 Whisper 产生的无意义转录结果。

  • 开源实时 Agent 交互能力扩展: 此次更新同时加入 grounded research、A2A v1.0、签名 Webhook 等 Agent 能力,进一步扩展 Hermes 在长任务执行和工具协作场景中的能力。


https://github.com/NousResearch/hermes-agent/releases/tag/v2026.8.3


(@NousResearch)



02 有亮点的产品


1、Wispr Flow 推出 AI Notetaker 功能:实时转写会议内容,并生成可检索 AI 会议上下文

https://wisprflow.ai/notetaker

(@tankots)



2、AI 语音访谈平台 Listen Labs 拟融资 1.25 亿美元:估值达 15 亿美元,ARR 预计年底突破 1.1 亿美元

图片


AI 语音访谈初创公司 Listen Labs 正推进 1.25 亿美元融资,估值约 15 亿美元。该公司通过 AI Agent 自动化开展客户访谈,根据受访者回答实时生成追问,用于企业产品调研、品牌认知分析等场景。


  • AI Agent 自动开展客户访谈: Listen Labs 允许企业输入基础问题,由 AI 进行语音访谈,并根据受访者实时回答生成后续问题,用于收集产品和用户反馈。

  • 融资后估值较七个月前增长三倍: Listen Labs 正寻求新一轮 1.25 亿美元融资,Menlo Ventures 正洽谈领投,该轮完成后公司估值预计达到 15 亿美元。

  • ARR 预计年底达到 1.1 亿美元: 知情人士透露,Listen Labs 当前年化营收约 3000 万美元,公司预计今年年底 ARR 将超过 1.1 亿美元。

  • 已有企业客户采用语音访谈服务:微软、Sweetgreen 和 Perplexity 等企业为其客户。公司此前已从 Ribbit Capital、Sequoia Capital 和 Conviction Partners 等投资方累计融资 1 亿美元。

  • 面向客户反馈场景的 Voice AI 竞争加剧: 除 Listen Labs 外,Conveo、Strella 等公司也提供 AI 语音客户反馈服务,OpenAI 等模型厂商则持续提升实时语音交互能力。


(@Z Potentials)



3、Google 语音助手 Gemini 接替 Google Assistant:9 月 4 日起逐步停止移动端 Assistant 支持

Google 将逐步结束 Google Assistant 在移动端设备上的支持,并由 Gemini 接替成为新的 AI 助手入口。Google 将从 2026 年 9 月 4 日开始移除 Android 手机、平板及部分关联设备上的 Google Assistant,符合条件的设备将迁移至 Gemini。


  • Gemini 成为 Android 默认 AI 助手: Google 将在 Android 手机和平板上以 Gemini 替代 Google Assistant,用户完成迁移后将无法切回旧版 Assistant。

  • 迁移范围覆盖移动设备生态: 此次调整影响 Android 手机、平板,以及部分连接设备,包括 Wear OS 手表、耳机和 Android Auto 等;Google Home 和 Google TV 等设备暂不受此次调整影响。

  • 从语音助手转向生成式 AI 助手: Gemini 依托 Google 的多模态模型能力,提供更强的上下文理解和生成式交互能力,Google 此前已开始将 Gemini 能力逐步整合到 Assistant 体验中。

  • Google Assistant 服务进入退出阶段: Google Assistant 于 2016 年推出,此次迁移标志着 Google 将移动端语音助手入口从传统指令式助手转向 Gemini AI 助手。


(@ArsTechnica)



03 有态度的观点



1、余承东:上游存储芯片剧烈涨价,手机终端随后或面临大规模价格上调

图片


华为常务董事、产品投资评审委员会主任、终端 BG 董事长余承东在 8 月 5 日的尊界时代旗舰 MPV 及华为全场景新品发布会上表示,近期手机供应链成本正在变化。


内存高昂涨价,手机之后可能都要大规模涨价,否则原本的价格都在亏损销售。

新浪科技还提到,余承东在今年 4 月的一场华为终端新品发布会上也曾说过「后面扛不住了也可能涨价」。


( @APPSO)

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。


图片

作者提示: 个人观点,仅供参考

注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    关键词
    // 相关帖子
    Coming soon...
    • 0
    AI 语音访谈平台 Listen Labs 拟融资 1.25 亿美元,估值15 亿美元丨日报RTRTE_Dev_Comm