Thinking Machines Lab 洽谈 10 亿美元融资,估值 400 亿美元丨日报

图片

本期编辑:@三水、@鲍勃


01 有话题的技术


1、微软发布批量语音识别模型 MAI-Transcribe-2:新增说话人分离与逐词时间戳,1 小时音频约 10 秒完成转录


Microsoft AI 发布批量语音识别模型 MAI-Transcribe-2。相比 MAI-Transcribe-1.5,新版本新增说话人分离、逐词时间戳和可配置转写风格,语言覆盖从 43 种扩展到 60 种,同时把 1 小时音频的模型推理时间从约 20 秒缩短至 10 秒


图片


Okay, listen. I have this absolutely unhinged idea, and I need you to roll with it. Help me make an agent that will literally buy tickets for my favorite band the second they are available.

  • 说话人分离和逐词时间戳直接内置到模型: MAI-Transcribe-2 可以在转录时区分不同说话人并将文本归属到对应人物,同时为每个词输出精确时间位置;这两项能力在 MAI-Transcribe-1.5 中均未提供。

  • 新增两种转写风格: 开发者可以选择「逐字」模式,保留填充词、停顿和口误,用于合规或分析;也可以选择「整洁」模式,自动去除口头填充内容,生成更适合字幕、笔记和发布的文本。

  • 支持对话中的语言混说: 模型可处理同一段对话自然切换不同语言的情况,包括 Hinglish、Spanglish 等常见混说组合;同时继续支持关键词偏置,可针对人名、缩写和领域术语提高识别准确率。

  • 长音频推理速度提升约一倍,价格降至每小时 0.10 美元: 官方对比显示,1 小时音频的模型推理时间由 MAI-Transcribe-1.5 的约 20 秒缩短至 10 秒;限时价格从每小时 0.36 美元降至 0.10 美元,该价格持续至 2026 年底。

  • 60 种语言 FLEURS 平均 WER 为 5.2%: MAI-Transcribe-2 在 FLEURS 60 种语言评测中排名第一;在 Artificial Analysis 的 WER 榜单中以 2% WER 排名第二,较上一版的 2.4% 进一步降低。


模型:

https://microsoft.ai/models/mai-transcribe-2/


博客:

https://microsoft.ai/news/mai-transcribe-2-is-the-fastest-most-accurate-and-cheapest-speech-recognition-model-in-the-world/



2、港中深、NUS、NVIDIA 等开源交互式视频世界模型体系 SolarWM:统一 143 万段视频训练流程,覆盖 5B–33B 四种模型


香港中文大学(深圳)、新加坡国立大学、香港中文大学、香港科技大学、NVIDIA、UCLA、微软亚洲研究院等团队开源 SolarWM,一套覆盖数据整理、模型训练到长时实时推理的交互式视频世界模型体系。项目将 143 万段异构视频统一成同一套交互训练格式,并用一套训练框架适配 Wan2.2、LTX-2.5 和 MiniMax-H3,形成四个 5B–33B 规模的世界模型。


  • 先把分散的世界模型数据统一起来: SolarWM 对 143 万段视频统一整理视觉画面、相机几何参数、文本描述、质量信息和数据来源等字段,把原本格式、镜头参数和标注方式不同的数据转换成同一套逐帧对齐格式,使不同视频骨干可以复用同一套数据处理和训练流程。

  • 一套框架覆盖四种不同规模的视频骨干: 当前支持 SolarWM-Wan-5B、SolarWM-Wan-14B、SolarWM-LTX-2.5 和 SolarWM-MiniMax-H3,参数规模横跨 5B–33B,同时尽量保留不同基础模型原有的表示方式和训练目标,而不是为每个模型重新搭建一套世界模型训练代码。

  • 用三阶段流程把双向视频模型改造成可交互的自回归世界模型: 训练依次经过双向适配、教师强制自回归初始化和分布匹配蒸馏。其中最后阶段让模型在自身生成的历史画面上继续训练,把原本面向完整视频生成的模型转换成可以持续接收控制并向前生成的因果模型。

  • 只训练 5 秒视频,也能连续运行数分钟甚至数小时: SolarWM 的训练序列只有 5 秒,但最终模型可以进行分钟级到小时级的实时连续生成,无需额外使用长视频微调或专门的长上下文机制,重点解决交互式世界模型长期运行时的误差累积问题。

  • 数据、代码、训练流程和模型权重均已开放: 项目已发布数据处理管线、训练与推理代码及模型权重;其中 Wan2.2-5B 已开放三个训练阶段的完整权重,其余 14B、LTX-2.5 和 MiniMax-H3 当前开放双向模型权重,后续训练阶段仍在补充。


https://junchao-cs.github.io/SolarWM-Web/


3、通义千问团队、华中科技大学开源自动驾驶视觉语言基础模型 Qwen-Drive-1.0:4B 模型统一 3D 感知、视觉问答与运动规划

图片


图片


通义千问团队与华中科技大学推出并开源 Qwen-Drive-1.0,一款面向自动驾驶的 4B 视觉语言基础模型。它以 Qwen3.5-4B 为共享视觉语言骨干,在不改动原有模型架构的情况下外挂鸟瞰图(BEV)感知头和规划专家,让同一套模型表示同时服务于 3D 环境感知、驾驶场景问答和车辆运动规划。

  • 把感知、理解和规划放进同一模型: BEV 感知头同时完成 3D 目标检测、语义占用预测和地图分割;原有语言模型负责通用及驾驶场景视觉问答;规划专家则读取共享视觉语言表示,预测自车未来行驶轨迹。

  • 不改 Qwen3.5 主干,通过外挂模块扩展驾驶能力: Qwen-Drive-1.0 保留预训练 Qwen3.5-4B 的主体架构,仅增加约 0.5GB 的 BEV 感知模块和约 2.1GB 的规划专家权重。这种设计让模型获得自动驾驶专用能力的同时,尽量保留原有通用视觉理解和指令遵循能力。

  • 规划提供直接输出和「先推理再规划」两种路径: 官方开放监督微调版和强化学习优化版两套规划专家;前者同时支持直接规划和推理后规划,后者针对带推理过程的规划进一步优化。模型因此可以直接生成未来轨迹,也可以先解释驾驶场景与决策依据,再输出规划结果。

  • 训练数据也统一跨数据集格式: 团队将不同自动驾驶数据集中的感知标签映射到统一类别体系,同时统一视觉问答答案格式和车辆轨迹表示,再与通用视觉语言数据共同训练,减少模型获得驾驶专用能力后对原有通用能力的遗忘。

  • 模型、代码和 Demo 已开放: Qwen-Drive-1.0-4B 以 Apache 2.0 许可证发布,GitHub 同时提供视觉问答、规划、3D 感知和评测代码,以及可直接运行的 Waymo 驾驶场景 Demo。


https://github.com/QwenLM/Qwen-Drive-1.0





02 有亮点的产品



1、YC F25 智能眼镜公司 AirCaps 推出音频研究实验室:开发全流式远场语音模型,可在消费级硬件端侧运行


YC F25 智能眼镜公司 AirCaps 正式推出 AirCaps Audio Research Lab,开始将其面向真实线下环境积累的音频能力扩展成一套全流式语音与音频模型体系,覆盖目标说话人提取、远场语音增强、说话人区分与识别、重叠语音分离和语音转文本。与主要针对干净近场音频优化的语音系统不同,AirCaps 将重点放在远距离、混响、低信噪比、多人同时说话等真实声学环境。


  • 从 ASR 扩展到整条真实世界音频处理链路: AirCaps 不只做语音转文本,而是从前端的目标说话人提取、远场增强和重叠语音分离,一直到说话人归属与最终转录,希望让模型直接处理未经清理的复杂现场音频。

  • 所有能力都面向流式和端侧场景设计: AirCaps 表示,这些模型能够持续处理实时进入的音频,并在消费级硬件上运行,而不是完全依赖云端批量处理。这与其智能眼镜产品需要持续监听线下对话、实时显示字幕的工作流直接相关。

  • 公开了针对噪声、远场和多人会议的 ASR 鲁棒性评测: AirCaps 发布的 A5Sv2 流式 ASR Benchmark 覆盖 Mega-ASR、AMI、DiPCo 和 NOTSOFAR 四套公开数据。在其自建测试协议下,A5Sv2 在 Mega-ASR 噪声与远场集合上的 WER 为 19.68%,低于 ElevenLabs Scribe v2 Realtime 的 22.64%、OpenAI GPT Live Transcribe 的 27.81% 和 Google Chirp 3 Streaming 的 34.68%;但在四套数据整体平均成绩上,ElevenLabs 仍排名更高。

  • 研究方向来自智能眼镜真实部署中的问题: AirCaps 原本提供实时字幕、翻译和线下会议 AI 助手,官方称其已处理超过 1.65 万小时真实线下对话。团队表示,在咖啡馆、餐厅、多人讨论等环境中测试现有云端语音模型时,噪声、混响和重叠语音仍会显著影响转录,因此将这些问题独立成新的音频研究方向。


https://research.aircaps.com



2、YC F25 个人 AI 助手 Caddy 从桌面语音控制转向 iMessage:可主动读取工作上下文并替用户执行任务

两位前 Loom AI 产品负责人创立的 YC F25 项目 Caddy,正在把产品从最初的「用语音控制电脑」转向常驻 iMessage 的个人 AI Agent。用户无需下载独立 App,只需像给联系人发消息一样与 Caddy 对话,它会持续学习用户的工作方式和关注事项,并连接 Gmail、Google Calendar、Slack、Linear、Todoist 等工具完成后续操作。


  • 从「语音操作电脑」转向「消息里的长期个人 Agent」: Caddy 最初以桌面语音界面切入,能根据屏幕内容,用语音创建 Linear 工单、发送 Slack 消息或安排会议;当前产品则把 iMessage 作为主要入口,用户可以通过文字、语音留言甚至群聊持续与 Agent 交互。

  • 不再只等用户下指令,而是主动追踪工作上下文: Caddy 可以关注用户授权连接的日历、消息和任务,在有事项需要处理时主动发消息提醒;对于提醒、日程准备和部分任务,还可以提前规划下一步,而不是每次都从一个 Prompt 开始。

  • 消息可以直接转成跨应用操作: 用户可以让 Caddy 查询邮件、起草回复、创建或修改日历事件、跟踪 Slack 与 Linear 中的事项;涉及发送邮件、修改日程等敏感操作时,系统会先要求用户确认。

  • 两位创始人此前负责 Loom 的 AI 产品与设计: Connor Waslo 和 Rajiv Sancheti 在创办 Caddy 前均在 Loom 工作约四年,分别负责 AI Suite 的产品和设计。Caddy 目前处于公开测试阶段。


https://caddy.app/



3、OpenAI 发布旗舰模型 GPT-6 Astra:强化电脑操作与长任务执行,Codex 可跨上下文保存并检索工作记忆


OpenAI 发布新一代旗舰模型 GPT-6 Astra,重点提升电脑操作、软件工程、浏览器使用和复杂专业任务执行能力。相比 GPT-5.6 Sol,新模型不仅在多项推理与代码评测上提升,更明显的变化是能够更快完成跨应用、多步骤工作流,并在长任务中更稳定地理解用户意图和持续接受中途调整。


  • 电脑操作速度和成功率同时提升: 在 OSWorld 2.0 中,GPT-6 Astra 得分从 GPT-5.6 Sol 的 65.7% 提升至 72.6%;OpenAI 的延迟模拟显示,单个任务平均耗时从约 75 分钟缩短至约 40 分钟,时间减少约 47%。模型可直接完成填写网页表单、操作 CRM、整理日历、安装软件和浏览器测试等任务。

  • Codex 引入跨上下文工作记忆,不再只靠压缩摘要维持长任务: 当上下文窗口用满后,Astra 可以持续保存工作笔记,同时让此前的上下文保持可搜索;后续可以重新检索早期需求、测试结果和工具输出,即使这些信息没有被写进压缩摘要。这项机制主要面向大型重构、长时间调试等持续数个上下文窗口的 Coding Agent 任务。

  • 中途修改需求时更不容易「丢掉原任务」: OpenAI 表示,上一代模型有时会把用户的补充指令当成新的目标;Astra 则能够在保持原有任务约束的同时接受新要求、回答旁支问题并继续执行。对于信息缺失的任务,它也会区分普通细节与关键决策:前者可自行补全,后者则主动询问用户。

  • 代码和专业工作能力进一步向 Agent 场景倾斜: Terminal-Bench 4.0 从 GPT-5.6 Sol 的 37.3% 提升至 57.9%,AutomationBench 从 18.1% 提升至 41.4%;模型同时针对文档、表格、演示文稿和数据分析等专业工作进行了强化训练。

  • API 型号为 gpt-6-astra GPT-6 Astra 将通过 OpenAI API、Microsoft Azure 和 AWS Bedrock 提供,标准 API 价格为每百万输入 Token 10 美元、输出 Token 50 美元;另提供最高约 2 倍速度的 Fast 模式,价格为标准模式的 2 倍。


https://openai.com/index/gpt-6-astra/



4、前 OpenAI CTO 创立的 AI 公司 Thinking Machines Lab 洽谈至少 10 亿美元融资:投前估值至少 400 亿美元,Accel 拟领投

图片


前 OpenAI CTO Mira Murati 创立的 Thinking Machines Lab 正在洽谈新一轮至少 10 亿美元融资,投前估值至少 400 亿美元,现有投资方 Accel 正洽谈领投,Nvidia 也讨论过参与。若交易完成,这家成立不到两年的 AI 公司估值将较 2025 年首轮融资时的 100 亿美元投前估值增长至约 4 倍。


  • 估值较首轮融资大幅跃升,但低于去年底目标: Thinking Machines 2025 年 7 月曾由 a16z 领投 20 亿美元,当时投前估值为 100 亿美元;去年底公司一度讨论以超过 500 亿美元估值融资 40 亿至 50 亿美元,此次拟议估值则回落至至少 400 亿美元。

  • 融资发生在首款开放权重模型 Inkling 发布之后: Thinking Machines 于今年 7 月推出首款模型 Inkling。模型权重可免费使用,公司主要通过向企业提供模型定制工具收费,帮助客户利用自身数据适配包括 Inkling 在内的 AI 模型,而不是单纯依靠模型 API 收费。

  • The Information 称其年化收入已达数亿美元: 报道援引知情人士称,Thinking Machines 当前年化收入至少达到数亿美元。按至少 400 亿美元估值计算,其估值相对于收入仍处于较高水平。

  • 新资金将继续投入模型训练和算力: 融资资金预计用于训练自有模型、租用服务器和扩充团队。今年 3 月,Nvidia 已宣布对 Thinking Machines 进行未披露金额的投资,并建立长期、吉瓦级战略合作关系,进一步保障其训练和推理所需算力。


(@The Information)



5、Google 上线 Gmail Live、Docs Live 与 Keep Live:把实时语音对话扩展到邮件查询、文档创作和笔记整理


Google 正式将此前在 I/O 预览的 Gemini 音频能力带入 Gmail、Docs 和 Keep,推出 Gmail Live、Docs Live 与 Keep Live。相比传统语音输入只负责「把说的话变成文字」,新的 Live 入口支持用户与应用持续对话,并直接基于当前 Workspace 内容完成搜索、写作和整理任务。


  • Gmail Live 可直接用语音查询邮箱内容: 用户可以连续提问「我的航班登机口是多少」「这周孩子学校有什么安排」等问题,Gmail Live 会检索邮箱中的相关邮件并直接返回答案,不需要手动输入关键词和逐封翻找。

  • Docs Live 从语音听写升级为实时共同写作: 用户可以直接口述想法,由 Docs Live 一边对话一边整理结构、起草文档和调整语气;在获得授权后,还能调用 Gmail、Drive、Chat 和网页中的相关信息补充内容。

  • Keep Live 将自由口述自动整理成结构化笔记: 用户可以直接进行长段、无结构的口述,系统会在后台理解内容,再整理成列表和可执行笔记,而不是简单保存一份逐字转录。

  • 从 I/O 预览进入正式上线阶段: 三项能力本周开始陆续开放,意味着 Google 正把实时语音交互从 Gemini 独立体验进一步嵌入 Workspace 的日常工作流。


https://blog.google/products-and-platforms/products/workspace/voice-features-gmail-docs-keep/





03 有态度的观点



1、奥特曼:OpenAI 将开发人形机器人

图片


OpenAI CEO 山姆·奥尔特曼在《Sources with Alex Heath》播客中表示,OpenAI 「一定会做人形机器人」,同时也会研发其他形态的机器人。这是他首次明确确认 OpenAI 将开发自有的人形机器人本体。


奥尔特曼解释称,现有的门、键盘、设备和厨房都按照人类身体构造,因此人形结构有利于机器人适配现实环境。但在数据中心等场景,OpenAI 会选择更适合具体任务的非人形设计。


他认为,机器人的外形最终仍要服务于「让机器人工作的大脑」。面对行业对机器人外形路线的不同判断,奥尔特曼把机器人的「大脑」放在机身之前。


他表示,OpenAI Robotics 的基础是机器人硬件研究与机器学习的共同设计;团队招聘方向涵盖全栈硬件、系统、机器学习和运营,目标是让模型能在真实物理环境中完成任务。


他把「每个人都拥有能完成各种任务的个人机器人」描述为长期目标,短期重点则是支持数据中心和其他基础设施建设。OpenAI 今年早些时候已组建内部机器人团队,并招聘机电执行器、仿真管线和数据收集等方向的工程师。


(@APPSO)




04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)



1、 北京招募 AI 主题《Talk With》桌游主持人!

图片


10 月底,我们又要在北京开玩 AI 主题桌游 《Talk With|聊天能解决的事儿》 啦,这次想从开发者社区里招募几位桌游主持人,一起把现场带起来~


作为主持人,你主要需要:


  • 给一桌 3–5 位玩家讲解规则、带大家完成游戏

  • 控制每轮节奏,推动竞拍、路演和投票

  • 最重要的是——会聊天、带气氛,让一桌陌生开发者迅速玩起来


不用是资深桌游玩家,我们会提前带大家熟悉完整玩法,帮助你开启主持人之路~如果你对 AI / Voice AI / 开发者社区 / 桌游感兴趣,就非常适合来!


地点:北京


时间:10 月底


想来当主持人的朋友,可以直接私聊我报名~这次不只来玩一局,而是来当那个让整桌人都玩嗨的人

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

图片

作者提示: 个人观点,仅供参考

注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    // 相关帖子
    Coming soon...
    • 0
    Thinking Machines Lab 洽谈 10 亿美元融资,估值 400 亿美元丨日报RTRTE_Dev_Comm