视频生成跨越实时门槛,MiniMax H3 Max 开启无限 AI 直播丨日报

本期编辑:@三水、@鲍勃

01 有话题的技术


1、Anthropic 开放硬件标准 MHS 研究预览:让 AI Agent 统一操控实验设备,硬件集成从数周缩短到数小时

Anthropic 开放 Model Hardware Standard(MHS)研究预览,一套让 AI Agent 安全操作现实硬件的统一规范。它将显微镜、移液工作站、机械臂等不同设备转换成统一接口,让 Agent 可以同时发现、读取和控制多台设备;Anthropic 表示,过去往往需要数周甚至数月的硬件集成工作,可缩短到数小时或数分钟。

  • 给不同硬件增加统一「驱动层」: MHS 将设备能力抽象成 readwrite 等基础操作,并自动生成包含设备能力、可调参数和安全限制的描述文件,让 Agent 面对没见过的设备时也能理解如何操作。

  • Agent 可通过 MCP、命令行和代码统一控制设备: MHS 本身不绑定 Claude,任何模型和 Agent Harness 都可以通过 MCP 等标准协议接入;多台设备还能被编排成一条连续工作流。

  • 从调用硬件 API 进一步走向闭环实验: Agent 可以读取设备实时状态、调整参数、监控实验结果,并在部分情况下自主恢复硬件错误;对于需要高速或长时间运行的操作,还可以把学到的流程写成确定性代码执行,而不是每一步都重新推理。

  • 已进入真实实验室与制造场景测试: Genentech 使用 MHS 协调移液设备、机械臂和酶标仪完成蛋白实验;华盛顿大学团队则用它让 Claude Code 实时监控 qPCR,并协调机械臂与移液设备完成样品交接。


MHS 目前仅向首批科研实验室和先进制造企业开放 Research Preview,Anthropic 计划在完成安全评测和最佳实践验证后进一步开源。


https://www.anthropic.com/news/model-hardware-standard-research-preview


2、MiniMax 推出 H3 Max Live:视频生成速度快于实时播放,聊天室一句 Prompt 数秒改写「无限直播」

MiniMax 展示基于 H3 Max 的实时 AI 直播形态 H3 Max Live:观众在聊天室输入 !prompt,模型会在几秒内生成下一段带声音的视频并直接接入直播流,让节目内容随着观众指令持续变化。H3 Max 生成 5 秒、768p 音视频不到 3 秒,已经快于实际播放速度,因此上一段视频播放时,系统就能提前生成下一段,把视频模型从「一次生成一个片段」推进到可以持续运行的实时内容系统。


  • 生成速度跨过实时门槛: H3 Max 支持 480p / 768p、5–15 秒、24fps 音视频生成,其中 5 秒 768p 不到 3 秒完成,15 秒内容约 15 秒生成。

  • 观众直接参与节目编排: Twitch 等 Demo 中没有固定节目单,观众输入新 Prompt 后,系统会结合当前画面生成下一段场景,直播可以从街景、广告、动画持续跳转到新的内容。

  • 从「视频生成」变成「持续内容流」: fal 已针对 H3 做实时生成后训练和推理优化,使模型可以被接入生成队列、编码和推流链路,而不是生成完一个文件再手动播放。

  • H3 Max 已进入开放平台: H3 Max 768P、480P 现已接入 MiniMax 开放平台和 MiniMax Design,开发者可以进一步搭建 AI 电视台、互动直播和持续生成应用。


https://x.com/fal/status/2094286082275696880


(@Minimax @fal@X)


3、Reactor × Hao AI Lab 开源无限 AI 直播系统:观众发 Prompt,FastH3 实时生成 768p 音视频并持续推流

Reactor 与 Hao AI Lab 基于 FastVideo 的 FastH3 搭建并开源了一套端到端「无限 AI 直播」系统。观众可以直接在 Twitch 或 YouTube 聊天室输入 Prompt,LLM 将想法扩展成连续场景,再交给 FastH3 生成带同步音频的 768p 视频片段,并通过 RTMP 无缝接入同一条持续直播流。

  • 完整直播链路全部开放: 仓库覆盖聊天室输入、Prompt 扩写、场景编排、视频生成队列、播放调度和 RTMP 推流,不只是单独开放一个视频模型 Demo。

  • 生成端使用 FastH3: FastH3 基于 MiniMax H3 蒸馏,将原本 49 次 Transformer Forward 压缩到 4 次,并使用 90% 稀疏视频注意力;8 张 B200 可在 13 秒内生成 15 秒、768p 音视频,达到快于实时播放的生成速度。

  • 模型生成与直播系统分开部署: FastH3 运行在 Reactor Runtime 的 8×B200 环境,直播客户端则负责「聊天 → 场景 → 生成队列 → 推流」,普通机器安装 ffmpeg 即可运行客户端,两部分通过 Reactor SDK 和 WebRTC 媒体轨道连接。

  • 代码采用 Apache 2.0 开源: 直播系统代码已完整公开;FastH3 模型权重则继承 MiniMax H3 Community License,开发者可以直接复现并改造成自己的 AI 电视台或互动直播。

https://haoailab.com/blogs/fasth3-preview/

4、开发者用 Codex + fal H3 数小时搭出「无限 TikTok」:边刷边实时生成视频,观看中还能续写到 30 秒

开发者 Rames Jusso 用 OpenAI Codex 在数小时内完成了一款支持无限滚动的 TikTok 式应用,视频内容由 fal 上的 H3 模型实时生成;从界面搭建、功能实现到演示录屏,整个流程基本交给 Codex 自动完成。产品不是预先准备固定视频库,而是在用户持续下滑时动态生成下一条内容;当用户停留观看某段视频时,系统还可以继续向后生成,把原本较短的片段延长到约 30 秒,展示了实时视频模型开始从「一次生成一个片段」转向持续内容流的可能性。

https://x.com/Rames_Jusso/status/2094160939776155706

(@Rames_Jusso@X)


5、NUS、NTU 等提出情感 TTS 系统 EmoTra-TTS:一句话内可从「开心」平滑过渡到「愤怒」,情绪转换质量最高提升 87%

新加坡国立大学、南洋理工大学、LIGHTSPEED 等研究团队提出 EmoTra-TTS,并已被 EMNLP 2026 主会接收。不同于常见 TTS 为整句话指定一个固定情绪,EmoTra-TTS 将情绪建模为随时间连续变化的轨迹,让同一句语音可以从「开心→愤怒」「惊讶→悲伤」等状态自然过渡,并允许开发者明确控制变化方向与强度。

  • 把情绪从离散标签变成连续轨迹: 系统使用 VAD(愉悦度、唤醒度、支配度)描述句首和句尾情绪,并在整句话内部连续插值,使情绪变化发生在帧级,而不是把两段不同情绪的音频直接拼接。

  • 在 CosyVoice2 上增加两阶段情绪控制: 第一阶段让 LLM 学习整句话的情绪变化趋势,第二阶段再把帧级情绪信号注入声学生成过程;新增参数仅约 0.43%,论文称不会增加额外推理延迟。

  • 专门解决「情绪过渡数据难录」的问题: 团队先用多次 Flow 解码生成时间严格对齐、但情绪不同的语音,再在频谱空间平滑融合,自动构造大量「句中情绪发生变化」的训练样本。

  • 论文实验显示情绪过渡质量明显提升: 相比 4 个 SOTA 基线和 ElevenLabs v3、gpt-4o-mini-tts 两个商业系统,EmoTra-TTS 的情绪转换质量相对提升 30%–87%;成对主观偏好测试中的整体胜率达到 64.4%–79.5%

  • 完整训练与数据处理代码已开放: 项目公开了数据合成、训练、推理和评测流程,并提供多组「惊讶→悲伤」「开心→愤怒」「愤怒→恐惧」等音频样本供直接对比。


https://liu-tianchi.github.io/EmoTra_DemoPage/



02 有亮点的产品

1、开源车载 AI 项目 CarWatch 0.4:Raspberry Pi 5 本地跑完整语音 Agent,断网也能直接问车况

CarWatch 0.4 新增完整车内语音交互链路:驾驶者说出「Hello car」即可提问,Raspberry Pi 5 在车内本地完成 VAD、whisper.cpp 语音识别、35B 级模型推理和语音播放,并结合 OBD 实时数据、车辆云端信息和 489 页车主手册回答问题;演示中最后一个问题在完全断网状态下完成。项目使用约 300 欧元硬件,AGPL 开源,可适配带 OBD 接口的车辆。

https://github.com/ThinkOffApp/CarWatch

2、开源爆款小智 A I 孵化「龙树智能」获天使轮融资,首发 AI 代接电话硬件:金沙江创投、泓川源资本参投

由 GitHub 开源项目「小智 AI(xiaozhi-ESP32)」团队孵化的龙树智能完成天使轮融资,投资方为金沙江创投与泓川源资本。这家公司 2026 年 2 月成立,团队此前已通过开源社区积累百万级设备接入、数十万开发者和日均近千万次真实对话,开始把这套实时语音交互与设备连接能力进一步产品化。

图片


  • 从开源 Voice AI 社区走向商业产品: 小智 AI 生态长期围绕 ESP32 等低成本硬件提供实时语音交互方案,龙树智能则试图将已有的设备连接、低延迟音频和云端 AI 服务能力转向消费级与企业级硬件。

  • 首款消费硬件 TonoCard 主打「AI 代接电话」: 设备磁吸在手机背面,通过蓝牙获取通话音频,可根据用户预设规则主动询问来意、过滤骚扰和推销,再将重要信息整理给用户;需要本人处理时,可震动提醒并切回真人接听。

  • 同时布局 AI 应用生成与边缘硬件: TonoBraid 面向「说需求—AI 生成应用—直接运行」的 AI 原生应用开发,另有面向制造、仓储、园区和零售等场景的边缘侧 AI 硬件方案。


https://github.com/78/xiaozhi-esp32


(@AING 硬迹)


3、开发者开源语音控制 MIDI 工具 midi-voice:直接对合成器说「加贝斯、换音色、开始循环」,AI 自动编排并演奏

开发者 jia-seed 将 Roland Juno-D8 合成器接入浏览器,用语音直接控制 MIDI 演奏和循环编排:语音先由 Web Speech API 转成文字,再交给 Claude Sonnet 4.6 理解成 start_loopadd_trackplay_chordprogram_change 等 MIDI 工具调用,通过 Web MIDI API 直接发到合成器。系统会保留当前循环中的调性、BPM 和已有声部,因此用户继续说「加一个管乐」「让它更暗」「多一点混响」时,模型会在现有编曲基础上补充新的声部,而不是只执行单次按键命令。


https://github.com/jia-seed/midi-voice


(@jia_seed)




03 有态度的观点

1、马斯克回应 OpenAI「断供」Cursor:毫不在意

图片


OpenAI 宣布,已通知 SpaceX,计划逐步终止向 Cursor 直接提供 OpenAI 模型的合同,拟定停止日期为 2026 年 11 月 12 日。


OpenAI 表示,这一日期已经用足合同规定的通知期限,受影响的主要是通过 Cursor 订阅直接调用其模型的开发者。现有模型直连在拟定日期前仍可继续使用,但 OpenAI 不会再向 Cursor 提供未来模型,包括尚未发布的 Astra。


对此,马斯克在 X 上只回了一句:「毫不在意。」


随后他继续开火,称 OpenAI CEO Sam Altman 和总裁 Greg Brockman「完全不值得信任」,并再次指责两人「偷走了一个开源非营利组织」。


马斯克与 OpenAI 的矛盾也因此进一步升级。此前马斯克已向 OpenAI 发起 1500 亿美元索赔诉讼,指控 OpenAI 与 Altman 背弃最初的非营利使命;OpenAI 则反驳称,马斯克过去曾试图夺取公司控制权。




04 社区黑板报


招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)


1、 Data for AI Meetup 议程升级|新增 AWS OpenSearch,7 位嘉宾阵容完整公布

前两天和大家推荐过的 9 月 5 日上海 Data for AI Meetup,这两天议程又升级了。


这次新增 AWS OpenSearch AI 研发经理 Charlie Yang,将从 Agentic Search、Agent Memory 到 Agent 可观测性,分享 OpenSearch 围绕 Agent 构建的完整搜索生态。


目前阵容已升级为 7 位嘉宾,来自 Datastrato、腾讯、Zilliz、AWS OpenSearch、Apache Doris、Red Hat,完整覆盖 语义层、元数据与取数、检索、Agent Memory、数据库内核与 AI 全栈基础设施


 9 月 5 日|上海前滩  

活动免费,限 100 人  

 报名截止延长至 9 月 2 日 24:00


[议程升级] Data Agent、语义层、元数据与检索,一场围绕开源 AI 数据基础设施的技术聚会 | 9/5 上海见



图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示:个人观点,仅供参考

注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    关键词
    // 相关帖子
    Coming soon...
    • 0
    视频生成跨越实时门槛,MiniMax H3 Max 开启无限 AI 直播丨日报RTRTE_Dev_Comm