SigmaZ AI 融资数百万美元,实时交互视频可生成「活画面」丨日报

本期编辑:@三水、@鲍勃


01 有话题的技术


1、Kyutai 开源 Pocket TTS 完整训练系统:从数据处理到评测全部开放,可训练自己的 CPU 端 TTS


Kyutai 进一步开放 Pocket TTS 的完整训练链路,不再只是提供可在 CPU 上运行的 TTS 模型和推理代码。开发者现在可以从自己的语音数据出发,完成数据处理、模型训练、压缩和评测,训练新的语言或声音版本,再直接使用 Pocket TTS 的现有推理框架部署到 CPU 设备。


  • 完整训练链路开放: 新增数据准备、训练配置和 WER、说话人相似度、语音质量等评测工具;官方训练流程先训练 24 层模型,再压缩成最终的 6 层轻量模型。

  • 几百小时数据即可开始训练新语言: 官方示例使用 200 小时语音即可得到可理解的 TTS,约 2000 小时可达到更接近正式 Pocket TTS 的效果;同时给出了捷克语训练流程,包括语音文本对齐和分词器准备。

  • 训练成本进一步降到个人开发者可尝试的范围: 官方数据显示,8 张 H100 训练到 20 万步约需 8 小时,40 万步约 16 小时;单张消费级 GPU 也可以通过缩小 batch 完成训练。

  • 训练完仍可直接在 CPU 上部署: Pocket TTS 本身约 100M 参数,在 M4 MacBook Air CPU 上可达到约 6 倍实时速度,并支持流式生成和声音复刻,使社区训练的新语言或定制模型能够继续沿用轻量端侧部署路线。


https://github.com/kyutai-labs/pocket-tts



2、BreezeBlue 开放 Breeze TTS 2 模型权重与推理代码:3B 参数,支持声音设计、表演控制与低于 40ms 实时生成


BreezeBlue 的 Breeze TTS 2 以 1215 Elo 位列 Provider Voices 榜单所有 100+ 模型中的第 6 名,同时成为当前排名最高的开放权重 TTS 模型,比第二名 Fish Audio S2 Pro 高出 90 Elo。Breeze TTS 2 已开放模型权重和推理代码,并支持声音复刻、声音设计、表演控制与实时流式生成。


  • Provider Voices 开放权重模型排名第一: Breeze TTS 2 获得 1215 Elo,领先 Fish Audio S2 Pro 的 1125 Elo;在包括闭源服务在内的 100+ 模型中整体排名第 6。

  • 可控声音榜单同样进入第一梯队: 在 Controlled Voices 评测中,Breeze TTS 2 以 1002 Elo 位列开放权重模型第 3,与 Fish Audio S2 Pro 持平,仅比排名第一的 Mistral Voxtral TTS 低 8 Elo。

  • 从「复刻声音」扩展到直接设计和指导表演: 开发者既可以用参考音频复刻音色、节奏和情绪,也可以直接通过自然语言创造新声音,或在保持说话人身份的同时控制语气、情绪、语速和表达方式;文本中还可加入 [笑][咳嗽][叹气] 等声音事件。

  • 实时能力仍是核心定位: 在 NVIDIA H100 预热后的快速推理路径下,TTFA 低于 40ms,RTF 为 0.32,相当于约 3.1 倍实时生成;Artificial Analysis 测得其处理速度为每秒 45 个字符,低于 Fish Audio S2 Pro 的 102 个字符/秒。


https://huggingface.co/BreezeBlue/Breeze-TTS-2



3、浙大提出智能眼镜 L0–L5 统一框架,覆盖从第一人称感知到具身行动


浙江大学 APRIL Lab 发布智能眼镜综述,将其从「拍摄、显示设备」重新定义为持续连接用户感知、上下文记忆与数字/物理行动的第一人称智能平台。论文提出一套统一能力与评估框架,希望解决当前智能眼镜研究分散在硬件、第一人称视觉、多模态模型和具身智能等不同领域、难以横向比较的问题。


  • 用 L0–L5 划分智能眼镜能力: 从 L0 信息采集、L1 即时感知、L2 上下文辅助,逐步扩展到 L3 持续状态记忆、L4 可控的智能体行动和 L5 与外部物理系统形成具身协作,不再只以摄像头、显示屏等硬件规格衡量「智能程度」。

  • 把智能眼镜拆成 7 类相互依赖的基础能力: 包括第一人称感知、多模态上下文、持续空间状态、可追溯个人记忆、环境中的智能体行动、具身数据交互,以及贯穿其中的延迟、功耗、隐私等部署约束。

  • 进一步覆盖 9 类真实应用场景: 框架将日常辅助、无障碍、工业、医疗、教育、移动出行、社交协作、空间智能和具身智能等场景,与对应的数据集、Benchmark、系统能力及风险要求关联起来。

  • 同步维护智能眼镜研究资源库: GitHub 项目整理代表性智能眼镜产品、平台、数据集、Benchmark 和研究系统,并计划持续更新,方便开发者按硬件能力、智能等级和应用场景查找相关工作。


https://github.com/zhangzjn/awesome-smart-glasses



4、PixVerse 发布实时全模态世界模型 R2:统一长程生成与实时加速,支持文本、音频和动作持续控制世界演化


PixVerse 发布实时全模态世界模型 R2。相比 R1 主要验证「实时视频世界模型可以成立」,R2 重点解决这类模型如何持续扩展:将原本多阶段的训练流程收敛为统一的全模态因果自回归模型,再直接蒸馏到实时生成路径,使新增数据、任务和控制信号能够更直接转化为生成质量、长程一致性与实时交互能力。


  • 统一处理文本、参考内容、音频和动作输入: R2 在持续生成过程中可不断接收 Prompt、参考图像/视频、Audio 以及 WASD 等动作控制,并同步生成后续视频和音频,不需要切换不同模型或任务链路。

  • 针对长时间运行中的世界漂移重新设计记忆机制: 系统分别保存角色、场景等长期信息,近期动作与镜头状态,以及关键对象信息;同时把生成过程中出现过的错误状态重新加入训练,阶段性实验中长期亮度漂移指标从 0.201 降至 0.129。

  • 根据不同交互信号动态调整生成时间粒度: 动作控制使用更短的视频片段以快速响应,而完整事件、音频等可使用更长片段保持语义连续,让不同时间尺度的交互共享同一个生成框架。

  • 将完整世界模型直接加速到实时路径: R2 采用块稀疏注意力和由粗到细的少步生成方案,其中注意力稀疏度可提升至 90%+,当前评测中画面质量、动作连续性和长时稳定性未出现明显下降。


https://pixverse.ai/zh/blog/pixverse-r2-scaling-real-time-omni-world-models



02 有亮点的产品



1、YC W25 公司 Mundo AI 完成 2000 万美元 A 轮融资:为 AI 感知音频、视频和新兴模态构建数据与评测层


YC W25 公司 Mundo AI 完成 2000 万美元 A 轮融资,由 GreatPoint Ventures 领投,Y Combinator、E12 Ventures 和 Next Frontier Capital 参投;加上此前未披露的 400 万美元种子轮,公司累计融资 2400 万美元。Mundo 将自身定位为「感知智能」的数据基础设施,为 AI 实验室提供数据集、评测体系和研究框架,让模型不只理解转录后的文本,还能处理语气、表情、动作、时间关系和环境声音等真实世界信号。


  • 重点覆盖音频、视频和新兴模态: 当前工作包括自然 Speech-to-Speech 交互、细粒度视频理解,以及尚未形成成熟训练和评测方法的新模态数据。

  • 把数据与评测做成持续反馈闭环: Mundo 认为感知能力不能仅靠扩大模型规模获得,需要通过新的训练数据、更细致的评测方式持续发现模型「哪里没看懂、没听懂」,再反向改进模型。

  • 已服务前沿多模态模型研发: Mundo 表示其数据集和评测体系已经被多家领先 AI 实验室使用;新资金将主要用于扩充研究、工程和运营团队。


https://mundoai.world/research/perception-is-the-next-frontier



2、印度 Voice AI 公司 Ringg 获 Peak XV 追加 1000 万美元 A 轮融资,融资总额 1550 万美元:从电话 Agent 扩展到 WhatsApp、聊天与浏览器任务


印度 Voice AI 公司 Ringg 获 Peak XV Partners 追加 1000 万美元 A 轮融资,使本轮融资总额达到 1550 万美元。Ringg 最初以 DesiVocal 名义自研 TTS,后来因从头训练语音模型成本过高转向企业 Voice Agent;现在又进一步从「自动打电话」扩展为能够跨渠道完成实际业务任务的 Agent 平台。


  • 从简单外呼转向复杂业务流程: Ringg 早期主要做销售线索筛选、催收等高频电话任务,现在重点进入医疗预约、电商弃购召回、金融 KYC 和商户入驻等完整流程;其 Agent 已在 Practo 的 1200 家诊所中用于预约和诊后跟进。

  • Voice 不再是唯一交互入口: 电话目前仍占 Ringg 业务的 70% 以上,但平台已经扩展到聊天和 WhatsApp,并为 Shell 等客户自动处理浏览器中的客服请求,定位也从「企业 Voice Agent」转向「真正完成任务的 Agent」。

  • 当前仍以模型编排为主: Ringg 自研 ASR 和语音生成模型,也希望未来掌握完整语音技术栈;但现阶段考虑到训练和部署成本,产品会根据不同任务在多个模型之间动态选择和路由。

  • 企业使用规模持续扩大: Ringg 当前每月处理约 2000 万次电话尝试,客户包括 Cred、Flipkart、Practo、Groww 和 PolicyBazaar,并开始拓展中东及美国相关业务。


(@TechCrunch)



3、实时交互视频公司 SigmaZ AI 完成数百万美元融资:用扩散语言模型生成可实时修改的「活画面」

SigmaZ AI 完成数百万美元融资,资方包括蓝驰创投、云启资本、德迅投资、小小基金等。公司没有沿用纯像素视频生成路线,而是让扩散语言模型高速生成可执行的视觉代码,再与像素生成结合,使画面中的文字、图表、按钮、3D 对象等元素可以持续修改和交互,而不是视频生成后就完全固定。


  • 扩散语言模型把代码生成速度拉到实时交互所需的量级: 传统自回归模型逐 Token 生成代码,复杂视觉场景往往需要等待较长时间;扩散语言模型可并行修改整段 Token,SigmaZ 希望把节省出的时间用于多轮「生成—渲染—检查—修改」,即使加入这一过程,首帧仍可控制在数秒内。

  • 用 Code + Pixel 分别处理「结构」和「外观」: 代码负责文字、组件、状态、因果关系和交互等需要精确控制的内容,像素模型负责纹理、细节等开放视觉内容。下一阶段团队计划进一步推进 Pixel-Code 联合训练,让两种输出成为同一个世界模型的不同生成路径。

  • 让模型从每次修改中继续学习: 系统会把视觉评审模型发现的问题、代码修改过程和最终结果重新用于训练,同时持续校准评审模型,使推理阶段产生的「试错经验」逐渐沉淀进后续模型。

  • 首款产品 Tap8 计划 2026 年内推出: 产品定位为实时交互内容平台,用户面对的不再是一段只能观看的视频,而是可以当场点击、修改和持续生成的视觉内容。

  • 创始团队来自连续创业与 Amazon AGI Lab: SigmaZ 由 2003 年出生的剑桥连续创业者杨博麟(William)与 Derek Law 联合创办。杨博麟曾主导多个创业项目从零做到数千万元营收并完成一次退出;Derek Law 毕业于帝国理工计算机科学专业,曾参与 Amazon Alexa 早期研发,后担任 Amazon AGI Lab(伦敦)旗舰模型视觉代码训练技术负责人,并作为核心作者在 ICLR 2026 RSI 发表论文。


(@十字路口Crossing)



4、Fitbit 两位联创推出家庭健康手环 Luffu Link:无屏 + 独立 LTE,语音记录可与健康数据交给 AI 统一分析


Fitbit 联合创始人 James Park 与 Eric Friedman 推出新品牌 Luffu,首款产品 Luffu Link 将可穿戴设备从个人健康记录进一步扩展到家庭照护。手环本身不设屏幕,可独立通过 LTE 与 GPS 联网,并允许用户直接用语音记录吃药、症状和日常感受,AI 再将这些事件与心率、睡眠、活动量等数据整合到同一时间轴,向家人或照护者筛选需要关注的变化。


  • 把语音变成健康数据的一部分: 用户可通过按键直接记录「刚吃过药」「今天头晕」等生活事件,AI 将语音内容与可穿戴传感器数据放在同一时间线上,而不是只展示独立的运动和睡眠指标。

  • 脱离手机也能完成定位和求助: Luffu Link 内置 LTE 与 GPS,紧急情况下可直接向预设联系人发送位置和语音信息,更适合需要持续照护但不一定随身携带手机的家庭成员。

  • 产品围绕整个家庭而非单个用户设计: 配套服务以家庭订阅方式提供,标准版最多连接 4 人,并将多位家庭成员的健康变化集中到统一照护界面。

  • 首发价 249.99 美元: Luffu Link 当前已开启预售,正式零售价为 299.99 美元,预计 2027 年初开始交付;单次充电续航约 5 天,并支持 50 米防水。


(@AING硬迹)


03 有态度的观点


1、微软 CEO:企业不能把 AI 思考能力外包给单一模型


微软 CEO 萨提亚·纳德拉在 CNN 对话中表示,企业使用 AI 时不仅拥有「人力资本」,还会积累由提示词上下文、员工与模型的交互记录以及使用方式组成的「Token 资本」。这些知识应留在企业内部,而不能被绑定到单一模型或服务商。


他主张企业保留每次使用模型产生的元数据,以便训练自己的权重或模型;在技术架构上,还应把应用层与模型分开,把上下文和记忆从模型中独立出来,从而能够按任务使用不同模型,即使某个模型停止服务也不失去控制。


纳德拉认为,企业若没有这类控制能力,等于把自身思考外包出去,最终可能失去作为独立公司的基础。他同时把消费者市场与企业市场区分开来:面向消费者的免费服务可以存在以数据交换价值的模式,但持续创造专有知识的企业不应照搬这一逻辑。


(@APPSO)

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

作者提示:个人观点,仅供参考

注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    // 相关帖子
    Coming soon...
    • 0
    SigmaZ AI 融资数百万美元,实时交互视频可生成「活画面」丨日报RTRTE_Dev_Comm