Vivix 发布流式多模态模型 Vivix-W1:边生成边用语音、触控实时改写丨日报

本期编辑:@三水、@鲍勃


01 有话题的技术

1、Vivix 推出流式多模态互动模型 Vivix-W1:生成过程中可随时加入语音、触控与图像,实时改变后续

Vivix 推出流式多模态互动模型 Vivix-W1,将视频生成从「输入提示词 → 生成固定片段」改成持续运行的音视频流。文本、语音、图像、视频、触控和相机运动等输入都可以在生成过程中继续加入,并从当前世界状态直接改变后续内容,无需重新开始生成。


  • 交互信号可以在生成过程中持续进入: 用户不仅能控制相机和角色移动,还可以直接点击或触摸画面中的对象,输入新的文字、语音、图片或视频;这些输入会加入当前上下文,改变接下来生成的音视频片段,而不是重新生成一个独立视频。

  • 音频、视频与交互统一在一个流式生成架构中: Vivix-W1 不再把视频生成、音频生成和交互理解拆成独立模块,而是联合处理场景状态、动作、声音、参考素材和实时控制信号,并原生同步生成画面、对白、环境声和空间音效。

  • 支持连续多镜头叙事: 模型可以在持续生成过程中自行安排镜头切换、视角和相机运动,并协调对白节奏、角色反应和动作,让交互后的内容继续沿当前故事发展,而不是由多个孤立片段拼接而成。

  • 约 300 亿激活参数,交互响应达到秒级: 当前版本在中等训练规模下验证,约有 300 亿激活参数。Vivix 表示模型能够维持长时间场景一致性,并对实时输入进行秒级响应;同时通过 Vivix-Turbo 的低步数蒸馏和长序列一致性优化,降低持续生成中的角色、场景和镜头漂移。


https://vivix.ai/vivix-w1



2、索尼、巴黎电信学院等团队开源音频描述数据集 SonicCaps:1500 万条描述覆盖 70 万段音频,每段平均约 24 种风格

索尼、巴黎电信学院等团队开源音频描述数据集 SonicCaps,一个面向音频—文本学习的大规模细粒度音频描述数据集。它不再为一段声音只配一条「标准答案」,而是为约 70 万段音频生成,配约 1500 万条描述,平均每段音频对应约 24 种不同粒度、风格和措辞的描述,用多种语言表达同一声音中可能被注意到的不同信息。


  • 从「一段音频一条描述」改成一对多监督: SonicCaps 同时提供主要描述、不同详细程度和风格的改写,以及语义标签,让训练数据更接近真实听觉感知——同一段声音可以有多种都合理的描述方式。

  • Qwen3-Omni 同时读取音频和已有文本生成描述: 数据构建采用 Qwen3-Omni,通过「强调内容准确性 → 扩展描述多样性 → 后处理」的三阶段流程生成描述,重点补充背景环境、声音质感、时间变化和强弱等传统音频描述容易忽略的声学细节。

  • 多描述训练直接改善音频检索: 论文在 CLAP 模型训练中随机采样同一音频的不同描述,相比单描述训练,在音频—文本检索和零样本分类上取得持续提升;团队同时发布了面向音频检索和人类主观评分对齐的两款 SonicCLAP 模型。

  • 公开的是描述和音频标识符,而非全部原始音频: SonicCaps 数据来源覆盖 FreeSound、AudioCaps 等多类音频资源;受原始音频版权限制,目前发布的数据主要包括生成描述及对应音频标识符。


https://huggingface.co/datasets/Zineb/SonicCaps



3、首尔大学 Human Interface Lab 发布 10 亿参数音频语言模型 Sori-1B:语言模块不做纯文本预训练,所有输出都基于音频学习

图片


首尔大学 Human Interface Lab 发布音频语言模型 Sori-1B。它可以对语音、音乐和环境声音进行转写、描述、问答、说话人区分和事件定位,但更特别的是训练方式:模型的语言部分没有单独接受纯文本预训练,每个文本 Token 都是在音频作为上下文的情况下学习得到,试图减少音频语言模型「没认真听声音,也能靠语言先验猜对答案」的问题。


  • 不是只做 ASR,而是统一处理多类音频理解任务: Sori-1B 可处理语音、音乐和环境声音,支持转写、音频描述、问答、说话人标注转录、事件时间定位和声音计数等任务,最终统一生成文本结果。

  • 语言模块不从纯文本单独学习: 模型使用 NVIDIA Audio Flamingo Next 的约 6.37 亿参数音频编码器,并将其冻结;其余约 3.78 亿参数从头训练,训练过程中所有目标文本都带有音频上下文,没有额外加入纯文本语料。

  • 用 Python 函数形式组织不同音频能力: Sori-1B 将音频视为 Python 会话中的一个对象,转写、统计说话人数、判断事件是否发生等任务对应不同函数,返回字符串、数字、布尔值或带时间戳的结构化结果;这些函数还可以作为 MCP 工具暴露给上层 Agent 调用。

  • 训练规模为 5737 小时音频: 模型使用约 270 万段不同音频、353 万个训练样本,共覆盖 5737 小时声音数据。目前仅支持英语,模型权重开放,但许可限定为非商业研究用途。


https://huggingface.co/snkii/Sori-1B



02 有亮点的产品


1、OpenAI 打通 Codex Voice 与已有工作线程:可直接语音讨论正在进行的 PR 和架构,上下文无需另开会话


OpenAI 为 Codex Voice 补上已有工作线程支持:开发者现在可以打开一个正在进行或历史 Codex 线程,直接切到语音,与该线程中已经掌握代码、PR 和任务上下文的 Agent 继续讨论架构或下一步方案,再让同一个 Agent 接着执行。 Codex 此前已经支持通过 Voice 启动、查看和调度任务,这次的变化是语音不再局限于单独的协调会话,而是可以直接进入具体任务线程。OpenAI 工程师 Guinness Chen 还建议,实时讨论时使用较轻的推理模式,方案确定后再提高推理强度执行,新建 Voice 会话现在也会沿用当前选择的项目和模型。



2、Reca 推出面向印度长辈的语音伴侣:支持 15+ 本地语言,从聊天延伸到提醒与生活协助

Reca 是一款专为印度父母和祖父母设计的语音伴侣,重点不是「等用户下命令」,而是通过持续对话、记忆和主动提醒形成长期陪伴。官方产品目前支持 Hindi、Tamil、Telugu、Bengali、Marathi 等 15+ 种印度本地语言,可用于用药和日程提醒、家人消息、新闻与信息查询;创始人此次演示还进一步展示了游戏、订购杂货、制定学习计划等更主动的生活协助能力,把传统语音助手的「执行单条命令」推进到持续陪伴和任务协助。

https://www.heyreca.com/



3、Voice Cursor 发布 AI 听写工具 Voice Cursor 1.0:新增智能编辑,写完后可继续用语音修改文本


Voice Cursor 发布 Voice Cursor 1.0,核心变化是把语音从「生成初稿」延伸到后续编辑。过去用户听写完成后通常还要切回键盘修改,新版加入智能编辑:选中已有文本后,直接说出修改要求,即可完成改写、缩短、翻译、重新排版或修改某个具体细节,让「语音输入 → 语音修改」形成完整写作闭环。


  • 语音开始接管写作后的编辑阶段: 用户可以直接对选中的文本说「缩短一点」「换个语气」「翻译成另一种语言」或「修改这个名字/日期」,无需重新听写整段内容。

  • 编辑发生在当前应用内: Voice Cursor 继续以系统级听写工具的方式工作,智能编辑可直接作用于用户正在使用的文本区域,把原本「语音起草、键盘修订」的工作流改成全程语音操作。


https://voicecursor.ai


03 有态度的观点


1、OpenAI 首席科学家:没有一家 AI 实验室准备好继续全速扩展,未来「主动减速」应成为常态

图片


OpenAI 首席科学家 Jakub Pachocki 9 月 6 日发表长文《An Alien Mind》,提出了一个比「模型还会变多强」更直接的判断:目前没有任何一家 AI 实验室,在对齐和监控问题上做得足够好,可以长期负责任地以最大速度继续扩展模型。


Pachocki 认为,AI 的下一阶段很可能进入递归自我改进(RSI):模型越来越多地参与 AI 研究本身,帮助设计算法、改进训练方法乃至优化运行 AI 的计算基础设施。按照 OpenAI 的内部结果,他预计当前的进步速度有可能延续到这一阶段,未来几年的能力跃迁甚至可能不低于过去几年。


问题在于,人类理解和监控模型的速度,未必能同步增长。


OpenAI 此前把思维链监控视为重要手段:只监督模型最终完成得怎么样,而尽量不直接监督它的推理过程,从而保留观察模型真实推理的窗口。这也是 o1-preview 发布时不向用户展示完整思维链的重要原因之一。


但 Pachocki 表示,这扇窗口正在变得越来越不可靠。新一代模型开始能够推理甚至操纵自己的推理过程,同时越来越多智能可以在没有显式文字思维链的情况下产生;模型又不断与人、其他 AI 和工具交互,使「内部推理」与「外部行为」之间的边界越来越模糊。


我预计,通用 AI 的进一步进展将越来越受到「我们对监控能力有多少信心」的限制。


因此 Pachocki 给出的答案不是单纯加速,也不是彻底停止研究,而是把 AI 扩展速度与安全可信度绑定起来:一边利用更强的 AI 继续研究对齐和监控,一边在安全能力跟不上时主动放慢扩展速度。


他甚至明确表示,希望在行业建立共同安全门槛之前,AI 实验室自愿放缓训练成为一种常态,并认为未来 AI 开发需要更强的国际协调。


https://openai.com/index/an-alien-mind/



04 Real-Time AI Demo


1、开发者在 Apple Watch 上串起 ChatGPT Voice 与 Apple Notes:边聊边把内容写进笔记


开发者 Kosta Eleftheriou 展示了一个 Apple Watch 上的语音工作流 Demo:直接通过 ChatGPT Voice 与 AI 对话,并把需要保留的内容写入 Apple Notes。它不是 OpenAI 或 Apple 新发布的官方集成功能,而是开发者自己把语音交互从「问完即走」进一步接到具体应用动作上——用户不用拿出手机,也能在手腕上完成「说 → 理解 → 记录」的闭环。



https://x.com/keleftheriou/status/2095576889494774200



05 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)


1、 iRTE2026 定档啦!Voice Agent Builder 们,10 月北京集合~


今年从对话式 AI 一路聊到实时智能,现场有 15+ 论坛、100+ 场深度演讲,汇聚 150+ 全球技术领袖和行业专家,全双工+交互式模型、实时互动世界模型、AI 硬件、AI Coding 工具等方向都会集中开聊。


贾扬清也将返场 iRTE 大会,带来对 AI 行业前沿趋势和技术演进的最新观察~


目前大会门票限时免费开放!


想来现场听技术、认识同行的开发者,可以先把票薅上


时间:10 月 23–24 日


地点:北京悠唐皇冠假日酒店


限免结束后将恢复收费,建议先报名占位


定档!从对话式 AI 到实时智能,Voice Agent Builder 的年度春晚 iRTE2026 来了丨10 月23-24 日,北京见!


图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

图片

作者提示: 个人观点,仅供参考


注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    关键词
    // 相关帖子
    Coming soon...
    • 0
    Vivix 发布流式多模态模型 Vivix-W1:边生成边用语音、触控实时改写丨日报RTRTE_Dev_Comm