西工大 ASLP 开源中文多方言 ASR 模型,缓解方言微调后的普通话能力退化丨日报

本期编辑:@三水、@鲍勃

01 有话题的技术

1、智象未来发布交互式世界模型 HiDream-O1-World:通过文本或图片生成可漫游 3D 世界,采用几何-外观两阶段扩散架构

智象未来发布交互式世界模型 HiDream-O1-World,可通过文本或图片生成可漫游、可编辑的 3D 世界。其相关研究 DreamWorld 入选 ECCV 2026,通过显式几何信息约束视频扩散过程,改善新视角生成中的几何结构和跨视角一致性。

  • 采用几何与外观解耦的两阶段生成架构: 给定输入图像和用户定义的相机轨迹,DreamWorld 先由几何视频扩散模型预测目标新视角的几何特征,再以这些特征为条件,由外观视频扩散模型生成最终 RGB 帧。

  • 将 3D 基础模型的结构先验蒸馏到扩散模型: 几何阶段通过蒸馏预训练 3D 基础模型的高层结构知识,使扩散模型生成反映场景空间布局的几何特征,并作为后续视频生成的结构约束。

  • 显式几何特征用于约束新视角生成: 与仅依赖隐式时空表示的 VDM 不同,DreamWorld 将预测的几何表示作为结构支点,重点改善几何不合理和不同视角之间的空间不一致问题。

  • 支持用户自定义相机轨迹: 几何阶段负责结构一致性和相机轨迹遵循,外观阶段则侧重视觉细节和画面保真度。

  • 论文实验覆盖室内、户外和分布外场景: DreamWorld 在视觉质量、3D 一致性和相机可控性方面优于对比方法。

https://yanghb22-fdu.github.io/DreamWorld

(@DreamWorld)

2、西工大 ASLP 联合 WeNet 开源中文多方言 ASR 模型 CN-MultiDialect-ASR:用 OPSD 缓解方言微调后的普通话能力退化

西北工业大学 ASLP 团队联合 WeNet、NEXDATA 发布 CN-MultiDialect-ASR,基于 Qwen3-ASR-1.7B 引入 OPSD 自蒸馏训练,重点解决多方言 ASR 中一个常见问题:提升方言识别后,普通话识别能力容易随之下降。OPSD 不再只让模型沿着标准答案训练,而是让模型基于自己实际生成的识别结果继续学习,使训练状态更接近真实推理过程。
  • OPSD 改为基于模型自己的识别结果进行训练: 当前模型先根据语音生成自己的识别结果,再由一个冻结的同源模型结合参考文本,为这些结果提供概率分布作为训练指导,减少训练阶段与实际推理阶段之间的差异。

  • 采用 CPT → SFT → OPSD 三阶段训练: 先使用约 10 万小时普通话与方言语音持续预训练,再提高方言数据采样比例进行监督微调,最后使用约 5000 小时方言数据进行 OPSD 优化。

  • 论文实验显示方言 CER 明显下降,同时普通话平均 CER 未退化: 相比原始 Qwen3-ASR-1.7B,5 个公开方言测试集平均 CER 从 15.37% 降至 12.79%,18 个内部方言测试集从 21.01% 降至 12.42%;8 个普通话测试集平均 CER 从 3.46% 降至 3.27%。

  • 对比实验显示 OPSD 比继续常规监督微调更能保留普通话能力: 在使用相同优化数据和训练配置时,继续进行基于标准答案的监督微调会使普通话 CER 上升,而 OPSD 在进一步改善方言识别的同时,没有出现这一退化。

  • 模型权重与训练代码已开放: CN-MultiDialect-ASR 已在 Hugging Face 发布模型权重,GitHub 提供 SFT、OPSD 训练脚本,推理方式兼容 Qwen3-ASR。

https://github.com/ASLP-lab/CN-MultiDialect-ASR

(@ASLP-lab)


02 有亮点的产品

1、深光发布物理 AI 多模态光交互世界模型 DeepLight:用空间理解驱动实时投影交互
图片


图片


深光科技发布物理 AI 多模态光交互世界模型 DeepLight,将摄像头环境感知、空间理解与投影输出串成一套交互系统。DeepLight 通过理解人与物体在真实空间中的位置和交互意图,将提示、导航、批注等内容直接投射到桌面、纸面、墙面或地面,让机器人能够直接通过真实空间提供可视化反馈。

  • 建立「感知空间 → 理解意图 → 投影反馈」的交互闭环: 系统先识别桌面、地面、墙体以及人与物体的位置关系,再结合人的动作判断交互需求,最终选择对应位置投射辅助信息。

  • 空间信息会随环境变化持续更新: DeepLight 不只识别静态物体,还会跟踪物品移动、人员走动和场景变化,并结合手部姿态、交互笔轨迹和空间指向理解用户正在操作什么。

  • 投影成为模型直接作用于真实空间的输出方式: 无需额外屏幕,系统可将错题批注贴合到纸质试卷对应位置,也可把导航路线、操作提示等信息直接投射到地面等真实表面。

  • 面向机器人与智能设备集成: 深光将 DeepLight 定位为可接入不同机器人和智能设备的空间交互能力,用于学习辅助、服务机器人、陪伴等场景。

https://www.alight-tech.cn/

(@深光 ALight)

2、阿里推出可编辑 AI 音频创作室:CosyCreative:支持文本音频同步编辑与多轨混音

CosyCreative 定位一站式音频内容创作平台,内置上千种音色,支持声音复刻、AI 播客、AI 有声书、链接听文章等场景。

文本与音频可同步编辑,并支持自动标签、多轨混音和背景音乐,覆盖从「一键生成」到「精细创作」的全链路。视频配音、短视频出海、音效音乐生成等场景后续也将上线。


(@阿里语音 AI)

3、Fish Audio 推出多模态创作平台 Fish Creative:从语音生成扩展到口型同步、图像视频与音效创作

Fish Audio 推出多模态创作平台 Fish Creative,将原有语音能力进一步扩展到完整的视听内容制作流程。用户可以从生成或复刻一段声音开始,在同一创作画布中继续完成口型同步、图像与视频生成以及音效添加,把声音直接作为多模态内容创作的起点。

  • 语音成为多模态创作的起点: 平台接入 Fish Audio S2.1 Pro,可生成语音并通过情绪标签控制表达,也支持复刻自己的声音,再围绕这段声音继续制作画面与视频。

  • 新增口型同步能力: 用户可将选定声音与人物面部进行匹配,让已有或生成的人物按照目标语音同步口型。

  • 图像、视频与语音进入同一创作画布: Fish Creative 接入图像和视频生成模型,可继续构建场景与动态画面,不需要在不同创作工具之间来回切换。

  • 支持按需添加音效: 在语音和画面之外,平台还可生成并加入所需音效,进一步补齐从声音到完整视听内容的制作链路。

https://x.com/FishCreativeHQ/status/2089759230576451693

(@FishCreativeHQ)

4、Suno 发布生成式音乐工作台 Studio 2.0:加入 MIDI 编辑、Studio Chat 与参数自动化
图片

Suno 发布生成式音乐工作台 Studio 2.0,在浏览器端加入 MIDI 编辑、内置合成器、音频效果器、参数自动化和 Studio Chat。新版本将生成能力进一步嵌入编曲、音色设计和混音流程,用户可以同时通过传统 DAW 操作和自然语言修改当前工程。

  • 支持 MIDI 导入、录制与钢琴卷帘编辑: 用户可以直接移动音符、调整节奏,并连接外部 MIDI 键盘;外部控制器同时支持 Transport Control 和 MIDI Learn,可映射播放、停止及部分插件参数。

  • 支持音频转 MIDI 和 MIDI 生成音频: Studio 2.0 可从已有录音提取旋律并继续编辑音高和节奏,也可依据 MIDI 中的音高、节奏和力度生成不同乐器、音色或演奏风格的音频。

  • Studio Chat 可直接操作当前工程: 用户可通过自然语言生成旋律、和弦或鼓组 MIDI,整理轨道、编辑音频和设计音色,还可通过文字生成定制音频效果器。

  • 新增波表合成器、效果器与参数自动化: 内置效果包括均衡器、压缩器、侧链压缩、混响、卷积混响、延迟、失真和噪声门;音量、声像及效果参数均可随时间自动变化。

  • 补充延迟补偿与演奏工具: Studio 2.0 新增延迟补偿、电脑键盘演奏、琶音器和和弦模式,进一步完善浏览器内的音乐制作流程。

https://suno.com/blog/studio-2


(@Suno)

5、Sarvam AI 向所有开发者开放语音智能体平台 Voice Agents:企业级构建与部署能力转为公开可用

Sarvam AI 宣布其语音智能体平台 Voice Agents 面向所有用户开放,此前该平台主要用于企业部署,并已累计支撑超过 3.5 亿次语音对话。此次变化在于,Sarvam 将经过大规模企业场景验证的一整套语音智能体构建、管理和部署能力直接开放给开发者使用。

https://links.sarvam.io/Voiceagents

(@SarvamAI)


03 有态度的观点

1、 Dario Amodei:AI 公司画了这么久的饼,该真正「治愈癌症」了
图片

Anthropic CEO Dario Amodei 近日在 X 发文表示,当前针对 AI 公司「最准确的批评」,是包括 Anthropic 在内的企业尚未兑现此前关于 AI 造福世界的宏大承诺。

他认为,想要改善公众对 AI 的看法,关键并非进一步宣传技术潜力,而是拿出真正能够改变现实的成果。

Amodei 以医疗领域为例称,如今「AI 将治愈癌症」已经越来越像一句陈词滥调,许多人甚至认为这样的说法具有欺骗性。他表示,真正能够改变公众态度的办法,是「实际治愈癌症」。

Amodei 同时将当前 AI 行业面临的问题归因于更广泛的信任危机,认为普通用户对科技公司、政府等机构长期存在不信任。

与此同时,前 OpenAI 高管 Fidji Simo 也公开回应称,尽管她在许多问题上与 Amodei 意见不同,但认同这一判断。她认为 AI 最终有潜力帮助治愈疾病,但仅依赖更强的模型并不足够,生物医学数据基础设施同样是目前限制 AI 医疗应用的重要因素。

(@APPSO)

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。


作者提示:个人观点,仅供参考

注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    关键词
    // 相关帖子
    Coming soon...
    • 0
    西工大 ASLP 开源中文多方言 ASR 模型,缓解方言微调后的普通话能力退化丨日报RTRTE_Dev_Comm