华为开源智能体平台 openJiuwen 更新,全双工音视频可打断对话丨日报

本期编辑:@三水 @鲍勃



01 有话题的技术


1、华为开源智能体平台 openJiuwen 更新 WorkSwarm:支持全双工音视频交互,Core Agent 可在后台持续执行任务

图片


华为联合开发者社区构建的开源智能体平台 openJiuwen,为办公与编程工作台 WorkSwarm 引入全双工多模态交互能力。用户可以通过实时语音和视频与智能体交流,在 AI 说话时随时插话、展示画面或追加任务;复杂工作则交由 Core Agent 在后台执行,实现前台持续对话、后台执行任务的协作方式。


  • 全双工语音支持实时打断与视频理解: WorkSwarm 在语音播报过程中持续检测用户输入,识别到有效插话后立即停止播报并处理新指令,同时支持通过摄像头画面进行实时问答。系统使用 VAD 和噪声门限减少误打断,目前支持 Qwen Omni 实时协议,以及由 ASR、LLM、TTS 串联构成的 JoyAI 协议。

  • Core Agent 后台执行不阻塞实时对话: 实时模型负责音视频理解和即时回应,Core Agent 负责拆解任务、搜索资料、调用工具和生成文件。用户可以在任务执行期间继续交谈、追加新任务,并通过任务队列调整优先级或停止执行。即使关闭音视频连接,已提交的后台任务仍可继续运行,完成后将结果返回原对话。

  • 支持昇腾 NPU 部署多模态模型: WorkSwarm 支持通过华为云 ModelArts 和 vLLM-Omni 推理框架,在昇腾 NPU 上部署全双工多模态模型,并接入工作台的实时音视频交互能力。当前已提供 Windows、macOS 和 HarmonyOS 安装包,相关智能体项目 JiuwenSwarm 已开源。


https://github.com/openJiuwen-ai/jiuwenswarm



2、AI 数字人公司 HeyGen 发布首款自研语音合成模型 HeyGen Voice:登顶 Artificial Analysis 克隆语音榜单,支持即时声音克隆与流式 API

图片


HeyGen 发布首款自研语音合成模型 HeyGen Voice,主打保留原声的音色、情绪、重音和自然停顿,让合成语音更接近本人说话方式。模型在 Artificial Analysis 的 Controlled Voice TTS Arena(可控声音合成榜单)排名第一,并已通过 HeyGen 平台和 API 开放使用。


  • 克隆语音评测排名第一: Artificial Analysis 使用相同的 8 种美式和英式英语参考声音比较不同 TTS 模型。HeyGen Voice 获得约 1201 Elo,领先 Qwen-Audio-3.1-TTS-Plus 和 Eleven v4 Turbo;在单独的发音稳健性测试中,得分为 83.1%,排名第 10。该排名针对英语克隆语音的主观听感评测。

  • 提供即时声音克隆与流式语音生成: 开发者只需上传一段参考录音,即可通过 POST /v3/models/audio/voices 创建克隆音色,通常数秒内就能获得可用的 voice_id,无需额外训练。随后可通过 TTS API 生成完整音频,或使用流式接口逐步接收语音数据。模型支持中文、英语、日语等多种语言。

  • 自研语音模型接入数字人生成技术栈: HeyGen 将语音能力整合到以 Avatar V 为核心的数字人模型体系中,使声音身份和数字人形象能够在同一产品体系内管理。API 模型标识为 heygen-voice-1,支持调节语音表现力,定价为每百万字符 30 美元。


https://developers.heygen.com/docs/voices/heygen-voice-instant-clone



3、实时视频生成公司 Vivix 开放视频模型 W1 在线体验:每秒仅 0.003 美元,8 秒视频生成耗时 8.4 秒


Vivix 开放视频生成模型 Vivix W1 的在线 Playground,并推出每秒 0.003 美元的限时价格。W1 采用面向流式生成的多模态架构,支持文本、图像和音频参考输入,旨在让视频内容能够随着用户交互持续变化。在官方公布的 720p、8 秒视频测试中,W1 平均生成耗时 8.4 秒,Seedance 2.5 则为 272.4 秒。


  • 视频生成成本降至每秒 0.003 美元: 当前限时价格持续至 10 月 31 日,生成一段 8 秒视频仅需 0.024 美元。按照官方列出的 Seedance 2.5 每秒 0.231 美元计算,同样约 1.85 美元的预算,可以生成约 77 段 W1 视频,而 Seedance 2.5 约为 1 段。

  • 8 秒视频生成耗时约 8.4 秒: Vivix 在单张参考图、720p 分辨率、8 秒视频的条件下进行了 10 次测试,W1 平均耗时 8.4 秒,Seedance 2.0 和 Seedance 2.5 分别为 183.5 秒和 272.4 秒。测试从请求提交到完整生成结束,不包含排队时间。

  • 面向持续交互的音视频生成: W1 的技术架构支持将文本、语音、图像和动作等信号接入持续生成过程,并联合生成画面、语音和音效。不过,当前公开 Playground 和 API 主要提供异步视频生成,支持在生成过程中持续交互的 W1 Streaming World 仍处于私有测试阶段。Vivix 也承认模型在电影级真实感、复杂动作和密集场景方面仍有不足。


https://platform.vivix.ai/vivix-w1-model/



02 有亮点的产品


1、智慧教育 IT 公司网班科技推出 AI 陪伴宠物 LinkeeBot:支持实时语音、长期记忆与声音克隆

图片


纳斯达克上市公司网班科技(NetClass Technology)宣布进军 AI 陪伴硬件市场,推出首款交互式 AI 智能宠物系列 LinkeeBot。产品以自然语言处理模型驱动,结合实时语音对话、情感陪伴和日程管理功能,面向大学生、年轻职场人及 Z 世代用户。


  • 实时语音交互与情感陪伴: LinkeeBot 支持自然语言对话、情感化回应、日程管理和互动提醒。硬件采用触摸感应头部、LED 表情眼睛等设计,用户可以通过语音或摇晃唤醒设备,抚摸头部也会触发声音反馈。

  • 长期记忆与个性化声音: 产品可记录用户与 AI 宠物的互动经历,并通过配套应用自定义角色形象、头像及声音,支持声音克隆,让宠物在持续对话中形成个性化互动体验。


网班科技同时成立合资公司 Linkee AI Company Limited,持有 40% 股权,负责 AI 陪伴玩具的海外销售、营销和相关技术服务。公司将与外部硬件制造商及软件服务商合作,首批商业化市场覆盖中国大陆、香港、日本及东南亚。


(@AING 硬迹)



2、汽车经销商 AI 客服公司 Flai 完成 2700 万美元 A 轮融资:推出 AI 原生 CRM,每月自动预约超 5 万次

图片


汽车经销商 AI 服务公司 Flai 宣布完成 2700 万美元 A 轮融资,由 Base10 Partners 领投,Toyota Ventures、Y Combinator 等参投。公司同时推出面向汽车销售与售后的 AI 原生客户关系管理系统(CRM),将原有的 AI 电话接听、客户预约和跟进能力扩展至经销商运营流程,让 AI 智能体直接执行客户管理任务。


  • AI 从接听电话扩展至运营任务执行: 新 CRM 能识别未跟进客户、遗漏预约和服务问题,自动发起电话或消息沟通、安排预约并更新经销商系统。遇到客户投诉等需要人工判断的情况,系统会通知相关员工,并提供完整对话背景和处理建议。

  • 每月完成超 5 万次客户预约: Flai 目前已服务数百家汽车经销商,覆盖美国前 50 大经销商集团中的 20% 以上。其 AI 智能体每月处理超过 5 万次销售及售后预约。据公司披露,过去一年收入增长超过 20 倍。


本轮融资将用于扩大产品与工程团队、深化经销商业务系统集成,并将 AI 自动化能力扩展至更多运营流程。


( @Techcrunch)



3、Meta 开源 AI 硬件开发套件 Muse Gadgets:支持 ESP32、Linux 设备接入 AI 智能体,语音控制智能家居

图片


Meta 发布开源 AI 硬件项目 Muse Gadgets,开放 ESP32 和 Linux 设备 SDK 及固件,让开发者能够将个人 AI 智能体 Muse 接入自制硬件,通过麦克风、扬声器、屏幕、按钮和传感器实现交互。同期推出 Muse Home Link,让智能体通过家庭局域网访问和控制兼容设备。


  • 开放 ESP32 与 Linux 硬件接入: 开发者可以在现成的 ESP32 开发板、树莓派或其他 Linux 设备上部署 SDK,为 Muse 添加语音输入输出、屏幕显示、实体按钮、传感器和执行器。设备通过 SDK Token 与 Muse 配对,开发者也可以自行添加硬件功能和控制指令。

  • Home Link 支持智能体控制局域网设备: Meta 推出基于 ESP32-C5 的 USB-C 设备 Muse Home Link,通过 Wi-Fi 将 Muse 连接至家庭网络。结合社区开发的技能,智能体可以调用设备的本地 HTTP API,控制智能灯、电视、音箱等设备,或向打印机发送文件。当前已提供 Philips Hue、Sonos、Apple TV 等设备的社区集成方案。


Muse Gadgets 的 SDK 和固件已在 GitHub 以 Apache 2.0 许可证开源,并提供多个硬件项目示例。Muse Home Link 则面向美国的有效 Muse 订阅用户免费开放申领,计划于 10 月开始发货。


https://github.com/facebookincubator/muse-gadget-sdk



4、苹果预告 10 月 13 日「Welcome Home」新品活动:预计推出搭载 AI Siri 的智能家居中枢


苹果全球营销高级副总裁 Greg Joswiak 于 10 月 8 日发布「Welcome Home」预告,宣布将在 10 月 13 日推出新品。苹果预计将推出全新智能家居中枢,并更新 Apple TV 4K 和 HomePod mini 产品线。全新智能家居中枢预计集成 AI Siri,以语音作为主要交互方式。 据报道,设备可能采用约 6 英寸显示屏,搭载支持 Apple Intelligence 的芯片,并提供桌面音箱底座和壁挂两种形态。用户预计可以通过语音及触控操作管理智能家居设备、查看日历、控制音乐播放,以及进行 FaceTime 视频通话。


( @Macrumors)



03 有态度的观点


1、AHM 呼吁数学研究回到以人类理解为中心

图片


人类数学协会(AHM)传播工作组 10 月 7 日发表声明,批评 OpenAI 前一天集中公开数学手稿的做法,并呼吁数学家停止与 OpenAI 合作。陶哲轩随后在个人博客转载了这份客座声明。这份公开信将争议落在数学研究的规范与理解上,并对模型给出的答案如何成为学术成果提出质疑。


AHM 写道,数学家对进步有一套受历史与学科特点塑造的认识。可信、符合研究伦理且服务公共利益,是评价数学研究的条件。


协会因此拒绝 OpenAI 关于这次发布推动数学进步的主张,并建议数学家与公众审慎看待这种发表模式。声明还援引数学与人工智能咨询小组(AGMAI)的建议,称前沿 AI 公司不应擅自用内部模型测试高级数学问题;AHM 认为,OpenAI 忽视这一前提,却借用该咨询小组为自身提供正当性,损害了学术共同体的规范。


对一次公开超过 700 份文件,AHM 的判断是:这更像力量展示,不能仅凭规模视为学术贡献。它提出的方向是回到以人类理解为中心的科学实践。这是 AHM 的组织立场;陶哲轩在转载说明中标明作者身份,并未将其作为自己署名的声明。


(@APPSO)



04 社区黑板报


招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)



1、【招聘】量子计算公司数耀量生开放 10 个岗位方向,招募 Physical AI 基础设施人才

图片


点击原文查看招聘详细信息:

数耀量生招聘|共筑 Physical AI 下一代基础设施


图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

图片

作者提示: 个人观点,仅供参考

请 注册 或 登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    关键词
    // 相关帖子
    Coming soon...
    • 0
    华为开源智能体平台 openJiuwen 更新,全双工音视频可打断对话丨日报RTRTE_Dev_Comm