OpenAI 首款 AI 硬件曝光:甜甜圈形状无屏智能音箱 300–400 美元丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、阿里发布 AI 语音平台 CosyVoice Studio:集成语音记录、语音智能体与音频创作能力
阿里巴巴推出一站式 AI 语音平台 CosyVoice Studio,基于自研语音模型 Qwen-Audio 构建,整合语音记录、实时语音智能体和 AI 音频创作三类能力。平台包含 CosyFlow、CosyAgent 和 CosyCreative 三个功能模块,覆盖语音输入、交互和内容生成场景。
语音记录工具 CosyFlow 支持语义理解与结构化整理: CosyFlow 在语音转文字基础上增加语义理解和文本生成能力,可自动去除口语填充词,并将录音内容整理为邮件、汇报、会议纪要等结构化文本。
支持多人会议录音与智能摘要: CosyFlow 内置“随记”功能,支持实时录制和离线上传,可通过声纹区分不同发言人,并自动生成章节结构和摘要。
语音智能体平台 CosyAgent 支持自然语言创建 Voice Agent: 用户可通过自然语言创建具备企业知识、工具调用和实时语音交互能力的智能体,同时兼容 Prompt 与 Workflow 配置,用于智能客服、电话营销等场景。
音频创作工具 CosyCreative 支持文档转播客与有声内容: 用户上传文档、网页链接或文本后,可生成对话播客、多角色有声书等内容,并支持声音复刻与多种音色选择。
(@阿里语音AI)
2、字节跳动发布多说话人语音生成模型 SwanTale:面向多说话人与复杂音频场景生成,支持指令控制与零样本语音生成
字节跳动 SwanAIGC 团队发布 SwanTale,一种面向多说话人语音与音频生成的统一模型,支持指令驱动(Instruct)和零样本(Zero-Shot)两类生成任务。该模型通过统一架构处理多说话人语音、环境音频等生成需求,并提供对应技术报告与 Demo。
支持 Instruct 与 Zero-Shot 两类音频生成任务: SwanTale 可根据自然语言指令生成包含环境描述、说话人风格和细粒度内容控制的音频,也支持结合参考音频完成零样本生成。
采用统一多模态音频生成架构: 模型引入 SwanVAE 支持多音频模态生成,并结合 Unified MoE 处理多任务与多音频模态建模。
加入数据与训练策略优化: 项目提出 SwanData-Caption 数据构建流程,通过清洗语音和音频数据、补充合成数据,并生成多层级描述标注用于训练。模型训练阶段结合奖励条件质量控制、Engram 条件控制、课程学习和 GRPO 后训练。
覆盖复杂多说话人生成场景: 实验结果显示,SwanTale 在多项 Instruct 和 Zero-Shot 评测指标中取得较好表现,并支持包含多说话人语音与音频元素的复杂指令生成。
https://arxiv.org/abs/2608.02023
https://swanaigc.github.io/
(@SwanAIGC)
3、OpenAI 与 Pion 合作构建 Go 语言 Opus 解码器:用于 GPT-Live 全双工语音系统
https://github.com/pion/opus
(@juberti@X)
02 有亮点的产品
1、千问 App 更新语音通话能力:支持多场景连续语音交互
千问 App 更新语音通话功能,新增 7×24 小时在线语音陪伴能力,覆盖互动陪玩、睡前故事、带娃讲题、语音打车等场景。此次更新重点提升语音交互体验,包括更自然的声音表现和面向不同场景的对话能力。
(@千问)
2、OpenAI 首款 AI 硬件曝光:甜甜圈形无屏幕智能音箱,预计售价 300–400 美元
OpenAI 计划推出一款外观像甜甜圈的新型智能硬件设备。该产品被定位为「AI 原生计算机」,预计将于明年正式发布,售价可能在 300 美元至 400 美元之间(约合人民币 2150 元至 2870 元)。该设备由 OpenAI 与 Jony Ive 创办的 LoveFrom 工作室合作设计。其外观呈圆环状,尺寸与冰球相当,采用高品质金属材质,旨在方便用户单手握持并在家中随身携带。与传统的智能音箱不同,该设备不配备显示屏,但包含可移动的机械部件。这些部件能够根据交互状态自主摆动,以赋予设备类似于「生命」的个性化反馈。
https://www.bloomberg.com/news/articles/2026-08-06/what-is-openai-s-device-a-doughnut-shaped-speaker-that-costs-over-300
(@Bloomblerg)
3、UNITH 发布 DEVA-1 Alpha:根据语音情绪、语调与节奏实时驱动数字人面部表情
UNITH 推出 DEVA-1 AI 数字人模型,面向实时数字人交互场景,重点提升面部表情、微表情和情绪表达能力。该模型通过实时生成完整面部表现,使数字人从传统口型同步和预制动画,转向更自然的动态表情交互。(unith.ai)
实时生成面部表情与情绪变化:DEVA-1 不仅驱动嘴部动作和语音同步,而是实时生成完整面部状态,包括表情变化、微动作和情绪表达,用于增强数字人的自然交互能力。
从语音驱动动画升级为 AI 原生数字人表现层:传统数字人通常依赖固定动作库或嘴型匹配,DEVA-1 聚焦面部动态生成,让数字人能够根据对话内容呈现更加连续的视觉反馈。
支持企业级交互式数字人部署:UNITH 平台提供数字人创建、API 集成和工作流接入能力,可将数字人嵌入网站、应用和企业业务流程,用于客服、培训、销售和内部协作场景。
结合语音克隆与数字人定制能力:平台支持创建自定义数字人,包括面部形象、声音以及交互行为配置,可用于品牌代表、培训角色和虚拟助手等场景。
https://www.unith.ai/lp/deva-1
(@UNITH)
4、Omilia 完成 6700 万美元 B 轮融资:扩展 AI 客户服务平台与语音智能体能力
Omilia 完成 6700 万美元 B 轮融资,由 Expedition Growth Capital 领投,用于扩展其 AI 客户服务平台业务。该公司长期专注语音客服自动化,并正在构建覆盖不同客户触点的自学习智能体平台。
融资 6700 万美元用于全球扩张: 本轮融资由 Expedition Growth Capital 领投,Omilia 表示将利用资金扩大北美市场业务和商业团队;公司自 2020 年融资以来 ARR 增长至 6000 万美元。公司计划利用资金扩大北美市场业务和商业团队。
构建自学习客户服务智能体: Omilia 正从传统语音客服自动化扩展到可跨客户触点工作的自学习智能体平台,覆盖电话、聊天和消息等交互渠道。
ARR 增长至 6000 万美元: 自 2020 年融资以来,年度经常性收入(ARR)增长 10 倍,达到 6000 万美元。
语音 AI 已部署于企业客服场景: Omilia 客户包括 Capital One、Discover、RBC、DWP、PSEG 等企业,并已在 Taco Bell 超过 1000 家门店部署语音点单技术。
(@TechCrunch)
03 有态度的观点
1、字节讨论训超 5 万亿参数模型,张一鸣:不蒸馏、别被 Coding 这种短期热点影响
字节跳动创始人张一鸣近日在 Seed 团队会议上表示,即使公司暂时落后于竞争对手,也不会依赖 AI 蒸馏技术来改进自身模型,而是坚持通过自主研发提升模型能力。
所谓「蒸馏」,通常指利用更先进模型的输出结果训练另一个模型,以较低成本获得接近前沿模型的能力。这种方式已经成为行业中提升模型性能的重要手段,但也引发了关于模型创新和能力来源的讨论。
当前 AI 竞争正在从单纯追求模型参数规模,转向数据、训练方法、基础设施和长期研发能力的综合竞争。相比快速复制已有能力,如何建立持续迭代的模型研发体系,可能决定下一阶段 AI 公司的竞争壁垒。
值得注意的是,模型蒸馏本身已经成为行业普遍采用的方法。包括 Anthropic 在内的多家 AI 公司都曾指控其他机构可能对其模型进行蒸馏,但这一技术路线仍存在大量争议。
张一鸣的判断背后,是对 AI 长期竞争逻辑的另一种理解:真正的领先优势,不只是获得当前最强模型的能力,而是持续创造下一代模型的能力。
( @latepostnews@X)

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
作者提示: 个人观点,仅供参考