Open Yap 1K 开源 1000 小时全双工真人对话数据,可免费商用丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、语音数据公司 The Agentic Data Company 发布全双工对话数据集 Open Yap 1K:1000 小时真实双人对话,可免费用于商业训练
语音数据公司 The Agentic Data Company 发布全双工自然对话数据集 Open Yap 1K,收录约 1000 小时、1600 余场英语双人真实对话。与围绕指定话题轮流说话的数据不同,这套数据让朋友、家人和同事直接自由聊天,并将双方语音分别录制到独立声道,完整保留打断、重叠说话、附和、笑声和快速接话等真实互动现象,重点服务于全双工 Voice Agent 和实时语音模型训练。
保留真实对话中的时间关系: 两位说话人的音频分别录制,模型可以直接学习「什么时候该接话、什么时候该等、什么时候只是附和」,而不需要再从混合音频中做说话人分离。
不是脚本式对话,而是自然聊天: 参与者之间本身就认识,不预设固定话题,也不要求严格轮流说话,因此更容易保留真实交流中的抢话、停顿、语气变化和重叠语音。
完整 1000 小时数据可免费用于商业训练: Hugging Face 目前公开提供约 8.9 小时样本,完整数据需要申请获取,可用于研究、模型训练、微调和商业部署;但不能二次分发,也不能用于克隆数据集中具体说话人的声音。
https://huggingface.co/datasets/TheAgenticDataCompany/open-yap-1k
2、语音 AI 评测导航 Voice Benchmarks:集中整理 TTS、STT、LLM 与轮次结束检测基准
HappyRobot 工程师 Gonzalo Cordova 推出了开源平台 Voice Benchmarks。该平台汇总了分散在各处的语音 AI 评测资源,覆盖 TTS、STT、LLM 及 EoT(轮次结束检测)等环节,方便开发者按需挑选针对性的评测工具,而非仅参考单一综合榜单。项目依托社区 PR 持续共建,本质上是一个开放、动态维护的语音 AI Benchmark 索引库。
https://voicebenchmarks.com
3、厦门大学等开源统一语音模型 UniVoice:一个 LLM 同时做 ASR 与 TTS,用连续语音表征避开离散 Token 损失
厦门大学、上海创新研究院、上海交通大学和浙江大学研究团队开源 UniVoice,将原本通常分开训练的 ASR 与 TTS 统一进同一个 LLM 框架:语音识别采用自回归生成,语音合成采用流匹配,并直接使用连续语音表征连接两项任务,避免先把语音离散成 Token 带来的信息损失。UniVoice 以 SmolLM2-360M 为语言模型骨干,目前同时开放仅 TTS 版本和统一 ASR+TTS 版本。
ASR 与 TTS 首次共享同一套连续表征框架: 过去统一语音模型常把声音离散成语音 Token 后交给 LLM 处理,UniVoice 则直接保留连续声学特征,让识别和生成共享模型,同时分别采用更适合各自任务的自回归建模与流匹配。
用双注意力机制解决两种任务的冲突: ASR 生成文本时使用因果注意力,只能关注已经出现的上下文;TTS 做语音生成时则切换为双向注意力,让模型同时利用前后文。也就是说,同一模型会根据当前任务切换不同的注意力方式。
同一框架还支持零样本声音克隆: 团队提出基于文本前缀条件的语音填充方法,让模型根据参考语音完成零样本音色复刻;论文报告其在 ASR 和零样本 TTS 上能够达到或超过部分专门针对单一任务设计的模型。
代码和模型均已开放: GitHub 已提供 ASR、TTS 的推理与联合训练脚本,代码采用 MIT 许可证;同时公开 UniVoice-TTS 和同时支持两项任务的 UniVoice-All 模型。
https://univoice-demo.github.io/UniVoice/
4、尼泊尔语音实验室 Ampixa 开源微控制器 TTS 模型家族 sanoTTS:最小仅 29.4 万参数,3 美元 ESP32-S3 可完全离线实时合成
尼泊尔语音 AI 实验室 Ampixa Labs 开源超小型神经 TTS 模型家族 sanoTTS,模型规模覆盖 29.4 万至 227 万参数,包含 11 个声音、6 种语言。其核心变化是把完整的神经语音合成链路压缩到通用微控制器上,无需云端、GPU 或 NPU,即可在约 3 美元的 ESP32-S3 上离线运行。
最小完整 TTS 模型只有 29.4 万参数:
heart-nano将时长预测、声学模型和解码器合计压缩到 294,279 个参数,int8 权重仅 337KB。从音素输入到最终波形都由本地神经网络完成,而不是只把声学模型放到端侧、再依赖外部云服务。56.7 万参数版本已在 ESP32-S3 上跑到快于实时播放: 论文实际测试的 MCU 模型拥有 567,008 个参数,在 ESP32-S3 上生成 4.54 秒语音耗时 1.02 秒,RTF 为 0.22,无需神经网络加速器。这里的 0.22 RTF 表示整体生成吞吐速度,并非首段音频延迟。
从单个 Demo 扩展成 11 个声音、6 种语言的模型家族: sanoTTS 当前覆盖英语、尼泊尔语、印地语、越南语、印度尼西亚语和中文,模型规模从 294K 到 2.27M 参数;浏览器版本还可通过 WebAssembly 完全在客户端合成,不上传文本或音频到服务器。
训练路线采用大模型教师蒸馏,而不是从零训练微型 TTS: 团队从 Piper/VITS 教师模型蒸馏时长、声学表示和波形生成能力,再对小型解码器进行联合优化和 int8 量化,把原本需要更强算力的神经 TTS 压缩到 MCU 可承载的规模。
项目来自 Ampixa 对尼泊尔及低资源语言语音基础设施的长期投入:
sano(सानो)在尼泊尔语中意为「small」。除 TTS 外,Ampixa 还在开发尼泊尔语 ASR、语音数据处理、强制对齐、OCR 和低资源语言工具,目标是让语音能力不必首先经过英语或云端模型。
https://tts.ampixa.com/sanoTTS/
5、字节跳动被曝基于 Seedance 开发实时空间视频世界模型:目标 20 FPS、约 50ms 响应,最快 10 月发布
据彭博社报道,字节跳动正在开发一款面向实时空间视频生成的世界模型,最快可能于 10 月发布,创始人张一鸣正在亲自协调内部资源推进项目。新模型将基于现有视频生成模型 Seedance 构建,目标是让用户通过语音或动作实时控制虚拟环境,并与 PICO 头显、直播、短剧和游戏等场景结合。
Seedance 从「生成视频」进一步走向「持续响应用户操作的世界模型」: 现有 Seedance 主要根据文本、图像、音频和视频等输入生成内容;据报道,新模型则需要根据用户在运行过程中的语音或动作不断改变后续画面,让生成结果从一次性的成片转向可持续交互的虚拟世界。
目标达到 20 FPS、约 50ms 响应: 知情人士称,这套系统面向 PICO 等空间计算设备时,目标以约 20 帧/秒生成画面,并将响应延迟控制在约 0.05 秒,用于实时空间环境和交互界面。需要注意,这些参数目前来自知情人士,尚未由字节官方公布技术报告或 Demo。
重计算放到云端,试图降低 XR 头显本地算力门槛: 字节计划把生成空间内容所需的大量计算放到云端,再将结果实时传回头显,从而减少设备自身所需的计算能力。其思路是让未来 PICO 硬件不必完全依赖高性能本地芯片来生成复杂空间内容。
世界模型被用来串联 Seedance、云计算、内容平台和 PICO: 报道称,张一鸣将这一空间视频模型视为连接字节 AI 模型、云算力、内容分发平台与 XR 硬件的一条「飞轮」。相比单独做一款世界模型,这意味着字节希望把实时生成能力直接嵌入自身已有的视频和终端生态。
PICO Space Pro 同期推迟至第四季度,并明确要做「大规模软件体验升级」: PICO 此前将原定 9 月发布的 Space Pro 推迟到 2026 年第四季度,称在最终体验验证阶段发现了新的机会,需要对软件体验进行重大升级。目前 PICO 没有确认这次延期是否与上述世界模型直接相关,因此两者只能视为时间上的关联,不能直接画等号。
(@Bloomberg)
02 有亮点的产品
1、Google 为 Gemini 加入智能体式视频理解:模型主动决定看哪里、看多快,Token 最多降低 88%
Google 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体式视频理解。与过去按固定帧率(默认 1 FPS)把整段视频送入模型不同,Gemini 现在会根据问题主动决定查看哪一段、以什么帧率查看,以及读取画面、音频还是转写文本,只调取完成任务真正需要的信号。Google 称,在标准视频理解评测中,这种方式可让 Token 消耗最多降低 88%、分析成本最多降低 66%,准确率最高提升 7%,尤其适合数十分钟甚至数小时的长视频。
视频理解从「固定采样」变成动态搜索: 模型可以先快速扫描视频,发现可能相关的时间段后,再对局部片段提高采样帧率或重新观看,因此能捕捉 1 FPS 容易错过的瞬间变化,并用于精确时刻检索、异常检测和动作计数。
开发者不用自己编排多阶段视频分析流程: 此前也可以手动切片、调整 FPS、分别处理音频和字幕,现在这些操作由 Gemini 在内部智能体循环中自主调用视频工具完成,减少开发者自己设计检索和重采样逻辑的工作。
已通过 Gemini API 开放: 支持上传视频和 YouTube 视频,在请求中将
processing设置为agentic即可启用,按现有 Gemini API Token 价格计费,不额外收取功能费用。
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
2、印度语音 AI 辅导平台 YoLearn.ai 获 ABP Education 种子轮投资:把学校教材直接接入可对话 AI 导师
印度语音优先 AI 辅导平台 YoLearn.ai 完成金额未披露的种子轮融资,由 ABP 集团旗下 ABP Education 领投。相比单纯扩张一款 AI Tutor,这轮合作更重要的变化是:ABP 旗下教育出版社 Headword Publishing 和 KIPS Learning 将把现有学校教材与 YoLearn.ai 的语音 AI 导师直接绑定,学生扫描课本中的二维码,就能围绕当前教材内容用语音提问,AI 一边回答、一边在交互式画板上画图和分步解题。
从通用 AI 辅导转向「教材即入口」: AI 导师会基于出版社授权的课程内容回答,而不是只依赖通用模型知识;Headword 和 KIPS 的图书因此可以直接成为 AI 辅导服务的入口。
语音是核心交互方式: YoLearn.ai 支持 22 种印度语言,学生可以直接说出问题,AI 通过语音回答,并同步在画板上展示示意图和解题过程;目前覆盖 CBSE、ICSE 及印度各邦课程体系。
出版渠道直接带来学校分发能力: 双方合作网络覆盖约 2.5 万所学校,潜在可触达近 1 亿名学习者。YoLearn.ai 此前曾以 500 万美元估值完成 50 万美元预种子轮融资,这次则进一步从纯产品扩张进入「出版社内容 + 学校渠道 + Voice AI」的规模化落地阶段。
(@多知)
3、联想升级个人智能体天禧 AI 4.3:引入全双工自然语音交互,端侧 VAD + AEC 支持随时打断
联想上线个人智能体 天禧 AI 4.3,重点升级全双工自然语音交互:AI 播放语音时仍可持续监听用户,用户无需等待一轮回答结束即可直接插话;系统结合端侧 VAD 与 AEC 回声消除判断用户是否真正开始说话,并减少扬声器自身声音对麦克风输入的干扰。
语音交互从「轮流说话」升级到可随时打断: 天禧 AI 4.3 支持 AI 输出和用户输入同时进行,用户可以在回答过程中直接插话、改口或切换需求,不再依赖固定的一问一答轮次。
端侧 VAD + AEC 共同处理打断判断: VAD 用于判断用户当前是在说话、思考停顿还是已经结束表达;AEC 则消除设备扬声器播放 AI 语音产生的回声,使系统在 AI 自己说话时仍能捕获用户插入的指令。
同步首发 Tianxi Agent Core 端侧智能体框架: 新版「超能模式」由联想自研 Tianxi Agent Core 驱动,可在不同设备之间进行远程操控,并完成从理解需求到执行任务的连续流程;联想称相关数据处理更多在本地完成。
全双工语音开始进入联想「一体多端」终端体系: 天禧 AI 4.3 同时统一 PC、平板等设备上的主要 AI 交互入口,意味着这套自然语音能力不再只是独立 Demo,而是开始与联想跨设备 Agent 工作流结合。
(@联想官方)
4、印度企业 Voice AI 公司 Navana.ai 获 420 万美元 A 轮融资:覆盖 12 种印度语言、45 种方言,已处理超 1 亿分钟语音
印度 Voice AI 公司 Navana.ai 完成 4000 万卢比(约 420 万美元)A 轮融资,由企业家兼投资人 Ronnie Screwvala 领投,Antler India、Sharad Sanghi、Sandeep Singhal、Paula Mariwala 等参投。新资金将用于扩大银行、金融服务和保险行业部署,继续训练印度语言与方言语音模型,并开发 AI 联络中心和自动评测平台。
自研语音模型覆盖 12 种印度语言和 45 种方言: Navana.ai 的 Bodhi 模型重点处理印度真实通话中的背景噪声、重叠语音、语言混说和地域口音,并提供实时及批量语音识别 API。
主要切入银行等强监管行业: Navana.ai 支持将语音模型和 Voice Agent 系统部署在企业自己的基础设施中,让客户自行控制音频与业务数据,重点服务销售、催收、合规和客服等通话场景。
已累计处理超过 1 亿分钟 Voice AI 音频: 客户包括 Bajaj Finserv、Ujjivan Small Finance Bank、Jana Small Finance Bank 等印度金融机构;其中 Ujjivan 的语音服务覆盖 12 种印度语言。
下一步从语音模型扩展到完整 AI 联络中心: 公司正在开发可构建、上线和评测电话 Voice Agent 的端到端平台,并支持连接 CRM、电话系统和分析工具;本轮资金也将投入自动化评测能力。
( @Navana.ai)
5、SoundHound AI 完成收购企业对话平台 LivePerson:从 Voice Agent 扩展到语音、网页、短信和社交消息全渠道
SoundHound AI 正式完成对企业对话 AI 公司 LivePerson 的收购。相比此前主要聚焦电话、车载、餐厅等语音场景,SoundHound 将把 LivePerson 的数字消息平台接入自研 Agent 系统 OASYS,让企业可以用同一套 Agent 同时处理语音、网页、移动端、SMS 和社交消息中的客户交互。
从 Voice AI 扩展成全渠道 Agent 平台: SoundHound 原有优势主要集中在语音 Agent,LivePerson 则长期服务企业网页聊天、移动消息和社交渠道。合并后,OASYS 将统一调度语音与数字消息,不再需要企业分别部署电话 Agent 和文本客服系统。
LivePerson 的数字消息基础设施将直接并入 OASYS: LivePerson 当前每月处理接近 10 亿条客户消息,其 Conversational Cloud 和 Syntrix 平台还包含对话分析、Agent 训练和 AI 评测能力;这些能力将与 SoundHound 的语音模型和 Agent 编排系统整合。
合并后客户覆盖 25 家《财富》100 强企业: 两家公司合并后拥有超过 750 项专利,SoundHound 预计仅基于现有客户的交叉销售机会,未来收入潜力可超过 5 亿美元。整合后的产品将在未来几个季度陆续向全球客户推出,LivePerson 股票也将停止在 Nasdaq 交易。
这笔交易最初以 4300 万美元股权价值达成: SoundHound 于今年 4 月宣布收购时,交易股权价值约 4300 万美元,对应企业价值约 2.5 亿美元;交易完成后,SoundHound 已清偿 LivePerson 剩余债务,合并公司实现无债务资产负债表。
6、欧洲消费电子展 IFA 2026 智能眼镜路线分化:36g 无摄像头 AI 眼镜拿下设计创新奖,另一边继续卷 307 英寸虚拟大屏
IFA 2026 上,智能眼镜产品路线进一步分化:一类以 INMO GO3 为代表,把实时翻译、导航、提词和会议记录等 AI 信息直接叠加到视野中,重点做轻量化和全天候佩戴;另一类则以 RayNeo GT Max 为代表,继续强化大视场、高画质和空间显示,把眼镜做成随身虚拟屏幕。
AI HUD 路线开始强调「像普通眼镜一样戴」: INMO GO3 重 58g,采用双目 Micro-LED + 衍射光波导,支持实时翻译、提词、会议转录、语音笔记和导航,并可接入 ChatGPT 与 Gemini。该产品获得 IFA 2026 「Best in IFA Next & Emerging Technologies」创新奖提名/荣誉。
显示型眼镜则继续向「私人影院」强化: RayNeo GT Max 重 78g,提供 59° 视场角和最高 307 英寸虚拟屏幕,支持原生 3DoF 空间跟踪,并把重点放在视频、游戏和大屏办公,而不是全天候 AI 助手。
「AI 伴侣」与「显示终端」开始成为两种不同产品: 前者强调低存在感、语音和上下文信息提示,让用户少掏手机;后者强调高画质、沉浸和大屏体验。相比此前把 AR、AI、拍摄和显示全部塞进同一副眼镜,厂商开始围绕不同使用场景主动取舍。
轻量化正在成为智能眼镜能否进入日常场景的关键门槛: IFA 2026 上多款产品已经进入 50–80g 区间,与传统数百克级混合现实头显形成明显差异,产品目标也从短时沉浸体验转向更长时间佩戴。
(@INMO)
03 有态度的观点
1、《纽约客》John Cassidy:AI 就业冲击尚未按预言到来
《纽约客》专栏作者 John Cassidy 认为,生成式 AI 至今没有造成部分科技高管预言的大规模失业。美国 8 月新增 16.2 万个岗位,失业率维持在 4.1%;自 2023 年 8 月以来,月均裁员与解雇人数约为 170 万,与 2010 至 2019 年的平均水平接近。
应届大学毕业生的处境确实变差:这一群体的失业率从 2022 年 6 月的 4.2% 升至今年 6 月的 5.7%。Cassidy 指出,同期 22 至 27 岁、没有大学学位的年轻人失业率也在上升,远程办公让企业更不愿招聘需要现场带教的新人,因此目前还不能把变化单独归因于 AI。
McKinsey 的企业调查显示,部署 AI Agent 的大型企业比例从去年的 27% 升至 40%,但报告实际出现 AI 相关裁员的企业只有 14%,低于上一年预计会裁员的 32%。
Cassidy 以放射科和法律行业为例说明,许多岗位包含沟通、协调与复杂判断,短期内难被单一工具替代;他同时提醒,AI 正在压低法律服务收费,企业仍可能为维持利润率削减初级岗位,这段缓冲期应被用于调整税收、公共采购和就业支持政策。
(@APPSO)
04 社区黑板报
招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)
1、
iRTE2026 定档啦!Voice Agent Builder 们,10 月北京集合~
今年从对话式 AI 一路聊到实时智能,现场有 15+ 论坛、100+ 场深度演讲,汇聚 150+ 全球技术领袖和行业专家,全双工+交互式模型、实时互动世界模型、AI 硬件、AI Coding 工具等方向都会集中开聊。
贾扬清也将返场 iRTE 大会,带来对 AI 行业前沿趋势和技术演进的最新观察~
目前大会门票限时免费开放!
想来现场听技术、认识同行的开发者,可以先把票薅上
时间:10 月 23–24 日
地点:北京悠唐皇冠假日酒店
限免结束后将恢复收费,建议先报名占位 
定档!从对话式 AI 到实时智能,Voice Agent Builder 的年度春晚 iRTE2026 来了丨10 月23-24 日,北京见!

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
作者提示: 个人观点,仅供参考