语音 AI 公司 Fish Audio 再融资 5200 万美元,22 人团队 ARR 达 2100 万美元丨日报
本期编辑:@三水、@鲍勃
01 有话题的技术
1、OpenAI 发布 GPT-Live-Transcribe 与 GPT-Transcribe 转录模型:流式延迟可调,最低每分钟 0.0045 美元
OpenAI 推出 GPT-Live-Transcribe 与 GPT-Transcribe 两款语音转录模型,分别面向实时音频流和已完成录音。前者可在说话过程中持续返回增量文本并调整延迟,后者侧重高准确率文件转录及 WebSocket 语音轮次转录,两款模型均支持上下文、关键词和多语言提示。
GPT-Live-Transcribe 支持实时增量转录与延迟调节:模型通过 Realtime API 接收麦克风、通话或媒体流,在语音持续输入时返回 transcript delta;开发者可降低延迟以更早获得部分文本,也可提高延迟以换取更完整的上下文和转录质量。
GPT-Transcribe 覆盖文件转录与 WebSocket 已提交语音轮次:模型支持对完整录音进行一次性或流式文件转录,也可在 Realtime 会话中转录已经提交的语音轮次;文件转录接口为
/v1/audio/transcriptions,单个文件上限为 25MB。新增三类转录上下文输入:两款模型均支持通过
prompt提供录音场景,通过keywords提示产品名、缩写等专有词,并通过languages指定一个或多个预期语言,用于改善专业术语、多语言音频和语码转换的识别。实时与文件转录采用两档定价:GPT-Live-Transcribe 按音频时长计费,每分钟 0.017 美元;GPT-Transcribe 每分钟 0.0045 美元,低于 GPT-4o-Transcribe 的每分钟 0.006 美元。
成为新转录项目的默认推荐模型:OpenAI 将 GPT-Live-Transcribe 作为实时音频转录的推荐入口,将 GPT-Transcribe 作为录音文件转录的推荐入口;原有 GPT-4o-Transcribe、GPT-4o-mini-Transcribe 等模型仍可继续使用。
https://x.com/OpenAIDevs/status/2082201169443905798
(@OpenAIDevs@X)
2、韩国语音 AI 公司 Supertone 调整语音 AI 产品线:Play、API 与 Voice Builder 8 月 31 日停服,Shift、Clear、Air 转移至新运营方
韩国语音 AI 公司 Supertone 宣布调整旗下语音 AI 服务运营方式:Supertone Play、Supertone API 与 Voice Builder 将于 2026 年 8 月 31 日停止服务,新用户注册和付费已于 7 月 23 日关闭。实时变声器 Shift、音频降噪工具 Clear 与实时语音增强产品 Air 将转移至新的运营方,现有许可证和已购买声音继续有效。
Play、API 与 Voice Builder 于 8 月 31 日停止服务:三项服务将在 2026 年 8 月 31 日终止访问;Play 与 API 已于 7 月 23 日停止新用户注册和新增付费,现有用户需在停服前完成音频、声音配置及相关数据备份。
Shift、Clear 与 Air 转移至新运营方:实时变声、语音分离和实时音频增强产品不会随 Supertone Play 一并关闭,而是由新的所有者继续运营;官方表示现有许可证及已购买声音资产保持有效。
Supertone API 停止新增调用接入:API 原支持 31 种语言、200 余种预设声音、50 余种情绪风格,以及约 10 秒参考音频的声音克隆;随着新注册和购买关闭,依赖其 REST API、Python SDK 或 TypeScript SDK 的应用需要迁移至其他 TTS 服务或本地模型。
Supertonic 开源模型同步停止维护:Supertonic GitHub 仓库将归档,官方不再开发新版本或提供技术支持;最后公开版本为 99M 参数的 Supertonic 3,支持 31 种语言、ONNX Runtime 本地推理和 44.1kHz 16-bit WAV 输出。
开源权重可继续本地部署,Voice Builder 不再生成新声音:Supertonic 的代码、ONNX 权重和多语言 SDK 不依赖云端服务,仓库归档后仍可下载和运行;但用于生成 Supertonic 2、Supertonic 3 自定义声音配置的 Voice Builder 将随停服下线。
https://www.supertone.ai/en
https://github.com/supertone-inc/supertonic/blob/main/README.md
(@Supertone)
3、Fish Audio 完成 5200 万美元种子轮融资:S2.1 Pro 单卡 H200 吞吐超 8000 tokens/s,ARR 达 2100 万美元
Fish Audio 宣布完成 5200 万美元种子轮融资,由 Coreline Ventures 与今日资本领投。成立一年内,团队从 3 人扩展至 22 人,发布 4 款 TTS 模型和 1 款 STT 模型,平台用户超过 800 万,ARR 从零增长至 2100 万美元;企业及开发者业务已贡献约三分之二收入。
单卡 H200 吞吐超过 8000 tokens/s:Fish Audio 重构完整推理栈并开发自定义 FP8 算子,使新推出的语音模型 S2.1 Pro 在单张 NVIDIA H200 上实现每秒 8000+ token,降低单次请求推理成本,并支撑 API 免费开放策略。
支持 83 种以上语言与 1.5 万条自然语言控制指令:S2.1 Pro 覆盖 83 种以上语言,可通过超过 1.5 万种自然语言指令控制词级情感表达,并重点优化带口音英语、普通话、日语、韩语和西班牙语。
盲听测试偏好率达到 66%:Fish Audio 披露,在与领先竞品的盲听比较中,66% 的听众更偏好 S2.1 Pro;该结果来自真实用户偏好驱动的后期训练体系。
一年发布 5 款音频模型,社区积累超 200 万个声音模型:团队在一年内推出 4 款 TTS 模型和 1 款 STT 模型,平台累计超过 800 万名创作者、开发者和企业用户,社区语音模型数量超过 200 万。
下一阶段扩展至 Audio LM 与语音到语音模型:融资后,Fish Audio 将研发范围从 TTS 扩展至音频理解语言模型和语音到语音系统,同时继续投入 API、开发者工具、本地化部署、零数据保留及符合 HIPAA 标准的企业配置。
https://fish.audio/blog/fish-audio-52m-seed-funding/
(@Fish Audio@X)
02 有亮点的产品
1、Mirage 发布 Avatar X 数字人模型:10 秒视频生成 AI Twin,联合建模声音、微表情与肢体动作
Mirage 发布 Avatar X 数字人生成模型,并将其接入 Captions 的 AI Twin 功能。用户录制 10 秒校准视频后,即可基于新脚本生成保留本人外观、声音和动作习惯的数字分身视频,支持横屏、竖屏及多语言内容生成。
10 秒视频完成数字分身校准:Avatar X 仅需用户录制 10 秒视频,即可提取人物身份、声音和行为特征;Mirage 官方对比显示,HeyGen 需要 15 秒,Synthesia 需要 1–5 分钟。
声音、表情与动作统一生成:模型不采用静态照片叠加嘴型的传统数字人管线,而是联合生成声音、眼神、微表情和肢体动作,使语音节奏能够同步驱动面部与身体表现。
支持笑、哈欠、坏笑与惊讶等细粒度表情:Avatar X 面向完整人物表演建模,可生成笑声、哈欠、坏笑和倒吸气等细微反应,并在连续视频中保持人物身份一致性。
同一 AI Twin 可修改服装、背景与语言:完成数字分身创建后,用户可通过脚本或提示词更换人物服装、拍摄环境和输出语言,无需重新录制真人素材。
已接入 Captions,支持横屏与竖屏生成:Avatar X 当前用于 Captions 的 AI Twin 和 AI Avatar 功能,可根据脚本生成横屏或竖屏数字人口播视频;相关能力包含在 Captions Max 及更高等级订阅中,Max 价格为每月 24.99 美元。
https://x.com/trymirage/status/2082120270618530053
(@Mirage)
2、Kaltura 支撑世界杯 13 亿次播放与 700 万峰值并发:AI 智能体参与直播运维,并预告 Agentic Avatar 实时观赛交互
Kaltura 为欧洲、亚洲和中东的广播商及电信运营商提供 2026 FIFA 世界杯直播基础设施,赛事期间累计处理超过 13 亿次播放会话,峰值并发达到 700 万,覆盖约 4000 万台注册设备。平台同时引入 AI 智能体辅助六套生产环境运维,并预告面向体育直播的 Agentic Avatar,通过语音、文本和数字人形象为观众提供实时交互服务。
13 亿次播放与 700 万峰值并发:Kaltura 驱动的电视服务在世界杯期间累计承载超过 13 亿次播放会话,峰值同时在线会话达到 700 万;整体直播需求较 2022 年世界杯增长约 86%。
六套生产环境覆盖三大区域与 4000 万台设备:平台在欧洲、亚洲和中东同时运行六套独立生产环境,覆盖约 4000 万台注册设备,并在比赛活跃阶段每日监控约 3000 万台设备。
单体后端重构为独立微服务:Kaltura 在 2022 年世界杯后的四年内完成媒体与电信平台重构,使认证、权益校验、播放等服务能够独立扩缩容,并通过服务隔离限制局部故障对整体直播链路的影响。
AI 智能体接入实时运维链路:工程团队使用 AI 智能体汇总环境健康状态、结合比赛进程监控流量与系统负载,并按需分析日志、请求量和错误模式;Kaltura 称,部分原需数小时完成的排查工作可缩短至数分钟。
Agentic Avatar 面向实时体育内容发现与观众服务:Kaltura 预告将 Agentic Avatar 扩展至体育与娱乐直播,通过语音、文本和可视化数字人提供实时对话,可用于内容发现、个性化观赛引导,以及套餐和订阅方案说明;官方尚未披露实际部署客户、响应延迟或正式上线时间。
https://corp.kaltura.com/blog/kaltura-delivers-2026-fifa-world-cup/
(@Kaltura)
3、XMOS 发布 VocalFusion XVF3620 语音处理器:芯片内集成 AI 降噪、全双工 AEC 与双麦克风波束成形
XMOS 推出 VocalFusion XVF3620 语音处理器,将 AI 降噪、全双工声学回声消除、双麦克风波束成形和自动增益控制集成至单芯片语音处理链路。该芯片面向智能家居、对讲设备、服务机器人和工业语音终端,可在交通、雷雨、空调及高噪声公共场所中改善语音采集,并支持播放音频期间的语音打断。
单芯片集成完整数字语音处理链路:XVF3620 在芯片内完成 PDM-to-PCM 转换、双麦克风波束成形、AI 降噪、多频段压缩、均衡和自动增益控制,减少外部 DSP 与多芯片音频处理链路。
全双工 AEC 支持播放期间语音打断:处理器集成快速自适应声学回声消除和残余回声过滤,在扬声器播放音频时继续提取近端语音,面向语音助手、对讲和机器人场景提供 barge-in 能力。
AI 降噪同时处理背景噪声与混响:降噪模型基于多类真实环境噪声训练,可分离语音与交通、雨声、雷声、空调及餐饮场所噪声,并针对混响进行抑制;模型还可根据具体应用和语音识别引擎进行调优。
XCORE 并行架构同时执行 AI、DSP 与接口任务:XVF3620 基于 XCORE 的确定性并行处理架构,使降噪、回声消除、波束成形和控制任务能够并行运行,避免不同实时任务之间相互阻塞。
提供 USB、I²S 与多类控制接口:音频接口支持 USB 及主从模式 I²S,控制接口支持 I²C、UART 和 USB HID,并可直接连接 PDM 麦克风;XMOS 同步提供双麦克风 XK Voice L71 开发套件,用于 USB 外设或嵌入式语音产品原型验证。
https://www.xmos.com/xmos-launches-ai-voice-processing-in-new-vocalfusion-xvf3620-voice-processor
(@XMOS)
4、AI 会议笔记 Granola 发布 Apple Watch 版:一键启动转录,跨 iPhone、Mac 与 Windows 自动同步
Granola 推出 Apple Watch 应用,将 AI 会议记录扩展至散步沟通、白板讨论和咖啡会谈等脱离电脑的线下场景。用户可从手表一键启动对话记录,结束后自动在 iPhone、Mac 和 Windows 客户端生成并同步会议笔记。
Apple Watch 一键启动会议记录:用户点击手表即可开始记录,界面会变为绿色并播放提示音,用于确认应用正在工作;再次点击即可结束,处理后的笔记会在其他终端显示。
日历提醒与表盘复杂功能降低启动成本:针对已排期会议,应用会在开始前通过轻触提醒用户启动记录;临时对话则可通过表盘复杂功能直接新建笔记,无需先打开 iPhone 或电脑。
跨 iPhone、Mac 与 Windows 自动同步:由 Apple Watch 发起的笔记会同步至 Granola 的手机和桌面客户端,用户可继续查看、编辑和处理会议内容。
支持通过 Granola MCP 向 AI 工具提供会议上下文:手表采集并生成的笔记可继续接入 Granola MCP,作为外部 AI 应用的上下文来源,而非停留在独立的手表转录记录中。
免费上线,要求 watchOS 11 或更高版本:Granola Apple Watch 应用已开放使用,用户需安装或更新 iPhone 版 Granola,并在登录后完成手表端设置。
https://x.com/cjpedregal/status/2082104366689821049
(@Granola@X)
03 有态度的观点
1、Dario Amodei:从未主张禁止开源权重模型
Anthropic CEO Dario Amodei 于当地时间 27 日发布博文,就外界关于 Anthropic 支持禁止开源权重模型的传言作出回应。
Amodei 在博文中明确表示,「Anthropic 从未主张禁止开源权重模型」,并强调不具备危险能力的开源权重模型「是一种公共品」,能为企业、开发者和研究人员带来价值。
他同时指出,即便是来自中国的开源权重模型,也不在他所担忧的范畴之内。
此外,他还对 AI 被用于「生物攻击」表示担忧,并认为开源权重模型在这类场景下风险更高,原因是难以对其施加护栏或进行使用监控。在应对措施上,Amodei 支持限制中国获取高性能芯片,并呼吁正式打击蒸馏行为。
此前,英伟达创始人兼 CEO 黄仁勋在 X 平台发布首条帖文,转发了一封由英伟达、Hugging Face、Meta、微软、Mistral 等多家 AI 公司联署的公开信,呼吁政策制定者不要对开源权重 AI 模型实施「过早的限制」。
( @APPSO)
04 Real-Time AI Demo
1、开发者用 Three.js + Kimi K3 + Agora,做了一台能「拨号聊天」的复古 AI 电话
开发者 @zicojzc:
我用 Three.js 和 Kimi K3 开发了一款复古风格的旋转式电话。我在桌子上留了张便条:只要拨对号码,你或许就能与 @elonmusk 交谈了。
由 Agora 提供支持的语音人工智能技术。声音已开启。
https://x.com/zicojzc/status/2081950728315404354
Live demo here:
https://rotary-dial-phone.vercel.app
05 社区黑板报
招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)
1、今日分享:pre-voice interfaces

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
作者提示: 个人观点,仅供参考