Friend 发布第二代 AI 陪伴项链:限制用户修改 AI 名字和音色,随机分配人格丨日报

图片

本期编辑:@三水、@鲍勃



01 有话题的技术

1、Qwen 发布 Qwen-Audio-3.0-ASR-Flash:上下文不「断片」、听得准行业词、热词加多也不乱、边识别边润色、一套模型听懂 30 种语言

阿里云千问发布 Qwen-Audio-3.0-ASR-Flash 语音识别模型,针对长音频上下文一致性、行业词识别、热词定制和语音润色进行升级。模型支持从音频上下文中持续更新识别记忆,可直接输出结构化文本,并通过阿里云百炼平台提供 Flash、Filetrans 和 Streaming 三种调用版本。


  • 长音频 Context 记忆:跨片段保持术语一致性:Qwen-Audio-3.0-ASR-Flash 在识别当前语音片段时,可参考此前已识别内容,根据上下文判断同音词、专业术语和中英文混合表达;即使面对长时间会议、访谈和课程录音,也能保持人名和技术概念识别一致。


图片


  • 行业词识别无需人工配置:医疗专业词命中率达到 95.36%:模型通过构建覆盖医疗、IT 编程、股票、社会名人等领域的专业词库,将行业术语识别能力内化到模型中;在内部行业词评测中,医疗场景专业词「听中率」超过 95.36%。


图片


  • 即时热词定制:热词识别率超过 90%,多数场景超过 99%:用户可动态传入企业专属品牌名、人名和业务术语,模型通过分级热词机制增强识别;在测试集中,热词听中率均达到 90% 以上,多数场景超过 99%,无需等待模型重新训练。

  • ASR 内置语音润色:一步输出结构化文本:模型在识别阶段同步完成去除口头禅、清理重复、自我纠正和语义重组,可直接输出更接近书面表达的文本;评测中,润色后的可读性平均分从 2.55 提升至 3.43,优秀可读率从 30.75% 提升至 59.27%,与「ASR + Qwen3.6-Plus 后处理」方案效果接近。

  • 统一支持 30 种语言与实时 Streaming 识别:Qwen-Audio-3.0-ASR-Flash 覆盖中文、英语、日语、韩语、泰语、越南语、印尼语、马来语、印地语、阿拉伯语等 30 种语言;Streaming 版本理论出字延迟 300ms,在中文工业场景平均错字率 7.8%,英文工业场景错字率 11.52%。



语音识别结果:공개매수는 경영권 확보를 위해 주식을 장외에서 정해진 가격으로 사는 건데 공개매수가 발표되면 해당 주식의 주가는 보통 상승합니다。

(公开收购是指为了取得经营权,在场外按照指定价格购买股票。公开收购发布后,相关股票的价格通常会上涨。)



语音识别结果:Apakah perasaan anda apabila pertama kali mengetahui anda akan mewakili sekolah ataupun negeri ke peringkat kebangsaan?

(当你第一次得知自己将代表学校或所在州参加全国级别的活动时,你是什么感受?)



语音识别结果:Vậy thì qua những cái kinh nghiệm, qua những cái bài học, qua những cái mà anh đúc kết được thì anh nghĩ đâu là yếu tố quan trọng nhất để có thể xây dựng cũng như là giữ vững được một cái đội nhóm hiệu quả?

(根据你的经验、教训和总结,你认为建立并长期维持一支高效团队,最重要的因素是什么?)


Qwen-Audio-3.0-ASR-Flash: 

https://help.aliyun.com/zh/model-studio/non-real-time-speech-recognition-for-fun-asr-flash


Qwen-Audio-3.0-ASR-Flash-Filetrans: 

https://help.aliyun.com/zh/model-studio/fun-asr-recorded-speech-recognition-http-api


Qwen-Audio-3.0-ASR-Flash-Streaming: 

https://help.aliyun.com/zh/model-studio/fun-asr-realtime-websocket-api


Qwen-Audio-3.0-ASR-Flash:长音频不丢词,行业词不用教


(@Qwen)



2、Thinking Machines 发布 Inkling-Small 开放权重模型:276B 总参数,12B 激活参数,1M token 上下文窗口


图片


Thinking Machines Lab 发布开放权重模型 Inkling-Small,定位为 Inkling 的轻量版本,在四分之一模型规模下保持接近 Inkling 的性能表现。该模型采用混合专家架构,拥有 2760 亿总参数和 120 亿激活参数,支持文本、图像、音频原生推理以及最长 100 万 token 上下文窗口。


  • 276B 总参数、12B 激活参数的混合专家架构: Inkling-Small 采用 Mixture-of-Experts 架构,相比 Inkling 的 975B 总参数、41B 激活参数,大幅降低每次推理所需激活参数规模,同时保持接近的大模型能力。

  • 原生多模态输入能力: 模型支持文本、图像和音频输入,可直接进行跨模态推理,无需额外视觉或语音模型级联。

  • 最长 1M token 上下文窗口: Inkling-Small 延续 Inkling 的长上下文能力,可处理百万级 token 输入,适用于长文档分析、多轮任务和复杂智能体工作流。

  • 可调节思考难度机制: 模型支持控制推理计算量,通过调整思考强度在响应速度与任务性能之间进行权衡。

  • NVIDIA GB300 NVL72 系统训练: Inkling-Small 与 Inkling 使用相同训练路线,在 NVIDIA GB300 NVL72 系统上完成训练,并通过优化预训练数据与训练配方提升小模型表现。


https://x.com/thinkymachines/status/2082885869426631032


( @ThinkingMachinesLab)



3、SpaceXAI 发布 Grok Voice Think Fast 2.0 语音模型:实时语音智能体延迟优化,支持工具调用与多语言交互

图片


图片


SpaceXAI 发布 Grok Voice Think Fast 2.0,面向实时语音智能体场景升级语音理解、生成和任务执行能力。该模型通过 Voice API 提供端到端语音交互,支持 WebSocket 实时通信、函数调用、搜索和 MCP 工具接入,可用于客服、语音助手和实时 Agent 应用。


  • 实时 Speech-to-Speech 架构:支持低延迟双向语音交互:Grok Voice Think Fast 2.0 通过实时语音接口处理音频输入和输出,支持连续语音对话,不需要传统 ASR → LLM → TTS 的多模块串联流程。

  • 语音智能体支持工具调用:连接搜索与外部系统:Voice Agent API 支持函数调用、Web 搜索、X 搜索、Collections 检索以及远程 MCP 工具,使语音智能体能够在对话过程中执行外部任务,而不仅生成语音回复。

  • 提供实时、TTS、STT 三类语音 API:SpaceXAI Voice API 覆盖 Speech-to-Speech 实时对话、文本转语音和语音转文本三类能力,其中 STT 支持批处理和流式模式,并覆盖 25 种语言。

  • 实时语音接口定价为 0.05 美元/分钟:Voice API 实时 Speech-to-Speech 按音频时长计费,每分钟 0.05 美元(约 3 美元/小时);文本输入事件额外按每条 0.004 美元计费。

  • 面向企业级部署提供安全与扩展能力:Voice API 支持企业场景中的高可用部署,包括 SOC 2 Type II、HIPAA 合规支持、GDPR/DPA 支持、零数据保留选项和自定义限流配置。


https://x.ai/news/grok-voice-think-fast-2


(@SpaceXAI)



4、智元发布 WITA-Omni Preview 具身全模态大模型:DailyOmni 得分 85.21 登顶,Thinker–Talker–Actor 统一感知与动作生成

图片


智元发布具身原生全模态大模型 WITA-Omni Preview,在 DailyOmni 全模态理解榜单中以 85.21 分登顶,并在八项细分指标中六项排名第一。模型面向人形机器人交互场景,将视觉、音频、语言、动作和表情统一建模,通过 Thinker–Talker–Actor 架构实现从环境理解、交互决策到语音和动作输出的一体化生成。


  • DailyOmni 综合得分 85.21:音视频联合理解能力登顶:WITA-Omni Preview 在 DailyOmni 评测中排名第一,该榜单重点测试模型对真实开放环境音视频中的声画对应关系、事件时间顺序和跨模态语义推理能力。


图片


  • Thinker–Talker–Actor 三层架构:统一感知、语言与具身输出:模型将文本、视觉、音频和音视频输入映射至统一表示空间,由 Thinker 负责多模态推理与交互决策,Talker 流式生成语音,Actor 输出机器人动作和表情,使动作与语音成为同等级输出。

  • 千万小时级多模态数据训练:强化真实物理环境理解:WITA-Omni 使用千万小时级多模态数据进行训练,并构建包含声音、画面、语言、动作和表情时序关系的高质量交互数据集,使模型能够判断交互对象、响应时机和事件关系。

  • SFT–OPD–RL 三阶段训练:优化回应时机与交互决策:模型通过监督微调建立基础能力,通过同策略蒸馏提升音视频上下文推理能力,再通过强化学习优化「是否回应、何时回应、回应谁」等具身交互策略。

  • 面向机器人原生交互:从模块串联转向端到端多模态生成:相比传统机器人将视觉、语音、动作模块分离处理,WITA-Omni 将「看、听、说、动」整合到统一模型中,用于构建持续感知和实时反馈的人机交互系统。


全球第一,智元 WITA-Omni Preview 登顶 DailyOmni 全模态理解榜单


(@智元 AGIBOT)



5、Kalpa Labs 推出通用音频模型:探索统一语音理解与生成的 Audio Foundation Model


Kalpa Labs 发布流式对话 TTS 模型公测,并展示其 Generalist Audio Model(通用音频模型)路线,希望通过统一音频基础模型覆盖语音生成、语音理解、环境音和音乐等任务。团队认为当前音频领域仍类似语言模型早期阶段,依赖多个专用模型组合,未来需要能够理解上下文并执行复杂指令的通用音频模型。


  • 提出 Turing Clock 作为新的语音交互评估指标:Kalpa Labs 认为当前 Speech AI 评测仍主要关注单轮 TTS 或简单理解任务,因此提出衡量「用户需要多久才能察觉自己正在与 AI 对话」的 Turing Clock,用于评估长期语音交互质量。

  • 创始团队覆盖语音助手规模化与实时系统方向:Kalpa Labs 由 Prashant Shishodia 和 Gautam Jha 创立。Prashant 此前参与 Google Assistant 机器学习系统建设,Gautam 曾从事低延迟系统开发,两人的背景分别对应语音模型能力和实时交互基础设施挑战。

  • 端到端对话语音模型:统一理解与生成链路:Kalpa Beta v0.3 面向 conversational speech 场景训练,同时支持对话和 TTS 模式,不依赖传统 ASR → LLM → TTS 多模型串联流程,可直接完成语音输入和语音输出。

  • 多角色音频生成与场景控制:支持 Studio 创建对话场景:Kalpa Studio 支持用户定义角色、台词、节奏和情绪,生成包含多个声音角色的完整对话场景,而非单一文本转语音输出。


https://x.com/KalpaLabsAI/status/2082867854547005954


https://kalpalabs.ai/blog/towards-generalist-audio-models


(@KalpaLabsAI)




02 有亮点的产品



1、语音编程助手 SKI :本地运行连接 Claude Code、Codex 等智能体,支持语音控制与会议记录

图片


SKI 是一款面向开发者的语音编程助手,将语音交互能力接入 Claude Code、Codex、Hermes 等编码智能体。用户可以通过语音描述需求,让智能体执行代码任务并以语音方式反馈结果;同时支持本地运行、离线转录和会议记录,无需 API Key。


  • 语音闭环驱动 Coding Agent:SKI 不只是语音转文字工具,而是让用户可以直接用语音与编码智能体交互。智能体执行任务后再通过语音反馈结果,形成「说需求—执行—反馈」的完整闭环。

  • 连接多个编码智能体:SKI 支持接入 Claude Code、Codex、Hermes 等不同智能体,用户可以在不同项目和任务之间切换,将其作为统一的语音入口来管理开发工作流。

  • 完全本地运行,无需 API Key:SKI 的语音处理与转录均在本地设备完成,数据不会离开用户电脑。目前支持 macOS 和 Windows。

  • 支持会议录音与实时笔记:除了编程场景,SKI 还可以直接录制会议内容,无需以机器人身份加入 Zoom、Google Meet 或 Teams,并自动生成带说话人标记的会议记录。

  • 面向 Agent 时代的语音交互层:SKI 将语音作为人与多个开发智能体之间的统一控制入口,减少复杂任务中频繁输入提示词的成本,更像是一个「语音协作层」,而非单一代码生成工具。


https://heyski.io/


(@SKI)



2、Smallest.ai 完成 1300 万美元 A 轮融资:发布 Voice 4.0 架构与 Hydra 语音模型,推进端到端实时语音智能体


图片


Smallest.ai 完成 1300 万美元 A 轮融资,由 Seligman Ventures 领投,Sierra Ventures 与 3one4 Capital 参投,累计融资超过 2100 万美元。公司同步发布 Voice 4.0 架构与 Hydra 异步语音-语音模型,将语音智能体处理流程从传统 ASR → LLM → TTS 串行链路改为「听、思考、动作、回答」并行处理。


  • Voice 4.0 四阶段并行架构:替代 ASR→LLM→TTS 串行流程:Smallest.ai 将实时语音 Agent 拆分为听(Listen)、思考(Think)、动作(Act)、回答(Speak)四个阶段,通过并行处理降低等待时间,使模型可以在继续接收用户输入的同时执行推理和生成响应。

  • Hydra 异步语音-语音模型:支持边听边处理任务:Hydra 面向实时语音交互设计,不再将语音转换为文本后再调用语言模型,而是直接在语音输入和语音输出之间建立端到端处理链路,支持打断、多轮对话和连续交互。

  • Pulse STT Pro 支持 38 种语言与说话人能力:Smallest.ai 的语音识别模型支持 38 种语言,同时集成说话人分离、情绪检测和噪声抑制能力,面向客服、呼叫中心等企业语音场景。

  • Lightning V3.1 登上 Artificial Analysis TTS 榜单前列:Smallest.ai 的 TTS 模型 Lightning V3.1 进一步优化语音生成速度和自然度,用于低延迟语音 Agent 和实时客服场景。

  • 企业客户覆盖通信与客服场景:Smallest.ai 已服务 RingCentral、Truecaller、Readymode 等企业客户,融资资金将用于扩大实时语音 AI 基础设施和企业级部署能力。


https://www.aol.com/articles/smallest-ai-gets-21-million-203000000.html


(@Smallest.ai)



3、Simile AI 完成 1 亿美元 A 轮融资:构建人类行为基础模型,用生成式智能体模拟真实决策


Simile AI 宣布完成 1 亿美元融资,由 Index Ventures 领投,Hanabi Capital、Bain Capital Ventures、A* 等机构及 Andrej Karpathy、Fei-Fei Li 等个人投资者参与。公司从生成式智能体研究起步,正在构建用于预测人类行为的基础模型和企业级模拟平台,通过 AI 智能体模拟消费者、员工和群体决策过程。


  • 1 亿美元 A 轮融资:加速人类行为基础模型研发:Simile 本轮融资用于扩展生成式智能体模拟平台,推动从个体行为模拟向大规模社会系统预测发展。

  • 生成式智能体模拟真实人类行为:平台中的 AI 智能体具备记忆流、反思和规划机制,可基于历史经历形成行为轨迹,并模拟不同个体在环境变化下的决策过程。

  • 构建预测人类行为的基础模型:Simile 正在开发能够预测不同场景下人类反应的基础模型,用于模拟消费者、员工、组织和社会群体在变化条件下的行为。

  • 企业模拟平台支持策略验证:平台可用于测试产品方案、市场策略、政策变化和商业决策,通过虚拟环境提前观察可能产生的结果,减少真实世界试错成本。

  • 已有企业客户验证模拟能力:Simile 已将技术应用于企业场景,包括财报电话会演练、诉讼结果建模和政策测试等任务,推动生成式智能体从研究实验进入商业应用。


https://x.com/simile_ai/status/2082873889407827980https://www.simile.ai/


(@Simile AI)



4、Friend 发布 AI 陪伴项链 Friend 2.0:提供固定但随机化的声音和人格设定,支持长期记忆与主动交互


备受争议的 AI 伴侣设备 Friend 推出新一代 AI 陪伴硬件 Friend 2.0,将原本通过手机文字消息交互的 AI 项链升级为可直接语音回应的可穿戴设备。新版本加入内置扬声器、个性化声音和增强记忆能力,定位为长期陪伴型 AI,而非生产力助手。


  • 内置扬声器实现直接语音反馈:Friend 2.0 在硬件中加入扬声器,使 AI 角色能够直接通过项链发声回应用户,不再依赖手机推送文字消息。

  • 固定声音和人格设计,区别于可配置型 AI 助手:Friend 不允许用户修改 AI 的名字或声音,而是为每个设备随机分配人格特征。团队希望通过限制可控性,强化用户与 AI 之间类似关系建立的体验。

  • 从文字聊天升级为可穿戴实时陪伴:设备通过项链形态将 AI 角色带入日常环境,用户可通过硬件与 AI 交流,并让 AI 感知周围环境作为交互上下文。

  • 增强长期记忆能力:Friend 2.0 支持更长时间的对话记忆,用户可通过订阅方案扩展超过 30 天的历史记忆保留,用于维持持续性的个人关系上下文。

  • 硬件售价提升至 249 美元:相比上一代 129 美元版本,Friend 2.0 因加入语音输出硬件和相关能力升级,售价提升至 249 美元;同时提供额外订阅服务扩展记忆能力。

  • 基于 Gemini 模型构建个人 AI 角色体系:Friend 平台中的数字角色基于大模型运行,结合可穿戴设备提供的环境信息和记忆系统,形成持续交互的个人 AI 伙伴。


https://x.com/friend/status/2082827641338658873


(@Friend)



03 有态度的观点


1、马斯克批评 Anthropic 切书脊,要求 SpaceXAI 扫描时不得切断书脊

图片


埃隆·马斯克在 X 上表示,他已要求 SpaceXAI 团队把处理过的珍稀书籍保存在一座图书馆,并采用不破坏装帧的方式扫描,而不是切断书脊后将书页送入高速扫描设备。


这条回应针对 AI 公司大批采购旧书作为训练数据引发的争议。404 Media 报道称,书籍数据库公司 ISBNdb 正向 AI 公司提供大批量图书采购服务,理由是旧书内容不含生成式 AI 产生的文本;《华盛顿邮报》此前援引诉讼文件称,Anthropic 的「巴拿马计划」曾批量购买纸质书,拆除装帧、扫描书页后回收原书。


这项要求只针对珍稀书籍:团队需保留实体原书,再完成数字化处理。


( @APPSO)



04 社区黑板报


招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)



1、招聘:内容增长 · 开发者方向(Content & Developer Growth)


职责


负责国内外开发者的 KOL 与内容增长,让我们的产品借声量持续被发现、讨论和推荐。


你会做的事


  • 端到端做 KOL:搜寻合适的开发者 KOL / 技术博主,建联、沟通、推进合作并长期维护

  • 盯热点、借势:长期关注海外 AI、vibe coding、Agent、语音 AI 的趋势和社区讨论,找到能借势的话题,快速接上我们的产品。

  • 内容分发 & GEO:把内容投放不同的社媒平台,结合各平台语境调整表达,兼顾 GEO 效果


能力需求


  • 有过完整的增长实操:在海外平台(尤其 X)独立做过 KOL 投放这套闭环优先

  • 英文能当工作语言:能跟海外 KOL 顺畅沟通、有内容品味,判断内容质量好坏

  • 深度用过海外平台:X / Reddit / YouTube / TikTok 等,了解这些平台的语境和热点扩散逻辑

  • 自驱、反应快:给方向能自己拆成任务跑完,把想法快速落成传播动作


加分项


  • 能 vibe coding:能借助 AI 工具自己跑通 demo、案例页、轻量内容项目

  • 有开发者社区运营经验,或手里有现成的海外技术 KOL 资源


简历请投递给 RTE 小助手(添加微信 Creators2022 并备注岗位名称)


图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。


图片

作者提示: 个人观点,仅供参考

注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    关键词
    // 相关帖子
    Coming soon...
    • 0
    Friend 发布第二代 AI 陪伴项链:限制用户修改 AI 名字和音色,随机分配人格丨日报RTRTE_Dev_Comm