红杉领投 AI 员工 Aidan:集成多模态屏幕感知与自然语音,主导企业客户通话丨日报

图片


开发者朋友们大家好:


这里是「RTE 开发者日报」,每天和大家一起看新闻、聊八卦。我们的社区编辑团队会整理分享 RTE(Real-Time Engagement) 领域内「有话题的技术」、「有亮点的产品」、「有思考的文章」、「有态度的观点」、「有看点的活动」,但内容仅代表编辑的个人观点,欢迎大家留言、跟帖、讨论。


本期编辑:@koki、@鲍勃


01 有话题的技术


1、DecartAI 联合 fal 上线 Lucy 2.5:基于 WebRTC 协议实现实时视频到视频(V2V)编辑与虚拟试穿


DecartAI 联合 AI 开发者平台 fal 正式上线实时 AI 模型 Lucy 2.5。该模型基于 WebRTC 协议,能够对摄像头或流媒体源的视频流进行实时视频到视频(Video-to-Video)编辑。这使得虚拟试衣、实时特效渲染和场景重塑能以交互式超低延迟直接部署在直播、电商和广告场景中。


  • 基于 WebRTC 协议的实时 V2V 编辑:支持直接通过 Webcam 摄像头或实时流媒体输入,在线进行实时视频样式重塑(Restyle)、背景替换以及实时增删画面物体。

  • 支持基于参考图的角色转换与虚拟试衣:模型支持通过单张参考图(Reference-image)进行角色特征替换,并能在交互式超低延迟下实现高保真的实时虚拟试穿(Virtual Try-On)。

  • 物理特效(V2V VFX)实时叠加:支持在运动视频流中实时检测并无缝叠加火焰、爆炸和烟雾等高质量视觉特效,同时支持修改画面中主体的颜色和纹理。

  • 优化微小与非居中物体的编辑隔离度:提升了对非人类、体积微小或处于画面非中心位置物体的边界定位精度(Edit Isolation),显著改善了局部编辑时的提示词遵循度(Prompt Adherence),避免局部修改对背景造成误伤。


( @DecartAI@X、@fal@X)



2、Zyphra 开源 ZUNA1.1:380M 参数 EEG 扩散自编码器模型,支持 0.5s–30s 可变长度输入与任意通道重建


AI 研发公司 Zyphra 宣布开源 380M 参数的脑电图(EEG)基础模型 ZUNA1.1。该模型基于 Transformer 扩散自编码器架构,旨在解决真实世界脑电数据通道流失、多变时长及高噪干扰等痛点。通过全新的时空多混合 Dropout 训练,ZUNA1.1 实现了在无缝兼容任意通道布局的同时,支持 0.5s 至 30s 的变长脑电信号重建、去噪与空间上采样。


  • 4D 旋转位置编码与通道无关架构:ZUNA1.1 采用基于 3D 头皮电极坐标(x, y, z)及 coarse-time 时间轴(t)的 4D 旋转位置编码(Rotary Positional Encoding)。模型不依赖固定阵列索引,可接受任意数量及布局的电极输入,并能对未采集的头皮空间位置进行信号上采样重建。

  • Flex Attention 支持 0.5s 至 30s 变长输入:相比前代 ZUNA1 仅支持 5 秒固定输入的限制,ZUNA1.1 引入 Flex Attention 机制与样本感知掩码(sample-aware mask),在单批次(batch)内打包训练不同长度的脑电片段,实现了 0.5s–30s 变长数据的免重训直接推理。

  • 混合四种 Dropout 遮蔽方案训练:为拟合运动伪迹、局部断连等真实场景,模型训练混合了整通道缺失(whole-channel)、全通道时间截断(time-stretch)、时空局部缺失(spatial-time gap)和单点随机丢失(point-wise)四种噪声机制,显著提升了在非均匀随机缺失下的重建精度。

  • 3.5M 通道小时数据集与动态质量过滤:训练语料库由 200 万扩大至 350 万通道小时。清洗阶段弃用了整段丢弃法,改用每秒质量评分进行细粒度保留,并同时训练了 0.1–45Hz 带通和 0.01Hz 高通(含陷波)两种预处理滤波器变体,增强了对异构预处理脑电数据的泛化能力。


Hugging Face:  

http://huggingface.co/Zyphra/ZUNA1.1


GitHub: 

http://github.com/Zyphra/zuna


(@ZyphraAI@X)



3、阿里发布 Qwen-Audio-3.0-TTS 语音合成模型:首包延迟约 300ms,支持 48kHz 输出与 16 语种合成

阿里正式发布实时语音合成模型 Qwen-Audio-3.0-TTS,推出低延迟 Flash 与高质量 Plus 双版本。该模型在多语种与方言、自然语言风格控制以及嘈杂环境音色复刻上进行了专项优化,首包延迟低至 300ms 左右,单次最长支持 3 分钟的音频生成。


图片


  • Flash 与 Plus 双版本分流:Flash 版本聚焦实时交互,首包延迟控制在 300ms 左右,平均 WER/CER(字/词错误率)得分为 3.87;Plus 版本聚焦高保真生成,在 16 种多语言评测中平均说话人相似度(SS)达 82.75%,获得 Artificial Analysis 榜单冠军。

  • 16 语种与 20 种中文方言支持:多语种覆盖中、英、日、韩、德等 16 种语言,并在其中 10 种语言的可懂度指标中取得最佳表现;通过专项方言强化训练,支持粤语、四川话、东北话等 20 种高质量中文方言,缓解了通用强化学习中方言特色弱化的问题。


图片


  • Free-style 自由指令与细粒度标签控制:支持使用自然语言定义情绪、角色、场景和语速,且允许在文本中直接嵌入结构化标签(如 [gasp]、[giggles]、[angry]),对呼吸、语气和停顿等非语言细节进行精准调控。



  • 原生抗噪鲁棒性与音色克隆:在模型复刻流程中原生注入语音增强能力,在包含高混响、高噪声的嘈杂参考音频中能够自动过滤干扰,实现高质量的音色复刻。

  • 48kHz 高清输出与长文本合成:模型音频输出采样率由 24kHz 提升至 48kHz,支持长文本播报,单次语音合成支持最长达 3 分钟的音频。


(@通义实验室)



02 有亮点的产品


1、硬件初创公司 Aina 获 550 万美元融资:推三键情境感知键盘 Dune,主打主动式 AI 智能体控制

图片


硬件初创公司 Aina(前称 Project Mirage)宣布完成 550 万美元早期融资,由 Redstart Labs 与 360 ONE 领投。该公司推出以三键情境感知键盘 Dune 为代表的系列硬件,旨在打破当前 AI 硬件「被动记录数据」的局限,通过物理按键主动触发并控制 AI 智能体(agent)的自动化工作流。


  • 550 万美元早期融资:由 Redstart Labs(Info Edge India)和 360 ONE 领投,MIXI Global Investments、Antler、Blume Founders Fund,以及新任 WhatsApp 负责人 Kunal Shah、Razorpay 联合创始人等多位个人投资者参投。

  • 主动式智能体触发(Agentic Action):区别于 Plaud 录音笔、Friend 等「始终监听」的被动环境感知设备,Aina 定位为「行动导向型设备」,不重复收集手机或电脑已有的上下文,而是利用已有上下文通过物理接口直接控制和触发 AI 智能体工作流。

  • 三键情境感知键盘 Dune:作为首发产品,Dune 是一个拥有 3 个物理按键的宏键盘。它具备情境感知能力,能根据用户当前运行的桌面应用程序,自动匹配并运行预设的快捷指令或脚本(如一键控制会议中的麦克风、摄像头等)。

  • 三合一硬件功能整合(Dune、Radiance、Shift):Aina 原本开发了三款设备,包括 Dune 键盘、视频通话桌面控制器 Radiance(配备音量旋钮、AI 笔记和语音调制键)以及单击式智能体控制按钮 Shift(与手机相连,单击直接触发特定重复任务)。早期测试后,公司决定将 Radiance 和 Shift 的功能整合至 Dune 中率先出货。


图片


  • 前 Ultrahuman 硬件副总裁操盘:Aina 创始人 Apoorv Shankar 曾任智能指环制造商 Ultrahuman 的硬件副总裁,此前创办的硬件交互初创公司 LazyCo(主打可通过指环控制智能手机)被 Ultrahuman 收购。


( @TechCrunch)



2、硬件初创公司 Sandbar 推出智能语音指环 Stream:基于原生 API 与固件模拟 iOS 键盘,实现跨设备免重连全局听写


Sandbar 推出智能语音交互指环 Stream。该设备通过原生 API 及设备端固件在系统底层将自身模拟为 iOS 键盘,无需切换 App 或频繁进行蓝牙重连,即可在 iOS 与 macOS 设备间实现无缝的全局语音转文字(Universal Dictation)与智能助手交互


  • 系统级模拟键盘输入:Stream 在 iOS 端通过调用原生 API 与设备端(on-device)固件,直接被系统识别为外接键盘。用户无需切换当前运行的 App,即可在任意输入框内实现一键推送通话(Push-to-talk)全局听写。

  • 免重连跨平台流转:配合专用的 Mac 客户端,用户在手机与电脑之间切换使用时,无需进行蓝牙重新配对或初始化,即可实现听写流转。

  • 多模态触控与低干扰硬件架构:采用铝树脂材质机身与定制弧形电池。配备玻璃多手势触控板(支持按住、轻触、滑动)、支持低分贝私密耳语录入的近场麦克风,以及提供无声操作确认的静音触觉反馈(Silent haptics)模块。

  • 三大原生软件交互模组:内置便签(Notes,支持待办事项与文本复制)、对话(Chat,支持网页检索、记忆库与音频交互)以及听写(Dictation,全局语音转文字)功能。


(@minafahmi@X)



3、初创公司 Sable 发布首款 AI 员工 Aidan:集成多模态屏幕感知与自然语音,主导企业客户通话


初创公司 Sable 宣布推出首款 AI 员工(AI Employee)Aidan,并完成了由红杉资本(Sequoia)和 8VC 领投的 4500 万美元融资。该 AI 员工具备屏幕感知、自然语音及界面自主导航能力,旨在通过规模化的个性化互动替代人工进行产品演示与客户培训。目前,Notion、Decagon 等企业已在实际业务中部署 Aidan 用于主导客户通话。


  • 多模态 GUI 导航与感知:Aidan 具备人类级别的屏幕视觉感知、自然语音交互及界面导航能力,能够实时解析用户屏幕内容并在目标应用软件中进行自主点击和路径操作。

  • B 端客户通话规模化落地:该 AI 员工已在 Notion、Decagon 等技术公司及大型公开上市公司部署,用于替代人工,执行原本无法自动化的、针对特定客户定制的软件演示(Demo)与产品培训通话。

  • 4500 万美元资金与行业巨头背书:本轮融资由 Sequoia 和 8VC 领投,Palantir 联合创始人 Joe Lonsdale(8VC 创始人)以及红杉合伙人 Shaun Maguire 已正式加入 Sable 董事会。


(@Nim_Ravid1@X)



03 有态度的观点



1、SK 集团会长崔泰源:内存应该降价,如果一直高价消费电子行业可能受到冲击


据报道,SK 集团会长、大韩商工会议所会长崔泰源表示,目前持续高企的内存价格并不正常。过高的半导体价格不仅会抑制市场需求,未来还可能引发地缘政治层面的矛盾。


图片


崔泰源表示:「内存价格应该下降。这句话听起来可能有点奇怪,但现在的价格并不正常。如果高价一直维持下去,PC 和智能手机只能不断涨价,最终出现所谓的『芯片通胀』。」


他认为,如果高昂的内存价格最终传导到消费电子市场,那么整个行业的基础需求都可能受到冲击,愿意换手机、电脑的人只会越来越少。


同时崔泰源认为,企业应该主动降低利润、扩大供应,在保护市场的同时推动市场继续增长。他对此比喻道:「只有这样,韩国半导体产业才能持续增长。只想着把眼前树上的苹果全部摘下来吃掉,不是战略。」


不过他认为,即使半导体行业全力扩产,也赶不上 AI 需求猛增:「市场已经提出,明年的需求至少会增长 60%-100%,但几乎没有任何一家厂商能够在明年实现相应幅度的产能提升。目前的供应竞争已经可以用『阿鼻叫唤』(注:比喻十分悲惨、呼唤求救的声音)来形容。」


此外崔泰源预测,即使未来内存供应紧张的情况有所缓解,AI 产业的发展瓶颈仍会转移至能源、电力等基础设施:「用于能源领域的电力设备,目前基本都已经进入供应短缺状态。随着 AI 的不断发展,数据中心所需的电缆,以及制造电缆所需的各种材料,也都会出现供不应求的情况。」


(@极客公园)


04 社区黑板报


招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)



1、招聘信息|Agent Harness 工程师(实习/校招)


上海 500-1000/d,20-30K 13 薪 更高薪资可议 提供股权激励


岗位职责:


1.参与 Agent 调度与推理模块的研发,负责优化 Agent 启发式推理链路的逻辑准确性与稳定性。


2.编写高质量的 Agent 运行时脚手架,提升 Agent 对外部环境的感知与操作能力。


3.主导 Agent 评估系统的建设与维护,编写测试脚本与场景评估用例,在非确定性输出下持续捕获边界问题并推动修复。


4.负责 Agent 系统的结构化 Context 与文件系统记忆管理,确保多 Agent 协同过程中信息完整不丢失。


任职要求:


1.专业学历不限,欢迎有极客精神的优秀同学。


2.能清晰描述复杂 Agent 流程中的输入、输出与边界条件,有独立使用 Agent 自动化真实任务的实践经历。


3.编程基础扎实,熟练掌握至少一门主流开发语言。


4.对前沿 AI Agent 技术保持主动追踪与实践热情,有大模型相关应用开发经历(高星 AI 开源项目贡献者优先)。


5.具备极强的学习能力、抗压能力与跨团队沟通能力。


我们提供的机会:


· 作为早期核心成员,参与 从 0 到 1 打造一款 Agent 产品的全过程,你的代码将直接影响产品形态与技术方向。

· 亲手构建属于你自己的系统模块,在非确定性的 Agent 领域解决真实世界中的工程挑战。

· 与公司一同快速成长,直接与创始人沟通,除了有竞争力的薪资与股权激励,还能获得远超成熟公司的技术决策空间与成长速度。


简体请投递:hr@langcore.cn

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。


图片

作者提示: 个人观点,仅供参考


注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    关键词
    // 相关帖子
    Coming soon...
    • 0
    红杉领投 AI 员工 Aidan:集成多模态屏幕感知与自然语音,主导企业客户通话丨日报RTRTE_Dev_Comm