BodyPark ATOM 健身摄像头:视觉识别训练动作并提供实时语音反馈丨日报

图片


开发者朋友们大家好:


这里是「RTE 开发者日报」,每天和大家一起看新闻、聊八卦。我们的社区编辑团队会整理分享 RTE(Real-Time Engagement) 领域内「有话题的技术」、「有亮点的产品」、「有思考的文章」、「有态度的观点」、「有看点的活动」,但内容仅代表编辑的个人观点,欢迎大家留言、跟帖、讨论。


本期编辑:@三水、@鲍勃


01 有话题的技术


1、字节跳动发布音频创作模型 Seed Audio 1.0:统一生成人声、音效与环境声,单次音频约 2 分钟


字节跳动发布音频创作模型 Seed Audio 1.0,在统一框架内生成人声、音效和环境声。用户可通过 prompt、参考音频和结构化时间线直接生成完整声音场景,减少分环节制作与后期拼接。

  • 通用声学编码器统一建模多类音频:将语音、音效和环境声映射至同一声学表征空间,联合处理角色语气、背景氛围、声音节奏及各要素间的声学关系。

  • 时间线控制声音起止与衔接:支持指定角色、台词、情绪以及音效的进入时机,可按时间线控制不同声音要素的进场和叙事配合。

  • 零样本生成支持文本与参考音频:可直接通过文字描述目标声音,或输入参考音频控制音色,无需针对每种声音单独训练模型。


  • 单次生成约 2 分钟并支持持续延长:模型可基于参考音频扩展长音频,在多次延长过程中维持角色音色和表达方式一致,并支持同一音色演绎不同角色。

  • 覆盖 20 余种语言:人工评测显示,大部分语言的音频自然度 MOS 超过 4;复杂指令遵循方面,除越南语外,其余受测语言 MOS 均高于 3.5。影视、短剧、动漫、播客对话等多数受测场景的音频可用率达到 90% 以上。


图片


( @语音之家)



2、Memories.ai 发布音视频理解框架 O-MARC:音视频推理延迟降低 34.6%,显存占用减少 34.7%

Memories.ai 发布音视频理解框架 O-MARC,通过训练外的 OMAC 压缩和压缩蒸馏降低全模态模型的推理成本。在 Qwen2.5-Omni-3B 上,其四项基准平均得分达到 45.8,高于完整 token 推理的 44.1,同时实现 1.53× 推理加速。


  • 推理延迟降低 34.6%,显存占用减少 34.7%:OMAC 相比完整 token 推理实现 1.53× 加速,两项数据均来自 Qwen2.5-Omni-3B 评测。

  • OMAC 无需重新训练即可接入现有模型:该组件保留高信息量的视频帧和时间对齐的音频锚点,再利用视觉记忆分布动态分配音频 token 预算。

  • 压缩后平均得分由 44.1 提升至 45.8:O-MARC 通过完整上下文教师分支与压缩上下文学生分支进行蒸馏;相同评测中,OmniZip 得分为 41.0。

  • UGC-AVQA 包含 1,000 条视频和 4,816 组问答:样本经过音轨移除测试,仅保留无法依靠视觉信息单独回答的问题,用于验证模型是否实际结合声音与画面推理。

  • 压缩方案覆盖 3B、7B 和 30B 模型规模:论文称 OMAC 在三个规模上均优于 OmniZip;其中 O-MARC 的主要效率与得分数据来自 3B 模型。


参考链接:https://memories.ai/research/O-MARC


( @Memories.ai@X)



3、面壁智能开源 MiniCPM-Robot:1.5B VLA 单步延迟 120ms,跟踪模型端侧延迟约 180ms

图片


面壁智能与 OpenBMB 发布 MiniCPM-Robot 系列,包含通用操作模型 MiniCPM-RobotManip 和目标跟踪模型 MiniCPM-RobotTrack。两款模型均面向端侧机器人部署,分别输出操作动作和移动轨迹,模型权重及代码已开放。


  • 1.5B VLA 保留最长 1 分钟视觉记忆:MiniCPM-RobotManip 采用流式上下文持续加入历史观测,可保留 60 帧历史信息,单步计算量由 125 TFLOPs 降至 3.3 TFLOPs。

  • 视觉 token 压缩率达到 4×:MiniCPM-RobotManip 继承 MiniCPM-V 4.6 的压缩机制,将单帧视觉 token 从 256 个减少至 64 个。

  • H100 单步模型前向延迟为 120ms:在 BF16、单帧输入条件下,MiniCPM-RobotManip 的单次决策前向延迟为 120ms;官方给出的 π0.5 对照结果为 234ms,数据不包含动作自回归解码。

  • 跟踪模型直接预测 8 个未来航点:MiniCPM-RobotTrack 融合 DINOv3 与 SigLIP 视觉特征,根据自然语言指令输出 8 组 [x, y, yaw] 轨迹点,用于机器人目标跟随。

  • 宇树 Go2 原生算力实现 5+ FPS:MiniCPM-RobotTrack 联合优化图像采集、编码、推理、动作生成与指令传输后,端到端延迟约 180ms,可在无网环境执行人物跟踪。


Github:

 https://github.com/OpenBMB/MiniCPM-Robot


Hugging face:

 https://huggingface.co/openbmb/MiniCPM-RobotManip

 https://huggingface.co/openbmb/MiniCPM-RobotTrack


( @面壁智能)




02 有亮点的产品



1、BodyPark ATOM 健身摄像头上市:摄像头识别训练动作并提供实时语音反馈,售价 219 美元起


BodyPark 将此前通过 Kickstarter 众筹的 ATOM 转为现货销售。该设备通过摄像头识别训练动作并提供实时语音反馈,使独立训练者无需佩戴传感器即可获得动作纠正、次数统计和训练报告。


  • 34 点骨骼追踪提供实时动作纠正:摄像头持续识别人体姿态,自动判断训练动作、统计次数,并通过内置扬声器提示姿势问题。

  • 160° 广角覆盖近距离全身动作:采用 1/2.8 英寸 CMOS,面向家庭、健身房等空间受限场景;镜头支持 5°–40° 俯仰调节。

  • 1.43 英寸 AMOLED 显示实时指标:训练过程中可直接查看动作和次数等数据,训练结束后生成分析报告。

  • 155g 机身支持磁吸底座与三脚架:设备内置扬声器和 Bluetooth,配备物理隐私遮盖,可放置于地面、桌面或安装至三脚架。

  • 软件持续更新动作识别与反馈能力:BodyPark 表示后续更新覆盖动作识别、计数、姿态反馈和训练报告;当前未披露识别准确率、反馈延迟及支持的动作总数。


https://www.bodypark.fit/


( @ritwikpavan@X)



2、千问亮相 Qwen Clip 耳夹耳机:Bose 参与调音,支持同声传译与 AI 眼镜联动

图片


千问在 WAIC 2026 展示 Qwen Clip,由千问与 Bose 共同打造,定位为接入千问智能体的开放式耳夹耳机。设备可承担语音输入输出、实时翻译和会议记录,并与千问 AI 眼镜联动,但完整硬件规格和发售计划尚未公布。


  • 开放式耳夹结构保留环境声音:Qwen Clip 不塞入耳道,用户在接收设备音频的同时仍可感知外部声音,面向长时间佩戴场景。

  • Bose 声学团队参与调音:双方合作范围目前仅明确包含音频调校,驱动单元、麦克风阵列及降噪方案尚未披露。

  • 支持实时同声传译与会议纪要:设备可处理实时翻译、会议录音和内容总结,官方未公布支持语言、转写准确率及端到端延迟。

  • 增加健康数据记录能力:Qwen Clip 可采集健康相关数据,但具体指标、传感器配置和测量精度尚未公开。

  • 可与千问 AI 眼镜联动:耳机负责音频交互,眼镜提供视觉入口;眼镜平台还计划支持第三方技能和智能体,但跨设备共享上下文、记忆及任务执行的具体机制尚未说明。


( @Alibaba Cloud Community )



3、Spotify 上线对话式 AI 功能「Talk to Spotify」:支持语音/文字交互,覆盖音乐、播客、有声书全场景


Spotify 推出对话式交互功能,用户可在应用内通过语音或文本搜索内容、控制播放并查询个人收听记录。该功能首先向部分 Premium 用户开放 Beta,可在同一会话中持续修改播放要求,无需退出当前页面。


  • 多轮指令持续调整播放结果:用户可先要求播放未听过的艺人,再追加特定歌手、限定近期作品或调整音乐情绪。

  • 对话直接触发播放操作:支持收藏当前歌曲、加入播放队列及关注艺人,不再需要进入对应的独立操作页面。

  • 「正在播放」页面增加内容问答:可查询歌曲、专辑、艺人和流派信息,并继续获取相关艺人及作品推荐。

  • 问答范围覆盖播客与有声书:用户可查询作者的其他书籍、嘉宾参与过的其他播客,以及当前内容涉及的人物和主题。

  • 个人收听历史成为查询上下文:系统可结合播放列表、收藏艺人、重复播放和历史记录,回答首次收听时间或近期偏好流派等问题。


( @Spotify)



03 有态度的观点



1、Google DeepMind CEO 哈萨比斯:AI 不会让 STEM 和计算机科学学位失去价值

图片


谷歌 DeepMind CEO 德米斯·哈萨比斯在伦敦一场商业会议上表示,AI 正在改变科技行业的职业路径,但 STEM 学位和计算机科学基础不会因此失去价值。哈萨比斯认为,掌握软件工程和计算机科学基础的人,能够更高效地使用 AI 工具。


他提到,编程语言已经历从机器码到 C 语言、再到 Python 的演变,未来可能进一步转向使用英语进行编程。不过,系统架构设计和软件工程最佳实践仍然不可或缺。


真正深入理解技术的人,使用 AI 工具的效率可能达到缺乏技术基础者的 10 倍。他同时表示,AI 时代也需要伦理学、哲学、经济学等人文学科和社会科学,以应对技术发展带来的新问题。


( @APPSO)



04 社区黑板报



招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)



1、活动推荐|AMD AI DevMaster 全球黑客松等你来战


首届 AMD Radeon GPU 全球黑客松来了!2026 AMD AI DevMaster 正式开放报名!本届黑客松由 AMD 主办,聚焦前沿 AI 应用与高性能 AMD Radeon GPU 技术,基于完全开源的 AMD ROCm 软件栈。无论你是独立开发者还是小团队(≤3 人),只要对 GPU 上的 AI 开发有热情,这就是你的舞台!


三大独立赛道,每个赛道单独评奖,总奖金池 30,000 美元


图片


时间:


图片


详情链接:

报名开启 | AMD AI DevMaster 全球黑客松等你来战(文末福利)

图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。


图片

作者提示: 个人观点,仅供参考


注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    关键词
    // 相关帖子
    Coming soon...
    • 0
    BodyPark ATOM 健身摄像头:视觉识别训练动作并提供实时语音反馈丨日报RTRTE_Dev_Comm