前 OPPO 团队众筹旅行 AI 眼镜,集成影像、语音导览、翻译与离线对讲丨日报

本期编辑:@三水、@鲍勃


01 有话题的技术


1、蚂蚁开源百灵首个原生多模态模型 Ling-3.0-flash-VL:引入视觉反馈闭环,Agent 可边执行边观察并持续修正

蚂蚁开源百灵系列首个原生多模态模型 Ling-3.0-flash-VL。模型基于 Ling-3.0-flash 的 MoE 架构扩展,支持文本、图像和视频输入;相比一次性的视觉理解,重点是把视觉反馈加入 Agent 执行链路,让模型按照「观察 → 行动 → 验证 → 修正」 持续完成前端开发、GUI 操作和长视频处理等任务。


  • 视觉从输入能力进入 Agent 执行闭环: 模型执行操作后可以重新查看结果、判断与目标的偏差,再继续修改。例如图片转网页时,会先生成代码并渲染页面,再根据渲染结果继续调整代码,而不是停在第一版生成。

  • GUI Agent 可以「边操作边校准」: 面对网页查数、整理 Excel、生成图表等跨工具任务,模型根据当前界面持续完成点击、输入、滚动和应用切换,并在每次操作后重新观察页面状态、调整后续步骤。

  • 124B 总参数,单次仅激活 5.5B: 模型采用稀疏 MoE 架构,并加入任意分辨率视觉编码器与 VideoRoPE;42 层语言主干交替使用 KDA 与 Gated MLA,在多轮视觉 Agent 工作流中降低单步推理开销。

  • 加入视觉后,文本综合评测反而提升: 在 Artificial Analysis Intelligence Index v4.1.1 中,Ling-3.0-flash-VL 得分 42,较纯文本版 Ling-3.0-flash 的 38 分提升 4 分。官方还称其以 linthium 代号参加 Image-to-WebDev Arena 时,图片转网页得分高于 GPT-5.4。

  • BF16 与 FP8 权重已开源: Hugging Face 当前模型卡标注最长支持 1M Token 上下文,而官方部署示例仍以 256K 为推荐配置;模型可通过 SGLang 和 vLLM 部署。


https://huggingface.co/inclusionAI/Ling-3.0-flash-VL-fp8



2、蚂蚁灵波开源实时交互世界模型 LingBot-World 2.0 轻量版:1.3B 世界模型可在消费级单卡 GPU 实时运行

蚂蚁灵波进一步开放实时交互世界模型 LingBot-World 2.0 的完整模型体系,新增 1.3B 轻量实时版、14B 双向模型和 14B 因果预训练模型。其中 1.3B Small 将原本偏多卡部署的实时世界生成能力压缩到消费级单张 GPU,降低开发者本地运行和实验世界模型的硬件门槛。


  • 1.3B 世界模型开始进入消费级单卡: LingBot-World 2.0 Small 是主模型的轻量实时版本,官方称可在单张消费级 GPU 上运行实时世界生成,不再要求数据中心级多卡环境。

  • 核心仍是持续运行的交互式世界: LingBot-World 2.0 支持长时间连续生成,并可根据玩家动作和文字指令持续改变后续世界,包括攻击、射箭、施法、射击等动作以及动态环境事件;完整配置最高可输出 720p / 60 FPS。

  • 同时开放两个面向研究和二次训练的 14B 版本: 双向模型主要作为高质量教师模型,可用于蒸馏更小、更快或面向特定领域的模型;因果预训练版则提供后训练、评测和进一步适配的基础权重。

  • LingBot-World 2.0 的模型链路至此基本补齐: GitHub 此前仍将 1.3B 实时版、14B 双向版和因果预训练版列为待发布,9 月 10 日已全部标记完成并开放下载。


https://github.com/Robbyant/lingbot-world-v2



3、Meta FAIR 提出 3B 参数语音生成模型 Text-AB:免强制对齐统一跨语言配音与全双工对话合成

图片


Meta FAIR 提出 Text-Audiobox(Text-AB),一个 3B 参数的语音生成模型,在同一套框架中统一跨语言配音、全双工对话合成和情绪化全双工对话合成。相比此前 Audiobox,Text-AB 不再依赖文本与语音的强制对齐和显式时长预测,而是直接从原始文本学习何时说、说多久以及两名说话人的互动节奏。


  • 配音不再需要提前做好文本—语音强制对齐: Text-AB 直接输入原始文本,通过交叉注意力自动学习文字与语音之间的对应关系,省去独立的强制对齐和时长预测模块,减少配音流程中的前置处理。

  • 同一模型可以合成两个人「同时在说话」的对话: 全双工版本能够生成轮次切换、重叠说话、附和以及情绪互动,而不是把两名说话人的 TTS 结果分别生成后再拼接。

  • 从 EnCodec 切换到更高压缩的潜空间表示: 模型使用 DAC-VAE 将 48 kHz 音频压缩为 25 Hz 潜序列,相比此前 Audiobox 使用的 EnCodec 表示压缩超过 10 倍,同时提升音频重建质量,从而让长语音生成更容易扩展。

  • 30 亿参数模型预训练使用 48 万小时语音: Text-AB 在大规模单语语音上预训练,再分别针对跨语言配音、全双工对话和情绪对话进行监督微调;在真实配音评测中,Meta 报告其在韵律、音色相似度、自然度等指标上明显超过上一代内部系统。

  • 单次可生成约 1 分钟,长对话则通过多扩散持续生成: Text-AB 支持一次生成最长约 1 分钟语音,并利用 Multi-Diffusion 扩展到任意长度的连续音频,更适合长配音和多人对话场景。


https://ai.meta.com/research/publications/alignment-free-text-audiobox-for-voice-dubbing-and-full-duplex-dialogue-synthesis/



4、美团首次披露「智播」数字人直播全链路:流式生成语音手势,视觉 Token 压缩 75% 面向万路并发

图片


图片


美团技术团队系统披露数字人直播产品 「美团智播」 背后的工程方案,覆盖数字人形象生成、动作生成、语音与手势实时协调、视觉大模型推理优化以及多智能体内容生产。相比单独优化数字人画质,其重点是把「边说边动、实时互动」做到可持续运行,并进一步压低大规模直播的推理成本。


  • 语音驱动手势从整段生成改为流式生成: 美团提出 StreamingTalk,将原本需要等待完整语音后一次生成动作的流程改为按块持续生成。每段语音到达后即可继续产生对应手势,推理延迟和内存开销不随直播时长增长,支持数字人持续「边说边动」。

  • 手势不只跟节奏,还能跟语义变化: 系统同时利用语音特征和动作标签控制当前动作,例如介绍商品、强调优惠或回答问题时可动态切换不同手势,使动作从简单点头、摆手进一步走向与讲解内容对应的协调动作。

  • 视觉 Token 压缩 75%,推理速度提升 2.5 倍: Glance2Gaze 将视觉 Token 从 576 个逐步压缩到 144 个,在官方测试中性能损失控制在 2% 以内,推理速度提升 2.5 倍、并发成本降低 60% 以上,主要解决数万商家同时开播时的大模型推理开销。

  • 实时交互采用全双工流式管线: 当观众发起提问时,系统并行调度语义理解、回答生成、数字人驱动等模块,上游产生部分结果后即可触发下游计算,而不是等待整条链路逐级完成,以缩短直播互动响应时间。

  • 计划性直播内容则由多个智能体协同生产: 美团将商品讲解拆成创意、检索、思考、生成、评测五个阶段,自动生成话术、动作和视频内容;单条商品讲解视频的制作从人工数小时缩短至分钟级。


https://tech.meituan.com/2026/09/03/meituan-Digital-Human-practice.html



5、南洋理工 S-Lab 等提出 3D 世界模型 Puffin-World:同时生成画面、深度与物理状态,可直接重建三维场景

图片



南洋理工大学 S-Lab、密歇根大学、北京交通大学和 ACE Robotics 等团队提出统一多模态世界模型 Puffin-World。与主要预测后续 RGB 画面的视频世界模型不同,它在同一框架中显式建模物理、几何和外观三种世界状态,让模型不仅生成「接下来看到什么」,还同时预测场景深度、重力方向和相机在真实世界中的姿态,并可直接重建 3D 场景。


  • 世界状态不再只有像素: Puffin-World 将世界拆成三层表示——物理状态包含重力场和纬度信息,几何状态用稠密深度描述空间结构,外观状态负责 RGB 图像;三者由同一模型联合建模,而不是生成视频后再调用独立深度估计或 3D 重建模型。

  • 生成新视角时同时生成 RGB 和深度: 给定一张初始图像和相机轨迹,模型可以沿指定路径持续生成后续视角,并同步预测每一帧的几何结构,最终直接整合成带颜色的 3D 点云。

  • 相机控制从简单平移扩展到真实 3D 姿态: 团队设计 Omni-Camera 表示,将相机内参、位置、朝向以及重力方向统一编码,可控制俯仰、翻滚、旋转和复合运动,并在长轨迹和大角度旋转中持续传播物理约束。

  • 同一模型覆盖理解、模拟、生成和重建: Puffin-World 可以从单张图像估计相机姿态和空间关系,也能进行自由视角模拟、文生 3D、图生 3D 和闭环世界探索,无需为不同任务额外挂接专用几何模块。

  • 同步开放 Puffin-16M 数据集: 数据包含 1500 万组视觉—语言—相机样本和 100 万条相机运动轨迹,并为 28 个公开数据集约 4450 万张图像补充相机标注;代码、模型和数据均已公开。


https://kangliao929.github.io/projects/puffin-world/


02 有亮点的产品


1、智能眼镜影目科技完成 C3 轮融资:C 轮累计近 10 亿元,已启动上市筹备

图片


智能眼镜影目科技(INMO) 完成 C3 轮融资,由四川振兴科创基金领投,静安资本、市北高新、广州产投等跟投。继今年完成 C1、C2 轮后,公司 C 轮累计融资近 10 亿元,并已正式启动上市筹备;新资金将继续投入新一代空间智能硬件和自研 INMO AIOS


  • 继续押注一体式智能眼镜: 影目长期将显示、计算和 AI 感知能力集成到眼镜本体,减少对手机和外接计算单元的依赖,产品方向从「手机配件」进一步向独立智能终端推进。

  • INMO AIOS 同时覆盖空间计算与 Agent: 系统端侧运行单目 VIO、6DoF 定位、空间锚点和渲染等低延迟能力,较重的空间重建放到云端;AI 层则负责多模态情境理解、Agent 任务编排和工具调用。

  • GO 与 AIR 共用同一套系统底座: AIR 系列侧重空间计算,GO 系列侧重语音交互和 Agent,不同硬件共享底层能力,再根据产品形态进行功能裁剪。

  • 下一步还将开放开发者生态: 影目计划提供可视化编排工具和 SDK,让开发者围绕移动商务、导航、线下游戏等场景开发应用,并在不同眼镜产品上复用。


(@硬氪)



2、前 OPPO、一加团队创办的 APOM 推旅行 AI 眼镜 L'Atitude 52°N:用影像、AI 导览和实时翻译覆盖旅行全程,众筹近 40 万美元

图片


前 OPPO、一加团队创办的 APOM,将首款 L'Atitude 52°N 定义为旅行 AI 眼镜,而非通用型智能眼镜。产品售价 399 美元起,围绕旅行中的第一视角记录、AI 导览和实时翻译做功能取舍;Kickstarter 已获得 735 名支持者,累计众筹约 34.6 万欧元,折合约 40 万美元。


  • 把 AI 眼镜收缩到旅行场景: 产品主动砍掉会议转写、语音记事等常见功能,核心只保留拍摄、导览和翻译,希望形成「看到 → 记录 → 理解 → 交流」的旅行闭环。

  • AI 导览直接理解用户眼前内容: 内置 Goya AI,可通过摄像头识别地标、艺术品和博物馆展品,再结合文化内容提供讲解;官网显示该能力由 Google Gemini 提供支持。

  • 12MP 第一视角相机强化旅行拍摄: 眼镜配备 1200 万像素、107° 视场角摄像头,并针对建筑、街景和户外场景强化计算摄影,而不只是把摄像头当作多模态模型的「眼睛」。

  • 实时翻译覆盖旅行高频语言: 当前支持英语、德语、西班牙语、法语和意大利语,可直接用于点餐、问路和入住等面对面交流场景。

  • 还把离线对讲做到眼镜挂绳里: 配套 Intercom Strap 可让同行者在弱网或无网环境下保持联系,进一步围绕户外和旅行场景补齐通信能力。


https://www.kickstarter.com/projects/latitude52n/latitude-52n-smart-ai-glasses-for-travel-and-adventure/


(@硬氪)



3、前 Sora 核心研究员联手 DreamWorks 联合创始人创业:将自研 AI 视频模型,直接瞄准电影制作人

图片


据 The Information 报道,前 OpenAI 视频研究员、Sora 核心成员 Bill Peebles 正与 DreamWorks 联合创始人 Jeffrey Katzenberg、Dropbox 前 CFO Sujay Jaswa 共同筹备一家新的 AI 视频公司。新公司尚未公布名称,计划自行训练视频生成模型,并直接面向电影制作人和影视制作场景


  • 不是再做一个视频工具,而是计划自己训练模型: 新公司目标是开发自有视频生成模型,并试图打入电影制作流程,与目前更多面向广告、创作者或企业市场的视频 AI 公司形成差异。

  • Jeffrey Katzenberg 带来好莱坞制作与产业资源: Katzenberg 曾任迪士尼影业负责人,并与 Steven Spielberg、David Geffen 共同创办 DreamWorks;他目前与 Sujay Jaswa 共同运营投资及孵化机构 Wndr。

  • 融资仍在洽谈,并未完成: 据知情人士透露,创始团队已与包括 Andreessen Horowitz 在内的潜在投资者接触,希望为新公司筹集大额资金,目前尚无正式融资结果。

  • Bill Peebles 离开 OpenAI 后继续押注视频生成: Peebles 曾参与推动 Sora 的核心研发,并于今年 4 月离开 OpenAI。OpenAI 的 Sora 网页及 App 已于 2026 年 4 月 26 日停止服务,API 也计划于 9 月 24 日关闭。


(@The Information)



4、印度语音 AI 公司 Sarvam 升级实时 STT API:用户没说完即可返回转写,通话中可动态切换语言和模式

图片


Sarvam 更新 Realtime Speech-to-Text API,新接口基于 saaras:v3-realtime / saaras:v4-realtime,与旧版流式 WebSocket 最大的区别是开始在用户说话过程中持续返回部分转写结果(partial transcript),而不是等一个完整话轮结束后才给出文本,更适合 Voice Agent 打断判断和实时字幕。


  • 从「说完一句再转写」变成「边说边出字」: 新接口持续发送 transcript.partial,Voice Agent 可以在用户尚未说完时就开始理解意图;开发者还可在低延迟与准确率之间选择 fastbalanced 等流式模式。

  • 连接不中断即可动态改配置: 通过 config.update,可以在同一 WebSocket 会话中切换语言、转写/翻译模式、提示词和端点检测方式,不再需要修改参数后重新连接。

  • VAD 参数从 10 多项压缩到 3 项: 新接口直接用毫秒配置静音时长和最短语音时长,并提供阈值控制,相比旧版基于帧数的参数更容易调试 Voice Agent 的话轮边界。

  • Saaras v4 支持最多 50 个关键术语: REST 和 Batch API 可通过 keyterms 提供品牌名、人名、地名和专业术语,引导模型提高这些词的识别概率,例如客服产品名或医疗药品名称;该能力目前仅支持 saaras:v4


https://docs.sarvam.ai/api/api-guides-tutorials/speech-to-text/realtime-streaming



5、OpenAI 升级 ChatGPT Voice:语音中可调用 GPT-5.6 / GPT-6 Astra 推理,模型与推理强度控件和文字聊天打通

图片


OpenAI 更新 ChatGPT Voice:实时语音对话仍由 GPT-Live-1 / GPT-Live-1 mini 驱动,但遇到网页搜索或更复杂的推理任务时,Voice 现在可以进一步调用 GPT-5.6 或 GPT-6 Astra。用户选择模型和推理强度时,也开始沿用文字聊天中的同一套控件。


  • 实时对话与复杂推理开始分工: GPT-Live 继续负责低延迟听说、打断和自然轮次;当问题需要搜索或更强推理时,再交给 GPT-5.6 / GPT-6 Astra 处理,而不是让同一个实时语音模型承担全部任务。

  • Voice 不再单独维护一套「智能等级」: 此前 Voice 的 Instant / Medium / High 智能级别被取消,模型和推理强度改为与文字聊天共用选择方式,可用模型仍取决于用户套餐。

  • GPT-Live 每日使用上限同步调整: Plus 提升至 3 小时 GPT-Live-1;100 美元 Pro 为 15 小时;200 美元 Pro 为不限量。Go 则提供最多 3 小时 GPT-Live-1 mini。

  • Plus / Pro 达到语音上限后不再自动降级到 mini: 此前达到 GPT-Live 使用限制后还可能切到较小模型继续使用,这次更新后 Plus 和 Pro 不再采用这一降级机制。


https://help.openai.com/en/articles/6825453-chatgpt-release-notes


(@OpenAI)



03 有态度的观点


1、字节 AI 产品 「猫箱」前负责人梁琛奇:AI 娱乐真正的新平台,必须让用户「消费时也烧 Token」


图片


梁琛奇提出了一个很反直觉的判断:如果 AI 只是让原有内容生产得更便宜,它大概率不会诞生一个新的消费平台。 因为内容形态没变,用户最终还是会回到已经拥有分发、推荐和用户关系的旧平台里——AI 做出来的短剧,最后仍然可能在红果、抖音里被消费。


真正的 AI Native 娱乐体验,应该让 AI 不只参与生产,也参与每一次消费。用户每次点击、输入、互动,系统都要实时生成新的内容或反馈,也就是消费过程本身持续「烧 Token」。只有这样,产品提供的才不是更便宜的旧内容,而是一种过去不存在、旧平台也无法直接承载的互动体验。


这也解释了为什么他更看好「边玩边生成」的内容,而不是单纯把短剧、漫画或视频换成 AI 制作:AI 娱乐的机会不在生产工具升级,而在消费方式本身被重新发明。


(@晚点 LatePost)



04 社区黑板报

招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)


1、 iRTE2026 定档啦!Voice Agent Builder 们,10 月北京集合~


今年从对话式 AI 一路聊到实时智能,现场有 15+ 论坛、100+ 场深度演讲,汇聚 150+ 全球技术领袖和行业专家,全双工+交互式模型、实时互动世界模型、AI 硬件、AI Coding 工具等方向都会集中开聊。


贾扬清也将返场 iRTE 大会,带来对 AI 行业前沿趋势和技术演进的最新观察~


目前大会门票限时免费开放!


想来现场听技术、认识同行的开发者,可以先把票薅上


时间:10 月 23–24 日


地点:北京悠唐皇冠假日酒店


限免结束后将恢复收费,建议先报名占位


定档!从对话式 AI 到实时智能,Voice Agent Builder 的年度春晚 iRTE2026 来了丨 10 月 23-24 日,北京见!


图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

图片

作者提示: 个人观点,仅供参考

注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    // 相关帖子
    Coming soon...
    • 0
    前 OPPO 团队众筹旅行 AI 眼镜,集成影像、语音导览、翻译与离线对讲丨日报RTRTE_Dev_Comm