谷歌发布 Gemini 3.5 Flash-Lite:350 tokens/s 极速响应丨日报
开发者朋友们大家好:
这里是「RTE 开发者日报」,每天和大家一起看新闻、聊八卦。我们的社区编辑团队会整理分享 RTE(Real-Time Engagement) 领域内「有话题的技术」、「有亮点的产品」、「有思考的文章」、「有态度的观点」、「有看点的活动」,但内容仅代表编辑的个人观点,欢迎大家留言、跟帖、讨论。
本期编辑:@koki、@鲍勃
01 有话题的技术
1、NVIDIA 发布端侧世界模型 Cosmos 3 Edge :4B 参数混合 Transformer 架构,支持端侧五模态实时推理
NVIDIA 推出面向边缘计算的 4B 参数世界基座模型 Cosmos 3 Edge。该模型采用混合 Transformer 架构,旨在不牺牲模型能力的前提下,在边缘端设备上实现高吞吐、低内存占用的端侧物理推理与机器人控制。
五模态理解与生成能力:作为多模态世界模型, Cosmos 3 Edge 能够跨模态理解并生成文本、图像、视频、环境声音(ambient sound)以及动作(action)数据。
4B 参数混合 Transformer 架构:在 4B 参数规模下支持文本、图像、视频、环境声音以及动作五个模态的协同理解与生成,实现端侧物理世界推理。
边缘端硬件高兼容与优化:针对 NVIDIA Jetson、GeForce RTX、NVIDIA RTX PRO 及 DGX 系统进行了高吞吐与显存优化,实现低延迟端侧视觉分析与动作输出。
VANTAGE-Bench 同参数级性能夺冠:在评估视觉分析能力的 VANTAGE-Bench 评测中,位列同参数级别模型首位,支持通过后训练实现先进的机器人学习。
HuggingFace:https://huggingface.co/collections/nvidia/cosmos3
( @blogs.nvidia)
2、Twelve Labs 发布视频 AI 智能体 Jockey:支持多视频库跨文件检索,由 Pegasus 与 Marengo 模型栈驱动
TwelveLabs 推出视频理解 AI 智能体 Jockey,目前处于研究预览阶段。该智能体通过将 TwelveLabs 的视听理解能力与 Claude 的逻辑推理能力相结合,可直接对大量视频资产的视听元素进行深度分析,自动化定位视频剪辑中的结构缺陷、视觉节奏偏差及内容覆盖缺口。
整库级多文件协同处理:突破单文件处理瓶颈,支持在包含数千个视频与图片的整个媒体库中进行跨文件检索,并执行「提取本月最佳瞬间并生成 Short 短视频」等跨素材的复合任务。
自研双模型栈架构:底层由 Twelve Labs 核心模型驱动,采用 Pegasus 模型进行视频特征与语义提取,结合 Marengo 模型进行多模态视频检索。
Search 2.0 多步检索技术:引入 Search 2.0 算法,实现复杂查询下的多步检索,支持对诸如「不同社媒广告的最佳留存黄金三秒(hook)有何共同点」等深度关联性问题进行归纳分析。
API 与第三方 LLM 平台无缝集成:提供原生 API 供开发者进行定制化构建,并已率先支持在 Claude 中直接调用,ChatGPT 的接入支持也已进入开发路线图。
预览链接:
http://twelvelabs.io/jockey
( @twelve_labs@X)
3、谷歌发布 Gemini 3.5 Flash-Lite:350 tokens/s 极速响应,内置计算机使用工具赋能智能体交互
谷歌正式推出 Gemini 3.5 Flash-Lite 模型,主打极低延迟与高吞吐量交互,在 Artificial Analysis 评测中输出速度达到 350 tokens/s。该模型专为大规模智能体工作流设计,通过内置的计算机使用工具实现高频交互,在大幅降低高并发调用成本的同时,多项编码及智能体基准测试成绩超越前代模型及标准版 Gemini 3 Flash。
输出速度达 350 tokens/s,主打高频交互与低延迟:模型定价为每百万输入 tokens 0.3 美元,每百万输出 tokens 2.5 美元。在保持高性价比的同时,其处理大规模、高频交互任务时的延迟低于 Gemini 3.5 Flash,适用于智能搜索和文档处理等高吞吐量生产场景。
原生内置计算机使用能力,提升交互效率:该模型将计算机操作能力作为内置工具,允许智能体直接在各类系统界面中执行点击、输入等操作,保障了智能体在跨平台交互任务中的执行可靠性。
引入可配置的思维等级:开发者可根据交互任务的复杂程度灵活调节模型的推理深度。针对高频、简单的交互任务,可配置为低思维等级以实现低成本、极速响应;针对复杂的多步骤子智能体任务,则可启用高思维等级进行深度推理。
基准测试全面超越前代及 3 Flash:在 Terminal-Bench 2.1(编码与智能体交互)中得分由前代的 31% 提升至 54%;长文本处理(GDM-MRCR v2)由 60.1% 提升至 72.2%;在涉及真实系统交互的 OSWorld-Verified 基准测试中,以 74.0% 对 65.1% 的成绩超越了定位更高的 Gemini 3 Flash。
( @blog.google)
4、京东发布 JoyAI 实时语音交互与视频编辑模型
京东在 WAIC 2026 发布 JoyAI-Talker 实时语音交互模型和 JoyAI-Video-Edit 实时视频编辑模型,补充其面向物理世界的多模态模型矩阵。
JoyAI-Talker 是一款实时语音交互模型。与传统语音助手等待用户说完一句话再回答不同,它更强调低延迟、可打断和连续交流,同时加入情绪理解与共情能力。对于进入家庭和服务场景的机器人来说,能否在嘈杂环境中听清人在和谁说话、判断一句话是在下达指令还是表达情绪,本身就是感知现实的一部分。
JoyAI-Video-Edit 是一款流式实时视频编辑模型。它表面上属于视频生成与编辑能力,但对物理 AI 而言,视频不只是内容,也可以成为理解动态环境、生成训练数据和模拟现实变化的工具。京东探索研究院将这项能力用于具身智能的实时视频交互,以及具身智能训练中的数据合成。
可以看出,JoyAI 模型矩阵扩展的方向,并不是简单叠加模态的类型,而是在逐步补齐 AI 进入物理世界所需要的能力——从看见环境、听懂语言,到进行实时交流;从理解空间和任务,到模拟变化、规划并输出动作。
(@虎嗅 APP、@APPSO)
02 有亮点的产品
1、3D 生成技术公司 Meshy 完成近 4 亿美元 B 轮融资:推出对话式 3D 智能体与图形学+AI 视频「混合世界模型」架构,宣布下一步进军实时互动的多模态内容体验
Meshy 宣布完成近 4 亿美元 B 轮融资,投后估值超 100 亿元人民币。公司在跑通 3D 资产生成商业化(ARR 突破 4000 万美元)的基础上,正式进军「实时互动的多模态内容体验」领域,推出基于图形学与 AI 视频混合渲染的技术路线。
首创对话式 3D 智能体:引入多轮对话生成流程,用户上传单张图像后,可通过自然语言交互进行材质选择、多色打印适配及局部参数微调,改变了传统 3D 生成「单次抽卡」的不可控模式,并支持多轮对话提示词的积分消耗结算。
自研图形学与 AI 视频「混合世界模型」:针对实时互动多模态内容,放弃纯视频扩散的端到端生成路线,采用「混合世界模型」(Hybrid World Model)架构。该架构由 AI 机制引擎负责世界逻辑运行,画面表现则采用物理仿真编程语言 Taichi 与 AI 视频混合的渲染系统,大幅降低算力门槛,使可交互世界运行在端侧 GPU 成为可能。
实时机制合成大模型:在首款 AI 游戏 Demo《黑箱:无限构筑》中部署自研「AI 游戏机制生成大模型」。该模型在逻辑层运行,支持玩家自由组合多模态道具,由大模型在 10 秒内实时合成、重构并执行全新的武器与技能机制,实现非预设的可交互世界。
对话式 3D 创作智能体(3D Agent):推出行业首个基于对话的 3D 生成智能体。改变了传统的「提示词到 3D(Prompt-to-3D)」单次抽卡模式,允许用户上传参考图片后,通过多轮自然语言对话进行材质选择、局部调整及参数优化。
(@极客公园)
2、三星联合 Google 发布 Galaxy AI 眼镜:支持原生手势识别,打通 Notes 会议记录与 SmartThings 边缘生态
三星(Samsung)联合 Google、Gentle Monster 及 Warby Parker 推出全新 AI 智能眼镜,由歌尔股份(Goertek)代工。该设备搭载 Google Gemini 助手,支持原生手势识别,并实现与三星 Notes 办公生态、SmartThings 智能家居及现代/起亚车载系统的深度跨端互联,定位为「核心边缘设备」以直接对标 Ray-Ban Meta。
多模态交互与手势识别:设备除了支持语音控制、多语言翻译及音频播放外,新增了原生手势识别支持;配备摄像头,可调用 Gemini Nano 等本地 AI 模型实现实时画面交互、背景消除及图像变换。
系统级应用深度打通:通过 AI 眼镜记录的会议纪要和语音便签可直接无缝同步至三星手机的 Notes 应用,并支持通过语音跨端控制 Uber、DoorDash、Mondly 等第三方应用程序。
SmartThings 边缘节点定位:设备并非单纯的可穿戴配件,而是作为三星物联网(IoT)生态的边缘计算节点,接入全球超 4 亿台(预计今年底达 8 亿台)SmartThings 智能设备,并支持现代与起亚汽车的「车家互联」(Car-to-Home)服务。
依托传统眼镜品牌渠道:产品通过与 Gentle Monster 和 Warby Parker 联名,直接利用其线下零售门店(如 Gentle Monster 计划年底前将海外门店增至 60 家以上)进行渠道渗透,解决传统智能硬件的推广瓶颈。
( @XR Vision)
3、CapWords 发布 Speak 功能:基于实时图像识别的个性化口语练习,取代预设场景对话
CapWords 在其语言学习 App 中上线 Speak 功能,将传统的预设场景口语练习替换为:用户拍摄当前环境物体 → AI 识别 → 基于该物体生成个性化对话模拟。核心差异在于训练数据从通用语料库转向用户日常生活的实时输入。
( @DTD_STUDIOS@X)
03 有态度的观点
1、黄震昕:SOTA 模型应该有自己的定价权
月之暗面企业业务负责人黄震昕在接受 21 世纪经济报道采访时表示,前沿模型的价值不应只用低价衡量。
这番回应针对 Kimi K3 发布后围绕定价、算力紧张和开源路线的行业争议。他表示,Kimi 会继续开源,但开源与闭源服务面向不同需求:需要私有化部署和微调的客户会选择开源模型,希望直接购买托管服务的客户则可能选择闭源服务,开源本身并不决定 Token 的质量和价格。
黄震昕称,月之暗面把模型能力集中在编程、金融、法律和科学等专业任务,而没有同时扩张到娱乐、图片和视频生成。对于大模型无法彻底消除的幻觉问题,K3 会在 Agent Swarm 中加入事实核查子智能体,让另一个智能体复核输出,而不是把不确定信息直接交给用户。
在商业化方面,他透露 Kimi 的企业收入中 API 调用占比最高,公司目前不做私有化部署。近期暂停新用户注册,是因为需求超过资源承载能力,团队优先保障付费用户体验,再通过模型效能优化和补充算力恢复服务。
( @APPSO)
04 社区黑板报
招聘、项目分享、求助……任何你想和社区分享的信息,请联系我们投稿。(加微信 creators2022,备注「社区黑板报」)
1、会议推荐:会议预告|第四届城市科学大会
第四届城市科学大会旨在以城市科学为锚点,推动城市科学与人工智能、公共健康、社会治理、气候变化、认知科学、复杂系统等方向的交叉融合创新,搭建跨学科交流与合作的平台。大会将于 8 月 8 日至 9 日在香港科技大学(广州)举办。
邀请国内外高校与科研机构的专家学者作特邀报告,共同探讨应对城市复杂性挑战的前沿理念、创新技术与实践方案。
此外,大会还将举办 Urban Cup 2026 挑战赛,设置「城市具身智能与世界模型」、「城市科学 Vibe Research」、「城市社会模拟 AgentSociety」三大赛道,旨在探索 AI 时代城市科学研究的新范式、新方法与新应用。
入围决赛队伍将有机会在大会现场进行成果展示,并获得与国际著名城市科学学者当面交流探讨的宝贵机会。本届赛事受到清华大学-美团数智生活联合研究中心等合作方联合资助, 总奖金达 15 万元,并将为各赛道提供计算平台与必要的技术支持,诚邀智慧城市、城市科学、人工智能及计算社会科学等相关交叉领域的研究者、开发者与实践者积极参与。
详情链接:
https://fi.ee.tsinghua.edu.cn/RSUSHD2026/

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
写在最后:
我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。
对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
作者提示: 个人观点,仅供参考