可靠、安静、自动运行:8 个 Jev 实时 AI 实验丨Voice Agent 学习笔记
理想的自动化,应该在后台运行,甚至让你根本不需要看它。
——TypeSafe 创始人 Diego Almeida
用户刚说出「go back」,浏览器就已经返回了上一页,甚至没等他把话说完。
这是开发者 Moritz Kremb 最近制作的一个语音控制浏览器实验。他将实时语音转写与 TypeSafe 发布的 Jev 模型结合,让浏览器根据不断更新的语音内容,判断用户想执行什么操作。
对于「go back」这样意图明确的指令,浏览器可以提前行动。
这个看起来简单的实验,恰好对应了 TypeSafe 创始人 Diego Almeida 最近在一场演讲中提出的一个问题:
「如果围绕可靠性和自动化重新设计整个 AI 技术栈,会发生什么?」
Jev 就是 TypeSafe 对这个方向的一次尝试。TypeSafe 将 Jev 称为一种 System One Model。
这个安静的模型不会生成一段完整的自然语言回复,而是根据不断变化的状态,快速作出判断。
最近,一批开发者开始把 Jev 放进各种实时系统:有人用它判断语音对话什么时候该接话、用户究竟是不是在和 AI 说话,有人让商品推荐随着对话实时变化,还有人让它参与浏览器操作、3D 场景搭建、游戏 NPC 的决策。
这篇学习笔记收集了其中 8 个实验,看看开发者正在把这种快速判断能力放进哪些场景。
从实时对话到主动客服:AI 开始在用户说完之前行动
1. 让 Jev 判断用户是否真的说完了
VAD 可以检测用户有没有发出声音,但用户短暂停顿,并不意味着他已经结束表达。
开发者 @uezochan 尝试用 Jev 做语义层的 Turn Detection:检测到停顿后等待约 0.5 秒,再判断当前话轮是否真的结束,并决定要不要继续等。
开发者展示的单次 Jev 处理时间约为 200ms。这里最核心的问题不是 AI 要回答什么,而是:现在该接话,还是继续等用户说?
https://x.com/uezochan/status/2100608556823388486
2. Toothless:不用唤醒词,AI 也知道你是不是在和它说话
即使用户已经说完,一个常驻语音助手还要先判断:这句话真的是在跟我说吗?
开发者 Ashutosh Purohit 用 Jev 做了 Toothless。它会结合当前发言和对话上下文,判断用户是在继续和 AI 交流,还是在和身边的人说话,再决定 AI 是否介入。
这让语音助手有机会摆脱唤醒词,也不必默认所有声音都在对自己说。对 AI 眼镜、桌面陪伴设备这类常驻式产品来说,这是一个很基础、也很现实的交互问题。
https://x.com/ashutoshpuro97/status/2101660362882085299
3. 一边语音接待客户,一边实时推荐商品
开发者 @rinte0321 将 GPT-Live-1 和 Jev 组合在一起,做了一个实时电商客服 Demo。
GPT-Live-1 负责持续语音对话,Jev 则根据不断更新的内容,让商品推荐和角色表情同步变化。用户还没说完,界面已经可以开始响应。
这个 Demo 有意思的地方在于:语音对话和界面反馈不必再严格排队发生。 Rinte 后来还用类似方式,让演示文稿随着讲述内容自动翻页。
https://x.com/rinte0321/status/2100736454850908344
https://x.com/rinte0321/status/2100749640866165092
4. 用户还没有点击,AI 已经开始猜他想做什么
实时判断也不一定来自语音。开发者 @tsuyoshi_osiire 尝试根据鼠标移动、停留和往返,判断用户是否正在犹豫,或者对某个商品产生兴趣。
比如,用户在两个商品之间反复移动鼠标,系统可能据此推测他正在比较,而不必等到用户真的点击咨询按钮。
这有点像把线下接客里的「察言观色」搬进网页。真正难的问题也随之出现:什么时候主动帮助是贴心,什么时候只是打扰?
https://x.com/tsuyoshi_osiire/status/2100714613381960186
5. 话还没说完,浏览器已经开始行动
开发者 Moritz Kremb 把持续更新的语音转写和网页状态一起交给 Jev,判断用户的意图以及当前指令是否已经足够明确。
开发者展示的数据里,Jev 单次判断约需 300ms,每次判断成本约为 0.0002 美元。像「go back」这样足够明确的操作可以提前执行,信息还不完整时则继续等待。
所以这个 Demo 真正的问题并不是怎么让 Agent 更快,而是:什么时候已经知道得够多,可以开始行动?
https://github.com/moritzkremb/jev-voice-browser
从页面操作到 3D 场景:让判断直接参与软件运行
6. 把浏览器 Agent 的下一步操作交给 Jev
Browser Use 的 Jev Ultrafast 解决的是另一个浏览器问题:当任务已经明确,Agent 后面的一连串网页操作能不能更快?
它先把网页转换成一组可执行的候选动作,再让 Jev 选择下一步操作和目标元素;只有真正需要输入新文字时,才调用小型语言模型。
Google Flights Demo 中,从任务开始后的页面操作、加载和结果检查约耗时 7.1 秒。这个案例的重点不是单次速度,而是把原本塞在一个 Agent 里的操作选择、文本生成和网页执行继续拆开。
https://github.com/browser-use/jev-ultrafast
7. 一秒搭建一个 3D 室内场景
歸藏用 Jev 做了一个实时 3D 场景生成器:提前准备大量 3D 素材,再根据用户描述,通过数百次并行判断选择素材、位置、光照和状态。
开发者展示的 Demo 可以在约一秒的量级完成一次室内场景搭建。这个数字更适合理解为 Demo 展示口径,而不是严格的端到端 benchmark。
这里的 Jev 不负责生成 3D 模型,而是把复杂场景拆成大量可以同时处理的小判断。大量判断可以并行发生,是这个案例最特别的地方。
https://x.com/op7418/status/2101536330018918793
8. HEIST//ONE:让游戏守卫根据环境自己做判断
HEIST//ONE 是一个潜行游戏实验。六名守卫会根据门突然打开、灯熄灭、异常脚步声等环境变化,判断威胁程度和下一步行动。
Jev 负责这种带有不确定性的战术判断,游戏物理、路径规划和动作是否合法仍然由传统程序处理。一次完整运行中,Jev 完成了 288 个结构化判断,中位响应延迟约 260ms。
相比速度,更有意思的是 NPC 的行为不必完全依赖开发者提前写好的规则:角色可以根据当前环境状态动态判断下一步。
https://github.com/AbdelStark/heist-one
当软件不用等你说完
把这些实验放在一起,Jev 最值得关注的并不是一次判断能快到多少,而是开发者开始把模型放进软件持续运行的过程中。
Jev 并没有发明「让模型做判断」。BERT、专用分类器、小型语言模型和规则系统早就能完成其中一部分任务。更值得观察的是,当这类判断变得更通用、更便宜、更容易调用,它们开始被放进更多实时运行的软件流程里。
TypeSafe 创始人 Diego Almeida 在演讲最后说:
「我相信,明天的 AI 会更多面向自动化,我们最终会进入一个软件本身更加智能的世界。」
Jev 还只是这种设想的一次早期尝试,但这 8 个 Demo 已经展示了一种可能:
AI 不一定要等在对话框里。它也可以成为软件运行过程中的一部分。
编辑:鲍勃、三水

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么