一边语音聊天,一边让 Agent 干活:最火爆的 7 个 Voice Coding Agent 大盘点
图:disbrief.com
「前台交流、后台工作」,正在成为 Voice AI 近期的一股重要技术与产品思潮,也让实时多模态模型与编程模型找到了一个更自然的交汇点。
你可以一边和 Coding Agent 说「帮我改一下这个 API 的返回结构」,一边继续追问「进度到哪了」,甚至在它还在运行测试时直接打断补充新需求。前台的对话不断流动,后台的任务也在持续推进,两者同时发生,却互不阻塞。
这篇 Voice Coding Agent 合集试图对这样的技术趋势做一次梳理,也通过当下批量出现的产品给你一个概览,看看大家都在探索什么,又各自有什么侧重点。

当交互成为智能的一部分
这类产品并不是最近才有。25 年底到 26 年初,来自语音模型厂商 Elevenlabs 的 11.ai、Deepgram 的 Saga 的实验,已经分别尝试过语音调用工具、理解屏幕和远程管理 Coding Agent。
但 2026 年这一轮明显加速,与实时交互模型能力的集中提升几乎同步发生。
5 月,Thinking Machines Lab 发布 Interaction Models 的 demo。它没有再把交互看成模型外部的一层包装,而是让模型持续接收音频、视频和文字,以 micro-turn 处理连续输入输出;需要更长时间推理和工具调用时,则交给异步运行的 background model。用户仍然可以继续说话、补充信息,后台结果完成后再被带回当前对话。
7 月,OpenAI 发布 GPT-Live。它同样采用全双工架构,并把持续交互和深度工作拆开:GPT-Live 留在前台听和说,搜索、复杂推理和 Agent 任务可以交给后台 GPT-5.5,期间对话不必停下来。随后 ChatGPT Voice 又接入桌面端的 Work 和 Codex,可以直接通过语音启动和协调任务。
两条路线的技术实现并不完全一样,但都把此前一来一往的「说一句 → 等 Agent 做完 → 看结果」,变成了前台持续交流、后台持续工作。
从语音输入到全双工协作,6+1 家 Voice Coding Agent 项目汇总
SKI:给现有 Coding Agent 加上耳朵和嘴
https://heyski.io/
刚刚在 Product Hunt 发布便备受关注的 SKI,做法很直接:不自己做 Coding Agent,而是连接 Claude Code、Codex、Cursor、Gemini CLI、OpenClaw 等已经存在的工具,在它们上面增加一层双向语音。
用户说话后,SKI 在本地完成 STT,把文字交给 Coding Agent;Agent 继续读文件、改代码、跑测试,返回的文字再由 SKI 在本地说出来。它支持全双工打断:Agent 正在回答时,用户可以直接插话,不需要先按键让它停止。语音输入和输出都可在设备本地运行。
它还把语音延伸到了多项目和会议场景:多个 repo 可以绑定不同声音;Agent 也可以作为参与者加入 Zoom、Meet 或 Teams,听会、说话、看屏幕,并继续连接相应代码项目。
Qwen-Audio-Agent:Code Agent 语音层的开源版本
https://github.com/QwenAudio/qwen-audio-agent
7 月底,通义千问语音团队开源了 Qwen-Audio-Agent。它与 SKI 很接近,同样把实时语音层部署在用户和已有 Agent 之间,但把整个中间层直接做成了开源 runtime。
前台语音 Agent 负责持续交流和简单问题;搜索、长时间推理、代码修改和工具操作,则连同当前上下文委派给后台 Agent。任务运行时,用户仍然可以继续补充要求、查询进度、改变目标或者取消任务,完成后的结果会自动回到原来的语音会话。项目明确支持全双工实时语音、自然打断以及多个后台任务并行运行。
目前已经适配 OpenCode、OpenClaw、Qoder、Kimi Code、Hermes、CodeBuddy、Codex 和 Claude Code,并通过 ACP 继续扩展其他 Agent;界面则包括 TUI、WebUI 和桌面悬浮球。
如果说 SKI 是开箱即用的桌面产品,Qwen-Audio-Agent 更像把相同思路完整拆出来:前台语音、后台 Agent、任务委派和界面都可以继续替换和改造。
ChatGPT Voice + Codex:语音直接进入原生任务系统
https://openai.com/index/introducing-gpt-live/
OpenAI 把 GPT-Live、ChatGPT Voice、Codex 和 Work 放进同一套产品里。
现在在 ChatGPT 桌面端选择 Codex 或 Work 后,可以直接进入 Voice。用户能够自然插话,也可以要求 Voice 创建任务、查看进展,或者协调正在执行的工作;Voice 会使用当前 Codex / Work 已经拥有的工具和权限。
底层 GPT-Live 又把实时交流与复杂工作分开:前台继续维持全双工语音,复杂推理和任务则委派给后台模型,因此后台开始工作并不意味着语音会话结束。
Clicky:前台只有一个伙伴,后台可以派出多个 Agent
https://www.heyclicky.com/
Farza Majeed 做的 Clicky 并不是专门的 Coding Agent,但它提供了这一波里很特别的一种桌面交互。
最初的 Clicky 是一个住在鼠标旁边的屏幕助手:用户可以直接开口询问正在使用的软件,它读取当前屏幕,用声音解释,还能直接在屏幕上画箭头指出应该操作的位置。
5 月底,Farza 又发布了一段基于 GPT-Realtime 2.0 的演示:不用键盘和鼠标,通过持续语音直接打开应用、控制 Spotify、进入 VS Code 和修改代码。Clicky 官网现在也明确把产品分成 Talk 与 Agents:Talk 是持续交流,Agents 则真正去后台执行任务。
界面上,被派出去工作的 Agent 会进入侧栏。用户并不需要分别打开多个 Agent 的聊天窗口,而是继续面对同一个 Clicky,后台任务则单独显示状态。
Clicky 更关注当语音和多个 Agent 同时存在时,桌面界面应该长什么样。
Zoku:用语音指挥多个 Coding Agent
https://heyzoku.com/
如果后台 Agent 已经不是一两个,而是同时跑十个,Zoku 处理的是另一类问题。
独立开发者 Priyanshu Dangi 把 Claude、Codex、Cursor、Pi 以及其他 CLI Agent 放在同一个 macOS Canvas 中。每个 Agent 可以有自己的名字和工作区,用户通过语音直接创建、重定向或者中断指定 Agent,例如点名让某个 Agent 跑测试,再让另一个处理不同任务。语音命令使用本地 Parakeet 转写。
Zoku 因此没有把重点放在长时间聊天上,它的语音更像多 Agent 环境里的指挥与反馈方式:名字、状态和声音共同解决「到底哪个 Agent 正在干什么」。
Heard:让多个 Agent 协同运行,用语音汇总成一条清晰叙事
https://heard.dev/
Kelly Fraser 做的开源项目 Heard 从输出端切入。它连接 Claude Code、Codex 和 Cursor,监听 Agent 的执行事件,再把值得注意的部分整理成语音,而不是逐行朗读终端。
Heard 提供不同的信息密度:人在屏幕前时只给简短提示;离开电脑时提供更完整的 briefing;Focus 模式则保持安静,直到出现审批、阻塞、失败或者需要决策的节点。多个 Agent 并行时,它会优先播报重要事件,再把其他进展压缩成项目级摘要。
手机配对后,语音会跟着用户离开电脑继续播放,用户也能按住说话回复 Agent、批准操作或者调整方向。这里不是持续的全双工聊天,而是一套双向的状态播报与回应机制。
盘盘不同项目的交互重点
把这些项目放在一起,同样是语音,做的事情已经不太一样:
SKI 给现有 Coding Agent 增加完整的语音往返;
Qwen-Audio-Agent 把相似结构开源,并加入前台对话与后台任务的完整 runtime;
ChatGPT Voice + Codex 把实时语音直接做进原生 Agent 系统;
Clicky 在尝试一场前台交流如何生成多个桌面 Agent 任务;
Zoku 用声音控制和调度多个并行运行的 Agent;
Heard 则负责把多个 Agent 的状态重新整理成适合人听的信息。
整体来看,多家产品共同描绘出一个语音交互与视觉实时理解融合的未来图景,充满想象力;而在当下的落地方案中,也清晰反映出当前能力的边界——语音首先被用来解决意图的表达与确认,以及任务结果的反馈与汇报。
但更有想象力的未来,就是人机的实时协作和共创:人不再只是下达指令或做最终确认,而是持续参与在任务推进的每一个关键节点中,与 Agent 一起迭代思路、修正路径、共同完成创造过程。
One More Thing:Disbrief,不妨边散步边编程
https://www.disbrief.com/#d1-reserve
最后推荐的是今年超音速·Physical AI Camp 中孵化支持的硬件项目 Disbrief。
它把以上提到的类似的多 Voice Coding Agent 工作方式装进了一台随身语音硬件:用户直接通过自然语音提出任务,Disbrief 将任务拆解后派发给 Claude Code、Codex 等多个 Coding Agent 并行处理,再将结果汇总反馈。即便 Disbrief 暂时只支持语音单向输入,硬件的加入打开了更多使用场景的想象空间。
团队由两位成员组成,均曾在 TikTok、Looki 等公司从事研发工作。
桌面上的 SKI、Qwen-Audio-Agent、Zoku 还假设人至少在电脑附近,拥有 4G 网络的 Disbrief 则把同样的问题带到了走路、通勤和离开屏幕之后:多个 Agent 继续在后台工作,人通过语音保持联系。
新的 AI 生产力在催生新的硬件载体,而语音交互将会是 AI 硬件最自然的交互方式。
本文是「Coding Agent 的集体语音时刻」系列的第三篇。阅读前两篇:

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么
