一边语音聊天,一边让 Agent 干活:最火爆的 7 个 Voice Coding Agent 大盘点

图片

图:disbrief.com

「前台交流、后台工作」,正在成为 Voice AI 近期的一股重要技术与产品思潮,也让实时多模态模型与编程模型找到了一个更自然的交汇点。


你可以一边和 Coding Agent 说「帮我改一下这个 API 的返回结构」,一边继续追问「进度到哪了」,甚至在它还在运行测试时直接打断补充新需求。前台的对话不断流动,后台的任务也在持续推进,两者同时发生,却互不阻塞。


这篇 Voice Coding Agent 合集试图对这样的技术趋势做一次梳理,也通过当下批量出现的产品给你一个概览,看看大家都在探索什么,又各自有什么侧重点。



当交互成为智能的一部分


这类产品并不是最近才有。25 年底到 26 年初,来自语音模型厂商 Elevenlabs 的 11.ai、Deepgram 的 Saga 的实验,已经分别尝试过语音调用工具、理解屏幕和远程管理 Coding Agent。


但 2026 年这一轮明显加速,与实时交互模型能力的集中提升几乎同步发生。


5 月,Thinking Machines Lab 发布 Interaction Models 的 demo。它没有再把交互看成模型外部的一层包装,而是让模型持续接收音频、视频和文字,以 micro-turn 处理连续输入输出;需要更长时间推理和工具调用时,则交给异步运行的 background model。用户仍然可以继续说话、补充信息,后台结果完成后再被带回当前对话。


图片


7 月,OpenAI 发布 GPT-Live。它同样采用全双工架构,并把持续交互和深度工作拆开:GPT-Live 留在前台听和说,搜索、复杂推理和 Agent 任务可以交给后台 GPT-5.5,期间对话不必停下来。随后 ChatGPT Voice 又接入桌面端的 Work 和 Codex,可以直接通过语音启动和协调任务。


两条路线的技术实现并不完全一样,但都把此前一来一往的「说一句 → 等 Agent 做完 → 看结果」,变成了前台持续交流、后台持续工作



从语音输入到全双工协作,6+1 家 Voice Coding Agent 项目汇总


  1. SKI:给现有 Coding Agent 加上耳朵和嘴


https://heyski.io/



刚刚在 Product Hunt 发布便备受关注的 SKI,做法很直接:不自己做 Coding Agent,而是连接 Claude Code、Codex、Cursor、Gemini CLI、OpenClaw 等已经存在的工具,在它们上面增加一层双向语音。


用户说话后,SKI 在本地完成 STT,把文字交给 Coding Agent;Agent 继续读文件、改代码、跑测试,返回的文字再由 SKI 在本地说出来。它支持全双工打断:Agent 正在回答时,用户可以直接插话,不需要先按键让它停止。语音输入和输出都可在设备本地运行。


它还把语音延伸到了多项目和会议场景:多个 repo 可以绑定不同声音;Agent 也可以作为参与者加入 Zoom、Meet 或 Teams,听会、说话、看屏幕,并继续连接相应代码项目。





  1. Qwen-Audio-Agent:Code Agent 语音层的开源版本


https://github.com/QwenAudio/qwen-audio-agent



7 月底,通义千问语音团队开源了 Qwen-Audio-Agent。它与 SKI 很接近,同样把实时语音层部署在用户和已有 Agent 之间,但把整个中间层直接做成了开源 runtime。


前台语音 Agent 负责持续交流和简单问题;搜索、长时间推理、代码修改和工具操作,则连同当前上下文委派给后台 Agent。任务运行时,用户仍然可以继续补充要求、查询进度、改变目标或者取消任务,完成后的结果会自动回到原来的语音会话。项目明确支持全双工实时语音、自然打断以及多个后台任务并行运行。


目前已经适配 OpenCode、OpenClaw、Qoder、Kimi Code、Hermes、CodeBuddy、Codex 和 Claude Code,并通过 ACP 继续扩展其他 Agent;界面则包括 TUI、WebUI 和桌面悬浮球。


如果说 SKI 是开箱即用的桌面产品,Qwen-Audio-Agent 更像把相同思路完整拆出来:前台语音、后台 Agent、任务委派和界面都可以继续替换和改造。





  1. ChatGPT Voice + Codex:语音直接进入原生任务系统


https://openai.com/index/introducing-gpt-live/


图片


OpenAI 把 GPT-Live、ChatGPT Voice、Codex 和 Work 放进同一套产品里。


现在在 ChatGPT 桌面端选择 Codex 或 Work 后,可以直接进入 Voice。用户能够自然插话,也可以要求 Voice 创建任务、查看进展,或者协调正在执行的工作;Voice 会使用当前 Codex / Work 已经拥有的工具和权限。


底层 GPT-Live 又把实时交流与复杂工作分开:前台继续维持全双工语音,复杂推理和任务则委派给后台模型,因此后台开始工作并不意味着语音会话结束。





  1. Clicky:前台只有一个伙伴,后台可以派出多个 Agent


https://www.heyclicky.com/



Farza Majeed 做的 Clicky 并不是专门的 Coding Agent,但它提供了这一波里很特别的一种桌面交互。


最初的 Clicky 是一个住在鼠标旁边的屏幕助手:用户可以直接开口询问正在使用的软件,它读取当前屏幕,用声音解释,还能直接在屏幕上画箭头指出应该操作的位置。


5 月底,Farza 又发布了一段基于 GPT-Realtime 2.0 的演示:不用键盘和鼠标,通过持续语音直接打开应用、控制 Spotify、进入 VS Code 和修改代码。Clicky 官网现在也明确把产品分成 Talk 与 Agents:Talk 是持续交流,Agents 则真正去后台执行任务。


界面上,被派出去工作的 Agent 会进入侧栏。用户并不需要分别打开多个 Agent 的聊天窗口,而是继续面对同一个 Clicky,后台任务则单独显示状态。


Clicky 更关注当语音和多个 Agent 同时存在时,桌面界面应该长什么样





  1. Zoku:用语音指挥多个 Coding Agent


https://heyzoku.com/



如果后台 Agent 已经不是一两个,而是同时跑十个,Zoku 处理的是另一类问题。


独立开发者 Priyanshu Dangi 把 Claude、Codex、Cursor、Pi 以及其他 CLI Agent 放在同一个 macOS Canvas 中。每个 Agent 可以有自己的名字和工作区,用户通过语音直接创建、重定向或者中断指定 Agent,例如点名让某个 Agent 跑测试,再让另一个处理不同任务。语音命令使用本地 Parakeet 转写。


Zoku 因此没有把重点放在长时间聊天上,它的语音更像多 Agent 环境里的指挥与反馈方式:名字、状态和声音共同解决「到底哪个 Agent 正在干什么」。





  1. Heard:让多个 Agent 协同运行,用语音汇总成一条清晰叙事


https://heard.dev/



Kelly Fraser 做的开源项目 Heard 从输出端切入。它连接 Claude Code、Codex 和 Cursor,监听 Agent 的执行事件,再把值得注意的部分整理成语音,而不是逐行朗读终端。


Heard 提供不同的信息密度:人在屏幕前时只给简短提示;离开电脑时提供更完整的 briefing;Focus 模式则保持安静,直到出现审批、阻塞、失败或者需要决策的节点。多个 Agent 并行时,它会优先播报重要事件,再把其他进展压缩成项目级摘要。


手机配对后,语音会跟着用户离开电脑继续播放,用户也能按住说话回复 Agent、批准操作或者调整方向。这里不是持续的全双工聊天,而是一套双向的状态播报与回应机制





盘盘不同项目的交互重点


把这些项目放在一起,同样是语音,做的事情已经不太一样:


SKI 给现有 Coding Agent 增加完整的语音往返;

Qwen-Audio-Agent 把相似结构开源,并加入前台对话与后台任务的完整 runtime;

ChatGPT Voice + Codex 把实时语音直接做进原生 Agent 系统;

Clicky 在尝试一场前台交流如何生成多个桌面 Agent 任务;

Zoku 用声音控制和调度多个并行运行的 Agent;

Heard 则负责把多个 Agent 的状态重新整理成适合人听的信息。


整体来看,多家产品共同描绘出一个语音交互与视觉实时理解融合的未来图景,充满想象力;而在当下的落地方案中,也清晰反映出当前能力的边界——语音首先被用来解决意图的表达与确认,以及任务结果的反馈与汇报。


但更有想象力的未来,就是人机的实时协作和共创:人不再只是下达指令或做最终确认,而是持续参与在任务推进的每一个关键节点中,与 Agent 一起迭代思路、修正路径、共同完成创造过程。




One More Thing:Disbrief,不妨边散步边编程


https://www.disbrief.com/#d1-reserve


图片


最后推荐的是今年超音速·Physical AI Camp 中孵化支持的硬件项目 Disbrief


它把以上提到的类似的多 Voice Coding Agent 工作方式装进了一台随身语音硬件:用户直接通过自然语音提出任务,Disbrief 将任务拆解后派发给 Claude Code、Codex 等多个 Coding Agent 并行处理,再将结果汇总反馈。即便 Disbrief 暂时只支持语音单向输入,硬件的加入打开了更多使用场景的想象空间。


图片


团队由两位成员组成,均曾在 TikTok、Looki 等公司从事研发工作。


桌面上的 SKI、Qwen-Audio-Agent、Zoku 还假设人至少在电脑附近,拥有 4G 网络的 Disbrief 则把同样的问题带到了走路、通勤和离开屏幕之后:多个 Agent 继续在后台工作,人通过语音保持联系。


新的 AI 生产力在催生新的硬件载体,而语音交互将会是 AI 硬件最自然的交互方式。




本文是「Coding Agent 的集体语音时刻」系列的第三篇。阅读前两篇:


  1. 全网首拆 ChatGPT Voice for Codex 安装包:当语音成为 Coding Agent 的下一代实时交互入口丨Voice Agent 学习笔记


  2. Agent-VUI 设计:写在语音智能体的「ChatGPT 时刻」前夜|Voice Agent 学习笔记


图片

阅读更多 Voice Agent 学习笔记:了解最懂 AI 语音的头脑都在思考什么


注册登录 后评论
    // 作者
    R
    @RTE_Dev_Comm
    还什么也没有写~
    • 0
    // 本帖子
    关键词
    // 相关帖子
    Coming soon...
    • 0
    一边语音聊天,一边让 Agent 干活:最火爆的 7 个 Voice Coding Agent 大盘点RTRTE_Dev_Comm