OpenAI 把全双工语音塞进 Codex:对着电脑说话就能同时跑多个编程 Agent
7月23日,OpenAI 将 GPT-Live 全双工语音模型正式接入 ChatGPT 桌面端(macOS 和 Windows),直接驱动 Codex 和 ChatGPT Work。开发者现在可以纯语音操控多个编程 Agent——查 bug、审 PR、写测试,同时进行,不用停手打字,不用切窗口。
全双工语音 + 编程 Agent,怎么配合?
GPT-Live 最初在7月8日发布,核心能力是"边听边说"——不需要等对方说完才能开口,对话更自然。这次更新把语音层和执行层解耦:GPT-Live 负责实时对话,插入"收到""明白了"这类自然回应,同时把重计算任务交给后台推理模型(GPT-5.5)处理。
实际操作中,你可以一句话同时派三个活:"查一下那个认证 bug,审一下 API 迁移的 PR,再把缺的单元测试补上。"桌面端会跨 Slack、GitHub、本地代码库协调这些任务。在 macOS 上还有屏幕上下文功能——说一句"看看这个",ChatGPT 就能分析你当前最前面的窗口。
iOS 端也支持远程查看任务进度、回答 Agent 提问、重定向正在跑的任务。build 26.715 加入了多文件夹项目支持。
谁能用,什么限制?
仅限付费用户:Plus、Pro、Business、Enterprise、Education 计划。语音触发的任务和普通 Agent 任务一样消耗配额,没有额外计费,但也没有独立 API——GPT-Live 目前不可自建,开发者想构建自定义语音 Agent 仍需走旧的 Realtime API。
为什么这件事值得关注?
编程 Agent 的交互方式正在从"打字→等待→打字"变成"说话→并行执行→语音确认"。当 Agent 越来越多地自主跑长时间任务,真正的瓶颈不再是模型能力,而是人怎么同时监督多个 Agent。语音全双工让这件事变得可行——你可以边走动边指挥,边开会边查进度。
巧合的是,同一周 Anthropic 也推出了自己的语音模式。两大实验室都在押注同一个方向:Agent 无人值守之后,语音是监督多任务的新界面。
---
基于多家媒体转述整理,主要来源:VentureBeat、OpenAI 官方 X 账号。