OpenAI 发布 GPT-Live:全双工语音让 ChatGPT 更接近实时对话
OpenAI 发布 GPT-Live-1 与 GPT-Live-1 mini,把 ChatGPT Voice 从轮流问答推进到持续听说,并把搜索、推理和更复杂的任务交给后台模型处理。
OpenAI 在 2026 年 7 月 8 日发布 GPT-Live,并把它接入 ChatGPT Voice。此次变化的重点不是又增加一个语音音色,而是改变语音交互的基本节奏:GPT-Live-1 和 GPT-Live-1 mini 可以在用户说话的同时继续监听和生成声音,不再必须等一个完整回合结束后才能决定是否回答。OpenAI 发布说明
这使 ChatGPT Voice 更像连续对话系统,而不是把语音先转成文字、再调用语言模型、最后合成为语音的串联系统。它仍然有 rollout、套餐和能力边界,不能直接理解为一个已经开放给所有开发者的语音 Agent API。
从“轮流说话”到连续交互
OpenAI 在公告中把过去的语音方案分成两类。早期 ChatGPT Voice 由语音转文字、大语言模型和文字转语音三个模型串联完成一次回答,信息需要在多个环节之间传递,容易出现延迟和表达不连贯。Advanced Voice Mode 已经把音频处理放进更统一的模型中,但它依然主要按照“用户说完—模型回答”的回合工作。
GPT-Live 的新做法是采用全双工架构,让系统持续处理输入并生成输出。模型可以在对话进行时多次判断:继续听、开始说、暂停、打断,或者调用工具。OpenAI 表示,这种持续交互也为更自然的快速来回、适时停顿和实时翻译提供了基础。这里的“全双工”描述的是交互架构,并不代表模型永远不会误判停顿或打断;真实体验仍会受到环境噪声、语言和网络状态影响。
把自然对话和深度工作拆开
GPT-Live 并不负责所有类型的推理。它主要负责保持连续、自然的语音交互;当问题需要搜索、较深推理或更复杂的 Agent 能力时,系统可以把任务交给后台的其他模型。OpenAI 说明,GPT-Live 首发会在后台使用 GPT-5.5,并会随着新的前沿模型发布而更新后台模型。
这种拆分带来一个很实际的产品变化:语音层不必因为等待搜索或推理而完全沉默,用户可以继续保持对话节奏;但“边聊边做深度工作”也意味着前台语音模型、后台推理模型和工具调用之间需要有清晰的状态管理。对产品经理和开发者而言,真正值得观察的不是语音是否更像人,而是系统能否把连续交互、任务委派、结果回传和用户打断组织成一个可控流程。
OpenAI 同时宣布 GPT-Live-1 和 GPT-Live-1 mini 开始面向 ChatGPT 用户全球推出,并计划稍后带到 API。开发者和企业目前可以通过官方表单登记通知,这不等于 API 已经普遍可用。
OpenAI 公布的评测说明了什么
OpenAI 表示,他们新增了以 5 到 10 分钟对话为单位的人类评测,比较整体偏好、轮流发言、打断、对话流畅度和自然程度。在这些对比中,GPT-Live-1 与 GPT-Live-1 mini 被称为明显更受偏好。公告还列出 GPQA、BrowseComp 和一个内部的语音电信任务评测:前者关注专家级科学推理,BrowseComp 关注较难的 Agent 搜索,内部任务则模拟多轮电信客服。OpenAI 公布的评测说明
这些数据目前仍属于 OpenAI 的发布材料。它们可以说明厂商选择了哪些指标,也能帮助读者理解 GPT-Live 不只是音色变化,但不能替代独立复现。尤其是“更受偏好”“明显提升”和“更聪明”需要结合样本、提示、对手版本和统计方法阅读,不能直接转译成所有场景都更好。
ChatGPT Voice 同时增加视觉和安全边界
在产品层面,ChatGPT Voice 现在可以在对话中展示天气、股票、体育等视觉卡片,并继续支持搜索、记忆、图片和文件上传。OpenAI 还介绍了更自然的停顿处理、对背景噪声的关注能力,以及为 GPT-Live 重新制作的九种声音。
语音交互的风险也不同于纯文字对话。OpenAI 表示,它增加了音频原生评测和合成音频评测,覆盖自伤、精神健康、情绪依赖、暴力和色情内容,并对高风险输出设计了语音中的实时转向、提示和结束对话机制。青少年保护与家长控制也被纳入公告。以上属于厂商公开的安全设计和测试说明,不应写成已经证明所有语音风险都被解决。GPT-Live System Card
开放范围与尚未实现的能力
GPT-Live 正在向 iOS、Android 和 ChatGPT.com 用户推出。Go、Plus 和 Pro 用户默认使用 GPT-Live-1,Free 用户默认使用 GPT-Live-1 mini。OpenAI 也提醒,部分语言可能存在非母语口音或流畅度不足的问题。
首发版本还不支持 ChatGPT 中的语音视频和屏幕共享,旧版 Standard Voice 或 Advanced Voice Mode 在支持的地方仍可使用。API 只是“计划稍后提供”,不能据此写成开发者今天已经可以直接调用 GPT-Live。对团队而言,当前更准确的判断是:语音正在成为 Agent 的连续交互层,但开发接入、权限控制、可观测性和跨语言质量仍然需要等待后续开放与独立验证。ChatGPT 更新日志
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
Copilot 代码审查接入 Agent Skills 与只读 MCP:团队规则如何进入 PR
GitHub 将 Copilot 代码审查中的 Agent Skills 与 MCP 支持从公开预览推进到正式可用,让任务型审查规则和问题跟踪、文档、服务目录等外部上下文进入 PR;但只读调用、评论归因和人工门禁仍有明确边界。
MCP 2026-07-28 转向无状态:GitHub Server 提前适配了什么
MCP 2026-07-28 稳定规范移除了协议会话与 initialize 握手,把连接上下文放回每次请求;GitHub MCP Server 的提前适配展示了无状态服务的工程收益,也说明兼容仍依赖版本协商、旧协议回退和一致性测试。
Copilot App 使用数据进入标准报表:能衡量采用,不能直接证明 ROI
GitHub 把 Copilot App 活动纳入企业、组织和用户级标准使用度量,新增用户活跃、会话、请求、Token、模型、语言与代码活动拆分;这些指标适合观察采用与覆盖,不应单独解释为生产力或 ROI。