OpenAI 发布 GPT-Live:全双工语音让 ChatGPT 更接近实时对话
OpenAI 发布 GPT-Live-1 与 GPT-Live-1 mini,把 ChatGPT Voice 从轮流问答推进到持续听说,并把搜索、推理和更复杂的任务交给后台模型处理。
OpenAI 在 2026 年 7 月 8 日发布 GPT-Live,并把它接入 ChatGPT Voice。此次变化的重点不是又增加一个语音音色,而是改变语音交互的基本节奏:GPT-Live-1 和 GPT-Live-1 mini 可以在用户说话的同时继续监听和生成声音,不再必须等一个完整回合结束后才能决定是否回答。OpenAI 发布说明
这使 ChatGPT Voice 更像连续对话系统,而不是把语音先转成文字、再调用语言模型、最后合成为语音的串联系统。它仍然有 rollout、套餐和能力边界,不能直接理解为一个已经开放给所有开发者的语音 Agent API。
从“轮流说话”到连续交互
OpenAI 在公告中把过去的语音方案分成两类。早期 ChatGPT Voice 由语音转文字、大语言模型和文字转语音三个模型串联完成一次回答,信息需要在多个环节之间传递,容易出现延迟和表达不连贯。Advanced Voice Mode 已经把音频处理放进更统一的模型中,但它依然主要按照“用户说完—模型回答”的回合工作。
GPT-Live 的新做法是采用全双工架构,让系统持续处理输入并生成输出。模型可以在对话进行时多次判断:继续听、开始说、暂停、打断,或者调用工具。OpenAI 表示,这种持续交互也为更自然的快速来回、适时停顿和实时翻译提供了基础。这里的“全双工”描述的是交互架构,并不代表模型永远不会误判停顿或打断;真实体验仍会受到环境噪声、语言和网络状态影响。
把自然对话和深度工作拆开
GPT-Live 并不负责所有类型的推理。它主要负责保持连续、自然的语音交互;当问题需要搜索、较深推理或更复杂的 Agent 能力时,系统可以把任务交给后台的其他模型。OpenAI 说明,GPT-Live 首发会在后台使用 GPT-5.5,并会随着新的前沿模型发布而更新后台模型。
这种拆分带来一个很实际的产品变化:语音层不必因为等待搜索或推理而完全沉默,用户可以继续保持对话节奏;但“边聊边做深度工作”也意味着前台语音模型、后台推理模型和工具调用之间需要有清晰的状态管理。对产品经理和开发者而言,真正值得观察的不是语音是否更像人,而是系统能否把连续交互、任务委派、结果回传和用户打断组织成一个可控流程。
OpenAI 同时宣布 GPT-Live-1 和 GPT-Live-1 mini 开始面向 ChatGPT 用户全球推出,并计划稍后带到 API。开发者和企业目前可以通过官方表单登记通知,这不等于 API 已经普遍可用。
OpenAI 公布的评测说明了什么
OpenAI 表示,他们新增了以 5 到 10 分钟对话为单位的人类评测,比较整体偏好、轮流发言、打断、对话流畅度和自然程度。在这些对比中,GPT-Live-1 与 GPT-Live-1 mini 被称为明显更受偏好。公告还列出 GPQA、BrowseComp 和一个内部的语音电信任务评测:前者关注专家级科学推理,BrowseComp 关注较难的 Agent 搜索,内部任务则模拟多轮电信客服。OpenAI 公布的评测说明
这些数据目前仍属于 OpenAI 的发布材料。它们可以说明厂商选择了哪些指标,也能帮助读者理解 GPT-Live 不只是音色变化,但不能替代独立复现。尤其是“更受偏好”“明显提升”和“更聪明”需要结合样本、提示、对手版本和统计方法阅读,不能直接转译成所有场景都更好。
ChatGPT Voice 同时增加视觉和安全边界
在产品层面,ChatGPT Voice 现在可以在对话中展示天气、股票、体育等视觉卡片,并继续支持搜索、记忆、图片和文件上传。OpenAI 还介绍了更自然的停顿处理、对背景噪声的关注能力,以及为 GPT-Live 重新制作的九种声音。
语音交互的风险也不同于纯文字对话。OpenAI 表示,它增加了音频原生评测和合成音频评测,覆盖自伤、精神健康、情绪依赖、暴力和色情内容,并对高风险输出设计了语音中的实时转向、提示和结束对话机制。青少年保护与家长控制也被纳入公告。以上属于厂商公开的安全设计和测试说明,不应写成已经证明所有语音风险都被解决。GPT-Live System Card
开放范围与尚未实现的能力
GPT-Live 正在向 iOS、Android 和 ChatGPT.com 用户推出。Go、Plus 和 Pro 用户默认使用 GPT-Live-1,Free 用户默认使用 GPT-Live-1 mini。OpenAI 也提醒,部分语言可能存在非母语口音或流畅度不足的问题。
首发版本还不支持 ChatGPT 中的语音视频和屏幕共享,旧版 Standard Voice 或 Advanced Voice Mode 在支持的地方仍可使用。API 只是“计划稍后提供”,不能据此写成开发者今天已经可以直接调用 GPT-Live。对团队而言,当前更准确的判断是:语音正在成为 Agent 的连续交互层,但开发接入、权限控制、可观测性和跨语言质量仍然需要等待后续开放与独立验证。ChatGPT 更新日志
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
17GB对100GB:Qwen3.8-27B与Flash-Next做同一批任务,省下的容量换来了什么?
同做89项终端任务,17GB的27B首轮完成35项,100GB的Flash-Next完成45项;最多两次是46对53,最多四次是48对60。本文追到9月13日后续结果,区分模型能力、环境故障和返工时间;测试为苹果MLX四位量化,不是GSQ-RCO IQ3_S,也不能套到16GB显卡。
Qwen3.8-Flash-Next每秒70词元?本地加速之前,先看模型究竟改了什么
同样叫Flash-Next,70词元/秒背后可能是另一条计算路径:每词元激活专家从10减到5,再训练共享专家补偿。本文对照单台DGX Spark的两套原始资料,拆开量化、MTP、输入速度、输出速度和并发吞吐,不把128GB统一内存结果套到16GB显卡。
NVIDIA PAIR:把家里的 RTX、DGX Spark 和 Mac 变成本地 AI 请求集群,但它不是“显存池化”
可以把 NVIDIA PAIR 理解成家里本地 AI 的“派单前台”:RTX 主机、DGX Spark、Mac 就像几名能力不同的员工,PAIR 看谁在线、谁装了对应模型、谁现在最空闲,就把下一份 AI 工作交给谁。它特别适合多 Agent 并发,但不会把 16GB + 24GB 显存拼成 40GB,也不会把一个大模型拆到多台机器上。