OpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 提速最高 14 倍,由 Cerebras 驱动

2026-08-13,OpenAI 预览 Ultrafast 服务层级,可在 API 中把 GPT-5.6 Sol 的运行速度提升至标准处理的 14 倍,由 Cerebras 提供支持,每秒最多生成 750 个输出 token。它面向应急响应、实时客服、金融研究与商务等对秒级响应敏感的场景,目前仅对限定的早期客户开放有限预览。

浏览 199
OpenAI 预览 Ultrafast 模式:GPT-5.6 Sol 提速最高 14 倍,由 Cerebras 驱动封面

2026 年 8 月 13 日,OpenAI 在官方博客中预览了 Ultrafast,一个新的服务层级,可在 OpenAI API 中把 GPT-5.6 Sol 的运行速度提升至标准处理的最高 14 倍。它由 Cerebras 提供底层支持,每秒最多生成 750 个输出 token。官方称,这是把「实时速度」与「前沿智能」结合的尝试,让最智能的模型进入对每一秒都敏感的工作流。

一个新的速度层级:不用牺牲智能

过去,要在产品里获得实时速度,通常意味着选择更小或更专用的模型。OpenAI 指出 Ultrafast 指向一个新的方向——「每秒完成更多有效工作」。当速度不再需要以牺牲智能为代价时,AI 就能进入业务中最依赖时间的部分。官方列举了若干已看到价值的场景:应急响应(系统故障时快速分析日志、定位原因并准备修复)、金融研究与安全(在市场条件仍在变化时分析信号、识别可疑交易)、客服与语音(不中断对话地实时解决复杂问题)、商务(在用户决策过程中实时回答商品问题、检查库存、推荐与解决结账问题),以及实时研究与实验(把以往需要整夜运行的研究变成可交互的会话)。

早期客户与 OpenAI 内部使用

OpenAI 已经在编码、商务、金融研究、支持等方向与一批早期公司测试 Ultrafast。Jane Street 的 John Crepezzi 表示 Cerebras 带来的速度提升令人印象深刻,让开发者能更聚焦、更高效地与模型协作;Podium 的 Courtland Lykins 提到 Ultrafast 在其语音栈里价值巨大,速度彻底改变了复杂工作的通话体验;Rogo 的 Alex Wang 认为它让复杂的金融研究变成实时交互。OpenAI 内部团队也在用 Ultrafast 处理应急响应与研究工作流,例如把「夜间批量跑实验、早晨看结果」的循环,收紧密到工作日内完成多次迭代。

由 Cerebras 提供支持

Ultrafast 是 OpenAI 与 Cerebras 合作的下一步,目标是把超低延迟推理带入 OpenAI 平台。现在,GPT-5.6 Sol 在 Ultrafast 模式下由 Cerebras 驱动,最高每秒 750 个输出 token。对开发者而言,这意味着可以构建响应更快的产品、更快决策,并把强大的 AI 直接放进最苛刻的工作流。

可用性与边界

GPT-5.6 Sol 的 Ultrafast 模式目前仅向一组限定客户提供有限预览,OpenAI 会随算力增长逐步扩展访问,有兴趣的组织可通过扩展通知表单登记。需要说明的是,本文内容完全来自 OpenAI 官方博客,未做独立速度实测;Ultrafast 的 14 倍提速、750 tokens/s 等均为厂商公布数据,实际可用性与延迟取决于具体工作负载、算力供给与网络环境。读者在评估是否接入时,应以官方正式文档与自身基准为准。

本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。

浏览 199
AI 基础设施 NVIDIA PAIR:把家里的 RTX、DGX Spark 和 Mac 变成本地 AI 请求集群,但它不是“显存池化”封面 NVIDIA PAIR:把家里的 RTX、DGX Spark 和 Mac 变成本地 AI 请求集群,但它不是“显存池化” 可以把 NVIDIA PAIR 理解成家里本地 AI 的“派单前台”:RTX 主机、DGX Spark、Mac 就像几名能力不同的员工,PAIR 看谁在线、谁装了对应模型、谁现在最空闲,就把下一份 AI 工作交给谁。它特别适合多 Agent 并发,但不会把 16GB + 24GB 显存拼成 40GB,也不会把一个大模型拆到多台机器上。 49