OpenAI 发布 GPT-5.5,强调真实工作中的 Agent 能力
OpenAI 发布 GPT-5.5,重点强调编码、知识工作、软件操作和跨工具执行能力,而不只是单轮问答能力。
GPT-5.5 发布:OpenAI 将模型能力推向真实电脑工作和长任务 Agent
OpenAI 在 2026 年 4 月 23 日发布 GPT‑5.5,并将其描述为 “a new class of intelligence for real work”。按照官方说明,GPT‑5.5 不只是更强的问答模型,而是更接近一种能够在电脑上完成实际工作的智能系统。
OpenAI 写到,GPT‑5.5 能更快理解用户意图,承担更多工作本身,擅长写代码和调试、在线研究、分析数据、创建文档和电子表格、操作软件,并在工具之间移动直到任务完成。用户可以给它一个混乱、多部分的任务,让它计划、使用工具、检查工作、处理模糊性并持续推进。
真实工作比单轮问答更难
OpenAI 在发布中强调,GPT‑5.5 的提升集中在 agentic coding、computer use、knowledge work 和 early scientific research。这些领域的共同点是任务时间更长、上下文更多、工具更多,不能只靠单次回答完成。
在 OpenAI 的表述中,GPT‑5.5 更像是能够工作 through problems 的模型。它不仅更智能,也更高效,通常可以用更少 tokens 和更少重试达到更高质量输出。
这和普通聊天模型的差别很明显。单轮问答看的是模型能不能给出答案;真实工作看的是它能否理解目标、拆解步骤、使用工具、修正错误、验证结果,并在不确定性中继续推进。
Agentic coding 是 GPT-5.5 的核心能力之一
OpenAI 称 GPT‑5.5 是其截至发布时最强的 agentic coding model。在 Terminal-Bench 2.0 上,GPT‑5.5 准确率达到 82.7%;在 SWE-Bench Pro 上达到 58.6%;在 Expert-SWE 这类长程编码评估中也超过 GPT‑5.4。
OpenAI 还强调,GPT‑5.5 在这些评估中不仅分数更高,而且使用更少 tokens。对于 Codex 这类 Agent 应用来说,这很重要,因为长程编码任务会产生大量工具调用、上下文读取、测试和迭代。
从早期测试反馈看,GPT‑5.5 的优势体现在理解系统形状、判断失败原因、定位修复位置、预测测试和审查需求等方面。OpenAI 举例称,有工程师让它重构协作 Markdown 编辑器的评论系统,返回了接近完成的 12-diff stack。
知识工作开始接近“电脑协作”
OpenAI 在 knowledge work 部分写到,GPT‑5.5 的同类能力也适用于日常电脑工作。模型更能理解意图,可以完成 finding information、understanding what matters、using tools、checking the output 和 turning raw material into something useful 的完整循环。
在 Codex 中,GPT‑5.5 比 GPT‑5.4 更擅长生成文档、电子表格和幻灯片。OpenAI 内部也已经把它用于真实工作流:超过 85% 的 OpenAI 员工每周使用 Codex,覆盖软件工程、财务、通信、市场、数据科学和产品管理等职能。
OpenAI 举了几个内部案例:通信团队用 GPT‑5.5 in Codex 分析六个月演讲请求数据,建立评分和风险框架,并验证自动 Slack Agent;财务团队用 Codex 审查 24,771 份 K-1 税务表格,共 71,637 页,并通过排除个人信息的工作流将任务比上一年提前两周完成;GTM 团队有人用它自动生成每周业务报告,每周节省 5 到 10 小时。
安全和可用性仍然分层推进
OpenAI 表示,GPT‑5.5 配备其截至发布时最强的一组 safeguards,用于减少滥用,同时尽量保留有益工作访问。OpenAI 对该模型进行了完整安全和 preparedness 框架评估,与内部和外部 red team 合作,并针对 advanced cybersecurity 和 biology capabilities 增加了专项测试。
可用性方面,GPT‑5.5 在发布时面向 Plus、Pro、Business 和 Enterprise 用户的 ChatGPT 与 Codex 推出,GPT‑5.5 Pro 面向 Pro、Business 和 Enterprise 用户推出。OpenAI 后续更新称,GPT‑5.5 和 GPT‑5.5 Pro 已在 API 中可用。
这说明 OpenAI 在把模型推向真实工作时采取了分层策略:先在 ChatGPT 和 Codex 中面向特定用户开放,再结合 API 的安全和部署要求逐步扩展。
这次发布的实际看点
GPT‑5.5 的核心信号是,OpenAI 正把模型从回答问题推进到完成真实电脑工作。编码、知识工作、科学研究、电脑使用和跨工具执行被放在同一个框架里讨论。
这对个人和企业用户都很重要。未来模型竞争不只看谁回答得更好,而是看谁能在复杂任务中持续工作、使用工具、检查结果、管理上下文,并在安全边界内完成交付。
参考来源
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
Copilot 代码审查接入 Agent Skills 与只读 MCP:团队规则如何进入 PR
GitHub 将 Copilot 代码审查中的 Agent Skills 与 MCP 支持从公开预览推进到正式可用,让任务型审查规则和问题跟踪、文档、服务目录等外部上下文进入 PR;但只读调用、评论归因和人工门禁仍有明确边界。
MCP 2026-07-28 转向无状态:GitHub Server 提前适配了什么
MCP 2026-07-28 稳定规范移除了协议会话与 initialize 握手,把连接上下文放回每次请求;GitHub MCP Server 的提前适配展示了无状态服务的工程收益,也说明兼容仍依赖版本协商、旧协议回退和一致性测试。
Copilot App 使用数据进入标准报表:能衡量采用,不能直接证明 ROI
GitHub 把 Copilot App 活动纳入企业、组织和用户级标准使用度量,新增用户活跃、会话、请求、Token、模型、语言与代码活动拆分;这些指标适合观察采用与覆盖,不应单独解释为生产力或 ROI。