GPT-5.4 加强计算机使用与工具搜索,Agent 工作流更接近真实软件操作

OpenAI 在 GPT-5.4 中强调计算机使用、视觉、工具搜索和更高效的工具调用能力。

浏览 12
GPT-5.4 加强计算机使用与工具搜索,Agent 工作流更接近真实软件操作封面

GPT-5.4 加强计算机使用与工具搜索,Agent 更接近真实软件操作

OpenAI 在 2026 年 3 月 5 日发布 GPT‑5.4,并将其描述为面向 professional work 的前沿模型。对于 Agent 工作流来说,GPT‑5.4 最值得关注的部分,是它原生加强了 computer use、vision 和 tool use 能力。

按照 OpenAI 的说明,GPT‑5.4 是 OpenAI 发布的首个具备原生、领先 computer-use capabilities 的通用模型。它可以帮助 Agent 操作电脑,并在多个应用之间完成复杂工作流。同时,它支持最高 1M tokens context,让 Agent 可以在长时间任务中计划、执行和验证结果。

Computer use 让模型可以操作网站和软件系统

OpenAI 在原文中写到,GPT‑5.4 可以跨 websites 和 software systems 完成真实任务。它既擅长通过 Playwright 这类库编写代码来操作电脑,也能根据截图发出鼠标和键盘命令。

这意味着 Agent 不再只通过 API 或文本接口工作。很多实际软件没有完整 API,或者需要通过图形界面操作。GPT‑5.4 的 computer-use 能力,使它更适合处理浏览器、桌面环境、表单、后台系统、网页应用和跨软件任务。

OpenAI 还提到,开发者可以通过 developer messages 调整模型行为,并通过 custom confirmation policies 配置不同风险容忍度下的安全行为。这一点对真实软件操作很关键,因为点击、提交、删除、发送等动作需要更细的确认规则。

多个 benchmark 显示电脑使用能力提升

OpenAI 给出了几项 computer-use 相关评估。GPT‑5.4 在 OSWorld-Verified 上达到 75.0% success rate,超过 GPT‑5.2 的 47.3%,也超过人类 72.4%。OSWorld-Verified 评估模型通过截图和键鼠动作操作桌面环境的能力。

在 WebArena-Verified 上,GPT‑5.4 使用 DOM 和截图交互达到 67.3% success rate,高于 GPT‑5.2 的 65.4%。在 Online-Mind2Web 上,GPT‑5.4 仅基于截图观察达到 92.8% success rate,超过 ChatGPT Atlas Agent Mode 的 70.9%。

这些指标说明,GPT‑5.4 的提升不是只体现在网页搜索或文本理解上,而是更接近真实用户操作软件的场景。

Tool search 降低大工具生态的 token 成本

GPT‑5.4 的另一个重要更新是 tool search。OpenAI 原文解释,过去当模型拥有很多工具时,所有工具定义都会被提前放进 prompt。对于包含大量工具的系统,这可能带来数千甚至数万 tokens 的额外上下文成本,也会拖慢响应并挤占上下文空间。

Tool search 改变了这一点。模型先获得一个轻量工具列表和工具搜索能力,只有当需要某个工具时,才查找并把该工具定义加入对话。

OpenAI 使用 Scale 的 MCP Atlas benchmark 做了 250 个任务评估。在全部 36 个 MCP servers 启用的情况下,把所有 MCP 工具放到 tool search 后,总 token 使用降低 47%,同时保持同样准确率。

对 Agent 系统来说,这非常重要。未来一个 Agent 可能连接几十个甚至上百个 MCP 工具,不能每次请求都把所有工具说明塞进上下文。Tool search 让大规模工具生态更接近可用。

Agentic tool calling 和 web search 也同步增强

OpenAI 表示,GPT‑5.4 在 tool calling 上也有改进,可以更准确、更高效地判断何时以及如何使用工具。在 Toolathlon 上,GPT‑5.4 相比 GPT‑5.2 能用更少轮次完成更多真实工具任务。

OpenAI 还提到,在 BrowseComp 上,GPT‑5.4 相比 GPT‑5.2 提升 17 个百分点,GPT‑5.4 Pro 达到 89.3% state of the art。BrowseComp 衡量 Agent 是否能坚持浏览网页,找到难以定位的信息。

这些能力和 computer use 结合起来,使 GPT‑5.4 更适合处理跨网页、跨工具、跨软件的长任务,而不是只在一个对话框里输出答案。

这次更新的实际看点

GPT‑5.4 的 computer use 和 tool search 更新,说明 Agent 正在从“会调用少量工具”走向“能在复杂工具生态和真实软件界面中操作”。它需要看懂屏幕、点击按钮、填写表单、选择工具、搜索工具定义,并在长上下文中保持任务目标。

对开发者来说,后续重点不是只测试模型回答质量,而是测试 Agent 是否能在真实软件环境中安全执行:是否会点错、是否能请求确认、是否能节省工具上下文成本、是否能可靠完成多步骤任务。

参考来源

本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。

12