GitHub Copilot Vision GA:图片和 PDF 成为代码协作提示的一部分

GitHub Copilot Vision 已正式可用,用户可以把图片和 PDF 直接附到聊天提示里,让 Copilot 结合视觉材料和代码上下文进行推理。

浏览 38
GitHub Copilot Vision GA:图片和 PDF 成为代码协作提示的一部分封面

GitHub 7 月 1 日宣布,Copilot Vision 正式进入 GA。用户可以把图片和 PDF 直接附加到聊天提示中,让 Copilot 在理解代码的同时,也能根据视觉材料进行推理。这不是单纯的“看图聊天”功能,而是把设计稿、报错截图、流程图、PDF 说明和代码协作放进同一个上下文入口。

支持图片和 PDF 后,需求表达方式会变化

GitHub 公告列出的支持文件包括 JPEG、PNG、GIF、WebP 以及 PDF。对开发者来说,这意味着一些原来很难用文字描述清楚的问题,可以直接变成上下文材料:页面错位截图、设计稿局部、控制台错误截图、接口文档 PDF、产品流程图,甚至用户反馈里的图片。

过去让 AI 辅助开发时,很多人需要先把图片内容转写成文字,再把问题描述给 Agent。这个过程既费时间,也容易漏掉视觉细节。Copilot Vision GA 后,图片和 PDF 本身可以成为提示的一部分,Agent 能在“看到材料”的同时结合仓库、代码片段和用户问题给出建议。

覆盖 VS Code、github.com 和 CLI 三个入口

这次 GA 不只覆盖一个聊天面板。GitHub 说明,Copilot Vision 在 VS Code 的 Copilot Chat 中可用,支持粘贴、拖拽或右键附加图片,并且可用于 ask、plan 和 agent 模式;在 github.com 的 Copilot Chat 中,可以直接附加图片和 PDF;在 Copilot CLI 中,也可以通过图片路径把视觉材料带入终端里的对话。

这个覆盖范围很重要。它说明 GitHub 不是把视觉能力做成一个孤立功能,而是让视觉输入进入开发者已经使用的多个 Copilot 表面。对于真实项目,问题往往不会只出现在代码编辑器里:有时来自设计稿,有时来自网页截图,有时来自 PDF 文档,有时来自命令行任务。统一的视觉入口可以减少材料在工具之间来回搬运。

所有计划可用,但企业附件有保留时间说明

GitHub 表示,Copilot Vision 现在对 Free、Pro、Pro+、Business 和 Enterprise 等所有 Copilot 订阅用户可用。Business 和 Enterprise 用户过去需要开启 Editor Preview Features 策略,现在 Vision 默认可用,不需要管理员额外操作。

不过企业使用时仍要注意数据边界。公告说明,对 Copilot Business 和 Copilot Enterprise 用户,GitHub 会保留图片和 PDF 附件约 24 小时以提供服务。对于涉及内部设计稿、客户文档、未公开产品截图的团队,这个细节需要写进自己的使用规范:哪些材料能附给 Copilot,哪些需要脱敏,哪些只能在内部模型或私有环境中处理。

对 AI Agent 工作流的意义

视觉输入进入 Copilot 后,AI Agent 的任务入口会更贴近真实工作。产品经理可以把流程图和页面截图交给 Agent 解释需求,设计师可以把 UI 截图和代码问题放在一起,开发者可以让 Copilot 对照错误截图定位代码改动。更进一步,和浏览器工具配合时,Agent 既可以在网页里观察,也可以把截图作为上下文继续推理。

这类能力不会自动替代人做判断,但会降低把非结构化材料转成开发任务的成本。对于学习 AI Agent 的用户,重点不是记住支持了哪些图片格式,而是理解:多模态材料正在成为 Agent 协作的默认输入,未来好的需求、测试和验收流程,会越来越多地把截图、文档、代码和运行环境放到同一个任务上下文里。

参考来源

本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。

38