GitHub Agent Plugins 1.0:把 Agent 技能与 MCP 服务器打包成跨客户端可插拔插件
2026-08-12,GitHub 宣布 Agent Plugins 1.0 在 VS Code、Copilot CLI、GitHub Copilot SDK 与 Copilot App 全面可用。该开放标准可将 Agent 技能(skills)与 MCP 服务器配置打包成一个插件,一次构建即可在多个兼容客户端复用,消除了为每个 Agent 维护独立包的重复成本;AWS、Anysphere、Microsoft、OpenAI、Vercel 与 Google 共同维护该规范。
2026 年 8 月 12 日,GitHub 在 Changelog 宣布 Agent Plugins 1.0 在 VS Code、Copilot CLI、GitHub Copilot SDK 与 GitHub Copilot App 中全面可用,覆盖所有 Copilot 套餐。Agent Plugins 是一个开放标准,把 Agent 技能与 MCP 服务器配置打包成一个可安装的插件,并独立于任何单一厂商进行治理。该规范于 2026 年 8 月 6 日发布,AWS、Anysphere、Microsoft、OpenAI、Vercel 与 Google 都是核心维护方。
一个插件,多个客户端复用
在 Agent Plugins 之前,为一个插件对接几个 Agent 是可行的,但需要重复维护:同一个技能与底层 MCP 服务器在每种客户端里都一样,但围绕它们的打包方式不同,导致要为每个 Agent 维护独立的 manifest 与目录结构。Agent Plugins 1.0 把技能和 MCP 服务器标准化到同一个包里,兼容客户端可以从同一份插件中发现它们支持的技能与 MCP 配置,例如一个「部署 runbook + 对应工具集成」可以被复用为部署技能与其 MCP 服务器。
构建或迁移插件
规范 对采用它的插件主要是 manifest 层面的工作:在 plugin.json 中加上 $schema;把技能放在 skills/ 目录、MCP 配置放在 mcp.json;把 Copilot 专属文件移入 com.github.copilot/ 目录,其他客户端会忽略该目录。最后一步是让插件可移植的关键——规范标准化了技能与 MCP 服务器,而 Copilot 独有的能力(自定义 Agent、命令、规则、hooks)放在命名空间目录里,仍会在 VS Code、Copilot CLI 与 Copilot App 中加载;CLI 与 App 还能加载画布(canvases)等扩展。参考 插件作者文档 与 示例插件 可以快速上手。
用现有设置治理插件
随着插件跨工具可移植,组织需要统一管理哪些插件对开发者可用。Copilot Business 与 Enterprise 客户可以用既有的企业级托管设置,覆盖 VS Code、Copilot CLI、GitHub Copilot App 与 Copilot 云端 Agent。在 managed-settings.json 中,用 enabledPlugins 自动安装或阻止特定插件,用 extraKnownMarketplaces 添加可用的市场,用 strictKnownMarketplaces 把安装限制在受托管市场。插件也可以携带 MCP 服务器配置,因此可与 MCP 白名单配合,按 URL、命令或名称批准或阻止单个服务器。详细可见 About plugins 文档。
生态与市场
插件可以从 Awesome Copilot 市场 安装,该市场在 VS Code、Copilot CLI 与 Copilot App 中默认可用。已有的不针对 Agent Plugins 1.0 的 GitHub Copilot 插件仍受支持,无需迁移。需要说明的是,Agent Plugins 1.0 是围绕"技能 + MCP 服务器打包"的互操作标准,它不改变各 Agent 自身的能力边界,也不代表插件内容经过某厂商的资质审核;开发者在采用第三方插件时,仍应关注其来源与权限范围。
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
17GB对100GB:Qwen3.8-27B与Flash-Next做同一批任务,省下的容量换来了什么?
同做89项终端任务,17GB的27B首轮完成35项,100GB的Flash-Next完成45项;最多两次是46对53,最多四次是48对60。本文追到9月13日后续结果,区分模型能力、环境故障和返工时间;测试为苹果MLX四位量化,不是GSQ-RCO IQ3_S,也不能套到16GB显卡。
Qwen3.8-Flash-Next每秒70词元?本地加速之前,先看模型究竟改了什么
同样叫Flash-Next,70词元/秒背后可能是另一条计算路径:每词元激活专家从10减到5,再训练共享专家补偿。本文对照单台DGX Spark的两套原始资料,拆开量化、MTP、输入速度、输出速度和并发吞吐,不把128GB统一内存结果套到16GB显卡。
NVIDIA PAIR:把家里的 RTX、DGX Spark 和 Mac 变成本地 AI 请求集群,但它不是“显存池化”
可以把 NVIDIA PAIR 理解成家里本地 AI 的“派单前台”:RTX 主机、DGX Spark、Mac 就像几名能力不同的员工,PAIR 看谁在线、谁装了对应模型、谁现在最空闲,就把下一份 AI 工作交给谁。它特别适合多 Agent 并发,但不会把 16GB + 24GB 显存拼成 40GB,也不会把一个大模型拆到多台机器上。