论文比较 AI 编码 Agent 与人类开发者修改代码的差异
研究使用 GitHub PR 数据比较 AI Agent 和人类贡献者的提交差异,显示 Agent 生成的 PR 在提交数量、涉及文件和描述一致性上呈现不同特征。
大规模 PR 研究:AI 编码 Agent 修改代码的方式不同于人类开发者
arXiv 论文《How AI Coding Agents Modify Code: A Large-Scale Study of GitHub Pull Requests》研究的是 AI coding agents 在真实 GitHub pull requests 中如何修改代码。论文提交于 2026 年 1 月 24 日,并在 2026 年 4 月 6 日更新到 v3,已被 MSR 2026 Mining Challenge Track 接收。
作者使用 MSR 2026 Mining Challenge 版本的 AIDev 数据集,分析 24,014 个已合并的 Agentic PRs,包含 440,295 次 commits,同时对比 5,081 个已合并的 Human PRs,包含 23,242 次 commits。研究关注 additions、deletions、commit 数量、触及文件数量,以及 PR 描述与实际 diff 之间的一致性。
研究对象是真实合并 PR,而不是基准题
这篇论文的价值在于,它没有只看 coding agent 在 benchmark 上能不能解题,而是观察它们进入 GitHub 协作流程后的实际贡献形态。
AI coding agents 正在从代码补全工具变成更自主的贡献者:它们可以根据开发者提供的任务描述生成完整 PR。这和传统 Copilot 式补全不同,因为 Agent 不只是补几行代码,而是会提交一组变更、写 PR 描述、触及多个文件,并参与真实项目协作。
因此,研究重点不只是“Agent 能否写对代码”,而是它们写出来的 PR 和人类 PR 在规模、结构和描述方式上是否有系统差异。
Agentic PR 在 commit 数量上差异最明显
论文摘要显示,Agentic PRs 与 Human PRs 在 commit count 上有显著差异,Cliff's delta 为 0.5429。它们在触及文件数量和删除行数上也表现出中等程度差异。
这说明 AI Agent 生成的 PR 并不是简单复制人类开发者的提交模式。Agent 可能更倾向于用不同粒度组织改动,或者在任务执行过程中产生更多结构化提交。
对团队来说,这类差异会影响代码审查体验。一个 PR 的 commit 数量、触及文件范围和改动行数,都会影响 reviewer 判断任务复杂度、风险范围和审查成本。如果 Agentic PR 的形态系统性不同,团队就需要重新调整 review 预期。
PR 描述与 diff 的一致性略高
论文还评估了 PR descriptions 与 diffs 之间的一致性,包括 lexical 和 semantic similarity。摘要显示,Agentic PRs 在所有度量上都表现出略高的 description-to-diff similarity。
这可能反映出 Agent 在生成 PR 描述时,更容易直接围绕实际 diff 总结改动。相比人类开发者,有些人类 PR 描述可能更简略、更口语化,或者遗漏部分细节;Agent 则可能因为自动读取 diff 和生成说明,在文本一致性上更稳定。
不过,一致性更高并不等于质量一定更高。它只能说明 PR 描述和代码差异之间更接近,不能直接证明实现正确、设计合理或维护成本更低。这也是团队不能只依赖自动描述的原因。
这类研究会改变团队看待 AI 贡献的方式
这篇论文给出的不是一个工具结论,而是一种观察视角:AI coding agents 进入开源协作后,会在 PR 层面留下可测量的行为差异。
这对仓库维护者和企业研发团队都有现实意义。未来团队可能需要区分 Agentic PR 和 Human PR,设置不同的审查策略。例如,Agentic PR 如果触及更多文件或提交结构不同,就需要更重视自动测试、影响范围分析和人工 review。
对研究者来说,这类数据也会影响软件工程研究本身。如果不区分人类 PR 和 Agentic PR,未来分析开发效率、贡献者行为或开源协作模式时,可能会把 AI 工具带来的变化误读为人类行为变化。
参考来源
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
Copilot 代码审查接入 Agent Skills 与只读 MCP:团队规则如何进入 PR
GitHub 将 Copilot 代码审查中的 Agent Skills 与 MCP 支持从公开预览推进到正式可用,让任务型审查规则和问题跟踪、文档、服务目录等外部上下文进入 PR;但只读调用、评论归因和人工门禁仍有明确边界。
MCP 2026-07-28 转向无状态:GitHub Server 提前适配了什么
MCP 2026-07-28 稳定规范移除了协议会话与 initialize 握手,把连接上下文放回每次请求;GitHub MCP Server 的提前适配展示了无状态服务的工程收益,也说明兼容仍依赖版本协商、旧协议回退和一致性测试。
Copilot App 使用数据进入标准报表:能衡量采用,不能直接证明 ROI
GitHub 把 Copilot App 活动纳入企业、组织和用户级标准使用度量,新增用户活跃、会话、请求、Token、模型、语言与代码活动拆分;这些指标适合观察采用与覆盖,不应单独解释为生产力或 ROI。