Agentic AI 综述提出 Agent 架构与评估分类
一篇综述把 Agentic AI 拆成感知、规划、行动、工具使用和协作等模块,为企业理解 Agent 系统提供了更清晰的框架。
Agentic AI 综述:从感知、规划到工具使用,重新整理 LLM Agent 架构
arXiv 论文《Agentic Artificial Intelligence (AI): Architectures, Taxonomies, and Evaluation of Large Language Model Agents》提交于 2026 年 1 月 18 日,作者试图为快速扩张的 LLM Agent 生态提供一套更统一的架构分类和评估视角。
论文指出,AI 正在从只生成文本的模型,转向能感知、推理、规划和行动的 Agentic AI。大语言模型不再只是被动知识引擎,而是逐渐成为 cognitive controller,结合 memory、tool use 和来自环境的 feedback,追求更长目标。
论文要解决的是 Agent 形态混乱问题
当前 Agent 生态的问题之一,是设计形态太多。从简单的 single-loop agents,到 hierarchical multi-agent systems,不同系统在感知、记忆、规划、工具调用和协作方式上差异很大。
论文认为,这种多样性使 Agentic AI 领域变得难以导航。对于研究者和工程团队来说,如果没有统一分类,很容易把“会调用工具的聊天机器人”“多代理协作系统”“能操作电脑的自动化 Agent”混在一起讨论。
因此,这篇论文的目标不是提出一个单独的新 Agent 系统,而是对已有架构进行梳理,给出更清晰的 taxonomy 和 evaluation 视角。
六个模块构成 Agent 分类框架
论文提出的统一 taxonomy 将 Agent 拆分为六个核心模块:Perception、Brain、Planning、Action、Tool Use 和 Collaboration。
Perception 负责从环境中接收信息;Brain 可以理解为 Agent 的核心认知和推理组件;Planning 处理任务分解和行动路径;Action 负责执行;Tool Use 连接外部 API、软件和工具;Collaboration 则覆盖多 Agent 或人机协作场景。
这个框架的价值在于,它把 Agent 从一个模糊概念拆成可比较的组成部分。一个系统如果只是能回答问题,可能只有 Brain;如果能调用工具但没有长期规划,Planning 仍然薄弱;如果多个 Agent 能分工协作,Collaboration 才成为关键能力。
MCP 和 Native Computer Use 被放进工具演化脉络
论文还用这套视角描述 Agent 从线性 reasoning procedures 转向 native inference-time reasoning models 的过程,并讨论从固定 API 调用到更开放标准的转变。
其中,Model Context Protocol(MCP)和 Native Computer Use 被作为重要方向提及。MCP 代表更标准化的上下文和工具连接方式,Native Computer Use 则代表 Agent 直接操作数字环境的能力。
这说明 Agentic AI 的演进不只是模型内部推理变强,也包括外部工具连接方式的变化。Agent 要真正执行任务,必须能稳定连接文件、软件、网页、数据库、API 和其他环境,而不是只在聊天窗口中给出建议。
评估难点来自行动中的幻觉和无限循环
论文还综述了当前 Agent 评估实践,并指出若干开放挑战,包括 hallucination in action、infinite loops 和 prompt injection。
这些问题都和普通文本生成中的幻觉不同。Agent 一旦能行动,错误输出就不只是“说错一句话”,而可能变成错误操作、错误工具调用、错误修改文件,或在循环中不断消耗资源。
Prompt injection 也会因为工具使用和环境交互变得更复杂。Agent 读取网页、文档或外部数据时,可能把恶意指令误当成任务上下文,从而改变行为。这意味着 Agent 评估不能只看回答准确率,还要看执行安全、环境鲁棒性和任务终止能力。
这篇综述的实际价值
对产品和工程团队来说,这篇论文的价值在于降低概念混乱。与其笼统地说“我们要做 Agent”,不如先判断系统需要哪些能力模块:是否需要感知环境?是否需要长程规划?是否要调用工具?是否要多 Agent 协作?是否要操作真实软件?如何防止行动中的错误和注入攻击?
Agentic AI 的真正难点不在于给模型起一个 Agent 名字,而在于把感知、规划、行动、工具和协作这些能力组合成可控系统。论文提供的分类框架,可以作为理解和评估 LLM Agent 的基础地图。
参考来源
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
Copilot 代码审查接入 Agent Skills 与只读 MCP:团队规则如何进入 PR
GitHub 将 Copilot 代码审查中的 Agent Skills 与 MCP 支持从公开预览推进到正式可用,让任务型审查规则和问题跟踪、文档、服务目录等外部上下文进入 PR;但只读调用、评论归因和人工门禁仍有明确边界。
MCP 2026-07-28 转向无状态:GitHub Server 提前适配了什么
MCP 2026-07-28 稳定规范移除了协议会话与 initialize 握手,把连接上下文放回每次请求;GitHub MCP Server 的提前适配展示了无状态服务的工程收益,也说明兼容仍依赖版本协商、旧协议回退和一致性测试。
Copilot App 使用数据进入标准报表:能衡量采用,不能直接证明 ROI
GitHub 把 Copilot App 活动纳入企业、组织和用户级标准使用度量,新增用户活跃、会话、请求、Token、模型、语言与代码活动拆分;这些指标适合观察采用与覆盖,不应单独解释为生产力或 ROI。