Google Gemini Robotics 把 Agent 能力带入物理世界
Google DeepMind 展示 Gemini Robotics,强调机器人可感知、推理、使用工具并执行真实世界任务。
Gemini Robotics:Google DeepMind 把 Gemini 能力延伸到物理 Agent
Google DeepMind 的 Gemini Robotics 页面将其定位为面向 physical agents 的系统,目标是让机器人主动理解环境,并在真实世界中执行任务。页面中写到,Gemini Robotics models 可以让不同形状和尺寸的机器人感知、推理、使用工具并与人类互动,同时解决广泛的复杂真实世界任务,包括一些训练中没有见过的任务。
这和普通多模态模型有明显区别。普通 Gemini 模型可以处理文本、图像、音频和视频;Gemini Robotics 增加的是对物理空间的推理和行动能力,让机器人不仅理解输入,还能把理解转化为动作。
Gemini Robotics 面向“理解并行动”的机器人任务
Google DeepMind 在页面中强调,Gemini Robotics 可以 reasoning through multi-step complex tasks,并做出行动计划,然后自主完成每一步。这说明它关注的是连续任务,而不是单次识别或单次机械动作。
页面列出的能力包括 generality、agentic、thinking、interactivity、dexterity 和 multiple embodiments。Generality 强调模型能理解物理世界,适应新情况,并把目标拆成可管理步骤;Agentic 指机器人可以自主调用 Google Search 等数字工具来解决复杂任务;Thinking 强调机器人可以在行动前思考,并用自然语言让决策过程更透明。
这些能力合起来,指向的是更完整的物理 Agent:它需要理解环境、规划步骤、调用工具、执行动作,并在人类指令或环境变化时调整行为。
真实世界任务比网页和代码任务更复杂
Gemini Robotics 页面展示的 hands-on 任务覆盖多个方向:agentic capabilities、thinking while acting、learning across embodiments、embodied reasoning、generality in action、dynamic interactions、与 Apptronik 合作、dexterous skills。
这些任务说明,物理世界的 Agent 不只是“会说会看”。例如,机器人需要完成长步骤任务,不需要每一步都由用户重新下指令;需要把不同机器人形态之间学到的动作迁移;需要处理动态交互,并在环境发生变化时快速调整。
这类任务比网页 Agent 和代码 Agent 更难,因为真实世界没有轻量级 undo。一个错误动作可能导致物体损坏、安全风险或任务失败。机器人还需要处理传感器噪声、物体位置变化、复杂手部操作和人类即时干预。
双模型路线区分动作执行和具身推理
Google DeepMind 在页面中说明,Gemini Robotics 采用 dual-model approach,将 vision-language-action(VLA)模型和 embodied reasoning(ER)模型配对使用。
Gemini Robotics 1.5 被描述为最强 VLA 模型,可以“see、understand、act”,把视觉输入和用户提示转化为 motor commands 来执行任务。Gemini Robotics-ER 1.6 则被描述为 advanced embodied reasoning model,用于帮助机器人更精确地理解物理世界、规划复杂任务并做出逻辑决策。
此外,Gemini Robotics On-Device 被描述为优化到可在机器人设备本地运行的 VLA 模型,开发者可以适配模型以提升自身应用表现。这个组合显示,Google 并没有把物理 Agent 简化成一个通用模型,而是区分了动作执行、具身推理和本地运行三类需求。
合作伙伴和测试者决定模型能否进入真实机器人生态
Google DeepMind 页面还列出 Collaborations。Google 正与 Apptronik 合作构建下一代 humanoid robots,并与 60 多个 trusted testers 合作,指导 Gemini Robotics-ER 的未来方向。
页面列出的伙伴包括 Apptronik、Boston Dynamics、Agile Robots、Agility Robotics、Enchanted Tools、PAL Robotics、Rainbow Robotics、Collaborative Robotics、Universal Robots 等。合作伙伴覆盖人形机器人、双臂平台、工业机械臂和不同形态机器人,这与页面中 “multiple embodiments” 的能力定位相互对应。
这说明 Gemini Robotics 的落地不只取决于模型,也取决于能否在不同硬件形态、不同任务环境和不同安全要求下被测试和适配。
这次动态的实际看点
Gemini Robotics 的重点不是让机器人会聊天,而是让 AI 模型进入物理执行链条。它把感知、语言理解、计划、工具使用、动作执行和人类交互连接到一起,尝试让机器人处理更长、更开放的真实世界任务。
对开发者和企业来说,后续更值得关注的是几个问题:Gemini Robotics 的 SDK 何时更广泛开放;On-Device 模型在本地机器人设备上能达到什么效果;不同机器人形态之间的迁移能力是否稳定;以及安全机制能否支撑更复杂的人机共处场景。
参考来源
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
Copilot 代码审查接入 Agent Skills 与只读 MCP:团队规则如何进入 PR
GitHub 将 Copilot 代码审查中的 Agent Skills 与 MCP 支持从公开预览推进到正式可用,让任务型审查规则和问题跟踪、文档、服务目录等外部上下文进入 PR;但只读调用、评论归因和人工门禁仍有明确边界。
MCP 2026-07-28 转向无状态:GitHub Server 提前适配了什么
MCP 2026-07-28 稳定规范移除了协议会话与 initialize 握手,把连接上下文放回每次请求;GitHub MCP Server 的提前适配展示了无状态服务的工程收益,也说明兼容仍依赖版本协商、旧协议回退和一致性测试。
Copilot App 使用数据进入标准报表:能衡量采用,不能直接证明 ROI
GitHub 把 Copilot App 活动纳入企业、组织和用户级标准使用度量,新增用户活跃、会话、请求、Token、模型、语言与代码活动拆分;这些指标适合观察采用与覆盖,不应单独解释为生产力或 ROI。