Google Gemini Robotics 把 Agent 能力带入物理世界

Google DeepMind 展示 Gemini Robotics,强调机器人可感知、推理、使用工具并执行真实世界任务。

浏览 11
Google Gemini Robotics 把 Agent 能力带入物理世界封面

Gemini Robotics:Google DeepMind 把 Gemini 能力延伸到物理 Agent

Google DeepMind 的 Gemini Robotics 页面将其定位为面向 physical agents 的系统,目标是让机器人主动理解环境,并在真实世界中执行任务。页面中写到,Gemini Robotics models 可以让不同形状和尺寸的机器人感知、推理、使用工具并与人类互动,同时解决广泛的复杂真实世界任务,包括一些训练中没有见过的任务。

这和普通多模态模型有明显区别。普通 Gemini 模型可以处理文本、图像、音频和视频;Gemini Robotics 增加的是对物理空间的推理和行动能力,让机器人不仅理解输入,还能把理解转化为动作。

Gemini Robotics 面向“理解并行动”的机器人任务

Google DeepMind 在页面中强调,Gemini Robotics 可以 reasoning through multi-step complex tasks,并做出行动计划,然后自主完成每一步。这说明它关注的是连续任务,而不是单次识别或单次机械动作。

页面列出的能力包括 generality、agentic、thinking、interactivity、dexterity 和 multiple embodiments。Generality 强调模型能理解物理世界,适应新情况,并把目标拆成可管理步骤;Agentic 指机器人可以自主调用 Google Search 等数字工具来解决复杂任务;Thinking 强调机器人可以在行动前思考,并用自然语言让决策过程更透明。

这些能力合起来,指向的是更完整的物理 Agent:它需要理解环境、规划步骤、调用工具、执行动作,并在人类指令或环境变化时调整行为。

真实世界任务比网页和代码任务更复杂

Gemini Robotics 页面展示的 hands-on 任务覆盖多个方向:agentic capabilities、thinking while acting、learning across embodiments、embodied reasoning、generality in action、dynamic interactions、与 Apptronik 合作、dexterous skills。

这些任务说明,物理世界的 Agent 不只是“会说会看”。例如,机器人需要完成长步骤任务,不需要每一步都由用户重新下指令;需要把不同机器人形态之间学到的动作迁移;需要处理动态交互,并在环境发生变化时快速调整。

这类任务比网页 Agent 和代码 Agent 更难,因为真实世界没有轻量级 undo。一个错误动作可能导致物体损坏、安全风险或任务失败。机器人还需要处理传感器噪声、物体位置变化、复杂手部操作和人类即时干预。

双模型路线区分动作执行和具身推理

Google DeepMind 在页面中说明,Gemini Robotics 采用 dual-model approach,将 vision-language-action(VLA)模型和 embodied reasoning(ER)模型配对使用。

Gemini Robotics 1.5 被描述为最强 VLA 模型,可以“see、understand、act”,把视觉输入和用户提示转化为 motor commands 来执行任务。Gemini Robotics-ER 1.6 则被描述为 advanced embodied reasoning model,用于帮助机器人更精确地理解物理世界、规划复杂任务并做出逻辑决策。

此外,Gemini Robotics On-Device 被描述为优化到可在机器人设备本地运行的 VLA 模型,开发者可以适配模型以提升自身应用表现。这个组合显示,Google 并没有把物理 Agent 简化成一个通用模型,而是区分了动作执行、具身推理和本地运行三类需求。

合作伙伴和测试者决定模型能否进入真实机器人生态

Google DeepMind 页面还列出 Collaborations。Google 正与 Apptronik 合作构建下一代 humanoid robots,并与 60 多个 trusted testers 合作,指导 Gemini Robotics-ER 的未来方向。

页面列出的伙伴包括 Apptronik、Boston Dynamics、Agile Robots、Agility Robotics、Enchanted Tools、PAL Robotics、Rainbow Robotics、Collaborative Robotics、Universal Robots 等。合作伙伴覆盖人形机器人、双臂平台、工业机械臂和不同形态机器人,这与页面中 “multiple embodiments” 的能力定位相互对应。

这说明 Gemini Robotics 的落地不只取决于模型,也取决于能否在不同硬件形态、不同任务环境和不同安全要求下被测试和适配。

这次动态的实际看点

Gemini Robotics 的重点不是让机器人会聊天,而是让 AI 模型进入物理执行链条。它把感知、语言理解、计划、工具使用、动作执行和人类交互连接到一起,尝试让机器人处理更长、更开放的真实世界任务。

对开发者和企业来说,后续更值得关注的是几个问题:Gemini Robotics 的 SDK 何时更广泛开放;On-Device 模型在本地机器人设备上能达到什么效果;不同机器人形态之间的迁移能力是否稳定;以及安全机制能否支撑更复杂的人机共处场景。

参考来源

本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。

11