谷歌 DeepMind 推出 Gemini Robotics 2:赋予机器人全身协同与推理能力

<article class="article-content">

Google DeepMind 正式发布 Gemini Robotics 2,标志着具身智能从局部桌面操作迈向全身协同控制的关键阶段。针对传统机器人依赖预编程、环境适应性差及跨硬件迁移成本高的问题,Gemini Robotics 2 构建了统一的智能大脑,实现了从思考、行动到交互的全链路智能化。该系统由三个核心模型组成:负责底层控制的 Gemini Robotics 2 (VLA模型) 能将视觉与语言指令转化为全身及灵巧手的机械运动;充当高阶大脑的 Gemini Robotics ER 2 (ER推理模型) 负责长程任务规划、多机协作及人机沟通;而轻量化的 On-Device 2 模型则支持离线环境下的本地部署,并能利用极少样本快速适配新硬件。新模型打破了静态桌面操作的限制,实现了人形机器人全身协同,可完成行走、蹲下取物等复杂任务,并展现出高精细度的五指操作能力(如打结、密封袋口)。此外,该模型具备长达数分钟、数百次决策的长程推理与错误自纠能力,并引入了 ASIMOV-Agentic 基准以强化物理安全机制。

事件分析

技术架构层面,Gemini Robotics 2 确立了“分层具身智能”的工程范式。通过将负责实时运动控制的 VLA 模型与负责逻辑推理的 ER 模型解耦,有效解决了单一大模型在处理高频反射动作与长程认知规划时的算力冲突,为具身智能体的落地提供了可扩展的架构参考。在产业影响上,“全身协同”与“少样本迁移”能力的突破,意味着机器人技术正从单一的专用机械臂向通用人形机器人平台演进。这种能快速适配不同形态硬件(如 Apollo 2、SharpaWave 手)的能力,极大地降低了硬件厂商的软件开发门槛,有助于解决具身智能领域“软硬适配”的落地难题。同时,引入专门的 ASIMOV-Agentic 安全评估基准,反映出随着智能体进入物理世界,行业对风险控制与伦理合规的重视正在显著提升。

💡 核心观点:Gemini Robotics 2 以“分层大脑”架构实现全身协同,正推动具身智能从专用机械臂向通用物理智能体跨越。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册