Google DeepMind 正式发布 Gemini Robotics 2,标志着具身智能从局部桌面操作迈向全身协同控制的关键阶段。针对传统机器人依赖预编程、环境适应性差及跨硬件迁移成本高的问题,Gemini Robotics 2 构建了统一的智能大脑,实现了从思考、行动到交互的全链路智能化。该系统由三个核心模型组成:负责底层控制的 Gemini Robotics 2 (VLA模型) 能将视觉与语言指令转化为全身及灵巧手的机械运动;充当高阶大脑的 Gemini Robotics ER 2 (ER推理模型) 负责长程任务规划、多机协作及人机沟通;而轻量化的 On-Device 2 模型则支持离线环境下的本地部署,并能利用极少样本快速适配新硬件。新模型打破了静态桌面操作的限制,实现了人形机器人全身协同,可完成行走、蹲下取物等复杂任务,并展现出高精细度的五指操作能力(如打结、密封袋口)。此外,该模型具备长达数分钟、数百次决策的长程推理与错误自纠能力,并引入了 ASIMOV-Agentic 基准以强化物理安全机制。
事件分析
💡 核心观点:Gemini Robotics 2 以“分层大脑”架构实现全身协同,正推动具身智能从专用机械臂向通用物理智能体跨越。
原文链接:Linux.do

评论前必须登录!
立即登录 注册