谷歌发布 Gemini Robotics ER 2:打造机器人的“超级大脑”,支持多机协作与原生工具调用

Google 正式推出了 Gemini Robotics ER 2,这是目前最强大的机器人“具身推理”模型。该模型被定位为机器人的高级大脑,旨在赋予机器人与人类自然交流、深度理解物理世界以及自主规划多步骤任务的能力。与传统的端到端控制模型不同,ER 2 采用了分层架构,专注于高层逻辑推理,将具体的运动执行移交给底层的视觉-语言-动作(VLA)模型,实现了认知与执行的解耦。在技术升级方面,ER 2 能够原生调用 Google 搜索及自定义功能以获取实时信息,并支持机器人在执行动作的同时持续“思考”后续步骤。相比前代 ER 1.6,新模型通过持续视频理解追踪任务进展,实现了更强的自我纠错能力。此外,谷歌还引入了多机器人协作技术,使机器团队能在共享空间中协同完成复杂工作流。目前,该模型已通过 Gemini API、Google AI Studio 及企业级智能体平台开启私密预览。

事件分析

Gemini Robotics ER 2 的发布体现了具身智能从单一模态向分层架构演进的重要趋势。通过将负责逻辑规划的“大脑”与负责运动控制的“反射神经”分离,该架构有效解决了机器人在处理长链条、复杂任务时的推理深度与反应速度平衡问题。技术上看,原生工具调用与多机协作功能的加入,补齐了机器人从单体智能向群体智能演进的关键短板。产业层面,谷歌利用 Gemini 强大的多模态理解能力切入机器人领域,不仅降低了机器人开发门槛,更展示了通用大模型作为物理世界通用操作系统的潜力,未来有望推动工业与服务机器人在非结构化环境中的大规模落地。

💡 核心观点:谷歌 ER 2 将“慢思考”与“快执行”分层,标志着具身智能正从单一的感知驱动迈向具备复杂规划与协作能力的“推理时代”。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册