Google 正式推出了 Gemini Robotics ER 2,这是目前最强大的机器人“具身推理”模型。该模型被定位为机器人的高级大脑,旨在赋予机器人与人类自然交流、深度理解物理世界以及自主规划多步骤任务的能力。与传统的端到端控制模型不同,ER 2 采用了分层架构,专注于高层逻辑推理,将具体的运动执行移交给底层的视觉-语言-动作(VLA)模型,实现了认知与执行的解耦。在技术升级方面,ER 2 能够原生调用 Google 搜索及自定义功能以获取实时信息,并支持机器人在执行动作的同时持续“思考”后续步骤。相比前代 ER 1.6,新模型通过持续视频理解追踪任务进展,实现了更强的自我纠错能力。此外,谷歌还引入了多机器人协作技术,使机器团队能在共享空间中协同完成复杂工作流。目前,该模型已通过 Gemini API、Google AI Studio 及企业级智能体平台开启私密预览。
事件分析
💡 核心观点:谷歌 ER 2 将“慢思考”与“快执行”分层,标志着具身智能正从单一的感知驱动迈向具备复杂规划与协作能力的“推理时代”。
原文链接:Linux.do





