0
0
0
0
北京时间 7 月 30 日,Google DeepMind 正式对外推出新一代机器人模型套件Gemini Robotics 2。本次更新最核心里程碑:依托视觉 - 语言 - 动作(VLA)模型,首次实现人形机器人全身一体化集中控制,打通双腿、躯干、双臂、灵巧手指全部自由度,有望打破长期困扰人形机器人行业的控制架构难题。
长久以来,全球人形机器人普遍采用分离式控制架构:行走平衡、全身运动由独立运动控制器负责,手臂抓取、灵巧操作依靠另一套策略系统。两套模块独立运行,需要额外调度模块相互配合。
这种 “拼接式方案” 在标准化演示场景尚可稳定运行,但在非结构化真实环境中极易出现协同失调,机器人很难流畅完成 “一边移动、一边操作物体” 的复合任务。同时,机器人控制策略大多针对单一硬件定制,跨机型迁移成本极高。
而上一代 Gemini Robotics 仅支持机器人上半身桌面作业,无法驱动全身运动。全新 Gemini Robotics 2 将全身运动与精细操作纳入同一套 AI 模型统一调度,实现从足部到指尖的一体化决策。
在官方演示中,该模型搭载 Apptronik Apollo 2 人形机器人,接收自然语言指令后自主完成跨房间移动、避障、下蹲拾取物品、精准放置等连贯动作;同时支持旋拧灯泡、密封包装袋等精细灵巧操作,实现移动与操作无缝联动。
完整的 Gemini Robotics 2 由三大模型组成,形成分层协同的具身智能体系:
✅ Gemini Robotics 2(核心 VLA 模型)
整套系统的运动执行核心。接收视觉图像与自然语言指令,直接输出全身关节电机控制信号。支持完整人形机器人、双臂机器人,兼顾全身移动与末端灵巧操作,同一权重可适配多款不同硬件平台。
✅ Gemini Robotics ER 2(具身推理模型)
机器人高层 “规划大脑”。负责环境理解、长时序多步骤任务拆解,支持持续数分钟的复杂任务;具备任务断点识别、进度追踪能力,执行出错时可从失败节点恢复任务,同时支持多机器人协同分工。
✅ Gemini Robotics On-Device 2(端侧轻量化模型)
未来,随着全身统一控制方案持续优化,人形机器人或将摆脱 “行走、操作二选一” 的限制,真正能够在家庭、工厂等复杂场景完成多样化复合任务。