1/ 1
  • 0
  • 0
  • 0
  • 0
Google DeepMind

北京时间 7 月 30 日,Google DeepMind 正式对外推出新一代机器人模型套件Gemini Robotics 2。本次更新最核心里程碑:依托视觉 - 语言 - 动作(VLA)模型,首次实现人形机器人全身一体化集中控制,打通双腿、躯干、双臂、灵巧手指全部自由度,有望打破长期困扰人形机器人行业的控制架构难题。

 

长久以来,全球人形机器人普遍采用分离式控制架构:行走平衡、全身运动由独立运动控制器负责,手臂抓取、灵巧操作依靠另一套策略系统。两套模块独立运行,需要额外调度模块相互配合。

这种 “拼接式方案” 在标准化演示场景尚可稳定运行,但在非结构化真实环境中极易出现协同失调,机器人很难流畅完成 “一边移动、一边操作物体” 的复合任务。同时,机器人控制策略大多针对单一硬件定制,跨机型迁移成本极高。

而上一代 Gemini Robotics 仅支持机器人上半身桌面作业,无法驱动全身运动。全新 Gemini Robotics 2 将全身运动与精细操作纳入同一套 AI 模型统一调度,实现从足部到指尖的一体化决策。

在官方演示中,该模型搭载 Apptronik Apollo 2 人形机器人,接收自然语言指令后自主完成跨房间移动、避障、下蹲拾取物品、精准放置等连贯动作;同时支持旋拧灯泡、密封包装袋等精细灵巧操作,实现移动与操作无缝联动。

 

完整的 Gemini Robotics 2 由三大模型组成,形成分层协同的具身智能体系:

✅ Gemini Robotics 2(核心 VLA 模型)

整套系统的运动执行核心。接收视觉图像与自然语言指令,直接输出全身关节电机控制信号。支持完整人形机器人、双臂机器人,兼顾全身移动与末端灵巧操作,同一权重可适配多款不同硬件平台。

✅ Gemini Robotics ER 2(具身推理模型)

机器人高层 “规划大脑”。负责环境理解、长时序多步骤任务拆解,支持持续数分钟的复杂任务;具备任务断点识别、进度追踪能力,执行出错时可从失败节点恢复任务,同时支持多机器人协同分工。

✅ Gemini Robotics On-Device 2(端侧轻量化模型)

 

未来,随着全身统一控制方案持续优化,人形机器人或将摆脱 “行走、操作二选一” 的限制,真正能够在家庭、工厂等复杂场景完成多样化复合任务。

1小时前 安徽

选择要@的好友

  • 😀
  • 😁
  • 😂
  • 😃
  • 😄
  • 😅
  • 😆
  • 😉
  • 😊
  • 😋
  • 😎
  • 😍
  • 😘
  • 😗
  • 😙
  • 😚
  • 😇
  • 😐
  • 😑
  • 😶
  • 😏
  • 😣
  • 😥
  • 😮
  • 😯
  • 😪
  • 😫
  • 😴
  • 😌
  • 😛
  • 😜
  • 😝
  • 😒
  • 😓
  • 😔
  • 😕
  • 😲
  • 😷
  • 😖
  • 😞
  • 😟
  • 😤
  • 😢
  • 😭
  • 😦
  • 😧
  • 😨
  • 😬
  • 😰
  • 😱
  • 😳
  • 😵
  • 😡
  • 😠