← 返回内容列表

Gemini Robotics 2:Google 让机器人拥有了全身智能

Gemini Robotics 2:Google 让机器人拥有了全身智能

Google DeepMind发布Gemini Robotics 2,将大模型能力拓展到物理世界。机器人不再只是抓取,而是能理解复杂的物理交互,进行全身协调操作。

从"看到"到"做到"

传统的机器人系统有一个明显的"脑体分离"问题:视觉系统负责"看",规划系统负责"想",控制系统负责"动",三个模块各自为政。这就像一个指挥体系里,眼睛看到的信息要通过三层转述才能到达手脚——延迟、误差、理解偏差不可避免。

Gemini Robotics 2 的核心突破是将视觉理解、任务规划和运动控制统一到一个模型中。它不再需要分别训练三个模块,而是端到端地从像素直接输出关节指令。这得益于 Gemini 2.0 的多模态基座能力——模型天然就能处理图像、文本、3D空间信息。

"全身智能"是什么概念

过去的机器人操作大多是"手臂智能"——伸出机械臂、抓取、放置。这在流水线场景下够用,但一旦需要全身协调(比如弯腰捡东西、侧身通过窄门、双手配合搬运不规则物体),传统的分步规划就力不从心了。

Gemini Robotics 2 的"全身智能"(Whole-Body Intelligence)意味着机器人能综合考虑全身所有关节的状态,找到最优解。就像人类不会单独思考"先迈左脚还是右脚",而是自然地协调全身——这种"直觉"正是大模型最擅长捕捉的模式。

为什么现在?

机器人领域的"ChatGPT 时刻"一直在被预言却从未真正到来。但有几个信号表明这次不同:

  • 数据飞轮:每台运行的机器人都产生新的训练数据
  • 多模态融合:视觉-语言-动作的联合建模已经成熟
  • 硬件成本:传感器和执行器成本持续下降

从爱因斯坦提出光量子假说等了20年才被接受,到AI大模型从理论到产品仅用了几年——技术的加速度正在改变一切。

关联推荐

评论 (0)

加载评论中…

Gemini Robotics 2:Google 让机器人拥有了全身智能 | 必学必会