---
url: /robotics/what_is_gemini_robotics.md
description: >-
  Gemini Robotics 2 是谷歌 DeepMind 的机器人基础模型，首次实现人形机器人从脚趾到指尖的全身控制，支持 22
  自由度灵巧手、多机协作，ER 2 已在 Google AI Studio 和 Gemini API 公开预览。
---

# 一分钟带你了解什么是Gemini Robotics

先说一个你可能没意识到的事实。

过去十年，机器人圈演示视频有个心照不宣的套路：**镜头永远只拍上半身。**

一张桌子，一双机械臂，叠个衣服、倒杯水、把方块放进洞里。为什么不拍腿？因为一旦机器人要走路、要弯腰、要蹲下去够低处的东西，控制系统就崩了——上半身抓取和下半身平衡，是两套完全不同的算法，中间靠工程师手写规则硬接。

2026 年 7 月 30 日，谷歌 DeepMind 发布 **Gemini Robotics 2**，把这堵墙拆了。

一个模型，从脚趾控到指尖。

## Gemini Robotics 是什么

Gemini Robotics 是谷歌 DeepMind 面向机器人的基础模型系列，本质上是把 Gemini 的多模态理解能力，接到了物理世界的电机上。

它解决的是机器人行业最拧巴的一个矛盾：**过去每台机器人都得为一个特定任务单独训练**，换个场景、换个本体，一切推倒重来。而 Gemini Robotics 想做的是"机器人界的安卓"——硬件厂商专心做身体，大脑交给基础模型。

> 上一代 Gemini Robotics 只能控制上半身完成桌面任务。这一代最关键的变化是：一个 VLA（视觉-语言-动作）模型，首次实现了对完整人形机器人的控制，并且在多个形态迥异的硬件平台之间共用同一份权重。

这次发布的不是一个模型，是**三个**，分工明确：

| 模型 | 角色 | 定位 | 状态 |
|---|---|---|---|
| **Gemini Robotics 2** | 小脑 | VLA 模型，把视觉+语言直接转成电机控制信号 | 私有预览 |
| **Gemini Robotics ER 2** | 大脑 | 具身推理模型，负责空间理解、多步规划、多机调度 | **公开预览**（AI Studio + Gemini API） |
| **Gemini Robotics On-Device 2** | 本地版 | 轻量 VLA，直接跑在机器人硬件上，不依赖云 | 私有预览 |

大脑想，小脑做。ER 2 规划完"把苹果放进碗里"，拆成定位、抓取、放置三步，再把动作交给 VLA 执行。妙的是 ER 2 的设计允许机器人**边做边想**——执行当前动作的同时，已经在盘算下一步了。

## 它到底强在哪

* **全身智能控制**：从脚到指尖的完整自由度。会动态调整重心，所以机器人能安全地迈步、下蹲、弯腰，在杂乱的真实空间里挪动，而不是杵在原地伸手
* **22 自由度灵巧手**：能拧灯泡、系垃圾袋、打结。这类活儿以前是具身智能的天花板，因为需要力度反馈和指尖级微调
* **跨本体迁移**：适配一台新的双臂机器人，只要**几小时**。端侧版本更狠——**不到 200 条示例数据**就能迁移到新平台
* **多机协作**：两台机器人能互相通信，识别彼此的物理特长，自主分工完成单机干不了的活
* **任务级持久性**：ER 2 能管理数分钟级的长任务，中途监控进度、失败了自己重来
* **会说人话**：干活的时候能解释自己在干嘛，你也能用大白话中途改主意，不需要技术术语
* **能用工具**：ER 2 可以调 Google 搜索、日历这类工具来补充对环境的理解——机器人也开始上网查资料了

## 真实场景里跑成什么样

**Apptronik Apollo 2 人形机器人**是这次的主力演示平台。

给它一句指令："把浇水壶放到底层货架的绿色垃圾桶里。" 然后 Apollo 2 自己**穿过整个房间**，找到浇水壶，抓起来，蹲下身，放进低处的桶。全程没有分段脚本，一句话到底。

配上五指 SharpaWave 仿人手之后，它还能拧灯泡、系垃圾袋。换成工业常见的平行夹爪，就去做精密插件装配和物品打包——同一个模型，换只手就换个工种。

硬件伙伴阵容也值得一提：**Apptronik、Boston Dynamics、Agile Robots**，再加上 100 多家"可信测试者"，从企业自动化巨头到机器人创业公司都在里面。波士顿动力那种级别的老牌厂商愿意把大脑外包，本身就是个信号。

至于安全，DeepMind 这次推了个叫 **ASIMOV-Agentic** 的基准测试（名字致敬阿西莫夫，不用我多说），专门评估三件事：机器人会不会拒绝不安全的操作、能不能判断任务是否可以安全完成、知不知道什么时候该喊人类来。ER 2 还带人体感知——有人走进作业区，自动安全停机。

## 上手：普通开发者能玩的那部分

好消息是，三个模型里**最有意思的 ER 2 是公开预览的**，你现在就能用。没有机器人？没关系，ER 2 输出的是文本（坐标、规划、判断），一张图片就能测它的空间推理能力。

模型 ID 有两个：

* `gemini-robotics-er-2-preview`：标准版，基于 Gemini 3.5 Flash，强化了空间推理、视频时刻查找、多机器人编排
* `gemini-robotics-er-2-streaming-preview`：流式版，走 Live API，为低延迟机器人 Agent 优化，吃连续音视频流

来个最直观的例子——让它指出图片里的物体在哪：

```python
from google import genai

PROMPT = """
Point to no more than 10 items in the image. The label returned
should be an identifying name for the object detected.
The answer should follow the json format: [{"point": <point>,
"label": <label1>}, ...]. The points are in [y, x] format
normalized to 0-1000.
"""

client = genai.Client()
uploaded_file = client.files.upload(file="my-image.png")

image_response = client.interactions.create(
    model="gemini-robotics-er-2-preview",
    input=[
        {
            "type": "image",
            "uri": uploaded_file.uri,
            "mime_type": uploaded_file.mime_type
        },
        {"type": "text", "text": PROMPT}
    ],
    generation_config={"thinking_level": "high"},
)

print(image_response.output_text)
```

返回长这样：

```json
[
  {"point": [376, 508], "label": "small banana"},
  {"point": [287, 609], "label": "larger banana"}
]
```

坐标是归一化到 0-1000 的 `[y, x]`。别小看这个"指一下"，它是所有抓取动作的起点——机器人得先知道东西在哪，才谈得上伸手。

除了指向，ER 2 还支持边界框检测、轨迹规划、任务编排（把长任务拆成子任务并调用你自己的机器人 API）。

三个坑提前说：

1. **API 密钥必须加限制**，无限制的 key 会直接吃 `403 Forbidden`，去 AI Studio 里配一下
2. **`thinking_level` 别无脑拉满**，`high` 延迟明显上升，日常用 `medium` 平衡就好
3. **老版本要停用了**：`gemini-robotics-er-1.6-preview` 将在**八月底下线**，还在用的赶紧换过来

顺便提一句流式版的限制：它不支持缓存、代码执行、结构化输出和 URL 上下文，只保留 Live API、函数调用、搜索接地和思考能力。选型前看清楚。

## 写在最后

具身智能这条赛道，2024 年大家比"能不能抓起来"，2025 年比"抓得稳不稳"，到 2026 年，问题变成了\*\*"能不能听懂一句话，然后自己走过去把整件事办完"\*\*。

Gemini Robotics 2 的意义不在于哪个 benchmark 又涨了几个点，而在于它把机器人的"大脑"和"身体"正式解耦了。硬件厂商不用再养一整支 AI 团队，中小机器人公司也能直接接通用基础模型进工业和服务场景——这个门槛的下降，可能比任何一段演示视频都重要。

当然，泼一盆冷水：VLA 模型目前还是私有预览，真机部署离普通开发者还有距离。但 ER 2 已经在 AI Studio 里躺着了，免费的。

**去传张你家客厅的照片，让它指指看沙发在哪。** 那一瞬间你会突然理解，为什么这帮人觉得机器人的 iPhone 时刻快到了。

## 进阶

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
