Skip to content

一分钟带你了解什么是Gemini Robotics

先说一个你可能没意识到的事实。

过去十年,机器人圈演示视频有个心照不宣的套路:镜头永远只拍上半身。

一张桌子,一双机械臂,叠个衣服、倒杯水、把方块放进洞里。为什么不拍腿?因为一旦机器人要走路、要弯腰、要蹲下去够低处的东西,控制系统就崩了——上半身抓取和下半身平衡,是两套完全不同的算法,中间靠工程师手写规则硬接。

2026 年 7 月 30 日,谷歌 DeepMind 发布 Gemini Robotics 2,把这堵墙拆了。

一个模型,从脚趾控到指尖。

Gemini Robotics 是什么

Gemini Robotics 是谷歌 DeepMind 面向机器人的基础模型系列,本质上是把 Gemini 的多模态理解能力,接到了物理世界的电机上。

它解决的是机器人行业最拧巴的一个矛盾:过去每台机器人都得为一个特定任务单独训练,换个场景、换个本体,一切推倒重来。而 Gemini Robotics 想做的是"机器人界的安卓"——硬件厂商专心做身体,大脑交给基础模型。

上一代 Gemini Robotics 只能控制上半身完成桌面任务。这一代最关键的变化是:一个 VLA(视觉-语言-动作)模型,首次实现了对完整人形机器人的控制,并且在多个形态迥异的硬件平台之间共用同一份权重。

这次发布的不是一个模型,是三个,分工明确:

模型角色定位状态
Gemini Robotics 2小脑VLA 模型,把视觉+语言直接转成电机控制信号私有预览
Gemini Robotics ER 2大脑具身推理模型,负责空间理解、多步规划、多机调度公开预览(AI Studio + Gemini API)
Gemini Robotics On-Device 2本地版轻量 VLA,直接跑在机器人硬件上,不依赖云私有预览

大脑想,小脑做。ER 2 规划完"把苹果放进碗里",拆成定位、抓取、放置三步,再把动作交给 VLA 执行。妙的是 ER 2 的设计允许机器人边做边想——执行当前动作的同时,已经在盘算下一步了。

它到底强在哪

  • 全身智能控制:从脚到指尖的完整自由度。会动态调整重心,所以机器人能安全地迈步、下蹲、弯腰,在杂乱的真实空间里挪动,而不是杵在原地伸手
  • 22 自由度灵巧手:能拧灯泡、系垃圾袋、打结。这类活儿以前是具身智能的天花板,因为需要力度反馈和指尖级微调
  • 跨本体迁移:适配一台新的双臂机器人,只要几小时。端侧版本更狠——不到 200 条示例数据就能迁移到新平台
  • 多机协作:两台机器人能互相通信,识别彼此的物理特长,自主分工完成单机干不了的活
  • 任务级持久性:ER 2 能管理数分钟级的长任务,中途监控进度、失败了自己重来
  • 会说人话:干活的时候能解释自己在干嘛,你也能用大白话中途改主意,不需要技术术语
  • 能用工具:ER 2 可以调 Google 搜索、日历这类工具来补充对环境的理解——机器人也开始上网查资料了

真实场景里跑成什么样

Apptronik Apollo 2 人形机器人是这次的主力演示平台。

给它一句指令:"把浇水壶放到底层货架的绿色垃圾桶里。" 然后 Apollo 2 自己穿过整个房间,找到浇水壶,抓起来,蹲下身,放进低处的桶。全程没有分段脚本,一句话到底。

配上五指 SharpaWave 仿人手之后,它还能拧灯泡、系垃圾袋。换成工业常见的平行夹爪,就去做精密插件装配和物品打包——同一个模型,换只手就换个工种。

硬件伙伴阵容也值得一提:Apptronik、Boston Dynamics、Agile Robots,再加上 100 多家"可信测试者",从企业自动化巨头到机器人创业公司都在里面。波士顿动力那种级别的老牌厂商愿意把大脑外包,本身就是个信号。

至于安全,DeepMind 这次推了个叫 ASIMOV-Agentic 的基准测试(名字致敬阿西莫夫,不用我多说),专门评估三件事:机器人会不会拒绝不安全的操作、能不能判断任务是否可以安全完成、知不知道什么时候该喊人类来。ER 2 还带人体感知——有人走进作业区,自动安全停机。

上手:普通开发者能玩的那部分

好消息是,三个模型里最有意思的 ER 2 是公开预览的,你现在就能用。没有机器人?没关系,ER 2 输出的是文本(坐标、规划、判断),一张图片就能测它的空间推理能力。

模型 ID 有两个:

  • gemini-robotics-er-2-preview:标准版,基于 Gemini 3.5 Flash,强化了空间推理、视频时刻查找、多机器人编排
  • gemini-robotics-er-2-streaming-preview:流式版,走 Live API,为低延迟机器人 Agent 优化,吃连续音视频流

来个最直观的例子——让它指出图片里的物体在哪:

python
from google import genai

PROMPT = """
Point to no more than 10 items in the image. The label returned
should be an identifying name for the object detected.
The answer should follow the json format: [{"point": <point>,
"label": <label1>}, ...]. The points are in [y, x] format
normalized to 0-1000.
"""

client = genai.Client()
uploaded_file = client.files.upload(file="my-image.png")

image_response = client.interactions.create(
    model="gemini-robotics-er-2-preview",
    input=[
        {
            "type": "image",
            "uri": uploaded_file.uri,
            "mime_type": uploaded_file.mime_type
        },
        {"type": "text", "text": PROMPT}
    ],
    generation_config={"thinking_level": "high"},
)

print(image_response.output_text)

返回长这样:

json
[
  {"point": [376, 508], "label": "small banana"},
  {"point": [287, 609], "label": "larger banana"}
]

坐标是归一化到 0-1000 的 [y, x]。别小看这个"指一下",它是所有抓取动作的起点——机器人得先知道东西在哪,才谈得上伸手。

除了指向,ER 2 还支持边界框检测、轨迹规划、任务编排(把长任务拆成子任务并调用你自己的机器人 API)。

三个坑提前说:

  1. API 密钥必须加限制,无限制的 key 会直接吃 403 Forbidden,去 AI Studio 里配一下
  2. thinking_level 别无脑拉满high 延迟明显上升,日常用 medium 平衡就好
  3. 老版本要停用了gemini-robotics-er-1.6-preview 将在八月底下线,还在用的赶紧换过来

顺便提一句流式版的限制:它不支持缓存、代码执行、结构化输出和 URL 上下文,只保留 Live API、函数调用、搜索接地和思考能力。选型前看清楚。

写在最后

具身智能这条赛道,2024 年大家比"能不能抓起来",2025 年比"抓得稳不稳",到 2026 年,问题变成了**"能不能听懂一句话,然后自己走过去把整件事办完"**。

Gemini Robotics 2 的意义不在于哪个 benchmark 又涨了几个点,而在于它把机器人的"大脑"和"身体"正式解耦了。硬件厂商不用再养一整支 AI 团队,中小机器人公司也能直接接通用基础模型进工业和服务场景——这个门槛的下降,可能比任何一段演示视频都重要。

当然,泼一盆冷水:VLA 模型目前还是私有预览,真机部署离普通开发者还有距离。但 ER 2 已经在 AI Studio 里躺着了,免费的。

去传张你家客厅的照片,让它指指看沙发在哪。 那一瞬间你会突然理解,为什么这帮人觉得机器人的 iPhone 时刻快到了。

进阶

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

Gemini中文文档