一分钟带你了解什么是Gemini Robotics
先说一个你可能没意识到的事实。
过去十年,机器人圈演示视频有个心照不宣的套路:镜头永远只拍上半身。
一张桌子,一双机械臂,叠个衣服、倒杯水、把方块放进洞里。为什么不拍腿?因为一旦机器人要走路、要弯腰、要蹲下去够低处的东西,控制系统就崩了——上半身抓取和下半身平衡,是两套完全不同的算法,中间靠工程师手写规则硬接。
2026 年 7 月 30 日,谷歌 DeepMind 发布 Gemini Robotics 2,把这堵墙拆了。
一个模型,从脚趾控到指尖。
Gemini Robotics 是什么
Gemini Robotics 是谷歌 DeepMind 面向机器人的基础模型系列,本质上是把 Gemini 的多模态理解能力,接到了物理世界的电机上。
它解决的是机器人行业最拧巴的一个矛盾:过去每台机器人都得为一个特定任务单独训练,换个场景、换个本体,一切推倒重来。而 Gemini Robotics 想做的是"机器人界的安卓"——硬件厂商专心做身体,大脑交给基础模型。
上一代 Gemini Robotics 只能控制上半身完成桌面任务。这一代最关键的变化是:一个 VLA(视觉-语言-动作)模型,首次实现了对完整人形机器人的控制,并且在多个形态迥异的硬件平台之间共用同一份权重。
这次发布的不是一个模型,是三个,分工明确:
| 模型 | 角色 | 定位 | 状态 |
|---|---|---|---|
| Gemini Robotics 2 | 小脑 | VLA 模型,把视觉+语言直接转成电机控制信号 | 私有预览 |
| Gemini Robotics ER 2 | 大脑 | 具身推理模型,负责空间理解、多步规划、多机调度 | 公开预览(AI Studio + Gemini API) |
| Gemini Robotics On-Device 2 | 本地版 | 轻量 VLA,直接跑在机器人硬件上,不依赖云 | 私有预览 |
大脑想,小脑做。ER 2 规划完"把苹果放进碗里",拆成定位、抓取、放置三步,再把动作交给 VLA 执行。妙的是 ER 2 的设计允许机器人边做边想——执行当前动作的同时,已经在盘算下一步了。
它到底强在哪
- 全身智能控制:从脚到指尖的完整自由度。会动态调整重心,所以机器人能安全地迈步、下蹲、弯腰,在杂乱的真实空间里挪动,而不是杵在原地伸手
- 22 自由度灵巧手:能拧灯泡、系垃圾袋、打结。这类活儿以前是具身智能的天花板,因为需要力度反馈和指尖级微调
- 跨本体迁移:适配一台新的双臂机器人,只要几小时。端侧版本更狠——不到 200 条示例数据就能迁移到新平台
- 多机协作:两台机器人能互相通信,识别彼此的物理特长,自主分工完成单机干不了的活
- 任务级持久性:ER 2 能管理数分钟级的长任务,中途监控进度、失败了自己重来
- 会说人话:干活的时候能解释自己在干嘛,你也能用大白话中途改主意,不需要技术术语
- 能用工具:ER 2 可以调 Google 搜索、日历这类工具来补充对环境的理解——机器人也开始上网查资料了
真实场景里跑成什么样
Apptronik Apollo 2 人形机器人是这次的主力演示平台。
给它一句指令:"把浇水壶放到底层货架的绿色垃圾桶里。" 然后 Apollo 2 自己穿过整个房间,找到浇水壶,抓起来,蹲下身,放进低处的桶。全程没有分段脚本,一句话到底。
配上五指 SharpaWave 仿人手之后,它还能拧灯泡、系垃圾袋。换成工业常见的平行夹爪,就去做精密插件装配和物品打包——同一个模型,换只手就换个工种。
硬件伙伴阵容也值得一提:Apptronik、Boston Dynamics、Agile Robots,再加上 100 多家"可信测试者",从企业自动化巨头到机器人创业公司都在里面。波士顿动力那种级别的老牌厂商愿意把大脑外包,本身就是个信号。
至于安全,DeepMind 这次推了个叫 ASIMOV-Agentic 的基准测试(名字致敬阿西莫夫,不用我多说),专门评估三件事:机器人会不会拒绝不安全的操作、能不能判断任务是否可以安全完成、知不知道什么时候该喊人类来。ER 2 还带人体感知——有人走进作业区,自动安全停机。
上手:普通开发者能玩的那部分
好消息是,三个模型里最有意思的 ER 2 是公开预览的,你现在就能用。没有机器人?没关系,ER 2 输出的是文本(坐标、规划、判断),一张图片就能测它的空间推理能力。
模型 ID 有两个:
gemini-robotics-er-2-preview:标准版,基于 Gemini 3.5 Flash,强化了空间推理、视频时刻查找、多机器人编排gemini-robotics-er-2-streaming-preview:流式版,走 Live API,为低延迟机器人 Agent 优化,吃连续音视频流
来个最直观的例子——让它指出图片里的物体在哪:
from google import genai
PROMPT = """
Point to no more than 10 items in the image. The label returned
should be an identifying name for the object detected.
The answer should follow the json format: [{"point": <point>,
"label": <label1>}, ...]. The points are in [y, x] format
normalized to 0-1000.
"""
client = genai.Client()
uploaded_file = client.files.upload(file="my-image.png")
image_response = client.interactions.create(
model="gemini-robotics-er-2-preview",
input=[
{
"type": "image",
"uri": uploaded_file.uri,
"mime_type": uploaded_file.mime_type
},
{"type": "text", "text": PROMPT}
],
generation_config={"thinking_level": "high"},
)
print(image_response.output_text)返回长这样:
[
{"point": [376, 508], "label": "small banana"},
{"point": [287, 609], "label": "larger banana"}
]坐标是归一化到 0-1000 的 [y, x]。别小看这个"指一下",它是所有抓取动作的起点——机器人得先知道东西在哪,才谈得上伸手。
除了指向,ER 2 还支持边界框检测、轨迹规划、任务编排(把长任务拆成子任务并调用你自己的机器人 API)。
三个坑提前说:
- API 密钥必须加限制,无限制的 key 会直接吃
403 Forbidden,去 AI Studio 里配一下 thinking_level别无脑拉满,high延迟明显上升,日常用medium平衡就好- 老版本要停用了:
gemini-robotics-er-1.6-preview将在八月底下线,还在用的赶紧换过来
顺便提一句流式版的限制:它不支持缓存、代码执行、结构化输出和 URL 上下文,只保留 Live API、函数调用、搜索接地和思考能力。选型前看清楚。
写在最后
具身智能这条赛道,2024 年大家比"能不能抓起来",2025 年比"抓得稳不稳",到 2026 年,问题变成了**"能不能听懂一句话,然后自己走过去把整件事办完"**。
Gemini Robotics 2 的意义不在于哪个 benchmark 又涨了几个点,而在于它把机器人的"大脑"和"身体"正式解耦了。硬件厂商不用再养一整支 AI 团队,中小机器人公司也能直接接通用基础模型进工业和服务场景——这个门槛的下降,可能比任何一段演示视频都重要。
当然,泼一盆冷水:VLA 模型目前还是私有预览,真机部署离普通开发者还有距离。但 ER 2 已经在 AI Studio 里躺着了,免费的。
去传张你家客厅的照片,让它指指看沙发在哪。 那一瞬间你会突然理解,为什么这帮人觉得机器人的 iPhone 时刻快到了。
进阶
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档