---
url: /nanobanana/what_is_nano_banana.md
description: >-
  Nano Banana 是 Gemini 原生图片生成模型的昵称，2026 年 9 月在役三款：Nano Banana 2、Nano Banana 2
  Lite、Nano Banana Pro。本文讲清它们的能力差异、API 定价、分辨率上限、参考图数量与上手方式，附真实成本数据。
---

# 什么是 Nano Banana：Gemini 图片模型家族入门指南

先说一件几乎每个用 AI 生过图的人都踩过的坑。

你花了十分钟，终于生成了一张满意的人物图。然后你想只把背景换成咖啡馆。改完一看——背景对了，**脸变了**。你试图改回来，脸回来了，衣服又变了。来回到第七版，你盯着屏幕上那个既像又不像的人，陷入一种很微妙的自我怀疑。

我干过这事，而且不止一次。

所以当我知道有个模型专门解决这个问题、而且它现在已经是 Gemini 默认的生图引擎时，我的第一反应是：这名字认真的吗？

它叫 **Nano Banana**（纳米香蕉）。

> 一个能让你的角色形象在十几次编辑后保持不变的模型，叫"小香蕉"。Google 的命名部门大概是真的很有自信。

## 什么是 Nano Banana

**一句话：Nano Banana 不是某个单独的产品，而是 Gemini 内部那组"原生图片生成模型"的对外昵称。**

它最早是个内部代号，结果因为太好记被用户叫开了，Google 索性认领，现在官方文档里就直接用这个名字。你在 Gemini 里点"生成图片"、在 Google 搜索的 AI 模式里出图、在 Lens 里玩视觉问答、在 Flow 里做分镜，背后跑的都是它。**2026 年 9 月 10 日刚发布的 Windows 版 Gemini 桌面应用里，那个能直接给你做 PPT 配图的功能，用的也是它。**

换句话说：**你很可能已经在用 Nano Banana 了，只是不知道它叫这个名字。**

这里有个容易搞混的点，先说清楚——**不是所有 Gemini 模型都会画图**。像 `gemini-3.7-flash`、`gemini-3.8-flash` 这类通用模型，官方明确写了**不支持图片生成**。画图得用专门带 `-image` 后缀的那几款。

### 2026 年 9 月在役的三款

截至 2026 年 9 月，Nano Banana 家族实际在跑的是三款，各自有独立的 API ID：

| 消费名 | API ID | 发布时间 | 定位 | 输出分辨率 |
| --- | --- | --- | --- | --- |
| **Nano Banana 2** | `gemini-3.1-flash-image` | 2026-02-26 | 默认主力，速度与质量均衡 | 512 / 1K / 2K / 4K |
| **Nano Banana 2 Lite** | `gemini-3.1-flash-lite-image` | 2026-06-30 | 最便宜最快，走量用 | 1K（512 仅部分渠道） |
| **Nano Banana Pro** | `gemini-3-pro-image` | 2025-11-20 | 旗舰，复杂画面与 4K | 1K / 2K / 4K |

另外还有个"前任"：**初代 Nano Banana（`gemini-2.5-flash-image`）**，2025 年 8 月发布，2026 年 2 月被 Nano Banana 2 取代默认位置，官方已标记弃用，**2026 年 10 月正式关停**。如果你代码里还写着这个 ID，现在就该改了。

## 它的特点，一条一条说

* **对话式改图**：不是"生成一次不满意就重来"，而是像聊天一样接着改。"把车改成敞篷"→"再换个黄色"，上下文和主体都还在
* **角色一致性**：这是它起家的本事。Nano Banana 2 最多支持 4 张角色参考图，Pro 支持 5 张，用来锁住人物长相
* **文字终于能看了**：以前 AI 画图最怕画面里有字，现在能渲染高质量文字，包括长字符串——海报、信息图有救了
* **参考图拼装**：2 和 2 Lite 最多 10 张物体参考图，Pro 最多 6 张物体 + 3 张风格参考，把指定的东西塞进最终画面
* **图文交织输出**：一次请求同时返回文字和图片，比如一边写菜谱一边配图，不用把两个模型串起来
* **4K 输出**：2 和 Pro 都能出 4K，Pro 在 4K 档的精细度是天花板
* **接地搜索**：Pro 和 2 支持 Google Search 接地，画"今天的某地标"这类需要实时知识的内容不会瞎编
* **视频输入**：**2 和 2 Lite 支持喂视频进去**（Pro 反而不支持），可以从视频里取素材
* **全部带 SynthID 水印**：所有生成图片都嵌入 SynthID 隐式水印，肉眼看不见但可检测
* **结构化输出**：只有 Pro 支持返回 JSON，方便接到自动化流程里

## 大概要花多少钱

这块是我最想讲清楚的，因为官方定价是**按 token 算的，不是按张算的**，很多人第一次看会懵。

| 模型 | 输入价 | 输出价 | 折算单张（实测） | 单张耗时 |
| --- | --- | --- | --- | --- |
| Nano Banana 2 | $0.50 / 百万 token | $3.00 / 百万 token | 约 **$0.067** | 9–14 秒 |
| Nano Banana 2 Lite | $0.25 / 百万 token | $1.50 / 百万 token | 约 **$0.034** | 3–4 秒 |
| Nano Banana Pro | $2.00 / 百万 token | $12.00 / 百万 token | 1K/2K 约 **$0.134**，4K 约 **$0.24** | 15–87 秒 |

> 上面"折算单张"和耗时来自第三方在 2026 年 9 月 9 日用同一组 12 个提示词实测：跑完 12 张，Nano Banana 2 花 $0.96，2 Lite 花 $0.408，Pro 花 $1.80。价格会随分辨率和提示词长度浮动，但量级是准的。

几个必须知道的现实：

1. **API 没有免费额度**，三款都是。Gemini API 的图片模型强制要求开通 Blaze 随用随付方案。
2. **但在 Gemini 应用里是免费的**——免费档就能用 Nano Banana 2 出 1K 图；Pro 需要 Google AI Plus / Pro / Ultra 订阅。
3. **Pro 的 4K 是真贵**，单张能到 $0.24，是 2 Lite 的 7 倍。别拿它跑批量。

## 真实用得上的几个场景

### 场景一：电商批量出图（2 Lite）

某家居品牌要给 300 个 SKU 各出一张场景图，要求不高，1K 够用。用 2 Lite：3–4 秒一张，串行跑完 300 张约 20 分钟，成本约 $10。如果换成 Pro，同样 300 张要 $40 起步，而且按 15 秒/张算得跑一个多小时。

**这种"数量大、精度低、反正还要再挑"的活，就该给最便宜的那档。**

### 场景二：海报与信息图（Pro）

要做一张带大段中文标题的活动海报。这是 Pro 的主场：文字渲染准确、支持 4K、还能用 Google Search 接地把"活动地点周边实景"画对。单张 $0.134–0.24 看着贵，但对比设计师改三版的时间成本，几乎可以忽略。

顺带说一句，Pro 是三款里唯一支持 **JSON 结构化输出**的，意味着你可以把它嵌进自动化流水线，出完图直接把元数据写回数据库。

### 场景三：系列内容保持角色一致（2）

做儿童绘本或者品牌 IP 形象，最怕的就是"每页长得不一样"。Nano Banana 2 支持 4 张角色参考图，先把主角形象喂进去锁住，后面每一页都基于它生成。这正是它 2025 年第一次亮相时的主打能力，到现在依然是最好用的那档。

**这也是开头那个"改七版脸就变了"问题的正解。**

### 场景四：从视频里取素材（2 / 2 Lite）

这个能力有点被低估：**2 和 2 Lite 支持视频输入**。你可以把一段产品视频丢进去，让它基于视频里的某个画面生成配套的宣传图，风格天然对得上。Pro 反而不支持这个。

### 场景五：桌面端现场造图

配合 9 月 10 日刚上线的 Windows 版 Gemini 桌面应用，做 PPT 到第 8 页缺配图时，直接在工作区里用 Nano Banana 生成，不用切浏览器、不用下载、不用拖文件。

> 我越来越觉得，这类"把能力塞到你手边"的动作，比单纯提升模型跑分更能改变实际使用量。

## 快速上手：两条路

### 路线 A：不写代码（推荐先走这条）

1. 打开 [Gemini 应用](https://gemini.google.com) 或桌面客户端
2. 直接说"生成一张……"，或上传一张图再说"把它改成……"
3. 接着用对话继续改，别重新开一轮

**先在这儿玩明白"对话式改图"是什么感觉，再决定要不要接 API。** 很多人上来就写代码，结果连自己想要什么效果都没想清楚。

### 路线 B：接 API

去 [Google AI Studio](https://aistudio.google.com) 拿 API Key，然后：

```python
from google import genai
from google.genai import types

client = genai.Client(api_key="YOUR_API_KEY")

response = client.models.generate_content(
    model="gemini-3.1-flash-image",  # Nano Banana 2
    contents="一只橘猫在窗台上晒太阳，午后光线，写实风格",
    config=types.GenerateContentConfig(
        response_modalities=["IMAGE"],   # 只要图
        image_config=types.ImageConfig(image_size="2K"),  # 注意 K 必须大写
    ),
)
```

想同时拿到文字说明，就把 `response_modalities` 改成 `["TEXT", "IMAGE"]`，这就是前面说的图文交织。

### 几个会让你卡住的坑

**1. 分辨率的 `K` 必须大写。** 写 `1k` 会被直接拒绝，`512` 这个档位反而不带 `K`。这种细节报错信息还很不友好，能气死人。

**2. 通用模型不能画图。** 别拿 `gemini-3.8-flash` 去生成图片，会失败。认准 `-image` 后缀。

**3. 输出固定 PNG。** 想要 JPEG 得自己转。

**4. 多轮编辑会累积成本。** 每一轮改图，上一轮的图会作为输入 token 重新计费。改 10 版的成本远高于生成 10 张新图——**这点在跑自动化流程时一定要算进去。**

**5. 初代 10 月关停。** `gemini-2.5-flash-image` 别再用了，迁移到 `gemini-3.1-flash-image`。

## 我的选择建议

如果只记一句话：**默认用 Nano Banana 2，走量用 2 Lite，要 4K 和复杂文字才上 Pro。**

Nano Banana 2 大概占了 Pro 一半的价格，质量差距却没那么明显，它成为 Gemini 应用、搜索 AI 模式、Lens、Ads、Flow 的默认引擎不是没原因的。Pro 更像是"关键时刻才请出来的专家"，不是日常口粮。

至于 2 Lite，它的价值在于让你**敢批量试错**。3 秒一张、$0.034 一张，意味着你可以一口气生成 50 个构图方向挑一个，这种自由度才是创意工作真正需要的。

## 进阶

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
