Skip to content

认识 Gemma 4:Google 的开源大模型,16GB 笔记本就能跑

先讲个能让不少人脸疼的事实。

2026 年 4 月 2 日深夜,Google 往 Hugging Face 传了一批模型权重,发了篇博客,没有发布会,没有 CEO 站台,连个像样的海报都懒得做。

然后开源圈炸了。

原因很简单:这批模型叫 Gemma 4,用的是 Apache 2.0 协议。商用、改代码、二次分发,全都可以,不用跟 Google 打一声招呼。上一代 Gemma 3 还挂着 Google 自己拟的那份限制性条款,这次一步到位换成了开源世界最宽松的那张纸。

我用过不少"开源"模型,其中相当一部分的许可证读起来像租房合同——能用,但条款里埋着七八个"但是"。Gemma 4 这次是真把钥匙交出来了。

大部分人不是不想用大模型,是不想把自己的数据、业务和命脉,全押在别人的 API 上。开源模型的意义从来不只是"免费",是"万一哪天你涨价、限流、改条款,我还能自己跑"。

什么是 Gemma 4

Gemma 4 是 Google DeepMind 的开源开放权重模型家族,技术血统来自 Gemini 3——换句话说,它是 Gemini 那个闭源旗舰的"开源表弟",把同一套研究和技术做成了能下载到你硬盘上的权重文件。

它跟 Gemini 不是竞争关系,是互补的:Gemini 负责云端最强的能力,Gemma 负责你自己硬件上能跑的部分。Google 的算盘很清楚——两条腿走路,闭源赚钱,开源占地盘。

这个家族目前有五个规格,覆盖从手机到工作站的完整光谱:

型号参数量定位上下文最低硬件
E2B20 亿(高效)极限轻量,端侧推理128K手机、树莓派
E4B40 亿(高效)手机与 IoT 设备128K手机、Jetson Nano
12B约 120 亿(稠密)笔记本,性能与体积均衡256K16GB 显存/统一内存
26B (A4B)260 亿(MoE 混合专家)高性价比,工作站256K消费级 GPU / 单张 H100
31B310 亿(稠密)旗舰,本地最强256K单张 80GB H100(bf16)

先解释两个容易看懵的缩写,不然你选型号时会踩坑:

  • E 系列(E2B/E4B) 的 "E" 是 Efficient。它们跑在手机和嵌入式设备上,推理时实际激活参数只有 20 亿和 40 亿,内存占用极小,对续航的影响几乎可以忽略。Google 拉上了 Pixel 团队、高通和联发科一起做适配,目标是让安卓手机在完全离线状态下跑这些模型,延迟接近零。
  • 26B 的 "A4B" 指的是 MoE 架构下实际激活的参数量。它总共有 260 亿参数,但每次推理只唤醒其中一部分"专家"模块,所以算力需求远低于同参数量的稠密模型,效果却很接近。

一句话选型建议:手机和树莓派选 E 系列,笔记本选 12B,有张像样显卡的工作站选 26B,追求本地最强、显存管够选 31B。

它有哪些特点

一、小体积,硬碰硬

这是 Gemma 4 最值得吹的地方。官方给的性能散点图里,31B 的 Elo 分数约 1451,26B 约 1442。作为对照,同图里的 qwen3.5-397b-a17b 是 1450——一个 3970 亿参数的模型。

31B 打平了比自己大 12 倍的模型。

硬指标更能说明问题。下面是官方 benchmark 表,最右边一列是上一代 Gemma 3 27B 做参照:

测试项31B26BE4BE2BGemma 3 27B
Arena AI(文本,4/2 数据)145214411365
MMMLU 多语言问答85.2%82.6%69.4%60.0%67.6%
MMMU Pro 多模态推理76.9%73.8%52.6%44.2%49.7%
AIME 2026 数学89.2%88.3%42.5%37.5%20.8%
LiveCodeBench v6 竞赛编程80.0%77.1%52.0%44.0%29.1%
GPQA Diamond 科学知识84.3%82.3%58.6%43.4%42.4%
τ²-bench 智能体工具调用86.4%85.5%57.5%29.4%6.6%

我最想让你看的是最后一行。τ²-bench 测的是"模型能不能真的调用工具把活干完",上代 Gemma 3 27B 只有 6.6%,31B 直接干到 86.4%。这不是渐进式进步,这是从"基本不会"到"能干活"的跨越。

数学那一行同理:20.8% → 89.2%。上代模型做 AIME 竞赛题基本是瞎蒙,这代是真会算。

参数量这事儿,正在从"越大越好"变成"同样大小谁更聪明"。Gemma 4 打的旗号就是 intelligence-per-parameter——单位参数的智能密度。对钱包不够鼓的人来说,这比堆卡有意义得多。

二、12B 那个"怪胎":把编码器整个拆了

2026 年 6 月 3 日,Google 又补发了一个 Gemma 4 12B,夹在 E4B 和 26B 之间。这个型号值得单独说,因为它的架构很反常规。

传统多模态模型怎么处理图片和声音?加编码器。图片先过一遍视觉编码器(中等规模模型常见 1.5 亿到 5.5 亿参数),声音先过一遍音频编码器(又是 3 亿参数起步)。每个编码器各自跑一次前向传播,各自占一份显存,每次输入非文本数据都要多付一份延迟。

Gemma 4 12B 把这两个编码器全拆了。

  • 视觉:用一个约 3500 万参数的极简嵌入模块替代。图片切成 48×48 像素的小块,一次矩阵乘法 + 位置嵌入 + 归一化,直接投进语言模型的向量空间。原来 27 层的视觉 Transformer,现在是一次矩阵乘法。
  • 音频:更狠,编码器直接删除。16kHz 原始音频切成 40 毫秒一帧(每帧 640 个浮点数),线性投影到和文本 token 同一个嵌入空间。你说的话和你打的字,走的是同一条路。

这个改动有个对普通开发者极其友好的副作用:微调变成单遍操作了。

在带编码器的模型里,视觉和音频编码器在下游训练时通常是冻结的,只有语言模型那部分权重在更新——意味着模型的"眼睛"和"耳朵"被锁死在预训练状态。想做真正的端到端多模态适配,得同时训练编码器和主干,显存直接翻倍。

而 12B 因为三 modality 共享权重,你挂一个 LoRA 适配器,一次微调自动覆盖文本、图像、音频。做医疗影像助手的团队应该最懂这个差别的分量。

12B 还有个叫 MTP(Multi-Token Prediction)草稿器的东西:生成当前 token 的同时并行预测接下来 3 到 5 个,对了就直接用,错了回退修正。官方说法是这种投机解码能把推理速度提升一倍以上。

它的成绩单也够看:MMLU Pro 77.2%、GPQA Diamond 78.8%、AIME 2026 77.5%、LiveCodeBench v6 72%、MATH-Vision 79.7%。社区实测在 RTX 4090 上生成 8.9k token 代码时显存占用约 9GB,Q4 量化后模型文件约 7.56GB——一台 16GB 内存的 MacBook Pro 就能稳稳跑起来。

三、其余几个关键点

  • Agentic 就绪:原生支持 function calling、结构化 JSON 输出、系统指令。不是"能做",是专门按智能体工作流的需求训练的。
  • 140+ 语言:原生训练覆盖,不是靠翻译中转。官方强调它理解文化背景,不只是字面转换。
  • 多模态原生:全系处理图像和视频,支持可变分辨率,OCR 和图表理解是强项。E2B/E4B 和 12B 还支持原生音频输入。
  • 长上下文:E 系列 128K,12B / 26B / 31B 都是 256K。256K 大概能塞下 200 页文档、一整个代码仓库,或者几个小时的音频。
  • 离线可用:E 系列能在手机、树莓派、Jetson Nano 上完全离线跑,近零延迟。这一点对隐私敏感场景是刚需。

能用来干什么:三个真实案例

案例一:保加利亚人终于有了自己的母语模型(INSAIT → BgGPT)

保加利亚只有约 650 万人口,在全球大模型的训练语料里属于妥妥的低资源语言。让 GPT 或 Gemini 说保加利亚语能凑合,但那种凑合本地人一读就知道——语感是翻译腔的,文化典故全是错的。

INSAIT(保加利亚人工智能研究机构)用 Gemma 微调出了 BgGPT,一个保加利亚语优先的模型。这件事的意义在于:如果没有开源权重,这种规模的市场永远不会有属于自己的模型——没有任何一家商业公司会为了 650 万用户专门训一个。

案例二:耶鲁大学拿它找癌症治疗新路径(Cell2Sentence-Scale)

Google 与耶鲁大学合作的 Cell2Sentence-Scale 项目,把细胞数据表示成"句子"喂给模型,用来发现癌症治疗的新通路。

这类研究有个硬前提:模型必须能拿到本地、能改、能微调。你没法通过 API 调用去改人家模型的中间层表示。开源权重在这里不是"省钱",是"能不能做"的问题。

案例三:你自己的本地代码助手

这个离我们最近。12B 的 LiveCodeBench v6 是 72%,意味着它处理日常编程任务已经相当够用。配合 256K 上下文,你可以把整个项目塞进去让它理解全貌——而这一切不需要联网,代码一行都不出你的机器。

对那些被公司安全策略禁止把代码发给外部 API 的团队来说,这可能是目前最实际的一条路。

Gemma 系列累计下载量已经超过 4 亿次,社区衍生出 10 万多个变体(Google 管这个生态叫 Gemmaverse)。开源模型的价值不取决于发布时的跑分,取决于两年后还有多少人在它上面盖东西。

快速上手:三分钟在本地跑起来

别被上面那些参数吓到,上手其实比装个开发环境还简单。

路线一:Ollama(最省事,推荐先走这条)

bash
# 装好 Ollama 后,直接拉模型(以 12B 为例)
ollama run gemma4:12b

# 显存紧张就用量化版,约 8GB 能跑
ollama run gemma4:12b-q4_K_M

# 想试旗舰
ollama run gemma4:31b

# 手机/树莓派这类设备
ollama run gemma4:e2b

跑起来之后直接在终端对话。想接进自己的程序,Ollama 默认在 http://localhost:11434 开了个 OpenAI 兼容的接口,改个 base_url 就能用。

Python 里这样调:

python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama"  # 本地随便填
)

resp = client.chat.completions.create(
    model="gemma4:12b",
    messages=[{"role": "user", "content": "用两句话解释什么是 MoE 架构"}]
)
print(resp.choices[0].message.content)
  • LM Studio:图形界面,搜 gemma-4 点下载,选个量化档位,完事。
  • Google AI Edge Gallery:Google 官方的本地模型 App,已有 macOS 桌面版,适合体验 E2B/E4B 的离线能力。
  • Google AI Edge Eloquent:官方演示 App,能看到 12B 在完全离线状态下做语音转写、格式化和多语言翻译。

路线三:Hugging Face 直接拿权重

bash
# 需要 Hugging Face 账号并同意协议
huggingface-cli download google/gemma-4-12b-it --local-dir ./gemma4-12b

12B 在 HF 上提供了三个仓库:

  • google/gemma-4-12B — 预训练基座
  • google/gemma-4-12B-it — 指令微调版(日常用这个)
  • google/gemma-4-12B-it-assistant — MTP 草稿模型,配合投机解码用

路线四:生产环境上云

本地玩明白之后要上线,可以走 Google Cloud 的 Model Garden、Cloud Run 或 GKE,也可以通过 Gemini Enterprise Agent Platform 部署。微调推荐 Unsloth,官方给了专门适配,效率比常规方案高一截。

顺便一提,如果你要做智能体,Google 同步开源了 Gemma Skills Repository——一套专门为 Gemma 构建智能体的技能库,能省掉从零搭框架的时间。

冷静一下:三个别上头的地方

第一,它只输出文本。 12B 能吃文本、图像、音频、视频,但吐出来的只有文字。想生成图片请去看 Imagen 或 Nano Banana,生成视频是 Veo 的活儿。别指望一个模型干完所有事。

第二,小模型在小语种上仍然会犯糊涂。 140 种语言是"原生支持",不等于"每种都达到英语水平"。社区反馈里,12B 在复杂图像理解上偶尔会识别错误或产生幻觉——这毛病所有这个尺寸的模型都有,不是 Gemma 独有。真要做生产级的多模态应用,请留好人工复核环节。

第三,协议是 Apache 2.0,但安全责任在你。 开源意味着没人替你兜底内容安全。你要把它放到公开产品里, moderation 层得自己搭。Google 给的是模型,不是完整的产品方案。

进阶

想继续往下挖,几个方向值得走:Gemma 4 的官方 model card(含完整 benchmark 与已知局限)、12B 的 Developer Guide(架构细节讲得很透)、Unsloth 的微调教程,以及 Gemma Skills 仓库里那些现成的智能体模板。

如果你是从 Gemini 生态过来的,推荐配合本站的《认识 Google DeepMind》理解它的研究版图;想对比闭源路线,《Gemini 3.8 Flash 模型介绍》是同一时期的主力模型;对本地部署工具链感兴趣的话,TensorFlow 与 Keras 的《认识 TensorFlow 与 Keras》里也有 Gemma 的集成说明。

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

Gemini中文文档