---
url: /synthid/what_is_synthid_bio.md
description: >-
  2026年9月30日 Google DeepMind 在《自然》发表 SynthID Bio，这是一种给 AI
  设计蛋白质打水印的方法。本文详解序列水印（ProteinMPNN 锦标赛采样）与结构水印（AlphaFold 3
  扩散网络微调）两条技术路线、VEGF-A/新冠 RBD/PD-L1 三靶点湿实验数据、99.8% 检测率、DNA
  合成筛查的现实缺口，以及重测序攻击能抹掉水印却被 Nature 点名的致命短板。附 Apache 2.0 开源上手指南。
---

# 认识 SynthID Bio：谷歌把水印打进蛋白质，然后发现洗掉水印的蛋白更强

先说个我读完论文后笑出声的细节。

DeepMind 在《自然》的论文里，老老实实记录了一次针对自己的攻击实验：拿 **38,396 个**已经打好水印的蛋白质结合体，重新过一遍不带水印的序列设计模型——也就是俗称的"重测序攻击"——水印基本被洗干净了。

到这里都还算正常，水印技术被攻击掉不丢人。

真正有意思的是后半句：**重测序之后得到的这批蛋白，结合亲和力经常比它爹还好。**

我盯着这句话看了半天。这是一种非常体面的自我拆台：你精心搞了套水印系统，结果有人在破解它的时候，顺手把你的蛋白优化了一下。

但正是这种"敢把自己打脸数据写进论文"的操作，让我觉得这东西值得认真聊一聊。**它不是公关稿，是个技术严谨度相当高的东西。**

2026 年 9 月 30 日，Google DeepMind 在官方博客和《自然》同日发布了 **SynthID Bio**。论文标题《Function-preserving watermarking of AI-generated proteins》，博客署名 Pushmeet Kohli、David Stutz、Ali Cowen-Rivers、Jeremy Ratcliff。

一句话概括它干的事：**这是人类第一次把"不可感知但可检测"的水印，塞进 AI 设计的蛋白质里，并且蛋白质还能正常工作。**

## 先搞清楚它到底在救什么火

在讲技术之前，必须先讲清楚这件事为什么重要。不然你很容易把它当成又一个"给 AI 内容打标签"的老套路。

事情是这样的。

假设你是个生物研究者，设计了一个自然界从未存在过的蛋白质，想把它做出来。你不能直接"打印"蛋白质，你得把对应的 DNA 序列发给**DNA 合成公司**（比如 Twist Bioscience），让他们合成，然后你在实验室里表达出来。

而合成公司不是给钱就干的。他们会拿你的订单去跟**已知危险序列数据库**比对——病原体、毒素之类的，命中就拦下来。

这套机制建立在一个默认前提上：

> **一个数据库里查不到的陌生序列，大概率是某种还没被人类发现过的天然生物。**

生物学界靠这个假设运转了很多年。直到 AI 出现。

现在的蛋白质生成模型（AlphaProteo、ProteinMPNN）能设计出**跟任何已知危险序列都不相似**的全新分子。因为它们的氨基酸序列压根不是从自然进化里"发现"出来的，是被"设计"出来的——不存在于任何威胁数据库的黑名单上，恰恰因为它从来就没有在自然界存在过。

那个默认前提，塌了。

这不是我危言耸听。**2025 年 10 月，Twist Bioscience 自己报告过一次测试结果：用 AI 设计出来的毒素和病毒蛋白变体，成功绕过了当时的标准筛查软件。** 事后 Twist 打了补丁、升级了检测策略——但这是一次攻击已经发生之后的补救。

如果你想知道"真的会有人这么干吗"——合成公司筛不了的序列，只能靠人工逐条复核。而人工逐条复核，会让正常的生物学研究彻底停摆。

> DeepMind 在博客里用了个很形象的词：**瑞士奶酪模型**。每一层防御都有洞，但你把多层叠起来，洞就不对齐了。**SynthID Bio 就是往这摞奶酪里多加一层。**

## SynthID Bio 是什么

SynthID Bio 不是单一技术，是**一族（a family of）针对合成生物学设计的水印方法**。

它是 SynthID 这条产品线的延伸——你可能在图片、音频、视频上见过这个名字（本站另一篇[《认识 SynthID》](/synthid/what_is_synthid)讲过）。这次是把同一个思路搬进了生物学。

核心主张一句话：

> 水印**不写在文件的元数据里**，而是**直接嵌进生物序列本身**。所以它不仅在数字模型上能被验证，在**被真正合成出来的那个实物蛋白上**，同样能被验证。

这个区别是关键。给图片加元数据水印，截图一下就没了；给蛋白质加水印，它跟着这个分子走到天涯海角。

它提供**两条互不替代的技术路线**，分别对应蛋白质设计的两个环节：

| 维度 | SynthID Bio-sequence（序列侧） | SynthID Bio-structure（结构侧） |
| --- | --- | --- |
| 作用对象 | 氨基酸序列 | 预测的 3D 原子坐标 |
| 实现方式 | 在自回归解码时悄悄影响氨基酸选择 | 微调 AlphaFold 3 扩散网络，写进模型权重 |
| 底座模型 | ProteinMPNN（改造版） | AlphaFold 3（改造版） |
| 需不需要改模型 | 不需要，采样阶段可开关 | 需要微调，且**权重一旦公开就无法去除** |
| 是否需要post-processing | 否，解码时直接生成 | 否，坐标天生自带信号 |
| 主要短板 | 重测序攻击可基本抹除 | 结构松弛（relaxation）可摧毁 |

**序列侧**的做法，是把 SynthID-Text 那套\*\*锦标赛采样（tournament sampling）\*\*移植到了 ProteinMPNN 上。原理其实挺朴素的：模型一个残基一个残基往外吐氨基酸，每个候选都有概率分；用一个密钥算种子，让候选两两"打比赛"，胜者输出。检测方拿同一把密钥重算一遍，统计分数是否系统性偏高。

因为是纯采样阶段动手，**模型完全不用重训**。好处是热插拔，代价是——用户理论上也能把它关掉。

**结构侧**就硬多了。DeepMind 微调了 AlphaFold 3 扩散网络的一小部分，把水印能力**烧进模型权重**。这意味着：

> 无论谁拿着这个模型去跑，输出的结构都自动带水印。**而且论文明确写着：一旦模型权重公开发布，这套水印流程就无法被移除。**

这一句我认为是整个项目里最狠的一句。它把"可选择性"剥夺了——你接收模型就必须接收它的水印。

## 它凭什么说"不影响功能"

这是所有人听到"改了氨基酸/坐标"之后的第一反应：**你这蛋白还能用吗？**

DeepMind 用湿实验回答了这个问题，而且它的实验设计我觉得挺值得学。

**设计流程**：用自家的结合体设计方法 **AlphaProteo** 搭骨架，配一个启用了 SynthID Bio 的 **ProteinMPNN** 版本生成序列。

**验证靶点**：三个临床上都有明确意义的目标——

* **VEGF-A**（血管内皮生长因子 A，肿瘤血管生成的核心靶点）
* **SARS-CoV-2 刺突蛋白受体结合域（RBD）**（新冠那个经典靶点）
* **PD-L1**（PD-1/PD-L1 免疫检查点通路的核心靶点）

实验量也不含糊：每个靶点用 **15 个**已知的 AlphaProteo 骨架，每种水印设置下跑出 **222 条未加水印序列**和 **267 条加水印序列**（已剔除对照组）。

**结果**：在这三个靶点上，带水印的设计在**命中率、结合亲和力（KD）、自然序列多样性**三个维度上，都与未加水印版本持平。

DeepMind 的原话是：成功创造了**史上第一批带水印且具备生物功能的蛋白质结合体**。

结构侧同样有硬数据：在 AlphaFold 3 自己的评测集上，**假阳性率 0.1% 时，真实阳性率超过 99.8%**；推荐配置在更严苛的 0.01% 假阳性率下仍有 **98.99%**。同时保持了预测精度和结构特征分布。

但接下来这段，是我最欣赏这篇论文的地方——它没藏拙，把对自己不利的数据也摊开了。

**论文自己报告的两个瑕疵：**

第一，在更宽松的结合阈值（KD ≤ 10⁻⁶）下，**未加水印的结合体命中率显著高于**"无损程度 0.5"那一档加水印的设置。换句话说，在宽松标准下它确实拖了后腿，只是在严格标准（KD ≤ 10⁻⁷）下两者没有显著差异。

第二，那个 100% 的真实阳性率，**不完全是水印的功劳**。里面有一部分来自"筛选"——弱标记的候选直接被丢掉了。在一项覆盖 23 个靶点、每个靶点 10,000 个样本的体外分析中，这套筛选让"非失真 0.5"设置在 0.1% 假阳性率下**通过率下降 41.7%**，意味着**需要多生成 171.5% 的候选**才能得到同样数量的合格设计。

> 我特别想把这段拎出来。很多人看技术宣传只看"检测率 100%"，但真正决定你能不能用它的，是"为了达到这个 100%，你多付了两倍的算力"。**DeepMind 把这笔账写在论文里，这叫诚实。**

## 它能用在哪儿

**场景一：给 DNA 合成公司的订单做"快速通道"**

这是主战场。合成公司拿到一个陌生订单，现在可以先查水印：这个设计来自于带了内置防护的可信模型吗？是的话，人工复核的优先级可以往后放一放，把精力集中到真正可疑的订单上。

Twist Bioscience 的政策与生物安全副总裁 James Diggans 在提前审读了论文后给的评价：

> "对 Twist 来说，水印提供了一个很有前景的新工具……可以强化筛查，把资源集中到真正需要仔细审查的序列上，让生物安全在 AI 设计的生物学持续进步的同时变得更高效。"

生物安全政策专家 Sarah Carter 的视角更值得注意：

> "通过把设计和模型开发者关联起来，这些水印让**开发者能够在安全议题上带头**，也让合成供应商可以为使用过这些模型的客户简化筛查流程。"

**场景二：防止公共数据库被污染**

蛋白质数据库（PDB）、UniProt、GenBank 这些公共库接受任何人提交。如果有 AI 设计的结构被误标成天然结构混进去，下游所有基于它做研究的人都会被带沟里。水印能在提交时就标记出"这是合成的"。

不过要说清楚：**这目前还是个提议，不是已经上线的系统。**

**场景三：已经打到了基因组级别**

这可能是最让人背后发凉、也最让人兴奋的一条。DeepMind 已经跟**斯坦福大学 Hie 实验室**和 **Arc Institute** 合作，把 SynthID Bio 集成进了基因组模型 **Evo 2**，并给一个 AI 设计的**噬菌体（感染细菌的病毒）基因组**打了水印。

早期的细菌培养测试显示：**带水印的噬菌体仍然是有效的。**

从单个蛋白质到一整个能自我复制的生命体基因组——这个跨度，得说一句"卧槽"。

## 上手：把代码拉下来跑跑

DeepMind 这次开源给得挺痛快：**代码、体外实验数据都公开了，模型权重向研究社区开放**。仓库是 [github.com/google-deepmind/synthidbio](https://github.com/google-deepmind/synthidbio)，**Apache 2.0** 许可（内置的 ProteinMPNN 是 MIT）。

序列侧的设计目标是**即插即用替换**现有的 ProteinMPNN，官方 README 说得很清楚：安装开销极小，只要打开水印开关就能生成带水印的序列。

在 Linux 上从零搭环境（抄自官方 README，推荐用 `uv`）：

```bash
# 1. 建虚拟环境并激活
uv venv synthid_bio --python 3.9
source synthid_bio/bin/activate

# 2. 装依赖
cd synthidbio_sequence
uv pip install -r requirements.txt
```

不用 `uv` 的话，标准 `venv` + `pip` 也行：

```bash
python3.9 -m venv synthid_bio && source synthid_bio/bin/activate
pip install -r requirements.txt
```

结构侧稍麻烦：它是一个微调过的 AlphaFold 3 模型，下载权重和运行带水印的结构预测要走 [AlphaFold 3 官方仓库](https://github.com/google-deepmind/alphafold3) 的完整流程。

> 提前打个预防针：这是**研究性质代码**，不是 `pip install` 完就能入库的生产组件。你要跑起来得有 Python 3.9 环境和一张还过得去的 GPU。别指望它跟装个 npm 包一样顺滑。

如果你不想折腾环境，只想先看看数据——**体外（in vitro）实验数据是随论文一起开放的**。

## 三件必须知道的事，不然会误判它

**第一，它是零比特（zero-bit）水印，不包含身份信息。**

这句话的意思是：它只能告诉你"这个设计被打了水印"，**不能区分是哪个用户、哪家实验室**。所以别指望它能当审计日志用。

密钥保密也是个约束。论文里明说：想要公开分发检测器或密钥，**还需要公钥水印方向的进一步创新**。而它这套可信工具框架，**最直接适用的场景是通过托管接口部署的模型**——也就是你自己下载权重离线跑，这套信任模型是打折扣的。

**第二，它的主要目标不是"抓坏人"。**

这点非常反直觉，但很重要。论文里明确反对把水印做成"惩罚性"机制（即检测到水印就给用户加码审查），理由是一针见血的：

> 一个恶意行为者，从一开始就会使用不带水印的工具。

所以水印的价值不在拦住坏人——拦不住，**而在于给好人一条快速通道**。它让可信订单跑得更快，从而把有限的人工审查资源腾给真正说不清来源的那些订单。

想通这一点，你才能理解为什么 DeepMind 反复强调这只是"瑞士奶酪里的一层"。

**第三，它能被抹掉，而且 Nature 的报道标题就在说这事。**

* **序列水印**：论文报告了针对 38,396 个结合体的重测序攻击，用一个不带水印的重测序器重新设计一遍，水印**大部分被移除**。虽然重测序会拉低估计的命中率，但如上一节所说——重测序之后的设计，常常结合得反而更好。翻译一下就是：**想抹掉水印的人，顺手还把蛋白优化了一版。**
* **结构水印**：扛得住数字噪声、刚性变换、裁剪。但论文报告，用 OpenMM + Amber99sb 力场做**受限结构松弛**，就能**成功摧毁水印**。

论文给自己定的目标说得非常克制：**"提高进入门槛，而不是保证绝对安全"（raise the barrier to entry rather than guarantee absolute security）。**

> 所以《自然》那篇配发报道才会直言"这个数字标记可以被擦掉"。这并不矛盾——**一个坦承自己防不住专业攻击、但能把攻击成本抬高一个量级的防御层，依然是有价值的防御层。**

## 我的判断

我写这篇的时候一直在想一件事：**这是不是又一个"用技术手段解决治理问题"的漂亮姿势？**

部分是的。坏人不会因为 DeepMind 加了水印就换一行代码填表单。

但有一部分我愿意给它加分，理由很具体：

这篇工作的开源姿态是真诚的。**代码、体外数据、模型权重都放出去了**（Apache 2.0），连"Photoshop 能删水印"的数据都自己写进论文了。它没有试图塑造一个"完美无缺的水印神话"，而是把"它能干什么、不能干什么、被捏了之后会发生什么"全部摊开。

**一个竞争对手可以直接拿着这套实现去改造自己的蛋白质模型。** 这让我想起了 SynthID 在数字内容领域的路线——谷歌不像是在当水印警察，更像是**在卖水**：定标准、给参考实现、然后让整个行业一起来用。

从 Android 到 Chromium 到现在的 SynthID，这套打法谷歌玩得很熟。而这次赌注比前几次都大：**这次的对象不是屏幕上那张图，是能自我复制的生命体。**

Demis Hassabis 在官宣那天说的话，我觉得没必要只是当公关稿看：

> "生物安全是 AI 时代最紧迫的挑战之一。把 SynthID 带到生物学领域，让 AI 生成的蛋白质可以带水印，是关键的一步——我们正在开源 SynthID Bio 工具，让研究社区能在这项工作上继续建设。"

有生之年见证"给蛋白质加水印"从概念变成 Nature 论文，说实话，比我预想的来得早。

**唯一的问题是：我们制定规则的速度，能不能跟上设计生命的速度。**

## 进阶

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
