Skip to content

认识 SynthID Bio:谷歌把水印打进蛋白质,然后发现洗掉水印的蛋白更强 ​

先说个我读完论文后笑出声的细节。

DeepMind 在《自然》的论文里,老老实实记录了一次针对自己的攻击实验:拿 38,396 个已经打好水印的蛋白质结合体,重新过一遍不带水印的序列设计模型——也就是俗称的"重测序攻击"——水印基本被洗干净了。

到这里都还算正常,水印技术被攻击掉不丢人。

真正有意思的是后半句:重测序之后得到的这批蛋白,结合亲和力经常比它爹还好。

我盯着这句话看了半天。这是一种非常体面的自我拆台:你精心搞了套水印系统,结果有人在破解它的时候,顺手把你的蛋白优化了一下。

但正是这种"敢把自己打脸数据写进论文"的操作,让我觉得这东西值得认真聊一聊。它不是公关稿,是个技术严谨度相当高的东西。

2026 年 9 月 30 日,Google DeepMind 在官方博客和《自然》同日发布了 SynthID Bio。论文标题《Function-preserving watermarking of AI-generated proteins》,博客署名 Pushmeet Kohli、David Stutz、Ali Cowen-Rivers、Jeremy Ratcliff。

一句话概括它干的事:这是人类第一次把"不可感知但可检测"的水印,塞进 AI 设计的蛋白质里,并且蛋白质还能正常工作。

先搞清楚它到底在救什么火 ​

在讲技术之前,必须先讲清楚这件事为什么重要。不然你很容易把它当成又一个"给 AI 内容打标签"的老套路。

事情是这样的。

假设你是个生物研究者,设计了一个自然界从未存在过的蛋白质,想把它做出来。你不能直接"打印"蛋白质,你得把对应的 DNA 序列发给DNA 合成公司(比如 Twist Bioscience),让他们合成,然后你在实验室里表达出来。

而合成公司不是给钱就干的。他们会拿你的订单去跟已知危险序列数据库比对——病原体、毒素之类的,命中就拦下来。

这套机制建立在一个默认前提上:

一个数据库里查不到的陌生序列,大概率是某种还没被人类发现过的天然生物。

生物学界靠这个假设运转了很多年。直到 AI 出现。

现在的蛋白质生成模型(AlphaProteo、ProteinMPNN)能设计出跟任何已知危险序列都不相似的全新分子。因为它们的氨基酸序列压根不是从自然进化里"发现"出来的,是被"设计"出来的——不存在于任何威胁数据库的黑名单上,恰恰因为它从来就没有在自然界存在过。

那个默认前提,塌了。

这不是我危言耸听。2025 年 10 月,Twist Bioscience 自己报告过一次测试结果:用 AI 设计出来的毒素和病毒蛋白变体,成功绕过了当时的标准筛查软件。 事后 Twist 打了补丁、升级了检测策略——但这是一次攻击已经发生之后的补救。

如果你想知道"真的会有人这么干吗"——合成公司筛不了的序列,只能靠人工逐条复核。而人工逐条复核,会让正常的生物学研究彻底停摆。

DeepMind 在博客里用了个很形象的词:瑞士奶酪模型。每一层防御都有洞,但你把多层叠起来,洞就不对齐了。SynthID Bio 就是往这摞奶酪里多加一层。

SynthID Bio 是什么 ​

SynthID Bio 不是单一技术,是一族(a family of)针对合成生物学设计的水印方法。

它是 SynthID 这条产品线的延伸——你可能在图片、音频、视频上见过这个名字(本站另一篇《认识 SynthID》讲过)。这次是把同一个思路搬进了生物学。

核心主张一句话:

水印不写在文件的元数据里,而是直接嵌进生物序列本身。所以它不仅在数字模型上能被验证,在被真正合成出来的那个实物蛋白上,同样能被验证。

这个区别是关键。给图片加元数据水印,截图一下就没了;给蛋白质加水印,它跟着这个分子走到天涯海角。

它提供两条互不替代的技术路线,分别对应蛋白质设计的两个环节:

维度SynthID Bio-sequence(序列侧)SynthID Bio-structure(结构侧)
作用对象氨基酸序列预测的 3D 原子坐标
实现方式在自回归解码时悄悄影响氨基酸选择微调 AlphaFold 3 扩散网络,写进模型权重
底座模型ProteinMPNN(改造版)AlphaFold 3(改造版)
需不需要改模型不需要,采样阶段可开关需要微调,且权重一旦公开就无法去除
是否需要post-processing否,解码时直接生成否,坐标天生自带信号
主要短板重测序攻击可基本抹除结构松弛(relaxation)可摧毁

序列侧的做法,是把 SynthID-Text 那套**锦标赛采样(tournament sampling)**移植到了 ProteinMPNN 上。原理其实挺朴素的:模型一个残基一个残基往外吐氨基酸,每个候选都有概率分;用一个密钥算种子,让候选两两"打比赛",胜者输出。检测方拿同一把密钥重算一遍,统计分数是否系统性偏高。

因为是纯采样阶段动手,模型完全不用重训。好处是热插拔,代价是——用户理论上也能把它关掉。

结构侧就硬多了。DeepMind 微调了 AlphaFold 3 扩散网络的一小部分,把水印能力烧进模型权重。这意味着:

无论谁拿着这个模型去跑,输出的结构都自动带水印。而且论文明确写着:一旦模型权重公开发布,这套水印流程就无法被移除。

这一句我认为是整个项目里最狠的一句。它把"可选择性"剥夺了——你接收模型就必须接收它的水印。

它凭什么说"不影响功能" ​

这是所有人听到"改了氨基酸/坐标"之后的第一反应:你这蛋白还能用吗?

DeepMind 用湿实验回答了这个问题,而且它的实验设计我觉得挺值得学。

设计流程:用自家的结合体设计方法 AlphaProteo 搭骨架,配一个启用了 SynthID Bio 的 ProteinMPNN 版本生成序列。

验证靶点:三个临床上都有明确意义的目标——

  • VEGF-A(血管内皮生长因子 A,肿瘤血管生成的核心靶点)
  • SARS-CoV-2 刺突蛋白受体结合域(RBD)(新冠那个经典靶点)
  • PD-L1(PD-1/PD-L1 免疫检查点通路的核心靶点)

实验量也不含糊:每个靶点用 15 个已知的 AlphaProteo 骨架,每种水印设置下跑出 222 条未加水印序列和 267 条加水印序列(已剔除对照组)。

结果:在这三个靶点上,带水印的设计在命中率、结合亲和力(KD)、自然序列多样性三个维度上,都与未加水印版本持平。

DeepMind 的原话是:成功创造了史上第一批带水印且具备生物功能的蛋白质结合体。

结构侧同样有硬数据:在 AlphaFold 3 自己的评测集上,假阳性率 0.1% 时,真实阳性率超过 99.8%;推荐配置在更严苛的 0.01% 假阳性率下仍有 98.99%。同时保持了预测精度和结构特征分布。

但接下来这段,是我最欣赏这篇论文的地方——它没藏拙,把对自己不利的数据也摊开了。

论文自己报告的两个瑕疵:

第一,在更宽松的结合阈值(KD ≤ 10⁻⁶)下,未加水印的结合体命中率显著高于"无损程度 0.5"那一档加水印的设置。换句话说,在宽松标准下它确实拖了后腿,只是在严格标准(KD ≤ 10⁻⁷)下两者没有显著差异。

第二,那个 100% 的真实阳性率,不完全是水印的功劳。里面有一部分来自"筛选"——弱标记的候选直接被丢掉了。在一项覆盖 23 个靶点、每个靶点 10,000 个样本的体外分析中,这套筛选让"非失真 0.5"设置在 0.1% 假阳性率下通过率下降 41.7%,意味着需要多生成 171.5% 的候选才能得到同样数量的合格设计。

我特别想把这段拎出来。很多人看技术宣传只看"检测率 100%",但真正决定你能不能用它的,是"为了达到这个 100%,你多付了两倍的算力"。DeepMind 把这笔账写在论文里,这叫诚实。

它能用在哪儿 ​

场景一:给 DNA 合成公司的订单做"快速通道"

这是主战场。合成公司拿到一个陌生订单,现在可以先查水印:这个设计来自于带了内置防护的可信模型吗?是的话,人工复核的优先级可以往后放一放,把精力集中到真正可疑的订单上。

Twist Bioscience 的政策与生物安全副总裁 James Diggans 在提前审读了论文后给的评价:

"对 Twist 来说,水印提供了一个很有前景的新工具……可以强化筛查,把资源集中到真正需要仔细审查的序列上,让生物安全在 AI 设计的生物学持续进步的同时变得更高效。"

生物安全政策专家 Sarah Carter 的视角更值得注意:

"通过把设计和模型开发者关联起来,这些水印让开发者能够在安全议题上带头,也让合成供应商可以为使用过这些模型的客户简化筛查流程。"

场景二:防止公共数据库被污染

蛋白质数据库(PDB)、UniProt、GenBank 这些公共库接受任何人提交。如果有 AI 设计的结构被误标成天然结构混进去,下游所有基于它做研究的人都会被带沟里。水印能在提交时就标记出"这是合成的"。

不过要说清楚:这目前还是个提议,不是已经上线的系统。

场景三:已经打到了基因组级别

这可能是最让人背后发凉、也最让人兴奋的一条。DeepMind 已经跟斯坦福大学 Hie 实验室和 Arc Institute 合作,把 SynthID Bio 集成进了基因组模型 Evo 2,并给一个 AI 设计的噬菌体(感染细菌的病毒)基因组打了水印。

早期的细菌培养测试显示:带水印的噬菌体仍然是有效的。

从单个蛋白质到一整个能自我复制的生命体基因组——这个跨度,得说一句"卧槽"。

上手:把代码拉下来跑跑 ​

DeepMind 这次开源给得挺痛快:代码、体外实验数据都公开了,模型权重向研究社区开放。仓库是 github.com/google-deepmind/synthidbio,Apache 2.0 许可(内置的 ProteinMPNN 是 MIT)。

序列侧的设计目标是即插即用替换现有的 ProteinMPNN,官方 README 说得很清楚:安装开销极小,只要打开水印开关就能生成带水印的序列。

在 Linux 上从零搭环境(抄自官方 README,推荐用 uv):

bash
# 1. 建虚拟环境并激活
uv venv synthid_bio --python 3.9
source synthid_bio/bin/activate

# 2. 装依赖
cd synthidbio_sequence
uv pip install -r requirements.txt

不用 uv 的话,标准 venv + pip 也行:

bash
python3.9 -m venv synthid_bio && source synthid_bio/bin/activate
pip install -r requirements.txt

结构侧稍麻烦:它是一个微调过的 AlphaFold 3 模型,下载权重和运行带水印的结构预测要走 AlphaFold 3 官方仓库 的完整流程。

提前打个预防针:这是研究性质代码,不是 pip install 完就能入库的生产组件。你要跑起来得有 Python 3.9 环境和一张还过得去的 GPU。别指望它跟装个 npm 包一样顺滑。

如果你不想折腾环境,只想先看看数据——体外(in vitro)实验数据是随论文一起开放的。

三件必须知道的事,不然会误判它 ​

第一,它是零比特(zero-bit)水印,不包含身份信息。

这句话的意思是:它只能告诉你"这个设计被打了水印",不能区分是哪个用户、哪家实验室。所以别指望它能当审计日志用。

密钥保密也是个约束。论文里明说:想要公开分发检测器或密钥,还需要公钥水印方向的进一步创新。而它这套可信工具框架,最直接适用的场景是通过托管接口部署的模型——也就是你自己下载权重离线跑,这套信任模型是打折扣的。

第二,它的主要目标不是"抓坏人"。

这点非常反直觉,但很重要。论文里明确反对把水印做成"惩罚性"机制(即检测到水印就给用户加码审查),理由是一针见血的:

一个恶意行为者,从一开始就会使用不带水印的工具。

所以水印的价值不在拦住坏人——拦不住,而在于给好人一条快速通道。它让可信订单跑得更快,从而把有限的人工审查资源腾给真正说不清来源的那些订单。

想通这一点,你才能理解为什么 DeepMind 反复强调这只是"瑞士奶酪里的一层"。

第三,它能被抹掉,而且 Nature 的报道标题就在说这事。

  • 序列水印:论文报告了针对 38,396 个结合体的重测序攻击,用一个不带水印的重测序器重新设计一遍,水印大部分被移除。虽然重测序会拉低估计的命中率,但如上一节所说——重测序之后的设计,常常结合得反而更好。翻译一下就是:想抹掉水印的人,顺手还把蛋白优化了一版。
  • 结构水印:扛得住数字噪声、刚性变换、裁剪。但论文报告,用 OpenMM + Amber99sb 力场做受限结构松弛,就能成功摧毁水印。

论文给自己定的目标说得非常克制:"提高进入门槛,而不是保证绝对安全"(raise the barrier to entry rather than guarantee absolute security)。

所以《自然》那篇配发报道才会直言"这个数字标记可以被擦掉"。这并不矛盾——一个坦承自己防不住专业攻击、但能把攻击成本抬高一个量级的防御层,依然是有价值的防御层。

我的判断 ​

我写这篇的时候一直在想一件事:这是不是又一个"用技术手段解决治理问题"的漂亮姿势?

部分是的。坏人不会因为 DeepMind 加了水印就换一行代码填表单。

但有一部分我愿意给它加分,理由很具体:

这篇工作的开源姿态是真诚的。代码、体外数据、模型权重都放出去了(Apache 2.0),连"Photoshop 能删水印"的数据都自己写进论文了。它没有试图塑造一个"完美无缺的水印神话",而是把"它能干什么、不能干什么、被捏了之后会发生什么"全部摊开。

一个竞争对手可以直接拿着这套实现去改造自己的蛋白质模型。 这让我想起了 SynthID 在数字内容领域的路线——谷歌不像是在当水印警察,更像是在卖水:定标准、给参考实现、然后让整个行业一起来用。

从 Android 到 Chromium 到现在的 SynthID,这套打法谷歌玩得很熟。而这次赌注比前几次都大:这次的对象不是屏幕上那张图,是能自我复制的生命体。

Demis Hassabis 在官宣那天说的话,我觉得没必要只是当公关稿看:

"生物安全是 AI 时代最紧迫的挑战之一。把 SynthID 带到生物学领域,让 AI 生成的蛋白质可以带水印,是关键的一步——我们正在开源 SynthID Bio 工具,让研究社区能在这项工作上继续建设。"

有生之年见证"给蛋白质加水印"从概念变成 Nature 论文,说实话,比我预想的来得早。

唯一的问题是:我们制定规则的速度,能不能跟上设计生命的速度。

进阶 ​

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

Gemini中文文档