认识 SynthID Bio:谷歌把水印打进蛋白质,然后发现洗掉水印的蛋白更强
先说个我读完论文后笑出声的细节。
DeepMind 在《自然》的论文里,老老实实记录了一次针对自己的攻击实验:拿 38,396 个已经打好水印的蛋白质结合体,重新过一遍不带水印的序列设计模型——也就是俗称的"重测序攻击"——水印基本被洗干净了。
到这里都还算正常,水印技术被攻击掉不丢人。
真正有意思的是后半句:重测序之后得到的这批蛋白,结合亲和力经常比它爹还好。
我盯着这句话看了半天。这是一种非常体面的自我拆台:你精心搞了套水印系统,结果有人在破解它的时候,顺手把你的蛋白优化了一下。
但正是这种"敢把自己打脸数据写进论文"的操作,让我觉得这东西值得认真聊一聊。它不是公关稿,是个技术严谨度相当高的东西。
2026 年 9 月 30 日,Google DeepMind 在官方博客和《自然》同日发布了 SynthID Bio。论文标题《Function-preserving watermarking of AI-generated proteins》,博客署名 Pushmeet Kohli、David Stutz、Ali Cowen-Rivers、Jeremy Ratcliff。
一句话概括它干的事:这是人类第一次把"不可感知但可检测"的水印,塞进 AI 设计的蛋白质里,并且蛋白质还能正常工作。
先搞清楚它到底在救什么火
在讲技术之前,必须先讲清楚这件事为什么重要。不然你很容易把它当成又一个"给 AI 内容打标签"的老套路。
事情是这样的。
假设你是个生物研究者,设计了一个自然界从未存在过的蛋白质,想把它做出来。你不能直接"打印"蛋白质,你得把对应的 DNA 序列发给DNA 合成公司(比如 Twist Bioscience),让他们合成,然后你在实验室里表达出来。
而合成公司不是给钱就干的。他们会拿你的订单去跟已知危险序列数据库比对——病原体、毒素之类的,命中就拦下来。
这套机制建立在一个默认前提上:
一个数据库里查不到的陌生序列,大概率是某种还没被人类发现过的天然生物。
生物学界靠这个假设运转了很多年。直到 AI 出现。
现在的蛋白质生成模型(AlphaProteo、ProteinMPNN)能设计出跟任何已知危险序列都不相似的全新分子。因为它们的氨基酸序列压根不是从自然进化里"发现"出来的,是被"设计"出来的——不存在于任何威胁数据库的黑名单上,恰恰因为它从来就没有在自然界存在过。
那个默认前提,塌了。
这不是我危言耸听。2025 年 10 月,Twist Bioscience 自己报告过一次测试结果:用 AI 设计出来的毒素和病毒蛋白变体,成功绕过了当时的标准筛查软件。 事后 Twist 打了补丁、升级了检测策略——但这是一次攻击已经发生之后的补救。
如果你想知道"真的会有人这么干吗"——合成公司筛不了的序列,只能靠人工逐条复核。而人工逐条复核,会让正常的生物学研究彻底停摆。
DeepMind 在博客里用了个很形象的词:瑞士奶酪模型。每一层防御都有洞,但你把多层叠起来,洞就不对齐了。SynthID Bio 就是往这摞奶酪里多加一层。
SynthID Bio 是什么
SynthID Bio 不是单一技术,是一族(a family of)针对合成生物学设计的水印方法。
它是 SynthID 这条产品线的延伸——你可能在图片、音频、视频上见过这个名字(本站另一篇《认识 SynthID》讲过)。这次是把同一个思路搬进了生物学。
核心主张一句话:
水印不写在文件的元数据里,而是直接嵌进生物序列本身。所以它不仅在数字模型上能被验证,在被真正合成出来的那个实物蛋白上,同样能被验证。
这个区别是关键。给图片加元数据水印,截图一下就没了;给蛋白质加水印,它跟着这个分子走到天涯海角。
它提供两条互不替代的技术路线,分别对应蛋白质设计的两个环节:
| 维度 | SynthID Bio-sequence(序列侧) | SynthID Bio-structure(结构侧) |
|---|---|---|
| 作用对象 | 氨基酸序列 | 预测的 3D 原子坐标 |
| 实现方式 | 在自回归解码时悄悄影响氨基酸选择 | 微调 AlphaFold 3 扩散网络,写进模型权重 |
| 底座模型 | ProteinMPNN(改造版) | AlphaFold 3(改造版) |
| 需不需要改模型 | 不需要,采样阶段可开关 | 需要微调,且权重一旦公开就无法去除 |
| 是否需要post-processing | 否,解码时直接生成 | 否,坐标天生自带信号 |
| 主要短板 | 重测序攻击可基本抹除 | 结构松弛(relaxation)可摧毁 |
序列侧的做法,是把 SynthID-Text 那套**锦标赛采样(tournament sampling)**移植到了 ProteinMPNN 上。原理其实挺朴素的:模型一个残基一个残基往外吐氨基酸,每个候选都有概率分;用一个密钥算种子,让候选两两"打比赛",胜者输出。检测方拿同一把密钥重算一遍,统计分数是否系统性偏高。
因为是纯采样阶段动手,模型完全不用重训。好处是热插拔,代价是——用户理论上也能把它关掉。
结构侧就硬多了。DeepMind 微调了 AlphaFold 3 扩散网络的一小部分,把水印能力烧进模型权重。这意味着:
无论谁拿着这个模型去跑,输出的结构都自动带水印。而且论文明确写着:一旦模型权重公开发布,这套水印流程就无法被移除。
这一句我认为是整个项目里最狠的一句。它把"可选择性"剥夺了——你接收模型就必须接收它的水印。
它凭什么说"不影响功能"
这是所有人听到"改了氨基酸/坐标"之后的第一反应:你这蛋白还能用吗?
DeepMind 用湿实验回答了这个问题,而且它的实验设计我觉得挺值得学。
设计流程:用自家的结合体设计方法 AlphaProteo 搭骨架,配一个启用了 SynthID Bio 的 ProteinMPNN 版本生成序列。
验证靶点:三个临床上都有明确意义的目标——
- VEGF-A(血管内皮生长因子 A,肿瘤血管生成的核心靶点)
- SARS-CoV-2 刺突蛋白受体结合域(RBD)(新冠那个经典靶点)
- PD-L1(PD-1/PD-L1 免疫检查点通路的核心靶点)
实验量也不含糊:每个靶点用 15 个已知的 AlphaProteo 骨架,每种水印设置下跑出 222 条未加水印序列和 267 条加水印序列(已剔除对照组)。
结果:在这三个靶点上,带水印的设计在命中率、结合亲和力(KD)、自然序列多样性三个维度上,都与未加水印版本持平。
DeepMind 的原话是:成功创造了史上第一批带水印且具备生物功能的蛋白质结合体。
结构侧同样有硬数据:在 AlphaFold 3 自己的评测集上,假阳性率 0.1% 时,真实阳性率超过 99.8%;推荐配置在更严苛的 0.01% 假阳性率下仍有 98.99%。同时保持了预测精度和结构特征分布。
但接下来这段,是我最欣赏这篇论文的地方——它没藏拙,把对自己不利的数据也摊开了。
论文自己报告的两个瑕疵:
第一,在更宽松的结合阈值(KD ≤ 10⁻⁶)下,未加水印的结合体命中率显著高于"无损程度 0.5"那一档加水印的设置。换句话说,在宽松标准下它确实拖了后腿,只是在严格标准(KD ≤ 10⁻⁷)下两者没有显著差异。
第二,那个 100% 的真实阳性率,不完全是水印的功劳。里面有一部分来自"筛选"——弱标记的候选直接被丢掉了。在一项覆盖 23 个靶点、每个靶点 10,000 个样本的体外分析中,这套筛选让"非失真 0.5"设置在 0.1% 假阳性率下通过率下降 41.7%,意味着需要多生成 171.5% 的候选才能得到同样数量的合格设计。
我特别想把这段拎出来。很多人看技术宣传只看"检测率 100%",但真正决定你能不能用它的,是"为了达到这个 100%,你多付了两倍的算力"。DeepMind 把这笔账写在论文里,这叫诚实。
它能用在哪儿
场景一:给 DNA 合成公司的订单做"快速通道"
这是主战场。合成公司拿到一个陌生订单,现在可以先查水印:这个设计来自于带了内置防护的可信模型吗?是的话,人工复核的优先级可以往后放一放,把精力集中到真正可疑的订单上。
Twist Bioscience 的政策与生物安全副总裁 James Diggans 在提前审读了论文后给的评价:
"对 Twist 来说,水印提供了一个很有前景的新工具……可以强化筛查,把资源集中到真正需要仔细审查的序列上,让生物安全在 AI 设计的生物学持续进步的同时变得更高效。"
生物安全政策专家 Sarah Carter 的视角更值得注意:
"通过把设计和模型开发者关联起来,这些水印让开发者能够在安全议题上带头,也让合成供应商可以为使用过这些模型的客户简化筛查流程。"
场景二:防止公共数据库被污染
蛋白质数据库(PDB)、UniProt、GenBank 这些公共库接受任何人提交。如果有 AI 设计的结构被误标成天然结构混进去,下游所有基于它做研究的人都会被带沟里。水印能在提交时就标记出"这是合成的"。
不过要说清楚:这目前还是个提议,不是已经上线的系统。
场景三:已经打到了基因组级别
这可能是最让人背后发凉、也最让人兴奋的一条。DeepMind 已经跟斯坦福大学 Hie 实验室和 Arc Institute 合作,把 SynthID Bio 集成进了基因组模型 Evo 2,并给一个 AI 设计的噬菌体(感染细菌的病毒)基因组打了水印。
早期的细菌培养测试显示:带水印的噬菌体仍然是有效的。
从单个蛋白质到一整个能自我复制的生命体基因组——这个跨度,得说一句"卧槽"。
上手:把代码拉下来跑跑
DeepMind 这次开源给得挺痛快:代码、体外实验数据都公开了,模型权重向研究社区开放。仓库是 github.com/google-deepmind/synthidbio,Apache 2.0 许可(内置的 ProteinMPNN 是 MIT)。
序列侧的设计目标是即插即用替换现有的 ProteinMPNN,官方 README 说得很清楚:安装开销极小,只要打开水印开关就能生成带水印的序列。
在 Linux 上从零搭环境(抄自官方 README,推荐用 uv):
# 1. 建虚拟环境并激活
uv venv synthid_bio --python 3.9
source synthid_bio/bin/activate
# 2. 装依赖
cd synthidbio_sequence
uv pip install -r requirements.txt不用 uv 的话,标准 venv + pip 也行:
python3.9 -m venv synthid_bio && source synthid_bio/bin/activate
pip install -r requirements.txt结构侧稍麻烦:它是一个微调过的 AlphaFold 3 模型,下载权重和运行带水印的结构预测要走 AlphaFold 3 官方仓库 的完整流程。
提前打个预防针:这是研究性质代码,不是
pip install完就能入库的生产组件。你要跑起来得有 Python 3.9 环境和一张还过得去的 GPU。别指望它跟装个 npm 包一样顺滑。
如果你不想折腾环境,只想先看看数据——体外(in vitro)实验数据是随论文一起开放的。
三件必须知道的事,不然会误判它
第一,它是零比特(zero-bit)水印,不包含身份信息。
这句话的意思是:它只能告诉你"这个设计被打了水印",不能区分是哪个用户、哪家实验室。所以别指望它能当审计日志用。
密钥保密也是个约束。论文里明说:想要公开分发检测器或密钥,还需要公钥水印方向的进一步创新。而它这套可信工具框架,最直接适用的场景是通过托管接口部署的模型——也就是你自己下载权重离线跑,这套信任模型是打折扣的。
第二,它的主要目标不是"抓坏人"。
这点非常反直觉,但很重要。论文里明确反对把水印做成"惩罚性"机制(即检测到水印就给用户加码审查),理由是一针见血的:
一个恶意行为者,从一开始就会使用不带水印的工具。
所以水印的价值不在拦住坏人——拦不住,而在于给好人一条快速通道。它让可信订单跑得更快,从而把有限的人工审查资源腾给真正说不清来源的那些订单。
想通这一点,你才能理解为什么 DeepMind 反复强调这只是"瑞士奶酪里的一层"。
第三,它能被抹掉,而且 Nature 的报道标题就在说这事。
- 序列水印:论文报告了针对 38,396 个结合体的重测序攻击,用一个不带水印的重测序器重新设计一遍,水印大部分被移除。虽然重测序会拉低估计的命中率,但如上一节所说——重测序之后的设计,常常结合得反而更好。翻译一下就是:想抹掉水印的人,顺手还把蛋白优化了一版。
- 结构水印:扛得住数字噪声、刚性变换、裁剪。但论文报告,用 OpenMM + Amber99sb 力场做受限结构松弛,就能成功摧毁水印。
论文给自己定的目标说得非常克制:"提高进入门槛,而不是保证绝对安全"(raise the barrier to entry rather than guarantee absolute security)。
所以《自然》那篇配发报道才会直言"这个数字标记可以被擦掉"。这并不矛盾——一个坦承自己防不住专业攻击、但能把攻击成本抬高一个量级的防御层,依然是有价值的防御层。
我的判断
我写这篇的时候一直在想一件事:这是不是又一个"用技术手段解决治理问题"的漂亮姿势?
部分是的。坏人不会因为 DeepMind 加了水印就换一行代码填表单。
但有一部分我愿意给它加分,理由很具体:
这篇工作的开源姿态是真诚的。代码、体外数据、模型权重都放出去了(Apache 2.0),连"Photoshop 能删水印"的数据都自己写进论文了。它没有试图塑造一个"完美无缺的水印神话",而是把"它能干什么、不能干什么、被捏了之后会发生什么"全部摊开。
一个竞争对手可以直接拿着这套实现去改造自己的蛋白质模型。 这让我想起了 SynthID 在数字内容领域的路线——谷歌不像是在当水印警察,更像是在卖水:定标准、给参考实现、然后让整个行业一起来用。
从 Android 到 Chromium 到现在的 SynthID,这套打法谷歌玩得很熟。而这次赌注比前几次都大:这次的对象不是屏幕上那张图,是能自我复制的生命体。
Demis Hassabis 在官宣那天说的话,我觉得没必要只是当公关稿看:
"生物安全是 AI 时代最紧迫的挑战之一。把 SynthID 带到生物学领域,让 AI 生成的蛋白质可以带水印,是关键的一步——我们正在开源 SynthID Bio 工具,让研究社区能在这项工作上继续建设。"
有生之年见证"给蛋白质加水印"从概念变成 Nature 论文,说实话,比我预想的来得早。
唯一的问题是:我们制定规则的速度,能不能跟上设计生命的速度。
进阶
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档