Skip to content

Gemini 文本水印:你复制的那段 AI 代码,正在被偷偷盖章

说个有点瘆人的事。

你现在让 Gemini 或 Claude 给你写一段代码,它吐出来的每一个字,都已经不是它"本来想写"的那个版本了

不是比喻。是字面意义上的:模型在选词的时候被人为拧了一下方向盘,让最终输出的词序带上一个肉眼看不见、但机器能统计出来的偏斜。目的只有一个——将来有人拿这段文本去验,能验出"这是 AI 写的"

而你,从头到尾没有被问过要不要。

这事在 2026 年 8 月之后突然变成了默认设置。导火索不在硅谷,在布鲁塞尔。

事情是怎么闹起来的

把时间线捋一遍,你会发现整个过程快得像被推着走:

时间事件
2026 年 7 月 20 日欧盟委员会定稿《通用 AI 实践准则》
2026 年 7 月 24 日谷歌签署该准则
2026 年 7 月 31 日OpenAI 给生成的音频加溯源信号
2026 年 8 月 2 日《AI 法案》第 50 条正式生效
2026 年 8 月上旬Anthropic 官宣:此后发布的 Claude 模型全量加水印
2026 年 9 月 9 日arXiv 论文实测 SynthID-Text,争议彻底公开化
2026 年 12 月 2 日老模型的提供方侧标记义务宽限期截止
2027 年 2 月 2 日跨厂商检测互操作性要求生效

第 50 条说得很直白:生成式 AI 的提供方,必须以机器可读的方式标记自己系统产出的内容,并且保证这些标记能被检测出来。罚则是最高 1500 万欧元,或全球年营业额的 3%,取更高的那个

1500 万欧元对大厂来说也就是个季度电费。3% 的全球营收不是。这个数字,比任何一条原则都更能解释后面发生的所有事。

配套的《实践准则》还给了具体要求:音频、图像、视频至少要有两层标记;自由文本超过 200 个 token 必须加水印。有意思的是准则自己都承认——文本短的时候可靠性会明显下降,所以才划了 200 token 这条线。

8 月 2 日之后没几天,Anthropic 先动了。它官宣:此后发布的每一个 Claude 模型,都在全部生成文本里嵌入基于 SynthID-Text 的水印,默认开启,没有关闭选项。

用户当场炸锅。有意思的是骂声还自相矛盾——一拨人说"这玩意儿把代码写烂了",另一拨人说"这玩意儿我复制粘贴一下就没了",还有一拨人说"它在偷偷编码我的身份信息"。厂商回应三连:质量没变、不编码身份、轻度编辑也扛得住。

三方都在下结论,但谁都拿不出证据。 这就是 9 月 9 日那篇论文要说的核心。

什么是 SynthID-Text

SynthID 是 Google DeepMind 做的隐形水印技术家族,覆盖图像、视频、音频、文本四种模态。SynthID-Text 就是文本那一路,2024 年 5 月 I/O 上随文本扩展一起亮相,算法同年 10 月通过 DeepMind 的 GitHub 和 Hugging Face 开源。

一句话版本:它在模型采样选词的环节动手脚,让输出的词序列带上一个可统计的偏置,不重训模型,人不读得出来。

拆开看,它和图片水印的思路完全是两回事:

  • 图像/视频/音频是"后期加编码器"——内容生成完之后,往像素、波形里塞信号
  • 文本没有像素可塞,只能在生成过程本身里做文章

这个差别很关键。图片水印是"给成品打钢印",文本水印是"让作者在写字的时候就不自觉地用了某种笔顺"。

技术细节上,SynthID-Text 用的方法叫 Tournament Sampling(锦标赛采样),2024 年发表在 Nature 上。它的关键优势是——只改采样阶段,模型完全不用重训。这也是它能被塞进 Claude 的原因:Anthropic 拿过去,改改就能用,不需要动自己的模型权重。

顺便说一句,谷歌给 Gemini 加文本水印这事,从 2024 年就开始了,比欧盟法案整整早了两年。所以当全网在骂 Claude 的时候,Gemini 用户其实已经被盖了两年章,只是没人察觉。这才是真正细思极恐的地方。

它到底怎么塞进去的

不用公式,讲人话。

大模型是一个词一个词往外蹦的。每蹦一个词,模型都会给词表里所有候选词打一个概率分。比如"我最喜欢的热带水果是芒果和……",后面接"香蕉"的概率远高于接"飞机"。

SynthID-Text 干的事是:在采样那一刻,拿前面已经生成的词加一个密钥算出随机种子,把候选词两两分组"打比赛",按一套评分函数决出胜者输出。

比赛规则本身是公开的,但密钥不公开。所以:

  • 加水印的一方:知道密钥,能按这套规则生成,也能反推检测
  • 不知道密钥的人:看到的只是一段完全正常的文本,读不出任何异常

检测时不需要重跑生成,只要拿密钥去统计这段文本的"比赛得分"是否系统性偏高。偏高到一定程度,就判定为带水印。

这就是论文里那个反复出现的比喻——它像 DNA,不像标签。标签能撕,DNA 在序列里。

那它会不会让 AI 变笨

终于到了所有人最关心的问题。我把目前能拿到的两组数据摆出来,你自己判断。

第一组,谷歌自己的(2024 年论文):

谷歌团队把 Gemini 用户的提问随机分给带水印和不带水印两个版本,然后比用户反馈。在 2000 万条回答的规模上,两组的用户反馈没有显著差异

这个实验设计其实挺扎实的——随机分配、真实用户、两千万样本。但它是厂商自证。

第二组,第三方实测(arXiv 2609.09604,2026 年 9 月 9 日提交):

三位研究者(Alexander Nemecek、Vipin Chaudhary、Erman Ayday)决定自己测。但有个前提困难:部署在线上的系统根本没法测——没有公开工具能直接验 Gemini 或 Claude 的输出。所以他们只能拿开源版 SynthID-Text 实现,跑在两个开放权重模型上。

结论分两半:

维度实测结果
散文质量水印带来的影响不超过换一个随机种子
代码质量一个模型正确性掉 3 个百分点,另一个低于测量精度
检测率接近随机猜测(near chance)

读到这儿你大概会说:那不就是"水印基本无害"吗?

别急,最后一行才是炸弹。

论文明确指出:代码上确实能测到代价,但真正的短板是检测率接近随机——这是可检测性的问题,不是质量的问题。也就是说,你可能为这个水印付出了 3 个点的代码正确率,换来的却是一个大概率验不出来的章

这就是我觉得整件事最荒诞的地方。我们集体接受了一个"轻微损害输出"的方案,理由是它能帮我们识别 AI 内容——结果它在短文本上根本识别不准。代价是真的,收益是打折的。

还有一个边缘情况值得单独拎出来。Meta 的 AI 研究科学家 Vinu Sankar Sadasivan(他是那篇被广泛引用的水印可检测性论文的共同作者)说过一段很实在的话:

"对于一条 20 个词的推文,我需要让 50% 到 60% 的词来自'绿名单',才能让水印被良好检测到。"

20 个词,要拧一半以上。你想想这改动量有多大。而一条基础 Python 函数也会撞上同样的矛盾——可选的词越少,水印越难藏,要么牺牲质量,要么牺牲强度,二选一。

谷歌自己的论文里也画了这条曲线:检测率最高能到 95%,但短回答会掉到 50% 以下。50% 以下是什么概念?抛硬币。

各家大厂的水印进度表

截至 2026 年 9 月上旬,各家的姿势差别挺大,值得存一份:

厂商图像/视频音频文本备注
GoogleSynthID + C2PASynthIDSynthID-Text,2024 年起资历最老;Detector 门户仍在 waitlist
Anthropic全量,默认开,无关闭项基于 SynthID-Text,未公开改动细节
OpenAIC2PA + SynthID 像素(2026-05-19 起)2026-07-31 起尚无,官方措辞"目标是扩展"准则要求 12 月 2 日前补上
MetaC2PA + 深度学习水印未确认7 月 28 日签署准则
Microsoft / Mistral未公开均已签署
xAI唯一未签署的西方主要实验室

两个观察:

第一,xAI 没签,但跑不掉。 第 50 条约束的是所有在欧盟提供服务的提供方,签不签那份自愿准则都得自己证明合规。

第二,开源权重模型是整个方案的真空区。 DeepSeek、Qwen,以及任何你能跑在自己显卡上的模型,全都不带水印,准则对此毫无办法。原因很朴素——水印是提供方在推理那一刻许下的承诺。你自己握着权重,你就没许过这个承诺。

这个洞不是技术能补的,是治理结构的问题。

对普通人和开发者,实际影响是什么

讲完宏观,落到具体。

场景一:你是个写代码的人。 如果你用 AI 生成的短代码片段,水印的检出率很低,所以"被抓到"的风险其实不高;但那 3 个点的正确性损失是真实存在的。建议:核心逻辑、边界条件、并发相关的代码,别直接信。

场景二:你在做内容平台。 Google Cloud 正在预览一个 AI Content Detection API,可信测试方包括 Shutterstock、Snap、Canva、Fox Sports。YouTube 已经把 SynthID 和 C2PA 信号当作 AI 标签的自动触发器,而且这些标签上传者不能改

场景三:你在做商业投放。 有个数据值得记住:NYU Stern 的一个数字被 IAB 引用——AI 标签会让点击率下降 31.5%。所以"合规"不是免费的,它有可测量的商业成本。

场景四:你在欧盟有业务。 别只盯着提供方。部署方的义务从 8 月 2 日就生效了,没有宽限期。 而 8 月 2 日之前生成的内容不需要追溯打标。

怎么验证,以及现在的尴尬

普通用户能走的路其实不多,我按可用性排个序:

  1. 在 Gemini 里直接问——上传图片、视频或音频,问它"这是不是 Google AI 生成的",Gemini 会查 SynthID 水印并告诉你结果。这是目前最省事的路径。
  2. SynthID Detector 门户——上传图片/视频/音频验证。但它还在 waitlist 阶段,优先给记者和研究人员。
  3. 文本?目前没有公开检测入口。 谷歌的 Detector 覆盖图像、视频、音频,不含文本。你想验一段文字,暂时没地方去。

第三点是我认为整件事最说不过去的地方。要求所有人不打折扣地给文本盖章,却不给公众一个验章的工具。

那篇 arXiv 论文的标题起得很准:Watermarks Without Verification——"没有验证的水印"。作者的核心论点不是"水印坏",而是:

反对者的指控和厂商的保证,目前双方都无法被验证。而这个"不可验证性"本身,才是实质性的治理失败。

他们开了五条药方:发布配对输出(同一 prompt 的开/关水印版本)、披露配置参数、引入认证审计、建立共享评测协议、实现可互操作的检测。

五条里没有一条是技术难题。全是愿不愿意的问题。

顺带说说中国

国内读者可能不知道,中国在这件事上动手最早也最硬。《人工智能生成合成内容标识办法》2025 年 9 月 1 日就已施行,要求显式标识 + 隐式标识双管齐下——隐式标识要嵌在文件元数据里。

对比欧盟的"200 token 以上文本才需要",国内的要求覆盖面更广。所以如果你在做面向国内用户的内容产品,标识合规这块得单独查一遍,别拿欧盟标准当通用解。

我的立场

我不反对水印。在 AI 内容已经泛滥到真假难辨的 2026 年,有个技术手段能溯源,方向是对的。

但我对现在这个版本有意见,三条:

第一,默认开启且不可关闭,这个设计是偷懒的。 尤其对代码场景——我要的是一个能跑的函数,不是一个"能证明自己是 AI 写的"的函数。这两件事的优先级在绝大多数工程场景下是前者。

第二,检测和标记投入严重不对等。 全行业花了大力气保证"每个 token 都被盖章",却没人保证"任何人都能验章"。这不叫溯源体系,这叫单向记账

第三,开源模型这块结构性空白,迟早会把整套制度架空。 如果合规的企业在水印上花钱、掉质量、降点击率,而不合规的开源模型什么都不用做,长期看这是逆向淘汰

最讽刺的一幕是:用户在骂"水印把代码写烂了",厂商在说"质量完全没变",两边都拿不出能服众的证据——因为没有独立第三方能测到线上系统。

这不是技术做不到,是没人要求做到。

进阶

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

Gemini中文文档