水印不写在文件里,写在氨基酸里
谷歌 DeepMind 9 月 30 日在《自然》(Nature)发表经同行评审的论文「Function-preserving watermarking of AI-generated proteins」,介绍面向合成生物学的水印系统 SynthID Bio。与给图片、音频加水印不同,这次的签名不是叠在文件上,而是直接嵌进生物学密码本身——官方称水印「不仅在数字模型上可验证,在合成出来的物理蛋白质上同样可验证」。也就是说,一段 AI 设计的蛋白序列离开模型、在实验室被表达成真正的分子后,标记仍然跟着它走。
两条管线:序列水印与结构水印
系统分两部分。序列水印针对蛋白设计模型写出的氨基酸序列:研究团队在 DeepMind 自家的结合剂设计方法 AlphaProteo 之外,改造了学界广泛使用的序列生成工具 ProteinMPNN,使其在生成序列时嵌入统计意义上的签名,持有密钥的检测器可从成品序列中读出。结构水印则作用于三维预测:团队对 AlphaFold 3 扩散网络的一小部分做了微调,使预测出的原子坐标天然携带可检测签名——无论谁运行模型,输出的结构都带着出处。
选择这个方向有两个直接动因。官方在论文与博客中说明:AI 设计的新型蛋白可能绕过传统的 DNA 合成筛查环节,而标注失真的合成结构一旦混入公共数据库,会污染下游研究。水印被定位为分层防御中的一层,与模型层防护、客户审查并列;团队建议未来将其与 C2PA 一类的来源元数据或中央登记库配合使用。
湿实验验证:结合力不掉,检测不漏
关键问题是加水印会不会破坏蛋白功能。团队针对三个靶点重新设计了蛋白结合剂——包括新冠病毒刺突蛋白的受体结合域、参与血管生成的 VEGF-A 与参与免疫调控的 PD-L1,并与 Adaptyv Bio 合作做了体外验证。按论文自报口径:267 条带水印序列与 222 条对照序列在结合强度上无显著差异;检测器调至 0.1% 误报率时,对带水印序列全部检出,对带水印三维结构的检出率在 99.8% 以上,预测精度未受明显影响。官方把这批分子描述为此前没有先例的、带水印且具备生物功能的蛋白结合剂。
需要标注的是:上述数字均来自 DeepMind 自家的测量,论文未包含独立第三方的复现评估;湿实验在测量结合之前即完成,属于受控条件下的验证,不是真实世界的对抗测试。
抗篡改仍是短板
论文对局限说得相当直白。结构水印经标准的结构松弛处理即可被破坏,作者预期可通过在训练中显式考虑松弛来改进;序列水印也存在移除路径——把设计重新送回序列生成步骤即可冲掉签名,但由此产出的蛋白预计结合能力会下降。对蓄意篡改的鲁棒性被列为后续关键挑战。换句话说,目前的水印能防「无意丢失」与低门槛改动,防不了有算力、懂方法的对手刻意清洗,官方也坦承这是概念验证,用于生物安全筛查或数据库核验还需行业协同与标准建设。
从蛋白质到噬菌体基因组
DeepMind 同时透露了更进一步的动作:与斯坦福大学 Hie 实验室及 Arc 研究所合作,把 SynthID Bio 嵌入基因组模型 Evo 2,为一株人工设计的噬菌体全基因组加上水印,早期细菌培养实验确认这些噬菌体保持功能——这是水印头一回进入可复制的遗传物质,完整结果将在后续论文中发表。方法论文、体外数据与序列水印代码已在 GitHub 开源,结构模型的权重也向研究社区开放。
溯源缺口,比模型能力更急的问题
为这项工作提供评审意见的生物安全政策专家 Sarah Carter(Science Policy Consulting)称其为「追踪生物设计来源拼图中的重要一块」;Twist Bioscience 生物安全副总裁 James Diggans 评价水印是「生物安全工具有前景的新增项」。值得把时间线摆在一起看:过去一年 AI 设计蛋白的能力快速上升,而溯源与筛查体系仍以 DNA 合成商的白名单为主——生成端越来越快,核验端还是手工时代。SynthID Bio 的意义不在某个检出率数字,而在它验证了「功能与签名可以共存」这条技术路线;剩下的难点——抗篡改、行业采用、标准互认——没有一条是纯技术问题。目前官方及行业暂未披露更多落地细节,后续将持续跟进迭代动态。