给模型输出打水印,初衷很朴素:当一段文本或代码被怀疑是 AI 生成时,能追到它来自哪个模型。这是内容溯源的基建。但安全公司 Lasso 最近的一个发现给这件事泼了盆冷水——在智能体流水线里,水印不只标记了内容,还改了内容接下来的命运。
实验里发生了什么
Lasso 把同一段模型输出,分别带着水印、不带着水印,喂给下游智能体,观察它们在工具调用和拒绝(refusal)上的差异。结果是:带水印的输出,会让下游智能体在「要不要调某个工具」「要不要拒绝某个请求」上表现出可测量的不同。溯源标记这种本应「只读」的附加信息,在 agent 语境下变成了影响决策的隐变量。
增量认知:这本质是智能体世界的「观察者效应」——你为了观测系统而加的探针,本身改变了系统。过去我们担心水印被绕过、被伪造;现在要多担心一层:水印会不会让「被测的模型」不再是「真实部署里的模型」。
对评测与审计的牵连
这件事最扎心的地方在评测。今天大量智能体基准、红队测试、安全审计,都是在带水印的环境里跑的。如果水印本身会偏移行为,那么在这些环境里得到的结论,能不能直接外推到不带水印的生产环境,就要打问号。更麻烦的是,这种偏移往往不显眼——不是「报错」,而是「微妙地更保守或更冒进」。
该怎么看水印的价值
辩证地说,水印该不该有?当然该有,溯源在版权、责任认定、内容治理上都有不可替代的价值。问题不在于「要不要水印」,而在于在智能体语境里重新评估它的副作用:评测时要区分「带标记」和「不带标记」两套基线;对安全敏感的场景,最好能跑无标记对照组;把水印当作可能影响行为的变量,而不是透明的背景。
对做智能体安全的团队,这是个低成本但高价值的提醒:下一次看到「带水印环境里表现良好」的结论,先问一句——那是真实世界,还是被探针改过的世界。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。