给模型输出打水印,初衷很朴素:当一段文本或代码被怀疑是 AI 生成时,能追到它来自哪个模型。这是内容溯源的基建。但安全公司 Lasso 最近的一个发现给这件事泼了盆冷水——在智能体流水线里,水印不只标记了内容,还改了内容接下来的命运

上游模型 输出(无标记) 输出(带水印) 下游智能体 工具调用 / 拒绝 下游智能体 行为出现偏移 同一段输出,只差一个溯源标记,下游决策就可能不同——这就是观察者效应
图 1|水印本是为「溯源」而加,但在智能体流水线里,它成了会扰动被测对象的变量,类似评测里的观察者效应。

实验里发生了什么

Lasso 把同一段模型输出,分别带着水印、不带着水印,喂给下游智能体,观察它们在工具调用和拒绝(refusal)上的差异。结果是:带水印的输出,会让下游智能体在「要不要调某个工具」「要不要拒绝某个请求」上表现出可测量的不同。溯源标记这种本应「只读」的附加信息,在 agent 语境下变成了影响决策的隐变量。

增量认知:这本质是智能体世界的「观察者效应」——你为了观测系统而加的探针,本身改变了系统。过去我们担心水印被绕过、被伪造;现在要多担心一层:水印会不会让「被测的模型」不再是「真实部署里的模型」。

对评测与审计的牵连

这件事最扎心的地方在评测。今天大量智能体基准、红队测试、安全审计,都是在带水印的环境里跑的。如果水印本身会偏移行为,那么在这些环境里得到的结论,能不能直接外推到不带水印的生产环境,就要打问号。更麻烦的是,这种偏移往往不显眼——不是「报错」,而是「微妙地更保守或更冒进」。

该怎么看水印的价值

辩证地说,水印该不该有?当然该有,溯源在版权、责任认定、内容治理上都有不可替代的价值。问题不在于「要不要水印」,而在于在智能体语境里重新评估它的副作用:评测时要区分「带标记」和「不带标记」两套基线;对安全敏感的场景,最好能跑无标记对照组;把水印当作可能影响行为的变量,而不是透明的背景。

对做智能体安全的团队,这是个低成本但高价值的提醒:下一次看到「带水印环境里表现良好」的结论,先问一句——那是真实世界,还是被探针改过的世界。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。