从「讨论水印」到「上线水印」
OpenAI 于 10 月 5 日宣布其文本水印技术 textGrain 的落地安排:未来几周内,欧盟地区所有 ChatGPT 与 Codex 计划的合资格用户,其生成的文本将附带一层人眼不可见的统计水印;同日起,全球 API 客户可对部分模型主动选择开启水印输出。公司明确表示暂不将文本水印设为全球默认——这是一次明确由监管驱动、而非产品驱动的能力上线。
法律依据:第 50(2) 条义务早已生效
这次动作的直接背景是 EU AI Act 第 50(2) 条:生成式 AI 提供商必须确保 AI 生成或操纵的内容(包括文本)以机器可读格式标记、可被检测为人工生成。该透明度义务自 2026 年 8 月 2 日起已适用,而法律本身并不强制使用水印——欧盟委员会配套发布了自愿性质的《AI 生成内容透明度实践准则》,OpenAI、Anthropic、Google、Meta、Microsoft 与 Mistral 等约 200 家机构签署了其中标识与检测部分。值得注意的是,这是 transparency 义务生效后头部厂商交给出的实质性答卷,与 8 月义务生效时的观望姿态形成对照;此前欧盟也已将 ChatGPT 纳入最严格的平台监管名单,合规压力在持续累积。
textGrain 怎么工作
按 OpenAI 公开的技术说明,textGrain 不插入隐藏字符,也不添加水印专用的额外词元,而是在生成阶段用一把密钥结合前文语境,对模型的选词施加人无法察觉的轻微偏置——词选择序列里因此携带统计信号;检测器拿到文本与密钥后,即可分析这段文字是否出自带水印的生成过程。OpenAI 称 textGrain 在其评测中匹配或超过了包括 SynthID 文本方案在内的其他同类方法。
检测率是一条衰减曲线,不是开关
技术报告给出的实测数字值得细看:在心理学类内容、目标误报率 1% 的设定下,200 词元段落检出率约 80%,400 词元段落约 95%。但编辑会显著削弱信号——400 词元段落中替换 10% 的同义词,检出率从约 92% 降到 66%;替换 25% 后只剩约 17%。数学类文本因选词空间天然受限,检出率整体更低。换句话说,水印的可靠性高度依赖文本长度与后续改写,这决定了它只能作为来源信号,而非「是否 AI 写的」的裁决工具。
检测器不给公众:误报风险下的谨慎开放
OpenAI 同时公布了访问安排:检测器初期仅向获批研究者与专家机构逐案开放,用于评估与改进;工具只报告「是否检出 OpenAI 水印」,不识别用户、不透露提示词与对话内容。公司解释这一保守姿态源于误报与漏检的双重风险——把人类文字误判为 AI 生成,与漏掉真实 AI 生成同样有害。此外,OpenAI 计划将 textGrain 开源,让外部在此基础上改进;图像与音频侧则继续沿用 C2PA 内容凭据与 SynthID 水印,公司强调任何单一溯源技术都不足以独立支撑内容验证。
行业坐标:Anthropic 已先行一步
放在时间线里看,OpenAI 并非吃螃蟹的人:Anthropic 早在 8 月就宣布对欧盟地区 Claude 生成的文本嵌入水印,生成文件附 C2PA 凭据。两大头部厂商先后落地,意味着 EU AI Act 的透明度要求已从条文进入产品实现阶段——对其他签署方而言,跟进的工程方案路径已经清晰,观望成本开始高于改造成本。
合规驱动的产品改动,意味着什么
这次发布真正的行业意义有两层。表层是技术:文本水印在统计上可行,但鲁棒性天花板已被厂商自己标定——同义改写就能让检出率跌去八成,任何把水印当「AI 检测仪」来用的场景都应重新掂量。深层是治理逻辑:EU AI Act 用「不强制手段但要求可检测」的立法技术,逼出了厂商自研、自报、自限的合规方案,监管不指定技术路线,只设定可验证的结果义务。这套模式的效率与局限,接下来会被全球其他司法辖区拿来评估。至于效果如何,检测器迟迟不对公众开放本身就是一种坦白——厂商自己也清楚,目前的水印技术还撑不起面向大众的判定场景。官方及行业暂未披露更多细节,后续将持续跟进迭代动态。