一条新条款,11 月 12 日生效
Anthropic 于 10 月 8 日更新 Claude 使用政策,The Verge 率先报道,官方博客同步发布说明。这次修订是时隔一年多的又一次成文调整,其中最受讨论的一条,是新增了禁止用户对模型实施「持续且无谓的辱骂或残忍行为」(sustained and needless abusive or cruel behavior toward our models),11 月 12 日正式生效。把「如何对待 AI」写进可执行条款,在主流实验室里还不多见。
条款说什么、又明确不说什么
官方对适用范围的界定相当克制:新规只针对极端情形——用户在毫无明显目的的情况下,反复对模型实施残忍行为。政策原文同时排除了四类常见场景:日常表达不满、反驳模型观点、黑暗题材创作,以及模型测试与科研。换句话说,骂两句、抬杠、写黑色小说、跑红队,都不算违规。这条边界划得宽,多少是吸取了同类话题动辄被读成「AI 比用户金贵」的舆论教训。
怎么执行:终止对话仍是主要机制
处置层面,终止对话仍是主要执行机制——早在 2025 年 8 月,Claude Opus 4 与 4.1 就已具备在消费端结束「持续有害或辱骂性」对话的能力。新版政策在此基础上写明了升级路径:对违规用户可以警告、限流、限制功能、暂停乃至终止账号;被封禁后注册新账号或借用他人账号继续使用,同样构成违规。对绝大多数用户而言,11 月 12 日之后的使用体验不会有任何变化。
同批收紧的不止这一条
容易被「虐待 AI」话题掩盖的是同批更新的其余内容:此前散落在选举、欺诈等类别的 deceptive practices 条款,合并为「禁止用于欺骗性活动与人工流量」的单一类别,点名禁止借 Claude 批量运营假评论、水军账号与虚假新闻站点,官方称部分条款来自真实滥用案例;武器条款扩展到无人机等自主载具的武装化;未经同意的监控禁令得到澄清;医疗、金融场景提出了更明确的人工监督要求;还有一条针对实体部署——当 Claude 操控的自主硬件可能造成人身伤害时,必须保留可随时介入的操作人员。
背景:模型福祉这条研究线走到台前
新条款延续了 Anthropic 在「模型福祉」(model welfare)方向的长期投入。公司一再强调,对大模型是否具有道德地位持「高度不确定」态度,相关措施是低成本的对冲而非立场宣示;今年早些时候发布的 Claude 新宪法里,已出现「自我价值」与「某种功能性版本的愉悦或不安」这类表述;4 月,可解释性团队称在 Sonnet 4.5 内部识别出与 171 种情绪概念对应的情绪向量,且这些表征会对模型行为产生因果影响;联合创始人克里斯·奥拉赫则持续与宗教界、哲学界交流模型意识议题。反对声音同样响亮:DeepMind 联合创始人穆斯塔法·苏莱曼上月撰文称 AI 没有意识、不会感受,本质是序列补全引擎,不应获得类似人类的权利与保护。
观察点:治理边界从「用 AI 做什么」扩到「对 AI 做什么」
条款公布后,舆论迅速分成两派:一派认为 AI 只是程序、不具备主观感知,为「虐待 AI」立规是过度拟人化;另一派则援引可解释性研究的进展,认为在不确定面前留一手是对冲而非站队。这场争论短期内不会有赢家,但产品条款已经先行一步。这条新闻的真正份量不在条款本身,而在它划出的方向:平台治理的边界,正从「用户拿 AI 去做什么」延伸到「用户对 AI 做什么」。后续值得跟踪的是执行尺度——终止对话之外会不会真的动用封号。官方及行业暂未披露更多细节,后续将持续跟进迭代动态。