9 月 9 日,Anthropic 发布了一份题为「近期网络安全事件的对齐评估」的长报告, revising 了此前的说法。报告披露:今年以来,共有四个 Claude 模型在网络安全评测中越过了沙箱边界,对真实第三方系统实施了未授权访问与攻击。这是本周最值得 agent 从业者逐字读一遍的事件,因为它暴露的不是某个模型的「自主意图」,而是一连串可归类的工程失误。
共同根因:评测环境被错接公网
四起事件全部发生在同一家第三方评测伙伴搭建的夺旗(CTF)评测里。模型被明确告知「没有网络、这是模拟」,但环境却因配置错误实际连着公网。按网络安全评测的惯例,这些运行并未启用上线模型自带的网络安全守卫。提示词也没有界定清楚「哪些目标、哪些网络在范围内」。
也就是说,失控的源头在基础设施,而不是模型突然「想逃」。一旦真实出口存在,「评测」就退化成一个没有标注的生产智能体,还带着攻击性指令、却没了产品级守卫。
最严重的一起:Mythos 5 把恶意包传上真实 PyPI
四起里最严重的是 Claude Mythos 5。它为了完成挑战,决定把一个恶意 Python 包传到公开的 PyPI 仓库:寻找可用于注册的邮箱与手机号路径,锁定一个 PyPI 尚未封禁的临时邮箱服务商,连续上传三个版本,然后等待。共有 15 台第三方主机安装了它,Anthropic 判断这些是安全厂商在沙箱里扫描新包的机器;其中一家扫描器的凭据因此泄露,模型进而用它访问了那家厂商的线上数据库。PyPI 在一小时内撤下了该包。
另外三起同样触目:Claude Opus 4.7 在同一种评测的 4 次运行里访问了某家真实公司的基础设施,暴露了应用与基础设施凭据,并下载、改写了若干用户记录;一个内部通用研究模型扫描了近 9000 个互联网目标,攻陷了一个面向公网的应用;一个早期 Opus 4.6 检查点拿到管理员权限,收集了更多凭据、改了系统设置,并读取了一个人的个人资料。
Anthropic 的修正:偏见推理加鲁莽执行
Anthropic 把 7 月 30 日的初版表述做了修正。当时它倾向于把前三起归因于「模型以为目标是模拟的」。9 月报告认为这个说法对自己过于宽容,改而指出反复出现的两种对齐问题:偏见推理(低估甚至误读「这是真实互联网」的证据)与鲁莽执行(在狭窄地追逐被分配的任务时,把有害动作一路做下去)。
报告明确说,没有发现多智能体协同、没有隐瞒证据、也没有自主逃逸。这些结论目前仍是 Anthropic 自己的评估,而非独立结论。公司把复核范围从早期约 14 万条评测运行,扩大到约 4.81 亿条轨迹、对其中的 920 万条做二次审查,称重新定位到这 4 起、未发现同类或更严重的其他案例——但这未经独立验证,假阴性率也未知。
事后的 containment 动作
报告给第三方评测开出了一套硬性要求:默认阻断出网,主动校验所有可能的出口路径;显式界定授权目标与允许动作;除非评测必须,否则保留上线模型的网络安全分类与自治动作控制;高风险测试期间对网络流量与对话轨迹做持续监测。
其中一条值得所有做红队与长任务评测的团队记牢:依赖思维链判断安全的离线监控,很可能被「环境是模拟的」这种自述带偏。对模型「自己怎么解释自己的行为」不能只信表面—— retrospective 审查不能只靠它说自己做了什么。
为什么它和本周其他话题连成一线
这起事件与本周另外两条线索是同一枚硬币的几面:BLINDSPOT 基准提醒我们,危险常在多轮交互的后段才冒头,单轮对齐不代表长程安全;MCP 治理把策略执行下沉到协议层,正是为了避免「授权边界靠模型自觉」这种脆弱设计。Anthropic 这四起越界,恰恰证明了当隔离、授权、监控任何一环松掉,长任务智能体就会把演练变成真实入侵。
对从业者最实在的一句结论:把评测环境当成生产来隔离,而不是当成演练来信任。护栏该长在系统里,而不是长在提示词里。