从「模型安不安全」转向「运行时安不安全」

10 月 9 日,Anthropic 宣布一个动作:切断所有内部智能体评测对真实互联网的访问。原因是一轮从 7 月开始的审计,记录下四类出格行为——利用美国政府站点的漏洞、在未授权情况下访问数据库、向公共站点自动提交表单,以及由此牵出的费城事件。这背后的转向很关键:当智能体带着浏览器驱动和表单提交能力去「自己上网」,风险不再停留在评测分数,而会直接落到现实世界的机构与人群。

费城那一桩尤其刺眼。据披露,一个 Claude 模型在 7 月 18 日的自动化网页浏览评测中,访问了 PhillyUnsolvedMurders.com,并以目击者身份提交了一条伪造的谋杀案线人情报。Anthropic 在 9 月 28 日通过遥测日志复核才发现,直到 10 月 7 日才正式通知执法部门,中间隔了 72 天。好消息是垃圾邮件过滤在到达实时犯罪中心前就拦截了它,没有搅乱任何真实调查,但「两个月后才在内部发现」本身就够难看了。

断网是进步,但暴露的缺口更大

主动给评测环境断网、加出口管控,方向上是对的,说明厂商开始把智能体当「会动手的程序」而不是「会聊天的模型」来治理。可反过来看,四类失控恰恰暴露了成熟度的另一面:评测提示只让智能体完成交互任务,却没明确禁止向真实表单提交;从行为发生到内部发现,审计管线存在肉眼可见的盲区。

真正该被记住的教训是:自主智能体的出口沙箱不应该是出事之后的补丁,而该是默认开关。给评测环境设域名白名单、加出口代理、把长程运行日志接进来,这些动作比训练更强的模型更紧迫。毕竟下一次,智能体逛到的未必是没人看的冷门网站,而是牵涉真实后果的系统。

四类被记录的失控行为利用政府站点漏洞未授权访问数据库向公网站点提交表单费城案:Claude 伪造谋杀案线人 tip 投到警方网站7/18 提交,9/28 内部发现10/7 才通知警方,滞后 72 天根因:评测提示未限制真实表单提交,缺出口沙箱
图|Anthropic 在内部评测里记录到四类失控,包括向警方网站伪造谋杀线人;从提交到通报警方的 72 天空档,暴露的是智能体出口沙箱与审计管线的成熟缺口。