9 月 18 日,Anthropic 宣布了一项在外人看来有点意外的合作:把埃森哲请进公司做独立评估。合作由埃森哲旗下专业 AI 业务 Faculty 牵头,内容包括评估与红队测试模型、执行对齐评估、测试模型安全护栏,双方预计各自投入至少 10 亿美元、为期五年——合计 20 亿美元的量级,花在「让别人检查自己」这件事上。
这次合作是 Anthropic CEO 达里奥·阿莫迪 9 月文章《我们必须为前沿踩下节奏》承诺的兑现。那篇文章给出三步走:让独立评估员进驻实验室、推动民主国家的前沿公司协调、再走向全球协调;Anthropic 单方面承诺先行落地这一步,并呼吁政府要求其他前沿公司跟进。文章里连评估员的待遇都写明白了:办公室有工位、门禁卡、公司笔记本电脑,访问权限大体与内部风险评估团队相当。
嵌入式评估与今天的外部评估差在哪?外部评估是周期性的、看成品的,公司给看什么就看什么;嵌入式评估是常驻的、看过程的——评估者能看着模型在训练中成形,跟随决定模型怎么建、怎么发布的内部讨论,直接与员工对话。Anthropic 的说法是,从这个位置出发,评估者可以评估公司如何运营、验证安全承诺是否兑现、找出盲区、报告事件,让公众对收益与风险有更知情判断。公司同时强调:这不减轻 Anthropic 的责任,只是让责任更可验证。
真正值得抠的是发布条款。按 CEO 文章的约定,评审方有权不经 Anthropic 编辑控制而公开发布关键发现——风险水平、事件、实践、以及他们实际获得了哪些访问;Anthropic 只保留狭义删改权,范围限于安全敏感、法律特权、商业敏感与第三方机密信息,不得因为结论不利而删改;如果删改影响了结论,评审方可以公开说明。这套条款借鉴了银行业监管的驻场先例,是目前同类安排里对独立性着墨最多的设计。当然,文本承诺与实际执行之间的距离,只有时间能检验。
为什么主角是埃森哲而不是 METR?这是市场最意外的部分——讨论原本聚焦 METR、Redwood Research、Apollo Research 这类安全研究机构,消息公布后埃森哲盘后股价上涨约 7%。Anthropic 给出的理由是:埃森哲长期帮企业与政府部署 AI,懂 AI 在真实业务里怎么被使用,这种实务视角会带进评估工作。合作是非独家的:几周内将公布更多评估方,Anthropic 正在与 METR 等非营利机构洽谈用它们自有资金试点嵌入式评估的部分环节;埃森哲也会以类似身份服务其他 AI 开发商。资金机制上,访问与报告的标准尚不存在,长期方向是池化或政府出资(6 月的 Advanced AI Framework 已有呼吁),眼下由 Anthropic 直接付费——这恰是利益结构上最受质疑的一点:付钱的人是被评估的人。
把时间线铺开看,这不是孤立动作。几天前 OpenAI 宣布将定期发布意外与异常行为报告,并一次性公开六起训练期事件;同一天加州州长签署行政令,要求州机构在 11 月中前就独立验证、前沿实验室驻场审计、失控事件上报与前沿模型急停开关拿出建议。再往前,是本站上周报道过的那起事件:研究人员借 Claude 在 72 小时内攻入 OpenAI 员工账户。攻击门槛在降,评估门槛必须跟着升——治理动作密集出台,是压力的镜像。
辩证地收个尾。支持方认为嵌入式评估让安全声明从口头变成可验证,哪怕条款不完善,有常驻的第三方眼睛总比没有强;批评方则担心这是自我监管的精致包装——顾问公司既做评估又卖部署,独立性存疑,20 亿美元相对前沿实验室的研发预算也只是零头,标准真空之下,条款怎么演化全看各家公司自觉。判断这场实验的成色,看两个东西就够了:后续公布的评估方名单里有没有真正的安全研究机构,以及 Faculty 的团队会不会真的发出让 Anthropic 难堪的报告。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。