把「默认拒绝」做成基准线
九月二十九日,Anthropic 与英伟达就智能体安全问题展开合作,共同开发 Open Agent Safety Platform,一套用于企业部署中治理和控制 AI 智能体行为的分层安全框架。框架由两家公司分别提供核心组件:英伟达给出开源的 OpenShell 运行时软件,Anthropic 给出 Claude Managed Agents API 套件。在安全机制上,Claude Managed Agents 通过凭证库集中保管智能体凭证,OpenShell 则默认阻止智能体动作。把「默认拒绝」设为基准线,是这套框架相对以往实验性护栏关键的一步——智能体想做什么,先得过授权这一关,而不是先执行再补审计。
生产落地比口号更有分量
比框架本身更值得关注的是生产侧信号:Notion、Rakuten 和 Asana 等公司已经率先在生产环境里使用 Claude Managed Agents。换句话说,托管智能体不再是实验室里的演示,而是已经被放进真实业务流程里的「数字同事」。这与过去一年企业智能体的主旋律一致——大家争论的早已不是「能不能用」,而是「如何在可控前提下用」。分层框架的出现,等于把分散在各家公司内部的护栏实践,收敛成一套可交付、可审计的参考实现。当护栏从各做各的变成共享底座,企业部署智能体的安全成本才有机会被摊薄。
安全框架为何由算力与模型方联手
值得玩味的是,这套安全框架的发起方是英伟达与 Anthropic,一个是算力底座,一个是模型能力方。二者的分工很清晰:英伟达的 OpenShell 负责把智能体「关进」一个默认拒绝的运行时,任何动作都先被拦下;Anthropic 的 Claude Managed Agents 负责把凭证集中保管,避免明文凭据散落各处。这种「运行时加托管」的组合,恰好补上了企业部署智能体时最怕的两块短板——执行失控与凭证泄露。由底层供给方而非应用厂商来定义安全标准,也意味着护栏可能随硬件和模型一同下沉到更多产品里,成为出厂即带的属性。
对标行业,安全正从口号变底座
把这件事放进更大的图景,企业智能体的讨论焦点已经从「能不能用」转向「怎么安全地用」。过去一年,多家头部厂商都曾就智能体安全给出过框架或承诺,但多数停留在文档层面。Anthropic 与英伟达的区别在于,它把护栏做成了可被 Notion、Rakuten、Asana 直接调用的生产组件,而非一份白皮书。这种「安全即服务」的思路,可能重塑企业采购智能体的评估维度:比起模型多聪明,买方会越来越在意,部署进去之后,谁来为失控买单。安全从加分项变成基础项,是这个赛道走向成熟的信号。
中小企业的现实距离
不过对绝大多数中小企业而言,这套框架仍是远水。分层治理、凭证库与默认拒绝运行时,本质上是一套需要专职团队运维的安全基建,落地成本不低。它们更现实的路径,是先借助托管智能体服务把低风险流程自动化,再逐步引入护栏。换句话说,Open Agent Safety Platform 定义的是行业天花板,而大量企业此刻关心的,是地板上那条安全及格线该怎么划。框架的价值不在一步到位,而在把「安全默认开」这件事变成可复制的范式,让后来者不必从零造轮子。
可用性、单点与标准的三重权衡
任何安全设计都要付出代价,这套框架也不例外。默认拒绝虽然堵住了大量越权动作,但也可能拖慢合理的业务流程,需要精细的白名单与审批来平衡;凭证库集中保管解决了散落各处的明文凭据问题,却把风险收敛成单点,一旦凭证库本身失守,影响面会被放大;跨厂商的分层标准仍处在早期,英伟达与 Anthropic 的组合能否被其它生态接纳,还要看互操作协议能否真正打通。对打算上托管智能体的企业来说,这套框架的价值不在于「从此高枕无忧」,而在于把安全从可选项变成部署的默认项。