中国信息通信研究院近日发布《智能体安全评测基准V1.0》,以 45 个攻击场景作为评测范围。对行业而言,这件事的意义不只是多了一张测试清单,更在于把智能体安全从「功能能不能实现」,往前推到「在攻击和误用条件下能不能被控制」。它为 AI 选型、合规审查和上线前自检,提供了一份更接近实际应用的共同参照。

为什么需要这份基准?企业过去做 AI 安全评估,往往沿用网络安全、数据安全与应用安全那一套:查访问控制、扫漏洞、留日志、做脱敏、建合规制度。这些仍必要,可智能体带来了新复杂性——传统应用按预设流程走,智能体却会根据自然语言理解任务、调用外部工具、访问企业知识库、生成代码或触发业务流程。风险不只是系统漏洞,也可能是一句恶意指令、一个权限配置错误、一次不受约束的工具调用,甚至模型对上下文的误读。基准要回答的,正是更具体的一组问题:模型能不能识别并拒绝越权指令?会不会被诱导泄露系统提示词?工具调用有没有身份、权限、参数与频率的限制?多轮复杂任务下安全边界还守不守得住?判断错了,企业能不能发现、阻断和追责?

45 个场景,落到五层风险链

把 45 个场景拆开看,不妨映射到五层风险:模型与指令层(提示注入、越权指令、多轮边界失效)、数据与隐私层(泄露提示词、跨会话与跨用户的数据隔离)、工具调用与权限层(参数校验、人工确认、异常中止)、流程与任务执行层(记忆管理、循环执行、责任不清),以及运营与治理层(日志、审计、人工接管、事件响应)。这里的关键提醒是:企业采购的从来不是一段模型输出,而是一套要持续运行、持续被管理的业务系统,评测对象不能只有基础模型,还要覆盖编排框架、插件、工作流、记忆模块和外围业务系统。

把这份基准放进更大的坐标系看,它的定位更接近「行业共用的安全证据底座」,而不是某家厂商的自证。过去一年海外也陆续出现把智能体安全拆成可测场景的做法,但大多由研究机构或企业自发推动,口径不一、难以横向比较;信通院这份以 45 个场景、五层风险给出统一框架,价值在于让甲方、乙方与监管方有了同一套能互相印证的语言。当然,框架统一不等于风险自动消失——它解决的是「测什么、怎么测」的口径问题,真正把风险压下来,仍要靠企业基于自身业务做场景化复测,并把结果落到采购合同、上线验收与持续监控里。基准是起点,不是终点,企业的复测与治理才是把纸面安全变成实际安全的关键一跃。它不替企业做决策,只提供一把可反复使用的尺子。对甲方而言,拿到基准不等于通过验收,真正的功夫在把通用清单映射成自己的高风险任务集,并据此做场景化复测与持续监控。

45 个攻击场景,落到五层风险链上 ① 模型与指令层 提示注入、越权指令、多轮边界失效 ② 数据与隐私层 泄露提示词、跨会话/跨用户数据隔离 ③ 工具调用与权限层 参数校验、人工确认、异常中止 ④ 流程与任务执行层 记忆管理、循环执行、责任不清 ⑤ 运营与治理层 日志、审计、人工接管、事件响应
图 1|把「能不能用」推进到「受攻击、被误用时能否被控制」
基准不是一次性证书,而是四个阶段都用得上 ① 材料审查 先看被测对象 与测试边界 确认覆盖哪些 ② 场景复测 用自身数据 与流程验证 高风险任务 ③ 上线验收 写进合同与 SLA 的硬指标 与整改时限 ④ 持续 定期复测 变更触发 复测 供应商给的「通过」只是材料,真正的安全证据要在自己业务里复测出来
图 2|采购方该把基准当「证据层」,而不是合规打勾的工具

对采购与合规团队,这份基准最实用的用法,是把它当成供应商筛选里的「安全证据层」,而不是替代完整的尽职调查。建议按四个阶段落地:先看供应商材料的测试边界,再拿自身业务里的高风险任务做场景化复测,然后把安全要求写进合同、验收标准与服务等级协议,最后建立定期复测、变更触发复测与持续监控。需要保持的冷静是,基准解决的是测试口径和风险识别,替代不了企业自己的威胁建模、权限治理和上线验收;也不能只看场景数量和总分,更要看与自身业务直接相关的场景、测试深度和真实防护效果。智能体安全不会因为一份基准发布就自动解决,能把手里这份通用评测与自身业务复测结合起来的企业,才更可能在拿到 AI 效率的同时,把不可控风险压到可接受范围。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。