在 9 月的国家网络安全宣传周期间,新一代《人工智能安全治理框架》正式发布,业界普遍称其为 3.0 版。和前两版相比,这一版最值得关注的变化是:智能体风险被单独成章。过去相关内容多散落在输出安全、内容合规的章节里,这一次,智能体作为一个会调用工具、会操作数据、会对外部世界产生动作的系统,被拿到了与它能力相匹配的位置上讨论。治理的镜头,从「模型说了什么」移向了「智能体做了什么」。

框架对智能体的要求,落在三条具体的线上。其一,可追溯身份标识:为每个智能体分配可识别、可归责的身份,确保一笔操作能追到发起它的主体,而不是一笔糊涂账。其二,最小权限:智能体只拿完成当前任务所需的权限,敏感的对外动作被收窄到必需范围。其三,关键节点人工确认:在涉及钱、数据、对外动作等关键关口,保留人拍板的那道闸。三条合在一起,指向的是同一条原则——把智能体当成一个有账号、有边界、可被审计的「数字员工」来管,而不是一个看不见底的自走装置。

智能体风险从章节附录升格为独立议题可追溯身份标识为每个智能体分配可识别、可归责的身份,动作能追到主体最小权限智能体只拿完成当前任务所需的权限,敏感动作收窄到必需关键节点人工确认在钱、数据、对外动作等关键节点保留人拍板的关口口径:框架为非强制指引;强制国标《智能体应用安全基本要求》仍在制定
图|框架3.0 把智能体风险单列

把这次框架放进近一两周的治理动作里看,信号更连贯。9 月 18 日,OpenAI 系统性披露过去半年发现的 6 起模型失配事件,并上线常态化的失配披露机制;更早前,Anthropic 请埃森哲作为嵌入式独立评估方常驻做红队与对齐评测(本栏目在 9 月中旬的稿件里已专门拆解过这笔合作)。一端是头部实验室把「可信」当成产品力来做,一端是监管把行动链安全写进框架——治理正在从口号走向一张可执行的清单。

但必须冷静看待框架的性质:它目前是非强制性的指引,不是法律。真正有约束力的那一块——《智能体应用安全基本要求》这份强制国家标准,仍在制定过程中。换句话说,框架给出了方向,强制标准还在路上。这中间的时间差,恰恰是各平台把身份、权限、审计这些能力做进产品的窗口期;也是风险所在——在强制标准落地前,谁来保证「最小权限」「关键节点确认」不是写在文档里、没落进代码里。

管住一句话,不如管住一连串动作旧重心(输出安全)聚焦生成内容是否违规、是否有害新重心(行动链安全)聚焦身份、权限、操作审计、关键节点确认全链路仍缺的一块强制标准尚未落地,落地快慢取决于监管与平台协同对照:OpenAI 失配披露、Anthropic 嵌入式评估,都在把「可信」做成产品力
图|治理重心从输出安全转向行动链安全

框架 3.0 把智能体单列,对行业是明确的倒逼,也对做智能体产品的团队提出了更具体的验收项:你的智能体有没有独立身份?权限是不是按任务最小发放?关键动作前有没有人确认?这三问答不上来,谈「安全智能体」就是空话。对个人与企业用户而言,选型时多问一句「你的智能体能不能被审计」,比多问一句「它聪不聪明」更有价值。

值得留意的是,这次框架的视野不限于通用对话机器人,而是把具身智能、金融、政务等高频落地场景都纳入了行动链安全的考量。治理跑在前面,智能体才敢往更深的生产系统里走。框架是里程碑,但不是终点——强制国标何时落地、跨厂商能否互通,才是决定这套治理能否真正生效的下一关。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。