当大语言模型变成会改动真实世界状态的自主智能体,多步工作流里的安全性就成了绕不开的难题。过去一年,评测从单轮走向了多轮,可两个老毛病还在:单步方法把动作一个个孤立看,看不见风险是怎么一步步累积的;轨迹级评测又往往是事后诸葛亮,等跑完了才打分,早就错过了介入的窗口。一篇被 EMNLP 2026 收录的论文 PASTABench,想用「解耦的主动安全监测」把这件事往前推一步。

PASTABench 把主动监测拆成三个维度来量化:该不该介入、什么时候介入、面对的是哪类风险。它据此造了一个基准,包含 1139 条多轮轨迹,覆盖 5 大类、13 个子类风险,并提出了最优干预窗口(Optimal Intervention Window),用标注好的「最早信号轮」和「触发轮」去衡量介入是否及时。评测 16 个大模型后,结论相当清醒:主动介入整体上仍基本未解,表现最好的模型,也只在 40.74% 的情况下做到了最优时机的介入。

更隐蔽的问题:安全分也会骗人

论文最值得玩味的地方,是它细扒出来的「词面过拟合」。不少体量较小的模型,安全分看着不低,可一旦把危险词汇抹掉、换成中性的表达,它们的主动能力就就地塌方。换句话说,这些分数很大程度上来自对关键词的敏感,而不是真的理解了风险。这对行业的提醒很尖锐:静态基准上的安全高分,可能只是模型学会了「在看到危险词时收紧」,并没有学会在语境真正危险时该不该拦、何时拦。

具体怎么量化「主动」,是这篇论文最关键的设计。PASTABench 没有笼统给一个安全总分,而是把监测拆成三个彼此独立又相互支撑的维度:介入必要性(此刻该不该拦)、介入时机(在风险信号出现的哪一轮拦)、风险类型(面对的是提示注入、权限越界还是数据外泄)。每个维度都能单独打分,合起来才能回答「一个智能体是不是真的会主动保护自己」,而不是「它在静态测试里看起来安不安全」。这种拆解的好处,是能把失败定位到具体环节——到底是根本没意识到该拦,还是意识到了却拦晚了,抑或是拦错了对象。

评测范式:从「判卷」走向「途中介入」 单步隔离 逐动作判对错 看不见风险 如何累积 事后判卷 跑完再打分 错过介入 窗口 解耦主动监测 是否 / 何时 / 何种风险 三维介入 把「该不该拦、什么时候拦」变成可量化的问题
图 1|主动监测把安全从结果验收,前移到过程里的时机判断
1139 条轨迹,16 个模型,最优时机仅 40.74% 1139 多轮轨迹 5 大类 13 子类 16 个大模型 逐一评测 EMNLP 2026 40.74% 最佳模型 最优时机 介入率 词面 过拟合 小模型 骗分 「主动介入」整体仍基本未解;小模型安全分高,多半是关键词敏感而非真懂风险
图 2|把危险词抹掉后,不少小模型的主动能力就地塌方——分数会骗人

把 PASTABench 放回更大的坐标系,它和同一周发布的 DUMA-Bench(双控交互)、信通院《智能体安全评测基准V1.0》构成了一组互补的信号:一个盯着「介入时机」,一个盯着「用户也能改环境」,一个把风险摊成企业可用的测试清单。三者在说同一件事——智能体安全的评测,正从「模型能不能答对话」升级成「系统在整个过程里能不能被控制」。对部署方而言,PASTABench 给的实操提示是:别只信一个总分,要去测模型是否能在风险信号刚冒头时就介入,以及它的安全表现是否只是关键词驱动的幻觉。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

对实际部署有两层提示。其一,别用单一总分替代理由。一个在 PASTABench 上整体表现平庸、却在最优时机维度上稳定的模型,可能比一个总分更高但关键词驱动的小模型更适合高利害场景,因为它拦得「对」而不是拦得「多」。其二,把主动监测本身当成可插拔模块来设计:与其指望底层模型天生会自我保护,不如在智能体编排层加一道独立的、基于信号的介入守卫,在风险轮次出现时触发暂停、人工确认或回滚。论文留下的最现实问题,不是「模型够不够安全」,而是「我们有没有在过程里留出可以介入的抓手。把介入权从模型手里挪到编排层,是把不可控风险变成可管理风险的关键一步,也是企业今天就能落地、不必等模型自我进化的一件事。