把真实攻击,回放进一个真实支付智能体
9 月 18 日,arXiv 2609.22076(APort Vault)给出了一份关于「支付智能体授权」的基准。它的素材不是合成 jailbreak 模板,也不是研究者自拟的任务集,而是今年 3 月到 8 月一场公开夺旗赛里、真人对一个在跑的银行智能体写下的 4371 条攻击——其中 97.7% 落在 3 月 6 日到 12 日的窗口。团队把这些攻击回放进 14 个来自 8 家实验室的模型,在五档策略配置、两条重放轨道下,完成 22.6 万次评测。
这份基准的巧思在于:同一批攻击,测两次——一次只有模型自己,一次在模型与工具之间加一道确定性的预动作检查,实现论文里称为 Open Agent Passport(OAP)的规范。它要衡量的不是「模型拒没拒」,而是「钱有没有转到策略不允许的收款方」,直接从执行后的工具调用上读结果。
请求很常见,但授权边界才是分水岭
在四级授权配置下,模型单独生成付款请求的比例在 71.2% 到 84.3% 之间;在 1293 条四级提示上,每条都跑过全部模型,其中 809 条(62.6%)从全部 14 个模型那里都骗出了付款请求,且每笔都成功付给了该档允许的收款方。换句话说,这些攻击对「用哪家模型」不挑——同一招几乎对所有人有效。
真正的分野出现在授权边界。在二到四级配置下,转到护照不允许的收款方的转账:模型单独时是 14 万分之 140,加上 OAP 那层之后是 6.9 万分之 0。这个零,覆盖 790 个源会话,按会话算的上界是 0.38%;而且它不是靠「拒绝付款」换来的——那一层后面实际执行了 2.5 万笔付款,只是策略拒绝了其中 187 次转账调用,148 次因为收款方被禁。
模型侧的安全,挡不住授权攻击
结论很直白:没有哪个前沿模型靠自己拒绝了那些请求——正是那些确定性护照检查随后拦下的请求。论文作者也诚实标出零的边界:攻击者若是更有资源或更高明的一批人,这个零未必守得住;而且自评的人工校验切片尚未完成,裁判可靠性仍留有一个问号。但核心判断站得住:当智能体能动钱,授权边界应当被视为模型之外的一个系统,而不是提示词工程问题。
这与近期几条线索呼应:有研究测算支付类智能体的授权边界攻击,也有支付智能体落地时把「Agent Payment」当中枢,还有对海量 MCP 配置做体检发现凭据长期不过期。APort Vault 给这些现象补了一把可复现的尺子——它证明 enforcement 架构是安全评测里的一阶变量,常常比选哪款模型更关键。
增量认知:把授权当成外部系统,而非提示词
落到工程上,APort Vault 的启示可以浓缩成一句话:如果你的智能体动钱,真正能兜底的硬控制不是模型自己的判断,而是一道它辩不赢的规则。OAP 的做法是在工具调用前放一个确定性检查——收款方在不在允许名单、金额与场景是否匹配策略——不合规则硬拦。这不是更好的 prompt,也不是更大的模型,而是一条模型绕不过去的线。
对正在把智能体接进交易、报销、清结算的团队,这应是上线前的底线检查:授权决策是否在模型之外、是否可审计、能否一键吊销。把这三件事做实在,比纠结「模型够不够聪明」更能决定一笔钱会不会被转错。
评测的边界,也要写进结论里
APort Vault 的零,不是营销口径的「绝对安全」,而是一个有明确上界的工程结论:它覆盖 790 个源会话、按会话算上界 0.38%,且作者坦承攻击方若更有资源或更高明,这个零未必守得住;人工校验切片也尚未完成。把边界一并写清,恰恰是这份基准比许多同类评测更值得信的地方——它告诉你这道硬规则在多大范围内成立,而不是把它说成万能。