工具增强的智能体会以一种很特别的方式失败:调用根本不存在的工具,或者给真实工具传任何 schema 里都没声明过的参数。这个失效模式难受的地方在于,现有的两道防线对它都无能为力——工具选择防线负责挑对工具,权限门控防线负责约束真工具的使用边界,但两者的前提都是「这次调用指向一个真实存在的工具」。arXiv 2609.19425 把这一点说透了:幻觉调用在构造上就不是任何门做过的决策,所以任何门都不可能拦下它。这是一个结构性盲区,不是防御做得不够细。

论文的主体是一份测量与基准研究。作者给出工具幻觉的五类分类法 H1 到 H5,并提出一个免训练的封闭世界消解器 Resolution Rung:查注册表成员资格,再做签名检查。它算不上聪明,关键在位置——论文证明了幻觉防御必须放在任何因果门之前,这道闸只能装在最上游。

为什么工具幻觉是结构性盲区工具选择防线帮 agent 挑对工具权限门控防线约束 agent 用真工具的边界幻觉调用指向根本不存在的工具、传入任何 schema 都没声明的参数ResolutionRung注册表 + 签名论文证明:幻觉调用不是任何门做过的决策,所以任何门都拦不住它——消解必须放在门之前 irreducible residue:借来的参数在 schema 上与合法调用无从区分,是消不掉的残余
图|现有两道防线拦不住幻觉调用

测量结果:接口越自由,幻觉越集中

实测横跨十个托管模型、两种调用面,共捕捉到 322 次真实幻觉。分布极不均匀:无约束的 raw-JSON 调用面上有 34 次伪造工具调用,受约束面上只有 3 次——调用接口的自由度直接放大了幻觉空间。另一个扎心的结果是模型规模帮不上忙:6750 亿参数的模型与 70 到 80 亿参数的模型,幻觉表现相当。指望下一代更大的模型自己长出免疫力,这条路走不通。

更值得注意的是 MCP 扩展部分。把多个 MCP server 合并进一个命名空间后,会产生单个注册表表达不了的碰撞与遮蔽——两个 server 提供同名工具、参数签名互相覆盖。论文给出第二套分类法 M1 到 M5,并在真实 MCP 环境测得 154 次幻觉,其中一些来自在单一注册表面上完全干净的前沿模型。合并本身就是幻觉面,这与 1113 篇里 MCPAgentBench 用干扰项考工具选择的结论互为表里:那边考的是「选哪个」,这边说的是「选的作业本上根本没有这个工具」。

测量结果:模型规模帮不上忙,MCP 合并是新幻觉面两条调用面共测得 322 次真实幻觉无约束的 raw-JSON 面 34 次对受约束面的 3 次——接口越自由,幻觉越集中规模不是解药6750 亿参数模型与 70 到 80 亿参数模型的幻觉表现相当MCP 合并命名空间:M1 到 M5多个 server 合成一个命名空间后产生单注册表表达不了的碰撞与遮蔽;实测 154 次幻觉,单表面干净的前沿模型也中招,并发布版本化 HTB 基准
图|测量结果:十个模型、两条调用面、HTB 基准

五类幻觉,各有各的病根

论文的分类法把幻觉拆成 H1 到 H5 五类,从凭空捏造工具名、错配参数签名,到把记忆里的旧工具当成现役工具调用,各有各的成因。这个拆分的价值在于对症下药:凭空捏造类靠注册表成员校验就能拦住,参数错配类需要签名检查,记忆错位类则要靠会话级的工具清单收敛。一套消解器不需要聪明,但需要把这些检查按正确顺序串起来。

MCP 部分的 M1 到 M5 则更偏结构性:同名工具的遮蔽、合并后的语义漂移,都不是单个 server 的锅,而是「把多个信任域揉进一个命名空间」这个动作自带的副作用。给智能体配多套 MCP 工具的团队,与其等模型变聪明,不如先做命名空间的隔离与冲突审计。

留给工程界的作业

论文随研究发布了版本化的 Hallucinated-Tools Benchmark(HTB),任何消解器都可以在同一把尺子下比较。对正在给智能体接工具的团队,可操作的建议有三条:调用面尽量收窄、少用自由 JSON 直传;在工具注册层面加一道成员资格与签名校验,位置放在权限门控之前;接多个 MCP server 时认真对待命名空间合并的冲突面。

残余风险也要认清:借来的参数在 schema 上与合法调用无从区分,这一部分是数学上消不掉的。防线能做到的是把幻觉挡在执行之外,而不是让模型不再产生幻觉。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。