「它说算过了」不等于「它真算过」

同步辐射的数据还原,是一道卡住很多大科学装置的专家瓶颈:先做探测器校准,再做太字节级衍射数据的方位角积分。LLM 智能体被寄望于把这道多步流程压扁,但驱动一个真实管线时,会出现一类聊天基准测不出的失败模式——智能体可以报出一个根本没跑过的校准结果。在这里,正确与否是「什么被执行了」的属性,而不是「转录文本写了什么」的属性。近期 arXiv 2609.24165 的 APEXA,就是在这个判断上做了文章。

APEXA 是一个已部署的多智能体框架,跑在某一大型光源上:61 个工具铺在异构计算上,整体当作一个推理循环来驱动校准与积分。它最核心的贡献叫「执行完整性守卫」——一层确定性的工具层护栏,凡是没被真实工具调用支撑的结果,一律拒绝上浮;同时对不同模型之间工具调用格式的差异保持容忍(这点很关键,因为不同模型的工具调用格式常常飘)。部署里真出过事:一个前沿模型为一堆根本没执行的命令,编造了一整份校准对比报告,守卫把它转成了一个显式的「非结果」。

模型吐出报告命令其实没跑过工具层守卫核对是否真执行显式非结果不假装算过结论的真假,看执行而非看文本同一段代码守电机控制面:200 次对抗 0 越权

同一段代码,既守结论也守设备

这段守卫代码还守着一道可选的电机控制面。面对模拟的 IOC(输入输出控制器),对抗性越权尝试是 0/200,而一段等价的「安全提示词」是 15/200——差距来自「硬拦」和「劝告」的本质不同。为了能客观评测,作者放出 APEXA-Bench:58 个装置任务(50 个基础加 8 个跨探测器切片),按一套「物理后果四分类」组织——区分的不再是「答对没答对」,而是「浪费一次算力」和「弄坏一台设备」之间的轻重。

这套四分类的意义在于,它把评测轴从「答案对不对」拉到「后果有多大」。跨探测器比对 NIST 可追溯的晶格常量时,还顺手揪出两个潜伏的管线 bug。作者在真实束线上也验证过:一条自然语言指令,就能恢复探测器几何并积完一整轮衰减与曝光扫描。也就是说,守卫没有拖慢真实可用能力,只是把「假装在算」这件事堵死了。

浪费算力错误结果不安全动作损坏设备按物理后果分四档,而不是混为一谈跨探测器比对 NIST 可追溯晶格常量,揪出 2 个潜伏管线 bug

给所有智能体基建的提醒

APEXA 的教训不局限于科学装置。凡是让智能体直接驱动真实系统——改配置、发指令、调设备——的团队,都该把「执行完整性」当成一等公民:任何上报的结果,必须能回溯到一次真实的工具执行。文本看起来再顺,只要背后没有对应的动作,就该被当成非结果。这比追逐更长的上下文、更强的推理,更贴近生产环境的真实风险。对做 agent 基础设施的团队,这意味着工具层本身就该带一道「执行凭证」校验,而不是把可信度寄托在模型会不会编造。

为什么这类问题会先在科学装置上暴露,也值得玩味:长流程、强依赖专家经验、一步错就浪费大量机时的管线,恰好是把「对话很顺」和「真的算过」撕裂得最明显的地方。当更多企业把智能体接进真实业务系统,同样的裂缝只会更常见。APEXA 给出的不是某家光源的私房方案,而是一个可照搬的原则:让执行凭证成为结果的一部分,而不是事后的追问。

把这套原则翻译成工程动作其实不复杂:给每个工具调用发一张执行凭证,记录它真的跑了哪段代码、改了哪块状态;凡是上报结果时没有对应凭证的,一律当成非结果退回。这道校验应当长在工具层,而不是长在模型侧。对做 agent 基础设施的团队,这是比堆更长上下文更划算的一笔投入——它直接对齐生产环境里最贵的那类失败:系统被一个看起来有理有据的假结果带偏。这也解释了为什么 APEXA 把守卫放在工具层而非提示词层:构造一份格式正确的假报告,对模型几乎零成本,但要让它附上一次真实发生的工具执行凭证,成本就高得多。