一句话:企业工作流要的不只是选对工具,E-Ledger 想在执行前先过一道代码审批

2026 年 10 月 8 日,arXiv 上线论文 E-Ledger(编号 2610.11552),针对的是企业级智能体一个很实在的痛点:大模型 agent 能流利地调工具,但企业工作流要求动作严格符合组织策略,工具返回里常常藏着部分可观测下的隐藏副作用,长周期任务还需要跨多条记录持续跟踪状态。作者提出 E-Ledger,一个安全、持久、可进化的多智能体执行框架,让每一次动作先经过代码审批层对照策略检查,再用一份「世界账本」记录经核实的隐藏规则和带证据的状态。

机制拆解:代码审批层,加会进化的世界账本

E-Ledger 由两部分构成。其一是代码审批层:它不依赖模型自觉,而是把每一个被提议的动作,在真正执行前对照组织策略检查一遍,不合规就拦下。其二是世界账本(World Ledger):因为企业里的隐藏规则通常事先并不清楚,账本负责沉淀那些经核实的隐藏规则,以及带证据支持、会动态更新的状态。两部分合起来,等于给长周期、跨记录的企业任务,建了一份既管动作又管知识的执行底座。框架在 World of Workflows 这个企业基准上,比表现最优的进化基线高出 5 到 15 个百分点。

世界账本怎么进化:WorldAbduct 用溯因补规则

账本能不能持续变准,取决于隐藏规则怎么被发现。论文配套了 WorldAbduct,一个溯因式的、以世界模型为驱动的框架进化机制。它从四个互补视角诊断执行轨迹:状态一致性、世界与观测的差距、策略门的正确性、以及目标判定,借此假设出潜在的隐藏规则,再通过针对性的溯因交互去验证,确认无误后才纳入账本。也就是说,账本不是一次性写死的,而是从 agent 跑出来的轨迹里,把那些原来没人写明的规则一点点补进来,再回头约束后续动作。

辩证看:审计与泛化仍是开放题

需要冷静看待的是适用范围与验证。其一,论文的增益来自 World of Workflows 等基准,而这些基准本身对企业真实环境的覆盖有限,规则更复杂、对抗更强、接口更脏的生产系统里,代码审批层的误拦与漏拦如何权衡,还需实测。其二,WorldAbduct 的溯因交互如果太频繁或太重,会拖慢长周期任务,成本和收益的平衡点尚未充分讨论。其三,所谓「隐藏规则」的发现质量,依赖诊断视角的完备性,万一漏了某个关键视角,账本可能把错误规则当成铁律。关于是否会在更多行业、更多模型后端上稳定迁移,目前独立复现仍不充分。

行业含义:企业 agent 的安全,正从网关走向执行内部

把 E-Ledger 和今年这一波 agent 安全走向放一起看,方向很清楚:企业要的不是更聪明的 agent,而是能管住 agent 动作的安全底座。无论是运行时旁路拦截、确定性策略引擎,还是 E-Ledger 这种「先审批、后执行、再进化账本」的框架,本质都是把安全前移到动作触达外界之前。对跑长周期企业工作流的团队,这类带审计、带状态跟踪的执行框架,比单纯靠提示词自律更经得起责任倒查。

结语

E-Ledger 给多智能体执行加了代码审批层,并用 WorldAbduct 让世界账本靠溯因自我补规则。它的价值不在又一个安全护栏,而在于把企业里那些没人写明的隐藏规则,从执行轨迹里捞出来、验证后纳入账本,再去管后续动作。至于在更脏的真实企业环境里稳不稳,要看更广的部署与复现。

E-Ledger · 安全持久可进化执行框架技术 · 安全Agent 提议动作代码审批层对照组织策略把关世界账本 World Ledger核实过的隐藏规则+ 带证据的状态WorldAbduct · 溯因进化四视角诊断轨迹:状态一致性 · 世界-观测差 · 策略门正确性 · 目标判定提出潜在规则 → 经针对性溯因交互验证 → 才纳入账本在 World of Workflows 上比表现最优的进化基线高 5–15 个百分点;ScienceWorld / DiscoveryWorld 也迁移有效
图 1|隐藏规则往往事先未知,E-Ledger 用溯因诊断把轨迹里漏掉的规则补进账本,再据此把关后续动作。