多智能体系统越来越像一家公司:有角色、有评审、有共享记忆,可我们评测它们,时长还停留在「几分钟跑完一个任务」。9 月提交、独立研究者 Bravish Ghosh 的论文 Frontier Autolab(arXiv 2609.36739)问了一个扎心的问题:当脚下的技术地面一直在动,这样一家公司长期会怎么表现?它造了一个能把智能体组织放进五十年技术史里反复推演的测试台,结论不只在讲智能体,也在讲我们怎么评测智能体。

Frontier Autolab:长程组织型智能体测试台16 个角色人格高管 / 工程师 / 评审专职红队持数值击杀闸九个技术时代1990 → 2040,时序门控历史学家-法官五维打分 + 复盘持久 Playbook教训跨时代累积每次决策先写进 Playbook,下一时代必须引用——记忆塑造公司性格
图 1|Frontier Autolab 用 16 个角色人格加一个专职红队,模拟一家公司在九个技术时代里反复自我重建;历史学家-法官按五维打分,教训沉淀进持久 Playbook。

测试台的设计很耐读。一家模拟公司由 16 个角色人格发声,再配一个专职红队;它要在从 1990 到 2040 的九个技术时代里反复「自我重建」。每个时代是时序门控的:公司先根据一份带日期的简报做决策,再由一位历史学家-法官揭晓历史上发生了什么,并按五个维度打分,教训写进一份持久 Playbook,下一时代必须引用。六個时代对照真实历史,一个对照当下市场,两个是开放预测。四轮推演共 36 个时代决策、180 个分项,样本虽不算大,却足以暴露一些稳定偏误。

其一(远见-承诺缺口)。在全部 24 个有历史对照的时代里,法官给「认出下一波趋势」的打分,都高于「选对在哪一层去建」——平均差 1.9 分(十分制)。原因很现实:董事会认得出超文本来了、认得出点击排名来了、认得出神经网络规模来了,却总把公司建在现有资产够得着的那一层。智能体组织在这里和人类组织犯了同一类错——看见趋势不难,难的是把自己重构成配得上趋势的形状。

其二(红队反噬)近乎反讽。那个拿着数值击杀闸的红队,在每个时代都发出硬性否决,结果这家公司五十年只做受控试点、零产品,却因为 rubric 重纪律、罚事后诸葛亮,反而被打了最高分。换句话说,会设防的系统可能因为太安全而什么都不交付,而评分机制还会奖励这种「不犯错」。这对企业部署多智能体是个清醒的提醒:把护栏设到极致,产出的可能不是稳健,而是停滞。

三轮跑暴露的偏误远见-承诺缺口24 个有历史对照的时代里,识别趋势的得分都高于「在哪建」红队反噬带击杀闸的红队:五十年只做受控试点、零产品,却被打分最高时间泄漏分数逐代上升,但法官事后复盘分反而下降(r=-0.58)「看起来在学」可能只是记住了历史答案——评估本身要先被评估
图 2|三轮推演暴露三类偏误:董事会认得出趋势却建在资产够得着的层;过度设防的红队反而零产出却高分;分数上升与事后复盘分下降并存,暗示「学习」可能是假象。

其三(时间泄漏)最该被评测者记住。论文发现,每一轮里分数随时代上升,可法官自己的事后复盘分反而下降,轮内相关系数 -0.58。也就是说,模型本来就「知道」谁赢了,评分时又「记得」历史答案,于是看起来在学,实际上可能只是把历史背得更熟。作者干脆把测量本身当成一等对象来研究,并放出全部记录与一套 API 工具,还点明哪些虚构与截止后的时代能把测试台变成真正基准。这种「先审自己的尺子」的态度,比结论本身更值得行业借鉴。

把 Frontier Autolab 和前两轮我们写过的主题连起来看会更有意思:它和「上下文即文件」「元推理把控制抽出来」是同一股潮流——都在认真处理长程智能体的记忆与控制。而它最尖锐的贡献,是指出组织型智能体的「性格」由记忆内容决定:Playbook 里存的是市场结构教训,公司就每个时代转型;存的只有验证流程,公司就死守一种方法。对做多智能体产品的团队,这等于在说:你让智能体记住什么,比让它们多聪明,更决定长期走向。

局限也要摆正。这是单作者、模拟性质的测试台,九個时代是精心编排的简报,不是真实市场;五维 rubric 仍带主观性,样本量也偏小。但它戳破了一个舒服的假设:我们以为多智能体评测只是「跑更久的任务」,可 Frontier Autolab 表明,真正的长程行为——转型、设防、记忆塑造——在分钟级任务里根本看不见。在大家忙着把智能体塞进公司之前,先有一套能跑满几十年的尺子,也许比再堆一个 benchmark 更紧迫。