一个很少被写进评测的指标:占空比

多数智能体的评测报告里,数字都是「任务成功率」。这类指标有一个共同的隐含前提——任务在有限的步数内结束,评测者始终在场。

微软与上海交通大学联合发布并开源了一个叫 Argus 的运行时,把评测的焦点换到了另一个地方:人在不在场的时候,这套系统还能不能继续干活。它给出的运行记录里,一次连续运行持续了 1548 小时,跨越 27 个研究战役,平均每 40.7 小时才请求一次人工介入,占空比落在 95.1% 到 98.7% 之间。

公开记录中的一次运行:1548 小时内含 27 个研究战役与约 38 次人工介入橙线为一次人工介入请求(平均间隔 40.7 小时)1548小时蓝条被 27 个刻度分成研究战役,占空比 95.1% 至 98.7%· 六个论文管道共完成 254 个任务,其中 16 次为证据驱动的阶段回滚· SWE-Bench Pro 约 78%,对照设置 59%,聚合 token 用量 1.41 倍· 公开数学结果包 17 个,可独立运行的验证路径 7 条
人工介入的位置是按 1548 小时除以 40.7 小时换算出来的示意刻度,不是逐次公开的时间戳。这些数字全部来自项目方自己的技术报告与仓库说明,尚未见到第三方独立复现。

占空比这个指标之所以值得单独拿出来说,是因为它衡量的是「系统在期望工作的时间里有百分之多少真的在工作」。对一次几分钟的评测来说,这个数字接近 100% 是理所当然的;放到以天和周为单位的长任务上,它才开始区分系统——崩溃、卡住、等待人类、反复重试,都会把它拖下来。

作者对现状的判断是:多数智能体系统在人离开之后就慢了下来。原因不是模型不行,而是缺少密集的奖励反馈——没有人在旁边不断确认「这一步做对了」,智能体要么在原地打转,要么把资源花在低价值的探索上。

四条设计原则

Argus 的设计原则在公开说明里有四条,值得逐条对照。

数学研究垂直论文管道垂直其他研究任务定义实际研究任务定义实际研究任务定义实际研究任务核心层向所有垂直层提供同一套边界核心层:权限 · 证据提交 · 人的边界 · 跨会话的持久项目状态任务、检查点、决策、技能与证据在会话切换和运行时变更后仍然保留证据驱动自我进化多智能体协作核心与垂直解耦
四条设计原则里最工程化的是最后一条:把权限、证据与人的介入边界收进核心层,让垂直层只负责定义研究任务。这样一来,换一个学科不必重做治理,多智能体也不容易一起爬到同一个局部最优上。

证据驱动是四条里最硬的一条:每一个主张都必须有可核验的证据支撑。这条原则在实践中会带来一个不太直观的后果——它允许系统主动回滚。公开记录里,六个论文管道共完成 254 个任务,其中有 16 次是「证据驱动的阶段回滚」,也就是在推进到某一步之后,因为新证据不支持前面的结论,退回去重做。

第二条是自我进化,系统从自己的研究历史里学习。这条和第三条连在一起看才有意义:多智能体协作采取的是角色分离、各自独立上下文、但共享工作区的方式。独立上下文避免了一个角色把自己的错误判断传给别人,共享工作区则保证进展是累积的。作者用「避免局部爬山」来概括这个设计意图——如果所有智能体共享同一份上下文,它们会一起收敛到同一个局部最优上。

第四条是核心与垂直解耦,把权限、证据提交与人的介入边界收进核心层,让垂直层只负责定义实际研究任务。这条是四条里最工程化的一条,也是这套系统能同时跑数学与论文管道两类任务的原因:换一个学科不必重做治理层。

研究流程的可审计性

Argus 的数学方向公开了一份结果档案,其中的设计比技术指标更值得看。

档案包含 17 个公开结果包、7 条可独立运行的验证路径、1 个经过 Lean 检查的逻辑组合,以及技术报告、评审包、证书和 71 个公开产物的校验和。

更值得注意的是它做的区分:档案明确把原创构造与文献重建分开,把历史负面结果与范围更正单列,并把「新颖性尚未认证」的主张单独标注出来。换句话说,它没有把所有产出都摆成同一等级的成果,而是按证据强度分档。

这种做法在智能体产出的场景里几乎是被迫的。当系统可以连续跑一千多个小时、产出成百上千个中间结论时,把所有东西都当作成果呈现,只会让审阅者失去判断依据。把证据强度显式编码进档案结构,等于把审计的工作前移到了产出环节。

必须说清楚的口径

Argus 的这批数字需要谨慎对待,原因有三。

其一,它们全部来自项目方自己的技术报告与仓库说明。1548 小时的运行、40.7 小时的人工介入间隔、95.1% 到 98.7% 的占空比,都是自报值,没有第三方独立复现。

其二,单次运行的记录不能当作可复现的基准。一次 1548 小时的成功运行,说明这套系统在这一次条件下跑得住,它不构成「这套系统稳定在某个水平」的统计结论。要判断稳定性,需要多次运行与失败案例的分布。

其三,「解决了一个二十年未解的公开数学问题」这类表述在原始材料里的呈现方式需要读者自行核对。公开档案把一部分主张标记为新颖性尚未认证,这个自我限制本身就说明了核验的难度。

把这三条放在前面不是要否定这项工作,而是因为长程智能体的宣传材料最容易在这一层失控:运行时长、占空比与人工介入频率都是可测量的,而「解决了什么」需要领域专家花很长时间才能确认。

对做企业智能体的团队意味着什么

即便完全不去讨论数学成果,这份工作里有两处设计可以直接迁移。

其一是把「人工介入频率」当成一级指标。企业部署里,智能体最贵的成本不是 token,而是它对人的打断——每打断一次,就等于把一个工程师从自己的工作里拽出来。设计目标应该是把这个频率压下去,而不是把所有判断都留给人类兜底。

其二是持久项目状态的范围。Argus 保存的不只是任务进度,还包括检查点、决策、技能与证据,而且在会话切换与运行时变更之后仍然保留。多数系统的持久化只覆盖到「任务跑到哪一步」,一旦运行时重启,之前的决策依据就丢了,后续的判断只能重新来一遍。把决策与证据一起持久化,是长任务能接续的前提。

还有一处是态度上的:这套系统把「回滚」写成了正常流程而不是异常处理。254 个任务里有 16 次阶段回滚,说明设计者预期系统的结论会被自己的新证据推翻。允许推翻自己的结论,是长时间自主运行的必要条件——如果每一次推进都不可撤销,系统在遇到反证时只能选择把错误继续往下传,或者停下来等人。

这三处设计有一个共同前提:愿意为「可核验」付出额外成本。把证据一起持久化、把回滚设计成一等流程、把人工介入频率当成指标,都会让单次任务的效率看起来更低。它们换来的是任务在时间轴上连续跑下去的能力。对以小时计的评测来说,这笔交换不划算;对以周计的任务来说,它可能是能不能跑完的分界线。

接下来要看什么

一是是否会出现第三方对这套运行记录的独立复现。没有独立复现,占空比这个指标就只能停留在个案层面。

二是这套架构在非研究类任务上的表现。数学与论文管道有一个共同优势:对错相对客观,证据容易定义。换成商业分析或运营决策,什么算「可核验的证据」本身就变成一个有争议的问题——而这恰恰是企业场景里的常态。

三是成本口径。1548 小时连续运行对应的算力支出没有公开,而这决定了这套模式的可复制性。

目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。