多智能体系统(MAS)在编码、数学、问答上压过单智能体,早就成了圈内共识——这些任务有可执行测试,成功与否是一清二白的二元信号。但有一个地方一直没人认真测过:真实的科研数据分析。那里没有现成测试能打二分,数值对不对要靠领域知识判断,多智能体到底帮不帮忙,过去基本是凭感觉。10 月 6 日挂上 arXiv 的 ST-Bench(编号 2610.07763)就是来补这个洞的。
用 2067 道地球科学题,把「多智能体是否更好」钉成可测
ST-Bench 的构造很实在:它从已发表的地球科学研究里挑出 100 个数据科学任务,覆盖水文、农业、湿地甲烷这些方向,再扩成 2067 道查询,每一道都由领域专家校验过 ground truth。评测时,它把五种近期主流的多智能体生成方法、套两种训练协议,全部跑在统一的 GPT-5 骨干上,去和单智能体基线比。这个「同骨干」的设计是关键——它把变量收敛到「有没有多智能体编排」本身,而不是让模型差异来搅局。
结论里藏着一个反直觉:赢在覆盖面,不赢在质量
结果读出来是这样的:十种多智能体配置里有九种超过了最便宜的那档单智能体基线,算力最大的配置拿到了接近三倍的综合分。但深挖下去,增益主要不是因为多智能体「算得更准」,而是因为「覆盖面更大」——经过训练的工作流能在更大比例的题目上产出看起来合理的数值指标;而一旦产出了合理数值,这些数值的质量,和单智能体基线产出的其实差不多。换句话说,多智能体让 agent「答得上来」的题目更多了,却没让「答得准」变得更好。
代价是实打实的算力
这个发现对落地有直接含义。算力最大的配置大约要花单智能体四倍的推理时间,才换来那约三倍的分数;而更省的工作流,用不到两倍的成本就能拿下大部分收益。所以「要不要上多智能体」在这类科研数据分析里,不该是信仰问题,而是一道权衡题:你漏答一道关键题目的代价,和你多烧的那几倍算力,到底哪个更疼。对很多内部分析场景,省配多智能体已经够用;只有在「覆盖面本身就有业务价值」的地方,才值得为强配买单。
一个别顺手推广的前提
还有一处容易被忽略:ST-Bench 测的题目都带有领域专家校验过的标准答案,结论成立的前提是「题目本身可判定」。一旦进入没有标准答案、靠人主观评判的开放分析,多智能体的覆盖面红利大概率还在,但「质量与单智能体持平」这一条会不会被打破,目前没有证据。所以这篇给的是「可判定科研题」上的清醒结论,别把它顺手推广到所有数据分析场景。
和本站此前覆盖的两条线能拼起来看
把 ST-Bench 放回近期多智能体研究里,它的位置很清楚。本站此前写过 Engineering Sustainable Agents(arXiv 2610.03010),那篇用 66 组配置测得多智能体平均多烧 6.36 倍的电、多跑 6.07 倍的时间,59 组里 59 组帕累托最优其实不需要多智能体——算力代价是真问题。ST-Bench 则补了另一半:它证明「省着花也能拿到大部分收益」这条路是存在的,关键是别盲目上满配。两篇合在一起,给的提醒一致:多智能体不是默认答案,先跑单智能体基线,只在它确实赢过噪声时才加 agent。当然,ST-Bench 只测了 GPT-5 这一个骨干、且任务集中在地球科学,换更强的闭源模型或别的学科,覆盖面红利会不会变,仍待后续复验。
对正在把科研数据分析往智能化推的团队,ST-Bench 最大的价值不是那张分数榜,而是它把「多智能体在科研上到底好在哪」拆成了覆盖面与质量两件事。看清这一点,才不会在 demo 里看到多智能体答出一堆数,就以为它比单智能体更懂你的数据。