9 月 17 日前后提交的 arXiv 论文 2609.19180 抛出了一个叫 BioPhys-Bridge 的跨学科科学推理基准,想解决一个很现实的问题:现在的科学问答和检索增强,常常给出一段看着专业、却查无实据的回答。它的核心主张很朴素——推理不能悬空,每一环结论都要锚回可验证的来源证据,再用定量物理模型去解释,而不是靠语言模型自己顺口编下去。观测、证据、解释三件事被拆开,谁也替代不了谁。

这个基准的规模不算小:覆盖 6 个科学领域、9 个物理模型族,共 500 个案例,拆出 1517 个面向智能体处理的任务。换句话说,它不是给人看的试卷,而是给智能体用的流水线——每个任务都要求 agent 先把观测数据锚进带稳定 ID 的证据块,再走物理模型解释,最后落到生物机制或下一步决策。规模的意义在于:它能逼出那种「看着对、查无据」的失败,而不是让模型用漂亮的句式把漏洞糊过去。

证据驱动的推理三连观测数据实验读数、图表、序列锚进来源证据稳定证据 ID、定量数值、单位、方程经物理模型解释用定量方程解读,再落到生物机制漏掉任一环,结论就会看着对、查无据
图|证据驱动的推理三连

证据块是这套设计里最关键的一笔。每个证据都带稳定证据 ID,连同定量数值、单位、方程、假设、机制、下一步决策一起结构化存下来。好处是回溯时不用猜这一步结论从哪来:到底是哪条读数、哪个方程推出来的,一目了然。再配一道严格的质量闸门——schema 校验、证据完整性检查这些都过,才算数。把证据当一等公民,意味着 agent 的每一步推理都能被审计,而不只是丢给你一个结论。

基准规模一览500 案例1517 任务6 领域 / 9 模型族证据块带稳定 ID定量值、单位、方程、假设、机制、下一步决策都结构化严格质量闸门schema、证据完整性等过关才算数面向 agent 的 QA 与 RAG 都把证据可溯当硬指标
图|基准规模一览

顺带说一个常被忽视的细节:这套基准是面向 agent 设计的,不是面向人类考生的。它刻意把问答和检索增强的质量指标,都绑到证据可溯这条硬线上。过去评科学智能体,常常只看最终答案对不对;BioPhys-Bridge 把「证据链是否完整、是否可溯」也纳入评价,等于把评测从结果正确性,往前推到了过程可信性。对做科研助手的团队,这个转向比多刷几个百分点更值得认真对待。

客观看,它仍是聚焦于物理与生物交叉这一专门场景的基准,离通吃所有科学学科还远;500 个案例在跨领域泛化上难免有覆盖盲区,9 个模型族也未必穷尽所有建模路线。但方法论的溢出价值是明确的:任何声称能「做科学」的智能体,都该被问一句——你的结论,能锚回哪条证据、哪个方程?目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

把 BioPhys-Bridge 放进可验证智能体这条线看,它和近期一批强调证据、过程、可追溯的科研框架站在一起。当行业从比谁答得漂亮,切换到比谁推得可信,基准的指挥棒作用就来了:你用什么标准评,团队就往哪个方向卷。把证据可溯写进基准,等于给科研智能体定了一条底线——先证明你查有实据,再谈你有多聪明。