背景:为什么「新增算力不等于真实进展」
2026 年智能体后训练的主流叙事,是把更多算力灌进推理循环:测试时扩展、自我修正、多轮重试。但清华深圳国际研究生院团队在 VeriLoop E2 的技术报告中,把一个被行业普遍回避的问题摆到了台前:新增的计算能否被证明真正构成了进展?
团队给出的两个失败样例非常具体:一次代码修改可能修好了主测试,却破坏了回归测试;一步数学推导可能减小了局部误差,却使另一个约束失效。在无约束的重试机制下,模型会陷入「幻觉循环」——看起来在持续工作,实际状态从未真正收敛,甚至倒退。这个问题在长程智能体任务(数小时到数周的自主运行)中被急剧放大:没有可靠的进展判据,运行时间越长,状态漂移越严重。
这也是近两个月智能体训练基础设施密集发版的共同背景:微软 Agent Lightning 走「部署即训练」路线(本站此前已有解构),Soket AI 的 LOOP 主打长任务 harness 的资源效率,而 VeriLoop E2 选择从另一个切口进入——不问「怎么训练得更强」,先问「什么才算变强」。
VeriLoop 团队的问题意识与主流 RL 后训练框架不同:verl、AReaL、Agent Lightning 关心「如何在真实 harness 上高效训练」,VGR 关心「训练信号本身是否可信」。两者互补而非替代——前者解决训练管道,后者解决奖励与状态判据的语义。
VGR 机制拆解:生成者与验证者的权限分立
VGR(VeriLoop-Governed Recurrence,循证收敛递归)的核心是一条清晰的权力边界:模型是提议者(proposer),不是裁决者。
具体运作方式如下:
| 环节 | 职责方 | 具体动作 | 关键约束 |
|---|---|---|---|
| 提出候选 | 模型(生成智能) | 抽象、诊断、重新规划,产出候选状态 | 候选必须先外显为可检查的制品,不允许模型私下提交内部状态 |
| 证据准入 | 外部 VeriLoop Harness(验证权威) | 执行确定性检查,判定候选是否对「一组固定受保护义务」构成严格进展 | 无回归、义务不被破坏,才允许持久化 |
| 监督信号 | 训练管线 | 把「状态是否成立」外化为可学习的监督信号 | 离散 Verifier 不纳入反向传播,保持验证权威的确定性 |
三点设计值得展开。其一,受保护义务是固定的:验证基准不是每次重算,而是一组预先固定的义务集合,这避免了「验证标准随生成漂移」的自我循环。其二,「严格进展」是持久化的门槛:仅仅「不退步」不够,候选必须证明自己推进了某个义务,才获得被写入状态的资格。其三,Verifier 在训练循环之外:把离散的验证器纳入反向传播既不可行也不可取(破坏其确定性),VGR 的处理是把验证结果作为外部信号供模型学习,而非内化验证器本身。
配套的后训练数据也体现了同样的语义纪律:约 184 万条训练记录不是简单拼接的成功轨迹,而是被区分为「正确答案」「有效中间进展」「无进展」「回归」「不可比较」五类——把中间过程的不同语义显式编码,而不是把所有记录当成同一种「正样本」。
模型与训练数据:27B 基座与 184 万条标注记录
VeriLoop E2 的基础规格如下:
| 项目 | 规格 | 备注 |
|---|---|---|
| 基座模型 | Qwen3.8-27B(后训练) | Safetensors 实测 27.87B 参数 |
| 原生上下文 | 262,144 tokens | 面向长程智能体任务 |
| 后训练数据 | 1,841,831 条记录 | 注意是记录数而非 token 数,官方未披露总 token 量 |
| 数据构成 | 代码智能体轨迹 + 科学推理 | 五类语义标签(见上文) |
| 许可证 | Apache-2.0 | 权重、评估证据数据集同步开源 |
| 发布渠道 | Hugging Face / ModelScope | 附 GGUF 全档位量化与官方评估证据仓库 |
两个工程细节值得一提。首先,团队同步发布了「评估证据(Evaluation Evidence)」数据集——每项基准分数都附带任务级证据与完整性元数据。这在开源模型里并不常见:绝大多数模型卡只给一个数字,VeriLoop 把「分数怎么来的」一并公开。其次,GGUF 量化覆盖从 BF16 到 IQ1_M 的完整阶梯,且量化质量的判定协议被完整冻结并公开(下一节展开)。
九项基准成绩与口径辨析
官方报告的九项基准实测成绩如下(均为自报,附证据数据集,截至本文发布尚无独立第三方复核):
| 基准 | VeriLoop E2 自报分数 | 考察维度 |
|---|---|---|
| SWE-bench Pro | 76.2% | 真实仓库缺陷修复(抗污染) |
| Terminal-Bench 2.1 | 88.8% | 终端环境多步任务 |
| Terminal-Bench 3.0 | 29.7% | 容器化跨域终端任务 |
| Terminal-Bench 4.0 | 37.9% | 持续更新的高难终端任务 |
| DeepSWE v1.1 | 64.6% | 深度软件工程任务 |
| SWE-Marathon v1.1 | 45.0% | 长程编码马拉松 |
| AIME 2026 | 98.3% | 竞赛数学 |
| GPQA Diamond | 93.94% | 研究生级科学问答 |
| MathArena Apex 2025 | 89.6% | 高难数学推理 |
这组数字需要放进两个坐标系里读。
坐标系一:与公开官方榜单对照。SWE-bench Pro 公开榜(Scale SEAL,10 月 9 日读取)头部为 Muse Spark 1.1 的 61.50%(±3.10)。VeriLoop E2 自报 76.2%,比公开榜头部高出约 14.7 个百分点——但两者口径不同:官方榜要求统一脚手架(scaffolding)提交,VeriLoop 的分数来自其自报 harness 与证据数据集,尚未进入 Scale 官方榜单。这 14.7 分的差距里有多少来自 harness 差异、多少来自模型能力,目前无法拆分。
坐标系二:跨代际成绩的落差。Terminal-Bench 2.1 拿到 88.8%,但 3.0 降到 29.7%、4.0 只有 37.9%。同一模型在相邻三代基准上落差超过 50 个百分点,说明其能力优势集中在已充分见过的任务形态上,对持续更新的新任务分布仍有明显空隙——这与本站此前对 Reflection Beam 的分析结论一致:开发权重模型在「自家舒适区基准」与「新代际基准」之间的落差,是评估时必须检查的项目。
VeriLoop E2 全部九项分数为团队自报,证据数据集公开但未经独立第三方复核;SWE-bench Pro 76.2% 不能与 Scale 官方榜单的统一脚手架成绩直接混排比较。在团队提交官方榜或第三方复现之前,建议将其视为「有证据支撑的自报成绩」而非「榜单成绩」。
GGUF 量化纪律:把「保真度」与「能力损失」分开
VeriLoop E2 的 GGUF 量化发布方式,可能是整次开源里工程上最值得抄作业的部分。团队没有用「位宽越低越好」的直觉判断,而是建立了一套冻结的配对协议:以 canonical BF16 GGUF 为参照,在固定语料(WikiText-2 raw test)、固定分块、固定随机种子的条件下,统一测量 PPL、KL 散度、token 概率漂移与 Same top-p 比率。
| 量化档位 | 文件大小 | 相对 BF16 体积 | PPL 漂移 | 定位 |
|---|---|---|---|---|
| BF16(参照) | 50.113 GiB | — | — | 质量参照基准 |
| Q8_0 | 26.632 GiB | -46.9% | 极小 | 高保真度 |
| Q6_K | 20.566 GiB | -58.96% | -0.0395% | 综合甜点位(视为与 BF16 平齐) |
| Q5_K_M | 18.965 GiB | -62.16% | +0.4450% | 内存-质量平衡点 |
| IQ1_M | 16.790 GiB | -66.5% | 未单项标注 | 最小占用(Same top-p 95.87%,5.36 有效 BPW) |
更难得的是团队主动划出了一条多数发布者避而不谈的红线:量化保真度不等于下游能力损失。官方明确声明,目前并未对每个量化档位重跑完整九项基准,因此 +0.3191% 或 +0.4450% 的 PPL 漂移不能被解读为 SWE-bench、AIME、GPQA 等任务分数的等比例下降。这句话堵死了下游最常见的一种过度解读,也把「量化档位选择」诚实地交还给部署者按目标自行权衡。此外官方提醒:16.79 GiB 的模型文件并不意味着能在 16 GiB 显存上完全卸载运行——KV 缓存、计算缓冲区与分配器开销都在运行时内存之外另算。
黎曼猜想临界线零点 67.35%:数学验证的样本
发布报道中引起较多关注的一项结果,是团队报告模型在黎曼猜想临界线零点比例下界问题上达到 67.35%。需要准确理解这项工作的性质:这不是「证明或证伪黎曼猜想」,而是在该问题的某个可计算切片上,模型产出的推导制品通过了外部验证——即一条对零点比例下界的、可检查的数学论证。它的价值在于示范了 VGR 的目标场景:验证权威存在、进展可判定的领域,智能体的自主探索才有收敛保障。代码(测试通过即进展)与形式化数学(证明检查器)恰好是这类领域的两个极端样本;而 VeriLoop E2 在这两个方向上都布置了基准,这个实验设计本身是自洽的。
与同类技术路线对比
把 VeriLoop E2 放进 2026 年秋季的智能体训练基础设施图谱里,三条路线的分工一目了然:
| 路线 | 代表项目 | 解决的问题 | 与部署 harness 的关系 |
|---|---|---|---|
| 接管式 Agentic RL | verl、AReaL、slime | 训练框架接管环境交互循环 | 需在框架内重写智能体,训练与部署行为可能不一致 |
| Harnessed Agentic RL | 微软 Agent Lightning v1.0 | 直接用部署 harness 训练,LLM 代理拦截 API 调用 | 部署即训练,行为一致;关心训练管道效率 |
| 循证收敛递归(VGR) | VeriLoop E2 | 训练信号与状态判据的语义可信:什么才算进展 | 验证权威外置且确定性,Verifier 不进反向传播 |
对使用者而言,这三条路线并非互斥选项:一个完整的智能体训练栈完全可能同时采用 Agent Lightning 式的拦截管道与 VGR 式的进展判据。VeriLoop 团队目前把两者打包在自己的模型与 harness 里,但 VGR 作为机制描述并不绑定 27B 这一具体基座。
局限与冷静判断
综合全部公开信息,VeriLoop E2 的边界可以概括为四条。其一,自报未复核:九项基准均无独立第三方复现,SWE-bench Pro 与官方榜的 14.7 分差距无法归因。其二,新代际基准仍有明显空隙:Terminal-Bench 3.0/4.0 的成绩说明能力尚未跨代际迁移。其三,量化档位的下游影响未测:官方自己承认未对每个 GGUF 档位重跑基准,本地部署者需要自行验证。其四,Verifier 的工程成本未披露:VGR 依赖外部验证权威,但验证器的实现细节、运行开销与覆盖范围,官方资料着墨有限,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
尽管如此,这次开源的示范价值是清晰的:它把「智能体的可靠性」从一句口号拆成了可操作的工程问题——状态持久化需要证据、训练信号需要语义分层、量化发布需要冻结协议。这三件事中的任何一件,都值得其他模型团队跟进。