技术解构 2026-10-11 25 分钟阅读 进阶

VeriLoop E2 深度解构:清华 SIGS 团队的「循证收敛递归」能否撬动可验证智能体

27B 开源模型用「生成者-验证者分权」重排智能体状态管理 — 九项基准自报数据全解读与口径辨析

摘要

清华大学深圳国际研究生院团队于 10 月上旬开源 VeriLoop E2:一个以 Qwen3.8-27B 为基座、面向代码智能体与科学推理的后训练模型。它的核心不是更大的参数量,而是一套被命名为「循证收敛递归」(VeriLoop-Governed Recurrence,VGR)的机制——把「生成候选」与「获得持久化资格」拆成两种权限,模型提出的任何中间状态都必须先外显为可检查的制品,再由独立 Verifier 判定是否构成严格进展。本文拆解 VGR 的设计动机与实现要点,梳理九项基准的自报成绩,辨析其与公开榜单的口径差异,并评估这套「可验证智能体」路线的真实边界。

背景:为什么「新增算力不等于真实进展」

2026 年智能体后训练的主流叙事,是把更多算力灌进推理循环:测试时扩展、自我修正、多轮重试。但清华深圳国际研究生院团队在 VeriLoop E2 的技术报告中,把一个被行业普遍回避的问题摆到了台前:新增的计算能否被证明真正构成了进展?

团队给出的两个失败样例非常具体:一次代码修改可能修好了主测试,却破坏了回归测试;一步数学推导可能减小了局部误差,却使另一个约束失效。在无约束的重试机制下,模型会陷入「幻觉循环」——看起来在持续工作,实际状态从未真正收敛,甚至倒退。这个问题在长程智能体任务(数小时到数周的自主运行)中被急剧放大:没有可靠的进展判据,运行时间越长,状态漂移越严重。

这也是近两个月智能体训练基础设施密集发版的共同背景:微软 Agent Lightning 走「部署即训练」路线(本站此前已有解构),Soket AI 的 LOOP 主打长任务 harness 的资源效率,而 VeriLoop E2 选择从另一个切口进入——不问「怎么训练得更强」,先问「什么才算变强」。

关键认知

VeriLoop 团队的问题意识与主流 RL 后训练框架不同:verl、AReaL、Agent Lightning 关心「如何在真实 harness 上高效训练」,VGR 关心「训练信号本身是否可信」。两者互补而非替代——前者解决训练管道,后者解决奖励与状态判据的语义。

VGR 机制拆解:生成者与验证者的权限分立

VGR(VeriLoop-Governed Recurrence,循证收敛递归)的核心是一条清晰的权力边界:模型是提议者(proposer),不是裁决者。

具体运作方式如下:

环节 职责方 具体动作 关键约束
提出候选 模型(生成智能) 抽象、诊断、重新规划,产出候选状态 候选必须先外显为可检查的制品,不允许模型私下提交内部状态
证据准入 外部 VeriLoop Harness(验证权威) 执行确定性检查,判定候选是否对「一组固定受保护义务」构成严格进展 无回归、义务不被破坏,才允许持久化
监督信号 训练管线 把「状态是否成立」外化为可学习的监督信号 离散 Verifier 不纳入反向传播,保持验证权威的确定性

三点设计值得展开。其一,受保护义务是固定的:验证基准不是每次重算,而是一组预先固定的义务集合,这避免了「验证标准随生成漂移」的自我循环。其二,「严格进展」是持久化的门槛:仅仅「不退步」不够,候选必须证明自己推进了某个义务,才获得被写入状态的资格。其三,Verifier 在训练循环之外:把离散的验证器纳入反向传播既不可行也不可取(破坏其确定性),VGR 的处理是把验证结果作为外部信号供模型学习,而非内化验证器本身。

配套的后训练数据也体现了同样的语义纪律:约 184 万条训练记录不是简单拼接的成功轨迹,而是被区分为「正确答案」「有效中间进展」「无进展」「回归」「不可比较」五类——把中间过程的不同语义显式编码,而不是把所有记录当成同一种「正样本」。

模型与训练数据:27B 基座与 184 万条标注记录

VeriLoop E2 的基础规格如下:

项目 规格 备注
基座模型 Qwen3.8-27B(后训练) Safetensors 实测 27.87B 参数
原生上下文 262,144 tokens 面向长程智能体任务
后训练数据 1,841,831 条记录 注意是记录数而非 token 数,官方未披露总 token 量
数据构成 代码智能体轨迹 + 科学推理 五类语义标签(见上文)
许可证 Apache-2.0 权重、评估证据数据集同步开源
发布渠道 Hugging Face / ModelScope 附 GGUF 全档位量化与官方评估证据仓库

两个工程细节值得一提。首先,团队同步发布了「评估证据(Evaluation Evidence)」数据集——每项基准分数都附带任务级证据与完整性元数据。这在开源模型里并不常见:绝大多数模型卡只给一个数字,VeriLoop 把「分数怎么来的」一并公开。其次,GGUF 量化覆盖从 BF16 到 IQ1_M 的完整阶梯,且量化质量的判定协议被完整冻结并公开(下一节展开)。

九项基准成绩与口径辨析

官方报告的九项基准实测成绩如下(均为自报,附证据数据集,截至本文发布尚无独立第三方复核):

基准 VeriLoop E2 自报分数 考察维度
SWE-bench Pro 76.2% 真实仓库缺陷修复(抗污染)
Terminal-Bench 2.1 88.8% 终端环境多步任务
Terminal-Bench 3.0 29.7% 容器化跨域终端任务
Terminal-Bench 4.0 37.9% 持续更新的高难终端任务
DeepSWE v1.1 64.6% 深度软件工程任务
SWE-Marathon v1.1 45.0% 长程编码马拉松
AIME 2026 98.3% 竞赛数学
GPQA Diamond 93.94% 研究生级科学问答
MathArena Apex 2025 89.6% 高难数学推理

这组数字需要放进两个坐标系里读。

坐标系一:与公开官方榜单对照。SWE-bench Pro 公开榜(Scale SEAL,10 月 9 日读取)头部为 Muse Spark 1.1 的 61.50%(±3.10)。VeriLoop E2 自报 76.2%,比公开榜头部高出约 14.7 个百分点——但两者口径不同:官方榜要求统一脚手架(scaffolding)提交,VeriLoop 的分数来自其自报 harness 与证据数据集,尚未进入 Scale 官方榜单。这 14.7 分的差距里有多少来自 harness 差异、多少来自模型能力,目前无法拆分。

坐标系二:跨代际成绩的落差。Terminal-Bench 2.1 拿到 88.8%,但 3.0 降到 29.7%、4.0 只有 37.9%。同一模型在相邻三代基准上落差超过 50 个百分点,说明其能力优势集中在已充分见过的任务形态上,对持续更新的新任务分布仍有明显空隙——这与本站此前对 Reflection Beam 的分析结论一致:开发权重模型在「自家舒适区基准」与「新代际基准」之间的落差,是评估时必须检查的项目。

口径红线

VeriLoop E2 全部九项分数为团队自报,证据数据集公开但未经独立第三方复核;SWE-bench Pro 76.2% 不能与 Scale 官方榜单的统一脚手架成绩直接混排比较。在团队提交官方榜或第三方复现之前,建议将其视为「有证据支撑的自报成绩」而非「榜单成绩」。

GGUF 量化纪律:把「保真度」与「能力损失」分开

VeriLoop E2 的 GGUF 量化发布方式,可能是整次开源里工程上最值得抄作业的部分。团队没有用「位宽越低越好」的直觉判断,而是建立了一套冻结的配对协议:以 canonical BF16 GGUF 为参照,在固定语料(WikiText-2 raw test)、固定分块、固定随机种子的条件下,统一测量 PPL、KL 散度、token 概率漂移与 Same top-p 比率。

量化档位 文件大小 相对 BF16 体积 PPL 漂移 定位
BF16(参照) 50.113 GiB — — 质量参照基准
Q8_0 26.632 GiB -46.9% 极小 高保真度
Q6_K 20.566 GiB -58.96% -0.0395% 综合甜点位(视为与 BF16 平齐)
Q5_K_M 18.965 GiB -62.16% +0.4450% 内存-质量平衡点
IQ1_M 16.790 GiB -66.5% 未单项标注 最小占用(Same top-p 95.87%,5.36 有效 BPW)

更难得的是团队主动划出了一条多数发布者避而不谈的红线:量化保真度不等于下游能力损失。官方明确声明,目前并未对每个量化档位重跑完整九项基准,因此 +0.3191% 或 +0.4450% 的 PPL 漂移不能被解读为 SWE-bench、AIME、GPQA 等任务分数的等比例下降。这句话堵死了下游最常见的一种过度解读,也把「量化档位选择」诚实地交还给部署者按目标自行权衡。此外官方提醒:16.79 GiB 的模型文件并不意味着能在 16 GiB 显存上完全卸载运行——KV 缓存、计算缓冲区与分配器开销都在运行时内存之外另算。

黎曼猜想临界线零点 67.35%:数学验证的样本

发布报道中引起较多关注的一项结果,是团队报告模型在黎曼猜想临界线零点比例下界问题上达到 67.35%。需要准确理解这项工作的性质:这不是「证明或证伪黎曼猜想」,而是在该问题的某个可计算切片上,模型产出的推导制品通过了外部验证——即一条对零点比例下界的、可检查的数学论证。它的价值在于示范了 VGR 的目标场景:验证权威存在、进展可判定的领域,智能体的自主探索才有收敛保障。代码(测试通过即进展)与形式化数学(证明检查器)恰好是这类领域的两个极端样本;而 VeriLoop E2 在这两个方向上都布置了基准,这个实验设计本身是自洽的。

与同类技术路线对比

把 VeriLoop E2 放进 2026 年秋季的智能体训练基础设施图谱里,三条路线的分工一目了然:

路线 代表项目 解决的问题 与部署 harness 的关系
接管式 Agentic RL verl、AReaL、slime 训练框架接管环境交互循环 需在框架内重写智能体,训练与部署行为可能不一致
Harnessed Agentic RL 微软 Agent Lightning v1.0 直接用部署 harness 训练,LLM 代理拦截 API 调用 部署即训练,行为一致;关心训练管道效率
循证收敛递归(VGR) VeriLoop E2 训练信号与状态判据的语义可信:什么才算进展 验证权威外置且确定性,Verifier 不进反向传播

对使用者而言,这三条路线并非互斥选项:一个完整的智能体训练栈完全可能同时采用 Agent Lightning 式的拦截管道与 VGR 式的进展判据。VeriLoop 团队目前把两者打包在自己的模型与 harness 里,但 VGR 作为机制描述并不绑定 27B 这一具体基座。

局限与冷静判断

综合全部公开信息,VeriLoop E2 的边界可以概括为四条。其一,自报未复核:九项基准均无独立第三方复现,SWE-bench Pro 与官方榜的 14.7 分差距无法归因。其二,新代际基准仍有明显空隙:Terminal-Bench 3.0/4.0 的成绩说明能力尚未跨代际迁移。其三,量化档位的下游影响未测:官方自己承认未对每个 GGUF 档位重跑基准,本地部署者需要自行验证。其四,Verifier 的工程成本未披露:VGR 依赖外部验证权威,但验证器的实现细节、运行开销与覆盖范围,官方资料着墨有限,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

尽管如此,这次开源的示范价值是清晰的:它把「智能体的可靠性」从一句口号拆成了可操作的工程问题——状态持久化需要证据、训练信号需要语义分层、量化发布需要冻结协议。这三件事中的任何一件,都值得其他模型团队跟进。

核心发现

参考来源

  1. ModelScope — tsinghua-sigs-robot-lab/VeriLoop-E2 与 VeriLoop-E2-GGUF 官方模型卡(含冻结配对协议、基准记录与量化对照表)
  2. Hugging Face — VeriLoop-E2-Evaluation-Evidence 评估证据数据集(任务级证据与完整性元数据)
  3. The Next Gen Tech Insider — Tsinghua SIGS Robot Lab Unveils VeriLoop E2 for Verifiable Reasoning(2026.10)
  4. 网易号 — 黎曼猜想临界线零点比例下界达 67.35%:清华团队开源模型 VeriLoop E2(2026.10)
  5. 覆手为雨 AI 早报 — 清华开源 VeriLoop E2:Qwen 3.8-27B 后训练,VGR 机制与团队信息(2026.10.07)