把「可复现」放回国产编码智能体的桌面

六月里,智谱把 GLM-5.2 推上 GLM Coding Plan 全量开放,并在随后几天放出 MIT 协议的模型权重,托管在 Hugging Face 与 ModelScope。这件事在发布当周被 benchmark 空缺的喧嚣盖过,但放到九月末回头看,它的分量更清楚了:一个约七百五十三亿参数的 MoE 模型、每 token 只激活约四百亿,带着一百万 token 的稳定上下文和十三万 token 的单次输出上限,以商业友好的 MIT 协议直接开放下载、部署和商用。对国内想做编码智能体的团队来说,这意味着不必再被某一家的 API 账单和黑盒权重卡住——把底座换成自托管,把客户端指向一个新 base URL,就能在本地复现一条长程编码链路。权重、脚手架能力、可复现评测三者齐发,才构成一个真正能拿来对标闭源的开源 baseline。

开源权重商业友好直接下载多参数规模智能体脚手架终端长程稳定工具调用不丢状态评测脚本可复现基准横向对比第三方可验只放权重不放脚手架,外部难验证厂商自报成绩——三者齐发才是开源 baseline国产开源编码权重节奏明显加快,GLM-5.2 是其中受关注的一个
图 1|智谱 GLM-5.2 放出 1M 上下文的 MIT 开源权重,配合终端长程智能体能力,让编码基准可被本地复现,延续国产开源编码加速节奏。

1M 上下文为什么是编码智能体的命门

GLM-5.2 最被反复讲的是那个一百万 token 窗口,它从 GLM-5.1 约二十万直接跳了五倍。对编码智能体,这个数字不是面子工程,而是能不能把「整个中等仓库加测试加长工作记录」塞进同一条推理链路的前提。智谱自己的说法里有个细节:它花几个月扩充了一百万 token 的 Coding Agent 训练环境,覆盖大规模实现、自动化研究、性能优化等领域,才让一百万上下文在真实长程任务里不「中段垮掉」。这也是为什么它在 FrontierSWE、SWE-Marathon、PostTrainBench 这类长程基准上能排到开源模型里靠前,且自述在完整开发到联调测试打包上线的多端链路里累计处理八十八万以上 token,几乎用满窗口。对 Agent 而言,上下文不是容量,是它能不能「不丢状态地连续干」的底座。

终端长程:卖点被写进了能力而非噱头

GLM-5.2 的终端长程能力,靠的是把两件容易被忽略的事当成核心。其一,长上下文代码库——Agent 能始终把整个工程留在视野里,少压缩、少遗忘;其二,稳定的工具调用格式——配合 Anthropic 兼容端点,Claude Code、Cline、OpenClaw 这类客户端只要改一个 base URL 就能接上,模型 ID 写作 glm-5.2 或带满窗口的 glm-5.2[1m],再切到 Max 思考档跑复杂多步编码。厂商自报 Terminal-Bench 2.1 为 81.0、SWE-bench Pro 为 62.1, Artificial Analysis 综合指数给到 51、居开源模型前列;这些数里有厂商口径,也已有独立评测 corroborate 大方向。真正关键的不是某一项分数,而是它把「读文件、改文件、跑测试、看报错、再改」这个循环能稳定跑通,当成产品能力而非演示片段来交付。

读文件 → 改文件 → 跑测试 → 看报错 → 再改长上下文代码库稳定工具格式循环不崩硬骨头在状态保持:任一步丢失都让长循环崩掉,所以两者被写进卖点
图 2|GLM-5.2 主打终端长程任务:把 1M 上下文代码库与稳定工具调用格式当成核心,避免多步循环里状态丢失。

接力棒已经交到 GLM-5.3 手上

把时间线拉到九月末,GLM Coding Plan 已全量上线 5.3,模型 API 近期开放,完整权重计划在发布两周、安全评估完成后开源。智谱自述 5.3 在编程上的内部基准 Z.ai Code Bench 比 5.2 提升约百分之五十,Terminal-Bench 3.0 从 4.6 升到 28.3、超过 Kimi K3 的 17.4,DeepSWE 从 46.2 到 66.9,Agents' Last Exam(CLI)也超过 Opus 4.8 与 Kimi K3。但要泼的冷水依旧:公开榜可能有污染,内部基准是厂商自测;5.3 的权重尚未开源,可复现性要等它真正放出才能兑现。换句话说,国产开源编码的「可复现底座」今天由 5.2 的 MIT 权重撑着,5.3 则是既定要接棒的下一棒——它的开放节奏,会决定这条线能不能从「能跑」走到「能审计、能横向比」。

给选型的两个实在提醒

对想用国产开源编码智能体的人来说,两条提醒比追分数更实在。其一,自托管是数据中心的活:一百万上下文的 KV 缓存加上七百多亿参数的 MoE,约需八张 H200(FP8),更少卡要靠激进 INT4 量化,落地前先算清显存与吞吐,别被「开源就能跑」误导。其二,评测要分层看:厂商数和独立数分开,Code Arena 这类盲测和 SWE-bench 这类硬基准分开,长程任务的分和短任务的分分开。GLM-5.2 在国产模型里把长上下文与终端长程做成可复现选项,这一步本身有长期价值;至于它和闭源旗舰的代差还剩多少,官方及行业暂未披露更多细节,后续将持续跟进迭代动态。把「能不能在自己机器上复现一条长程编码链路」当成验收标准,比记某一个榜单排名更稳。

一句收尾

GLM-5.2 开源权重的意义,不在它某天超过谁,而在于它把「国产编码智能体」从订阅一个黑盒,变成可以下载、可以托管、可以用自己基准去验的一件事。当 5.3 的权重也按承诺放出,这条可复现的线才算真正接上。