9 月 17 日,Z.ai 发布技术文章《Toward Recursive Self-Improvement:GLM 如何构建自己的推理基础设施》,披露了一条不寻常的吞吐曲线:旗舰开源模型 GLM-5.3-Flash 的生产推理,全部跑在超过 10 万枚国产 AI 加速器组成的集群上,从系统跑通到生产就绪用时不到两周,端到端吞吐从初始基线的 1.00 倍一路提升到 3.22 倍。而做优化工作的主力,是一个由 GLM-5.3 自身驱动的 Infra Agent——模型参与了优化服务自己的那套系统。

先把工程背景摆出来,才知道这两周有多紧。官方描述的硬约束包括:国产加速器单卡内存与互联带宽受限;软件生态的算子支持不完整、不少文档缺失只能从底层原理自行推导;模型本身是新架构,要处理最长 100 万 token 的上下文与多模态请求。系统层的落点也很具体:线性注意力与语言模型头的节点内张量并行、ReplaySSM、混合 INT8/FP8/BF16 缓存量化、编码-Prefill-Decode 分离的 EPD 架构——每一项都是计算、显存、通信、调度之间的取舍。

GLM-5.3-Flash 端到端吞吐优化曲线(官方口径)四个阶段:系统启动与调度 → 并行与通信 → 内核优化 → 上线T+0T+6T+131.00x3.22x3.22x横轴为开发天数;曲线为官方公布的端到端吞吐增益,公司自述口径,未经第三方复核
图|两周内端到端吞吐从 1 倍走到 3.22 倍

Infra Agent 的分工被讲得很清楚:人负责定目标、搭反馈环境、审查高风险修改(审查范围覆盖数值语义、并发行为与生产风险);智能体负责分析系统栈、提出假设、产出内核补丁与栈层改动。CEO 汤筠在帖子里点出了要害:智能体卡住的原因很少是不会写代码,而是「端到端吞吐降了 20%」这样的信号不告诉它问题出在哪一层、下一步该验证什么假设——这是一个稀疏奖励下的信用分配难题,何况每次全量基准要跑数小时。

Z.ai 的解法叫密集反馈(dense feedback),把三层信号接进同一条迭代链:正确性反馈管结果算没算对,系统行为反馈管时间耗在哪个环节,性能反馈管哪个方案在什么条件下更快。三个条件缺一不可:信号要贴近具体内核与代码路径,获取要便宜到假设提出后能快速返回,结果要能通过参考实现或受控实验核验。智能体由此可以先把局部变化验证清楚,再决定要不要进完整服务测试。

密集反馈:让智能体不用猜正确性:结果对不对系统行为:时间花在哪性能:什么条件下更快人:目标、边界、高风险审查数值语义、并发行为、生产风险仍由工程师把关,高风险改动先审后上智能体:诊断、假设、改代码沿调用链追踪问题,读开源项目整理「优化骨架」,先局部验证再进全量测试为什么关键「吞吐降了 20%」这种稀疏信号不指出哪层坏了;反馈要贴近内核、获取便宜、结果可核验反馈设计源自把资深工程师隐式的「过程奖励」显式化
图|密集反馈三层信号与人机分工

三个落进上游的修复案例让这套流程有据可查。其一,KDA 上下文并行路径的精度漂移:序列变长后 TF32 舍入误差在连续状态矩阵合并中累积,问题定位到 Flash Linear Attention,相关修复已合入上游第 1180 号 PR。其二,KV 传输没有与 DeepEP 调度重叠,智能体沿着 Python 与 C++ 的调用链追到节点内路径未释放 GIL 的环节,修复后传输开销从 30% 以上降到 1% 以下。其三,一个 Decode 内核因分块方式重复计算同一归一化四次,重构后拿到 1.71 倍加速——优化思路来自智能体通读 SGLang、Flash Linear Attention、DeepGEMM 等项目后整理的「优化骨架」。

公司把这件事称为递归自我改进(RSI)最小闭环的出现,但边界也划得明白:模型没有训练自己,没有改自己的权重,做的是编写、测试与验证「服务自己的那套代码」;目标选择、边界设定与高风险审查仍然由人完成。文中还回溯了一条轨迹:2025 年 10 月起 GLM 被用于强化安全能力,不到一年内安全伙伴用它挖出数千个真实漏洞,公司为此设计了可信访问计划。新模型发布前,系统还以 Ox-Alpha 的化名在两个开发者平台匿名测试,一周内登顶用量榜、六天处理超 62 万亿 token(公司口径)。

辩证地看:吞吐、成本(官方称单 token 成本已接近主流英伟达 GPU 水平)与 token 数全部是公司自述,未经第三方复核,不同渠道对个别案例细节的转述也有出入,应以官方技术文章为准。「递归自我改进」的说法介于叙事包装与工程事实之间——真正坐实的是把芯片适配周期从以月计压缩到两周这件事,对评估国产算力做大规模推理的团队,这是一个值得拿自家负载去复测的数据点,而不是一句口号。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。