跑过大规模智能体任务的人都知道一个不太体面的事实:你的 agent 每开一个沙箱,就在云上占着一份内存,而这份内存的大部分时间是闲置的。一个任务可能扇出几十个并发沙箱会话,每个都从同一个模板启动、执行相似的动作序列,然后在模型思考的那几秒里安静地待着。香港科技大学的团队把这笔账算清楚了:他们提出的 AgentZip 系统,能把这些沙箱的自有内存最多压缩 8.7 倍,而调优过的 Linux 标准压缩只能做到 2.1 倍。论文 9 月 10 日挂上 arXiv(2609.11294),署名七人。
先解释为什么常规压缩在这里失灵。传统内存压缩为相互独立的负载设计,它在三个维度上都不适配智能体沙箱:怎么压——它要求页面相同才能去重,而沙箱之间是「高度相似但不完全相同」;压什么——它只敢压冷页,用保守的选页策略控制缺页开销;何时压——它靠内存压力或定时器触发,完全不知道 agent 正在干什么。
AgentZip 在这三个维度上各做了一件事。利用模板相对冗余和跨沙箱冗余,让压缩器能从「相似但不同」的页面中获益;把压缩范围放宽到任何「有收益表示」的页面,而不是只盯着冷页;也是最关键的第三件事——按执行相位调度压缩,把昂贵的压缩工作对齐到 LLM 等待期。模型在生成的时候,沙箱本来就没有活干,这段时间是天然的维护窗口。开销控制的重心从「压缩时选页」移到「恢复时预取」,后者是可预测的。
数字上的收益很直接:激进压缩原本最高会带来 3.1 倍的减速,相位感知调度把它降到 1.40 倍,同时几乎保留了全部内存节省。在 LLM 训练与推理两类负载上,8.7 倍对 2.1 倍的差距稳定存在。对运行大规模强化学习训练或多智能体评测的平台来说,这直接决定了同一批机器上能并行跑多少个智能体——内存不再按「每个沙箱一份完整副本」计价。
这篇论文真正值得带走的是那个调度洞察,它的影响超出内存管理本身。智能体循环里有一段巨大的、可预测的、周期性的空闲窗口——每次模型生成、每次工具调用的往返、每次限流退避,沙箱都在空转。大多数基础设施仍按资源压力调度后台工作,这是从「不会按固定节奏暂停」的负载那里继承来的习惯。快照、垃圾回收、索引重建、日志归集,这些工作现在都在和前台执行抢资源,而它们本可以被搬进推理的等待期。AgentZip 只是把这件事在内存压缩上做了一次系统化示范。
需要标注的边界也有三条。其一,论文摘要未附开源仓库,机制描述足够复现,但 8.7 倍的数字出自作者自己的环境与负载,跨平台外推需要验证。其二,评测基准是 LLM 训练与推理工作负载,真实生产平台上还有网络延迟、存储 IO 等变量未进入模型。其三,压缩调度引入了新的时序行为——如果多个沙箱共享宿主机,后台压缩的时机本身可能成为信息侧信道的一个来源,这类风险论文没有展开讨论。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。