一句话:让模型跳过文字,直接把脑子里的状态传给另一个模型
清华大学 NICS-EFC 实验室联合上海人工智能实验室与 Infinigence,提出 Cache-to-Cache(C2C,arXiv:2510.03215,已被 ICLR 2026 接收)。它的想法很反直觉:两个大模型协作时,与其把一个模型的内部表征压成一段输出文本、再由另一个模型重新读回,不如直接把它的 KV 缓存投影融合进对方。论文测得,相比单模型平均准确率提升 6.4 到 14.2 个百分点,相比同样的文本通信范式提升约 3.1 到 5.4 个百分点,而通信延迟平均下降约 2.5 倍。
为什么值得看:文本是模型间最贵的翻译层
在常见的多模型或多智能体设计里,模型之间靠文字交接。模型 A 先把分析结论写成句子,模型 B 再把这些句子当作上下文读进去。这个过程有两个代价:一是信息损耗,高维的内部语义被压成线性 token 序列,很多隐含线索就此丢失;二是延迟,生成与读取都要逐 token 进行,长上下文下尤其明显。C2C 要质疑的正是这个默认设定——如果通信的两端都是神经网络,为什么非得绕一圈自然语言?论文用一组对照实验先证明:直接丰富 KV 缓存里的语义,能提升回答质量且不增大缓存体积,这说明 KV 缓存本身就能当通信介质用。
机制拆解:Fuser 加门控,跳过中间文本
C2C 的实现靠一个叫 Cache Fuser 的小型神经网络。它把提供信息的 Sharer 模型的 KV 缓存,投影并融合进接收信息的 Receiver 模型的缓存空间,让 Receiver 后续计算直接建立在 Sharer 的内部表征之上,而不是建立在生成的文本上。难点在于两个模型的层数、结构与内部维度往往不同,无差别逐层融合会不稳定,于是 C2C 引入一个可学习的门控机制,逐层决定该融合多少。整段交换里不产生任何中间文本,Receiver 就像自己构建了那份上下文一样继续推理。值得注意的是,Fuser 被设计得很小,不会增大 KV 缓存体积——也就是说,换来的是更丰富的语义,却没增加存储开销。
收益与代价:质量延迟双升,规模化悬而未决
收益相当直观。相比各自为战的单模型,C2C 把多模型的互补能力真正用起来,平均准确率提升 6.4 到 14.2 个百分点;即便和同样的文本通信范式比,也仍有 3.1 到 5.4 个百分点的优势,同时延迟平均降约 2.5 倍,某些配置下提速更明显。论文在 Qwen、Llama 与 Gemma 等多个系列上验证了这一点。但代价也清楚:Cache Fuser 需要针对每一对模型组合单独训练,一旦要把几十个异构模型塞进同一条流水线,如何建立共享的潜在空间仍是开放工程问题。此外,若 Sharer 传递了错误信息,Receiver 反而可能答错原本能独立答对的题,强接收者配弱提供者的失败时更突出。
优势与局限:范式清爽,落地有门槛
优势在切中多模型协作的本质痛点:通信介质决定了信息保真度与速度。用内部表征代替文本,是一条少有人走却合乎直觉的路。局限在于:其一,成对训练让它在模型数量增多时扩展性存疑;其二,它要求调用方自管推理栈,能干预 KV 缓存,这对习惯调 API 的团队是一道门槛;其三,关于在更长上下文、更多模态与真实智能体流水线里的稳定性,官方及行业暂未披露更多细节,后续将持续跟进迭代动态。关于门控策略是否可跨模型复用,仍有待更多实验。
结语
C2C 把多模型通信从「写下来再读」推进到「直接传状态」,用 KV 缓存融合这一招同时换来质量与速度。它能不能走出论文、进入真实的多智能体系统,取决于那道成对训练的门槛,能不能被更通用的路由方案撬开。