一个绕不开的架构问题
多智能体系统迟早会遇到一个问题:整支智能体团队应该跑在同一层,还是分散在边缘与云之间。
直觉的答案通常围绕网络走。如果智能体之间的通信要跨过基站、城域与光链路,那么把需要频繁对话的智能体放在一起、把数据密集的环节放在云上,看起来是省钱的排法。这个直觉有一个前提:通信本身有可观的能耗代价。
9 月 16 日挂上预印本平台的一篇论文给出了不同的测量结果。论文编号 2609.18283,标题是《Where Should Agents Live? Energy-Memory Characterization of Agentic AI for the Edge-Cloud Continuum》,作者为 Carolina Fortuna、Vid Hanžel、Tim Strnad 与 Blaž Bertalanič。它要回答的是:多智能体工作流在边缘与云之间的能耗,究竟分布在哪些环节上。
为什么要重做一套度量
既有的 AI 生命周期能耗指标有两个共同的问题:它们评估的是孤立的单模型推理,或者干脆忽略多智能体执行图。
这两点在智能体场景里都是硬伤。一次智能体任务的能耗并不是「一次推理」的整数倍;它是一条有向的执行图——检索、规划、工具调用、校验、重试各自消耗不同,而且上游的输出会改变下游的输入长度。按单次调用估算多智能体工作流,误差会随图的分支增加而放大。
论文提出的指标叫 agentic-eCAL,是既有 AI 生命周期能耗成本指标的推广版。它由两个部分耦合而成:一个闭式的双速率单次调用能耗模型,把计算受限的预填充阶段与显存受限的解码阶段分开处理;以及一个七层网络传输模型,用来计算智能体之间文本在链路上往返的开销。
数据基础与那个反直觉的数字
为了让这套指标站得住,作者用了数百组 GPU 基准配置,覆盖英伟达 A100 与 H100 两代硬件、16 个开放权重模型、8 种编排拓扑。
在这套基础上得到的结论很集中:智能体之间的文本传输,在工作流总能耗中只占 0.25%,而且这个比例在 5G 无线接入网、城域链路与光链路上都成立。
论文由此给出推论:在边缘与云之间做智能体放置决策时,分布式带来的能耗主导项通常不是智能体之间文本的传输本身,而是这种通信诱发出来的额外推理与上下文处理。
把这句话说得更直白一些:真正花钱的不是「把话传过去」,而是「因为多说了这句话,下游又多想了多少」。一次跨智能体的交接,会往下一个智能体的上下文里塞进新的文本,后者要在更长的上下文上做预填充与解码。文本自身的比特量很小,但它撬动的计算量不小。
这个区分在工程上有一个直接后果。优化方向从「压缩传输」转向了「压缩交接」。前者关心的是带宽与编码,后者关心的是上一环到底该不该把这段内容交代给下一环、交代多少、以及能不能用结构化的摘要代替全文。多智能体系统里最贵的一句话,往往不是最长的那句,而是那句让下游重新检索了一遍的那句。
这条结论对架构的实际含义
如果传输占比确实是千分之几的量级,那么按「网络延迟与带宽」来切分智能体部署的方案,理由就被削弱了。取而代之应该被纳入评估的,是三种随拓扑变化的开销。
其一是单次交接带来的上下文膨胀。每增加一个智能体参与,往下游传递的文本就会增加,而预填充阶段的能耗与输入长度近似成正比。
其二是重试与回环的次数。多智能体系统里失败往往不是终止,而是回到上一个环节重来,一次回环的成本通常高于一次既定路径上的传递。
其三是工具调用侧的往返。检索、代码执行、外部接口这类动作的能耗并不在模型里,却由智能体编排决定其频次。
这也解释了一个在工程实践中反复被观察到的现象:多智能体系统未必比单智能体便宜。如果拆分方式只是把同一件事拆给更多人重复说,那么省下的传输开销远不足以抵消新增的推理量。架构评审里更该追问的是「这次拆分减少了多少轮对话」,而不是「这两台机器离得够不够近」。
企业侧的实际取用方式
对不跑电信网络的企业团队,这篇论文的可用部分不是那套指标公式,而是它给出的问题清单。
在做智能体拓扑设计时,可以把交接次数、每轮交接的平均文本长度、回环率、以及工具调用密度这四个量先量出来。它们都不需要新的监控系统,从现有链路日志里就能统计。这四个量决定了推理量的大头,而推理量决定了账单与电费。
反过来,跨区域部署的取舍依据要换。如果传输不是主要成本项,那么把智能体团队拆到多地部署所带来的收益,就应该从「省下的网络开销」改成「就近带来的合规与延迟收益」来论证。论证依据错了,方案选错的概率会上升。
必须打折扣的地方
三点局限要说清楚。
论文的靶子是电信网络运营者的决策场景,起点是 5G-Advanced 与 6G 自主运维。这套结论迁移到通用企业场景时,链路假设、模型规模与拓扑形态都需要重新校准,不能直接套用。
0.25% 是在特定模型集合与链路条件组合下测得的比例,论文摘要层面没有给出不同拓扑下的分布区间。把它当作常数引用并不合适。
此外,这项指标衡量的是工作流内部的能耗分布结构,不是绝对能耗规模。它回答「能耗在哪儿」,不回答「总量是否可接受」。对正在做电费或碳排预算的团队,仍需另一套绝对量核算。
为什么这类度量值得关注
智能体的运营指标这几年集中在三个方向:准确率、延迟与成本。能耗在多数公开材料里只以定性方式出现,被简化成「推理很贵」。而要让这条曲线从「感觉贵」变成「能算清楚贵在哪」,需要的正是这种把执行图、硬件代际与网络链路拆开度量的工作。
论文里有一个参照数字值得一提:生物大脑完成复杂认知的代谢功耗大约是 20 瓦。这个对照本身不是结论,但它点出了一件事——可持续的生命周期编排正在从公关话题变成运营指标。
目前该论文的工具链、数据集与不同拓扑下的完整分布尚未在公开层面展开,后续将持续跟进迭代动态。