2026 年 9 月 24 日,一篇题为 SkillApt 的 arXiv 论文提出了一个针对智能体技能使用的朴素却常被忽略的问题:当智能体从知识库里检索出一堆可复用技能(Skills)并注入上下文时,被检索到的技能是否真的需要在当前状态被激活?论文的核心主张是,把检索到哪些技能与当前是否值得加载拆成两个独立决策,并据此构建一个检索后激活框架,用反事实证据做 LOAD 与 ABSTAIN 的判断。

检索与激活,本应是两个决策

今天的智能体框架普遍把技能当作检索到就注入的资源:一个检索器返回若干相关技能,系统便把它们一股脑塞进上下文。这种做法的代价是上下文被大量未必用得上的能力占满,token 成本与注意力干扰同步上升。SkillApt 的洞见在于,检索回答的是哪些技能可能相关,而激活回答的是在当前执行状态下、加载它是不是划算——两者不该被同一个动作吞掉。论文用匹配过的加载与不加载对照运行来积累执行证据,再借相似历史状态的后果,对每个候选技能给出 LOAD 或 ABSTAIN 的结论。

检索与激活,是两个该分开的决策 检索(retrieval) 哪些技能可能相关 宽召回,宁可多 激活(activation) 当前状态是否值得加载 按需,宁可少 SkillApt 用反事实证据做 LOAD 与 ABSTAIN 判断 在 SRA-Bench 上,激活率从 100% 降到 31.5%,准确率不降 把「该不该用」从「检索到了就用」里拆出来,是核心洞见
图 1|技能检索与激活解耦后,上下文不再被无关能力占满

在冻结的确认性基准 SRA-Bench 上,SkillApt-E 拿到了与 BM25 Top-1 相同的观察准确率(0.838),却把技能激活率从 100% 降到了 31.5%,平均 token 用量下降了 74.3%。这组数字之所以有说服力,是因为它同时守住了效果与开销:没有用准确率换节省,而是在不牺牲结果的前提下,把上下文里真正生效的技能比例压了下来。对动辄往上下文里塞几十个工具与技能的现代智能体,这种少加载直接对应更低的推理成本与更短的延迟。

激活边界随基座模型变化

论文的进一步诊断显示,技能本身的效用,以及激活边界的可学性,会随基座模型不同而变化。换句话说,某一套激活策略在模型 A 上表现好,换到模型 B 上可能就要重新校准。这意味着激活不应被当成一套写死的规则,而是一类需要按模型、按任务持续学习的决策。对框架设计者,这提示了技能路由应当具备可塑性:检索与激活解耦之后,激活环节本身也要能随模型能力漂移而调整,而不是一次性调参通吃。

准确率持平,token 用量降 74.3% 准确率 0.838 与 BM25 Top-1 持平 不牺牲效果 激活率 31.5% 从 100% 降下来 少加载多省 token -74.3% 平均用量骤降 成本与延迟双赢 诊断显示:技能的效用与激活边界的可学性,随基座模型不同而变化 这意味着激活策略需要按模型校准,而非一套参数通吃 对 Agent Skills 与 MCP 工具泛滥,是直接的工程解法
图 2|「少加载」换来「少花钱」,且准确率不滑坡,正是工程想要的权衡

把视线拉回行业,SkillApt 的命题正切中当下 Agent Skills 与 MCP 工具泛滥带来的真实痛点。随着各大模型厂把技能与连接器作为生态卖点,单个智能体能调用的能力数量迅速膨胀,上下文与成本随之失控。SkillApt 给出的解法不是减少技能总量,而是让该不该用一个显式、可学习的决策,这与近期围绕技能选择、上下文压缩的一系列研究方向相互呼应。

需要打折扣看的部分

客观地说,SkillApt 仍处在早期验证阶段。其一,结论主要来自 SRA-Bench 这类确认性基准,真实生产环境里的技能分布与失败模式可能更复杂;其二,反事实证据的构建依赖足够的对照运行样本,在小样本或高变动场景里,激活判断的稳定性有待检验;其三,论文把检索与激活解耦,但二者在系统实现上如何高效协同,尤其是激活决策的延迟与额外开销,仍需工程化打磨。对框架与平台团队,更务实的启发是:先把技能检索与激活在架构上分开,再为激活环节引入轻量的对照评估,逐步把上下文从尽量塞满改成按需点亮。对应用开发者,这提醒我们在给智能体装配技能时,应关注每个技能的激活率而非拥有量,把不常生效的能力移出热路径。对国内大模型与工具生态,SkillApt 也指向一个趋势:当工具数量不再稀缺,谁能把选得准、用得省做成默认能力,谁就更可能在智能体工程层拿到优势。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。