2026 年 9 月 24 日,一篇题为 SkillApt 的 arXiv 论文提出了一个针对智能体技能使用的朴素却常被忽略的问题:当智能体从知识库里检索出一堆可复用技能(Skills)并注入上下文时,被检索到的技能是否真的需要在当前状态被激活?论文的核心主张是,把检索到哪些技能与当前是否值得加载拆成两个独立决策,并据此构建一个检索后激活框架,用反事实证据做 LOAD 与 ABSTAIN 的判断。
检索与激活,本应是两个决策
今天的智能体框架普遍把技能当作检索到就注入的资源:一个检索器返回若干相关技能,系统便把它们一股脑塞进上下文。这种做法的代价是上下文被大量未必用得上的能力占满,token 成本与注意力干扰同步上升。SkillApt 的洞见在于,检索回答的是哪些技能可能相关,而激活回答的是在当前执行状态下、加载它是不是划算——两者不该被同一个动作吞掉。论文用匹配过的加载与不加载对照运行来积累执行证据,再借相似历史状态的后果,对每个候选技能给出 LOAD 或 ABSTAIN 的结论。
在冻结的确认性基准 SRA-Bench 上,SkillApt-E 拿到了与 BM25 Top-1 相同的观察准确率(0.838),却把技能激活率从 100% 降到了 31.5%,平均 token 用量下降了 74.3%。这组数字之所以有说服力,是因为它同时守住了效果与开销:没有用准确率换节省,而是在不牺牲结果的前提下,把上下文里真正生效的技能比例压了下来。对动辄往上下文里塞几十个工具与技能的现代智能体,这种少加载直接对应更低的推理成本与更短的延迟。
激活边界随基座模型变化
论文的进一步诊断显示,技能本身的效用,以及激活边界的可学性,会随基座模型不同而变化。换句话说,某一套激活策略在模型 A 上表现好,换到模型 B 上可能就要重新校准。这意味着激活不应被当成一套写死的规则,而是一类需要按模型、按任务持续学习的决策。对框架设计者,这提示了技能路由应当具备可塑性:检索与激活解耦之后,激活环节本身也要能随模型能力漂移而调整,而不是一次性调参通吃。
把视线拉回行业,SkillApt 的命题正切中当下 Agent Skills 与 MCP 工具泛滥带来的真实痛点。随着各大模型厂把技能与连接器作为生态卖点,单个智能体能调用的能力数量迅速膨胀,上下文与成本随之失控。SkillApt 给出的解法不是减少技能总量,而是让该不该用一个显式、可学习的决策,这与近期围绕技能选择、上下文压缩的一系列研究方向相互呼应。
需要打折扣看的部分
客观地说,SkillApt 仍处在早期验证阶段。其一,结论主要来自 SRA-Bench 这类确认性基准,真实生产环境里的技能分布与失败模式可能更复杂;其二,反事实证据的构建依赖足够的对照运行样本,在小样本或高变动场景里,激活判断的稳定性有待检验;其三,论文把检索与激活解耦,但二者在系统实现上如何高效协同,尤其是激活决策的延迟与额外开销,仍需工程化打磨。对框架与平台团队,更务实的启发是:先把技能检索与激活在架构上分开,再为激活环节引入轻量的对照评估,逐步把上下文从尽量塞满改成按需点亮。对应用开发者,这提醒我们在给智能体装配技能时,应关注每个技能的激活率而非拥有量,把不常生效的能力移出热路径。对国内大模型与工具生态,SkillApt 也指向一个趋势:当工具数量不再稀缺,谁能把选得准、用得省做成默认能力,谁就更可能在智能体工程层拿到优势。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。