提示注入是智能体安全里最磨人的一类攻击:恶意指令藏在邮件、网页、文档里,Agent 读进去就照着做。传统防线多在内容层下功夫——过滤可疑文本、设指令层级、把高风险的动作拦一道人工确认。但这些都挡不住一种情况:攻击者不写「请越权」,而是用看起来正常的句子,把 Agent 说服去调用一个完全合规的工具、传完全合规的参数。网关看到的是一笔再正常不过的请求,内容过滤一声不响。
换一个视角:注入是「行为漂移」
一篇 2026 年的预印本 DriftNet 换了个角度想问题:如果内容看不出破绽,那就看执行轨迹的形状。正常 Agent 的轨迹(调用序列、参数走向、目标收敛)是有规律的;一旦被注入牵着走,轨迹会在某个拐点突然偏离原定路径——比如本该去查数据库,半路拐去读本地文件再往外发。DriftNet 是一个双头轨迹 Transformer:一个头负责判断「这段轨迹有没有被注入」,另一个头负责定位轨迹里是哪一步拐的弯。
思路上的巧,在于它不依赖读懂攻击文本,而是把注入建模成「行为偏离」。这正好补上了内容过滤的盲区:哪怕指令措辞天衣无缝、参数合法,只要轨迹形态异常,就能被揪出来。对工程师来说,它给的是一个运行期可监控的信号,而不是事后的文本审计。
它站在哪一层防护里
要厘清位置:DriftNet 不是替代网关、指令层级或人工确认,而是叠在它们之上的「行为观测层」。网关管「能不能调」,指令层级管「该不该信这段文本」,DriftNet 管「调出来的轨迹像不像被带偏了」。三层各看各的,合起来才接近「授权范围内、但理由不对」这类最难防的语义攻击。
增量认知:智能体安全正从「管输入文本」往「管执行轨迹」迁移。内容看不出问题时,轨迹形态成了新的可观测信号——这和信息安全里「不只用特征码、也用行为基线」的演进是一路。
优势与局限,分开看
优势直接:它兜住了内容过滤兜不住的那类语义攻击,而且给出定位,便于复盘是哪一步出的事。局限也得说清:轨迹检测依赖「正常轨迹长什么样」的基线,面对全新任务或极少出现的合法非常规路径,可能误报;双头模型要喂足量带标注的轨迹数据,标注成本不低。更公允的判断是——它把提示注入防御从「读得懂攻击」推进到「看得懂行为」,是防护体系里缺的那一块拼图,但单靠它还撑不起整面墙。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。