一份 9 月 24 日发布、10 月 5 日被多家媒体转述的红队报告,把「间接提示注入」这件事从论文推到了普通内容里。做端到端 agent 安全的公司 ClawSecure 发布了一份两卷本的对抗研究,声称在 14 个来自五家前沿实验室和三个主流 MCP 平台的模型上,系统性地复现了间接提示注入的失守——也就是一封邮件、一份共享文档、一张工单这类普通内容,就能劫持一个会读它们的智能体。
报告覆盖的模型横跨 Anthropic、OpenAI、Google、DeepSeek 和阿里的 Qwen,结论是每一个被测模型都「听从了攻击者」——也就是间接提示注入这一 OWASP 列为自主 AI 头号威胁的攻击。更扎眼的是它对主流生产平台上 MCP 默认配置的披露:Dropbox Dash、Notion、Linear 这些被广泛接入 agent 的平台,被指存在可被利用的默认弱点。报告还称,用厂商自己的话反驳了其中三则已发布的安全声明,包括一条曾被标为「0% 攻击成功率」的 Claim,被它测出 15.2%。
必须先把立场摆清楚:这是一份供应商自家的红队报告,带着明显的销售动机,里面的数字都还没经独立复现,不该被当成客观基准来引用。但抛开营销成分,它点出的结构性问题却是真的——当智能体开始读邮件、读文档、读工单,攻击面就从「模型会不会被骗」转移到了「它会读的内容里有没有埋东西」。模型再强,只要它默认信任自己读到的文本,普通内容就能变成指令。这也是为什么近一年来护栏研究从「盯模型输出」一路挪到了「盯工具调用前的执行图」。
这份报告真正值得行业接住的,是它把「责任归属」这道难题摆到了台前。报告里点名,OpenAI 称实现护栏「是开发者的责任」,Google 则让「所有构建 agent 的集成方」自己去做清洗——但同一批实验室,恰恰在最需要被告知的人群面前,把最危险的部分营销得最猛。ClawSecure 因此过去两个月在和两党国会办公室协作,想推动一套独立的 agent 测试国家标准,让买方在部署前就能透明地看到某个模型的真实注入失守率。无论这家公司动机如何,它逼出的这个问题是实在的:当 agent 已经在管钱、管业务、管关键系统,而每一家都能被它读到的内容劫持,却没有统一标准去衡量「到底多容易失守」,这本身就是个 accountability 真空。
把视角拉回买家,报告的实操价值不在吓人数字,而在它揭示的默认配置风险:把 MCP 接进 Dropbox Dash、Notion、Linear 这类平台时,默认权限和信任边界很可能就是入口。行业里更稳妥的做法,是把工具权限收窄、对不可逆动作要求显式确认、把密钥放在 agent 上下文之外、给工具描述当成不可信输入来对待,再补上能重建整段运行的日志与真实可用的急停。也就是说,安全不能只靠模型「自己不作恶」,而得靠结构——给工具窄权限、给操作留痕、给危险动作设闸门。
当然,整份报告带着供应商的立场,所有数字都应被标注为「厂商自报、未经独立复现」,尤其 14 个模型全失守、某平台默认弱点这类结论,需要进一步验证才能当成事实。它更大的意义是替行业把「间接提示注入是日常内容里的风险,而非模型漏洞」这件事又敲了一遍,并把责任归属的争论推到了监管面前。后续是否真有国家标准落地、各家平台是否修补默认配置,目前官方及行业暂未披露更多细节,将持续跟进迭代动态。