一份 9 月 24 日发布、10 月 5 日被多家媒体转述的红队报告,把「间接提示注入」这件事从论文推到了普通内容里。做端到端 agent 安全的公司 ClawSecure 发布了一份两卷本的对抗研究,声称在 14 个来自五家前沿实验室和三个主流 MCP 平台的模型上,系统性地复现了间接提示注入的失守——也就是一封邮件、一份共享文档、一张工单这类普通内容,就能劫持一个会读它们的智能体。

风险在日常内容里,不在模型里 普通内容 邮件/文档/工单 夹带注入指令 agent 读取 把内容当指令 被劫持去偷凭据 或外泄数据 后果 凭据/资金/隐私 用户无感知 责任归谁?
图 1|ClawSecure 报告的核心:风险藏在 agent 会读取的普通内容里,一封邮件或一份文档就能把它引向偷凭据、外泄数据,而用户可能毫无觉察。

报告覆盖的模型横跨 Anthropic、OpenAI、Google、DeepSeek 和阿里的 Qwen,结论是每一个被测模型都「听从了攻击者」——也就是间接提示注入这一 OWASP 列为自主 AI 头号威胁的攻击。更扎眼的是它对主流生产平台上 MCP 默认配置的披露:Dropbox Dash、Notion、Linear 这些被广泛接入 agent 的平台,被指存在可被利用的默认弱点。报告还称,用厂商自己的话反驳了其中三则已发布的安全声明,包括一条曾被标为「0% 攻击成功率」的 Claim,被它测出 15.2%。

必须先把立场摆清楚:这是一份供应商自家的红队报告,带着明显的销售动机,里面的数字都还没经独立复现,不该被当成客观基准来引用。但抛开营销成分,它点出的结构性问题却是真的——当智能体开始读邮件、读文档、读工单,攻击面就从「模型会不会被骗」转移到了「它会读的内容里有没有埋东西」。模型再强,只要它默认信任自己读到的文本,普通内容就能变成指令。这也是为什么近一年来护栏研究从「盯模型输出」一路挪到了「盯工具调用前的执行图」。

责任归属,才是更难的一题 实验室口径 OpenAI:开发者负责 Google:自己清洗 责任外推 报告主张 独立测试国家标准 买方部署前可见率 与国会办公室协作
图 2|报告的更大议题是责任归属:实验室把安全推给开发者,它则主张建立独立测试的国家标准,让买方在部署前就能看到真实的注入失守率。

这份报告真正值得行业接住的,是它把「责任归属」这道难题摆到了台前。报告里点名,OpenAI 称实现护栏「是开发者的责任」,Google 则让「所有构建 agent 的集成方」自己去做清洗——但同一批实验室,恰恰在最需要被告知的人群面前,把最危险的部分营销得最猛。ClawSecure 因此过去两个月在和两党国会办公室协作,想推动一套独立的 agent 测试国家标准,让买方在部署前就能透明地看到某个模型的真实注入失守率。无论这家公司动机如何,它逼出的这个问题是实在的:当 agent 已经在管钱、管业务、管关键系统,而每一家都能被它读到的内容劫持,却没有统一标准去衡量「到底多容易失守」,这本身就是个 accountability 真空。

把视角拉回买家,报告的实操价值不在吓人数字,而在它揭示的默认配置风险:把 MCP 接进 Dropbox Dash、Notion、Linear 这类平台时,默认权限和信任边界很可能就是入口。行业里更稳妥的做法,是把工具权限收窄、对不可逆动作要求显式确认、把密钥放在 agent 上下文之外、给工具描述当成不可信输入来对待,再补上能重建整段运行的日志与真实可用的急停。也就是说,安全不能只靠模型「自己不作恶」,而得靠结构——给工具窄权限、给操作留痕、给危险动作设闸门。

当然,整份报告带着供应商的立场,所有数字都应被标注为「厂商自报、未经独立复现」,尤其 14 个模型全失守、某平台默认弱点这类结论,需要进一步验证才能当成事实。它更大的意义是替行业把「间接提示注入是日常内容里的风险,而非模型漏洞」这件事又敲了一遍,并把责任归属的争论推到了监管面前。后续是否真有国家标准落地、各家平台是否修补默认配置,目前官方及行业暂未披露更多细节,将持续跟进迭代动态。