一句话:攻击者不再「问」AI 要代码,而是让 AI 替自己跑完整条链路
Anthropic 于 9 月 10 日发布《Detecting and Countering Misuse of AI: September 2026》,覆盖 2025 年 12 月到 2026 年 8 月、跨八个月的七类危害。报告核心的判断一句话就能概括:AI 在攻击活动里的角色,已经从「助手」变成了「总指挥」。它跟踪的多数行动里,威胁方搭建起多智能体工作流,让代理自主跑完侦察、利用、凭证收集、数据渗出,人只负责选目标、定目标、看结果。报告未指称 Anthropic 自身系统被攻破,所有涉案密钥均来自客户环境。
为什么值得看:这是「智能体用于进攻」被点名系统化
过去谈 AI 与安全,焦点多在防御侧——怎么给代理加护栏、怎么做权限收敛。这份报告把镜头反过来,呈现攻击者怎么把编码智能体、多智能体编排当成现成的作战流水线。它把滥用方称为 Generative Threat Groups(GTG),并量化「增益」沿速度、规模、深度三个方向展开。一个反直觉的结论是:当攻击者用上自适应工作流,传统靠签名与静态指标的防御被迫转入守势,因为对手能在你的检测触发后自己改、自己重新部署恶意载荷。这恰好呼应了同周 Google 的判断——攻击者已经从「会写提示词」进化到「会开自主智能体」。
机制拆解:四类战线上,代理在替人干活
报告把活动归到几条战线。其一,网络间谍:一个被归因指向 Midnight Blizzard(俄 SVR 关联、亦称 APT29)的团伙 GTG-20006,用定制化 AI 工作流把开发、基础设施获取、钓鱼、持久化到数据渗出几乎全自动,并能观察安全产品是否标记其恶意软件,一旦触发就让代理改、重新构建、再部署以绕过检测;受影响组织逾 20 家,集中在乌克兰与欧洲。其二,漏洞工厂:据称由中国高校在读学生运作的自动化漏洞挖掘工作流,一个月产出十余个可能的新零日,并用能跨会话保留记忆的代理集群维持战役。其三,犯罪提速:与 ShinyHunters 关联的团伙用 AI 把窃取规模化——一个流水线跨十台云服务器下载并反编译 180 万份安卓应用扫硬编码密钥,另一起供应链入侵在约 34 小时内从一家 SaaS 供应商处 dump 出跨越 40 多家企业租户的 2100 余组 Azure AD 令牌。其四,武器与生物滥用:报告列出六起常规武器案例(含俄方自由职业者打造的 FP V 自杀式无人机蜂群)与五起生物双重用途案例。
实验读数:API 密钥成了新战利品
报告里一条贯穿多案的主线是——攻击者开始从受害者环境偷 AI API 密钥,用别人的账单跑自己的行动。Anthropic 明确:所有涉案密钥都来自客户环境,自身系统未被攻破;有一个团伙在侵入一家 AI 厂商的评估沙箱后「先拿走生产密钥」。这把「AI 密钥和代理集成」的安全等级,直接拉到与生产凭证同等重要的位置。另一个值得记下的细节是模型选择:所有确认的滥用案用的都是 Haiku、Sonnet 或 Opus,没有一个用到 Fable 或 Mythos 级别模型(蒸馏案有一例例外)。也就是说,攻击者当前够用的,是中等能力、低延迟、易编排的那一档。
优势与局限:样本精选,但信号清晰
作为防御方自曝的研究,它的价值在于把零散的滥用事件拼成一个可归纳的趋势:AI 把攻击的两个传统瓶颈——可用漏洞的供给、熟练人手的供给——同时松了绑。局限也要说清:其一,报告选取的是「最复杂、最新颖」的活动,不代表典型滥用全貌;其二,它未提供跨所有 GTG 的统一定量基线,部分数字来自厂商披露口径;其三,关于「自适应恶意软件重部署」在真实防御环境下的实际绕过率,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。它更像一个警报而非一份统计学普查。
结语
这份报告真正让人不安的,不是某个具体团伙多厉害,而是它把「智能体作为进攻基础设施」从设想变成了已观测到的常态。当攻击方也开始用编排、用记忆、用自适应闭环,防御方的对手模型必须同步升级——从盯签名,转向盯行为、盯跨租户异常、盯那些被代理悄悄顺走的密钥。AI 用于进攻的闸门,已经开了。