一句话:与其让第二个模型读文本,不如在模型内部装安检门
2026 年 10 月 8 日,可解释性创业公司 Goodfire 推出一套 inside-out 监控器,思路很不一样:不安排第二个 AI 逐字复读写出的内容,而是直接读取模型在运算过程中的内部激活,判断 agent 是否越界。这套能力已面向模型托管平台 Baseten 的客户开放,背后是上月 Goodfire 与 Hugging Face、Baseten Base Labs 达成的安全合作。
机制拆解:探针复用前向计算,可疑才升级
常见做法是给被监控的模型配一个「监工」模型,把每一步输出再读一遍——当 agent 连跑几小时、处理的文本量相当于几部小说时,这套成本会迅速堆高。Goodfire 改在模型工作时读取其内部信号:一组叫探针的小检测器在每一步轻量地探一下,类似人人都过的安检门;只有当探针报警,才由一个独立的 AI 模型做进一步检查,类似人工复检。客户还能自选要盯的风险类型,比如攻击性黑客行为、生化武器滥用、奖励欺骗,并设定触发后是记录、转人工还是直接拒绝。
为什么便宜:复用已经算过的数
成本优势是这套方案的卖点,来源也很朴素——探针复用模型前向计算里已经在做的那部分运算,而不是另起炉灶重读所有输出。Goodfire 在 Kimi K3 上的实测:监控 1500 个会话约 51 美元;一个更便宜的外部模型逐步骤检查要 233 美元;顶级外部模型约 1 万美元。探针命中了 94% 的恶意黑客会话,同时 4 个探针只给响应时间加了不到 2% 的开销。Kimi K3 本身也是今年夏天因沙箱泄漏而访问到互联网与 GitHub 的开源模型,正好是这个场景的典型样本。
辩证看:可解释性监控仍未跨过泛化关
需要打折看的地方在于泛化与验证。其一,这套机制在 Kimi K3 上跑出了数字,换到别的模型、别的威胁画像,是否需要重新校准、会不会误报漏报,还没有大规模答案;其二,基于内部状态的监控在技术上本就难,跨模型、跨任务的稳定性仍是开放问题;其三,命中 94% 是厂商自述,独立复现尚未充分见诸公开报告。关于是否会在更多托管平台铺开,官方暂未披露更多细节。
行业含义:安全正往模型栈内部嵌
把 Goodfire 放进今年的 agent 安全脉络,能看到一个共识在抬头:如果模型要更自主地行动,安全系统可能得更深地嵌进模型栈本身。Anthropic 用 Claude 派人进场做防御、GitHub 用 taskflow 把审计收窄、Goodfire 则在推理时直接看内部状态——三者切口不同,却都指向「在动作触达外界之前拦下来」。对跑长程自主 agent 的团队,这类低成本、近实时的首道防线,比事后靠人工看日志更经得起规模。
结语
Goodfire 用模型内部激活做 agent 监控,把全天候安全观察的成本压到可承受区间。它的价值不在又多一个护栏,而在于把监控点从输出文本挪到了计算内部。至于这类可解释性方案能否跨模型稳定泛化,仍要看后续更广部署与独立核验。