9 月 15 日,Cloudflare 一项酝酿了两个多月的默认策略正式生效:自动流量被拆成三档彼此独立的控制开关——搜索、训练、智能体。过去网站主面对的是「放爬虫还是拦爬虫」的二选一,如今智能体(Agent)头一回作为和训练爬虫平级的流量类被单独拎了出来。对做智能体产品的团队来说,这件事的信号很直接:你的智能体能不能读到某块内容,不再由「对方是否允许被搜」顺带决定,而要单独授权。

三档开关,把「智能体」单独成列

新机制下,搜索、训练、智能体各有一把独立的锁。搜索索引网页并带回人类流量;训练抓取语料去训练或微调模型;智能体则是实时替用户拉取页面——三种行为的风险和收益并不相同,却被混在同一个「爬虫」抽屉里很久了。Cloudflare 的改动是给广告承载页设了更严的默认:这类页面上训练与智能体默认被拦、搜索保持开放。同时上线的「禁止 AI 训练(Disallow AI Training)」开关,让站点主能在「保留搜索曝光」的前提下拒绝训练用途;「Bot Preference Sync」则把偏好一次性同步到所有受支持的爬虫,不用再分别维护 robots.txt。

Cloudflare 把自动流量拆成三档独立控制 搜索 Search 索引网页并带回流量 训练 Training 抓取语料训练模型 智能体 Agent 实时代人为拉取页面 本次新增、可单独授权与计量
图 1|9 月 15 日起,广告页上训练与智能体默认被拦,搜索保持开放——智能体头一回成为和训练爬虫平级的独立流量类。

增量认知:这次调整的本质,是把「智能体可读的 Web」从训练语料的附带品,变成了一个独立、可计量的接口。对智能体厂商而言,这意味着内容获取这件事从此有了「用途维度」——你能读到,不等于你能训练;你能被搜到,也不等于你能被智能体实时调用。

计费从「按抓取」走向「按被使用」

和开关同步变化的,是计费锚点。Cloudflare 把早前的 Pay Per Crawl(按抓取次数计费)推进为 Pay Per Use(按答案中被引用的用量计费),首发合作方包括 Ceramic.ai 与 You.com。差别在于:过去机器人每来抓一次就计一次费,现在变成「你的内容真的被写进某个答案、被用户用到」才计费。这把内容的商业价值从「被访问」挪到了「被引用」,对发布商是一种更贴近结果的变现逻辑。Cloudflare 还参与了 IETF 的 ai-prefs 标准起草,试图让「网站希望被怎样使用」成为一种可移植、跨爬虫通用的声明。

Pay Per Crawl 按每次抓取计费 Pay Per Use 按答案中被引用的用量计费 计费事件从「请求」移向「被使用」,发布商在答案中露脸才计费
图 2|计费锚点从抓取次数改为答案引用,意味着内容的价值在「被智能体用到」时才实现。

站在标准视角看,ai-prefs 的意义不只是技术约定。它把「我的内容能不能被智能体训练 / 调用 / 摘要」变成站点主可以一行声明的事,而不是依赖每家爬虫各自的君子协定。对合规要求高的行业(金融、医疗、政务)尤其关键——授权边界一旦可声明、可审计,智能体的内容获取才谈得上可控。

可见性经济:看不见智能体流量,就从答案里消失

推动这波变化的,是一组让人生畏的数据。Cloudflare 自己披露,混合用途爬虫(一个爬虫同时做搜索和训练)已占其网络可验证爬虫流量的 36.6%,是最大的单一类别;另有分析指出,超过一半的 AI 爬虫流量花在重复抓取没变化的页面上。与此同时,答案引擎对品牌的曝光高度集中——有研究统计 Gemini 平均每条回答点名约 10 个品牌,Perplexity 约 6 个。换句话说,一个站点如果因为默认策略收紧而退出了智能体流量,它大概率会从一整类答案里彻底消失,而不是仅仅丢掉搜索排名。

这正是「可见性经济」的核心:未来内容的可见性,越来越不取决于搜索引擎的索引,而取决于你是否在智能体的可调用集合里。Cloudflare 把这组开关交给站点主,等于把「是否进入智能体视野」的主动权部分还给了内容方。

辩证看:控制权增强,但默认更严、耦合未解

利好的一面很清楚:发布商头一回能精细地说「你可以搜我,但不能用我训练,也不能让智能体随便调我」,且能按广告页、按来源分别设限。但对两类站点要提个醒。其一,更严格的默认只作用于新接入域名与免费档从未改过设置的存量站点——既有付费客户的历史配置会原样保留,不会突然变脸,但这也意味着「默认已经替你选好了」,不主动检查就会沿用旧档。其二,智能体流量与训练流量在不少爬虫身上仍耦合在同一身份下,Cloudflare 用「最严规则胜出」来裁决,结果就是拦训练有时也会误伤搜索。治理颗粒度变细了,但底层耦合的坑还在。

对 clawpk.net 这类内容站以及做智能体产品的团队,建议现在就做三件事:确认自家站点的训练/智能体开关状态而非依赖默认;在允许智能体读取的关键页面上保留结构化、可引用的信息,提高被答案引用的概率;把内容授权当成产品策略的一部分,而不是等被默认挡掉再补救。智能体互联网的底层规则正在被少数几家基础设施厂商重写,早看清开关,比晚抱怨算法更划算。