7月1日,Cloudflare发了一篇博客,标题温和得近乎虚伪——「你的网站,你的规则」。但内容一点也不温和:从9月15日起,所有使用Cloudflare的网站,默认屏蔽混合用途的AI爬虫。
注意这个逻辑翻转。以前是「默认允许,你可以选择屏蔽」,现在是「默认屏蔽,你可以选择允许」。
多数报道把这件事解读为「内容创作者的福音」。这是一个广泛流传但站不住脚的判断。
真相是:Cloudflare不是在保护创作者,它是在搬家——把互联网的收费站从搜索引擎搬到了基础设施层。而这一次,坐在收费亭里的,还是同一类人。
## 一、旧契约已经死了
理解Cloudflare在做什么,先要看清旧秩序是怎么崩的。
搜索引擎时代有一个心照不宣的社会契约:我让你爬我的内容,你给我带流量。Googlebot来了,Google搜索收录你了,用户搜到了,点进来了,广告展示了。一笔交易,各方满意。
这笔交易在AI时代彻底崩盘。
Cloudflare公布了一组数据,揭示各家AI公司的爬取与回流比:Google大约是14:1——每爬14个页面,回流1次点击。OpenAI是1,700:1。Anthropic是73,000:1。
73,000比1。这意味着Anthropic的爬虫从出版商那里拿走73,000个页面的内容,换回来一次点击都没有。不是回报少了,是回报根本不存在。
更致命的是,bot流量已经超过人类流量。Cloudflare CEO Matthew Prince说,这个里程碑比所有人预期的都来得早——原本预计2027年才会发生。今天你打开的大多数网页,「看」它们的主要不是人,而是机器。
旧契约的前提是「爬虫带来流量」。当爬虫只取不给的时候,契约就死了。
## 二、Cloudflare的刀:拆开捆绑
Cloudflare这次做的核心动作,是把AI爬虫拆成三类:
- **Search**:为搜索建索引的传统爬虫,Google干了二十多年的那种
- **Agent**:实时替用户访问网页的AI代理,比如ChatGPT帮你查信息时背后跑腿的那个
- **Training**:大规模抓取内容用于模型训练的爬虫
三类分开标注,网站主可以分别设置允许或屏蔽。
这个分类本身是一把刀,直接捅向Google。
Google的Googlebot是一个典型的「混合爬虫」——它同时为搜索建索引,也为Google的AI功能(比如AI Overviews)采集数据。Google确实提供了一个叫Google-Extended的选退工具,但问题在于,Googlebot这个核心爬虫本身,依然同时为AI功能收集数据。
搜索和AI的数据需求,在Google的架构里就没有被真正分开过。
Cloudflare加了一条「最严规则优先」原则:如果一个爬虫同时执行搜索和训练两个功能,所有适用的规则同时生效,按最严格的那个来。也就是说,你只要选择屏蔽Training爬虫,Googlebot、Applebot、BingBot这些混合爬虫,统统会被一并屏蔽。
砍的是捆绑——你想被搜索到,就得接受被AI训练。Cloudflare说,这个捆绑不公平,必须拆开。
## 三、从保安到收银员:Cloudflare的三重角色
如果故事到这里结束,Cloudflare就是一个基础设施层的正义使者。但故事没有结束。
去年7月,Cloudflare推出「Pay Per Crawl」——按爬取次数向AI公司收费。今年,升级为「Pay Per Use」——不再按次收费,而是当内容在AI系统中真正产生价值时才付费。
听起来很美。初始合作伙伴是Ceramic.ai和You.com。Condé Nast的CEO说这是「游戏规则的改变」。
但有一个细节值得注意:今年3月,Cloudflare自己发布了一个爬虫API。你给它一个URL,它能一次性抓取整个网站,返回HTML、Markdown或结构化JSON。
那个一直帮你挡爬虫的公司,自己造了一个爬虫。
有出版商尝试屏蔽Cloudflare自己的爬虫时发现,设置不生效。虽然Cloudflare后来修复了这个问题,但评论已经传开了——「我们保护网站不被爬虫抓取……除非是我们自己的爬虫。」
Cloudflare的解释是,它的爬虫是「合规爬虫」,会尊重robots.txt,会遵守自己的AI Crawl Control规则。
这里需要建一个框架来理解Cloudflare的真实角色。
**Cloudflare同时扮演三个角色:**
- **规则制定者**:定义三类爬虫,设定默认策略
- **规则执行者**:在基础设施层拦截或放行爬虫
- **市场参与者**:运营自己的爬虫和内容交易平台
这不是中立的基础设施裁判。这是一个新型中间商——一个以自己为枢纽的「AI内容税收站」。
## 四、收费站搬了,收费逻辑没变
把Cloudflare和Google放在一起看,结构惊人地相似。
Google的逻辑:你必须在搜索中被看到 → 所以你接受Googlebot的一切行为 → 你的内容同时被用于AI训练 → Google获得两倍于其他AI公司的网页内容访问量。
Cloudflare的逻辑:你的网站必须被访问 → 所以你通过Cloudflare的基础设施 → 我定义谁能进来、按什么条件进来 → 我同时提供合规爬虫和交易市场。
过去二十年,Google是那个站在路中间决定谁能被看见的人。现在Cloudflare想在更底层的位置拦一道——你要过路,先说清楚你是来干什么的,然后按规矩来。
收费站变了。收费的人,未必变了。
区别在于:Google管理的是「可见性」——你搜不搜得到我。Cloudflare管理的是「可达性」——你访不访问得了我。后者是一个更底层、更不可绕过的权力。
Cloudflare管理着全球大约20%的网络流量。20%既大又不够大。另外80%的网站不在它的保护范围内,AI公司完全可以把数据采集重心转向非Cloudflare站点。
但20%已经足够改变游戏规则。当全球最大的CDN之一说「默认屏蔽」,它定义的不再是Cloudflare用户的命运,而是整个行业的预期。
## 五、谁真正受益?
这可能是整件事里最需要冷静的部分。
站出来支持Cloudflare的——Condé Nast、Dotdash Meredith、Reddit——都是大型出版商和平台。它们有内容规模,有法务团队,有谈判筹码。这些公司不需要Cloudflare也能跟AI公司签许可协议——过去一年全球已经签了超过50份内容许可大单。
个人博主呢?一个在WordPress上写技术教程的独立开发者呢?
对小创作者来说,曝光本身就是最稀缺的资源。屏蔽AI爬虫可能意味着减少被发现的机会。大媒体屏蔽爬虫,Google搜索还是会收录它们;小博客屏蔽爬虫,可能就真的消失在噪音里了。
一组更让人清醒的数据:AI聊天机器人带来的引荐流量比传统搜索少大约96%。用户在AI回答中点击引用来源的概率只有大约1%。出版商在过去一年因AI搜索功能损失了20%到90%不等的流量和收入。
即使Pay Per Use全面铺开,付费规模也可能远远不够弥补已经失去的广告收入。这不是一场变局,更像是一次止损——而且未必能止住。
## 所以该怎么办
**如果你是大型内容平台/出版商:**
- Cloudflare的新策略是你的筹码,不是你的救星。用它来增强与AI公司的谈判地位,但不要指望它替你完成交易
**如果你是独立创作者/小博主:**
- 默认屏蔽AI爬虫对你可能弊大于利。在屏蔽之前,评估你的流量来源——如果你的被发现渠道高度依赖搜索引擎和AI推荐,谨慎操作
- 关注Pay Per Use的进展,但目前不要把它当成收入来源
**如果你在做AI产品:**
- 数据采集的「免费午餐」时代正式结束。从现在开始,内容获取成本必须进入你的商业模型
- 与Cloudflare这样的基础设施层合作,比逐一跟出版商谈判更高效——但你要接受被「收税」
**如果你在做基础设施:**
- Cloudflare的动作是一个信号:AI时代的数据治理正在从应用层下沉到基础设施层。这个位置上的玩家,将拥有定义规则的权力
- 问题是:规则制定者和市场参与者能不能是同一个人?历史告诉我们,答案通常是否定的
---
*来源:Cloudflare官方博客、36氪/极客公园报道、Cloudflare公开数据*
