Cloudflare近日向AI行业发布了新的截止日期,要求将用于传统搜索(如谷歌搜索)的网络爬虫与用于AI代理和训练的爬虫区分开来。公司宣布,从2026年9月15日起,Cloudflare的默认设置将阻止“混合用途”爬虫访问包含广告的网页。
这意味着,混合搜索、代理使用和训练功能的爬虫将默认被阻止爬取这些网站,除非网站所有者调整相关设置。此默认设置变更将适用于新的Cloudflare客户、新建站点以及所有现有的免费客户。
此举可能影响AI模型提供商获取网页内容以进行训练和支持其代理服务的能力。
Cloudflare指出,大多数网站所有者希望其内容能通过搜索和AI服务被发现,但同时也希望保护其知识产权不被免费滥用。
Cloudflare特别提到“全球最大的搜索引擎”(显然指谷歌)拥有比其他AI公司多约两倍的信息访问量,因为谷歌让客户难以在保持可被发现的同时避免内容被用于AI。
谷歌此前对此有反驳,称其提供了名为Google Extended的爬虫,允许网站所有者选择不让其内容被用于训练和AI产品(如Gemini Apps和Vertex API),且该爬虫不会影响网站在谷歌搜索中的收录。然而,谷歌的旗舰爬虫Googlebot仍会为搜索及其AI功能(如AI概览和AI模式)进行爬取。
Cloudflare联合创始人兼CEO Matthew Prince在宣布此消息时表示:“现在互联网流量中大多数是非人类流量,我们必须更快行动,推动可持续生态系统的形成。”他提到最近一个里程碑——机器人流量首次超过人类流量,这一变化原本预计要到明年才会发生。

Prince还说:“Cloudflare的新工具和合作伙伴关系为网站所有者提供了更高的可见性和商业机会,也有利于那些意图明确透明的AI公司。我们希望通过默认设置的调整,促使混合用途爬虫将搜索与代理使用和训练区分开来。”
尽管Cloudflare提供多种产品帮助用户启动自己的AI系统,公司也发布了多项工具,赋予出版商在AI时代对内容的更多控制权。近年来,Cloudflare推出了针对AI爬虫的防护工具,包括一个名为“按爬取付费”(Pay Per Crawl)的市场,允许网站向AI爬虫收取抓取费用。
Cloudflare表示,这一模式正在演变为“按使用付费”(Pay Per Use),允许出版商在其内容创造价值时向AI公司收费,而不仅仅是在内容被抓取时收费。
这一改变还有助于节省出版商的带宽和计算资源,因为Cloudflare数据显示,超过50%的AI爬虫流量用于重复抓取未变更的页面。
为落实此举,Cloudflare正与Ceramic.ai和You.com两家合作伙伴合作。当出版商选择加入时,他们将在Ceramic的AI搜索结果中出现其内容或You.com访问其优质内容时获得报酬。
Cloudflare表示,其他AI公司也可以根据自身需求定制这一收费模式。


