Cloudflare新功能介绍

美国Cloudflare作为领先的CDN服务商,近日推出了一项新功能“Disallow AI Training”,允许网站运营者仅拒绝AI对内容的学习使用,同时继续允许内容被搜索引擎索引和展示。通过这项新设置,出版商和媒体公司可以针对“搜索”、“AI学习”及“AI代理”三种不同用途,分别管理自家内容的使用权限。

此前,Cloudflare提供的“Block AI Bots”功能是一个一键式的整体阻断AI爬虫访问的开关,而新功能则将其拆分为三个独立的管理选项,提升了灵活性和细致度。

此外,Cloudflare还将“Managed Robots.txt”功能升级为“Bot Preference Sync”,网站管理员只需一次设置爬虫访问偏好,系统便会自动同步到所有支持的爬虫,简化了管理流程。

解决“兼用爬虫”的难题

Cloudflare针对开发和运营爬虫的企业,设立了“Accountable”(负有说明责任)认证标准,目前Google、Microsoft和Apple三家公司已获得该认证。未达到该标准的“兼用爬虫”——即同时为搜索索引和AI学习收集内容的单一爬虫——如果网站运营者拒绝AI学习访问,则其搜索索引功能也会被阻断。

据Cloudflare统计,兼用爬虫在其网络中的爬虫流量占比高达36.6%,是最大的爬虫类型。传统兼用爬虫存在的问题是,一旦拒绝AI学习访问,搜索索引的内容抓取也会被一并阻止,给网站运营者带来困扰。

对于已经将搜索和AI学习爬虫分开的情况,Cloudflare现有设置可以单独阻止AI学习爬虫,这类爬虫未来将被归类为“Accountable”。

未来,Cloudflare计划支持“AI摘要”功能的管理,允许爬虫运营商为网站提供AI摘要的拒绝选项,网站运营者可在一个统一界面管理所有AI相关的访问权限,目标是在2027年初实现这一功能。