当AI训练爬虫以每天数次抓取网站的频次出现,大量站长面临一个两难困境:屏蔽所有爬虫会影响搜索引擎的自然流量,放任AI访问又担心服务器负载与内容被无偿占用。Cloudflare的“AI访问治理”工具上线,提供了一个分水岭式的解决方案——不屏蔽、而是分类管理。
Cloudflare在流量管理中新增三个独立标签:搜索爬虫、AI智能体爬虫与训练爬虫。搜索爬虫依然指向Google、Bing等传统搜索引擎的抓取,可保持SEO权重;AI智能体爬虫涵盖Perplexity、Google Gemini等AI服务的实时抓取行为,这类爬虫旨在为用户即时搜索提供答案;训练爬虫则对应OpenAI、Anthropic等模型开发公司的数据采集。
这一区分的商业逻辑异常清晰。传统站长依赖搜索引擎获得流量来变现广告——广告页面是收入核心,但AI智能体爬虫可能直接提取“答案”,使用户无需访问原始页面,从而绕过广告曝光。另一类训练爬虫则被广泛认为属于“资源占用作他人嫁衣”的行为,免费抽取公开数据、增强模型,却对网站本身回报无几。
Cloudflare同时增加对“保护广告变现页面”的专门功能:允许站长在屏蔽AI智能体爬虫的同时,继续保持其抓取搜索结果页等非广告内容的许可。这种粒度的控制,使得广告展示不受AI总结干扰,而网站内容仍然能出现在AI搜索的引用中——平衡可见性与变现。
早期尝试“白名单”式屏蔽时,某些站长曾遭遇搜索流量急剧下跌,根源就在于无法区分正向搜索和负向爬虫。Cloudflare的新分类本身基于大量网络流量特征作为模型训练基础,实现了行为层面的多类区分。这一更新的行业意义在于:AI互联网时代的流量管控,已从“是否允许访问”演化为“为何访问”的治理。
站长应根据自身依赖度优先灰阶测试:对广告页面,可试验性地拒绝AI智能体爬虫;对高价值原创内容,完全屏蔽训练爬虫;但保留搜索爬虫权限。随着AI搜索工具进一步渗透用户习惯,能精细配置访问策略的网站,会在内容曝光与商业变现之间占得先机。