Cloudflare 新功能上线:屏蔽 AI 训练爬虫不影响搜索收录,独立站 SEO 与 GEO 分道
屏蔽 AI 训练爬虫,搜索排名不动——这道过去无解的选择题,现在有了标准答案。9 月 15 日,Cloudflare 正式上线「禁止 AI 训练」(Disallow AI Training)设置,网站可以拒绝内容被用于 AI 模型训练,同时完整保留在搜索结果中的收录与排名。官方数据显示,混合用途爬虫(既建搜索索引又采训练数据)已占 Cloudflare 网络已验证爬虫流量的 36.6%,成为最大单一类别;而其网络中只有不到 1% 的站点屏蔽搜索爬虫,17% 已启用某种屏蔽 AI 训练的机制。两个数字之间的巨大落差,正是这个新功能的出发点。
Cloudflare 同时设立「Accountable」(负责任)爬虫运营方认定,苹果、谷歌、微软成为首批达标方,亚马逊、Anthropic、Meta、OpenAI 也因搜索与训练爬虫分离而获得认定。
对做独立站和内容站的跨境卖家,SEO 与 GEO(生成式引擎优化)从今天起是两套需要分开设计的策略了。
一、一个开关拆两半
问题出在「混合用途爬虫」上。以 Googlebot 为例,它既为搜索索引抓取页面,也为 AI 训练采集数据——过去网站想拒绝训练,就得连搜索一起拒,等于把自家流量入口一起堵死。
Cloudflare 新增的「Disallow AI Training」正是为解决这个取舍而生:该设置通过 robots.txt 发布偏好声明,被认定的混合用途爬虫可以继续为搜索抓取,但被要求不得将内容用于训练。
Cloudflare 联合创始人兼首席执行官 Matthew Prince 在新闻稿中表示,此举是为了「在保留让搜索有价值的开放性的同时,让网站背后的人和业务真正掌控自己作品的用途」。搜索照常、训练说不,第一次成了一个独立选项。
二、三项控制重新分工
这次调整中,Cloudflare 用三个独立开关取代了原有的「Block AI Bots」单一按钮:Search(搜索索引)、Training(AI 训练)、Agent(AI 代理,代表用户执行任务的抓取)。
「Managed Robots.txt」功能也被「Bot Preference Sync」取代——网站主设置一次偏好,即可自动同步到所有支持的爬虫。老用户的原有设置将自动迁移,多数情况下无需手动操作。
对依赖广告变现的站点,Cloudflare 给出更严格的新站推荐配置:搜索允许、AI 训练禁止、带广告页面的 AI 代理访问被拦截。逻辑很直接——训练用一次抓取替代了一次真实访问,广告没了曝光对象。非广告站点则默认三项全开。

三、巨头站队与边界
「Accountable」认定有四条硬标准:提供训练退出机制、提供 AI 摘要退出选项、披露 URL 级收录与使用情况、公开承诺退出训练不影响搜索排名。谷歌的 Google-Extended 就是现成样本——拒绝它不会影响 Google 搜索收录。
亚马逊、Anthropic、Meta、OpenAI 的训练专用爬虫则可以被单独屏蔽而不波及搜索,因为它们的搜索与训练爬虫本就分离。
但边界也要看清楚:微软方面,Bingbot 对 robots.txt 级别「禁止训练」偏好的完整支持预计要到 2027 年初才上线,在那之前 Cloudflare 的该设置不会自动把偏好传递给 Bing。科技媒体 Best Media Info 也提醒,这套控制依赖爬虫运营方自觉遵守,各平台落地进度并不一致。
四、跨境站怎么选
对跨境独立站卖家,这道题没有统一答案,得按页面类型分而治之。
核心品类页与转化页:这些页面靠搜索流量吃饭,建议「允许搜索 + 禁止训练」,保护产品内容不被白嫖进模型,又不影响 Google 收录。长尾测评、行业知识类内容:如果目标是让品牌出现在 ChatGPT、Gemini 的回答里(GEO 逻辑),可以考虑允许训练抓取,换取生成式引擎中的品牌曝光。
有一个现实参照:Cloudflare 在 2025 年 7 月推「内容独立日」时公布过数据——OpenAI 爬虫当时每回传 1 次引荐要抓取约 1700 个页面,Anthropic 更是高达 73000 次。抓取与回报严重失衡的内容,屏蔽是理性选择;能换来 AI 引用曝光的内容,则可以谈。

五、流量规则在重写
把三次动作连起来看:2025 年 7 月 AI 爬虫默认拦截、pay-per-crawl 按次收费开测;2026 年 9 月训练与搜索正式拆分——Cloudflare 在一步步给「AI 时代的内容定价」搭基础设施。
TechCrunch 报道称,Cloudflare 还在推动 Pay Per Crawl 演进为「Pay Per Use」——不只按抓取收费,而是按内容创造的价值收费,并已与 Ceramic.ai、You.com 两家伙伴启动合作。下一个待解问题是 AI 摘要:Cloudflare 的目标是明年年初前,让网站主能控制自家内容在 AI 摘要中出现的比例。
对卖家,风险视角同样要摆出来:屏蔽训练爬虫不等于内容安全,robots.txt 本质是偏好声明而非强制墙,真正的拦截发生在 Cloudflare 网络层;而如果你的流量依赖 AI 引用,屏蔽过狠可能反过来饿死自己。
SEO 与 GEO 分道的时代,没有全选或全不选,只有一页一页算清:哪些内容要被看见,哪些内容要被记住,哪些内容谁都不许拿。

参考资料
- Cloudflare 新闻稿:《Cloudflare Helps End the Search-or-AI-Training Tradeoff》
- Cloudflare 官方博客:《Have it both ways: stay discoverable in search while disallowing AI training》
- TechCrunch:《Cloudflare's new policy pushes AI companies to pay for publishers' content》
- Best Media Info:《Cloudflare separates AI training opt-outs from search crawling for publishers》
- PANews:《Cloudflare 推新功能:网站可保留搜索流量同时拒绝 AI 训练》