GEO资讯

机器流量首超人类,官网怎么管AI爬虫

发布于 2026/8/7 63 次阅读
机器流量首超人类,官网怎么管AI爬虫

机器流量首超人类,官网怎么管AI爬虫

云服务商Cloudflare 7月上旬发布的数据显示,在其托管网站的所有网页请求中,约57.4%来自AI和自动化程序,真实人类只占42.6%。这是互联网历史上人类网页请求首次被机器超越,且4月底以来这一比例一直维持在53%至60%之间,并非短期波动。另一组数据更直观:安全公司HUMAN Security统计,真正执行点击、填表等操作的智能体流量同比增长7851%,而传统爬虫只增长了597%;支付平台Stripe的数据显示,其API数据访问命令中已有70%来自智能体。访问你官网的"人"里,机器正在成为大多数——这个结构变化,值得每个做线上生意的企业认真对待。

先把AI爬虫分清楚

管理AI流量之前,要分清三类机器。第一类是搜索类爬虫,比如Googlebot、Bingbot、Applebot,它们为搜索引擎和AI搜索抓取内容——这类应该放行,因为被它们收录是品牌在搜索结果和AI答案里出现的前提。第二类是训练类爬虫,主要为大模型收集训练语料,是否放行取决于企业愿不愿意把自己的内容喂给模型训练。第三类是智能体流量,代表用户执行订票、比价、填表等任务,它会真实地浏览页面、产生点击——这类流量既可能带来转化,也可能带来服务器负担和无效消耗,需要单独评估。

Cloudflare在7月宣布了一项面向所有客户的新功能:按"搜索、智能体、训练"三大场景分别管理AI流量,免费套餐也能用。更关键的是默认值的变化:从9月15日起,新接入Cloudflare的域名将默认在展示广告的页面上屏蔽训练与智能体流量,同时默认放行搜索流量——逻辑是广告页面的价值靠真人浏览实现,不应被机器挤占。

一个容易踩的坑:多功能爬虫

需要注意,谷歌、苹果、微软等厂商的爬虫往往"身兼数职":既用于搜索收录,也用于模型训练。Cloudflare的新默认规则是,对同时具备搜索与训练功能的多功能爬虫,将按最严格的策略执行——也就是说,一旦你选择了屏蔽训练流量,Googlebot这类多功能爬虫可能被连带拦截,连搜索收录也一起断掉。9月15日前,网站所有者可以在设置里主动标记,选择不改变多功能爬虫的访问权限。对靠搜索流量吃饭的企业,这一步要格外小心:别为了防训练,把搜索入口也堵了。

给官网运营的三条实操建议

基于这些变化,有三条建议可以直接落地。第一,检查自己站点的爬虫访问策略,确认搜索类爬虫(Googlebot、Bingbot等)没有被误伤,这是AI搜索引用你的基础。第二,按内容属性决定是否屏蔽训练类爬虫:原创深度内容可以收紧,公开产品介绍、企业资质类信息建议保持开放——这类内容被AI引用,本身就是在帮你做免费曝光。第三,保持页面结构清晰,标题、参数、联系方式用规范的结构化标记,让智能体抓取时能快速定位关键信息;同时把AI流量的访问统计单独建一个视图,别让机器数据污染你的转化分析。如果站点数据量大,还可以考虑用Cloudflare这类服务做托管预设,把管理策略变成配置而不是人工判断。

机器流量过半是结构性变化,不是短期波动。对GEO从业者来说,理解搜索引擎、训练语料、智能体三类流量对网站的不同诉求,是做好AI可见性的基本功——该放行的放行,该管理的管理,网站才能既被AI看见,又不被机器拖垮。

本文数据来自Cloudflare官方披露及腾讯新闻综合报道(HUMAN Security、Stripe等机构数据),政策细节以Cloudflare官方博客为准。

信息来源

  • Cloudflare官方博客:《您的网站您做主:面向所有客户的全新AI流量管理选项》,2026年7月,blog.cloudflare.com
  • 腾讯新闻:《人类首次沦为网络少数派:Cloudflare数据显示57.4%互联网流量来自机器》,2026年7月8日,new.qq.com
  • 腾讯新闻:《AI智能体流量激增近8000%,互联网半数流量已非人类》,2026年7月24日,new.qq.com