独立开发者 Pieter Levels 本周在 X 表示,Meta 对他旗下所有网站进行了“非常非常非常大量”的抓取,规模之大,以至于其中一台 VPS 直接跳出负载平均警报。他还提到,Meta 连 url2og 也在抓取。该服务由他自行搭建,供旗下网站生成截图使用,这意味着对方抓取的内容不只限于文本。
DataDome:Meta 两款 AI 爬虫 Q2 合计发出 91 亿次请求
安全公司 DataDome 在 Q2 2026 流量报告中给出了更具体的规模数据。该公司称,其网络在这一季度共处理 177 亿次 AI 代理请求,较上一季度增加 45%。其中,Meta 旗下两款爬虫合计发出 91 亿次请求,占比超过一半,而这种主导地位在 Q1 还不存在。
DataDome 提到,这两款爬虫承担的任务并不相同。
- Meta-ExternalAgent:用于训练。DataDome 形容它更像研究人员在网络上四处阅读内容,再将数据喂给模型训练。该爬虫单季请求量从 31 亿次升至 53 亿次,季增 74%。
- Meta-WebIndexer:用于搜索索引。其行为更接近 Google 爬虫,会持续读取网页并建立索引,供 Meta AI 在回答问题时调用最新内容。该爬虫单季请求量从 14 亿次升至 37.5 亿次,季增 163%。
到了 2026 年 6 月,Meta-WebIndexer 的月请求量首次超过 Meta-ExternalAgent。按报道说法,这意味着 Meta 的抓取重心已从训练模型转向构建一个可实时查询的索引,而且这一变化就在本季度完成。
抓取得最多,但几乎不带回访问流量
DataDome 的数据还显示,Meta 的爬虫虽然抓取规模很大,却几乎没有为被抓取网站带回真实访客。同一份报告中,ChatGPT 拿走了 88% 的 AI 推荐流量。
报道指出,抓取最多的平台与回流最多流量的平台,并不是同一家。
在样本更小的统计中,这种差距更明显。追踪机构 TrustMRR 的三日爬取统计显示,Meta 发出了 67,390 次请求,同期 OpenAI 为 409 次,Anthropic 为 721 次。仅 Meta 一家的请求量,就超过 OpenAI 的 160 倍。
对网站运营者而言,这些请求会转化为明确成本,包括带宽、CPU 和数据库查询资源。Pieter Levels 提到那台触发警报的 VPS,也成为这类成本的一个直接例子。按报道描述,网站承担了服务一个搜索引擎的成本,却没有获得搜索引擎通常会带来的用户访问。
Meta 自建搜索索引的计划始于 2024 年
这波抓取并非临时举措。报道称,早在 2024 年 10 月,就有消息指 Meta 已安排一支专职工程团队,投入约八个月时间,为 Meta AI 建立自有搜索数据库,目标是减少对 Google 和微软 Bing 的依赖。带队者为资深工程经理 Xueyuan Su。
报道同时提到,Meta-ExternalAgent 从 2024 年夏天就已开始在网络上运行。
按照当时的说法,这套索引既能让 Meta AI 自行生成时事摘要,也可在其与外部搜索巨头的合作关系发生变化时,作为备选方案。报道认为,从两年后的数据表现来看,这一备选方案已经变成主线。
至于动机,文中还提到,一名 Meta 员工曾私下表示,公司想做的是自己的“Google”,以避免将 AI 搜索请求交给 Google,反过来被 Google 用于训练。报道也注明,这一说法来自单一匿名来源,且未获 Meta 证实,不过与 DataDome 观察到的流量变化方向一致。
Meta-WebIndexer 与 Meta-ExternalAgent 有何区别
报道给出的区分是,Meta-ExternalAgent 主要承担训练任务,大规模收集内容供模型使用;Meta-WebIndexer 则更像传统搜索引擎爬虫,持续建立搜索索引,帮助 Meta AI 回答更新的实时问题。Q2 数据分别为 53 亿次和 37.5 亿次,而在 6 月的月度请求量上,后者已经超过前者。
网站能否屏蔽 Meta 的 AI 爬虫
报道称,网站可以通过 robots.txt 声明拒绝特定 user agent,Meta 也提供了相关爬虫说明文档。不过,robots.txt 依赖对方自愿遵守。实际操作中,站长通常还需要配合 WAF、速率限制,或 Cloudflare 这类服务,才更有机会挡住高频抓取。

