The Numbers因AI爬虫冲击下线后缩编重启

The Numbers因AI爬虫冲击下线后缩编重启

N
News Editor
2026-07-24 09:47:00
运营近 30 年的电影数据网站 The Numbers 于 2026 年 3 月 5 日突然下线,3 月 13 日以精简版恢复。PANews援引 Stephen Follows 转述创始人 Bruce Nash 的说法称,AI 爬虫与智能体流量占总流量 90%,服务器长期过载并反复崩溃。恢复后的版本移除了历史图表、单片详情页和 Report Builder,折射出数据型网站在机器流量占主导后面临的成本、架构与商业模式压力。

运营近 30 年的电影数据网站 The Numbers 在 2026 年 3 月 5 日突然下线。对于一个拥有约 200 万个页面、收录 78396 部电影、178375 条发行记录和 236176 人信息的数据库网站来说,这次中断并非普通维护。3 月 13 日,网站重新上线,但仅恢复为精简版本,历史图表、单部电影详情页以及核心功能 Report Builder 均被移除。

据 Stephen Follows 报道转述,The Numbers 创始人 Bruce Nash 表示,导致网站被迫收缩的直接原因,是 AI 爬虫和智能体流量已占总流量的 90%,服务器持续过载并反复崩溃。系统日志还记录到针对后门的恶意攻击行为。报道提到,攻击动机可能与预测市场有关,因为 Polymarket 等平台将 The Numbers 的数据用作结算依据,若能提前获取数据,就可能形成交易优势。不过,相关攻击的技术细节以及攻击者身份并未披露,Bruce Nash 也没有进一步说明。

一个从 1997 年运行至今的老牌数据站

The Numbers 由 Bruce Nash 于 1997 年 10 月 17 日在 Geocities 上创建。网站最初是个人项目,之后逐步发展为电影行业常用的数据工具,长期追踪票房、发行情况,并为从业者和媒体提供数字参考。

在 AI 爬虫集中涌入之前,The Numbers 年访客量超过 800 万。对垂直数据站点而言,这已经是相当可观的规模。其数据库中保存着 78396 部电影、178375 条发行记录、236176 人信息,页面总量约 200 万,源文件约 16 万个。过去,这些数据和页面构成了网站的核心资产;在机器请求占据主导后,这套资产也成了基础设施的沉重负担。

Bruce Nash 透露,在旧系统时代,团队 90% 的时间都花在维持网站运行,而不是开发新功能或优化数据。对一个运行了 30 年的系统来说,16 万个源文件背后意味着大量依赖关系、老旧框架、遗留脚本和难以改动的模块。旧架构积累出的技术债务,使网站在新流量环境下面对的已不是单点优化问题。

为人类浏览设计的架构,扛不住机器速度的请求

传统数据网站通常按人类浏览习惯设计:用户打开一个页面,服务器渲染一次 HTML,返回一次响应,用户停留数秒再离开。在这种模式下,并发压力相对可控,因为人类阅读天然限制了请求速度。

AI 爬虫并不遵循这种节奏。它们可以在极短时间内发起大量请求,不需要阅读时间,也不需要等待页面渲染完成。当一套原本面向人类访问设计的旧架构,面对以机器速度发起的密集请求时,结果就是服务器持续过载、数据库连接池耗尽、响应时间快速上升,最终走向崩溃。

报道指出,在 The Numbers 现有旧系统中,修补的边际成本已经高于重建。优化个别查询无法解决 16 万个源文件中可能存在的大量低效逻辑;增加服务器,也未必能让旧架构具备水平扩展能力;即便引入缓存,面对 200 万页面和长尾分布,命中率也未必理想。3 月 13 日重新上线的版本,因此并不是常规升级,而更像一次主动收缩。

历史图表和单片详情页被移除,意味着网站放弃了大量长尾页面;这些页面本身就是 AI 爬虫偏好的抓取目标,因为其中包含结构化且可直接使用的数据。Report Builder 被下线,则意味着网站连核心付费工具属性也一并让出,以换取基础设施层面的生存空间。

Cloudflare数据揭示的交换比变化

报道认为,要理解 The Numbers 为何被压垮,需要区分 AI 爬虫和传统搜索引擎爬虫的行为差异。过去,网站与搜索引擎之间存在相对稳定的价值交换:网站允许抓取内容,搜索引擎再把人类访客导回网站。按 Cloudflare 数据,Google 每带来 1 个访客,大约抓取 5 个页面。这个比例下,网站承担的带宽成本还有机会通过广告、订阅或品牌曝光回收。

AI 爬虫打破了这套平衡。按同样来自 Cloudflare 的数据,OpenAI 每带来 1 个访客,会抓取超过 1000 个页面;Anthropic 的比例则超过 1:38000。也就是说,网站在消耗服务器、带宽和算力的同时,几乎得不到对等的人类流量回流。数据被抓走后,往往用于模型训练或 AI 搜索摘要,用户消费这些信息的终点不再是原网站,而是在 ChatGPT 或 AI 搜索产品里。

这直接改变了流量结构。Cloudflare Radar 数据显示,截至 2026 年 6 月,机器人已占 HTML 页面请求的 57.5%。HUMAN Security 在 2026 年报告中称,智能体流量在 2025 年增长 7851%,AI 驱动流量整体增长 187%,自动化流量增速是人类流量的 8 倍。Thales 的 Bad Bot Report 也指出,2025 年机器人占全球网页流量的 53%。

在 The Numbers 这个案例里,90% 的访问来自机器。它们不会点击广告,也不会购买订阅,但会真实消耗站点资源。过去“允许抓取换取流量”的逻辑,在 1:38000 这样的交换比面前已经很难成立。对于依赖免费内容吸引人类访问、再靠人类流量变现的数据网站来说,这种结构性变化直接动摇了生存基础。

报道还援引 Cloudflare 数据称,2026 年上半年 AI 爬虫请求中,52.3% 用于训练,34.2% 用于混合用途,10.1% 用于搜索,真正由用户触发的仅占 2.6%。这意味着多数 AI 流量并非因用户访问而被动产生,而是系统主动抓取,不会随着人类用户减少而同步下降。

成本不只是流量数字,而是带宽、算力和运维时间

The Numbers 没有公开具体服务器成本,但报道列举了多个公开案例,说明机器流量带来的开支并不抽象。开源文档托管平台 Read the Docs 曾在官方博客披露,单个 AI 爬虫一个月就消耗了 73TB 带宽,成本超过 5000 美元。该平台还发现,这些爬虫并不总会遵守 robots.txt。

维基媒体基金会也在官方博客中披露,多媒体内容的带宽需求自 2024 年初增长了 50%,其中 65% 的高成本流量来自机器人,虽然机器人仅占页面浏览量的 35%。与此同时,随着 AI 搜索摘要普及,Wikipedia 在 2025 年 5 月至 8 月的人类流量同比下降了 8%。对内容平台而言,这意味着成本上升、人类流量下降,两端同时承压。

SourceHut 创始人 Drew DeVault 也曾表示,他每周有 20% 到 100% 的运维时间被用于对抗爬虫,网站因此每周发生数十次短暂宕机。LWN 编辑 Jonathan Corbet 直接将这类流量定性为“就是 DDoS 攻击”。电商公司 Triplegangers 曾因 OpenAI 的 GPTBot 在营业时段高频抓取导致网站宕机,其 CEO 同样称这“基本就是 DDoS 攻击”。iFixit 则记录到 Anthropic 的 ClaudeBot 单日对其网站发起近 100 万次请求。

这些案例共同指向一个现实:机器流量对应的是实际带宽费用、CPU 占用和运维人力消耗。当 The Numbers 的服务器在 90% 机器流量压力下持续过载时,Bruce Nash 面对的已不仅是一个技术优化问题,而是站点能否继续维持的成本问题。

报道进一步做出粗略推演:如果 The Numbers 年访客量超过 800 万,而其中 90% 来自机器,再考虑爬虫抓取深度通常远高于人类浏览,那么机器请求规模至少会达到数千万级别甚至更高。即便单次请求成本很低,累计后的带宽与算力消耗,仍可能让缺乏企业级基础设施支持的独立团队难以为继。

哪些网站更容易成为下一批受冲击者

报道并未把 The Numbers 的遭遇外推为所有网站都必须立刻重构,而是将重点放在“哪些网站更脆弱”。其中,最容易受到冲击的是数据密集型网站,尤其是同时具备以下特征的平台。

  • 长尾页面数量庞大。The Numbers 约有 200 万个页面,每个页面都可能成为 AI 爬虫的目标。
  • 内容可被静态抓取。无需登录即可访问的结构化数据,对爬虫最具吸引力。
  • 商业模式依赖人类流量变现。若收入依赖广告或免费转付费,而流量主体却变成机器,原有逻辑就会失效。

报道将 Box Office Mojo 和 IMDb 作为对照样本。两者同属电影数据网站,但其抗风险能力强于独立运营的 The Numbers。Box Office Mojo 被 Amazon 收购后,有企业级基础设施支撑;IMDb 同样属于 Amazon 体系,并且设置了登录墙和付费层 IMDbPro,一部分核心数据位于认证之后,无法像 The Numbers 那样被无障碍抓取。

相对更安全的网站,则包括交互型平台、实时服务类网站,以及设有付费墙或认证机制的网站。交互型平台的核心价值在于用户互动关系,公开抓取难以复制其动态网络;电商和 SaaS 产品的价值更多来自服务过程,而非静态数据页面;登录墙则天然降低了未认证爬虫对全站无差别抓取的可能。

报道据此提出两个判断指标:一是数据暴露面,二是流量变现依赖度。如果网站的数据容易被抓取,且商业模式高度依赖这些数据所带来的人类流量,那么它遭遇类似冲击的概率就更高。反过来,若数据暴露面较小,或商业模式本就不依赖浏览量变现,例如 B2B 服务、API 授权或企业合同,则暂时不必像 The Numbers 一样“截肢式”重构。

robots.txt 之外,问题已经进入基础设施层

面对 AI 爬虫,站长最先想到的往往是调整 robots.txt,但报道认为,这条路径已经很难构成有效防线。Read the Docs 的案例显示,不少 AI 爬虫并不会严格遵守 robots.txt。HUMAN Security 还提到,大量爬虫会伪装成合法身份规避检测。按 Cloudflare 数据,目前只有 7.9% 的 AI 爬虫请求会被服务器主动以 403 状态码拒绝。

原因在于,robots.txt 本质上更像一种依赖对方自觉遵守的约定。在搜索引擎时代,Google 等公司有动力遵守这套规则,以维持与网站之间的长期合作关系;AI 公司面临的激励却不同。模型训练和摘要生成需要更多数据来源,若遵守限制意味着放弃部分数据供给,在竞争中就可能处于不利位置。在这种条件下,单纯依靠应用层规则,很难抵御基础设施层面的请求压力。

报道指出,真正的应对开始转向基础设施和商业机制。2025 年 7 月,Cloudflare 推出 Pay-per-Crawl 机制,允许网站对 AI 爬虫抓取收费。其官方公告显示,从 2026 年 9 月 15 日起,Cloudflare 将默认屏蔽未付费的“混合用途”爬虫。这个安排能否形成行业共识仍待观察,但它至少提供了一个方向:让机器流量的成本重新回到数据使用方,而不是由内容生产者单方面承担。

站长的几条现实路径

对于独立站长和中小团队,报道将应对方式拆成几个层次。

第一步是识别。通过日志分析明确 AI 流量来源和占比,不要把服务器变慢或宕机简单归因于业务增长。如果没有识别出机器流量是根因,升级服务器或优化代码,只会以更高成本延缓崩溃。The Numbers 的案例中,Bruce Nash 发现 90% 流量来自机器,这一判断本身就是后续决策的起点。

第二步是隔离。通过边缘计算和 WAF 规则,将机器流量尽可能导向静态缓存或轻量级响应,避免其直接冲击数据库和动态渲染模块。对数据密集型网站而言,这意味着把高频页面预渲染为静态文件,让爬虫拿到缓存内容,而不是实时查询结果。这种做法解决不了根本矛盾,但可以为下一阶段调整争取时间。

第三步是重写商业模式。当 90% 访客都不是人,依赖人类浏览量的广告逻辑就必须改变。报道给出的可能方向包括:API 付费访问、数据授权,以及更深的登录墙设计,把核心数据迁移到认证之后,以降低暴露面。这些都不只是技术修改,而是网站如何定义自身产品形态的问题。

The Numbers 以放弃 30 年旧系统部分能力的代价,展示了一种极端但现实的选择:当机器成为主要“访客”后,流量不再天然等于资产,它也可能是必须单独核算的负债。对于数据密集、依赖人类流量变现的独立网站,这起事件更像一记预警;而对数据暴露面较小、收入并不依赖浏览量的网站来说,当前更现实的动作,是持续监控流量结构变化,并在机器流量真正压垮系统前提前布设防线。

互联网的主要流量主体已经变化,网站运营者也不得不重新核算这笔账。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。