Cloudflare上线全站爬虫API:支持RAG、增量抓取与模型训练

Cloudflare上线全站爬虫API:支持RAG、增量抓取与模型训练

N
News Editor 01
2026-07-23 12:15:15
Cloudflare为Browser Rendering服务推出/crawl端点,开发者可用一次API调用抓取整站内容,并输出HTML、Markdown或结构化JSON,支持RAG、增量更新与训练数据整理。
CloudflareRAG爬虫APIAI训练Workers

Cloudflare 已为 Browser Rendering 服务推出新的 /crawl 端点,目前处于 Open Beta 阶段。按官方说法,开发者只需发起一次 API 调用,就可以抓取整个网站内容,并将结果转换为 HTML、Markdown 或结构化 JSON,面向 AI 训练数据集整理和 RAG(检索增强生成)流程。

一次调用抓取整站,任务以异步方式执行

这项功能于 3 月 10 日公布。Cloudflare 表示,新接口采用异步模式运行,开发者提交起始 URL 后,系统会返回一个任务 ID,并在后台通过无头浏览器自动发现、渲染页面。后续抓取进度和结果,也可以通过该 ID 查询。流程不复杂,但把整站抓取、页面渲染和结果回传整合到了一次任务里。

输出格式是这次更新的重点之一。除了常见的 HTML,接口还支持更适合大语言模型处理的 Markdown,以及由 Workers AI 驱动的结构化 JSON。对构建知识库、整理网站文档和准备训练语料的团队来说,这意味着前处理步骤可以压缩,数据清洗与格式转换的工作量也会减少。

默认遵守 robots.txt,不能绕过机器人检测

Cloudflare 把这项工具定位为合规、透明的爬取方案,而不是绕过防护的抓取工具。官方提到,/crawl 是一个 signed-agent,默认会遵守目标网站的 robots.txt 指令,也包括爬取延迟限制。同时,它也会遵循 Cloudflare 自家的 AI Crawl Control 规则。

更关键的是,Cloudflare 明确表示,这个工具会主动表明自身是机器人,且无法绕过 Cloudflare 的机器人检测系统或 Captcha 验证。这一点划清了边界:接口强调的是在网站规则范围内抓取内容,而不是替开发者规避限制。

增量抓取、路径过滤和静态模式一并开放

为了控制成本和提升效率,Cloudflare 还在 /crawl 中加入了几项细粒度能力。增量抓取支持 modifiedSincemaxAge 参数,可以跳过未更新或刚抓取过的页面,减少重复计算。开发者也能设置抓取深度、页面数量上限,并通过通配符包含或排除特定 URL 路径。

如果目标站点是纯静态页面,还可以将 render: false 打开,跳过无头浏览器渲染流程,加快抓取速度。Cloudflare 表示,这项功能目前已经向 Cloudflare Workers 的免费版和付费版用户开放。对需要持续跟踪网站内容、整理研究资料或搭建企业 AI 知识库的团��,这是一项直接可用的基础设施更新。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
600

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。