Scrapy

Scrapy

全球广泛使用的开源数据提取框架Scrapy 是一个快速、异步且可扩展的 Python 网页抓取框架。它以完整项目结构组织爬虫、设置、数据项和处理管道,帮助开发者构建可维护、可扩展的公开网页数据采集项目。

Scrapy 页面快照
15+年
持续开发时间
500+
贡献者
JSON、CSV、S3
支持的导出目标
CSS、XPath
内置选择器语法
核心能力

从爬虫开发到数据导出的完整工具链

Scrapy 将选择器、异步抓取、数据处理、导出和扩展机制整合在框架核心中,并可通过社区扩展增加浏览器渲染、监控和反限制等能力。

CSS 与 XPath 选择器

使用 CSS 或 XPath 查询 DOM、提取文本与属性,也可在同一链式 API 中应用正则表达式和默认值。

异步抓取引擎

通过异步引擎和智能、礼貌的限速机制执行大规模抓取任务。

结构化项目组织

使用 startproject 创建包含爬虫、设置、数据项和处理管道的完整项目,便于项目随规模增长持续维护。

数据处理管道

通过 Item Pipelines 校验、清洗并存储抓取到的数据。

多种数据导出

支持将抓取结果导出为 JSON、CSV、S3 等目标格式和存储位置。

可扩展生态

可接入 scrapy-playwright、spidermon、scrapy-zyte-api 和 scrapy-poet 等社区或官方扩展,增加浏览器渲染、监控、反限制和页面对象能力。

版本动态

持续维护与版本发布

Scrapy 已持续开发超过 15 年,页面展示了近期版本及其功能变更,并提供完整变更记录。

Scrapy 2.17.0 发布

新增 HTTP/2 与 SOCKS 代理支持,并改进 TLS 版本设置。

Scrapy 2.16.0 发布

加入官方 Python 3.14 支持,并兼容 Twisted 26.4.0 及更高版本。

Scrapy 2.15.0 发布

引入实验性的无 reactor 模式和基于 httpx 的下载处理器。

官方资源

文档、扩展与社区入口

通过官方文档学习 Scrapy,浏览社区扩展与知识库,并前往社区渠道参与项目交流。

Scrapy

从这里开始使用Scrapy。