Skip to content

开源项目 · Python · BSD-3-Clause · 图像

Scrapy

Scrapy

Python 生态工业级爬虫框架,大规模结构化抓取首选

50,000BSD-3-Clause2026年7月9日Python

在视频工作流中的位置

Scrapy 是 Python 生态最广泛使用的工业级爬虫框架,2012 年首次提交,BSD-3-Clause 宽松开源协议,GitHub 主语言 Python。提供 Spider / Item / Pipeline / Middleware / Downloader 全套架构,适合大规模结构化抓取与数据处理流水线,被数据工程、机器学习、AI 训练数据准备等领域广泛采用。

核心能力围绕「可扩展异步抓取框架」展开。Spider 层 用户继承 scrapy.Spider 类,通过 start_requests + parse 回调定义抓取逻辑;支持 SitemapSpider / CrawlSpider / XMLFeedSpider 等预制基类;Selector API(CSS / XPath)与 lxml 高效集成。Pipeline 层 Item Pipeline 是数据后处理钩子链,可串联去重、清洗、验证、数据库写入、机器学习评分等步骤;Pipeline 单测 + 调试成熟。并发模型 基于 Twisted 异步 I/O + 队列,单机可同时处理数千并发请求;AutoThrottle 自动限速与并发调优。Middleware 层 支持自定义 downloader middleware(代理、UA、cookie、重试)、spider middleware(请求过滤、URL 规范化);提供成熟的 fake-useragent、scrapy-rotating-proxies、scrapy-splash(JS 渲染)等扩展生态。部署与监控 Scrapyd(scrapy/scrapyd)是官方守护进程,支持 HTTP API 提交爬虫任务;商业版 Scrapy Cloud(scrapinghub)提供云端调度;开源替代品如 SpiderKeeper / Gerapy。生态 scrapy-redis(分布式)、scrapy-playwright(JS 渲染)、scrapy-impersonate(浏览器指纹伪装)覆盖各种特殊场景。

适用场景:大规模数据采集(电商比价、新闻聚合)、AI 训练数据集准备(配合 gallery-dl / yt-dlp 抓图集视频)、SEO 与品牌监控、研究者数据集准备、企业 ETL 流水线输入。硬件门槛:Python 异步框架,单核 CPU 处理 100+ 并发,8GB RAM 即可跑数十万 URL / 小时;高并发场景可水平扩展 worker。上手路径:pip install scrapy → scrapy startproject myspider → 定义 Item / Spider / Pipeline → scrapy crawl myspider。文档在 docs.scrapy.org,中文社区资源丰富(《Python 3 网络爬虫开发实战》等)。

License 为 BSD-3-Clause(宽松开源),允许商业闭源使用、修改、再分发,只需保留版权声明;不要求衍生作品开源 — 这是相对 gallery-dl(GPL-2.0)与 yt-dlp(Unlicense)的协议友好性差异。Scrapy 与 yt-dlp / gallery-dl 的定位互补:Scrapy 适合「自定义抓取逻辑 + 结构化数据后处理」的工程师场景,yt-dlp / gallery-dl 适合「按站点预设 extractor + 媒体文件归档」的用户场景。若需混合(部分站点有现成 extractor,部分站点需自写爬虫),可在 Scrapy 项目中调用 yt_dlp Python API 与 gallery_dl Python API,作为 Downloader Middleware 注入。注意:Scrapy 不存储下载内容,也不代理版权判断;用户需自行遵守目标平台 ToS、robots.txt 与所在司法辖区版权法。

在视频工作流中的位置

快速开始

部署教程与文档以外链形式呈现,未做内嵌以保证时效性。

相关开源项目

隐私偏好

我们使用 localStorage 记录访问统计,改进内容质量。 了解更多