Python Scrapy框架的组件有哪些,工作原理是什么
Admin 2022-05-25 群英技术资讯 567 次浏览
Scrapy是一个快速、高层次的屏幕抓取和web抓取的框架,可用于数据挖掘、监测和自动化检测,任何人都可以根据需要去进行修改。
1.Scrapy引擎(Scrapy Engine
):负责控制数据流在系统的所以组件中的流动,并在相应动作发生时触发事件。
2.调度器(Scheduler
):从引擎接受reques并将其入队,便于以后请求它们提供给引擎。
3.下载器(Downloader
):负责获取网页数据并且提供给引擎,然后提供给Spider。
4.Spiders
: 指Scrapy用户编写用于分析response并且提取item或额外跟进的URL类人。每个Spider负责处理一些特定网站。
5.Item Pipeline
:负责处理被Spider提取出来的item。典型的处理有清洁、验证及持久化
6.下载器中间件(Downloader Middlewares
):指在引擎及下载器之间的特定钩子(specific hook
),处理Downloader 传递给引擎的response。它提供一个简便的机制,通过插入自定义代码来扩展Scrapy功能。
7.Spiders中间件(Spider Middlewares
):指在引擎及Spider之间的特定钩子(specific hook
),处理Spider 的输入(response
)和输出(items
及requests
)。它提供一个简便的机制,通过插入自定义代码来扩展Scrapy功能。
1.引擎向spider要URL
2.引擎将要爬取的URL给调度器
3.调度器会将URL生成请求对象放入指定的队列中
4.从队列中出队一个请求
5.引擎将请求交给下载器进行处理
6.下载器发送请求获取互联网数据
7.下载器将数据返回给引擎
8.引擎将数据再次给到spiders
9.spiders通过xpath解析该数据,得到数据或URL
10.spiders将数据或URL给到引擎
11.引擎判断该数据是URL还是数据,交给管道处理,URL交给调度器处理
12.当调度器里没有任何数据之后,整个程序停止
下面是我根据工作原理画的可以结合去看:
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:mmqy2019@163.com进行举报,并提供相关证据,查实之后,将立刻删除涉嫌侵权内容。
猜你喜欢
这篇文章主要为大家介绍了python神经网络特征金字塔FPN原理的解释,有需要的朋友可以借鉴参考下,希望能够有所帮助,祝大家多多进步,早日升职加薪
一个图片里边绘制多个图像是绘图中的常见需求,下面这篇文章主要给大家介绍了关于python绘制子图技巧之plt.subplot、plt.subplots及坐标轴修改的相关资料,文中通过实例代码介绍的非常详细,需要的朋友可以参考下
很多新手学习python时,对于多进程和多线程不是很清楚,为了帮助大家更好的学习和理解多进程和多线程,这篇文章就给大家介绍关于PHP多进程和多线程的使用,下面有详细的介绍以及代码,供大家参考学习。
这篇文章主要介绍了python 实现添加标签&打标签的操作,具有很好的参考价值,希望对大家有所帮助。如有错误或未考虑完全的地方,望不吝赐教
在python中,我们经常会使用到字符串,它可以来表示文件的描述、硬件的标识等。字符串的使用可以方便我们编程的操作。我们在使用字符串的时候,也经常遇到分割这个词。你知道如何字符串分割字符串吗?今天小编就带大家认识一下python中分割字符串的explode() 函数。
成为群英会员,开启智能安全云计算之旅
立即注册Copyright © QY Network Company Ltd. All Rights Reserved. 2003-2020 群英 版权所有
增值电信经营许可证 : B1.B2-20140078 粤ICP备09006778号 域名注册商资质 粤 D3.1-20240008