前言

一文搞懂Python—>爬虫需要学什么，附送课程、笔记。

关于Python爬虫，我们需要学：

1. Python基础语法学习（基础知识）
首先，你需要熟悉Python的基本语法，包括变量、数据类型、条件语句、循环、函数等。
2. 对HTML页面的内容抓取（数据抓取）
如HTTP协议、URL、请求方法（GET、POST等）和响应状态码（如200，404等）。
3. 对HTML页面的数据提取（数据提取）
爬虫通常需要从HTML中提取信息，因此你需要了解HTML标签、属性和CSS选择器。
4. Scrapy框架以及scrapy-redis分布式策略（第三方框架）
requests：一个用于发送HTTP请求的库，它可以帮助你获取网页的HTML内容BeautifulSoup：一个用于解析HTML和XML的库，它可以帮助你在HTML文档中定位和提取信息。lxml：一个解析HTML和XML的高性能库，可以作为BeautifulSoup的替代品。Scrapy：一个强大的爬虫框架，用于构建和管理复杂的爬虫项目
6. 爬虫(Spider)、反爬虫(Anti-Spider)、反反爬虫(Anti-Anti-Spider)之间的斗争…
熟悉常见的反爬虫策略，如User-Agent伪装、IP代理、使用Selenium处理JavaScript等。
7.学习数据存储
学习如何将爬取的数据存储到文件（如CSV、JSON）或数据库（如MySQL、MongoDB）中。

（文末有惊喜）

可选择的IDE和编译器

工欲善其事，必先利其器：

IDE：PyCharm、Spyder、Visual Studio等
编辑器：Vim、Sublime Text、Atom等

通用搜索引擎（Search Engine）工作原理

通用网络爬虫 从互联网中搜集网页，采集信息，这些网页信息用于为搜索引擎建立索引从而提供支持，它决定着整个引擎系统的内容是否丰富，信息是否即时，因此其性能的优劣直接影响着搜索引擎的效果。

第一步：抓取网页

搜索引擎网络爬虫的基本工作流程如下：

首先选取一部分的种子URL，将这些URL放入待抓取URL队列；
取出待抓取URL，解析DNS得到主机的IP，并将URL对应的网页下载下来，存储进已下载网页库中，并且将这些URL放进已抓取URL队列。
分析已抓取URL队列中的URL，分析其中的其他URL，并且将URL放入待抓取URL队列，从而进入下一个循环…

（文末有惊喜）
在这里插入图片描述

搜索引擎如何获取一个新网站的URL：

1. 新网站向搜索引擎主动提交网址：（如百度http://zhanzhang.baidu.com/linksubmit/url）
1. 在其他网站上设置新网站外链（尽可能处于搜索引擎爬虫爬取范围）
1. 搜索引擎和DNS解析服务商(如DNSPod等）合作，新网站域名将被迅速抓取。

但是搜索引擎蜘蛛的爬行是被输入了一定的规则的，它需要遵从一些命令或文件的内容，如标注为nofollow的链接，或者是Robots协议。

Robots协议（也叫爬虫协议、机器人协议等），全称是“网络爬虫排除标准”（Robots Exclusion Protocol），网站通过Robots协议告诉搜索引擎哪些页面可以抓取，哪些页面不能抓取，例如：
淘宝网：
https://www.taobao.com/robots.txt
腾讯网：
http://www.qq.com/robots.txt