python爬虫的基本流程 - 代码天地

python爬虫的基本流程

其他 2018-08-03 17:37:40 阅读次数: 0

在学习python的过程中，学会获取网站的内容是我们必须要掌握的知识和技能，今天就分享一下爬虫的基本流程，只有了解了过程，我们再慢慢一步步的去掌握它所包含的知识

通过一段时间的工作，我总结了一下，爬虫大概需要七步

一、获取网站的地址

有些网站的网址十分的好获取，显而易见，但是有些网址需要我们在浏览器中经过分析得出

二、获取User-Agent

我们通过获取User-Agent 来将自己的爬虫程序伪装成由人亲自来完成信息的获取，而非一个程序，因为大多数网站是不欢迎爬虫程序的

三、请求 url

主要是为了获取我们所需求的网址的源码，便于我们获取数据

四、获取响应

获取响应是十分重要的，我们只有获取了响应才可以对网站的内容进行提取，必要的时候我们需要通过登录网址来获取cookie 来进行模拟登录操作

五、获取源码中的指定的数据

这就是我们所说的需求的数据内容，一个网址里面的内容多且杂，我们需要将我们需要的信息获取到，我目前主要用到的方法有3个分别是re(正则表达式) xpath 和 bs.4

六、处理数据和使数据美化

当我们将数据获取到了，有些数据会十分的杂乱，有许多必须要的空格和一些标签等，这时我们要将数据中的不需要的东西给去掉

七、保存

最后一步就是将我们所获取的数据进行保存，以便我们进行随时的查阅，一般有文件夹，文本文档，数据库，表格等方式

本人的一点心得，希望能对一些初学的人一些帮助，如有不足的地方，也请尽情指出。’

猜你喜欢

转载自blog.csdn.net/weixin_42539547/article/details/81291325

python爬虫的基本流程

Python爬虫基本流程

Python爬虫工作基本流程

爬虫的基本流程

爬虫基本流程

scrapy框架爬虫基本流程

爬虫的基本分类和爬虫的流程

Python爬虫流程

Python爬虫的整体流程

【Python爬虫系列教程 2- 100】了解HTTP基本原理和爬虫的基本流程

爬虫基本原理与实战---2、爬虫的基本流程

python爬虫的基本框架

python爬虫----基本操作

python爬虫基本示例

python爬虫基本方法

python爬虫的基本介绍

Python爬虫基本框架

Python爬虫的基本操作

安装python的基本流程

Python Django 基本流程

一篇文章教会你Python网络爬虫程序的基本执行流程

[Python自学] 爬虫（2）爬虫基础流程

Python爬虫的基本流程是怎样的？技术实现是什么？带你简单入门一下爬虫

爬虫基本流程及简单爬取网页

Scrapy框架爬虫基本使用流程

scrapy爬虫教程摘要（一）——基本流程

Python 爬虫（二）爬虫基本入门

PYTHON爬虫（爬虫的基本原理）

python爬虫 scrapy爬虫框架的基本使用

爬虫的概念和基本流程基本了解（二）

今日推荐

《美国对全球网络空间安全与发展的威胁和破坏》报告发布

火速冲上 GitHub 热榜 —— 开源编程语言、框架哪有这么可爱？

北京人形机器人创新中心发布全球首个纯电驱拟人奔跑的全尺寸人形机器人“天工”

LFOSSA 源来如此公开课 | 掌握云原生未来：CNCF 认证全面攻略与备考秘籍

国产云输入法——仅华为无云端数据上传安全问题

周排行

Python环境安装与基础语法（1）——计算机基础知识

IMU预积分

ADAS中的LDW、FCW、BSD、LCA、ACC、AEB、APA、DMS代表的含义

B站笔试两道题

skyeye arm 硬件虚拟机环境的搭建

Web前端静态页面示例

数组-合并排序数组 II-简单

springcloud之版本问题启动报错

面向对象-------------匿名对象(六)

输入URL到页面呈现中间发生了什么？

每日归档

更多

2024-04-30(1)

2024-04-29(40)

2024-04-28(0)

2024-04-27(56)

2024-04-26(39)

2024-04-25(22)

2024-04-24(36)

2024-04-23(26)

2024-04-22(39)

2024-04-21(0)