Python：黑板课爬虫闯关第一关 - 代码天地

Python：黑板课爬虫闯关第一关

其他 2018-09-15 15:06:02 阅读次数: 0

近日发现了【黑板课爬虫闯关】这个神奇的网页，练手爬虫非常的合适

第一关非常的简单

get 请求网址，在响应的 html 中用正则获取需要在网址后面输入的数字，生成新的 url，继续请求，直到通关。

代码如下：

import re
import requests
import time


def main():
    url = 'http://www.heibanke.com/lesson/crawler_ex00/'
    get_next(url)


def get_next(url):
    print(url)
    html = requests.get(url).text
    m = re.search('(你需要在网址后输入数字|下一个你需要输入的数字是)(\d+)', html)
    if m:
        num = m.group(2)
        next_url = 'http://www.heibanke.com/lesson/crawler_ex00/' + num
        time.sleep(1)
        get_next(next_url)
    else:
        m = re.search('(?<=\<h3\>).*?(?=\</h3\>)', html)
        print(m.group())
        m = re.search('(\<).*?href="([^"]*?)".*?(\>下一关\</a\>)', html)
        print(f'下一关 http://www.heibanke.com{m.group(2)}')


if __name__ == '__main__':
    main()

猜你喜欢

转载自www.cnblogs.com/gl1573/p/9650887.html

Python：黑板课爬虫闯关第一关

python 黑板课爬虫闯关-第一关

Python 黑板客爬虫闯关的第一关

Python3 黑板客爬虫闯关第一关

黑板客爬虫闯关第一关、第二关

glidedsky爬虫闯关第一关

XSS闯关之第一关

第一关

Python：黑板课爬虫闯关第二关

python 黑板课爬虫闯关-第四关

python 黑板课爬虫闯关-第二关

GlideSky爬虫练习网站第一关详解

Cheat Engine进阶教程：gtutorial-i386闯关记第一关

python-spider 第一关

算法第一关

Redis第一关预热

sqli 第一关

第一关：初识爬虫 - 0入门到进阶（附练习题） | Python爬虫

【Codecomba Python 编程系列】KITHGARD 地牢第一关【第一关卡系列】

Python黑板客爬虫闯关一

【Codecomba Python 编程系列】KITHGARD 地牢第二关【第一关卡系列】

NO15 第一关课后考试

csapp实验二 ---bomb(第一关)

WPF第一关Bingding怎么用

upload-files 第一关

BitcoinChallenge第一关解密代码

我的机器学习之路第一关

SQL注入实验——web靶机第一关

第一关：块级元素

Webug3.0靶场第一关学习

今日推荐

《美国对全球网络空间安全与发展的威胁和破坏》报告发布

火速冲上 GitHub 热榜 —— 开源编程语言、框架哪有这么可爱？

北京人形机器人创新中心发布全球首个纯电驱拟人奔跑的全尺寸人形机器人“天工”

LFOSSA 源来如此公开课 | 掌握云原生未来：CNCF 认证全面攻略与备考秘籍

周排行

循环神经网络（rnn）讲解

Tigao教程四：单独的关节运动

金蝶K3WISE15.0-注册套打教程

如何在Mac上配置Kubernetes

Android应用结束自身进程的方法

SpringMVC学习十三拦截器栈

中国驻洛杉矶总领馆举行新春招待会

HttpClient get post 发送

11 - three.js 笔记 - 绘制三维字体模型

Mysql递归获取某个父节点下面的所有子节点和子节点上的所有父节点

每日归档

更多

2024-05-01(4)

2024-04-30(1)

2024-04-29(40)

2024-04-28(0)

2024-04-27(56)

2024-04-26(39)

2024-04-25(22)

2024-04-24(36)

2024-04-23(26)

2024-04-22(39)