glidedsky爬虫闯关第一关 - 代码天地

glidedsky爬虫闯关第一关

其他 2020-03-11 23:17:33 阅读次数: 0

今天无意中发现了一个练习爬虫的网站：
http://glidedsky.com/

做的挺不错的强烈推荐

第一关是将网页中所有的数字相加，因为格式十分整齐，可以用多种方法来实现，一并记录在这里了，注意在get的时候要加上在cookie

import requests
from bs4 import BeautifulSoup
import re
from requests_html import HTMLSession
from lxml import etree

header = {"cookie": "自己的cookie"}
r=requests.get("http://glidedsky.com/level/web/crawler-basic-1",headers=header)

r.encoding = r.apparent_encoding
html = BeautifulSoup(r.text,'lxml')
anss=0

#css选择器
x=html.select("div[class='col-md-1']")
for i in x:
    anss+=int(i.get_text().strip())
print(anss)

"""
#正则
s='''<div class="col-md-1">(.+?)</div>'''
x=re.findall(s,r.text,re.DOTALL)
for i in x:
    anss+=int(i.strip())
print(anss)
"""

"""
#HTMLSession.get().html.find()方法
session=HTMLSession()
url=session.get("http://glidedsky.com/level/web/crawler-basic-1",headers=header)
#content=url.html.find('div.col-md-1:nth-child(1)',first=True)
for i in range(1,1201):
    s='div.col-md-1:nth-child('+str(i)+')'
    content=url.html.find(s,first=True)
    anss+=int(content.text)
print(anss)
"""

"""
#xpath路径
label=etree.HTML(r.text)
content=label.xpath('//div[@class="col-md-1"]/text()')
#提取div标签中class名为"col-md-1"的内容信息,并且存入一个列表中
for i in content:
    anss+=int(i.replace('\n', '').strip())
print(anss)
"""

猜你喜欢

转载自www.cnblogs.com/dyhaohaoxuexi/p/12466290.html

glidedsky爬虫闯关第一关

Python：黑板课爬虫闯关第一关

python 黑板课爬虫闯关-第一关

Python 黑板客爬虫闯关的第一关

GlidedSky爬虫闯关第二关

XSS闯关之第一关

黑板客爬虫闯关第一关、第二关

GlideSky爬虫练习网站第一关详解

Python3 黑板客爬虫闯关第一关

Cheat Engine进阶教程：gtutorial-i386闯关记第一关

Python爬虫入门教程 87-100 glidedsky网站爬虫解析，爬虫闯关第一篇

第一关：初识爬虫 - 0入门到进阶（附练习题） | Python爬虫

第一关

算法第一关

Redis第一关预热

sqli 第一关

NO15 第一关课后考试

csapp实验二 ---bomb(第一关)

WPF第一关Bingding怎么用

upload-files 第一关

BitcoinChallenge第一关解密代码

我的机器学习之路第一关

SQL注入实验——web靶机第一关

第一关：块级元素

Webug3.0靶场第一关学习

第一关——2005NOIP提高组

找到好工作的第一关-如何面试

Q版泡泡堂第一关

第一关：初识Docker容器

第一关：解决问题的基本步骤

今日推荐

《美国对全球网络空间安全与发展的威胁和破坏》报告发布

火速冲上 GitHub 热榜 —— 开源编程语言、框架哪有这么可爱？

北京人形机器人创新中心发布全球首个纯电驱拟人奔跑的全尺寸人形机器人“天工”

LFOSSA 源来如此公开课 | 掌握云原生未来：CNCF 认证全面攻略与备考秘籍

周排行

循环神经网络（rnn）讲解

Tigao教程四：单独的关节运动

金蝶K3WISE15.0-注册套打教程

如何在Mac上配置Kubernetes

Android应用结束自身进程的方法

SpringMVC学习十三拦截器栈

中国驻洛杉矶总领馆举行新春招待会

HttpClient get post 发送

11 - three.js 笔记 - 绘制三维字体模型

Mysql递归获取某个父节点下面的所有子节点和子节点上的所有父节点

每日归档

更多

2024-05-01(4)

2024-04-30(1)

2024-04-29(40)

2024-04-28(0)

2024-04-27(56)

2024-04-26(39)

2024-04-25(22)

2024-04-24(36)

2024-04-23(26)

2024-04-22(39)