利用python3爬虫下载图片、pdf文档 - 代码天地

利用python3爬虫下载图片、pdf文档

其他 2018-11-22 14:39:10 阅读次数: 0

版权声明：本文为博主原创文章，未经博主允许不得转载。 https://blog.csdn.net/weifuliu/article/details/84261593

环境
语言环境：python3.6
操作系统：Win10

第三方库
requests

互联网上的资源大都是以二进制形式存储和运输的，如图片、pdf、音频、视频等，像.dat、.ts等这些不常用的文件也都是二进制。我们知道python3爬虫是利用爬虫模拟浏览器向服务端发送请求，并解析服务器返回来的响应，像上述这些文件都是以二进制形式返回到本地客户端的。而response对象的属性content表示的则是HTTP响应内容的二进制形式，利用该属性，我们可以通过代码对网上资源进行下载
下载这些资源最重要的一点就是，你要知道这些文件在哪儿，也就是他们的URL,即他们的连接

下载图片
链接：美女长发披肩背影美图

美女长发披肩背影

代码实现

import requests  

url = 'https://img-blog.csdnimg.cn/20181119214250858.png'
r = requests.get(url)
img = r.content       #响应的二进制文件
with open('美女.png','wb') as f:     #二进制写入
    f.write(img)

下载pdf
下载链接：http://47.106.94.154/study_file/hdu-multi6-fzdx.pdf

代码实现

import requests

url = 'http://47.106.94.154/study_file/hdu-multi6-fzdx.pdf'
r = requests.get(url)
pdf = r.content       #响应的二进制文件
with open('杭电多校第六场.pdf','wb') as f:     #二进制写入
    f.write(pdf)

效果图

当然，本篇博文针对的只是文件的下载，当然对于这样一个两个文件完全可以手动下载，而且一般情况下资源的URL不一定说能找到就能找到的，但对于处理大批量文件来说通过脚本实现就非常容易了
以下是一个处理大量文件的例子：Python3批量下载.dat和.hea文件

猜你喜欢

转载自blog.csdn.net/weifuliu/article/details/84261593

利用python3爬虫下载图片、pdf文档

python3爬虫下载网页上的pdf

Python3爬虫 - 下载反盗链图片的方式

用Python 爬虫批量下载PDF文档

python3 爬虫——scrapy文档

python3 pdf转图片

python3网络爬虫：爬虫正则表达式下载图片（六）

Python3爬虫图片抓取

python3实现简单图片爬虫

python3爬虫JD图片

python3爬虫下载图片之常见问题

Python3网络爬虫：Scrapy入门之使用ImagesPipline下载图片

python3爬虫系列16之多线程爬取汽车之家批量下载图片

Python3 多线程下载图片

python爬虫开发与项目实战PDF文档免费下载

精通Python网络爬虫PDF文档免费下载

python3网络爬虫开发实战pdf

《Python3网络爬虫开发实战》崔庆才 PDF 百度云下载

python3爬虫攻略（3）：利用Fidder抓包！

python爬虫.3.下载网页图片

Python3 图片(jpg、bmp、png)转PDF

基于python3 pdf转化为图片

利用Python将PDF文档转为MP3音频

python3爬虫 - 利用浏览器cookie登录

python3利用Scrapy实现爬虫--学习笔记

利用python下载网页到本地(python3)

python3 爬虫

python3爬虫

利用Python爬虫实现网页图片批量下载

python3 API文档和源码下载

今日推荐

《美国对全球网络空间安全与发展的威胁和破坏》报告发布

火速冲上 GitHub 热榜 —— 开源编程语言、框架哪有这么可爱？

北京人形机器人创新中心发布全球首个纯电驱拟人奔跑的全尺寸人形机器人“天工”

LFOSSA 源来如此公开课 | 掌握云原生未来：CNCF 认证全面攻略与备考秘籍

周排行

让自己的头脑极度开放

CentOS 6.5(x64) 和Redhat6.5操作系误删libc

高可用注册中心

【日记】12.28/【题解】AtCoder AGC041

XML（5）_XML 约束_DTD

Java集合Map（四）

树梅派安装桌面环境教程

pipenv 的使用和安装

小程序白屏问题和内存研究

C语言简单选择排序

每日归档

更多

2024-05-02(0)

2024-05-01(4)

2024-04-30(1)

2024-04-29(40)

2024-04-28(0)

2024-04-27(56)

2024-04-26(39)

2024-04-25(22)

2024-04-24(36)

2024-04-23(26)