有时候我们会需要从网络上爬取一些图片,来满足我们形形色色直至不可描述的需求。
一个典型的简单爬虫项目步骤包括两步:获取网页地址和提取保存数据。
这里是一个简单的从图片url收集图片的例子,可以成为一个小小的开始。
获取地址
这些图片的URL可能是连续变化的,如从001递增到099,这种情况可以在程序中将共同的前面部分截取,再在最后递增并字符串化后循环即可。
抑或是它们的URL都保存在某个文件中,这时可以读取到列表中:
def getUrls(path): urls = [] with open(path,'r') as f: for line in f: urls.append(line.strip('\n')) return(urls)
保存图片
在python3中,urllib提供了一系列用于操作URL的功能,其中的request模块可以非常方便地抓取URL内容,也就是发送一个GET请求到指定的页面,然后返回HTTP的响应。具体细节请看注释:
def requestImg(url, name, num_retries=3): img_src = url # print(img_src) header = { 'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/35.0.1916.114 Safari/537.36', 'Cookie': 'AspxAutoDetectCookieSupport=1' } # Request类可以使用给定的header访问URL req = urllib.request.Request(url=img_src, headers=header) try: response = urllib.request.urlopen(req) # 得到访问的网址 filename = name + '.jpg' with open(filename, "wb") as f: content = response.read() # 获得图片 f.write(content) # 保存图片 response.close() except HTTPError as e: # HTTP响应异常处理 print(e.reason) except URLError as e: # 一定要放到HTTPError之后,因为它包含了前者 print(e.reason) except IncompleteRead or RemoteDisconnected as e: if num_retries == 0: # 重连机制 return else: requestImg(url, name, num_retries-1)
其他
捕获异常
以下是批量爬取网页时可能需要捕获的异常,同时可以看出,urllib2库对应urllib库,而httplib库对应http.client:
重连机制
在函数参数中设置一个参数num_retries并对其进行初始化,即默认参数。在某些异常出现时可以将该参数递减,再让它递归调用自身,这就是基本的重连机制。
修饰器
有种设计模式叫修饰器模式,它可以在不修改目标函数代码的前提下,在目标函数执行前后增加一些额外功能。
def clock(func): # 修饰器函数,对函数计时 def clocked(*args): t0 = timeit.default_timer() result = func(*args) elapsed = timeit.default_timer() - t0 name = func.__name__ arg_str = ', '.join(repr(arg) for arg in args) print('[%0.8fs] %s(%s)' % (elapsed, name, arg_str)) # print('%s(%s) -> %r [%0.8fs]' % (name, arg_str, result, elapsed)) return result return clocked
上面这段代码是修饰器函数的一个例子,用来对函数运行时间进行计时,在需要计时的函数上一行添加一点点代码即可:
@clock
完整代码
from urllib.error import HTTPError, URLError from http.client import IncompleteRead, RemoteDisconnected import timeit, time import urllib.request import socket # timeout = 20 # socket.setdefaulttimeout(timeout) # 等待,防止被简单地反爬 def getUrls(path): urls = [] with open(path,'r') as f: for line in f: urls.append(line.strip('\n')) return(urls) def clock(func): # 修饰器函数,对函数计时 def clocked(*args): t0 = timeit.default_timer() result = func(*args) elapsed = timeit.default_timer() - t0 name = func.__name__ arg_str = ', '.join(repr(arg) for arg in args) print('[%0.8fs] %s(%s)' % (elapsed, name, arg_str)) # print('%s(%s) -> %r [%0.8fs]' % (name, arg_str, result, elapsed)) return result return clocked @clock def requestImg(url, name, num_retries=3): img_src = url # print(img_src) header = { 'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/35.0.1916.114 Safari/537.36', 'Cookie': 'AspxAutoDetectCookieSupport=1' } req = urllib.request.Request(url=img_src, headers=header) try: response = urllib.request.urlopen(req) filename = name + '.jpg' with open(filename, "wb") as f: content = response.read() f.write(content) response.close() except HTTPError as e: print(e.reason) except URLError as e: print(e.reason) except IncompleteRead or RemoteDisconnected as e: if num_retries == 0: return else: requestImg(url, name, num_retries-1) if __name__ =='__main__': urls = getUrls('./'URLS.txt') # 换成你的URL文件路径 nLines = len(urls) print(nLines) for index, value in enumerate(urls): requestImg(value, './'+str(index).zfill(6)) # zfill用来格式化数字:000001
以上这篇Python3直接爬取图片URL并保存示例就是小编分享给大家的全部内容了,希望能给大家一个参考,也希望大家多多支持。
稳了!魔兽国服回归的3条重磅消息!官宣时间再确认!
昨天有一位朋友在大神群里分享,自己亚服账号被封号之后居然弹出了国服的封号信息对话框。
这里面让他访问的是一个国服的战网网址,com.cn和后面的zh都非常明白地表明这就是国服战网。
而他在复制这个网址并且进行登录之后,确实是网易的网址,也就是我们熟悉的停服之后国服发布的暴雪游戏产品运营到期开放退款的说明。这是一件比较奇怪的事情,因为以前都没有出现这样的情况,现在突然提示跳转到国服战网的网址,是不是说明了简体中文客户端已经开始进行更新了呢?
更新日志
- 小骆驼-《草原狼2(蓝光CD)》[原抓WAV+CUE]
- 群星《欢迎来到我身边 电影原声专辑》[320K/MP3][105.02MB]
- 群星《欢迎来到我身边 电影原声专辑》[FLAC/分轨][480.9MB]
- 雷婷《梦里蓝天HQⅡ》 2023头版限量编号低速原抓[WAV+CUE][463M]
- 群星《2024好听新歌42》AI调整音效【WAV分轨】
- 王思雨-《思念陪着鸿雁飞》WAV
- 王思雨《喜马拉雅HQ》头版限量编号[WAV+CUE]
- 李健《无时无刻》[WAV+CUE][590M]
- 陈奕迅《酝酿》[WAV分轨][502M]
- 卓依婷《化蝶》2CD[WAV+CUE][1.1G]
- 群星《吉他王(黑胶CD)》[WAV+CUE]
- 齐秦《穿乐(穿越)》[WAV+CUE]
- 发烧珍品《数位CD音响测试-动向效果(九)》【WAV+CUE】
- 邝美云《邝美云精装歌集》[DSF][1.6G]
- 吕方《爱一回伤一回》[WAV+CUE][454M]