Python爬虫之Spider类用法简单介绍

脚本专栏 2026/7/7 佚名

3 2 1

一、网络爬虫

网络爬虫又被称为网络蜘蛛（"color: #ff0000">二、Python如何访问互联网

想要写网络爬虫，第一步是访问互联网，Python如何访问互联网呢？

在Python中，我们使用urllib包访问互联网。（在Python3中，对这个模块做了比较大的调整，以前有urllib和urllib2,在3中对这两个模块做了统一合并，称为urllib包。包下面包含了四个模块，urllib.request，urllib.error，urllib.parse，urllib.robotparser），目前主要使用的是urllib.request。

我们首先举一个最简单的例子，如何获取获取网页的源码：

import urllib.request
response = urllib.request.urlopen('https://docs.python.org/3/')
html = response.read()
print(html.decode('utf-8'))

三、Python网络简单使用

首先我们用两个小demo练一下手，一个是使用python代码下载一张图片到本地，另一个是调用有道翻译写一个翻译小软件。

3.1根据图片链接下载图片，代码如下：

import urllib.request

response = urllib.request.urlopen('http://www.3lian.com/e/ViewImg/index.html"0f4b59230a4c41:0"

Server: Microsoft-IIS/8.0

Date: Sun, 14 Aug 2016 07:16:01 GMT

Connection: close

Content-Length: 2827
输入：response.getcode()

->200


3.2使用有道词典实现翻译功能
我们想实现翻译功能，我们需要拿到请求链接。首先我们需要进入有道首页，点击翻译，在翻译界面输入要翻译的内容，点击翻译按钮，就会向服务器发起一个请求，我们需要做的就是拿到请求地址和请求参数。
我在此使用谷歌浏览器实现拿到请求地址和请求参数。首先点击右键，点击检查（不同浏览器点击的选项可能不同，同一浏览器的不同版本也可能不同），进入图一所示，从中我们可以拿到请求请求地址和请求参数，在Header中的Form Data中我们可以拿到请求参数。

（图一）
代码段如下：


import urllib.request
import urllib.parse

url = 'http://fanyi.youdao.com/translate"type":"EN2ZH_CN","errorCode":0,"elapsedTime":0,"translateResult":[[{"src":"i love you","tgt":"我爱你"}]],"smartResult":{"type":1,"entries":["","我爱你。"]}}
对于上述结果，我们可以看到是一个json串，我们可以对此解析一下，并且对代码进行完善一下：


import urllib.request
import urllib.parse
import json

url = 'http://fanyi.youdao.com/translate"htmlcode">

import urllib.request
import urllib.parse
import json

url = 'http://fanyi.youdao.com/translate"htmlcode">

import urllib.request
import urllib.parse
import json
import time


while True:
 content = input('please input content(input q exit program):')
 if content == 'q':
  break;

 url = 'http://fanyi.youdao.com/translate"color: #ff0000">五、批量下载网络图片
图片下载来源为煎蛋网（http://jandan.net)
图片下载的关键是找到图片的规律，如找到当前页，每一页的图片链接，然后使用循环下载图片。下面是程序代码（待优化,正则表达式匹配，IP代理）：


import urllib.request
import os

def url_open(url):
 req = urllib.request.Request(url)
 req.add_header('User-Agent','Mozilla/5.0')
 response = urllib.request.urlopen(req)
 html = response.read()
 return html

def get_page(url):
 html = url_open(url).decode('utf-8')
 a = html.find('current-comment-page') + 23
 b = html.find(']',a)
 return html[a:b]


def find_image(url):
 html = url_open(url).decode('utf-8')
 image_addrs = []
 a = html.find('img src=')
 while a != -1:
  b = html.find('.jpg',a,a + 150)
  if b != -1:
   image_addrs.append(html[a+9:b+4])
  else:
   b = a + 9
  a = html.find('img src=',b)
 for each in image_addrs:
  print(each)
 return image_addrs

def save_image(folder,image_addrs):
 for each in image_addrs:
  filename = each.split('/')[-1]
  with open(filename,'wb') as f:
   img = url_open(each)
   f.write(img)

def download_girls(folder = 'girlimage',pages = 20):
 os.mkdir(folder)
 os.chdir(folder)
 url = 'http://jandan.net/ooxx/'
 page_num = int(get_page(url))

 for i in range(pages):
  page_num -= i
  page_url = url + 'page-' + str(page_num) + '#comments'
  image_addrs = find_image(page_url)
  save_image(folder,image_addrs)

if __name__ == '__main__':
 download_girls()


代码运行效果如下：


                                
                                
                                    Python爬虫,python,Spider类,Python,Spider 
                                
                                    标签：
                                        Python爬虫,python,Spider类,Python,Spider
                                     

                            
                        
                        
                            
                                免责声明：本站文章均来自网站采集或用户投稿，网站不提供任何软件下载或自行开发的软件！
                                如有用户或公司发现本站内容信息存在侵权行为，请邮件告知！ 858582#qq.com
                            
                        
                        
                            
                                
                                    上一篇
                                    详解Tensorflow不同版本要求与CUDA及CUDNN版本对应关系
                                
                            
                            
                                
                                    下一篇
                                    python读取xml文件方法解析
                                
                            
                        
                        
                        白云城资源网 Copyright www.dyhadc.com
                        
                            
                                
                                
                                    评论“Python爬虫之Spider类用法简单介绍”
                                
                            
                            
                                
                                    
                                        
                                            
                                                Python爬虫之Spider类用法简单介绍
                                            
                                            
                                                
                                            
                                            
                                                
                                                
                                                
                                            
                                            
                                        
                                    
                                    
                                    
                                        暂无“Python爬虫之Spider类用法简单介绍”评论...

www.dyhadc.com 白云城资源网

129,905影音资源

244,626技术资源

111,817软件资源

578,645站长资源

稳了！魔兽国服回归的3条重磅消息！官宣时间再确认！

昨天有一位朋友在大神群里分享，自己亚服账号被封号之后居然弹出了国服的封号信息对话框。

这里面让他访问的是一个国服的战网网址，com.cn和后面的zh都非常明白地表明这就是国服战网。
而他在复制这个网址并且进行登录之后，确实是网易的网址，也就是我们熟悉的停服之后国服发布的暴雪游戏产品运营到期开放退款的说明。这是一件比较奇怪的事情，因为以前都没有出现这样的情况，现在突然提示跳转到国服战网的网址，是不是说明了简体中文客户端已经开始进行更新了呢？

更新日志

2026年07月07日

Python爬虫之Spider类用法简单介绍

Python爬虫,python,Spider类,Python,Spider

详解Tensorflow不同版本要求与CUDA及CUDNN版本对应关系

python读取xml文件方法解析

评论“Python爬虫之Spider类用法简单介绍”

稳了！魔兽国服回归的3条重磅消息！官宣时间再确认！

更新日志

友情链接