python3.5爬虫实例（一）简单图片抓取

为了提高教学的趣味性，先不从基本的正则表达式入手介绍，用到的时候会解释一下。

先直接一个图片抓取的实例（能快速保存页面的所有图片到本地）：

读取网页源码和抓取信息用的是urllib库，正则表达式用的是re库（http://blog.csdn.net/twc829/article/details/50377952 这里有正则的详细介绍）。

step1:获取页面数据

def getHtml(url):

page = urllib.request.Request(url=url)

html=urllib.request.urlopen(page).read()

return html

这是最基本的代码，利用request函数可以获取页面的所有信息，但很多网站都会为了防止被爬取数据，会检查你的headers。所以还需要对程序进行伪装一下，加上自定义的headers：

headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}

并将page改成page = urllib.request.Request(url=url, headers=headers)

网站中通常含有中文，还要将编译方式改成utf－8:

html = html.decode('utf-8')

综合一下获取页面数据：

def getHtml(url):

headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}

page = urllib.request.Request(url=url, headers=headers)

html=urllib.request.urlopen(page).read()

html = html.decode('utf-8')

return html

step2:寻找图片先用正则表达式确定页面数据中需要的部分： reg = r'src="(.*\.jpg)"' . 是匹配任意字符，换行符\n除外＊是匹配前一个字符0次或n次，即可以含有n个 . \.是为了区分 . 表示一个真正的符号. 所以这条语句实在确定搜索目标是XXXX.jpg

然后把正则表达式编译成一个正则表达式对象：

imgre = re.compile(reg)

再读取html 中包含 imgre（正则表达式）的数据：

imglist = re.findall(imgre,html)

step3:保存图片

由于图片比较多，肯定要用循环来进行保存

x = 0

for imgurl in imglist:

urllib.request.urlretrieve(imgurl,'/Users/yangyanxin/Desktop/1/%s.jpg' % x)

x+=1

urlretrieve函数可以将指定url的文件保存到本地

综合一下寻找和保存图片：

def getImg(html):

reg = r'src="(.*\.jpg)"'

imgre = re.compile(reg)

imglist = re.findall(imgre,html)

x = 0

for imgurl in imglist:

urllib.request.urlretrieve(imgurl,'/Users/yangyanxin/Desktop/1/%s.jpg' % x)

x+=1

return imglist

step4:指定网站进行爬取：html=getHtml("http://www.douyu.com")

getImg(html)

运行后，斗鱼首页的所有图片就都在指定文件夹里了

综合所有代码：

#-*- coding: UTF-8 -*-

import urllib

import re

from urllib import request

def getHtml(url):

headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}

page = urllib.request.Request(url=url, headers=headers)

html=urllib.request.urlopen(page).read()

html = html.decode('utf-8')

return html

def getImg(html):

reg = r'src="(.*\.jpg)"'

imgre = re.compile(reg)

imglist = re.findall(imgre,html)

x = 0

for imgurl in imglist:

urllib.request.urlretrieve(imgurl,'/Users/yangyanxin/Desktop/1/%s.jpg' % x)

x+=1

return imglist

html=getHtml("http://www.douyu.com")

print (getImg(html))

python3.5爬虫实例（一）简单图片抓取

推荐阅读更多精彩内容