为了提高教学的趣味性,先不从基本的正则表达式入手介绍,用到的时候会解释一下。
先直接一个图片抓取的实例(能快速保存页面的所有图片到本地):
读取网页源码和抓取信息用的是urllib库,正则表达式用的是re库(http://blog.csdn.net/twc829/article/details/50377952 这里有正则的详细介绍)。
step1:获取页面数据
def getHtml(url):
page = urllib.request.Request(url=url)
html=urllib.request.urlopen(page).read()
return html
这是最基本的代码,利用request函数可以获取页面的所有信息,但很多网站都会为了防止被爬取数据,会检查你的headers。所以还需要对程序进行伪装一下,加上自定义的headers:
headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}
并将page改成page = urllib.request.Request(url=url, headers=headers)
网站中通常含有中文,还要将编译方式改成utf-8:
html = html.decode('utf-8')
综合一下获取页面数据:
def getHtml(url):
headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}
page = urllib.request.Request(url=url, headers=headers)
html=urllib.request.urlopen(page).read()
html = html.decode('utf-8')
return html
step2:寻找图片先用正则表达式确定页面数据中需要的部分: reg = r'src="(.*\.jpg)"' . 是匹配任意字符,换行符\n除外 * 是匹配前一个字符0次或n次,即可以含有n个 . \.是为了区分 . 表示一个真正的符号. 所以这条语句实在确定搜索目标是XXXX.jpg
然后把正则表达式编译成一个正则表达式对象:
imgre = re.compile(reg)
再读取html 中包含 imgre(正则表达式)的数据:
imglist = re.findall(imgre,html)
step3:保存图片
由于图片比较多,肯定要用循环来进行保存
x = 0
for imgurl in imglist:
urllib.request.urlretrieve(imgurl,'/Users/yangyanxin/Desktop/1/%s.jpg' % x)
x+=1
urlretrieve函数可以将指定url的文件保存到本地
综合一下寻找和保存图片:
def getImg(html):
reg = r'src="(.*\.jpg)"'
imgre = re.compile(reg)
imglist = re.findall(imgre,html)
x = 0
for imgurl in imglist:
urllib.request.urlretrieve(imgurl,'/Users/yangyanxin/Desktop/1/%s.jpg' % x)
x+=1
return imglist
step4:指定网站进行爬取:html=getHtml("http://www.douyu.com")
getImg(html)
运行后,斗鱼首页的所有图片就都在指定文件夹里了
综合所有代码:
#-*- coding: UTF-8 -*-
import urllib
import re
from urllib import request
def getHtml(url):
headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:23.0) Gecko/20100101 Firefox/23.0'}
page = urllib.request.Request(url=url, headers=headers)
html=urllib.request.urlopen(page).read()
html = html.decode('utf-8')
return html
def getImg(html):
reg = r'src="(.*\.jpg)"'
imgre = re.compile(reg)
imglist = re.findall(imgre,html)
x = 0
for imgurl in imglist:
urllib.request.urlretrieve(imgurl,'/Users/yangyanxin/Desktop/1/%s.jpg' % x)
x+=1
return imglist
html=getHtml("http://www.douyu.com")
print (getImg(html))