用Pyquery重写崔庆才的《Python3网络爬虫开发实战》的猫眼爬取(正则表达式不会用。。。。)

目前正在学Python爬虫,正在读崔庆才的《Python3网络爬虫开发实战》,之前学习正则表达式,但是由于太难,最后放弃了(学渣的眼泪。。。。),在这本书上的抓取猫眼电影排行上,后来自学了pyquery,发现用pyquery可以解决这个问题,目前自己试着写了代码

附上代码:

import requests
from pyquery import PyQuery as pq
import time

def get_one_page(url):
    headers = {
        'User-Agent':'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/67.0.3396.79 Safari/537.36'
    }
    html = requests.get(url=url,headers=headers)
    return html.text

def parse_one_page(html):
    doc = pq(html)
    items = doc('dd').items()
    for item in items:
        item1 = item.find('.board-item-main .board-item-content .movie-item-info')#空格表示嵌套
        item2 = item.find('.board-index')
        print('名次:' + item2.text())
        name = item1.find('.name').text()
        star = item1.find('.star').text()
        time = item1.find('.releasetime').text()
        score = item1.siblings('.movie-item-number .score .integer').text() + item1.siblings('.movie-item-number .score .fraction').text()
        print('电影名:' + name + '\n' +
              star + '\n' + time + '\n' + '评分:'+score +'\n')

def main(offset):
    url = 'http://maoyan.com/board/4?offset=' + str(offset) #设置偏移量
    html = get_one_page(url)
    parse_one_page(html)

if __name__ == '__main__':
    for i in range(10):
        main(offset = i * 10)
        time.sleep(1)#由于现在猫眼多了反爬虫,如果速度过快则无响应,所以要添加延时等待。

代码在:
https://github.com/liuweixu/Python-crawler/tree/master/PyQuery

欢迎来star

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

推荐阅读更多精彩内容

  • 爬取目标 本文将提取猫眼电影 TOP100 排行榜的电影名称、时间、评分、图片等信息,URL 为http://ma...
    田旭1阅读 1,700评论 0 0
  • Spring Cloud为开发人员提供了快速构建分布式系统中一些常见模式的工具(例如配置管理,服务发现,断路器,智...
    卡卡罗2017阅读 134,973评论 19 139
  • 1、自制力像一块肌肉 像肌肉一样,自制力是后天可以锻炼的。不锻炼会萎缩、榨取太多会“干涸”;注意“休息恢复”同样重...
    po界的猫阅读 243评论 0 0
  • 心里全是你 我不自觉地出现在你面前 却无法相认。 只要看到你 听到你的声音心里就觉得很安定舒服 这样的欣喜已无法言明。
    SweetCC阅读 195评论 0 0
  • 天空所包含的 鱼虫鸟兽 树木一切 都是女皇的子宫 而人生则是 终其一生举着“我要有所成就我要做个伟人”旗帜 在女皇...
    siee阅读 179评论 1 2