nodejs + cheerio + Promise(bluebird库实现)抓取慕课网nodejs课程数据

文章概要

使用nodejs + cheerio + Promise(bluebird库实现)的nodejs课程数据进行爬取。统计scott老师的所有课程的情况：每个课程的课程名、课程介绍、链接地址、课程难度等级。

关于cheerio的使用

请参考我的另外一篇文章《cheerio 使用初步》

也可以参考我的另外一篇爬虫实践文章

nodejs + cheerio 爬取极客学院的nodejs课程数据

准备

我们要爬去scott老师的所有课程信息

对应的DOM结构如下

我希望的到的是如下

  课程名称: Node.js 异步优化
  课程介绍：本课程作为 Node.js 进阶提升系列的第一课，主要讲解 Node.js 的异步代码编程习惯以及异步代码编程会带来的潜在问题。通过本课程的学习，学员将学会如何将 Node.js 的异步代码进行改良优化。
  课程链接：4510人学习
  学习人数：http://www.jikexueyuan.com/course/2052.html

代码 crawler.js

var http = require('http');
var cheerio = require('cheerio');
var Promise = require('bluebird');
// baseUrl + videoIds 是一个课程的
var baseUrl = 'http://www.imooc.com/learn/';
var videoIds = [348, 259, 197, 134, 75];


function filterHtml(html){
    var $ = cheerio.load(html);// 使用 cheerio模块装载课程页面，使用类似jquery方式处理

   
    var course_infos = $('.course-infos');//课程信息
    var title = course_infos.find('.hd').find('.l').text().trim();//课程标题
    var number = $($('.static-item.l')[1]).find('span').last().text().trim();//课程难度等级
    var chapters = $('.chapter');//章节（每个章节包含若干小节）

    //期望返回的数据结构，将每个html页面处理成这个字面量对象
    /*var courseData = {
        title: title,//课程名称
        number: number,//课程学习人数
        //课程的每个章节：章节名称，小章节数组。小章节：小章节名称，小章节链接
        videos:[{
            chapterTitle: '',
            videos: [
                title:'',
                id:''
            ]
        }]
    }*/

    var courseData = {
        videos: [],
        number: number,
        title: title
    }
    //遍历每个章节
    chapters.each(function(item) {
        var chapter = $(this);

        var chapterTitle = chapter.find('strong').text().trim();//每个章节的标题
        var videos = chapter.find('.video').children('li');//每个小章节DOM（数组）
        var chapterData = {
            chapterTitle : chapterTitle,
            videos: []
        }

        videos.each(function(item) {
            var video = $(this).find('.J-media-item');//每个小节的a标签
            var videoTitle = video.text().trim();
            var id = video.attr('href').split('video/')[1].trim();

            chapterData.videos.push({
                title: videoTitle,
                id:id
            })
        })

        courseData.videos.push(chapterData)
    })

    return courseData;
}


function printInfo(info) {
    info.forEach(function(item){
        console.log(item.number + ' 人学过 ' + item.title + '\r\n');
    });

    info.forEach(function(courseData) {
        console.log('###' + courseData.title + '\n')

        courseData.videos.forEach(function(item) {
            var chapterTitle = item.chapterTitle;

            console.log(chapterTitle + '\r\n');
            item.videos.forEach(function(video) {
                var subtext = '【' + video.id +'】' + video.title
                console.log(subtext)
            })
        })

    })
}


var fetchCourseArray = [];

videoIds.forEach(function(id) {
    fetchCourseArray.push(getPageAsync(baseUrl + id));
})


function getPageAsync(url) {
    return new Promise(function(resolve, reject){
        console.log('正在爬取....');
        http.get(url, function(res){
            var html = '';

            res.on('data', function(data) {
                html += data;
            })

            res.on('end', function(){
              
                resolve(html);
            })

        }).on('error', function(e) {
            reject(e)
            console.log('出错了')
        })
    })
}

Promise
.all(fetchCourseArray)
.then(function(pages) {
  
    var coursesData = [];//很多课程的数组（之前是一个课程里许多个章节的数组）
    pages.forEach(function(html){
        var courses = filterHtml(html);

        coursesData.push(courses);
    })

    coursesData.sort(function(a, b){
        return a.number < b.number;//从大到小
    })

    printInfo(coursesData)
})

拉出啦溜溜

执行

npm install --save cheerio bluebird
node crawler.js

问题

我最开始想爬取慕课网某个课程的学习人数

DOM结构如下

“上次学到”、“学习人数”等四块内容，分别存储在四个className为static-item的DIV中。但是通过数据抓取，我发现，抓出的数据“上次学到”等标题是乱码，然后具体的内容如“1-1课程简介”等是空

var number = $('.statics ').find('.static-item').html();

也许是我的这次行为被慕课网发现了，触发了自动“反扒”机制，这个机制和怎么规避，目前，我还不了解，后面的文章，我会继续填坑~

最后编辑于：2017.12.04 06:15:35

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 218,525评论 6赞 507
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 93,203评论 3赞 395
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 164,862评论 0赞 354
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 58,728评论 1赞 294
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 67,743评论 6赞 392
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 51,590评论 1赞 305
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 40,330评论 3赞 418
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 39,244评论 0赞 276
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 45,693评论 1赞 314
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 37,885评论 3赞 336
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 40,001评论 1赞 348
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 35,723评论 5赞 346
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 41,343评论 3赞 330
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 31,919评论 0赞 22
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 33,042评论 1赞 270
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 48,191评论 3赞 370
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 44,955评论 2赞 355

nodejs + cheerio + Promise(bluebird库实现)抓取慕课网nodejs课程数据

文章概要

准备

代码 crawler.js

拉出啦溜溜

问题

推荐阅读更多精彩内容