爬虫工具实战篇（Web Scraper）- 京东商品信息爬取（原创）

一、背景与目的

数字化营销时代，快速掌握了解数据是一项基本技能，本文主要讲解里面Web Scraper工具如何爬取公开数据，比如爬取京东的店铺售卖商品情况数据，以便我们更好地了解竞品对手的产品情况和定价情况等，从而采取有效针对性的手段应对，同时对于个人也是一项数据收集技能的提升。

二、工具介绍和安装

1> 介绍

Web Scraper是一款可以从网页中提取数据的chrome网页数据提取插件,是一款非常好用的爬虫工具。

2> 安装

步骤一：安装Chrome浏览器的桌面版。

步骤二：:在webscraper.io下载谷歌Chrome浏览器插件，完全免费。

步骤三：安装完Web Scraper可以在Chrome右上角找到图标。

步骤四：Windows操作系统，按F12键，Chrome开发者工具会弹出，Web Scraper在菜单项的最右边，至此安装工作结束。

三、实战爬取操作

1> 选取爬取平台的链接

步骤一：获取爬取链接：打开京东首页，搜索手机之后，我们看到全部商品分类的选项，然后我们选取手机通讯->手机->品牌HUAWEI，进入相应页面后，选取第二页商品列表，之后得到如下链接。

https://list.jd.com/list.html?cat=9987,653,655&ev=exbrand_8557&page=2&sort=sort_rank_asc&trans=1&JL=6_0_0&ms=9#J_main

步骤二：分析链接：上面URL中加粗的参数sort、trans、JL和ms并没有用，有用的是cat、ev和page参数，其中cat代表品类，ev代表华为品牌，page代表商品列表页数

步骤三：定义取值链接和爬取页数：根据上边分析和之前查看页数，获得总页数42页，故工具抽取链接如下（循环遍历抽取1~42页数据）。

https://list.jd.com/list.html?cat=9987,653,655&ev=exbrand_8557&page=[1-42]

2> 爬取配置

步骤一：创建爬取网站项目，定义爬取网站地址

在Web Scraper选项下边选取Create new sitemap，具体参数如下

sitemap name ：huawei_mobile

Start URL：https://list.jd.com/list.html?cat=9987,653,655&ev=exbrand_8557&page=[1-42]

创建完成后，进入Add new selector蓝色按钮的界面，此时我们的位置为_root，这里面selector就是CSS里面的CSS选择器，然后我们依次添加selector，圈选商品和商品项。

步骤二：创建商品选择器，圈选爬取商品

a> 点击按钮：CSS Selector的作用是在HTML中定位，我们点击蓝色按钮Add new selector，进入页面元素选取状态。

b> 页面商品圈选：

鼠标定位某一个商品，此时商品处于蓝色框选区域，具体如图所示

然后鼠标双击，在Done Selecting！处获取圈选商品页面HTML元素，点击此蓝色按钮，具体获取元素为：li.gl-item:nth-of-type(1) div.gl-i-wrap

点击Element preview按钮时，该块商品区域会再次高亮。

我们此时需要选取所有商品，则需要调整刚才所选取元素，根据如下HTML Element则调整为#plist > ul > li

备注：此处应用了页面Copy Selector的插件，可以在HTML Element右键复制

当我们再次启用Element preview时，就能看到所有商品区域都高亮了。

点击蓝色按钮Save selector保存,item的选择器创建成功

步骤三：创建商品项选择器，圈选商品项

依次在item选择器下创建商品属性项，分别为商品名称（product name）、商品价格（price）、商品评论数（comment_cnt）和店铺（shop)，具体如下图所示：

此时如需预览数据，可以将之前sitemap里面的页数page=[1-42]调整为page=2，data preview具体如下：

步骤四：数据爬取

选取Scrape进行数据爬取，启动爬取

步骤五：结果导出

csv版本导出

四、总结

webscraper优缺点总结

优点：免费、操作系统无限制（依赖于浏览器）、操作简便，容易上手（无技术背景人可配置操作）、功能强大（支持静态和动态数据抓取）

缺点：不支持iframe的爬取（比如地图嵌入之类，经销商地图）、不支持爬取数据的过滤、其他的以后碰到在说吧，O(∩_∩)O哈哈~

适用人群：

技术人员

商业分析人员

咨询人员

欢迎使用！！！！！！！！！！！！！！！！！

最后编辑于：2019.02.21 11:46:49

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 230,578评论 6赞 544
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 99,701评论 3赞 429
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 178,691评论 0赞 383
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 63,974评论 1赞 318
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 72,694评论 6赞 413
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 56,026评论 1赞 329
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 44,015评论 3赞 450
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 43,193评论 0赞 290
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 49,719评论 1赞 336
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 41,442评论 3赞 360
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 43,668评论 1赞 374
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 39,151评论 5赞 365
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 44,846评论 3赞 351
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 35,255评论 0赞 28
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 36,592评论 1赞 295
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 52,394评论 3赞 400
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 48,635评论 2赞 380