开始之前请先确保自己安装了Node.js环境,如果没有安装,大家可以到下载安装。
1.在项目文件夹安装两个必须的依赖包
npm install superagent --save-dev
superagent 是一个轻量的,渐进式的ajax api,可读性好,学习曲线低,内部依赖nodejs原生的请求api,适用于nodejs环境下
npm install cheerio --save-dev
cheerio是nodejs的抓取页面模块,为服务器特别定制的,快速、灵活、实施的jQuery核心实现。适合各种Web爬虫程序。相当于node.js中的jQuery
2.新建 crawler.js 文件
//导入依赖包 const http = require("http"); const path = require("path"); const url = require("url"); const fs = require("fs"); const superagent = require("superagent"); const cheerio = require("cheerio");
3.获取 Boos直聘数据
superagent .get("https://www.zhipin.com/job_detail/") .end((error,response)=>{ //获取页面文档数据 var content = response.text; //cheerio也就是nodejs下的jQuery 将整个文档包装成一个集合,定义一个变量$接收 var $ = cheerio.load(content); //定义一个空数组,用来接收数据 var result=[]; //分析文档结构 先获取每个li 再遍历里面的内容(此时每个li里面就存放着我们想要获取的数据) $(".job-list li .job-primary").each((index,value)=>{ //地址和类型为一行显示,需要用到字符串截取 //地址 let address=$(value).find(".info-primary").children().eq(1).html(); //类型 let type=$(value).find(".info-company p").html(); //解码 address=unescape(address.replace(/&#x/g,'%u').replace(/;/g,'')); type=unescape(type.replace(/&#x/g,'%u').replace(/;/g,'')) //字符串截取 let addressArr=address.split('<em class="vline"></em>'); let typeArr=type.split('<em class="vline"></em>'); //将获取的数据以对象的形式添加到数组中 result.push({ title:$(value).find(".name .job-title").text(), money:$(value).find(".name .red").text(), address:addressArr, company:$(value).find(".info-company a").text(), type:typeArr, position:$(value).find(".info-publis .name").text(), txImg:$(value).find(".info-publis img").attr("src"), time:$(value).find(".info-publis p").text() }); // console.log(typeof $(value).find(".info-primary").children().eq(1).html()); }); //将数组转换成字符串 result=JSON.stringify(result); //将数组输出到json文件里 刷新目录 即可看到当前文件夹多出一个boss.json文件(打开boss.json文件,ctrl+A全选之后 ctrl+K,再Ctrl+F即可将json文件自动排版) fs.writeFile("boss.json",result,"utf-8",(error)=>{ //监听错误,如正常输出,则打印null if(error==null){ console.log("恭喜您,数据爬取成功!请打开json文件,先Ctrl+A,再Ctrl+K,最后Ctrl+F格式化后查看json文件(仅限Visual Studio Code编辑器)"); } }); });
总结
以上所述是小编给大家介绍的Nodejs实现爬虫抓取数据,希望对大家有所帮助,如果大家有任何疑问请给我留言,小编会及时回复大家的。在此也非常感谢大家对网站的支持!
免责声明:本站文章均来自网站采集或用户投稿,网站不提供任何软件下载或自行开发的软件! 如有用户或公司发现本站内容信息存在侵权行为,请邮件告知! 858582#qq.com
《魔兽世界》大逃杀!60人新游玩模式《强袭风暴》3月21日上线
暴雪近日发布了《魔兽世界》10.2.6 更新内容,新游玩模式《强袭风暴》即将于3月21 日在亚服上线,届时玩家将前往阿拉希高地展开一场 60 人大逃杀对战。
艾泽拉斯的冒险者已经征服了艾泽拉斯的大地及遥远的彼岸。他们在对抗世界上最致命的敌人时展现出过人的手腕,并且成功阻止终结宇宙等级的威胁。当他们在为即将于《魔兽世界》资料片《地心之战》中来袭的萨拉塔斯势力做战斗准备时,他们还需要在熟悉的阿拉希高地面对一个全新的敌人──那就是彼此。在《巨龙崛起》10.2.6 更新的《强袭风暴》中,玩家将会进入一个全新的海盗主题大逃杀式限时活动,其中包含极高的风险和史诗级的奖励。
《强袭风暴》不是普通的战场,作为一个独立于主游戏之外的活动,玩家可以用大逃杀的风格来体验《魔兽世界》,不分职业、不分装备(除了你在赛局中捡到的),光是技巧和战略的强弱之分就能决定出谁才是能坚持到最后的赢家。本次活动将会开放单人和双人模式,玩家在加入海盗主题的预赛大厅区域前,可以从强袭风暴角色画面新增好友。游玩游戏将可以累计名望轨迹,《巨龙崛起》和《魔兽世界:巫妖王之怒 经典版》的玩家都可以获得奖励。