南强小屋 Design By 杰米
本文实例讲述了Python进阶之使用selenium爬取淘宝商品信息功能。分享给大家供大家参考,具体如下:
# encoding=utf-8 __author__ = 'Jonny' __location__ = '西安' __date__ = '2018-05-14' ''' 需要的基本开发库文件: requests,pymongo,pyquery,selenium 开发流程: 搜索关键字:利用selenium驱动浏览器搜索关键字,得到查询后的商品列表 分析页码并翻页:得到商品页码数,模拟翻页,得到后续页面的商品列表 分析提取商品内容:利用PyQuery分析页面源代码,解析获得商品列表信息 存储到MongDB中:将商品的信息列表存储到数据库MongoDB。 ''' import requests from selenium import webdriver from selenium.webdriver.common.by import By from selenium.webdriver.support.ui import WebDriverWait from selenium.webdriver.support import expected_conditions as EC from selenium.common.exceptions import TimeoutException from pyquery import PyQuery as pq import pymongo import re import time browser = webdriver.Chrome() wait = WebDriverWait(browser,10) client = pymongo.MongoClient('localhost',27017) mongo = client['taobao'] def searcher(): url = 'https://www.taobao.com/' browser.get(url=url) try: #判断页面加载是够成功,设置等待时间 #判断位置1:搜索输入框是否加载完成 input_kw = wait.until( EC.presence_of_element_located((By.CSS_SELECTOR, '#q')) ) #判断位置2:搜索输入框对应的搜索按键是否加载完成 submit = wait.until(EC.element_to_be_clickable( (By.CSS_SELECTOR,'#J_TSearchForm > div.search-button > button')) ) input_kw.send_keys('男装') submit.click() #等待页面加载完成,便于准确判断网页的总页数 page_counts = wait.until( EC.presence_of_element_located( (By.CSS_SELECTOR,'#mainsrp-pager > div > div > div > div.total')) ) parse_page() return page_counts.text except TimeoutException as e: print(e.args) return searcher() #实现翻页 def next_page(page_number): try: # 判断页面加载是够成功,设置等待时间 # 判断位置1:页面跳转输入页是否加载完成 input_page = wait.until( EC.presence_of_element_located((By.CSS_SELECTOR, '#mainsrp-pager > div > div > div > div.form > input')) ) # 判断位置2:确认按键是否加载完成 submit = wait.until(EC.element_to_be_clickable( (By.CSS_SELECTOR, '#mainsrp-pager > div > div > div > div.form > span.btn.J_Submit')) ) input_page.send_keys(page_number) submit.click() #判断翻页是否成功 wait.until(EC.text_to_be_present_in_element( (By.CSS_SELECTOR,'#mainsrp-pager > div > div > div > ul > li.item.active'),str(page_number)) ) parse_page() except TimeoutException as e: print(e.args) next_page(page_number) #对页面进行数据处理 def parse_page(): # wait.until(EC.presence_of_element_located(By.CSS_SELECTOR,'#mainsrp-itemlist > div > div')) wait.until(EC.presence_of_element_located((By.CSS_SELECTOR, '#mainsrp-itemlist .items .item'))) html = browser.page_source doc = pq(html) items = doc('#mainsrp-itemlist .items .item').items() for item in items: goods = { 'image':item.find('.pic .img').attr('src'), 'price':item.find('.price').text(), 'deal':item.find('.deal-cnt').text()[:-3], 'title':item.find('.title').text(), 'shop':item.find('.shop').text(), 'location':item.find('.location').text() } print(goods) data_storage(goods) #将数据存入数据库 def data_storage(goods): try: if mongo['mongo_sheet'].insert(goods): print('Successfully storage!') except Exception as e: print('failedly storage!',goods) def main(): text = searcher() print(text) #获取总页数 pages = int(re.compile('(\d+)').search(text).group(0)) print(pages) for i in range(2,pages+1): next_page(i) browser.close() if __name__ == '__main__': main()
更多关于Python相关内容可查看本站专题:《Python Socket编程技巧总结》、《Python正则表达式用法总结》、《Python数据结构与算法教程》、《Python函数使用技巧总结》、《Python字符串操作技巧汇总》、《Python入门与进阶经典教程》及《Python文件与目录操作技巧汇总》
希望本文所述对大家Python程序设计有所帮助。
南强小屋 Design By 杰米
广告合作:本站广告合作请联系QQ:858582 申请时备注:广告合作(否则不回)
免责声明:本站文章均来自网站采集或用户投稿,网站不提供任何软件下载或自行开发的软件! 如有用户或公司发现本站内容信息存在侵权行为,请邮件告知! 858582#qq.com
免责声明:本站文章均来自网站采集或用户投稿,网站不提供任何软件下载或自行开发的软件! 如有用户或公司发现本站内容信息存在侵权行为,请邮件告知! 858582#qq.com
南强小屋 Design By 杰米
暂无Python进阶之使用selenium爬取淘宝商品信息功能示例的评论...
《魔兽世界》大逃杀!60人新游玩模式《强袭风暴》3月21日上线
暴雪近日发布了《魔兽世界》10.2.6 更新内容,新游玩模式《强袭风暴》即将于3月21 日在亚服上线,届时玩家将前往阿拉希高地展开一场 60 人大逃杀对战。
艾泽拉斯的冒险者已经征服了艾泽拉斯的大地及遥远的彼岸。他们在对抗世界上最致命的敌人时展现出过人的手腕,并且成功阻止终结宇宙等级的威胁。当他们在为即将于《魔兽世界》资料片《地心之战》中来袭的萨拉塔斯势力做战斗准备时,他们还需要在熟悉的阿拉希高地面对一个全新的敌人──那就是彼此。在《巨龙崛起》10.2.6 更新的《强袭风暴》中,玩家将会进入一个全新的海盗主题大逃杀式限时活动,其中包含极高的风险和史诗级的奖励。
《强袭风暴》不是普通的战场,作为一个独立于主游戏之外的活动,玩家可以用大逃杀的风格来体验《魔兽世界》,不分职业、不分装备(除了你在赛局中捡到的),光是技巧和战略的强弱之分就能决定出谁才是能坚持到最后的赢家。本次活动将会开放单人和双人模式,玩家在加入海盗主题的预赛大厅区域前,可以从强袭风暴角色画面新增好友。游玩游戏将可以累计名望轨迹,《巨龙崛起》和《魔兽世界:巫妖王之怒 经典版》的玩家都可以获得奖励。