Python 制作糗事百科爬虫实例

站长资源 2026/3/7 佚名

32 1538 32

南强小屋 Design By 杰米

早上起来闲来无事做，莫名其妙的就弹出了糗事百科的段子，转念一想既然你送上门来，那我就写个爬虫到你网站上爬一爬吧，一来当做练练手，二来也算找点乐子。

其实这两天也正在接触数据库的内容，可以将爬取下来的数据保存在数据库中，以待以后的利用。好了，废话不多说了，先来看看程序爬取的数据结果

值得一提的是，我在程序中想一下子爬取糗事百科 30 页的内容，但是出现了连接错误，当我把页数降到 20 页的时候，程序就可以正常的跑起来了，不知道是什么原因，渴望知道的大神可以告诉我一声，感激不尽。

程序非常简单，直接上源代码咯

# coding=utf8

import re
import requests
from lxml import etree
from multiprocessing.dummy import Pool as ThreadPool
import sys

reload(sys)
sys.setdefaultencoding('utf-8')


def getnewpage(url, total):
 nowpage = int(re.search('(\d+)', url, re.S).group(1))
 urls = []

 for i in range(nowpage, total + 1):
  link = re.sub('(\d+)', '%s' % i, url, re.S)
  urls.append(link)

 return urls


def spider(url):
 html = requests.get(url)
 selector = etree.HTML(html.text)

 author = selector.xpath('//*[@id="content-left"]/div/div[1]/a[2]/@title')
 content = selector.xpath('//*[@id="content-left"]/div/div[2]/text()')
 vote = selector.xpath('//*[@id="content-left"]/div/div[3]/span/i/text()')

 length = len(author)
 for i in range(0, length):
  f.writelines('作者 : ' + author[i] + '\n')
  f.writelines('内容 ：' + str(content[i]).replace('\n','') + '\n')
  f.writelines('支持 ： ' + vote[i] + '\n\n')


if __name__ == '__main__':

 f = open('info.txt', 'a')
 url = 'http://www.qiushibaike.com/text/page/1/'
 urls = getnewpage(url, 20)

 pool = ThreadPool(4)
 pool.map(spider,urls)
 f.close()

如果其中有不懂得部分，可以依次参考我的前三篇文章。

python,爬虫,糗事百科,糗事百科爬虫,python爬虫实例

标签：

python,爬虫,糗事百科,糗事百科爬虫,python爬虫实例

南强小屋 Design By 杰米

广告合作：本站广告合作请联系QQ：858582 申请时备注：广告合作（否则不回）
免责声明：本站文章均来自网站采集或用户投稿，网站不提供任何软件下载或自行开发的软件！如有用户或公司发现本站内容信息存在侵权行为，请邮件告知！ 858582#qq.com

南强小屋 Design By 杰米

评论“Python 制作糗事百科爬虫实例”

暂无Python 制作糗事百科爬虫实例的评论...

Python 制作糗事百科爬虫实例

python,爬虫,糗事百科,糗事百科爬虫,python爬虫实例

教你用Python脚本快速为iOS10生成图标和截屏

Python 使用SMTP发送邮件的代码小结

评论“Python 制作糗事百科爬虫实例”

RTX 5090要首发性能要翻倍！三星展示GDDR7显存

友情链接

Python 制作糗事百科爬虫实例

python,爬虫,糗事百科,糗事百科爬虫,python爬虫实例

教你用Python脚本快速为iOS10生成图标和截屏

Python 使用SMTP发送邮件的代码小结

评论“Python 制作糗事百科爬虫实例”

RTX 5090要首发 性能要翻倍！三星展示GDDR7显存

友情链接

RTX 5090要首发性能要翻倍！三星展示GDDR7显存