最近用Python写了个豆瓣读书的爬虫玩,方便搜罗各种美美书,分享给大家



实现功能:

1 可以爬下豆瓣读书标签下的所有图书

2 按评分排名依次存储

3 存储到Excel中,可方便大家筛选搜罗,比如筛选评价人数>1000的高分书籍;可依据不同的主题存储到Excel不同的Sheet

4 采用User Agent伪装为浏览器进行爬取,并加入随机延时来更好的模仿浏览器行为,避免爬虫被封



试着爬了七八万本书,存在了book_list.xlsx中,结果截图如下:





详细代码和爬取的一些结果可移步到GitHub: https://github.com/lanbing510/DouBanSpider


转载请标明出处:http://blog.csdn.net/lanbing510/article/details/45887075

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐