MyException - 我的异常网
当前位置:我的异常网» Perl/Python » 31 个 Python 爬虫实战项目会合

31 个 Python 爬虫实战项目会合

www.MyException.Cn  网友分享于:2013-10-11  浏览:0次
31 个 Python 爬虫实战项目集合
温馨提示:由于本文包含大量外部链接,墙裂建议小伙伴们点击 “阅读原文“ 进行阅读和收藏。:)WechatSogou

https://github.com/Chyroc/WechatSogou

微信公众号爬虫。基于搜狗微信搜索的微信公众号爬虫接口,可以扩展成基于搜狗搜索的爬虫,返回结果是列表,每一项均是公众号具体信息字典。

DouBanSpider

https://github.com/lanbing510/DouBanSpider

豆瓣读书爬虫。可以爬下豆瓣读书标签下的所有图书,按评分排名依次存储,存储到Excel中,可方便大家筛选搜罗,比如筛选评价人数>1000的高分书籍;可依据不同的主题存储到Excel不同的Sheet ,采用User Agent伪装为浏览器进行爬取,并加入随机延时来更好的模仿浏览器行为,避免爬虫被封。

zhihu_spider

https://github.com/LiuRoy/zhihu_spider

知乎爬虫。此项目的功能是爬取知乎用户信息以及人际拓扑关系,爬虫框架使用scrapy,数据存储使用mongo

bilibili-user

https://github.com/airingursb/bilibili-user

Bilibili用户爬虫。总数据数:20119918,抓取字段:用户id,昵称,性别,头像,等级,经验值,粉丝数,生日,地址,注册时间,签名,等级与经验值等。抓取之后生成B站用户数据报告。

SinaSpider

https://github.com/LiuXingMing/SinaSpider

新浪微博爬虫。主要爬取新浪微博用户的个人信息、微博信息、粉丝和关注。代码获取新浪微博Cookie进行登录,可通过多账号登录来防止新浪的反扒。主要使用 scrapy 爬虫框架。

distribute_crawler

https://github.com/gnemoug/distribute_crawler

小说下载分布式爬虫。使用scrapy,Redis, MongoDB,graphite实现的一个分布式网络爬虫,底层存储mongodb集群,分布式使用redis实现,爬虫状态显示使用graphite实现,主要针对一个小说站点。

CnkiSpider

https://github.com/yanzhou/CnkiSpider

中国知网爬虫。设置检索条件后,执行src/CnkiSpider.py抓取数据,抓取数据存储在/data目录下,每个数据文件的第一行为字段名称。

LianJiaSpider

https://github.com/lanbing510/LianJiaSpider

链家网爬虫。爬取北京地区链家历年二手房成交记录。涵盖链家爬虫一文的全部代码,包括链家模拟登录代码。

scrapyjingdong

https://github.com/taizilongxu/scrapyjingdong

京东爬虫。基于scrapy的京东网站爬虫,保存格式为csv。

QQ-Groups-Spider

https://github.com/caspartse/QQ-Groups-Spider

QQ 群爬虫。批量抓取 QQ 群信息,包括群名称、群号、群人数、群主、群简介等内容,最终生成 XLS(X) / CSV 结果文件。

wooyunpublic

https://github.com/hanc00l/wooyunpublic

乌云爬虫。 乌云公开漏洞、知识库爬虫和搜索。全部公开漏洞的列表和每个漏洞的文本内容存在mongodb中,大概约2G内容;如果整站爬全部文本和图片作为离线查询,大概需要10G空间、2小时(10M电信带宽);爬取全部知识库,总共约500M空间。漏洞搜索使用了Flask作为web server,bootstrap作为前端。

findtrip

https://github.com/fankcoder/findtrip

机票爬虫(去哪儿和携程网)。Findtrip是一个基于Scrapy的机票爬虫,目前整合了国内两大机票网站(去哪儿 + 携程)。

163spider

https://github.com/leyle/163spider

基于requests、MySQLdb、torndb的网易客户端内容爬虫

doubanspiders

https://github.com/fanpei91/doubanspiders

豆瓣电影、书籍、小组、相册、东西等爬虫集

QQSpider

https://github.com/LiuXingMing/QQSpider

QQ空间爬虫,包括日志、说说、个人信息等,一天可抓取 400 万条数据。

baidu-music-spider

https://github.com/Shu-Ji/baidu-music-spider

百度mp3全站爬虫,使用redis支持断点续传。

tbcrawler

https://github.com/pakoo/tbcrawler

淘宝和天猫的爬虫,可以根据搜索关键词,物品id来抓去页面的信息,数据存储在mongodb。

stockholm

https://github.com/benitoro/stockholm

一个股票数据(沪深)爬虫和选股策略测试框架。根据选定的日期范围抓取所有沪深两市股票的行情数据。支持使用表达式定义选股策略。支持多线程处理。保存数据到JSON文件、CSV文件。

BaiduyunSpider

https://github.com/k1995/BaiduyunSpider

百度云盘爬虫。

Spider

https://github.com/Qutan/Spider

社交数据爬虫。支持微博,知乎,豆瓣。

proxy pool

https://github.com/jhao104/proxy_pool

python爬虫代理IP池(proxy pool)。

music-163

https://github.com/RitterHou/music-163

爬取网易云音乐所有歌曲的评论。

jandan_spider

https://github.com/kulovecc/jandan_spider

爬取煎蛋妹纸图片。

CnblogsSpider

https://github.com/jackgitgz/CnblogsSpider

cnblogs列表页爬虫。

spider_smooc

https://github.com/qiyeboy/spider_smooc

爬取慕课网视频。

CnkiSpider

https://github.com/yanzhou/CnkiSpider

中国知网爬虫。

knowsecSpider2

https://github.com/littlethunder/knowsecSpider2

知道创宇爬虫题目。

aiss-spider

https://github.com/x-spiders/aiss-spider

爱丝APP图片爬虫,以及免支付破解VIP看图。

SinaSpider

https://github.com/szcf-weiya/SinaSpider

动态IP解决新浪的反爬虫机制,快速抓取内容。

csdn-spider

https://github.com/Kevinsss/csdn-spider

爬取CSDN上的博客文章。

ProxySpider

https://github.com/changetjut/ProxySpider

爬取西刺上的代理IP,并验证代理可用性


转载自:http://www.sohu.com/a/160870327_505818

文章评论

程序员都该阅读的书
程序员都该阅读的书
程序员的鄙视链
程序员的鄙视链
那些性感的让人尖叫的程序员
那些性感的让人尖叫的程序员
代码女神横空出世
代码女神横空出世
总结2014中国互联网十大段子
总结2014中国互联网十大段子
十大编程算法助程序员走上高手之路
十大编程算法助程序员走上高手之路
Java程序员必看电影
Java程序员必看电影
Java 与 .NET 的平台发展之争
Java 与 .NET 的平台发展之争
程序员周末都喜欢做什么?
程序员周末都喜欢做什么?
一个程序员的时间管理
一个程序员的时间管理
程序猿的崛起——Growth Hacker
程序猿的崛起——Growth Hacker
程序员必看的十大电影
程序员必看的十大电影
科技史上最臭名昭著的13大罪犯
科技史上最臭名昭著的13大罪犯
要嫁就嫁程序猿—钱多话少死的早
要嫁就嫁程序猿—钱多话少死的早
10个帮程序员减压放松的网站
10个帮程序员减压放松的网站
程序员和编码员之间的区别
程序员和编码员之间的区别
聊聊HTTPS和SSL/TLS协议
聊聊HTTPS和SSL/TLS协议
做程序猿的老婆应该注意的一些事情
做程序猿的老婆应该注意的一些事情
60个开发者不容错过的免费资源库
60个开发者不容错过的免费资源库
程序员应该关注的一些事儿
程序员应该关注的一些事儿
初级 vs 高级开发者 哪个性价比更高?
初级 vs 高级开发者 哪个性价比更高?
“肮脏的”IT工作排行榜
“肮脏的”IT工作排行榜
我跳槽是因为他们的显示器更大
我跳槽是因为他们的显示器更大
中美印日四国程序员比较
中美印日四国程序员比较
老美怎么看待阿里赴美上市
老美怎么看待阿里赴美上市
当下全球最炙手可热的八位少年创业者
当下全球最炙手可热的八位少年创业者
“懒”出效率是程序员的美德
“懒”出效率是程序员的美德
看13位CEO、创始人和高管如何提高工作效率
看13位CEO、创始人和高管如何提高工作效率
编程语言是女人
编程语言是女人
10个调试和排错的小建议
10个调试和排错的小建议
团队中“技术大拿”并非越多越好
团队中“技术大拿”并非越多越好
为什么程序员都是夜猫子
为什么程序员都是夜猫子
程序员最害怕的5件事 你中招了吗?
程序员最害怕的5件事 你中招了吗?
为啥Android手机总会越用越慢?
为啥Android手机总会越用越慢?
旅行,写作,编程
旅行,写作,编程
如何成为一名黑客
如何成为一名黑客
2013年美国开发者薪资调查报告
2013年美国开发者薪资调查报告
程序员的一天:一寸光阴一寸金
程序员的一天:一寸光阴一寸金
5款最佳正则表达式编辑调试器
5款最佳正则表达式编辑调试器
Web开发人员为什么越来越懒了?
Web开发人员为什么越来越懒了?
老程序员的下场
老程序员的下场
 程序员的样子
程序员的样子
我的丈夫是个程序员
我的丈夫是个程序员
2013年中国软件开发者薪资调查报告
2013年中国软件开发者薪资调查报告
如何区分一个程序员是“老手“还是“新手“?
如何区分一个程序员是“老手“还是“新手“?
鲜为人知的编程真相
鲜为人知的编程真相
那些争议最大的编程观点
那些争议最大的编程观点
我是如何打败拖延症的
我是如何打败拖延症的
Web开发者需具备的8个好习惯
Web开发者需具备的8个好习惯
软件开发程序错误异常ExceptionCopyright © 2009-2015 MyException 版权所有