Lofter爬虫

这两天对LOFTER上面的几个妹子情有独钟,然而她们每一个都是自拍狂魔,手动收藏她们的照片实在是太慢了,于是我就写了一个爬虫专门去收集她们的照片了。
使用方法非常简单,只要输入Lofter ID就可以爬取到妹子(当然也可以是汉子)的所有照片了。爬取之后的图片存放在主机中。
本来我把地址po出来了,但是居然有人恶意攻击,所以暂时不公开成品地址了。
Continue reading

Python爬虫的工具列表整理

这个表单是从网络上转载的,mark下来,以后应该会有用得上的地方。

网络

  • 通用
    • urllib -网络库(stdlib)。
    • requests -网络库。
    • grab – 网络库(基于pycurl)。
    • pycurl – 网络库(绑定libcurl)。
    • urllib3 – Python HTTP库,安全连接池、支持文件post、可用性高。
    • httplib2 – 网络库。
    • RoboBrowser – 一个简单的、极具Python风格的Python库,无需独立的浏览器即可浏览网页。
    • MechanicalSoup -一个与网站自动交互Python库。
    • mechanize -有状态、可编程的Web浏览库。
    • socket – 底层网络接口(stdlib)。
    • Unirest for Python – Unirest是一套可用于多种语言的轻量级的HTTP库。
    • hyper – Python的HTTP/2客户端。
    • PySocks – SocksiPy更新并积极维护的版本,包括错误修复和一些其他的特征。作为socket模块的直接替换。
  • 异步
    • treq – 类似于requests的API(基于twisted)。
    • aiohttp – asyncio的HTTP客户端/服务器(PEP-3156)。

Continue reading