Name	Name	Last commit message	Last commit date
Latest commit History 12 Commits
LICENSE	LICENSE
README.md	README.md

Awesome-crawler-cn

互联网爬虫，蜘蛛，数据采集器，网页解析器的汇总，因新技术不断发展，新框架层出不穷，此文会不断更新...

交流讨论

欢迎推荐你知道的开源网络爬虫，网页抽取框架.
开源网络爬虫QQ交流群:322937592
email address: liinux at qq.com

Python

Scrapy - 一种高效的屏幕,网页数据采集框架。
- django-dynamic-scraper - 基于Scrapy内核由django Web框架开发的爬虫。
- Scrapy-Redis - 基于Scrapy内核采用Redis组件的爬虫。
- scrapy-cluster - 基于Scrapy内核采用Redis 和 Kafka 开发的分布式爬虫框架。
- distribute_crawler - 基于Scrapy内核采用redis, mongodb开发的分布式爬虫框架。
pyspider - 一个强大纯python的数据采集系统.
cola - 一个分布式的爬虫框架.
Demiurge - 基于PyQuery的微型爬虫框架.
Scrapely - 一个纯python的HTML页面捕捉库.
feedparser - 一个通用的feed解析器.
you-get - 静默网站爬去下载器.
Grab - 网站采集框架.
MechanicalSoup - 一个自动化的互动网站Python库.
portia - 基于Scrapy的可视化数据采集框架.
crawley - 基于非阻塞通信(NIO)的python爬虫框架.
RoboBrowser - 一个简单的，不基于Web浏览器的基于Python的Web 浏览器.
MSpider - 一个基于gevent(协程网络库)的python爬虫.
brownant - 一个轻量级的网络数据抽取框架.

Java

Apache Nutch - 用于生产环境的高度可扩展的高度可扩展的网络爬虫.
- anthelion - 一个基于Apache Nutch抓取语义注释在HTML页面插件.
Crawler4j - 简单和轻量级的网络爬虫.
JSoup - 采集，分析，处理和清洗HTML页面.
websphinx - HTML网站特定的处理、信息提取.
Open Search Server - 全套搜索功能，建立你自己的索引策略。分析、提取全文数据，这个框架可以索引的一切.
Gecco - 一个易于使用的轻量级网络爬虫.
WebCollector -简单的抓取网页的界面，可以在不到5分钟内部署一个多线程的网络爬虫.
Webmagic -一个可扩展的爬虫框架.
Spiderman -一个可扩展的，多线程的网络爬虫.
- Spiderman2 - 分布式网络爬虫框架，支持javascript渲染.
Heritrix3 - 可扩展，大规模的网络爬虫项目.
SeimiCrawler - 一个敏捷的分布式爬虫框架.
StormCrawler - 基于开放源代码、构建低延迟的网络资源采集框架，基于Apache Storm.
Spark-Crawler - 基于Apache Nutch 的网络爬虫，可以运行于Spark.

C#

ccrawler - 一个简单的Web内容分类方案，它可以根据其内容分开网页,基于C#3.5.
SimpleCrawler - 简单的多线程网络爬虫，基于REG表达式.
DotnetSpider - 基于C#开发的一个轻量级，交叉平台的网络爬虫.
Abot - 具有很好效率和可扩展性的C#网络爬虫.
Hawk - 用 C#/WPF开发的网络爬虫，具有简单的ETL功能.
SkyScraper - 一个支持异步网络和有很好扩展性的网络爬虫.

JavaScript

scraperjs - 基于JS的一个功能齐全的网络爬虫.
scrape-it - 基于Node.js的网络爬虫.
simplecrawler - 基于事件驱动开发的网络爬虫.
node-crawler - 提供简单API，适于二次开发的网络爬虫.
js-crawler - 基于Node.JS,支持HTTP(S)的网络爬虫.
x-ray - 支持分页的网络爬虫.
node-osmosis - 基于Node.js适于解析HTML结构的网络爬虫.

PHP

Goutte - A screen scraping and web crawling library for PHP.
- laravel-goutte - Laravel 5 Facade for Goutte.
dom-crawler - The DomCrawler component eases DOM navigation for HTML and XML documents.
pspider - Parallel web crawler written in PHP.
php-spider - A configurable and extensible PHP web spider.

C++

open-source-search-engine - A distributed open source search engine and spider/crawler written in C/C++.

C

httrack - Copy websites to your computer.

Ruby

upton - A batteries-included framework for easy web-scraping. Just add CSS(Or do more).
wombat - Lightweight Ruby web crawler/scraper with an elegant DSL which extracts structured data from pages.
RubyRetriever - RubyRetriever is a Web Crawler, Scraper & File Harvester.
Spidr - Spider a site ,multiple domains, certain links or infinitely.
Cobweb - Web crawler with very flexible crawling options, standalone or using sidekiq.
mechanize - Automated web interaction & crawling.

R

rvest - Simple web scraping for R.

Erlang

ebot - A scalable, distribuited and highly configurable web cawler.

Perl

web-scraper - Web Scraping Toolkit using HTML and CSS Selectors or XPath expressions.

Go

pholcus - A distributed, high concurrency and powerful web crawler.
gocrawl - Polite, slim and concurrent web crawler.
fetchbot - A simple and flexible web crawler that follows the robots.txt policies and crawl delays.
go_spider - An awesome Go concurrent Crawler(spider) framework.
dht - BitTorrent DHT Protocol && DHT Spider.
ants-go - A open source, distributed, restful crawler engine in golang.
scrape - A simple, higher level interface for Go web scraping.

Scala

crawler - Scala DSL for web crawling.
scrala - Scala crawler(spider) framework, inspired by scrapy.
ferrit - Ferrit is a web crawler service written in Scala using Akka, Spray and Cassandra.

Provide feedback

Saved searches

Use saved searches to filter your results more quickly

Repository files navigation

Awesome-crawler-cn

交流讨论

Python

Java

C#

JavaScript

PHP

C++

C

Ruby

R

Erlang

Perl

Go

Scala

About

Releases

Packages

License

DZ1Y/awesome-crawler-cn

Folders and files

Latest commit

History

Repository files navigation

Awesome-crawler-cn

交流讨论

Python

Java

C#

JavaScript

PHP

C++

C

Ruby

R

Erlang

Perl

Go

Scala

About

Resources

License

Stars

Watchers

Forks

Releases

Packages 0

Packages