Skip to content

互联网爬虫,蜘蛛,数据采集器,网页解析器的汇总,因新技术不断发展,新框架层出不穷,此文会不断更新...

License

Notifications You must be signed in to change notification settings

DZ1Y/awesome-crawler-cn

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

12 Commits
 
 
 
 

Repository files navigation

Awesome-crawler-cn

互联网爬虫,蜘蛛,数据采集器,网页解析器的汇总,因新技术不断发展,新框架层出不穷,此文会不断更新...

交流讨论

  1. 欢迎推荐你知道的开源网络爬虫,网页抽取框架.
  2. 开源网络爬虫QQ交流群:322937592
  3. email address: liinux at qq.com

Python

  • Scrapy - 一种高效的屏幕,网页数据采集框架。
  • pyspider - 一个强大纯python的数据采集系统.
  • cola - 一个分布式的爬虫框架.
  • Demiurge - 基于PyQuery的微型爬虫框架.
  • Scrapely - 一个纯python的HTML页面捕捉库.
  • feedparser - 一个通用的feed解析器.
  • you-get - 静默网站爬去下载器.
  • Grab - 网站采集框架.
  • MechanicalSoup - 一个自动化的互动网站Python库.
  • portia - 基于Scrapy的可视化数据采集框架.
  • crawley - 基于非阻塞通信(NIO)的python爬虫框架.
  • RoboBrowser - 一个简单的,不基于Web浏览器的基于Python的Web 浏览器.
  • MSpider - 一个基于gevent(协程网络库)的python爬虫.
  • brownant - 一个轻量级的网络数据抽取框架.

Java

  • Apache Nutch - 用于生产环境的高度可扩展的高度可扩展的网络爬虫.
    • anthelion - 一个基于Apache Nutch抓取语义注释在HTML页面插件.
  • Crawler4j - 简单和轻量级的网络爬虫.
  • JSoup - 采集,分析,处理和清洗HTML页面.
  • websphinx - HTML网站特定的处理、信息提取.
  • Open Search Server - 全套搜索功能,建立你自己的索引策略。分析、提取全文数据,这个框架可以索引的一切.
  • Gecco - 一个易于使用的轻量级网络爬虫.
  • WebCollector -简单的抓取网页的界面,可以在不到5分钟内部署一个多线程的网络爬虫.
  • Webmagic -一个可扩展的爬虫框架.
  • Spiderman -一个可扩展的,多线程的网络爬虫.
    • Spiderman2 - 分布式网络爬虫框架,支持javascript渲染.
  • Heritrix3 - 可扩展,大规模的网络爬虫项目.
  • SeimiCrawler - 一个敏捷的分布式爬虫框架.
  • StormCrawler - 基于开放源代码、构建低延迟的网络资源采集框架,基于Apache Storm.
  • Spark-Crawler - 基于Apache Nutch 的网络爬虫,可以运行于Spark.

C#

  • ccrawler - 一个简单的Web内容分类方案,它可以根据其内容分开网页,基于C#3.5.
  • SimpleCrawler - 简单的多线程网络爬虫,基于REG表达式.
  • DotnetSpider - 基于C#开发的一个轻量级,交叉平台的网络爬虫.
  • Abot - 具有很好效率和可扩展性的C#网络爬虫.
  • Hawk -  用 C#/WPF开发的网络爬虫,具有简单的ETL功能.
  • SkyScraper - 一个支持异步网络和有很好扩展性的网络爬虫.

JavaScript

  • scraperjs - 基于JS的一个功能齐全的网络爬虫.
  • scrape-it - 基于Node.js的网络爬虫.
  • simplecrawler - 基于事件驱动开发的网络爬虫.
  • node-crawler - 提供简单API,适于二次开发的网络爬虫.
  • js-crawler - 基于Node.JS,支持HTTP(S)的网络爬虫.
  • x-ray - 支持分页的网络爬虫.
  • node-osmosis - 基于Node.js适于解析HTML结构的网络爬虫.

PHP

  • Goutte - A screen scraping and web crawling library for PHP.
  • dom-crawler - The DomCrawler component eases DOM navigation for HTML and XML documents.
  • pspider - Parallel web crawler written in PHP.
  • php-spider - A configurable and extensible PHP web spider.

C++

C

  • httrack - Copy websites to your computer.

Ruby

  • upton - A batteries-included framework for easy web-scraping. Just add CSS(Or do more).
  • wombat - Lightweight Ruby web crawler/scraper with an elegant DSL which extracts structured data from pages.
  • RubyRetriever - RubyRetriever is a Web Crawler, Scraper & File Harvester.
  • Spidr - Spider a site ,multiple domains, certain links or infinitely.
  • Cobweb - Web crawler with very flexible crawling options, standalone or using sidekiq.
  • mechanize - Automated web interaction & crawling.

R

  • rvest - Simple web scraping for R.

Erlang

  • ebot - A scalable, distribuited and highly configurable web cawler.

Perl

  • web-scraper - Web Scraping Toolkit using HTML and CSS Selectors or XPath expressions.

Go

  • pholcus - A distributed, high concurrency and powerful web crawler.
  • gocrawl - Polite, slim and concurrent web crawler.
  • fetchbot - A simple and flexible web crawler that follows the robots.txt policies and crawl delays.
  • go_spider - An awesome Go concurrent Crawler(spider) framework.
  • dht - BitTorrent DHT Protocol && DHT Spider.
  • ants-go - A open source, distributed, restful crawler engine in golang.
  • scrape - A simple, higher level interface for Go web scraping.

Scala

  • crawler - Scala DSL for web crawling.
  • scrala - Scala crawler(spider) framework, inspired by scrapy.
  • ferrit - Ferrit is a web crawler service written in Scala using Akka, Spray and Cassandra.

About

互联网爬虫,蜘蛛,数据采集器,网页解析器的汇总,因新技术不断发展,新框架层出不穷,此文会不断更新...

Resources

License

Stars

Watchers

Forks

Releases

No releases published

Packages

No packages published