最全大数据学习资源整理

Brooklyn:用于简化应用程序部署和管理的库;

Buildoop:基于Groovy语言,和Apache BigTop类似;

Cloudera HUE:和Hadoop进行交互的Web应用程序;

Facebook Prism:多数据中心复制系统;

Google Borg:作业调度和监控系统;

Google Omega:作业调度和监控系统;

Hortonworks HOYA:可在YARN上部署HBase集群的应用;

Marathon:用于长期运行服务的Mesos框架。

应用程序

Adobe spindle:使用Scala、Spark和Parquet处理的下一代web分析;

Apache Kiji:基于HBase,实时采集和分析数据的框架;

Apache Nutch:开源网络爬虫;

Apache OODT:用于NASA科学档案中数据的捕获、处理和共享;

Apache Tika:内容分析工具包;

Argus:时间序列监测和报警平台;

Countly:基于Node.js和MongoDB,开源的手机和网络分析平台;

Domino:运行、规划、共享和部署模型——没有任何基础设施;

Eclipse BIRT:基于Eclipse的报告系统;

Eventhub:开源的事件分析平台;

Hermes:建于Kafka上的异步消息代理;

HIPI Library:在Hadoop’s MapReduce上执行图像处理任务的API;

Hunk:Hadoop的Splunk分析;

Imhotep:大规模分析平台;

MADlib:RDBMS的用于数据分析的数据处理库;

Kylin:来自eBay的开源分布式分析工具;

PivotalR:Pivotal HD / HAWQ和PostgreSQL中的R;

Qubole:为自动缩放Hadoop集群,内置的数据连接器;

Sense:用于数据科学和大数据分析的云平台;

SnappyData:用于实时运营分析的分布式内存数据存储,提供建立在Spark单一集成集群中的数据流分析、OLTP(联机事务处理)和OLAP(联机分析处理);

Snowplow:企业级网络和事件分析,由Hadoop、Kinesis、Redshift 和Postgres提供技术支持;

SparkR:Spark的R前端;

Splunk:用于机器生成的数据的分析;

Sumo Logic:基于云的分析仪,用于分析机器生成的数据;

Talend:用于YARN、Hadoop、HBASE、Hive、HCatalog和Pig的统一开源环境;

Warp:利用大数据(OS X app)的实例查询工具。

搜索引擎与框架

Apache Lucene:搜索引擎库;

Apache Solr:用于Apache Lucene的搜索平台;

ElasticSearch:基于Apache Lucene的搜索和分析引擎;

Enigma.io:为免费增值的健壮性web应用,用于探索、筛选、分析、搜索和导出来自网络的大规模数据集;

Facebook Unicorn:社交图形搜索平台;

Google Caffeine:连续索引系统;

Google Percolator:连续索引系统;

TeraGoogle:大型搜索索引;

HBase Coprocessor:为Percolator的实现,HBase的一部分;

Lily HBase Indexer:快速、轻松地搜索存储在HBase的任何内容;

LinkedIn Bobo:完全由Java编写的分面搜索的实现,为Apache Lucene的延伸;

LinkedIn Cleo:为一个一个灵活的软件库,使得局部、无序、实时预输入的搜索实现了快速发展;

LinkedIn Galene:LinkedIn搜索架构;

LinkedIn Zoie:是用Java编写的实时搜索/索引系统;

Sphinx Search Server:全文搜索引擎

MySQL的分支和演化

Amazon RDS:亚马逊云的MySQL数据库;

Drizzle:MySQL的6.0的演化;

Google Cloud SQL:谷歌云的MySQL数据库;

MariaDB:MySQL的增强版嵌入式替代品;

MySQL Cluster:使用NDB集群存储引擎的MySQL实现;

Percona Server:MySQL的增强版嵌入式替代品;

ProxySQL:MySQL的高性能代理;

TokuDB:用于MySQL和 MariaDB的存储引擎;

WebScaleSQL:运行MySQL时面临类似挑战的几家公司,它们的工程师之间的合作。

PostgreSQL的分支和演化

Yahoo Everest – multi-peta-byte database / MPP derived by PostgreSQL.

HadoopDB:MapReduce和DBMS的混合体;

IBM Netezza:高性能数据仓库设备;

Postgres-XL:基于PostgreSQL,可扩展的开源数据库集群;

RecDB:完全建立在PostgreSQL内部的开源推荐引擎;

Stado:开源MPP数据库系统,只针对数据仓库和数据集市的应用程序;

Yahoo Everest:PostgreSQL可以推导多字节P比特数据库/MPP。

Memcached的分支和演化

Facebook McDipper:闪存的键/值缓存;

Facebook Memcached:Memcache的分支;

Twemproxy:Memcached和Redis的快速、轻型代理;

Twitter Fatcache:闪存的键/值缓存;

Twitter Twemcache:Memcache的分支。

嵌入式数据库

Actian PSQL:Pervasive Software公司开发的ACID兼容的DBMS,在应用程序中嵌入了优化;

BerkeleyDB:为键/值数据提供一个高性能的嵌入式数据库的一个软件库;

HanoiDB:Erlang LSM BTree存储;