Brooklyn:用于简化应用程序部署和管理的库;
Buildoop:基于Groovy语言,和Apache BigTop类似;
Cloudera HUE:和Hadoop进行交互的Web应用程序;
Facebook Prism:多数据中心复制系统;
Google Borg:作业调度和监控系统;
Google Omega:作业调度和监控系统;
Hortonworks HOYA:可在YARN上部署HBase集群的应用;
Marathon:用于长期运行服务的Mesos框架。
应用程序
Adobe spindle:使用Scala、Spark和Parquet处理的下一代web分析;
Apache Kiji:基于HBase,实时采集和分析数据的框架;
Apache Nutch:开源网络爬虫;
Apache OODT:用于NASA科学档案中数据的捕获、处理和共享;
Apache Tika:内容分析工具包;
Argus:时间序列监测和报警平台;
Countly:基于Node.js和MongoDB,开源的手机和网络分析平台;
Domino:运行、规划、共享和部署模型——没有任何基础设施;
Eclipse BIRT:基于Eclipse的报告系统;
Eventhub:开源的事件分析平台;
Hermes:建于Kafka上的异步消息代理;
HIPI Library:在Hadoop’s MapReduce上执行图像处理任务的API;
Hunk:Hadoop的Splunk分析;
Imhotep:大规模分析平台;
MADlib:RDBMS的用于数据分析的数据处理库;
Kylin:来自eBay的开源分布式分析工具;
PivotalR:Pivotal HD / HAWQ和PostgreSQL中的R;
Qubole:为自动缩放Hadoop集群,内置的数据连接器;
Sense:用于数据科学和大数据分析的云平台;
SnappyData:用于实时运营分析的分布式内存数据存储,提供建立在Spark单一集成集群中的数据流分析、OLTP(联机事务处理)和OLAP(联机分析处理);
Snowplow:企业级网络和事件分析,由Hadoop、Kinesis、Redshift 和Postgres提供技术支持;
SparkR:Spark的R前端;
Splunk:用于机器生成的数据的分析;
Sumo Logic:基于云的分析仪,用于分析机器生成的数据;
Talend:用于YARN、Hadoop、HBASE、Hive、HCatalog和Pig的统一开源环境;
Warp:利用大数据(OS X app)的实例查询工具。
搜索引擎与框架
Apache Lucene:搜索引擎库;
Apache Solr:用于Apache Lucene的搜索平台;
ElasticSearch:基于Apache Lucene的搜索和分析引擎;
Enigma.io:为免费增值的健壮性web应用,用于探索、筛选、分析、搜索和导出来自网络的大规模数据集;
Facebook Unicorn:社交图形搜索平台;
Google Caffeine:连续索引系统;
Google Percolator:连续索引系统;
TeraGoogle:大型搜索索引;
HBase Coprocessor:为Percolator的实现,HBase的一部分;
Lily HBase Indexer:快速、轻松地搜索存储在HBase的任何内容;
LinkedIn Bobo:完全由Java编写的分面搜索的实现,为Apache Lucene的延伸;
LinkedIn Cleo:为一个一个灵活的软件库,使得局部、无序、实时预输入的搜索实现了快速发展;
LinkedIn Galene:LinkedIn搜索架构;
LinkedIn Zoie:是用Java编写的实时搜索/索引系统;
Sphinx Search Server:全文搜索引擎
MySQL的分支和演化
Amazon RDS:亚马逊云的MySQL数据库;
Drizzle:MySQL的6.0的演化;
Google Cloud SQL:谷歌云的MySQL数据库;
MariaDB:MySQL的增强版嵌入式替代品;
MySQL Cluster:使用NDB集群存储引擎的MySQL实现;
Percona Server:MySQL的增强版嵌入式替代品;
ProxySQL:MySQL的高性能代理;
TokuDB:用于MySQL和 MariaDB的存储引擎;
WebScaleSQL:运行MySQL时面临类似挑战的几家公司,它们的工程师之间的合作。
PostgreSQL的分支和演化
Yahoo Everest – multi-peta-byte database / MPP derived by PostgreSQL.
HadoopDB:MapReduce和DBMS的混合体;
IBM Netezza:高性能数据仓库设备;
Postgres-XL:基于PostgreSQL,可扩展的开源数据库集群;
RecDB:完全建立在PostgreSQL内部的开源推荐引擎;
Stado:开源MPP数据库系统,只针对数据仓库和数据集市的应用程序;
Yahoo Everest:PostgreSQL可以推导多字节P比特数据库/MPP。
Memcached的分支和演化
Facebook McDipper:闪存的键/值缓存;
Facebook Memcached:Memcache的分支;
Twemproxy:Memcached和Redis的快速、轻型代理;
Twitter Fatcache:闪存的键/值缓存;
Twitter Twemcache:Memcache的分支。
嵌入式数据库
Actian PSQL:Pervasive Software公司开发的ACID兼容的DBMS,在应用程序中嵌入了优化;
BerkeleyDB:为键/值数据提供一个高性能的嵌入式数据库的一个软件库;
HanoiDB:Erlang LSM BTree存储;