大数据可能是现在最炙手可热的技术名词了。热就意味着有泡沫,有值得反思的地方。Quartz的Christopher Mims 5月6日发表了一篇文章,名为“大多数数据都不大,假装大数据其实是瞎浪费钱”,有理有据,推荐一读。以下为译文:
如果你现在还没有加入大数据的阵营, 那你想办法弄到一些。毕竟, 竞争需要大数据。如果你的数据量很小, 你将被竞争对手彻底打败。
作为顾问和 IT公司向企业推销的另一个大项目,在大数据背后的猜想还存在很多问题。幸运的是,诚实的大数据实践者(又称数据科学家)从不放下怀疑态度, 并提出了一系列对大数据大肆宣传感到厌倦的理由。如下:
理由一,即使像Facebook和Yahoo!这样的互联网巨头也并非总是处理大数据,Google风格工具的应用是不合适的。
Facebook和雅虎运行其巨型集群机(功能强大的服务器集合)来处理数据。必须要进行集群处理是大数据的标志之一。毕竟,在家用PC就能处理的数据不能称为大数据。将业务拆分为小业务,使用一系列的计算机来处理每个小业务的必要性,是类似Google计算世界上每一个网页排名的大数据问题典型特点。
现在看来,对于Facabook和Yahoo!来说,每个业务都是用同样规模的集群机是不必要的。比如Facebook的情况,工程师提交给集群机的大多数任务都是