或许我们需要的是“智能遗忘”:让我们的工具变得更会放弃最近的过去,从而在整体视角上保持更大的连续性。这有点像是重新组织一本相片簿,尽管加上了更多的 数学方法。什么时候两百万张照片的价值比两千张照片更低?什么时候较大的样品覆盖的范围反而较小?什么时候细节水平能提供有用的质疑证据,而不是虚假的自信?
许多数据集是无法缩减的,而且在完整的情况下才最宝贵,比如,基因序列、人口统计学数据、地理和物理学的原始观测数据等。科学性越弱,数据规模与数据的质量更可能呈现负相关,此时时间本身就成为更加重要的过滤工具。我们如果不仔细选择过去保存下来的有价值、有意义的东西,那它们就会悄无声息地淹没在如今日益增长的噪音之中。
今天的企业、个人和政府机构都能够获得比以往(甚至就在几年前)大许多数量级的数据,但这些数据并没有获得更多的处理时间。利用越来越高效的工具,董事会成员、首席执行官、政府官员等决策者可以就已有的信息提出更有意义的问题。单纯的堆积不是问题的答案。在一个数据量越来越大的时代,如何选择不知道哪些事情,与选择做什么事情一样重要。