小到敲击键盘、迈开步子,大到征信系统、政务记录,数据已成这个时代最活跃的要素和最有价值的“信息矿产”。无论“互联网+”、物联网还是智能制造,数据的触角几乎无远弗届,影响着几乎所有产业生态未来的走向。
据中国信息通信研究院发布的《大数据白皮书(2016)》分析,未来五年,全球数据量将呈指数级增长。但庞大的总量却并不意味着完全有效的开发利用。《经济参考报》记者采访了解到,除了技术瓶颈外,开放和合作的障碍正在让大量数据陷入“沉睡”。数据原材料的缺乏与信息“孤岛”的形成,严重制约着大数据产业的发展。
壁垒让数据“沉睡”
国际数据公司(IDC)的数据显示,按目前发展趋势,预计2020年全球大数据总存储量将达到44ZB(1ZB约等于10000亿GB)。我国数据总量为909EB(1EB约等于1000亿GB),占全球数据总量的13%。
目前数据层面的壁垒普遍存在于政企、企业间,业内人士表示针对现状普遍是通过购买和“爬虫”(自动获取网页内容的手段)的方式获取,但数据存在不准确、不全和非结构化等问题。
“相比于行业间的数据流通,政企之间的壁垒更是一块沉睡数据的‘集聚地’。”中关村大数据产业联盟秘书长赵国栋说,“目前一些上市数据如股权占比、科研数据都是价值密度比较高的沉睡数据。”
据中国信息通信研究院2015年对国内800多家企业的调研来看, 企业内部数据仍是大数据的主要来源。当前有32%的企业通过外部购买数据;只有18%的企业使用政府开放数据。
业内人士指出,大数据时代的数据资源广泛散布于政府、行业、企业三个子系统中,其中,信息数据资源80%以上掌握在各级政府部门手里。而与此同时,区域部门间基本实现共享的省级地方仅占13%,区域部门间少量实现共享的地市和区县仅占32%和28%,信息共享和业务协同在地市和区县进展缓慢。
“如果更多数据可以开放,将会对产业转型、政务和公共服务效率提升等大有裨益。”上海至信普林科技有限公司总经理顾敏洁说,“比如中国人民银行上海总部自2006年起公开金融信息后,催生了一批金融信息咨询服务公司,其中还有5家上市公司,拉动的就业人数也非常可观。”
数据割据、技术壁垒和标准缺失形成数据孤岛
“数据孤岛的成因主要有三个,数据割据、技术壁垒和标准缺失。”赵国栋说。观念问题是主观意愿缺失的症结。“政府部门由于缺乏企业间基于共同利益开发这样的主观能动性,导致数据开放滞后。除了政府部门,一些大企业也应该认识到数据合理开放可以造就更好的社会和行业生态价值。”
外部管理规范、法规的缺失也使部分主体对开放数据保持顾虑。“目前如果只遵循‘谁的数据谁负责’这一简单的准则,要调动政府部门开放数据的积极性比较困难。”DT大数据产业创新研究院院长陈新河说。
除了主观意愿,技术和标准也是一道“硬门槛”。“比如目前信息共享的安全问题。公共云的运维工作面临着一些新的安全风险和挑战。计算环境从本地到云端的自身安全性是提高了,但由于公共云的运维管理工作必须通过互联网完成,和传统IT环境运维有很大不同,容易造成管理员权限被劫持攻击,造成运维管理账号和凭证泄露等问题。”顾敏洁说。
目前开放的数据同样因为格式标准缺失成了“开放的孤岛”。公布类似停车位数量、开放非标准化的图表等形式的数据都是不可机读的。这类“伪开放”并没有真正整合数据的价值。“不同行业数据整合必然需要标准化的数据格式,比如从卫生、人口的角度用数据对‘人’进行的描述就是不一样的。”全国信息安全标准化技术委员会大数据标准工作组成员张群说。
“因此目前要开放的应该是底层数据,而不仅提供根据数据分析出来的结果或产品。”业内专家表示,这类数据在技术上应该有其标准形式,可以被计算机抓取、调用,而且在法律上也是可以进行各种使用的。