探索中国CIO人才现状 | 第四季调研报告
“大数据”或“小数据” 哪个更好?
2013-05-17  作者:新华网 

  如果你现在还没有加入大数据的阵营,那你想办法弄到一些。毕竟,竞争需要大数据。如果你的数据量很小,你将被竞争对手彻底打败。


  作为顾问和IT公司向企业推销的另一个大项目,在大数据背后的猜想还存在很多问题。幸运的是,诚实的大数据实践者(又称数据科学家)从不放下怀疑态度,并提出了一系列对大数据大肆宣传感到厌倦的理由。如下:


  理由一,即使像Facebook和Yahoo!这样的互联网巨头也并非总是处理大数据,Google风格工具的应用是不合适的。


  Facebook和雅虎运行其巨型集群机(功能强大的服务器集合)来处理数据。必须要进行集群处理是大数据的标志之一。毕竟,在家用PC就能处理的数据不能称为大数据。将业务拆分为小业务,使用一系列的计算机来处理每个小业务的必要性,是类似Google计算世界上每一个网页排名的大数据问题典型特点。


  现在看来,对于Facabook和Yahoo!来说,每个业务都是用同样规模的集群机是不必要的。比如Facebook的情况,工程师提交给集群机的大多数任务都是MB到GB的范围,完全可以在一台计算机甚至笔记本电脑上完成。


  Yahoo!也存在类似的情况,Yahoo!集群机所处理的数据中位数只有12.5GB,通常台式电脑不能处理这种任务,但一台配置较好的服务器完全可以胜任。


  以上观点均提炼于MicrosoftResearch的一篇名为《Nobodyevergotfiredforbuyingacluster》的论文。论文中指出即使是在最渴求数据的公司,多数问题也不必集群处理。因为对于大量问题类型而言,集群是一个相对低效甚至是完全不合适的解决方案。


  理由二,大数据已经成为数据分析的代名词,这种定义是混乱的,并会起到反作用。


  数据分析最早可追溯到为皇家粮仓的所有粮食制表统计,但是现在你必须要在数据前加“大”字,必要的数据分析已经卷入了一场较大但是用处不大的流行风暴中。例如,一篇文章告诫读者“3个步骤将大数据运用到你的小企业中”,其实小企业的数据量谷歌文档就能处理,更不说用笔记本的EXCEL了。


  这就是说,实际上大多数企业处理的数据都是被OpenKnowledgeFoundation的RufusPollock所说的小数据。这很重要,这是一场“革命”,Pollock称。但它与大数据关系不大。


  理由三,超大化你的数据规模正在变成一件得不偿失的事情。


  数据越多就越好吗?不尽然。如果你正在寻找相关方程式——x,y的关系,如何能给我提供有效信息?实际上数据越多,随之而来的麻烦也越大。


  能从大数据中提取的信息会随着数据规模的增加而减少,MichaelWu(社交媒体分析公司Lithium的首席数据分析学家)写道。这意味着越过了某一点后,继续增加数据所产生的边际数据回报率减少到如此地步,收集更多数据仅仅是浪费时间。


  原因之一:数据越“大”,寻找相关性时错误信息会更多。正如数据分析家VincentGranville在《Thecurseofbigdata》(《大数据的诅咒》)中写道的:即使只包括1000个条目的数据集,也很容易会陷入处理几百万个相关分析的处境。“这意味着,”所有这些相关分析,有些可能会高度符合,但这仅仅是一种偶然:如果你使用这种相关分析作为预测模型,结果将会错误“。


  这个错误经常在大数据的原始应用领域之一遗传学中突然出现。对基因组序列有兴趣的科学家苦心找寻其相关性而进行的无休止的研究,最终却得出了各种毫无益处的结果。


  理由四,在某些情况下,大数据会令你茅塞顿开,但也可能会令你陷入困惑。


  公司一旦开始使用大数据,就深陷于一系列艰涩学科的研究中——统计,数据质量,和其他构成“数据科学”的一切。就像那些每天都需要发表出版物的科学,经常会被忽视或是被修正,或是从未被证实,这之中的陷阱实在太多了。


  数据收集方式的偏见,上下文的缺乏,数据聚集的缺口,数据的人工处理模式和整体认知偏差都会导致即使最好的研究人员也可能发现错误的相关模型,麻省理工学院媒体实验室客座教授KateCrawford说:“我们可能会陷入某种算法幻觉中”。换句话说,即使你有大数据,也并非IT部门的任何人都能处理的,他可能需要有博士学位或等量经验。当处理完成后,他们的答案可能是你并不需要“大数据”。


  那么哪个更好——大数据或小数据?


  你的业务需要数据吗?当然需要。但是只有尖头发呆伯特的老板才会像赶时髦一样购买具有所谓重要性的数据规模。在科学领域同样存在着企业使用数据制定决策时固有的问题——数据质量,总体目标以及上下文和直觉的重要性。记住:GregorMendel仅利用一本笔记本的数据就发现了遗传的秘密。重要是数据的质量,而不是数据的规模。