数据是不会撒谎的,但它只能展示出有数据的那部分信息,而无法展示没有数据的那部分信息,它是片面的。
数据不会骗人,但他会坑人。数据真正的价值并不在于其统计或计算结果,而在于人们能对其做出正确的解读。不过这很困难,尤其当你面对的是残缺的数据。
据《2017社会大学英雄榜》显示,国内登上胡润百富榜的2000多位资产超二十亿的富豪中,有一半的人都是低学历。(PS,低学历是指本科以下的学历)
请问:从这条新闻中你能读出什么结论?
我想肯定有很多人会认为:学历的高低跟收入的确没什么关系。
然而,这种解读是错的。
正确的解读方式是什么呢?
应该是:中国在2016年末大约有13.8亿人口,其中本科及以上的只有3800万,本科以下则有13.42亿——低学历的人本来就比高学历的人多得多(35倍),而它们进入榜单的人数基本相同。因此,拥有高学历的人进入百富榜的概率,是低学历的35倍。
在这个例子中,所有的数据都是真实的。但如果你只看到一部分数据,而没有看到其他数据,那就很容易被数据给坑了,得出错误的结论。
当然,要想得出更加准确的结论,这里还需挖掘更多的数据。比如:
富豪们的年龄分布。毕竟不同年龄段人群的学历分布是不一样的;所属行业的分布。毕竟不同行业对学历的要求与相关程度是不一样的;在这些富豪中,高学历的收入与低学历的收入的总体对比情况…
嗯,如果你不是专门学统计的,相信在加入这么多因素之后,一定会崩溃掉…不过你也不用慌,因为大部分情况下,你根本就没有机会能知道这么详尽的数据。
包括以数据著称的新零售。为什么大部分新零售项目仍然在亏钱?其实就是因为它们的规模还没有达到一定的量,数据的维度依然比较单一,“算”出来的东西依然不够精准,所以效率的提升也就很有限了。
把某一类型数据当做全部数据,导致分析结果错误二战时英国空军希望增加飞机的装甲厚度,但如果全部装甲加厚则会降低灵活性,所以最终决定只增加受攻击最多部位的装甲。后来工作人员经过对中弹飞机的统计,发现大部分飞机的机翼弹孔较多,所以决定增加机翼的装甲厚度。直到后来一个专家说:“可是机头中弹的那些飞机就没有飞回来。”
这个故事里本应是对全部飞机进行分析,但统计样本没有包含已经损毁的飞机,所以得出的结论只是根据部分数据,或者说是根据具有同样特征(受伤)的某一类数据推论出的,并不能代表全部类型的数据,所以得出的结果很可能是错误的。
鲜明事件让我们夸大了偶然因素富士康N连跳,大家都觉得这么多人跳楼,富士康肯定太黑暗了,但大家却没有注意富士康员工大概有37万人,按12连跳的话自杀率不到十万分之四,而全国的平均自杀率为十万分之十五, N连跳自杀率远低于全国自杀率,可见富士康12连跳实际上是一个社会问题,而不仅仅是一个企业的问题,我们太过注重鲜明的事实却忽略了背后整体的概率。
太过鲜明的偶然事件会让我们忽略背后一直存在的整体概率。看到这种数据的时候,不要太过情绪化,你所看到的数据或事件可能只是个例,并不能代表大多数,可以去查查历史情况或平均情况,去找找沉默的用户或数据,切忌轻易就做出判断和决定。要理性看待这些偶然事件,既不盲目跟随,也不对此嗤之以鼻,在明确整体概率的情况下,剔除偶然因素,分析这些偶然事件背后是否存在着某些值得借鉴的地方,从而吸收到自己产品或项目中,以便使自己的产品或要处理的事情有可能成为市场中下一个“偶然事件”。
数据是客观的,但是,解读数据的人是主观的。
只有正确的认识数据,才能正确的利用数据。
本文素材来源于网络,版权归相关权利人所有,如有侵权,请联系删除。