在查看历史数据的时候,很多人首先看到的是一连串具体数字。
但当样本数量逐渐增加以后,只看单个数据点就会变得越来越困难。
这个时候,数据分布图的作用就体现出来了。
它能够把大量历史样本按照一定方式整理出来,让我们更加直观地看到:
数据主要集中在哪些位置、不同区间之间有什么差别,以及最近的变化放在长期历史中处于什么位置。
不过,第一次查看数据分布图时,也很容易出现一个问题:
信息很多,却不知道应该先看哪里。
比较简单的方法,是按照固定顺序进行阅读。
一、先确定数据的整体范围
打开一张数据分布图以后,第一步不是寻找某个特别突出的数据,而是先观察:
整组数据大概分布在哪个范围。
例如一组历史样本可能主要出现在中间区域,只有少部分数据出现在两侧。
也可能整体分布比较平均,没有特别明显的集中区域。
这一步的目的,是先建立整体背景。
只有知道大部分数据通常位于什么位置,后面看到某个较高或者较低的数据时,才知道它在整个历史范围中意味着什么。
因此,可以先回答三个问题:
数据主要覆盖哪些区间?
哪些区间样本数量比较多?
哪些区间长期出现得比较少?
把整体范围看清楚以后,再继续观察细节。
二、再看数据是否存在明显集中区域
数据并不一定平均分布。
有时候,一部分区域会明显比其他区域出现得更频繁。
这就是观察数据集中度的意义。
例如可以把整个范围分成几个区域,再分别统计各个区域的样本数量。
如果大部分数据长期集中在中间区域,那么可以描述为:
历史样本主要集中在中间区间。
如果不同区域之间数量比较接近,则可以描述为:
整体分布相对均衡。
需要注意的是:
集中并不代表未来一定会继续集中。
这里观察的是已经发生的历史数据,而不是利用历史结果推断未来结果。
三、观察不同周期下分布有没有变化
单独看一张分布图,只能够看到某一个观察范围里的情况。
如果想进一步理解变化,就可以比较不同周期。
例如分别观察:
最近30组、最近50组和最近100组。
假设100组数据整体分布比较均衡,但最近30组明显集中在某一个区域。
这时候比较合理的描述是:
近期样本出现了一定程度的局部集中,但长期分布仍然相对平稳。
如果30组、50组和100组都呈现类似状态,则说明这种分布特征持续的时间相对更长。
因此,多周期观察能够帮助我们区分:
近期变化和长期状态。
四、再看波动是否扩大或缩小
除了数据集中在哪些区域,还可以观察数据分布范围是否发生变化。
例如:
早期数据主要集中在较窄范围;
后来逐渐扩展到更大的范围。
这种情况下,可以描述为:
样本波动范围有所扩大。
相反,如果历史数据原本分布比较分散,而近期逐渐集中,也可以描述为:
近期样本分布范围有所收窄。
这里关注的不是某一个数字,而是整个分布形态发生了怎样的变化。
五、异常点应该单独看,但不要放大
数据图中经常会出现一些明显偏离主要区域的数据。
这类数据通常比较醒目。
但异常点并不一定意味着整体结构发生改变。
比较合理的方法是继续观察:
它只是单次出现,还是连续出现?
过去是否也曾出现过类似数据?
在更长周期中,这类数据出现频率如何?
如果只是偶尔出现一次,就没有必要因为一个数据点改变对整体分布的理解。
因此:
先看整体,再看异常。
通常比先寻找异常点更容易得到清晰的数据认识。
六、把分布图与趋势图结合起来看
数据分布图回答的是:
数据主要出现在哪里。
趋势图回答的则更多是:
这些数据按照时间顺序发生了怎样的变化。
两种图表结合起来,会比单独观察一种图表获得更多信息。
例如:
分布图显示某个区域样本较多;
趋势图则可以继续观察这些数据主要集中在哪一个阶段。
这样就可以进一步判断:
这是长期持续存在的分布特点,还是某个时间阶段形成的局部现象。
七、适合初学者的阅读顺序
如果刚开始接触数据分布图,可以使用下面这套简单顺序:
看整体数据范围。
看主要集中区域。
比较30、50、100组。
观察分布范围扩大还是缩小。
查看异常数据。
结合趋势图观察时间变化。
长期使用固定的阅读方式,可以让复杂图表逐渐变得更加容易理解。
总结
数据分布图最重要的作用,并不是从大量历史数据中寻找某一个特殊数字。
它真正能够帮助我们看到的是:
整体范围、集中程度、周期差异、波动变化和异常位置。
把这些信息按照固定顺序进行整理,就能够逐渐建立更加完整的数据阅读习惯。
福码云数持续整理公开数据、历史样本与图表学习内容,希望通过更加直观的数据展示方式,为用户提供长期的数据观察和知识阅读入口。
本文内容仅用于公开数据整理、统计学习、趋势观察和图表阅读,不构成任何形式的建议。
相关阅读:
继续阅读相关栏目
本平台内容仅用于公开数据整理、统计学习、趋势观察和图表阅读,不构成任何形式的建议。