阅读历史数据时,很多人习惯直接看:
某一个区间出现了多少次。
例如:
A区间出现12次;
B区间出现8次;
C区间出现10次。
这种比较虽然直观,但如果不同数据使用的样本范围不一样,仅仅比较出现次数,很容易产生误解。
真正更有意义的指标是:
占比。
一、出现次数和占比有什么区别?
出现次数回答的是:
发生了多少次。
占比回答的是:
在全部样本中占多少。
例如:
最近30期中某区间出现12次。
占比就是:
12 ÷ 30 = 40%。
而最近100期中某区间出现30次。
虽然30次明显多于12次,但占比只有30%。
所以:
绝对次数更多,不代表相对比例更高。
二、为什么样本范围非常重要?
如果脱离样本总数,单独看出现次数,意义会变得有限。
例如:
| 样本范围 | 出现次数 | 占比 |
|---|---|---|
| 最近30期 | 12 | 40% |
| 最近50期 | 17 | 34% |
| 最近100期 | 30 | 30% |
从次数看:
100期的30次最多。
但从比例看:
最近30期反而最高。
这说明:
这个区间近期出现得更加集中。
三、30期占比更容易反映近期变化
最近30期样本较少。
因此,只要最近一段时间出现次数发生变化,占比就会比较明显。
这也是为什么短周期更适合观察:
近期区间变化;
短期集中;
当前阶段是否发生偏移。
但它也容易受到少量数据影响。
因此,不能单独依靠30期得出长期判断。
四、50期适合判断变化是否持续
如果最近30期某区间占比明显提高,可以继续看最近50期。
如果50期的占比也同步提高,说明:
变化可能已经持续一段时间。
如果50期仍接近长期水平,则说明:
当前变化可能主要集中在最近阶段。
五、100期可以提供长期背景
100期最大的价值,是帮助判断:
当前区间占比在更长历史中是否常见。
例如:
最近30期占比40%;
100期长期占比29%。
可以描述为:
近期该区间占比高于长期水平。
这种说法比:
“这个区间最近很热”
更加客观清晰。
六、区间应该怎么划分?
区间划分需要保持一致。
例如可以按照:
低区间;
中区间;
高区间。
如果今天使用一种区间范围,明天又换另一种划分方式,数据之间就很难进行比较。
因此,长期阅读时应该尽量保持:
统计口径一致。
七、占比变化多大才值得关注?
没有一个适用于所有数据的固定标准。
更合理的方法是:
和该指标自己的长期历史比较。
例如:
长期占比通常在28%—32%之间。
近期提高到45%。
这就比:
从30%提高到32%
更加值得记录。
因此,不应该只看:
“有没有变化。”
还应该看:
变化幅度有多大。
八、占比高不等于未来更容易继续出现
这是区间占比最容易被误解的地方。
某一区间最近30期占比很高,只能说明:
过去30期中,该区间出现得比较多。
不能进一步推出:
未来还会继续高频。
同样,占比低也不能说明:
未来一定回升。
历史比例是结果描述,不是未来保证。
九、多个区间应该同时看
如果只看一个区间,很容易忽略整体结构。
例如:
A区间占比提高;
B区间下降;
C区间基本不变。
这其实比单独看A区间更加完整。
因此,可以同时记录:
各区间占比;
哪个区间变化最大;
哪些区间基本稳定。
十、占比和分布范围有什么区别?
占比回答:
某个区间占全部样本多少。
分布范围回答:
全部数据覆盖多大的范围。
两者不是同一个指标。
例如整体范围很宽,但大部分数据仍然可能集中在中间区间。
因此,阅读历史数据时,最好把:
占比
和
分布范围
结合起来看。
十一、异常值会不会影响区间占比?
会,但影响程度取决于样本数量。
例如最近30期中出现3个异常数据。
这3个数据已经占10%。
如果是100期样本,同样3个异常只占3%。
因此:
小样本的占比变化更容易受到少量数据影响。
这也是为什么需要多周期对比。
十二、一个简单的区间占比阅读方法
可以按照下面顺序:
确定统一区间;
统计每个区间出现次数;
计算或查看占比;
比较最近30期;
再看50期;
最后对比100期;
找出近期与长期差异最大的区间。
这样就能够把单纯的“次数统计”,变成更加完整的比例阅读。
总结
历史数据中的区间占比,不应该只看出现次数。
更加完整的方法应该同时结合:
样本数量、出现次数、所占比例和不同周期。
尤其是在比较最近30期、50期和100期时,占比能够帮助我们更清楚地看到:
哪些变化属于近期,哪些状态在长期中更加稳定。
福码云数将持续整理公开数据、历史样本和图表学习内容,为用户提供更加清晰的数据阅读方式。
本文仅用于公开数据整理、统计学习、历史资料查阅和图表阅读,不构成任何预测、投注或其他形式的建议。
相关阅读:
/data-research/
/trend/
/articles/
继续阅读相关栏目
本平台内容仅用于公开数据整理、统计学习、趋势观察和图表阅读,不构成任何形式的建议。