LTIsland Insight龙太观市 · LTIsland Insight
← 回看盘基础

样本量与统计显著性:为什么「试了很多次都对」不等于发现了规律

内容由龙太观市 LTIsland Insight原创整理并存证发布,转载/引用请署名并链接原文,详见授权条款

一个方法连着几次都说对了,感觉上就像发现了规律。但「几次都对」和「这个方法真的有效」之间,隔着样本量和随机性两道坎——这篇讲清楚这两道坎是什么。

抛一枚公平的硬币十次,出现七次正面并不稀奇——那么一个方法「十次对了七次」,凭什么说它有效?

是什么

样本量指的是一次检验中用到的观测次数。统计显著性则是一套用来回答这个问题的工具:观察到的这个结果,有多大可能只是随机波动碰巧造成的?

两者的关系是整个话题的核心:同一个观察结果,在不同的样本量下,说服力完全不同。十次里对七次,和一千次里对七百次,表面上是同一个比例,但后者几乎不可能是随机造成的,前者则很容易。

规则与细节

第一道坎:小样本里,随机波动本身就能制造出「规律」的外观

用硬币做直觉参照:抛一枚公平的硬币十次,出现七次或更多正面并不是什么罕见的事,随手试几轮就可能碰上一次。如果此时把这十次结果当成「这枚硬币偏向正面」的证据,就是被随机波动骗了。换成一千次,如果仍然出现七成正面,那就几乎不可能用随机来解释了——同样的偏离幅度,在大样本下才具备说服力。

这个道理直接对应到策略与信号的检验上:任何方法在短期内连续正确,都不足以区分「它真的有效」与「它恰好赶上了一段顺风」。要区分这两者,靠的不是结果看起来多漂亮,而是样本量是否足以让随机解释站不住脚。

第二道坎:多重比较——试的次数越多,越容易「碰」出一个好结果

如果同时检验几十上百个想法,即使这些想法全都无效,纯粹靠运气也会有一部分呈现出漂亮的结果。这是概率的必然,不是运气特别好。问题在于,事后只把那个漂亮的结果拿出来展示、不提还试过多少个失败的,读者看到的就是一个被严重高估的结论。这个现象在方法论讨论里被称为「多重比较问题」,也常被形容为「数据窥探」。

因此,判断一个检验结论时,「一共试了多少个想法」跟「这个想法的结果多好」同等重要——只报告后者、隐去前者,结论是无法评估的。本站把否决掉的研究一并公开(见研究墓地),处理的正是这个问题的一部分:让分母可见。

显著性水平的直觉含义

研究中常见的做法,是设定一个门槛(学界常用的惯例门槛是5%),意思大致是:如果这个效应其实不存在,那么观察到当前这么强的结果的可能性低于这个门槛,因此倾向于认为效应不是随机造成的。要注意这只是一个约定俗成的惯例门槛,不是自然界的分界线,也不代表「有95%的把握结论正确」——这是对显著性最常见的一种误读。

常见影响或现象

  • 看到任何「有效性」宣称时,第一个该问的是样本量:没有样本量的效果宣称,无法判断它是规律还是巧合,这跟宣称的数字看起来多好无关。
  • 第二个该问的是「一共试了多少」:只展示成功案例的内容源,其成功率无法评估——分子可见、分母不可见的比例是没有意义的。
  • 统计工具的作用是划定「不能说什么」的边界:它不能证明某个方法有效,只能帮助排除「这个结果可以简单用随机解释」这种可能性,这是它能力的上限。

常见误区

  • 「统计显著」不等于「有实用价值」:样本量足够大时,一个非常微小的效应也可能达到统计显著。但微小的效应在扣除交易成本、冲击成本之后,可能什么都不剩。显著性回答的是「这是不是随机造成的」,不回答「这个效应大不大、够不够用」,两个问题必须分开看。
  • 「不显著」不等于「证明无效」:样本量不足时,一个真实存在的效应也可能检验不出来。「没有发现效应」与「证明效应不存在」是两个不同强度的结论,前者远弱于后者,不宜互相替换。
  • 把显著性水平读成「结论正确的概率」是常见误读:它描述的是「假设效应不存在的前提下,观察到这种结果的可能性」,不是「结论正确的把握程度」,两者不能划等号。
  • 历史样本再大,也不保证未来:所有基于历史数据的统计检验,前提都是「未来与历史在结构上相似」。市场制度、参与者结构、交易规则发生变化时,这个前提本身就可能不成立——统计工具无法检验它自己的前提,过去不代表未来。
  • 本文只介绍方法论概念,不构成任何投资建议,也不针对任何具体标的或策略给出评价。