幸存者偏差:被统计漏掉的那部分样本,如何让结论系统性偏乐观
内容由龙太观市 LTIsland Insight原创整理并存证发布,转载/引用请署名并链接原文,详见授权条款。
一份名单看起来成绩亮眼,有时不是因为里面的成员真的出色,而是因为表现最差的那些早就不在名单里了。这篇讲清楚这种偏差从哪来、为什么多取样本也消不掉,以及看到统计结论时该追问什么。
「过去十年年年跑赢基准」的名单之所以看起来令人振奋,有一种可能是:没跑赢的那些,已经不在被统计的范围里了。
是什么
幸存者偏差指的是:统计时只算了「留到最后」的那些样本,中途消失的样本没有进入统计,导致结论系统性地偏向乐观。
关键词是系统性。它不是随机误差——随机误差有正有负,样本取得多了会互相抵消;幸存者偏差被漏掉的恰恰是表现最差的那一部分,方向是固定的,因此把样本扩大并不能让它消失,只会让一个方向一致的偏差看起来更「稳定」。
它也通常不是刻意造假。样本消失往往是自然发生的:退市、清盘、改名、被合并、被剔除出成分名单,事后回头取数时,这些对象在数据库里本来就不容易被取到。不需要有人动手脚,一份默认取数就已经带上了这个偏差。
规则与细节
场景一:回测样本里只有现在还在交易的标的
做历史检验时,如果标的池是「今天仍在正常交易的这些」,那么历史上已经退市、被合并、长期停牌后离场的对象就不在样本里。这些对象在退出前往往经历了最差的一段表现,把它们排除掉,等于事先替这套方法删掉了最坏的情形。回测方法论的坑一篇把它与过拟合、数据窥探并列,正是因为三者都会让检验结果比真实情况好看。
场景二:业绩排行榜与「长期收益」统计
任何按存续产品排出来的名单,天然只包含还在存续的产品。中途清盘、终止运作的那些不再出现在榜单里,它们的成绩也就不会被算进「这一类产品的长期表现」。同一个道理适用于任何以「现存对象」为口径的历史平均值:分母只数了活着的,分子自然偏高。
场景三:指数的历史序列
指数按既定规则定期调整成分,被调出的对象不再影响此后的指数走势。这是指数编制规则的正常运作(见上证指数怎么编),但如果拿指数的长期历史,去论证「买入并持有一篮子标的会得到类似结果」,那么指数替换成分的这个动作本身就构成一道筛选,而个人持有的一篮子并不会自动完成同样的替换——两者不是同一件事。
场景四:成功案例访谈与经验总结
可被采访、可被复盘的对象,都是已经走到能被看见的位置的那些。用同样方法但结果不佳、因而没有留下记录的对象有多少,从公开信息里通常无法知道。这不是说这类经验没有价值,而是说:从中读出的「有效性」,缺少分母。本站公开否决掉的研究(见研究墓地),处理的正是让分母可见这件事。
为什么它比一般误差更难察觉
一般的数据错误会留下痕迹——数值突兀、逻辑对不上、跟别处对不齐。幸存者偏差不留痕迹:剩下的每一条记录本身都是真实、准确、可核对的,问题出在没被记录下来的那部分,而「没有的东西」在数据里不会报错。这与本站反复提到的一类失败同型:不报错的失败,只有主动去问才会暴露。
常见影响或现象
- 看到任何历史统计时,先问样本范围是怎么划的:具体是「历史上曾经存在的全部对象」,还是「截至今天仍然存在的对象」。这两种口径给出的结论可以差得很远,而它们在表述上常常都写成「历史数据显示」。
- 问「中途消失的有多少、去哪了」:如果一份统计完全不提退出的样本,通常不是因为没有,而是因为取数时它们本来就不在。
- 样本量大不能作为反驳理由:幸存者偏差的方向是固定的,扩大样本只会让偏了的结论显得更可靠。判断它有没有发生,要看样本怎么选,不看样本有多大——这一点与样本量与统计显著性讨论的随机波动是两个独立的问题,需要分别检查。
- 对「幸存下来」这件事本身保持敏感:凡是名单、榜单、案例集这类以「现存对象」为单位组织起来的材料,都默认经过了一次筛选。
常见误区
- 「有幸存者偏差」不等于「结论一定是错的」:它说明的是这个结论被高估了,高估多少取决于消失样本的比例与它们的表现,通常无法从现有材料里反推出来。指出偏差的存在,是要求补充样本范围说明,不是直接推翻结论。
- 补全样本并不总是可行:包含已退市、已终止对象的完整历史数据不一定容易取得。诚实的做法是说明样本口径的限制,而不是在无法补全时假装它不存在。
- 它与「只报告好结果」是两回事:只挑成功案例展示,属于选择性呈现;幸存者偏差即使在如实呈现全部手上数据的情况下也会发生,因为问题出在数据被取到之前。两者可以同时存在,处理方式不同。
- 不要把它当成万能的反驳句式:任何统计都可以被质疑「是不是有幸存者偏差」,但有意义的质疑需要指出具体是哪一类样本、以什么机制被漏掉了。泛泛的怀疑不构成论证。
- 本文只介绍方法论概念,不构成任何投资建议,不评价任何具体产品、名单或数据来源,也不针对任何标的给出判断。