数据口径与可复现性:同一个指标,为什么不同来源算出来的数字不一样
内容由龙太观市 LTIsland Insight原创整理并存证发布,转载/引用请署名并链接原文,详见授权条款。
同一只标的、同一天、同一个指标,两个地方给出的数字对不上——这经常不是谁算错了,而是两边在算之前做了不同的取舍。这篇讲清楚口径差异从哪几个环节产生,以及「可复现」这个要求到底在要求什么。
两个地方给出的同一个指标数字对不上时,第一反应通常是「哪个是对的」——但更常见的答案是:两个都对,只是算之前的取舍不同。
是什么
口径指的是一个数字在被算出来之前所做的一系列取舍:用哪一段数据、怎么处理特殊情形、中间步骤选哪种算法。这些取舍每一个都合理,但换一组就会得到另一个数字。
可复现指的是:把口径完整说明之后,另一个人按同样的说明重新算一遍,能得到同一个数字。
两者的关系是:口径决定了数字是什么,可复现性决定了这个数字能不能被检验。一个没有口径说明的数字,既不能被证实也不能被证伪,它只能被相信或者不相信——而这正是本站反复要避开的位置。
规则与细节
环节一:价格序列本身要不要复权
发生分红、送转之后,价格会在除权除息日出现一次跳变,这个跳变来自权益的分离,不是交易造成的涨跌(机制见除权除息与分红送转)。为了让前后价格可比,通常会对历史序列做复权处理,把这次跳变还原掉。问题在于复权有不止一种做法:可以把历史价格往回调整、也可以把此后价格往前调整,处理分红的方式也有差别。不同做法算出来的历史涨跌幅并不相同,而任何以价格序列为输入的指标,都会一路把这个差异带下去。用未复权序列直接算长期涨跌幅,则会把权益分离当成下跌,这是更明显的一种口径错配。
环节二:时间窗口怎么取
「近一个季度」是按交易日数还是按自然日算、起点含不含当日、遇到停牌与休市如何顺延——这些取法都常见,且各自都说得通。窗口边界差一两个位置,在波动较大的时段可以让结果明显不同。「近期」「过去一段时间」这类表述如果不落到具体取法上,本身就是没有口径的。
环节三:样本范围怎么划
算一个横截面上的统计量时,样本池是「全部标的」还是「剔除某些情形之后的标的」,会直接改变结果。常见的剔除项包括停牌、上市不满一定期限、以及处于特别处理状态的对象(见ST与退市)。每一种剔除都有其理由,但剔除本身就是一次筛选——如果剔除的同时没有说明,读者无法判断结论适用于哪个范围。这里与幸存者偏差直接相邻:样本范围的划法,正是那种不会报错的差异。
环节四:中间步骤的选择
取平均是简单平均还是按规模加权、缺失值是跳过还是用前值补上、极端值要不要处理、小数在哪一步取舍——这些步骤单看都是技术细节,叠加起来足以让两条结论指向不同方向。越是多步骤的复合指标,口径分歧的空间越大,因为每一步的取舍都会往后传递。
可复现要求的是什么
可复现不要求结论正确,只要求结论的来路可以被检查:数据取自哪里、口径如何、每一步做了什么处理,写清楚到另一个人能重走一遍。这个要求听起来低,但它把「这个数字是怎么来的」从不可讨论变成可讨论——一旦可以重走,口径里的取舍就会暴露在外,是否合理就能被单独评估,而不是被结论的漂亮程度掩盖过去。
常见影响或现象
- 看到一个数字,先找口径说明:数据取自哪里、覆盖哪一段、样本怎么划、有没有做复权处理。这几项缺任何一项,这个数字都无法与别处的数字直接比较。
- 不同来源的数字对不上时,先假设是口径差异:直接判断「哪个错了」通常没有依据,而找出两边在哪一步分岔了,往往能同时解释差异的方向和大小。
- 跨来源拼接数字要格外小心:把一个来源的分子配上另一个来源的分母,即使两边各自都准确,得到的比值也可能没有意义。
- 可复现是必要条件,不是充分条件:一份口径写得清清楚楚的研究,结论仍然可能是错的——口径本身可能选得不合适,或者数据源头就有问题。可复现保证的是能被检查,不保证检查一定通过。
常见误区
- 口径不同不等于有一方算错:多数情况下两边都在各自的口径内算对了。把口径差异当成错误来争论,会错过真正该讨论的问题——哪一种口径更适合当前要回答的问题。
- 「用的是官方数据」不能替代口径说明:同一份原始数据,经过不同的处理步骤同样会得到不同结果。数据来源权威,不代表加工过程被说清楚了。
- 口径一旦改变,历史序列不再前后可比:统计口径本身也会修订,修订前后的数字直接接在一起看,会把口径变化读成真实变化。会计上对这类情形另有一套专门的处理规则,同样是为了让口径变化不被误读成经营变化。
- 本文不评价任何具体数据来源、行情软件或数据服务商的优劣,也不推荐使用其中任何一种;文中提到的差异是口径设计的正常结果,不针对任何一方。
- 本文只介绍方法论概念,不构成任何投资建议,不针对任何具体标的或指标给出判断。