什么是数据窥探?

数据窥探是反复在同一历史样本里寻找表现最好的规则,再把这个冠军当成独立证据所产生的偏差。

MyTrade Academy
4 分钟阅读

数据窥探(Data Snooping)是同时或反复测试大量模型、规则、资产或参数后,把同一历史样本里最漂亮的结果当成好像事前已经独立指定一样,从而产生的选择偏差。

它是怎么运作的

即使每个候选都没有真正优势,只要测试足够多,也可能随机出现一个历史冠军;一旦按成绩选冠军,它的回测结果就不能再按单次独立检验来理解。

样本外数据、walk-forward、事前写好的假设和多重检验控制,都是为了把“选择模型”和“评价模型”分开。

为什么交易者需要知道

它解释了为什么策略在样本内极其漂亮,上线后却迅速掉队,即使代码本身没有bug。

它与未来数据泄漏相关但不同:数据窥探来自反复搜索同一样本;look-ahead bias是直接使用当时尚不可得的信息。

一个简单的市场例子

20组实际上都没有edge的参数一起竞争,历史最强的一组被选中,但样本外表现明显恶化。问题不仅在参数,而在选择过程本身。

常见误区

只展示冠军参数,却不披露总共试了多少版本。

同一段历史既用来选参数、调阈值,又用来当最终验证。

常见问题

调参一定是数据窥探吗?

不一定,但要把调参与最终评价分开,并记录搜索过程。

什么是样本外测试?

用没有参与模型选择或拟合的数据进行评价。

walk-forward能完全避免过拟合吗?

不能,它提高纪律,但整个验证流程本身也可能被反复优化。

仅供教育用途。部分术语在不同国家、机构和市场中的具体口径可能不同。

回到真实课程理解它

第 44 课用真实市场事件把这个术语放回完整的分析逻辑中。

打开第 44 课