什麼是資料窺探?

資料窺探是反覆在同一歷史樣本尋找最佳規則,再把這個冠軍當成獨立證據所產生的偏誤。

MyTrade Academy
4 分鐘閱讀

資料窺探(Data Snooping)是同時或反覆測試大量模型、規則、資產或參數後,把同一歷史樣本中最漂亮的結果當成彷彿事前已獨立指定,因而產生的選擇偏誤。

它怎麼運作

即使每個候選都沒有真實優勢,只要測試足夠多,也可能隨機出現歷史冠軍;一旦依成績挑冠軍,它的回測結果就不能再當成單次獨立檢驗。

樣本外資料、walk-forward、事前寫好的假設與多重檢驗控制,都是為了把選模型和評模型分開。

為什麼投資人需要知道

它解釋了為什麼策略樣本內非常漂亮,上線後卻迅速掉隊,即使程式沒有bug。

它和未來資料洩漏相關但不同:資料窺探來自反覆搜尋同一樣本;look-ahead bias是直接使用當時不可得資訊。

一個簡單的市場例子

20組實際上都沒有edge的參數一起競爭,歷史最強的一組被選中,但樣本外明顯惡化。選擇過程本身就放大了信心。

常見誤解

只展示冠軍參數,卻不揭露一共試過多少版本。

同一段歷史既用來選參數、調門檻,又用來做最終驗證。

常見問題

調參一定是資料窺探嗎?

不一定,但調參與最終評價應分開,也要記錄搜尋過程。

什麼是樣本外測試?

使用沒有參與模型選擇或擬合的資料來評價。

walk-forward能完全避免過度擬合嗎?

不能,它改善流程紀律,但整個驗證方法本身仍可能被反覆優化。

僅供教育用途。部分術語在不同國家、機構與市場中的實際用法可能不同。

回到真實課程理解它

第 44 課用真實市場事件把這個術語放回完整的分析邏輯中。

開啟第 44 課