資料窺探(Data Snooping)是同時或反覆測試大量模型、規則、資產或參數後,把同一歷史樣本中最漂亮的結果當成彷彿事前已獨立指定,因而產生的選擇偏誤。
它怎麼運作
即使每個候選都沒有真實優勢,只要測試足夠多,也可能隨機出現歷史冠軍;一旦依成績挑冠軍,它的回測結果就不能再當成單次獨立檢驗。
樣本外資料、walk-forward、事前寫好的假設與多重檢驗控制,都是為了把選模型和評模型分開。
為什麼投資人需要知道
它解釋了為什麼策略樣本內非常漂亮,上線後卻迅速掉隊,即使程式沒有bug。
它和未來資料洩漏相關但不同:資料窺探來自反覆搜尋同一樣本;look-ahead bias是直接使用當時不可得資訊。
一個簡單的市場例子
20組實際上都沒有edge的參數一起競爭,歷史最強的一組被選中,但樣本外明顯惡化。選擇過程本身就放大了信心。
常見誤解
只展示冠軍參數,卻不揭露一共試過多少版本。
同一段歷史既用來選參數、調門檻,又用來做最終驗證。
常見問題
調參一定是資料窺探嗎?
不一定,但調參與最終評價應分開,也要記錄搜尋過程。
什麼是樣本外測試?
使用沒有參與模型選擇或擬合的資料來評價。
walk-forward能完全避免過度擬合嗎?
不能,它改善流程紀律,但整個驗證方法本身仍可能被反覆優化。
僅供教育用途。部分術語在不同國家、機構與市場中的實際用法可能不同。