回測過度配適:別把歷史雜訊當成優勢

反覆試參數、標的與期間,總會碰到一條漂亮曲線。真正的問題是:這個結果能否在**未參與挑選的資料**上維持。

約 19 分鐘偏誤防線含 2 個互動練習
螺旋、大腦和圖表表示過度配適陷阱
學習目標
  • 解釋過度配適與資料探勘偏誤如何產生
  • 區分訓練、驗證與真正的樣本外資料
  • 說明多次嘗試後的「最佳結果」為什麼會偏樂觀
  • 把成本、期間與參數擾動納入穩健性檢查
  • 用簡化規則、事前封存與失效條件描述回測結論的邊界
歷史冠軍可能只是選出來的

20 組參數裡挑最好的一組,真的代表找到規律嗎?

過度配適是規則過度貼合訓練樣本,把雜訊誤認為可重複優勢。嘗試愈多,歷史中出現偶然冠軍的機率就愈高。 從許多候選裡挑歷史冠軍會引入資料窺探

Overfitting Visual Lab

20 組都沒有真正優勢的參數,歷史上總會出現一個『冠軍』

這是一個明確的模擬實驗:20組參數都由雜訊生成,沒有真實 edge。先只看 in-sample,挑最想上線的一組;之後才打開 out-of-sample。

選擇要上線的參數
生活比喻

為一把舊鎖反覆磨鑰匙,不代表能打開下一把鎖

每次卡住就磨掉一點,鑰匙最後會貼合手上那把舊鎖;那些細小的凹槽也可能只屬於這一把鎖。

回測時一邊看答案一邊改規則,也會把偶然的雜訊磨進參數裡。

核心機制

試得越多,偶然的冠軍越容易出現

  1. 1大量嘗試測試許多均線期間、門檻、產業與起訖日期,碰到漂亮結果的機會跟著變多。
  2. 2只看冠軍保留最高指標,忽略全部失敗版本與相近設定。
  3. 3回頭解釋看到結果之後才補上看似合理的機制故事。
  4. 4誤認可重現同一份資料上的漂亮表現被當成新證據,換到新期間可能就失效。
互動練習

增加參數,看偶然的贏家怎麼出現

在沒有預設優勢的虛構序列裡增加可調參數,觀察「最佳結果」如何因為篩選機會變多而變漂亮。

A

參數 ≤ 3

相對典型資料集而言參數很少——更容易推理,也更不容易擬合雜訊。

B

參數 4–8

中等數量的參數——在相信結果之前,值得跨幾個獨立子區間檢查表現。

C

參數 > 8

可調參數很多——相對可用資料,自由參數越多,越容易擬合巧合雜訊而不是真實規律。

事實、解釋、預測、反證

從冠軍曲線回頭數一共試過幾次

01

事實

【虛構練習資料】共測試 50 組參數;最佳組的樣本內指標為 18 練習單位,兩組鄰近參數分別為 3 與 -2,加入虛構成本假設後為 -1。數值僅用來展示多重嘗試偏誤,不是真實績效,也不構成投資建議。

02

解釋

大量嘗試提供了挑中偶然贏家的機會;鄰近參數落差很大、成本後由正轉負,兩件事一起出現,提示規則可能只是貼合特定歷史雜訊。

03

預測(待驗證)

若繼續在同一段舊樣本調參,歷史曲線可能再變漂亮,但換到未參與挑選的資料未必維持;要真的用新的未見樣本跑一次才算驗證。

04

反證

若規則有事前寫下的機制、嘗試次數完整揭露,並在多個未參與調整的期間、較保守的成本假設與參數擾動下都保持相似特徵,才會削弱過度配適的解釋。依序填寫「嘗試總數、是否事前封存、鄰近參數是否同方向、成本後是否維持、判定為穩健/脆弱/資訊不足」。

互動練習

找出偷看答案與隱藏失敗版本的痕跡

核對嘗試總數、規則封存時間、樣本切分、交易成本、參數敏感度與沒有展示的結果,再判斷證據強弱。

A

為了擬合而加參數

研究者為了小幅提升歷史結果而給策略加第九個可調參數,沒有其他理由。純粹因為改善同一資料集擬合而加入、沒有獨立理由的參數,是擬合雜訊的典型訊號。

B

多個子區間一致

研究者用兩個參數、跨二十年多種市場環境測試策略,每個子區間表現一致。多個獨立子區間的一致表現,比單一彙總結果更有說服力。

C

對日期敏感

研究者發現策略歷史表現嚴重依賴測試起訖日期的選擇。對測試窗口極度敏感是警示訊號:結果可能反映雜訊而不是穩健規律。

風險邊界

相信一條回測曲線前,先完成四項檢查

  1. 1揭露搜尋範圍記錄所有參數、版本、期間與篩選次數。只報冠軍,等於讓讀者低估選擇偏誤。
  2. 2切分並鎖住未見樣本訓練樣本用來形成與估計規則,允許調整但要留下嘗試紀錄;驗證樣本只在有限候選之間選擇,反覆查看同樣會被配適;樣本外測試在規則封存後只評估一次,失敗後改完再宣稱通過同一個樣本外測試並不成立。時間序列要依時間先後切分,隨機打散可能讓後期的市場狀態滲入較早資料。
  3. 3加入真實摩擦測試手續費、價差、滑價、延遲與無法成交的情形;費率與稅制請依交易場所、服務機構與法規的最新正式資料查核,並記下查閱日期。
  4. 4擾動規則輕微移動參數與起訖日期,觀察結論是否立刻翻轉,並比較不同市場階段的損益特徵。

參數平台

鄰近設定若結果劇烈翻轉,可能只是精準貼合雜訊。

滾動檢驗

依時間重新估計與前推,觀察不同市場階段的表現差異。

成本壓力

提高價差與滑價假設,檢查優勢是否過度依賴理想成交。

合理機制

事前的機制說明不能證明結果,但能限制任意搜尋的空間。

本課總結

離開前收好三條回測規則

先數嘗試總數

冠軍必須放回全部成功與失敗版本裡一起理解。

樣本外不能邊看邊改

一旦依留出樣本的結果調整規則,它就不再獨立。

穩定比峰值重要

跨期間、成本與參數擾動的穩定性,比單一條漂亮曲線更有資訊;即使全部通過,虧損仍然真實而且可能發生。

知識檢測

檢驗你是否真正理解

確認你能辨認看似嚴謹、實際上重複偷看答案的研究。送出作答後會顯示每一題的原理說明。

第 1 題,共 3 題

研究者看過樣本外結果後調整參數,再用同一區段宣稱通過樣本外,問題在哪裡?

第 2 題,共 3 題

哪一種現象較像過度配適警訊?

第 3 題,共 3 題

桌上有兩個虛構候選規則:甲有 9 個可調參數,全部在同一段三年資料上調出來,彙總結果較好;乙只有 2 個參數,彙總結果偏弱,但在多個不同市場階段的分段上都保持相似特徵。哪一種讀法站得住腳?

認識你的學伴

卡住了?讓 Mira 幫你拆解

Mira 僅處理去識別化的虛構教學情境,不接收真實帳戶、個人資料、資產、委託或成交資料、登入資訊或憑證,也不提供具體標的、方向、數量、時點或個人化指令。回測結果不代表未來成果。

正在檢查登入狀態...