回测不是水晶球
理解回测是把规则应用到历史数据检查过去表现和风险特征,但不能证明未来一定赚钱,且忽略成本会高估表现。
量化最危险的错觉之一,是“模型越来越复杂,回测越来越漂亮,所以我越来越接近真相”。现实可能正好相反:你只是给旧数据量身定做了一件衣服。换到新时期,它立刻不合身。

过拟合发生在规则过度贴合训练样本,把噪音当成可重复规律。测试的自由度越高、尝试次数越多,历史里偶然出现“冠军”的概率就越大。 从许多候选里挑历史冠军会引入数据窥探。
这是一个明确的模拟实验:20组参数都从噪音生成,没有真实 edge。先只看 in-sample 表现,挑你最想上线的一组;然后才打开 out-of-sample。
选择要上线的参数即使所有规则都没有真正优势,只要测试次数足够多,也可能出现几条异常漂亮的历史曲线。如果只展示冠军、不告诉别人一共试过多少次,就很容易把偶然结果当成发现。
参数并不是越少越好,复杂问题确实可能需要复杂模型。真正的问题是:每个参数有没有独立理由和足够数据支撑,还是只是因为“这样调历史更赚钱”才被加进去。
| 参数加入原因 | 风险 |
|---|---|
| 来自明确机制或业务约束 | 仍需检验,但至少有独立于历史冠军结果的理由 |
| 只因为让同一段回测更漂亮 | 非常容易把该样本独有的噪声写进模型 |
保留试过的参数、数据区间、失败结果和调整原因,不是为了把研究日志写成史诗,而是为了让后来的人能判断到底搜索了多大空间。AI 和自动化让试验速度暴涨,也让这个问题更加严重。
只检验过拟合和稳健性检查。
正在检查登录状态...