可复现研究:不要只保存一张漂亮图,要保存它是怎么长出来的

一张收益曲线可以截图,一段 AI 总结可以复制,但这些都不是研究过程。真正可复现的研究,要让另一个人知道你问了什么、用了哪版数据、跑了哪段代码、试了哪些参数,以及哪些结果失败了。这样分歧才有地方可以检查。

约 14 分钟AI 量化交易初探 · 收官核心:研究证据链
清单、放大镜和指南针表示可复现研究流程
学习目标
  • 理解可复现研究需要保存哪些关键版本
  • 区分可复现与结论正确
  • 理解 AI 参与研究时也必须记录输入和核验过程
  • 把因子、数据、模型试验和限制放进同一条证据链
  • 完成 AI 量化模块的整体收口
结论必须能被别人重走

报告只写“数据来自某 API”,为什么还不能复现?

可复现性要求另一个人在获得相同输入、代码、参数和版本条件后,能够重做出相同的分析过程。金融数据会更新,因此时间戳和版本同样属于证据。

Research Pipeline

一份研究少掉哪一步,就开始无法复现?

研究不是一张收益曲线。完整证据链至少要保留 Source → Raw Data → Transformation → Rule → Result → Conclusion。先找断点,再亲手补一份 Research Record。

来源原始数据规则结果结论
缺了哪一步?
建立 Research Record

仍有字段为空:别人还不能完整重走你的研究路径。

每个结论都要能找到父母

从一张结果图开始,应该一路追到代码、参数、处理后数据和原始来源

如果研究只留下“年化收益 12%”这一行,没人知道这个数字来自哪段历史、是否含成本、用了哪版规则、数据有没有后来修订。可复现的目标,是让结果能一路倒查到最初输入。

缺一类,就少一段证据链

问题、数据、代码、试验、限制,组成最小研究包

  1. 1研究问题测试什么因子或规则,评价指标是什么,什么结果会让假设失去支持。
  2. 2数据快照来源、许可、时间范围、版本、清洗步骤和样本边界。
  3. 3代码与环境脚本版本、依赖、运行环境和必要的随机种子。
  4. 4全部试验参数、版本、成功和失败结果都保存,不能只留下冠军。
  5. 5限制样本偏差、成本假设、缺失数据、适用环境和仍未解决的问题。
模型不是隐形同事

如果 AI 参与摘要、写代码或生成特征,输入和人工修改同样要留下

例如让 AI 根据一份财报生成结构化字段,就应保存原材料版本、提示目标、最终采用的字段以及人工修正。否则下一次结果不同,你无法判断是数据变了、模型输出变了,还是人工编辑变了。

输入

AI 看到了什么材料

来源、时间范围和版本必须明确。

输出

AI 生成了什么

保存真正进入后续研究的内容,而不是只记“用了 AI”。

人工核验

哪里被确认、修改或拒绝

最终研究责任不能消失在模型调用里。

同一个错误也能跑一百次

如果数据有幸存者偏差,代码完全可复现只会稳定地重复这个偏差

可复现解决的是“别人能不能得到同样结果”,不是“这个结果是否代表真实世界”。所以复现之后仍要审查数据、假设、成本、过拟合和反例。它让错误更容易被定位,而不是让错误自动消失。

把 36–40 串起来

AI 和量化真正带来的不是“更确定”,而是把研究变得更快、更一致、更容易检验

  1. 36AI 辅助加速整理、提取、解释和代码初稿,但关键事实要核验。
  2. 37因子把市场特征变成统一、可计算的定义。
  3. 38数据保证输入的来源、时间、版本和样本边界可信。
  4. 39过拟合防止大量试验把历史噪声包装成规律。
  5. 40可复现研究把整条链保存下来,让结果可以重跑、质疑和修正。
知识检测

检验你是否真正理解

只检验可复现研究与模块边界。

第 1 题,共 3 题

哪组信息最能帮助另一个人重建一次量化研究?

第 2 题,共 3 题

研究可以稳定重跑,能否因此证明结论正确?

第 3 题,共 3 题

AI 参与生成研究字段时,为什么要保存人工修正?

认识你的学伴

卡住了?让 Mira 帮你拆解

正在检查登录状态...