数据来源谱系(Data Provenance)是指完整记录数据集从原始采集源头、下载时戳、时区校准、除权除息处理,到最终特征工程入模全生命周期的可审计溯源历史档案。
它是怎么运作的
在量化回测中,数据谱系不仅要记录数据供应商(如 Wind、Tushare、Bloomberg),还需明确记录数据的静态截面(Point-in-Time)时点,避免使用后来修正过的财报数据造成未来函数。
任何第三方复核者通过调取谱系日志,均可完全重现模型在历史上某一天所能看到的精确数据切片。
为什么交易者需要知道
缺乏数据谱系,供应商在后台静默更新一次 CSV 文件,就可能导致相同的策略代码跑出截然不同的收益曲线,且无法排查原因。
它是识别并彻底杜绝幸存者偏差、未来函数(Lookahead Bias)与后视镜数据的最底层防线。
一个简单的市场例子
量化研究员在下载 A 股历史行情数据时,没有随意保存一个名为 `stock_data.csv` 的未标记文件,而是在元数据日志中详细记录了下载时间、数据供应商 API 版本以及前复权算法公式。
常见误区
直接在原始数据文件上做增删修改,导致历史测试基准被彻底覆盖且无法追溯。
未记录价格数据是前复权、后复权还是除权未复权,导致均线策略回测逻辑失真。
常见问题
为什么同一张 CSV 文件更新后,回测结果会完全变样?
金融数据服务商经常会对历史财务报表进行更正重述,或者对退市股票进行追溯清洗。如果使用更新后的数据重跑历史,策略相当于变相偷看了后来的修正事实。
普通个人交易者如何做好数据溯源?
将原始下载的数据文件保存在只读文件夹中,文件名严格附带日期标签(例如 `nasdaq100_daily_20260901_raw.csv`),并在同目录下保存一份说明文档记录数据抓取源和筛选条件。
数据谱系只对量化高频交易有用吗?
不是。任何使用 Excel 做历史交易统计、或者手工复盘特定 K 线形态的交易者,都依赖清晰的数据源版本,否则很容易在不同复盘周期得出自相矛盾的结论。
仅供教育用途。部分术语在不同国家、机构和市场中的具体口径可能不同。