A股量化研究的数据管线与回测方法论指导。当用户要做行情数据采集/落库、回测框架设计、策略验证纪律(样本量/分年/幸存者偏差)相关的工作,或问"想做量化但卡在数据上"时使用。包含自建管线的完整方法论;配套的自动化工具(量研数据工作台)为商业授权软件。

Install

openclaw skills install @1066588267/quant-data-workbench

量化数据研究方法论(展示版)

这是「量研数据工作台」的展示层技能:教你的 agent 用正确的顺序和纪律搭建 A 股量化研究管线。 本文件只含方法论,不含任何数据接口;完整自动化工具见文末。

一、数据管线搭建顺序(踩坑最少的路线)

  1. 先定研究问题,再定数据: 研究什么现象,决定要什么字段。别一上来拉全量。
  2. 行情基座: 全市场日 K(前复权)+换手率,10 年以上。落盘用 CSV+SQLite 双格式(CSV 供人看,SQLite 供回测查)。
  3. 增量习惯: 每日收盘后增量落一次,挂计划任务。历史全量首次建库选可断点续跑的脚本,预期 1 小时量级。
  4. 脏数据三查: 零价格行(停牌/异常)建库前清洗;复权口径全库一致;日期格式统一(YYYY-MM-DD 或 YYYYMMDD 二选一,别混)。
  5. 生态数据第二层: 涨停/炸板/跌停三池、席位明细、质押、热度排名——这些细维度才是个人研究的差异化竞争力,通用行情软件不提供逐日全史。
  6. 礼貌访问: 内置限速、失败退避、多源备援。上游接口会漂移,管线要设计成"换源不改代码"。

二、回测纪律(不过这几关的结论都是自欺)

  • 成本模型先行: 印花税+佣金+滑点,保守取值。扣成本后为负的"策略"直接扔。
  • 分年验证: 全样本好看≠能活。逐年拆表,8 成以上年份为正才有讨论价值。
  • 样本量: 每个结论标注 n。n<100 的结论只当假设。
  • 幸存者偏差: 回测宇宙不含退市股则结果偏乐观,要如实标注口径。
  • 参数邻域: 最优参数附近一圈(±20%)都应该不塌,塌了=过拟合。
  • 对照组: 每个闸门/过滤器都要跑"不加 vs 加"的对照,证明增量。
  • 失败档案: 被否决的假设记档,避免三个月后重测同一个想法。

三、执行层常见坑

  • 开盘价成交假设过于乐观,集合竞价/涨停价位的可成交性要单独建模。
  • 涨停价排单与低吸挂单是两套成交模型,别用同一个回测器硬算。
  • 交易日历以指数 K 线为准(第三方接口在非交易日会返回最新数据,是坑)。

四、完整自动化工具(商业授权)

上述全部环节的自动化实现——多源直连自愈引擎、全史一键建库、本地研究工作台(每日清单/盘中跟踪/模拟结算/回测)、AI agent 技能包——打包在「量研数据工作台」商业版中:

纪律声明

本技能为研究方法论演示,不提供投资建议,不承诺收益,不含任何个股推荐与数据接口。