| name | cjms-empirical-validation |
| description | Use when designing the real-data validation of a 《中国管理科学》 (Chinese Journal of Management Science) manuscript — forecasting and financial-engineering strands: data provenance, rolling out-of-sample tests, benchmark batteries, and significance of improvement. Validates methods on data; simulation-based studies belong to cjms-numerical-experiments. |
实证与数据检验(cjms-empirical-validation)
触发时机
- 预测/金融类稿件只有全样本内拟合,没有样本外
- "新方法更优"只凭一张误差表,没有显著性检验
- 数据来源、频率、区间交代不清,无法复现
核心:本刊实证的四道硬门
预测与决策、市场与投资分析两个栏目的稿件,外审按四道门检查:
- 数据可溯源:来源(Wind/CSMAR/交易所官网/公开能源数据)、频率、起止区间、缺失处理逐项写明;关键序列给描述统计与平稳性检验。
- 样本外为王:训练/验证/测试切分或滚动窗口预先声明;窗口长度、步长、再估计频率写清。样本内 R² 再高也不算证据。
- 基准电池:至少三层——朴素基准(随机游走/等权组合)、经典基准(ARIMA/GARCH/均值-方差)、最强近敌(最新文献同型方法)。赢不过朴素基准的改进无发表价值。
- 改进要显著:预测类给 DM 检验或 MCS;组合类报夏普比、最大回撤并做子区间稳健性;单点百分比改进不构成结论。
稳健性设计(按威胁分类,不是堆表)
| 结论威胁 | 对应检验 |
|---|
| 结果靠某段行情 | 子样本/牛熊分段、危机窗口单独报告 |
| 结果靠调参 | 参数敏感性网格、默认参数对照 |
| 结果靠某个数据源 | 换数据源/频率复跑 |
| 结果靠事后信息 | 检查前视偏差:特征、标准化、模型选择全部只用当期可得信息 |
与代码库的衔接
面板/因果类支线(如政策冲击对市场的影响)可直接改用 ../../resources/code/ 的 Stata/Python 骨架(清洗→描述→DiD/IV/RDD→稳健性→出表);时间序列预测线建议同样落成"一键复现"目录结构,随稿准备可提供的复现材料。
执行桥(StatsPAI / Stata MCP)
四道硬门里有三道是算出来的,不是写出来的。工具全表见
execution-with-mcp。
- 改进显著性:
bootstrap 给误差差值的区间;预测线的 DM/MCS 若无现成实现,
至少用 bootstrap + romano_wolf 把"赢了几个基准"的多重比较校正掉——基准电池
越厚,单看一列 p 值越容易赢在运气上,这正是本刊外审最常追的一刀。
- 参数敏感性:
spec_curve 把"换个窗长/换个参数就翻盘"一次画完,比补三张表更
能回答审稿人的"结果靠调参吗"。
- 因果支线:政策冲击类用
detect_design → preflight → did / iv /
rdd,再 audit_result 列出还欠哪些稳健性,逐条按它给的 suggest_function 补。
- 子样本:牛熊分段与危机窗口用同一个
result_id 派生,避免各段口径悄悄不一致。
服务器未连接时退回 ../../resources/code/ 的骨架照抄改写,并在稿中说明数字的来源——
不报没算过的数。
自检清单
本刊实证节的外审期待
| 退稿信号(审稿常用语) | 根因 | 本刊期望的修法 |
|---|
| "缺乏样本外检验" | 只报全样本拟合 | 滚动窗口方案入正文,细节可复现 |
| "对比方法选择不当" | 基准电池缺最强近敌 | 补近三年同型方法,正面交锋 |
| "改进幅度的显著性存疑" | 只报点值 | DM/MCS + 子区间一致性 |
| "结果可能依赖样本区间" | 区间恰避开极端行情 | 危机窗口单独报告,边界诚实 |
| "存在前视偏差之嫌" | 分解/标准化用了全样本信息 | 逐环节声明信息时点;分解类方法尤其要滚动重估 |
最后一条是预测栏目的高频雷区:EMD/VMD 类"分解-预测-集成"研究若对全样本一次性分解再切分训练测试,属于典型前视偏差,近年外审盯得很紧。
微型走查:碳价预测的检验设计
虚构稿件《基于模态自适应组合的全国碳市场价格预测》(示意设计):
数据:全国碳排放权交易市场日收盘价,2021-07 至 2025-12,来源与
缺失处理(节假日对齐)写明
样本外:滚动窗口 500 日,步长 1 日,每步重新分解与训练(防前视)
基准电池:朴素=随机游走;经典=ARIMA、GARCH;机器学习=LSTM、XGBoost;
最强近敌=近三年文献的 VMD-LSTM 组合
指标:RMSE / MAE / MAPE + DM 检验(vs 逐个基准)+ MCS 90% 存活集
稳健性:履约季 vs 非履约季分段;窗长 250/750 敏感性;
剔除政策公告日复跑
要点:履约季分段是碳市场特有的结构性检验——用情境知识设计稳健性,比堆通用检验更能说服本刊审稿人。
反模式
- 用样本内拟合优度讲故事,样本外一笔带过
- 基准只选弱者:跟十年前的方法比,回避最新同型文献
- 百分比误差改进 0.3% 就宣称"显著优于",无任何检验
- 数据区间恰好停在方法失效的行情之前
- 把机器学习黑箱直接端上来,不报告特征与调参协议
输出格式
【数据】来源<…> 频率<…> 区间<…> 缺失处理<…>
【样本外方案】<切分或滚动细节>
【基准电池】朴素<…> 经典<…> 最强近敌<…>
【显著性】DM/MCS/子区间:<结果>
【稳健性矩阵】威胁→检验 × n
【下一步】cjms-numerical-experiments(如有仿真)或 cjms-managerial-insights