| name | gl-paper-replication |
| description | Use when helping a user lightly replicate and learn from an empirical economics, management, finance, or accounting paper from public paper materials, create a clean replication project structure, extract variables/data/models, draft basic Stata replication steps, explain code and tables, record reproducible outputs, and produce a replication report or Word-ready writeup. |
GL 论文复现 Skill
这是公开轻量版论文复现 skill。它帮助普通用户从一篇实证论文出发,建立可复现的项目结构、整理变量和数据需求、生成基础复现步骤、保存代码和日志、输出复现报告,并形成学习笔记,解释每段代码、每张表和每个模型在做什么。
边界
- 不依赖任何私有总控工作流。
- 不包含私有数据路径、私有记忆、私有模板、密钥或个人项目结论。
- 不提供自动显著性筛选、最优组合搜索、黑箱调参或结果包装。
- 复现结果与原文不一致时,记录差异;不得编造系数、P 值、样本量、星号或表格。
适用场景
- 用户提供论文 PDF、Word、网页、DOI、题目或截图,想复现论文实证部分。
- 用户想搭建“顶刊/核心期刊论文复现”项目文件夹。
- 用户想从论文中提取研究问题、变量、数据来源、模型、表格和复现任务。
- 用户已有数据,希望生成基础 Stata 清洗、描述性统计、基准回归和复现报告。
- 用户复现完后想学习代码、表格和模型,知道每一步为什么这样写。
推荐下游能力
按需要使用,不要求一次全部安装:
| 场景 | 可用能力 |
|---|
| 读取论文 | pdf, docx, web-access |
| 表格和清单 | xlsx |
| Stata 清洗和回归 | stata, stata-data-cleaning, stata-regression |
| 文献和引用 | literature-search, cnki-search, gs-search, zotero |
| 写作和交付 | academic-paper-writer, word, docx |
第一步:建立项目结构
每个复现任务必须建立独立文件夹。默认中文结构:
论文复现项目/
00_项目说明/
01_论文材料/
原文/
附件/
02_文献与变量/
03_数据/
原始数据/
清洗数据/
04_代码/
stata/
python/
05_日志/
06_结果/
描述性统计/
基准回归/
稳健性/
机制异质性/
07_复现报告/
08_交付文件/
09_学习笔记/
先创建这些文件:
00_项目说明/项目说明.md
00_项目说明/复现目标.md
00_项目说明/待确认问题.md
02_文献与变量/变量清单.md
02_文献与变量/数据需求.md
03_数据/数据说明.md
07_复现报告/复现差异说明.md
09_学习笔记/代码讲解.md
09_学习笔记/表格解读.md
09_学习笔记/模型学习卡片.md
09_学习笔记/学习路线.md
09_学习笔记/复现收获.md
第二步:读取论文并提取信息
先读论文,不直接跑代码。提取:
- 论文题目、作者、期刊、年份。
- 研究问题和核心结论。
- 样本范围、年份、观测单位。
- 被解释变量、解释变量、控制变量、机制变量、调节变量、异质性分组。
- 数据库或数据来源。
- 基准模型、固定效应、聚类方式。
- 要复现的表格编号和内容。
写入:
00_项目说明/项目说明.md
00_项目说明/复现目标.md
02_文献与变量/变量清单.md
02_文献与变量/数据需求.md
第三步:复现准入检查
正式运行前必须确认:
- 是否已有论文原文和必要附件。
- 是否明确样本期和观测单位。
- 是否明确数据来源。
- 是否明确 Y、X 和控制变量。
- 是否明确固定效应和聚类方式。
- 是否已有可读取数据。
- 是否知道要复现哪几张表。
- 是否明确输出:代码、表格、报告、Word 或全部。
任一关键项缺失时,只能写待确认问题、数据需求和复现计划,不运行正式回归。
第四步:整理数据和变量
原始数据放入:
03_数据/原始数据/
原始数据只读,不覆盖。清洗后另存:
03_数据/清洗数据/
变量清单至少包含:
| 字段 | 含义 |
|---|
| 变量角色 | Y / X / 控制变量 / 机制 / 调节 / 异质性 |
| 变量名 | 数据中的变量名 |
| 中文含义 | 变量解释 |
| 构造方式 | 对数、滞后、比率、虚拟变量等 |
| 数据来源 | 数据库、表名或用户文件 |
| 原文依据 | 原文表格、变量定义或脚注 |
| 备注 | 缺失、替代口径、无法复现原因 |
第五步:生成基础 Stata 复现文件
至少生成:
04_代码/stata/01_数据清洗.do
04_代码/stata/02_描述性统计.do
04_代码/stata/03_基准回归.do
如果论文包含扩展分析,再生成:
04_代码/stata/04_稳健性检验.do
04_代码/stata/05_机制检验.do
04_代码/stata/06_异质性分析.do
每个 do 文件都要:
- 写明输入和输出。
- 打开日志。
- 不覆盖原始数据。
- 保存结果到
06_结果/。
- 保存日志到
05_日志/。
第六步:默认复现顺序
按论文需要选择:
- 数据清洗和样本筛选。
- 描述性统计。
- 相关性分析。
- 基准回归。
- 稳健性检验。
- 机制或中介分析。
- 调节效应。
- 异质性分析。
- 内生性或其他扩展。
- 复现差异说明。
结果与原文不一致时,不调整结果;先检查变量口径、样本期、固定效应、聚类、缺失值和数据版本,并记录差异。
第七步:输出复现报告
生成:
07_复现报告/复现报告.md
07_复现报告/复现差异说明.md
复现报告结构:
1. 论文基本信息
2. 复现目标
3. 数据和样本
4. 变量定义
5. 模型设定
6. 描述性统计复现
7. 基准回归复现
8. 稳健性或扩展结果
9. 与原文差异
10. 未解决问题
若用户要求 Word,使用 word 或 docx 输出:
08_交付文件/复现报告.docx
Word 交付格式规范
凡是本 skill 生成的论文复现 Word 版交付文件,包括复现报告、学习笔记汇总和其他 Word-ready 文档,必须统一使用以下格式:
- 中文字体:宋体。
- 英文、数字和西文字母字体:Times New Roman。
- 正文:宋体小四,即 12 pt。
- 一级标题:宋体四号,即 14 pt,加粗。
- 二级标题:宋体小四,即 12 pt。
- 三级标题:宋体小四,即 12 pt。
- 生成
.docx 后必须验证 Word XML 或样式设置,确认 eastAsia 字体为宋体,ascii/hAnsi 字体为 Times New Roman,字号符合上述要求。
第八步:生成学习笔记
复现结束后,必须帮助用户从“跑出来”进入“学明白”。学习笔记面向初学者,用中文解释代码、表格和模型,不写成内部调试日志。
生成:
09_学习笔记/代码讲解.md
09_学习笔记/表格解读.md
09_学习笔记/模型学习卡片.md
09_学习笔记/学习路线.md
09_学习笔记/复现收获.md
代码讲解
逐个解释 04_代码/stata/ 中的 do 文件。每个文件至少说明:
| 内容 | 说明 |
|---|
| 文件作用 | 这个 do 文件解决什么问题 |
| 输入数据 | 读取了哪些数据 |
| 输出结果 | 生成了哪些数据、表格或日志 |
| 关键命令 | 重要 Stata 命令及含义 |
| 变量处理 | 生成、替换、筛选、合并了什么变量 |
| 初学者要学会什么 | 这一段代码对应的实证技能 |
示例格式:
代码片段:
merge 1:1 id year using control_data.dta
这句代码的作用:
按照企业 id 和年份 year,把主数据与控制变量表做一对一合并。
学习点:
面板数据合并前必须确认 id-year 是否唯一,否则回归样本可能被重复扩张。
表格解读
逐张解释 06_结果/ 中的核心表格。每张表至少说明:
- 这张表回答什么问题。
- 行和列分别代表什么。
- 核心变量的系数方向和显著性如何读。
- 样本量、固定效应、标准误说明什么。
- 它与原文表格是否一致。
- 初学者读这张表时最容易误解什么。
模型学习卡片
为每个主要模型生成一张学习卡片:
模型名称:
固定效应回归
解决的问题:
控制不随时间变化的个体差异。
基本形式:
Y_it = beta X_it + Controls_it + firm FE + year FE + error_it
在本文中的用法:
用于估计 X 对 Y 的基准关系。
读结果时看:
核心系数、标准误、显著性、样本量、固定效应和聚类方式。
常见误区:
固定效应回归不能自动解决所有内生性问题。
可覆盖模型包括:OLS、固定效应、双重差分、PSM、IV、动态 GMM、Heckman、中介、调节和异质性。
学习路线
生成一份 09_学习笔记/学习路线.md,告诉用户复现完成后应该按什么顺序学习这篇论文。至少包含:
- 先读哪几个文件,后读哪几个文件。
- 每个 do 文件对应哪类实证能力。
- 每张核心表格对应论文中的哪一步论证。
- 哪些 Stata 命令值得单独练习。
- 哪些模型可以迁移到下一篇论文。
- 建议用户自己动手改哪 3 个小地方来检查是否真正理解。
推荐结构:
1. 先看论文问题和变量清单
2. 再看数据清洗代码
3. 接着看描述性统计和相关性表
4. 然后看基准回归与固定效应设置
5. 最后看稳健性、机制、异质性或内生性处理
6. 自测任务:改变量、改样本、改模型,并观察结果变化
复现收获
最后总结这篇论文值得学习的地方:
- 研究问题如何提出。
- 变量如何构造。
- 数据如何组织。
- 模型如何层层推进。
- 表格顺序如何服务论文叙事。
- 哪些地方无法复现或需要额外数据。
- 用户下次复现类似论文时可以复用什么。
输出口径
面向用户的最终输出要包含:
- 已创建的项目结构。
- 已提取的论文信息。
- 数据和变量需求清单。
- 已生成的 Stata 文件。
- 已运行或尚未运行的模块。
- 结果文件和日志位置。
- 与原文一致和不一致的地方。
- 学习笔记位置、学习路线,以及每个代码文件和核心表格是否已解释。
- 下一步需要用户补充的材料。
禁止
- 不编造文献、变量、数据来源或回归结果。
- 不把未运行的结果写成已复现。
- 不为了接近原文而手动改系数、P 值、星号、样本量或 R 方。
- 不隐藏复现失败或差异。
- 不把内部调试过程放入正式交付 Word,除非用户明确要求审计版。
- 不只给代码不解释;复现后必须帮助用户理解代码、表格、模型和可迁移学习路径的价值。