| name | empirical-paper-workflow |
| description | AI 辅助微观数据实证论文的写作、修订与审校工作流(含防失真铁律)。Use when writing, revising, or reviewing an empirical/quantitative academic paper (esp. Chinese social-science papers using microdata like CFPS/CHFS/CGSS), when the user asks to 写论文、改论文、审稿、审阅论文、查数据失真、核对参考文献, or when adding robustness checks / citations during revision. Covers the full pipeline (规则内化→数据→回归→成文→修订→审校) and a three-pass integrity review (data replication, citation verification, typography). |
实证论文写作工作流(防失真版)
判断模式
按用户请求进入对应模式,不要全流程硬走:
- 写作模式:从零或从某阶段开始写论文 → 按"十阶段流程"推进。
- 修订模式:回应审稿意见 / 补稳健性 / 加文献 → 重点执行"铁律",新增内容一律过脚本与题录核验。
- 审校模式:用户要求审阅/检查失真 → 执行"三线审校"。
十阶段流程(写作模式)
- 规则内化:把课程/期刊的格式要求与扣分规则结构化为
requirements.md 清单,之后所有环节对照检查(摘要发现占比、图表来源位置、引证体例、英文斜体等)。
- 资料结构化:扫描数据手册/codebook 生成变量主题索引;大数据文件(.dta 数百MB)只读元数据或指定列(
pd.read_stata(path, columns=[...])),索引落盘避免重复扫描。
- 选题:主题 × 数据可用性匹配矩阵 → 收束为一个主选题 + 研究设计文档。
- 文献:生成检索式 → 人工下载 → AI 初筛并按"章节角色"分组登记(每篇记期刊与写作用途);保留 RIS 题录库作为后续核验依据。
- 框架先行:写正文前完成章节结构、字数分配、章节×文献证据地图、图表规划。每节动笔时应已知道:论点、用哪组文献、引用哪张表的哪个系数。
- 数据工程:建样脚本参数化(年份/口径);输出派生数据 + codebook(变量构造、筛选流程、样本量逐级记录)。数据有意外(模块轮换、变量缺失)时调整设计并在正文如实说明,不硬上。
- 实证分析:回归脚本直接生成全部表格文件(Markdown/CSV),正文数字只从表格抄录。
- 成文:建议顺序"研究设计与结果 → 综述与理论 → 导言、结论、摘要"。使用latex撰写。
- 模拟审稿与修订:审稿能有效暴露因果语言滥用、稳健性缺口等问题;但修订是失真高发区,严格执行铁律。
- 独立审校与定稿:换视角执行三线审校(见下),通过后再编译定稿、按提交规范命名。
每个阶段结束在项目 README 追加日期小节记录产出(工作日志 = 数字可追溯链)。
铁律(任何模式下不可违反)
- 正文每一个数字必须有脚本出处。修订中新增的检验同样先写进脚本、运行、再从输出抄数。"结果未列表"必须仍然"结果已运行"。禁止凭推算或记忆补数。
- 新增文献一律过题录核验:本地 RIS 库 → Crossref API(
curl -s https://api.crossref.org/works/<DOI>)→ 必要时 WebSearch。核不到的字段(如未出版文章页码)宁可不写。
- 引用前确认文献立场:转述性句子的引证落点逐句对应;支撑关键论断(尤其政策建议)的文献,提示用户人工读原文确认——题录真伪 AI 可核,"文献是否真的说了这句话"需要人读。
- 交叉引用即时验证:写下"见表X注释/列(N)"后立刻回看目标处是否真有该内容。
- 修订留痕:每轮修改前备份
*_backup_<date> ;README 记录每个数字产生于哪一步。
- 数据引证:正文出现的任何外部统计数字(人口、规模、比率)必须有引证,且注意口径(如"农民工总量"≠"流动人口")。
三线审校(审校模式)
按"数据 → 引证 → 排版"三条线系统过一遍,重点是不在表格里的数字:
第一线:数据复算
- 表格文件与生成脚本输出逐项比对。
- 正文所有由表格派生的换算(×ln2、×标准差、占比、倍数)逐个重算。
- 正文中不在任何表格里的数字(稳健性口述结果、子样本特征、筛选链样本量)在派生数据上全部复算——这是失真集中区。复算口径对不上时,先试定义变体(截断点、归并方向、样本基),变体也对不上即判失真。
- 检查每个"见表X/注释"指向的内容真实存在。
第二线:引证核验
- bib 逐条对照本地 RIS / Crossref / WebSearch:刊名、年份、卷期页码、作者、标题。
- 检查未被引用的 bib 条目(删)、正文 cite key 无悬空。
- 叙述性引用用
\textcite,否则出现"作者(作者, 年份)"重复——在编译 PDF 上肉眼验证。
- 体例统一(如 gb7714-2015ay);英文期刊/书名斜体、不用中文书名号。
第三线:排版与合规
- 引号:正则清查
”…” 反向对、ASCII "…",统一为成对“……”;若中文字体引号字形不佳(如 STSong 偏斜),用 \xeCJKDeclareSubCJKBlock 将 U+2018–201D 单独映射到 Songti SC。
- 浮动体不得插断正文:表格源代码位置移到所属节正文段落之后。
- 图表标题齐全、资料来源写在图表下方(不入脚注)。
- 摘要:写明样本量、抽样设计、模型名;研究发现占比 ≥ 三分之二。
- 字数按"正文 CJK 字符(不含图表)"口径统计;提交文件按要求命名。
- 编译日志零 undefined reference、biber 零 WARN。
审校报告按严重程度排序输出:失真(含复算证据)→ 引证问题 → 排版问题 → 通过项清单。
关键命令模板
curl -s "https://api.crossref.org/works/<DOI>" | python3 -m json.tool
latexmk -xelatex -output-directory=out main.tex
rg -n '”[^“”]{1,60}”|"[^"]{1,60}"' main.tex
pdftoppm -f <页> -l <页> -r 250 -png out/main.pdf /tmp/pg && magick /tmp/pg-0<页>.png -crop WxH+X+Y /tmp/crop.png