| name | gl-thesis-variable-selection |
| description | 帮助中国高校经管类本科生和硕士生审查普通 AI 给出的变量答案,并把已确定的论文题目转成可执行的变量设计。用于 AI 变量方案纠错、核心解释变量和被解释变量衡量、主口径与替代口径选择、熵值法或主成分分析判断、数据可得性评分、10篇文献控制变量筛选、控制变量矩阵和变量表生成;不用于从零选题、直接下载最终数据、运行回归或为显著性倒推变量。 |
GL 论文选题变量确定 Skill
核心任务
把“题目里的概念”转成有文献依据、有数据来源、能复现的变量方案。
核心顺序:
先分变量角色
→ 再查衡量口径
→ 再过数据闸门
→ 再筛控制变量
→ 最后形成研究方案
使用前提醒
本 Skill 需要检索真实文献来核验变量口径和控制变量,建议本机提前安装并启用:
- CNKI Skill 套件:用于检索中文经管文献、硕博论文和变量衡量方式,例如
cnki-search、cnki-paper-detail。
- GS Skill 套件:用于检索 Google Scholar 英文文献、机制和替代口径,例如
gs-search、gs-fulltext。
- 文档读取工具:用于读取用户提供的 PDF、Word 和 Excel 文献。
开始任务时先检查上述工具是否可用。若 CNKI Skill 或 GS Skill 未安装,必须明确提醒使用者先安装相关 Skill;在工具恢复前只能生成初步候选方案,所有未经真实文献核验的结论必须标注“待核验”,不得伪造文献依据。
输入检查
先检查 CNKI Skill、GS Skill 和文档读取工具是否可用,再读取用户提供的题目、学历、专业、论文用途、10 篇相关实证文献和可用数据源。
信息不足时最多问 5 个关键问题。若用户未提供 10 篇文献且当前环境有 CNKI、Google Scholar 或文献检索工具,主动补充检索;工具不可用时标注“待核验”,不得编造。
执行流程
- 审查已有 AI 答案:用户提供普通 AI 的变量方案时,先读取 AI 变量答案审查规则,检查证据、角色、口径、固定效应、内生性和数据落地风险。
- 分变量角色:识别 Y、X、控制变量、机制变量、调节变量和异质性分组。机制变量或后处理变量不得机械放入基准控制变量。
- 确定核心变量口径:读取 核心变量衡量规则,输出主衡量方式、替代衡量方式、公式、文献和数据来源。
- 评估数据可得性:读取 数据可得性评分,完成六维评分和红黄绿闸门。
- 筛选控制变量:读取 控制变量筛选规则,从 10 篇文献抽取、对齐、计频并检查理论必要性。
- 生成交付物:读取 输出契约,生成变量设计报告和控制变量矩阵。需要 Excel 时复制 assets/控制变量文献矩阵模板.xlsx,不修改原始模板。
硬规则
- 变量名称相似不等于衡量口径相同;ROA/ROE、企业年龄/上市年限、Top1/Top10 不得强行合并。
- 高频控制变量只代表文献共识信号,不代表自动必选。
- size、lev 是企业层面高频基础候选,不是所有研究的绝对必选。
- 8-10 个控制变量是常见起点,不是数量指标;不得为了凑数加入无理论依据的变量。
- 固定效应不计入控制变量数量。
- 企业面板首先检查企业固定效应与年份固定效应;加入企业固定效应后,不机械叠加基本不变的行业和地区固定效应。
- 滞后一期不能自动解决内生性;工具变量必须单独论证相关性、排除性和数据可行性。
- 硕士变量可以多源合并或构建综合指数,但不是越复杂越好。
- 熵值法权重表示样本信息差异,不等于理论重要性。
- 爬虫数据并非天然不被认可,但技术、合规、清洗和复现风险通常更高。
- 不为追求显著性先定结论,再倒推变量或控制变量。
- 任何未从真实文献或数据源确认的内容都标注“待核验”。
工具路由
- 中文变量口径与控制变量文献:优先 CNKI、中文权威经管期刊、CSSCI 和北大核心。
- 英文前沿、机制与替代口径:使用 Google Scholar 或英文文献检索工具补充。
- 表格交付:优先生成 .xlsx;同时在 Markdown 报告中给出可预览的摘要表。
- 用户提供 PDF、Word 或 Excel 时,先读取原文件,不凭标题猜测变量定义。
中文核心文献检索与全文核验流程
中文核心论文不能只凭搜索结果摘要或题名进入控制变量矩阵。按以下顺序执行,并把每一步的证据留存到项目文件中。
1. 先筛期刊层级,再筛题目相关性
- 在 CNKI 高级检索中使用题名或主题组合检索,例如“数字化转型 AND 绿色创新”。
- 在来源限定中选择“CSSCI”和“北大核心”相关来源;如果页面把两者作为并集筛选,报告中写明“至少命中其中一种”,不要笼统写成“顶刊”。
- 优先保留同一被解释变量、同一数据层级和相近样本的中文核心实证论文;可按被引量排序用于发现高影响文献,但被引量不是核心级别证明。
- 每篇候选必须核对作者、题名、期刊、年份、卷期、页码和 DOI。题名相同的论文必须继续核对作者和期刊,不得按题名唯一匹配。
2. 中文全文获取优先级
按下列顺序尝试合法全文入口:
- 学校图书馆的 CNKI、万方或维普机构权限,包括 WebVPN、CARSI 和校外统一认证。
- 国家哲学社会科学文献中心(
ncpssd.cn)的个人或机构登录资源。检索结果中的“阅读全文/全文下载”是有效入口;不要直接复制带临时签名的 PDF 地址。
- 期刊官方网站、DOI 落地页、作者所在高校成果库或作者公开稿。
- 图书馆馆际互借、CALIS/CASHL 文献传递或向作者请求合法作者稿。
个人账号登录不等于拥有 CNKI 全文权限;不得绕过付费、破解权限、共享他人账号或使用来源不明的网盘文件。需要登录态、动态页面或浏览器交互时,使用 web-access;若 CDP/浏览器授权失败,先按全局 Agent 指令用 computer-use 检查并处理授权弹窗。
3. 同名论文与期刊误匹配防护
取得全文后必须检查 PDF 首页或期刊官网详情页的作者、期刊、年份和 DOI,并与检索记录逐项比对。发现同名但期刊不同、年份不同或作者不同的文件时:
- 将其移出核心文献目录并记录为“同名误匹配”;
- 不得使用误匹配论文的控制变量替代目标论文;
- 如果目标论文没有可验证全文,标记“全文待核验”,或用同一 X/Y、同一层级的另一篇核心实证论文替换,并在报告中说明替换原因。
4. PDF 有效性检查
下载或获取后至少检查:
- MIME 类型为
application/pdf,文件大小大于 0;
- 文件头为
%PDF,能够被 pypdf、pdfplumber 或等效工具打开;
- 页数、正文文本和首页题录可读取;
- 记录本地文件路径、获取入口和核验日期。
直接访问 PDF 返回 403、空文件或“来源应用不正确”时,不把它视为全文已获取。很多平台的全文链接带会话签名,必须从已登录页面点击或通过页面授权流程获取。
5. 从全文提取变量证据
全文核验至少提取以下字段:
- 样本层级、样本年份、样本筛选和数据来源;
- 核心 X、被解释变量 Y 的定义、公式和替代口径;
- 原文控制变量名称和每个变量的计算方式;
- 企业/年份/行业/地区固定效应及标准误聚类层级;
- 中介变量、调节变量、异质性分组和内生性处理;
- 变量定义所在页码、章节或表格编号。
控制变量矩阵的单元格保留原文写法;ROA/ROE、企业成立年龄/上市年限、Top1/Top5/Top10、现金流不同分母、专利申请/授权等口径必须分行。只在全文公式或表格确认后计入频次,摘要中提到的机制变量不能直接当作控制变量。
6. 文献证据留痕与替换规则
项目交付至少保留:
控制变量文献矩阵.xlsx:文献登记、原文变量、口径、固定效应、聚类方式和公式频次;
变量设计报告.md:核心变量主口径、替代口径、控制变量频次和最终取舍;
待核验清单.md:全文缺失、同名误匹配、页码不明、数据库权限和字段覆盖风险;
核心文献全文/ 或等效目录:已验证 PDF 及必要的文本提取文件。
任何全文未取得、题录未核对或变量公式未确认的内容都必须标注“待核验”,不得为了凑足 10 篇或提高某个变量频次而引入非核心论文、同名误匹配或摘要推断。
输出契约
至少交付:
- AI变量方案审查.md(用户提供 AI 回答时)
- 变量设计报告.md
- 控制变量文献矩阵.xlsx
- 待核验清单.md
报告必须包括:学生场景、变量角色、核心变量衡量、数据评分、控制变量频次与理论判断、最终变量清单、不建议变量、风险和下一步。
排除范围
- 从零寻找论文方向或生成选题。
- 代替用户下载付费数据库或破解权限。
- 在没有真实数据时直接运行正式回归。
- 纯问卷量表设计与信效度分析。
- 为获得显著结果而隐藏变量筛选过程。