| name | data-collector |
| description | Evidence collection — use when the user wants to locate data sources, collect case evidence, validate data availability, clean datasets, or organize non-academic research materials. Looks for variable requirements and research object in research_proposal.md; asks user if absent. |
| version | 8.0.0 |
| produces | ["data/data_report.md"] |
| output_dir | data/ |
Data Collector
职责边界
所需信息:需要什么变量/证据 + 研究对象 + 数据用途。
产出:data/data_report.md(证据来源报告)+ 原始数据文件(data/raw/)+ 清洗结果(data/clean/)。
完成标准:研究计划书中每个子问题/因果链环节都有对应的可用证据/变量,来源已记录,关键数据 ≥2 源验证。
不做:联网操作执行细节(→ web-access)、回归分析(→ empirical-analysis)、学术文献搜集(→ paper-search)。
材料范围:收录所有不能进入论文参考文献列表的材料——企业年报/季报/公告、券商研报/行业分析报告、新闻报道/媒体专访、行业数据(LightCounting、Yole 等)、投资者互动平台记录、政府政策文件(非学术出版)等。这些材料在论文中以脚注/数据来源注释形式出现。
Step 1 — 收集所需信息
查找顺序:
- 读取
./topics/research_proposal.md,识别:研究类型、关键变量/证据需求、研究对象
- 读取对话中用户已提供的数据说明或已有材料
- 仍缺失时,向用户追问——一次只问一个问题:
- "你要找什么数据/证据?用来验证什么?"
- (确认后)"已经有哪些数据?需要搜集的是哪部分?"
完成标准:研究类型已判断,需要搜集的变量/证据清单已确认。
Step 2 — 声明搜集模式
根据研究类型选择模式,告知用户:
| 研究类型 | 搜集模式 | 核心产出 |
|---|
| 计量实证 | 面板数据模式 | 结构化数据集(csv/dta) |
| 案例研究 | 案例证据模式 | 多源证据档案 |
| 质性研究 | 质性素材模式 | 文本语料库 |
| 描述/政策分析 | 资料汇编模式 | 结构化资料集 |
Step 3 — 执行搜集
面板数据模式
搜索意图声明(交 web-access 执行):
搜索意图: 数据源定位 + 文件获取
成功标准: 找到覆盖所需变量和时间范围的数据源,文件下载到 data/raw/
优先源: 统计局官网 / 国家数据平台 / CSMAR / Wind / 学术数据仓库
输出要求: 下载 Excel/CSV/DTA 到 data/raw/,记录来源 URL
失败降级: 公开源不可得 → 标记"需用户从付费数据库导出"并给操作步骤
清洗流程(本 skill 执行,需 Python 可用):
原始数据 → 格式识别 → 变量筛选 → 类型转换
→ 缺失值诊断(记录比例和处理方式)
→ 异常值处理(winsorize 或 trim,记录依据)
→ 去重 → 面板结构验证 → 变量构造 → 导出
面板结构验证核查项:唯一性(id×time 无重复)、平衡性(T 是否一致)、时间连续性、变量分布(均值/标准差/极值)、相关系数矩阵。
清洗脚本保存为 data/scripts/01_clean.py,可一键复现;原始数据在 data/raw/ 不改动。
案例证据模式
搜索意图声明(交 web-access 执行):
搜索意图: 多源证据获取(企业财报 + 行业数据 + 政策文本 + 媒体报道)
成功标准: 各类证据实际下载/提取到 data/raw/,核心事实有 ≥2 源交叉验证
优先源: 巨潮资讯网(年报)/ 东方财富(财务数据)/ 政府官网(政策)/ 权威媒体
输出要求: PDF 下载到 data/raw/,结构化数据存 data/clean/
失败降级: 需登录/付费 → 标记"需用户手动获取"并给具体操作步骤
证据三角验证(本 skill 执行)——同一事实须有 ≥2 个独立来源确认(Yin, 2018):
| 证据类型 | 来源A | 来源B |
|---|
| 财务数据 | 年报 | 券商研报 |
| 战略事件 | 公司公告 | 媒体报道 |
| 技术进展 | 产品发布/专利 | 行业评测 |
| 市场地位 | 第三方排名 | 营收数据计算 |
事件时间线输出格式:
| 时间 | 事件 | 类别 | 来源 | 验证状态 |
|------|------|------|------|---------|
| 2022.03 | 收购Alpine获取硅光技术 | 战略决策 | 公司公告 | ✓ 双源 |
质性素材模式
确认语料范围(来源、时间、筛选标准)和预期规模后执行:
确定语料边界 → 系统搜集(web-access)→ 格式统一 → 编码框架初建 → 预编码验证
资料汇编模式
确认资料清单(统计数据、政策文本、行业报告等)后执行:
明确资料清单 → 分类搜集(web-access)→ 结构化整理 → 关键数据图表化
完成标准:所有目标数据/证据已搜集,来源有记录,核心事实已交叉验证。
文件结构
面板数据模式:
data/raw/ ← 原始数据(语义命名,如 nbs_provincial_2011_2023.xlsx)
data/clean/panel_clean.csv ← 清洗后数据
data/scripts/01_clean.py ← 清洗脚本
data/data_report.md ← 主输出
案例证据模式:
data/raw/ ← 原始素材(语义命名,如 annual_report_2023.pdf)
data/clean/ ← 结构化数据
data/data_report.md ← 主输出(含事件时间线)
质量 Checklist
通用(所有模式):
面板数据追加:
案例证据追加:
完成后标准输出
✅ 数据搜集完成
📄 data/data_report.md
模式: [面板数据 / 案例证据 / 质性 / 资料汇编]
原始文件: [N] 个(data/raw/)
验证状态: ✓ [X] 条核心事实双源验证
📊 评价:
[through-line 各环节的证据覆盖情况]
➡️ 建议下一步:
1. empirical-analysis — 运行基准回归(面板数据)
2. paper-writer — 直接写作(案例/质性)
⚠️ [如有缺口或局限,在此说明]