data-profiler
数据探查与画像。30分钟生成完整数据画像,包括变量字典、分布、缺失率。既支持 /data-profiler,也支持自然语言触发,如‘先帮我看看这份数据长什么样’。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
数据探查与画像。30分钟生成完整数据画像,包括变量字典、分布、缺失率。既支持 /data-profiler,也支持自然语言触发,如‘先帮我看看这份数据长什么样’。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
研究方向发现引擎。在成熟领域的交界处发现没人建的桥。 触发条件: "找方向"/"研究方向"/"选题"/"下一轮做什么"/"research frontier"。 核心方法: 资产盘点 → 结构选型 → 交叉缝隙扫描(deep research驱动) → 证据验证 → 可行性确认。
AI 科研军团统一入口。用户投入任何科研任务→Wei 读取任务→查阅 Skill 注册表→动态调度各角色。 触发条件: 用户说"/start-army"、"启动军团"、"接单"、"开始项目",或提供数据文件+研究需求。
原始数据真伪与异常模式扫描。既支持 /data-forensics,也支持自然语言触发,如‘这份数据可信吗’。
最终交付收口。把投稿包整理成可交付目录,补齐说明文件、清单和接收指引。既支持 /delivery,也支持自然语言触发,如‘把这些整理成最终交付目录’。
学术论文撰写。基于统计结果和文献生成IMRAD格式论文。既支持 /manuscript-draft,也支持自然语言触发,如‘帮我写成论文初稿’。
质量审查与自动迭代。多轮审查直到通过或达到上限。既支持 /quality-review,也支持自然语言触发,如‘帮我审这篇稿子’。
| name | data-profiler |
| description | 数据探查与画像。30分钟生成完整数据画像,包括变量字典、分布、缺失率。既支持 /data-profiler,也支持自然语言触发,如‘先帮我看看这份数据长什么样’。 |
| argument-hint | ["数据文件路径"] |
| allowed-tools | Bash(*), Read, Write, Edit, Grep, Glob, WebSearch, WebFetch, Agent |
在数据通过鉴伪门控后,对数据集进行全面探查与画像。产出结构化的变量字典和数据画像报告,为研究设计和统计分析提供决策依据。以 Ming 的视角执行(参考 ~/.claude/agents/ming.md)。
对每个变量自动判定类型,并支持人工覆盖:
| 类型 | 判定规则 | 示例 |
|---|---|---|
| 连续型 | 数值型 + 唯一值 > 20 | 年龄、BMI、血压 |
| 分类型(有序) | 数值/文本 + 唯一值 ≤ 10 + 有自然顺序 | 分期(I/II/III)、评分等级 |
| 分类型(无序) | 文本/数值 + 唯一值 ≤ 20 + 无顺序 | 性别、种族、医院 |
| 二分型 | 唯一值 = 2 | 是/否、存活/死亡 |
| 日期型 | 可解析为日期格式 | 入院日期、随访日期 |
| ID 型 | 唯一值接近行数 | 患者ID、病历号 |
| 自由文本 | 文本 + 唯一值比例高 | 诊断描述、备注 |
针对不同变量类型执行对应的分布分析:
连续型变量:
分类型变量:
日期型变量:
汇总所有探查结果,生成两份文件:
data_dictionary.md — 变量字典:
| 变量名 | 原始名 | 类型 | 描述 | 取值范围 | 缺失率 | 备注 |
data_profile_report.md — 完整画像报告:
data_dictionary.md — 结构化变量字典data_profile_report.md — 完整数据画像报告data_clean.csv(或对应格式)— 清洁的分析就绪数据集progress.md 中数据探查阶段状态