| name | exploratory-data-analysis |
| description | Use when exploring a dataset before formal analysis, modeling, reporting, or dashboarding. Profiles fields, missing values, distributions, outliers, relationships, data quality risks, and next analysis directions. |
Exploratory Data Analysis
目标
对一份数据集做探索性分析,先弄清楚“数据到底长什么样”,再决定后续如何分析、建模、做报表或写结论。
这个 Skill 不负责直接写完整业务报告,也不负责复杂建模。它负责在分析前把数据结构、质量问题、变量分布、异常值和初步关系讲清楚。
使用场景
使用这个 Skill,当用户需要:
- 拿到一张新表或一份 CSV/Excel 后先摸底
- 判断数据是否能用于后续分析
- 分析字段缺失、重复、异常值和类型问题
- 在做用户分析、销售分析、运营分析前建立数据认知
- 为建模、看板、分析报告准备数据画像
- 找出值得继续深入的维度和假设
典型输入:
请帮我对这份订单数据做 EDA,看哪些字段有质量问题,哪些方向值得继续分析。
不适用场景
不要用这个 Skill 直接完成:
- 漏斗分析,请使用
funnel-analysis
- 留存或 Cohort 分析,请使用
retention-cohort-analysis
- A/B 实验分析,请使用
ab-test-analysis
- 完整分析报告撰写,请使用
data-analysis-report-writer
- SQL 审查,请使用
sql-reviewer
如果用户只提供业务问题,没有任何数据字段或样例,先列出需要的数据,而不是假装已经完成 EDA。
输入信息
最少输入:
可选输入:
- 分析目标
- 业务背景
- 目标字段
- 时间字段
- 主键或唯一键
- 数据周期
- 数据量级
- 已知异常
上下文建议
推荐使用 数据分析上下文模板。
最有价值的上下文是:字段列表、数据粒度、时间字段、对象 ID、分析目标和已知异常。缺少真实数据样例时,只能设计 EDA 检查清单,不能声称已经发现具体分布或异常。
工作流程
- 识别数据对象:一行代表什么,字段大致分为哪些类型。
- 做结构检查:行数、列数、字段类型、主键候选、时间范围。
- 做质量检查:缺失率、重复行、重复主键、异常编码、混合类型。
- 做分布检查:数值字段的均值、中位数、分位数、偏度、极值;类别字段的 Top N 和占比。
- 做异常检查:离群点、突增突降、非法值、常量字段、高基数字段。
- 做关系探索:核心字段之间的相关性、分组差异、时间趋势、分层差异。
- 形成初步结论:数据是否可用、主要问题是什么、下一步该分析什么。
输出格式
## EDA 结果
### 1. 数据概览
| 项目 | 结果 |
| --- | --- |
| 数据对象 | |
| 数据粒度 | |
| 行数 | |
| 字段数 | |
| 时间范围 | |
| 主键/唯一键候选 | |
### 2. 字段画像
| 字段 | 类型 | 含义推测 | 缺失率 | 主要问题 |
| --- | --- | --- | --- | --- |
### 3. 数据质量问题
| 风险等级 | 问题 | 影响 | 建议 |
| --- | --- | --- | --- |
### 4. 分布与异常
### 5. 初步关系与模式
### 6. 可继续分析的方向
### 7. 待确认问题
质量标准
输出必须:
- 先说明数据粒度和可用性
- 区分数据质量问题和真实业务异常
- 不把相关性直接写成因果关系
- 对字段含义不确定时标记为推测
- 给出后续分析建议,而不是只罗列统计量
示例 Prompt
请用 exploratory-data-analysis 分析下面这张用户行为表:
粒度:一行一条用户事件
字段:user_id, event_time, event_name, page, channel, device, session_id
目标:判断是否能用于用户转化路径分析