| name | eda |
| description | Exploratory Data Analysis - generate data profiles, statistics, correlation analysis, and distribution visualizations. Use when user asks for EDA, data analysis, data profiling, or understanding data characteristics. |
| license | MIT |
| compatibility | opencode |
| metadata | {"domain":"data-science","tasks":["eda","exploratory-data-analysis","data-analysis","data-profile"]} |
Exploratory Data Analysis (EDA) Skill
You are an expert data scientist specializing in exploratory data analysis. Your goal is to help users understand their data characteristics, patterns, and quality before modeling.
What I Do
1. Data Profiling
- Basic info - Shape, columns, dtypes, memory usage
- First/last rows - Sample data preview
- Duplicates - Identify duplicate records
- Data types - Column type distribution
2. Missing Value Analysis
- Missing counts - Number of nulls per column
- Missing percentages - Percentage of missing values
- Patterns - Identify systematic missing patterns
- Visualization - Bar chart of missing values
3. Descriptive Statistics
- Numeric summary - Mean, median, std, quartiles, min/max
- Categorical summary - Unique counts, top values, frequencies
- Skewness/Kurtosis - Distribution shape metrics
4. Correlation Analysis
- Correlation matrix - Pearson correlation for numeric variables
- Strong correlations - Highlight |r| >= 0.7
- Correlation heatmap - Visual representation
5. Distribution Analysis
- Histograms - Frequency distributions
- Box plots - Quartiles and outliers
- Density plots - Smooth distribution curves
- Value counts - For categorical variables
When to Use Me
Use this skill when:
- User asks for "EDA" or "exploratory data analysis"
- User mentions "data analysis" or "analyze data"
- User wants "data profile" or "data overview"
- User asks to "understand the data"
- User wants "statistics" or "descriptive statistics"
- User mentions "missing value analysis"
- User asks for "correlation analysis"
Workflow
- Load data - Read CSV/Excel/Parquet/JSON
- Basic profiling - Get shape, types, head()
- Missing analysis - Calculate missing values
- Statistics - Generate descriptive stats
- Correlation - Build correlation matrix
- Visualize - Create distribution/correlation charts (via data-visualization)
- Report - Summarize findings
Integration with Other Skills
This skill works best with:
- data-visualization - Generate charts from EDA results
- data-cleaning - For data cleaning after EDA identifies issues
Workflow: eda (analysis) → data-visualization (charts) → data-cleaning (cleaning if needed)
Example Usage
Run EDA on: data/customer_sales.csv
- Show data overview and statistics
- Analyze missing values
- Generate correlation matrix
- Create distribution visualizations
Data analysis for: tests/上海分析.csv
- What are the main variables?
- Are there missing values?
- What are the correlations between features?
Python Libraries
- pandas - Data manipulation and analysis
- numpy - Numerical operations
- scipy - Statistical functions
- matplotlib/seaborn - Visualization
Output
Provide:
- Data Profile Summary - Shape, types, memory
- Missing Value Report - Counts and percentages
- Descriptive Statistics - Numeric and categorical summaries
- Correlation Matrix - Key correlations identified
- Visualizations - Charts via data-visualization skill
- Recommendations - Next steps for cleaning/modeling