| name | ydata-profiling |
| version | 1.0.0 |
| description | Automated data quality reports with comprehensive variable analysis, missing value detection, correlations, and HTML report generation - formerly pandas-profiling |
| type | reference |
| author | workspace-hub |
| category | data-analysis |
| capabilities | ["Automated data quality reports","Variable type inference and analysis","Missing value detection and patterns","Correlation analysis (Pearson, Spearman, Kendall, Phik)","Duplicate row detection","HTML report generation","Large dataset handling with minimal mode","Comparison reports between datasets","Time series analysis"] |
| tools | ["ydata-profiling","pandas","numpy","scipy","matplotlib"] |
| tags | ["ydata-profiling","pandas-profiling","data-quality","eda","profiling","missing-values","correlations","html-report","data-analysis"] |
| platforms | ["python"] |
| related_skills | ["autoviz","pandas-data-processing","polars","great-tables","streamlit"] |
| requires | [] |
| scripts_exempt | true |
Ydata Profiling
When to Use This Skill
USE YData Profiling when:
- Data quality assessment - Evaluating dataset health and completeness
- Initial data exploration - Understanding a new dataset quickly
- Missing value analysis - Detecting patterns in missing data
- Variable analysis - Understanding distributions and characteristics
- Data documentation - Creating shareable data quality reports
- Dataset comparison - Comparing training vs test data, or before/after
- Stakeholder reporting - Generating professional HTML reports
- Data validation - Checking data before ML model training
DON'T USE YData Profiling when:
- Real-time analysis - Need streaming data profiling
- Custom visualizations - Specific chart requirements
- Interactive dashboards - Use Streamlit or Dash instead
- Very large datasets - Over 10M rows (use sampling or minimal mode)
- Production pipelines - Need lightweight validation (use Great Expectations)
Prerequisites
pip install ydata-profiling
pip install 'ydata-profiling[all]'
uv pip install ydata-profiling pandas numpy
pip install ydata-profiling ipywidgets notebook
python -c "from ydata_profiling import ProfileReport; print('YData Profiling ready!')"
Complete Examples
Example 1: Data Quality Pipeline
from ydata_profiling import ProfileReport
import pandas as pd
import numpy as np
from datetime import datetime
import os
import json
(