| 1 | Problem Formulation | Étape initiale critique qui fixe la direction de tout le projet | Stakeholders, impact business, problème actionnable, tâche ML (classif/régression/clustering), critères de succès, scope + timeline |
| 2 | Data Collection | Extraire, curer & collecter les données nécessaires | Sources (API/scraping/datasets), features/attributs, contraintes (privacy/qualité/légalité), labels si supervisé |
| 3 | Data Preprocessing | Nettoyer, wrangler, curer & préparer les données (60-70 % du temps) | Intégration, nettoyage (doublons), encodage (label/one-hot), valeurs manquantes, scaling, outliers, split train/val/test |
| 4 | Feature Engineering | Créer, transformer ou sélectionner des features pour mieux capter les patterns | Création (combiner colonnes), transformation (normalisation, one-hot), sélection (corrélation/influence) |
| 5 | Modeling / Development | Choisir & entraîner le meilleur modèle selon objectifs/contraintes | Model selection (supervisé vs non), training = optimisation des paramètres (poids appris) |
| 6 | Evaluation | Mesurer la performance sur données non vues | Métriques par type (classif : accuracy/precision/recall/F1 ; régression : MSE/MAE/R² ; clustering : silhouette/Dunn), cross-validation (overfitting), model comparison = champion |
| 7 | Deployment | Intégrer le modèle dans un environnement de production | Choix d'environnement, intégration, API, scalabilité, sécurité |
| 8 | Monitoring | Garder le modèle efficace & fiable en conditions réelles | Performance en prod, détection de drift (data/concept/model), anomalies, scalabilité → déclenche le retraining |