Monitoring & observabilité — Prometheus pour la collecte de métriques, Alertmanager pour les alertes, Grafana pour les dashboards, Loki pour les logs, bonnes pratiques SRE
Standardmäßig ist der Prompt ausgewählt, der zuerst die Quelle prüft. Sie können zu einem direkten Befehl wechseln oder eine lokale Kopie herunterladen.
Quelldateien prüfen
Lesen Sie SKILL.md und alle von SkillsMP angezeigten Begleitdateien, bevor Sie sich für eine Installation entscheiden.
Mit Codex oder Claude installieren Kopieren Sie diesen Prompt, fügen Sie ihn in Codex, Claude oder einen anderen Assistant ein und lassen Sie die Skill-Seite prüfen und installieren.
Ein direkter Befehl überspringt den Prüf-Prompt. Prüfen Sie die Quelle, bevor Sie ihn ausführen.
Monitoring & observabilité — Prometheus pour la collecte de métriques, Alertmanager pour les alertes, Grafana pour les dashboards, Loki pour les logs, bonnes pratiques SRE
Prometheus (collecte de métriques) + Grafana (visualisation) + Alertmanager (notifications) forment la stack de monitoring standard dans l'écosystème cloud-native. Cette compétence couvre l'installation, la configuration, l'écriture de règles d'alerte, la création de dashboards, l'intégration Loki pour les logs, et les patterns SRE (Service Level Objectives).
Quand l'utiliser
Monitorer les métriques d'infrastructure (CPU, RAM, disque, réseau)
Surveiller des applications custom avec endpoints Prometheus
Créer des dashboards Grafana pour visualiser les KPIs
Mettre en place des alertes (Slack, PagerDuty, Telegram, email)
Centraliser les logs avec Loki et les corréler aux métriques
Rétention trop courte : 7 jours par défaut. En production, 30 jours minimum (--storage.tsdb.retention.time=30d).
Trop de métriques cardinales : Des labels comme request_id ou user_email explosent la cardinalité. Éviter les labels uniques.
Sondes Alertmanager sans groupement : 100 alertes par seconde pour un même incident submerge tout le monde. Grouper par alertname, cluster.
Dashboard sans variables : Un dashboard codé en dur pour un serveur ne sert à rien pour 50 serveurs. Ajouter des variables $instance, $job.
Promtail lit tout Docker : Sans filtrage, promtail ingère les logs de TOUS les conteneurs, même ceux non monitorés. Filtrer par label.
Absence de scrape targets :promtool check config prometheus.yml ne vérifie pas la résolution DNS. Tester avec curl http://target:9090/metrics.
9. SLO / SLI / SLA — Patterns SRE
# Exemple : SLO 99.9% de disponibilité API sur 30 joursgroups:-name:slorules:-record:job:slo_errors_total:ratio_rate1hexpr:|
sum(rate(http_requests_total{status=~"5.."}[1h]))
/
sum(rate(http_requests_total[1h]))
-record:job:slo_burn_rateexpr:|
job:slo_errors_total:ratio_rate1h / (1 - 0.999)
-alert:SLOWarningexpr:job:slo_burn_rate>1for:1hlabels:severity:warningannotations:summary:"Burn rate SLO > 1x (atteindra le budget en 30j)"
10. Checklist Production
Rétention Prometheus configurée (≥30 jours)
Règles d'alerte testées avec promtool test rules rules/alerts.yml
Alertmanager avec groupement et répétition raisonnable