Skip to main content

validate-evaluator

Calibrate LLM-as-Judge evaluators against human labels. Computes TPR, TNR, precision, recall, F1, and Cohen's kappa. Detects systematic biases and recommends prompt corrections. Produces a calibration report with confidence intervals. Triggers on: "validate evaluator", "calibrate judge", "judge accuracy", "evaluator validation", "judge metrics"

Ir a la instalación

Datos de origen

Repositorio
Miosa-osa/canopy
Última actividad en el origen
16 de agosto de 2026 a las 14:17
Idioma detectado de SKILL.md
inglés
Estrellas
228
Forks
54

Opciones de instalación

De forma predeterminada está seleccionado el prompt que primero revisa el origen. Puedes cambiar a un comando directo o descargar una copia local.

Revisa los archivos de origen

Lee SKILL.md y los archivos complementarios que muestra SkillsMP antes de decidir si quieres instalarlo.