Skip to main content

evals

Objective eval metrics via code/model/human graders with pass@k/pass^k scoring. USE WHEN eval, evaluate, test agent, benchmark, verify behavior, regression test, capability test, run eval, compare models, compare prompts, create judge, create use case, view results, failure to task, suite manager, transcript capture, trial runner.

Aller à l'installation

Informations de source

Dépôt
danielmiessler/Personal_AI_Infrastructure
Dernière activité de la source
15 mars 2026 à 22:10
Langue détectée de SKILL.md
anglais
Étoiles
15 967
Forks
2 205

Options d'installation

Le prompt qui vérifie d'abord la source est sélectionné par défaut. Vous pouvez passer à une commande directe ou télécharger une copie locale.

Vérifiez les fichiers source

Lisez SKILL.md et les fichiers associés affichés par SkillsMP avant de décider de l'installer.