Skip to main content
Ejecuta cualquier Skill en Manus
con un clic

eval-harness

Estrellas4
Forks1
Actualizado9 de julio de 2026 a las 09:49

Automated evaluation harness for measuring agent and LLM performance, preventing regressions, and enabling eval-driven development. Use when setting up systematic quality gates for AI-assisted workflows or when you need measurable pass/fail criteria for non-deterministic outputs. Distinguishes itself through pass@k/pass^k metrics, LLM-as-judge patterns, cost tracking per eval run, and CI/CD integration with coverage mapping.

Instalación

Instalar con Codex o Claude Copia este prompt, pégalo en Codex, Claude u otro asistente, y deja que revise la página de la skill y la instale por ti.

SKILL.md
readonly