Skip to main content

eval-harness

Build a repeatable eval loop that grades agent output with an LLM judge, so prompt/skill changes get scored against a baseline instead of eyeballed. Reuses loopkit's verifier subagent as the grader — do not build a new one.

Ir a la instalación

Datos de origen

Repositorio
Archive228/loopkit
Última actividad en el origen
7 de julio de 2026 a las 20:58
Idioma detectado de SKILL.md
inglés
Estrellas
751
Forks
129

Opciones de instalación

De forma predeterminada está seleccionado el prompt que primero revisa el origen. Puedes cambiar a un comando directo o descargar una copia local.

Revisa los archivos de origen

Lee SKILL.md y los archivos complementarios que muestra SkillsMP antes de decidir si quieres instalarlo.