Skip to main content

llm-as-judge-evaluation

Evaluate LLM outputs using frontier models as judges. Use for pairwise model comparison, quality scoring with custom rubrics, and automated evaluation pipelines. Covers position bias mitigation, statistical significance, and generating preference data for DPO/RLHF.

Ir a la instalación

Datos de origen

Repositorio
synthetic-sciences/openscience
Última actividad en el origen
4 de julio de 2026 a las 06:25
Idioma detectado de SKILL.md
inglés
Estrellas
3362
Forks
454

Opciones de instalación

De forma predeterminada está seleccionado el prompt que primero revisa el origen. Puedes cambiar a un comando directo o descargar una copia local.

Revisa los archivos de origen

Lee SKILL.md y los archivos complementarios que muestra SkillsMP antes de decidir si quieres instalarlo.