Skip to main content

llm-as-judge-evaluation

Evaluate LLM outputs using frontier models as judges. Use for pairwise model comparison, quality scoring with custom rubrics, and automated evaluation pipelines. Covers position bias mitigation, statistical significance, and generating preference data for DPO/RLHF.

Ir para a instalação

Informações da origem

Repositório
synthetic-sciences/openscience
Última atividade na origem
4 de julho de 2026 às 06:25
Idioma detectado do SKILL.md
inglês
Estrelas
3.362
Forks
454

Opções de instalação

Por padrão, está selecionado o prompt que primeiro revisa a origem. Você pode mudar para um comando direto ou baixar uma cópia local.

Revise os arquivos de origem

Leia o SKILL.md e os arquivos complementares exibidos pelo SkillsMP antes de decidir se vai instalar.