Skip to main content

evaluating-llms

Evaluate LLM systems using automated metrics, LLM-as-judge, and benchmarks. Use when testing prompt quality, validating RAG pipelines, measuring safety (hallucinations, bias), or comparing models for production deployment.

Ir para a instalação

Informações da origem

Repositório
ancoleman/ai-design-components
Última atividade na origem
9 de dezembro de 2025 às 21:02
Idioma detectado do SKILL.md
inglês
Estrelas
516
Forks
73

Opções de instalação

Por padrão, está selecionado o prompt que primeiro revisa a origem. Você pode mudar para um comando direto ou baixar uma cópia local.

Revise os arquivos de origem

Leia o SKILL.md e os arquivos complementares exibidos pelo SkillsMP antes de decidir se vai instalar.