Skip to main content

livemedbench-contamination-free-medical-benchmark

Build contamination-free LLM evaluation pipelines with multi-agent data curation and automated rubric-based scoring. Uses LiveMedBench's three-agent curation framework and bipolar rubric evaluation to assess LLM outputs against granular, case-specific criteria. Trigger phrases: 'build a contamination-free benchmark', 'evaluate LLM with rubrics', 'curate clinical test data', 'automated rubric evaluation pipeline', 'detect data contamination in LLMs', 'multi-agent data curation framework'.

Ir a la instalación

Datos de origen

Repositorio
ndpvt-web/arxiv-claude-skills
Última actividad en el origen
13 de febrero de 2026 a las 11:08
Idioma detectado de SKILL.md
inglés
Estrellas
14
Forks
3

Opciones de instalación

De forma predeterminada está seleccionado el prompt que primero revisa el origen. Puedes cambiar a un comando directo o descargar una copia local.

Revisa los archivos de origen

Lee SKILL.md y los archivos complementarios que muestra SkillsMP antes de decidir si quieres instalarlo.