Skip to main content

livemedbench-contamination-free-medical-benchmark

Build contamination-free LLM evaluation pipelines with multi-agent data curation and automated rubric-based scoring. Uses LiveMedBench's three-agent curation framework and bipolar rubric evaluation to assess LLM outputs against granular, case-specific criteria. Trigger phrases: 'build a contamination-free benchmark', 'evaluate LLM with rubrics', 'curate clinical test data', 'automated rubric evaluation pipeline', 'detect data contamination in LLMs', 'multi-agent data curation framework'.

Zur Installation springen

Quellinformationen

Repository
ndpvt-web/arxiv-claude-skills
Letzte Quellaktivität
13. Februar 2026 um 11:08
Erkannte Sprache von SKILL.md
Englisch
Sterne
14
Forks
3

Installationsoptionen

Standardmäßig ist der Prompt ausgewählt, der zuerst die Quelle prüft. Sie können zu einem direkten Befehl wechseln oder eine lokale Kopie herunterladen.

Quelldateien prüfen

Lesen Sie SKILL.md und alle von SkillsMP angezeigten Begleitdateien, bevor Sie sich für eine Installation entscheiden.