Skip to main content
Ejecuta cualquier Skill en Manus
con un clic

research-lm-evaluation-harness

Estrellas1
Forks0
Actualizado13 de julio de 2026 a las 09:28

Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, reporting academic results, or tracking trainin...

Instalación

Instalar con Codex o Claude Copia este prompt, pégalo en Codex, Claude u otro asistente, y deja que revise la página de la skill y la instale por ti.

SKILL.md
readonly