Skip to main content
تشغيل أي مهارة في Manus
بنقرة واحدة

research-lm-evaluation-harness

النجوم١
التفرعات٠
آخر تحديث١٣ يوليو ٢٠٢٦ في ٠٩:٢٨

Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, reporting academic results, or tracking trainin...

التثبيت

التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.

SKILL.md
readonly