Skip to main content

benchmark-audit

Automatically evaluates an LLM coding benchmark result using a standardized 0-100 rubric across 8 dimensions. Use when a benchmark finishes, when the user asks to evaluate a model, analyze a run's quality, or generate a score for a result. Also activates for 'score', 'evaluate benchmark', 'audit model', or 'analyze result'.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
akitaonrails/llm-coding-benchmark
آخر نشاط في المصدر
١١ مايو ٢٠٢٦ في ٢٣:٢٢
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
٢٩٨
التفرعات
٣٨

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.