Skip to main content

ai-evaluation-suite

Comprehensive AI/LLM evaluation toolkit for production AI systems. Covers LLM output quality, prompt engineering, RAG evaluation, agent performance, hallucination detection, bias assessment, cost/token optimization, latency metrics, model comparison, and fine-tuning evaluation. Includes BLEU/ROUGE metrics, perplexity, F1 scores, LLM-as-judge patterns, and benchmarks like MMLU and HumanEval.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
majiayu000/claude-skill-registry
آخر نشاط في المصدر
٢٣ يونيو ٢٠٢٦ في ١٢:١٥
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
٥٤٣
التفرعات
٨٥

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.