Skip to main content

evaluating-llms

Evaluate LLM systems using automated metrics, LLM-as-judge, and benchmarks. Use when testing prompt quality, validating RAG pipelines, measuring safety (hallucinations, bias), or comparing models for production deployment.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
ancoleman/ai-design-components
آخر نشاط في المصدر
٩ ديسمبر ٢٠٢٥ في ٢١:٠٢
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
٥١٦
التفرعات
٧٣

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.