Skip to main content

evals

Objective eval metrics via code/model/human graders with pass@k/pass^k scoring. USE WHEN eval, evaluate, test agent, benchmark, verify behavior, regression test, capability test, run eval, compare models, compare prompts, create judge, create use case, view results, failure to task, suite manager, transcript capture, trial runner.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
danielmiessler/Personal_AI_Infrastructure
آخر نشاط في المصدر
١٥ مارس ٢٠٢٦ في ٢٢:١٠
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
١٥٬٩٦٧
التفرعات
٢٬٢٠٥

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.