Skip to main content

eval-design

Use when the user needs to design evaluation datasets, create test cases, stratify samples, generate adversarial examples, extract eval dimensions from traces/specs, or build a labeled evaluation set. Also use when the user mentions test data design, eval coverage, difficulty stratification, synthetic data generation for eval, or "how to create good evaluation data." Outputs datasets in OpenJudge-compatible format.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
agentscope-ai/OpenJudge
آخر نشاط في المصدر
٨ يوليو ٢٠٢٦ في ٠٩:٥٥
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
٨٠٦
التفرعات
٦٤

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.