Skip to main content
تشغيل أي مهارة في Manus
بنقرة واحدة

eval-design

النجوم٢
التفرعات٠
آخر تحديث١٢ يوليو ٢٠٢٦ في ٠٠:٢٣

Design an LLM/agentic eval that can change a decision — a task + a model or agent under test producing fresh output + a grader — and separate real capability evals from instrumentation (linters, CI gates, KPIs). For proving a harness skill earns its keep, use /skill-eval instead. Use when: designing or critiquing an eval, building an eval corpus, designing or calibrating an LLM-as-judge, or comparing models/harnesses on a measured capability. Trigger: /eval-design.

التثبيت

التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.

مستكشف الملفات
5 ملفات
SKILL.md
readonly