Skip to main content
تشغيل أي مهارة في Manus
بنقرة واحدة

agent-benchmark

النجوم١٠
التفرعات٢
آخر تحديث٤ يونيو ٢٠٢٦ في ٢١:١٢

Run agent tasks across multiple LLMs in parallel tmux sessions, score results with a weighted rubric, track improvements over time in JSONL, and generate harness improvement recommendations. Use when comparing model performance, evaluating harness changes, or identifying agent failure patterns at scale.

التثبيت

التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.

مستكشف الملفات
6 ملفات
SKILL.md
readonly