Skip to main content

run-evaluation

Run a VLA model evaluation against a simulation benchmark. Use this skill whenever the user wants to evaluate, benchmark, test, or run a model on a sim environment — even if they say it casually like 'try OpenVLA on LIBERO' or 'get me CALVIN scores'. Covers the full workflow: serving the model, launching the benchmark, sharding for speed, merging results, and interpreting output.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
allenai/vla-evaluation-harness
آخر نشاط في المصدر
١ يوليو ٢٠٢٦ في ٠٩:٤٥
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
٥٩٠
التفرعات
٤٩

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.