Skip to main content
تشغيل أي مهارة في Manus
بنقرة واحدة

unsloth-grpo

النجوم٤
التفرعات٠
آخر تحديث١٣ مارس ٢٠٢٦ في ٠٦:٢١

Run GRPO reinforcement learning training on gym tasks. Use when the user wants to train a model with RL rewards from test suites, format checks, or hybrid scoring.

التثبيت

التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.

SKILL.md
readonly