Skip to main content

qwopus27b-rl-training

Prepare, validate, launch-plan, monitor, resume, and stop configurable Qwopus 27B reinforcement-learning workflows for GRPO or GSPO. Use when Codex needs to turn an editable Goal template and user config into a safe local or SSH RL training plan without overstating dry-run results or relabeling SFT, GRPO, GSPO, or other algorithms.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
R6410418/Jackrong-llm-finetuning-guide
آخر نشاط في المصدر
٣١ مايو ٢٠٢٦ في ١٥:٣٤
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
١٬٦٥٢
التفرعات
٢٦٥

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.