Skip to main content

community-fine-tuning-with-trl

Fine-tune LLMs using reinforcement learning with TRL - SFT for instruction tuning, DPO for preference alignment, PPO/GRPO for reward optimization, and reward model training. Use when need RLHF, align model with preferences, or train from human feedback. Works with HuggingFace Transformers.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
ArgentAIOS/argentos-core
آخر نشاط في المصدر
٢٧ أبريل ٢٠٢٦ في ٠١:٣٥
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
١٢٥
التفرعات
٢٢

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.