Skip to main content
تشغيل أي مهارة في Manus
بنقرة واحدة

fine-tuning-with-trl

النجوم٣
التفرعات٠
آخر تحديث٢٤ يونيو ٢٠٢٦ في ١٠:٢٣

Fine-tune LLMs using reinforcement learning with TRL - SFT for instruction tuning, DPO for preference alignment, PPO/GRPO for reward optimization, and reward model training. Use when need RLHF, align model with preferences, or train from human feedback. Works with HuggingFace Transformers.

التثبيت

التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.

مستكشف الملفات
5 ملفات
SKILL.md
readonly