Skip to main content

fine-tuning-with-trl

النجوم٢٢٠٬٩٠٤
التفرعات٤٢٬١١٦
آخر تحديث٢٤ يوليو ٢٠٢٦ في ١٥:١٨

TRL: SFT, DPO, GRPO, RLOO reward modeling for LLM RLHF.

التثبيت

التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.

مستكشف الملفات
7 ملفات
SKILL.md
readonly