Skip to main content
تشغيل أي مهارة في Manus
بنقرة واحدة

rlhf

النجوم٢٤
التفرعات٠
آخر تحديث٦ مايو ٢٠٢٦ في ٠٤:٣٥

Understanding Reinforcement Learning from Human Feedback (RLHF) for aligning language models. Use when learning about preference data, reward modeling, policy optimization, or direct alignment algorithms like DPO.

التثبيت

التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.

مستكشف الملفات
4 ملفات
SKILL.md
readonly