local-rl-alignment-engineering
本地基座模型强化学习对齐工程实践 - 涵盖 RLHF/DPO/GRPO 算法选型、显存优化、框架选择、数据工程与全流程实施指南
معلومات المصدر
- المستودع
- hiyenwong/ai_collection
- آخر نشاط في المصدر
- ١٣ يوليو ٢٠٢٦ في ٠٢:٠٠
- لغة SKILL.md المكتشفة
- الصينية
- النجوم
- ٢
- التفرعات
- ٠
خيارات التثبيت
يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.
مراجعة ملفات المصدر
اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.