Skip to main content

rlhf

Understanding Reinforcement Learning from Human Feedback (RLHF) for aligning language models. Use when learning about preference data, reward modeling, policy optimization, or direct alignment algorithms like DPO.

インストールへ移動

ソース情報

リポジトリ
itsmostafa/llm-engineering-skills
ソースの最終更新活動
2026年5月6日 04:35
検出された SKILL.md の言語
英語
スター
23
フォーク
1

インストール方法

デフォルトでは、最初にソースを確認する Prompt が選択されています。直接コマンドに切り替えるか、ローカルコピーをダウンロードすることもできます。

ソースファイルを確認

インストールを決める前に、SKILL.md と SkillsMP に表示されている付属ファイルをお読みください。