Skip to main content

rlhf

Understanding Reinforcement Learning from Human Feedback (RLHF) for aligning language models. Use when learning about preference data, reward modeling, policy optimization, or direct alignment algorithms like DPO.

Ir para a instalação

Informações da origem

Repositório
itsmostafa/llm-engineering-skills
Última atividade na origem
6 de maio de 2026 às 04:35
Idioma detectado do SKILL.md
inglês
Estrelas
23
Forks
1

Opções de instalação

Por padrão, está selecionado o prompt que primeiro revisa a origem. Você pode mudar para um comando direto ou baixar uma cópia local.

Revise os arquivos de origem

Leia o SKILL.md e os arquivos complementares exibidos pelo SkillsMP antes de decidir se vai instalar.