Skip to main content
Ejecuta cualquier Skill en Manus
con un clic

rlhf

Estrellas24
Forks0
Actualizado6 de mayo de 2026 a las 04:35

Understanding Reinforcement Learning from Human Feedback (RLHF) for aligning language models. Use when learning about preference data, reward modeling, policy optimization, or direct alignment algorithms like DPO.

Instalación

Instalar con Codex o Claude Copia este prompt, pégalo en Codex, Claude u otro asistente, y deja que revise la página de la skill y la instale por ti.

Explorador de archivos
4 archivos
SKILL.md
readonly