Skip to main content

rlhf-systems

Human-feedback-driven model optimization — preference data collection, reward modeling, policy updates, and alignment evaluation.

Aller à l'installation

Informations de source

Dépôt
a5c-ai/babysitter
Dernière activité de la source
7 mai 2026 à 20:19
Langue détectée de SKILL.md
anglais
Étoiles
1 652
Forks
96

Options d'installation

Le prompt qui vérifie d'abord la source est sélectionné par défaut. Vous pouvez passer à une commande directe ou télécharger une copie locale.

Vérifiez les fichiers source

Lisez SKILL.md et les fichiers associés affichés par SkillsMP avant de décider de l'installer.