Skip to main content

nlp-preference-optimization

Set up and run NLP preference optimization experiments (DPO, SimPO, CPO). Use this skill when configuring trainer environments, installing dependencies (torch, trl, transformers, peft), or running preference optimization unit tests. Triggers on: DPO, SimPO, preference optimization, trl trainer, RLHF, alignment training.

Aller à l'installation

Informations de source

Dépôt
cxcscmu/SkillLearnBench
Dernière activité de la source
24 avril 2026 à 05:14
Langue détectée de SKILL.md
anglais
Étoiles
77
Forks
4

Options d'installation

Le prompt qui vérifie d'abord la source est sélectionné par défaut. Vous pouvez passer à une commande directe ou télécharger une copie locale.

Vérifiez les fichiers source

Lisez SKILL.md et les fichiers associés affichés par SkillsMP avant de décider de l'installer.