Skip to main content

nlp-preference-optimization

Set up and run NLP preference optimization experiments (DPO, SimPO, CPO). Use this skill when configuring trainer environments, installing dependencies (torch, trl, transformers, peft), or running preference optimization unit tests. Triggers on: DPO, SimPO, preference optimization, trl trainer, RLHF, alignment training.

Ir para a instalação

Informações da origem

Repositório
cxcscmu/SkillLearnBench
Última atividade na origem
24 de abril de 2026 às 05:14
Idioma detectado do SKILL.md
inglês
Estrelas
77
Forks
4

Opções de instalação

Por padrão, está selecionado o prompt que primeiro revisa a origem. Você pode mudar para um comando direto ou baixar uma cópia local.

Revise os arquivos de origem

Leia o SKILL.md e os arquivos complementares exibidos pelo SkillsMP antes de decidir se vai instalar.