nlp-preference-optimization
Set up and run NLP preference optimization experiments (DPO, SimPO, CPO). Use this skill when configuring trainer environments, installing dependencies (torch, trl, transformers, peft), or running preference optimization unit tests. Triggers on: DPO, SimPO, preference optimization, trl trainer, RLHF, alignment training.
Informações da origem
- Repositório
- cxcscmu/SkillLearnBench
- Última atividade na origem
- 24 de abril de 2026 às 05:14
- Idioma detectado do SKILL.md
- inglês
- Estrelas
- 77
- Forks
- 4
Opções de instalação
Por padrão, está selecionado o prompt que primeiro revisa a origem. Você pode mudar para um comando direto ou baixar uma cópia local.
Revise os arquivos de origem
Leia o SKILL.md e os arquivos complementares exibidos pelo SkillsMP antes de decidir se vai instalar.