Skip to main content

simpo-loss

Implement the SimPO (Simple Preference Optimization) loss function for LLM alignment. Use this skill whenever implementing SimPO training objectives, reference-free reward optimization, or Bradley-Terry preference loss with target reward margin. Triggers on: SimPO, preference optimization loss, average log probability reward, gamma margin.

Aller à l'installation

Informations de source

Dépôt
cxcscmu/SkillLearnBench
Dernière activité de la source
24 avril 2026 à 05:14
Langue détectée de SKILL.md
anglais
Étoiles
77
Forks
4

Options d'installation

Le prompt qui vérifie d'abord la source est sélectionné par défaut. Vous pouvez passer à une commande directe ou télécharger une copie locale.

Vérifiez les fichiers source

Lisez SKILL.md et les fichiers associés affichés par SkillsMP avant de décider de l'installer.