simpo-training
Simple Preference Optimization for LLM alignment. Reference-free alternative to DPO with better performance (+6.4 points on AlpacaEval 2.0). No reference model needed, more efficient than DPO. Use for preference alignment when want simpler, faster training than DPO/PPO.
Informations de source
- Dépôt
- synthetic-sciences/openscience
- Dernière activité de la source
- 4 juillet 2026 à 06:25
- Langue détectée de SKILL.md
- anglais
- Étoiles
- 3 362
- Forks
- 454
Options d'installation
Le prompt qui vérifie d'abord la source est sélectionné par défaut. Vous pouvez passer à une commande directe ou télécharger une copie locale.
Vérifiez les fichiers source
Lisez SKILL.md et les fichiers associés affichés par SkillsMP avant de décider de l'installer.