simpo-training
Simple Preference Optimization for LLM alignment. Reference-free alternative to DPO with better performance (+6.4 points on AlpacaEval 2.0). No reference model needed, more efficient than DPO. Use for preference alignment when want simpler, faster training than DPO/PPO.
Datos de origen
- Repositorio
- synthetic-sciences/openscience
- Última actividad en el origen
- 4 de julio de 2026 a las 06:25
- Idioma detectado de SKILL.md
- inglés
- Estrellas
- 3362
- Forks
- 454
Opciones de instalación
De forma predeterminada está seleccionado el prompt que primero revisa el origen. Puedes cambiar a un comando directo o descargar una copia local.
Revisa los archivos de origen
Lee SKILL.md y los archivos complementarios que muestra SkillsMP antes de decidir si quieres instalarlo.