unsloth-grpo
Implementation of Group Relative Policy Optimization (GRPO) for training reasoning models, optimized for 8x memory savings (triggers: GRPO, reasoning, DeepSeek-R1, reinforcement learning, RLVR, GRPOTrainer, thinking tokens).
Datos de origen
- Repositorio
- majiayu000/claude-skill-registry
- Última actividad en el origen
- 23 de junio de 2026 a las 12:15
- Idioma detectado de SKILL.md
- inglés
- Estrellas
- 543
- Forks
- 85
Opciones de instalación
De forma predeterminada está seleccionado el prompt que primero revisa el origen. Puedes cambiar a un comando directo o descargar una copia local.
Revisa los archivos de origen
Lee SKILL.md y los archivos complementarios que muestra SkillsMP antes de decidir si quieres instalarlo.