Skip to main content

model-finetuning

Fine-tune LLMs using reinforcement learning with TRL - SFT for instruction tuning, DPO for preference alignment, PPO/GRPO for reward optimization, and reward model training. Use when need RLHF, align model with preferences, or train from human feedback. Works with HuggingFace Transformers.

Ir a la instalación

Datos de origen

Repositorio
vuralserhat86/antigravity-agentic-skills
Última actividad en el origen
3 de enero de 2026 a las 12:19
Idioma detectado de SKILL.md
Varios idiomas
Estrellas
43
Forks
11

Opciones de instalación

De forma predeterminada está seleccionado el prompt que primero revisa el origen. Puedes cambiar a un comando directo o descargar una copia local.

Revisa los archivos de origen

Lee SKILL.md y los archivos complementarios que muestra SkillsMP antes de decidir si quieres instalarlo.