Skip to main content
Ejecuta cualquier Skill en Manus
con un clic

synthetic-self-improve-rl

Estrellas26
Forks0
Actualizado20 de mayo de 2026 a las 16:49

Teacher/student self-improvement loop. Claude post-trains a smaller student model on a real dataset via prime-rl, analyzes failed training traces, generates a 500-1000 row dataset targeting the model's weaknesses, wraps it as a verifiers environment, and re-trains in a loop until a wall-clock budget expires. Default student is Qwen/Qwen3-0.6B; override with --model. Use when the user types /synthetic-self-improve-rl <dataset>.

Instalación

Instalar con Codex o Claude Copia este prompt, pégalo en Codex, Claude u otro asistente, y deja que revise la página de la skill y la instale por ti.

SKILL.md
readonly