Skip to main content
تشغيل أي مهارة في Manus
بنقرة واحدة

synthetic-self-improve-rl

النجوم٢٦
التفرعات٠
آخر تحديث٢٠ مايو ٢٠٢٦ في ١٦:٤٩

Teacher/student self-improvement loop. Claude post-trains a smaller student model on a real dataset via prime-rl, analyzes failed training traces, generates a 500-1000 row dataset targeting the model's weaknesses, wraps it as a verifiers environment, and re-trains in a loop until a wall-clock budget expires. Default student is Qwen/Qwen3-0.6B; override with --model. Use when the user types /synthetic-self-improve-rl <dataset>.

التثبيت

التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.

SKILL.md
readonly