Skip to main content
burtenshaw
ملف منشئ GitHub

burtenshaw

عرض على مستوى المستودعات لـ ١٦ skills مجمعة عبر ٦ مستودعات GitHub.

skills مجمعة
١٦
مستودعات
٦
محدث
١٥ يونيو ٢٠٢٦
مستكشف المستودعات

المستودعات و skills الممثلة

agentic-self-distillation
مطوّرو البرمجيات

Use when designing or reviewing self-distillation workflows for agentic models, including trace collection, teacher or judge feedback, rejection sampling, critique, conversion to SFT or preference data, iterative TRL training loops, and safeguards against…

١٥ يونيو ٢٠٢٦
hugging-face-cli-workflows
مطوّرو البرمجيات

Use when working with Hugging Face CLI or Hub workflows for TRL training, including auth, repositories, uploads, downloads, Jobs, buckets, model persistence, dataset checks, Space links, and remote artifact movement.

١٥ يونيو ٢٠٢٦
openenv-agentic-rl
مطوّرو البرمجيات

Use when designing, reviewing, or implementing OpenEnv-style environment interfaces for agentic RL with TRL, including reset/step/state contracts, tasksets, Docker or HTTP/WebSocket serving, MCP compatibility, reward separation, and GRPO environment rollouts.

١٥ يونيو ٢٠٢٦
trackio-observability
مطوّرو البرمجيات

Use when instrumenting or inspecting TRL training runs with Trackio, run names, metric schemas, dashboards, logs, grep or ripgrep, SFTP, Hugging Face Job logs, remote artifacts, or experiment result summaries.

١٥ يونيو ٢٠٢٦
trl-post-training
مطوّرو البرمجيات

Use when building, reviewing, or editing TRL post-training workflows for agentic applications, including SFT, DPO, GRPO, RLOO, reward modeling, dataset formats, chat templates, assistant/completion-only losses, tool-calling data, reward functions, and…

١٥ يونيو ٢٠٢٦
trl-sft
مطوّرو البرمجيات

Use when designing, implementing, reviewing, or debugging supervised fine-tuning with TRL SFTTrainer or `trl sft`, especially for agentic models trained on chat messages, prompt/completion data, tool-calling examples, assistant-only loss, completion-only…

١٥ يونيو ٢٠٢٦
عرض ٦ من أصل ٦ مستودعات
تم تحميل كل المستودعات