Skip to main content

fine-tuning-with-trl

スター220,904
フォーク42,116
更新日2026年7月24日 15:18

TRL: SFT, DPO, GRPO, RLOO reward modeling for LLM RLHF.

インストール

Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。

ファイルエクスプローラー
7 ファイル
SKILL.md
readonly