職業分類
データサイエンティスト
説明
Post-train LLMs with TRL (Transformers Reinforcement Learning) — SFT, DPO, GRPO, KTO, and reward-model training. Use when writing or debugging training code with the TRL Python API or the trl CLI.
原文の言語: 英語
更新
メニュー
SkillsMP は huggingface/trl から 1 件の skill を収集しています。skill を開くとソースと詳細を確認できます。
収集済み skill 1 件中 1 件を表示しています。
Post-train LLMs with TRL (Transformers Reinforcement Learning) — SFT, DPO, GRPO, KTO, and reward-model training. Use when writing or debugging training code with the TRL Python API or the trl CLI.
原文の言語: 英語