职业分类
数据科学家
描述
Post-train LLMs with TRL (Transformers Reinforcement Learning) — SFT, DPO, GRPO, KTO, and reward-model training. Use when writing or debugging training code with the TRL Python API or the trl CLI.
原文语言:英语
更新
菜单
SkillsMP 已收集 huggingface/trl 中的 1 个 Skill。打开任一 Skill 可查看来源和详情。
已展示 1 / 1 个已收集 Skill。
Post-train LLMs with TRL (Transformers Reinforcement Learning) — SFT, DPO, GRPO, KTO, and reward-model training. Use when writing or debugging training code with the TRL Python API or the trl CLI.
原文语言:英语