Skip to main content

fine-tuning-with-trl

星标220,904
分支42,116
更新时间2026年7月24日 15:18

TRL: SFT, DPO, GRPO, RLOO reward modeling for LLM RLHF.

安装

用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。

文件资源管理器
7 个文件
SKILL.md
readonly