Skip to main content

dpo

Direct Preference Optimization for learning from preference pairs. Covers DPOTrainer, preference dataset preparation, implicit reward modeling, and beta tuning for stable preference learning without explicit reward models. Includes thinking quality patterns.

跳到安装

来源信息

仓库
majiayu000/claude-skill-registry
最近来源活动
2026年6月23日 12:15
检测到的 SKILL.md 语言
英语
星标
543
分支
85

安装方式

默认使用会先检查来源的 Prompt;你也可以切换为直接命令,或下载本地副本。

检查来源文件

决定是否安装前,请先阅读 SKILL.md,以及 SkillsMP 当前展示的配套文件。