用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/hiyenwong/ai_collection --skill local-rl-alignment-engineering命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
基于 SOC 职业分类
正在显示 SKILL.md
| name | local-rl-alignment-engineering |
| description | 本地基座模型强化学习对齐工程实践 - 涵盖 RLHF/DPO/GRPO 算法选型、显存优化、框架选择、数据工程与全流程实施指南 |
| version | 1.0.0 |
| author | 工程狮5号 |
| license | MIT |
| metadata | {"hermes":{"tags":["RLHF","DPO","GRPO","PPO","本地训练","显存优化","LoRA","QLoRA","对齐","强化学习"],"category":"ai_collection"}} |
当需要:
不要使用:
L_DPO = -E[log σ(β log(π_θ(y_w|x)/π_ref(y_w|x)) - β log(π_θ(y_l|x)/π_ref(y_l|x)))]
| 技术 | 7B 模型显存 | 硬件建议 | 场景 |
|---|---|---|---|
| 全量微调 | 100-120 GB | 2x A100 80GB | 极高性能要求 |
| LoRA | 16-24 GB | RTX 3090/4090 24GB | 快速实验,单卡 |
| QLoRA (4-bit) | 6-12 GB | RTX 3060 12GB | 显存受限,大模型 |
关键公式(7B BF16):
| 类型 | 关键字段 | 用途 |
|---|---|---|
| 指令数据 | instruction, input, output | SFT 基础能力 |
| 偏好数据 | chosen, rejected | DPO/RM/PPO 对齐 |
| KTO 数据 | response, kto_tag (true/false) | 二进制反馈对齐 |
PPO 超参数:
pref_beta: 0.1(KL 散度权重,输出怪异时调高)ppo_buffer_size: 控制采样/训练比例ppo_epochs: 过高会导致灾难性遗忘GRPO 超参数(参考 grpo-rl-training skill):
num_generations: 8-16learning_rate: 5e-6 ~ 1e-5在 M 系列 Mac 上训练,优先 MLX 或 PyTorch MPS 后端:
| 框架 | 显存(7B BF16) | M5 Max 128GB 表现 | GRPO 支持 |
|---|---|---|---|
| MLX(Apple 原生) | ~7 GB | 🔥 最快推理 (~2000 tok/s) | 需手写 REINFORCE |
| PyTorch MPS | ~14 GB + overhead | ✅ 兼容 TRL GRPOTrainer | ✅ 直接支持 |
| Unsloth(MPS) | ~5 GB(4-bit) | ⚡ Triton 内核部分支持 | ⚡ 实验性 |
| llama.cpp + 自定义 | ~4 GB(GGUF Q4) | 🔥 llama.cpp 原生 | 需手写 RL 循环 |
M5 Max 128GB 推荐配置:
| 预算级别 | 硬件 | 可训练模型 | 推荐框架 |
|---|---|---|---|
| 入门 | RTX 3060 12GB | 7B (QLoRA) | Unsloth |
| 入门 | Mac Mini M4 24GB | 7B (MLX 4-bit) | MLX |
| 主流 | RTX 4090 24GB | 14B (LoRA) | LLaMA-Factory |
| 主流 | MacBook Pro M4 Max 48GB | 7B-14B (BF16) | PyTorch MPS |
| 推荐 | Mac M5 Max 128GB | 7B-30B (BF16/4-bit) | MLX / PyTorch MPS |
| 进阶 | 2x 4090 | 30B (QLoRA) | OpenRLHF |
references/hf-model-research.md — HF API 模型搜索技巧