소스 정보
- 저장소
- hiyenwong/ai_collection
- 최근 소스 활동
- 2026년 7월 13일 02:00
- 감지된 SKILL.md 언어
- 중국어
- 스타
- 2
- 포크
- 0
설치 방법
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
소스 파일 검토
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
메뉴
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
직접 명령은 검토 Prompt를 거치지 않습니다. 실행하기 전에 소스를 확인하세요.
npx skills add https://github.com/hiyenwong/ai_collection --skill local-rl-alignment-engineering명령은 한 줄로 유지됩니다. 복사하기 전에 가로로 스크롤해 전체 내용을 확인하세요.
로컬 사본을 원하시나요? SkillsMP에서 현재 제공할 수 있는 파일을 다운로드하세요.
Graph-native Python reimplementation of the Information Dynamics of Music (IDyOM) model that represents predictive memories as explicit graph objects for musical expectation modeling and network analysis.
Physics-aware end-to-end deep reinforcement learning methodology for quadcopter control with actuator dynamics modeling.
Reinforced Dreamer methodology for asymmetric reinforcement learning using latent guidance to improve world model representations and behaviors in model-based RL.
SOC 직업 분류 기준
SKILL.md 표시 중
| name | local-rl-alignment-engineering |
| description | 本地基座模型强化学习对齐工程实践 - 涵盖 RLHF/DPO/GRPO 算法选型、显存优化、框架选择、数据工程与全流程实施指南 |
| version | 1.0.0 |
| author | 工程狮5号 |
| license | MIT |
| metadata | {"hermes":{"tags":["RLHF","DPO","GRPO","PPO","本地训练","显存优化","LoRA","QLoRA","对齐","强化学习"],"category":"ai_collection"}} |
当需要:
不要使用:
L_DPO = -E[log σ(β log(π_θ(y_w|x)/π_ref(y_w|x)) - β log(π_θ(y_l|x)/π_ref(y_l|x)))]
| 技术 | 7B 模型显存 | 硬件建议 | 场景 |
|---|---|---|---|
| 全量微调 | 100-120 GB | 2x A100 80GB | 极高性能要求 |
| LoRA | 16-24 GB | RTX 3090/4090 24GB | 快速实验,单卡 |
| QLoRA (4-bit) | 6-12 GB | RTX 3060 12GB | 显存受限,大模型 |
关键公式(7B BF16):
| 类型 | 关键字段 | 用途 |
|---|---|---|
| 指令数据 | instruction, input, output | SFT 基础能力 |
| 偏好数据 | chosen, rejected | DPO/RM/PPO 对齐 |
| KTO 数据 | response, kto_tag (true/false) | 二进制反馈对齐 |
PPO 超参数:
pref_beta: 0.1(KL 散度权重,输出怪异时调高)ppo_buffer_size: 控制采样/训练比例ppo_epochs: 过高会导致灾难性遗忘GRPO 超参数(参考 grpo-rl-training skill):
num_generations: 8-16learning_rate: 5e-6 ~ 1e-5在 M 系列 Mac 上训练,优先 MLX 或 PyTorch MPS 后端:
| 框架 | 显存(7B BF16) | M5 Max 128GB 表现 | GRPO 支持 |
|---|---|---|---|
| MLX(Apple 原生) | ~7 GB | 🔥 最快推理 (~2000 tok/s) | 需手写 REINFORCE |
| PyTorch MPS | ~14 GB + overhead | ✅ 兼容 TRL GRPOTrainer | ✅ 直接支持 |
| Unsloth(MPS) | ~5 GB(4-bit) | ⚡ Triton 内核部分支持 | ⚡ 实验性 |
| llama.cpp + 自定义 | ~4 GB(GGUF Q4) | 🔥 llama.cpp 原生 | 需手写 RL 循环 |
M5 Max 128GB 推荐配置:
| 预算级别 | 硬件 | 可训练模型 | 推荐框架 |
|---|---|---|---|
| 入门 | RTX 3060 12GB | 7B (QLoRA) | Unsloth |
| 入门 | Mac Mini M4 24GB | 7B (MLX 4-bit) | MLX |
| 主流 | RTX 4090 24GB | 14B (LoRA) | LLaMA-Factory |
| 主流 | MacBook Pro M4 Max 48GB | 7B-14B (BF16) | PyTorch MPS |
| 推荐 | Mac M5 Max 128GB | 7B-30B (BF16/4-bit) | MLX / PyTorch MPS |
| 进阶 | 2x 4090 | 30B (QLoRA) | OpenRLHF |
references/hf-model-research.md — HF API 模型搜索技巧