en un clic
parallelism-strategy
[WIP] 大模型分布式并行策略选型参考。当前提供策略分类概览(TP/USP/RSP/CFG),
Installer avec Codex ou Claude Copiez ce prompt, collez-le dans Codex, Claude ou un autre assistant, puis laissez-le vérifier la page du skill et l'installer pour vous.
Menu
[WIP] 大模型分布式并行策略选型参考。当前提供策略分类概览(TP/USP/RSP/CFG),
Installer avec Codex ou Claude Copiez ce prompt, collez-le dans Codex, Claude ou un autre assistant, puis laissez-le vérifier la page du skill et l'installer pour vous.
Basé sur la classification professionnelle SOC
MindIE-SD 代码部署与编译安装。已在昇腾设备上直接编译安装;本地开发机通过 SSH 推送到远端昇腾设备, 支持 Docker 容器内源码编译。当用户需要部署安装 MindIE-SD、更新远端容器内代码、 或管理多人共享 NPU 环境时使用此 skill。 即使用户只提到"把代码推到服务器"而未说 SSH 或昇腾,只要上下文涉及部署都应触发。 由 dev-workflow 的部署阶段触发。
在远端昇腾 NPU 设备上采集性能 profiling 数据,打包回传本地供 performance-analysis 使用。 统一采集流程:开启 Profiler → 运行推理 → 压缩 → 回传(部署由 ascend-deploy 完成)。 当用户需要采集模型 profiling 数据、开启 profiler 跑推理、或为性能分析准备数据时使用此 skill。 即使用户只提到"帮我采一下 profile"或"开 profiler 跑这个模型",也应触发。 通常由 model-verification、ascend-deploy 或 performance-evaluation 的 NPU 路径路由触发。
端到端性能优化闭环,组合 profiling-collection、performance-analysis、performance-optimization 三个下层 skill 完成从 profiling 采集到方案实施的完整流程。 当用户需要完整优化模型推理性能、并确认优化效果时使用此 skill。 前置条件:模型已通过 ascend-deploy 部署至 NPU 设备且已验证可通过。 由 dev-workflow 的各阶段触发。
MindIE-SD Python 代码格式与 lint 规则。当编写、格式化、lint 检查或审查 MindIE-SD 项目的 Python 代码时使用此 skill。 即使用户只提到"提个MR"或"代码好像有 lint 问题"而未明确说格式化,也应触发。 通常由 dev-workflow 在编码阶段指引加载。
MindIE-SD 编译后端适配与分析。覆盖 Pattern 创建/注册/调试、Copy 算子消减、 四后端选择 (default / torchair_ge / npugraph_ex / aclgraph) 的全生命周期。 触发: "pattern", "compile", "Copy", "InplaceCopy", "fusion", "backend", "torchair_ge", "--npugraph", "register_replacement".
MindIE-SD 开发总入口。当用户进行 MindIE-SD 的任何开发工作时使用此 skill—— 包括但不限于写 pattern、改测试、部署到昇腾、跑 benchmark、性能分析、多卡并行、复盘归档。 即使用户未明确提到"开发流程",只要涉及 MindIE-SD 代码改动都应触发。
| name | parallelism-strategy |
| description | [WIP] 大模型分布式并行策略选型参考。当前提供策略分类概览(TP/USP/RSP/CFG), |
⚠️ WIP — 此 skill 尚未完成。 当前仅提供策略分类大纲,具体实施指南待后续补充。
| 策略 | 适用场景 | 通信模式 | 关键参数 |
|---|---|---|---|
| Ulysses 并行 | 多模态扩散模型(序列维度切分) | all-to-all | ulysses_size |
| CFG 并行 | 开启 classifier-free guidance 的模型 | 双分支独立推理 | cfg_parallel |
| 张量并行 (TP) | 单层参数量超单卡显存 | all-reduce / all-gather | tp_size |
| 环状序列并行 (RSP) | 长序列场景,通信可被计算掩盖 | P2P 环形传递 | world_size |
| 流水线并行 (PP) | 层数多、单层显存可承受 | send/recv | pp_size |
当新的并行策略经验证有效、多卡互联拓扑发生变化或发现新的分布式训练模式时, 按 dev-workflow 的复盘流程更新本 skill。