with one click
parallelism-strategy
[WIP] 大模型分布式并行策略选型参考。当前提供策略分类概览(TP/USP/RSP/CFG),
Install with Codex or Claude Copy this prompt, paste it into Codex, Claude, or another assistant, and let it review the skill page and install it for you.
Menu
[WIP] 大模型分布式并行策略选型参考。当前提供策略分类概览(TP/USP/RSP/CFG),
Install with Codex or Claude Copy this prompt, paste it into Codex, Claude, or another assistant, and let it review the skill page and install it for you.
Based on SOC occupation classification
MindIE-SD 代码部署与编译安装。已在昇腾设备上直接编译安装;本地开发机通过 SSH 推送到远端昇腾设备, 支持 Docker 容器内源码编译。当用户需要部署安装 MindIE-SD、更新远端容器内代码、 或管理多人共享 NPU 环境时使用此 skill。 即使用户只提到"把代码推到服务器"而未说 SSH 或昇腾,只要上下文涉及部署都应触发。 由 dev-workflow 的部署阶段触发。
在远端昇腾 NPU 设备上采集性能 profiling 数据,打包回传本地供 performance-analysis 使用。 统一采集流程:开启 Profiler → 运行推理 → 压缩 → 回传(部署由 ascend-deploy 完成)。 当用户需要采集模型 profiling 数据、开启 profiler 跑推理、或为性能分析准备数据时使用此 skill。 即使用户只提到"帮我采一下 profile"或"开 profiler 跑这个模型",也应触发。 通常由 model-verification、ascend-deploy 或 performance-evaluation 的 NPU 路径路由触发。
端到端性能优化闭环,组合 profiling-collection、performance-analysis、performance-optimization 三个下层 skill 完成从 profiling 采集到方案实施的完整流程。 当用户需要完整优化模型推理性能、并确认优化效果时使用此 skill。 前置条件:模型已通过 ascend-deploy 部署至 NPU 设备且已验证可通过。 由 dev-workflow 的各阶段触发。
MindIE-SD Python 代码格式与 lint 规则。当编写、格式化、lint 检查或审查 MindIE-SD 项目的 Python 代码时使用此 skill。 即使用户只提到"提个MR"或"代码好像有 lint 问题"而未明确说格式化,也应触发。 通常由 dev-workflow 在编码阶段指引加载。
MindIE-SD 编译后端适配与分析。覆盖 Pattern 创建/注册/调试、Copy 算子消减、 四后端选择 (default / torchair_ge / npugraph_ex / aclgraph) 的全生命周期。 触发: "pattern", "compile", "Copy", "InplaceCopy", "fusion", "backend", "torchair_ge", "--npugraph", "register_replacement".
MindIE-SD 开发总入口。当用户进行 MindIE-SD 的任何开发工作时使用此 skill—— 包括但不限于写 pattern、改测试、部署到昇腾、跑 benchmark、性能分析、多卡并行、复盘归档。 即使用户未明确提到"开发流程",只要涉及 MindIE-SD 代码改动都应触发。
| name | parallelism-strategy |
| description | [WIP] 大模型分布式并行策略选型参考。当前提供策略分类概览(TP/USP/RSP/CFG), |
⚠️ WIP — 此 skill 尚未完成。 当前仅提供策略分类大纲,具体实施指南待后续补充。
| 策略 | 适用场景 | 通信模式 | 关键参数 |
|---|---|---|---|
| Ulysses 并行 | 多模态扩散模型(序列维度切分) | all-to-all | ulysses_size |
| CFG 并行 | 开启 classifier-free guidance 的模型 | 双分支独立推理 | cfg_parallel |
| 张量并行 (TP) | 单层参数量超单卡显存 | all-reduce / all-gather | tp_size |
| 环状序列并行 (RSP) | 长序列场景,通信可被计算掩盖 | P2P 环形传递 | world_size |
| 流水线并行 (PP) | 层数多、单层显存可承受 | send/recv | pp_size |
当新的并行策略经验证有效、多卡互联拓扑发生变化或发现新的分布式训练模式时, 按 dev-workflow 的复盘流程更新本 skill。