بنقرة واحدة
compute-graph-viewer
يحتوي compute-graph-viewer على 10 من skills المجمعة من yinyucheng0601، مع تغطية مهنية على مستوى المستودع وصفحات skill داخل الموقع.
Skills في هذا المستودع
面向 Ascend PyTorch Profiler / msprof DB(如 ascend_pytorch_profiler*.db、msprof_*.db)的 SQL 分析技能。将自然语言问题(算子耗时、通信、下发、调度、schema/table 查询)转为安全可执行 SQL,并按需从官方文档提取表结构详情。
计算算子(如 matmul/GEMM/FlashAttention)的 MFU(Machine FLOP Utilization),并给出清晰的公式和推导过程。支持两类输入:用户手填维度,或从 Ascend PyTorch Profiler 落盘(kernel_details.csv / *.db)批量提取 shape+耗时后聚合 MFU(含转置安全的 M/N/K 推导、cube_utilization 与 MFU 的区别、算子达成率 vs 端到端 step MFU 两种口径)。
为一次性能 profiling 数据计算 0-100 的性能健康度评分 (PHS, Performance Health Score) 与等级 (S/A/B+/B/C/D),作为报告"结论速览"首行的仪表盘指标。复合公式涵盖计算利用率、通信效率、调度效率、内存带宽利用率四个子项;按工作负载场景(大模型多卡训练 / 单卡训练或推理 / 单算子调优 / 集群慢卡)自动切换权重;子项缺数据时按比例归一化剩余权重。另含一个独立诊断指标"显存容量利用率(HBM 占用率,从 memory_record.csv / npu_module_mem.csv / NPU_MEM 表提取,不计入 PHS)",用于回答显存占用 / OOM 风险类问题。
面向 Ascend Profiling timeline(trace_view.json / msprof_*.json 及 db 中带 startNs/endNs 的区间表)的"泳道时序结构"分析技能。专门补齐聚合统计型 skill 无法给出的几何派生指标——关键路径(最长链路)、计算-通信重叠率、算子利用率(AI Core time-based)、泳道空挡比例、PP 流水线 bubble 率、step 间抖动、通信抖动(逐 step 通信 CV)、per-step 周期归一,以及推理 prefill/decode 时序拆解。
基于 msprof op 工具的端到端 Ascend NPU 算子性能调优技能。当用户提供算子源码目录,并要求使用 msprof op 完成从性能采集、瓶颈分析、代码优化到优化效果验证的完整闭环时,必须使用此 skill。典型触发词包括"端到端调优"、"代码优化"、"msprof op 调优"、"完整调优"、"性能优化闭环"、"端到端"、"调优全流程"。此 skill 自动执行:编译运行 → msprof op 上板/仿真性能采集 → 瓶颈诊断 → 代码优化 → 重新采集 → 优化前后性能对比。注意:此 skill 专门使用 msprof op 工具进行性能采集和分析,覆盖 msot-msopprof-operator-profiler(纯分析),并额外包含编译运行和性能采集的自动化流程。
专门用于 Ascend 集群 Profiling 性能数据的"快慢卡"诊断专家技能。当用户提供【集群性能数据目录/路径】并要求分析【快慢卡】、【慢节点】、【负载不均衡】或【集群瓶颈】时,必须触发此技能。该技能会自动接收集群路径,调度相关工具输出快慢卡的宏观定性与微观根因(如 Host 下发瓶颈、算子计算劣化)。
当用户希望使用 msOpProf(`msprof op` / `msprof op simulator`)对昇腾 AI 算子做上板或仿真性能调优、解释 `aic-metrics`/`trace.json`/`visualize_data.bin`、选择 device vs simulator 路径、排查 `--soc-version`/`--export`/`signal 6`/`Bad address`/热点图或流水图相关问题,或要求生成固定分析报告模板(算子基本信息 / 关键数据 TOP5 / 核心瓶颈 TOP5 / 优化建议 TOP5)时,使用本技能。它负责先判定模式、输入形态与芯片/能力边界,再给出正确命令、结果解读、固定报告输出与高频踩坑规避;不要把经验案例当成通用规则。
MindStudio Profiler Analyze(msprof-analyze)是面向 AI 训练与推理场景的性能分析工具,基于采集得到的 profiling 数据进行统计、比对和诊断,帮助定位计算、通信、调度及集群场景下的性能瓶颈。
多卡分布式训练中的 loss/gnorm 精度溢出检测与根因追溯。基于 MSProbe dump 数据,先跨 rank 定位首次出现 NaN 的源卡,再在源卡上追溯具体的溢出根因算子。 当用户需要:(1) 多卡分布式训练场景下的 NaN/Inf 溢出检测 (2) 找出首先出现 NaN 的源卡 (3) 追溯根因计算算子 (4) loss/gnorm NaN 问题定位 时使用此 skill。
End-to-end root cause analysis for train vs rollout dump mismatches. Use when module mapping/value compare is not enough and you need to trace the first credible divergence boundary, filter out fused or structural false positives, follow producer-consumer chains, and generate a root-cause report with concrete hypotheses and evidence.