ワンクリックで
pypto-precision-overall
PyPTO 算子精度问题调试技能。提供场景路由式排查:根据用户问题自动选择排查路径,支持前端校验、Pass校验、特定问题排查、上板二分的自由组合。当需要调试 PyPTO 算子精度、定位精度差异来源时使用此技能。
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
メニュー
PyPTO 算子精度问题调试技能。提供场景路由式排查:根据用户问题自动选择排查路径,支持前端校验、Pass校验、特定问题排查、上板二分的自由组合。当需要调试 PyPTO 算子精度、定位精度差异来源时使用此技能。
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
SOC 職業分類に基づく
PyPTO Pass 编译性能优化技能。用于分析和优化 Pass 模块的编译性能,当 Pass 编译耗时过长需要优化时使用此技能。
定位测试案例中出现 aicore error 时的问题 CCE 文件和问题代码行。当用户说"aicore error"、"定位 aicore error 的原因"、"帮我定位 aicore error 报错"时使用此技能。也适用于用户直接提供 CCE 文件希望定位问题代码行或映射到源码的场景。
PyPTO 环境安装与环境问题修复,包括 CANN、torch_npu、编译工具链、第三方依赖和 PyPTO 编译运行等。触发词:PyPTO environment setup, CANN install, torch_npu, NPU environment, Ascend toolkit, compile PyPTO, build PyPTO, NPU driver, prepare_env, diagnose environment, fix import error, torch_npu import fail, DT_FP8E8M0, pto-isa, ASCEND_HOME_PATH, npu-smi, softmax verify, pip dependency conflict
分析当前 session 上下文,识别 PyPTO 框架或文档不完善导致的断裂点,产出可转化为 Issue 的结构化报告。当用户在 pypto 相关 skill 运行结束后提到"断裂点"、"识别断裂点"、"检测断裂点"、"fracture point"时触发此 skill。也适用于用户对 session 中遇到的问题进行复盘、想要生成问题报告、或希望改进 pypto 框架/文档质量的场景。
分析 host 侧捕获异常后的堆栈信息,通过地址到源码行映射和符号解析,定位问题代码位置。支持 Python traceback、C++ stack trace 和混合堆栈的自动识别与分析。支持编译Debug版本PyPTO包并定位具体代码行。Triggers:"堆栈分析"、"堆栈反汇编"、"分析堆栈信息"、"地址到源码行"、"stack trace"、"backtrace"
PyPTO MACHINE 内存重叠检测与修复技能。通过系统化流程检测和修复 workspace 内存重叠、内存管理策略问题导致的精度异常。当怀疑精度问题由内存重叠、workspace 不足、内存管理异常引起时使用此技能。触发词:内存重叠、内存重叠检测、workspace问题、内存管理异常、内存复用错误。
| name | pypto-precision-overall |
| description | PyPTO 算子精度问题调试技能。提供场景路由式排查:根据用户问题自动选择排查路径,支持前端校验、Pass校验、特定问题排查、上板二分的自由组合。当需要调试 PyPTO 算子精度、定位精度差异来源时使用此技能。 |
提供场景路由式排查流程,根据用户问题自动选择排查路径,支持各阶段的自由组合。
请选择排查场景:
1. 全自动排查 — 从前端到上板逐层排查
2. 只怀疑前端问题 — 只做 tensor_graph 校验
3. 验证VF/同步/合轴 — 直接验证开关配置问题
4. 前端校验后排查特定问题 — tensor_graph 校验后直接查VF/同步/合轴
5. 只跑Pass对比 — 只做 Pass 层校验
6. 直接上板二分 — 直接添加检查点二分定位
| 场景 | 触发关键词 | 路由链 |
|---|---|---|
| 全自动排查 | 精度问题、精度调试、精度不对 | tensor-graph → pass校验 → 特定排查 → 二分 |
| 只怀疑前端问题 | 前端校验、tensor_graph、构图问题 | tensor-graph → 结束 |
| 验证VF/同步/合轴 | VF融合、同步问题、合轴、开关验证 | 特定问题排查 → 结束 |
| 前端校验后排查特定问题 | 先查前端再用配置定界、先查构图再查开关、tensor_graph后查特定问题 | tensor-graph → 特定问题排查 |
| 只跑Pass对比 | pass校验、pass_compare、Pass层 | pass校验 → 结束 |
| 直接上板二分 | 二分、上板二分、检查点tensor | 二分 → 结束 |
[precision-tensor-graph] 算子写法校验 + tensor_graph 校验 + 中间 tensor 对比
│
├── 定位到前端构图错误 / 首个计算结果不同的 op ──→ 结束
│
│ tensor_graph PASS
▼
[precision-pass] PreCheck/PostCheck 全链路校验 + pass_compare 逐 Op 对比
│
├── 定位到引入偏差的 Pass 和具体 Op ──→ 结束
│
│ 所有 Pass 校验通过
▼
[precision-pass] 特定问题排查(同步/VF融合/合轴等开关配置验证)
│
├── 通过开关配置定位到问题 ──→ 结束
│
│ 仍未定位
▼
[precision-binary-search] 添加检查点 tensor + 二分对比上板真实数据
│
└── 定位到上板执行阶段首个出错 op ──→ 结束
执行步骤:
[precision-tensor-graph] 算子写法校验 + tensor_graph 校验 + 中间 tensor 对比
│
├── FAIL → 阶段二定位首个计算结果不同的 op ──→ 结束
│
└── PASS → 前端构图正确 ──→ 结束
执行步骤:
[precision-pass] 特定问题排查(直接进入,跳过 Pass 校验)
│
├── 通过开关配置定位到问题 ──→ 结束
│
└── 未定位 ──→ 结束
执行步骤:
[precision-tensor-graph] 算子写法校验 + tensor_graph 校验 + 中间 tensor 对比
│
├── FAIL → 阶段二定位问题 op ──→ 结束
│
│ PASS(跳过 Pass 校验)
▼
[precision-pass] 特定问题排查
│
├── 定位到 ──→ 结束
│
└── 未定位 ──→ 结束
执行步骤:
[precision-pass] PreCheck/PostCheck 全链路校验 + pass_compare 逐 Op 对比
│
├── 定位到问题 Op ──→ 结束
│
└── 未定位 ──→ 结束
执行步骤:
[precision-binary-search] 添加检查点 tensor + 二分对比上板真实数据
│
└── 定位到上板执行阶段首个出错 op ──→ 结束
执行步骤:
| 特性 | precision-tensor-graph | precision-pass | precision-binary-search |
|---|---|---|---|
| 定位目标 | 前端构图错误 / 首个计算不同的 op | 引入偏差的 Pass 和 Op / 开关配置问题 | 上板执行阶段首个出错 op |
| 实现方式 | pass_verify_save() + torch.save() 对比 | PreCheck/PostCheck + pass_compare + 开关验证 | 检查点 tensor 作为输入参数对比 |
| 代码修改 | 添加 pass_verify_save() 调用 | 配置 verify_options + tile_fwk_config.json | 修改 kernel 函数签名,添加检查点参数 |
| 使用难度 | 简单 | 中等 | 较复杂 |