원클릭으로
pypto-precision-overall
PyPTO 算子精度问题调试技能。提供场景路由式排查:根据用户问题自动选择排查路径,支持前端校验、Pass校验、特定问题排查、上板二分的自由组合。当需要调试 PyPTO 算子精度、定位精度差异来源时使用此技能。
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
메뉴
PyPTO 算子精度问题调试技能。提供场景路由式排查:根据用户问题自动选择排查路径,支持前端校验、Pass校验、特定问题排查、上板二分的自由组合。当需要调试 PyPTO 算子精度、定位精度差异来源时使用此技能。
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
SOC 직업 분류 기준
PyPTO Pass 编译性能优化技能。用于分析和优化 Pass 模块的编译性能,当 Pass 编译耗时过长需要优化时使用此技能。
定位测试案例中出现 aicore error 时的问题 CCE 文件和问题代码行。当用户说"aicore error"、"定位 aicore error 的原因"、"帮我定位 aicore error 报错"时使用此技能。也适用于用户直接提供 CCE 文件希望定位问题代码行或映射到源码的场景。
PyPTO 环境安装与环境问题修复,包括 CANN、torch_npu、编译工具链、第三方依赖和 PyPTO 编译运行等。触发词:PyPTO environment setup, CANN install, torch_npu, NPU environment, Ascend toolkit, compile PyPTO, build PyPTO, NPU driver, prepare_env, diagnose environment, fix import error, torch_npu import fail, DT_FP8E8M0, pto-isa, ASCEND_HOME_PATH, npu-smi, softmax verify, pip dependency conflict
分析当前 session 上下文,识别 PyPTO 框架或文档不完善导致的断裂点,产出可转化为 Issue 的结构化报告。当用户在 pypto 相关 skill 运行结束后提到"断裂点"、"识别断裂点"、"检测断裂点"、"fracture point"时触发此 skill。也适用于用户对 session 中遇到的问题进行复盘、想要生成问题报告、或希望改进 pypto 框架/文档质量的场景。
分析 host 侧捕获异常后的堆栈信息,通过地址到源码行映射和符号解析,定位问题代码位置。支持 Python traceback、C++ stack trace 和混合堆栈的自动识别与分析。支持编译Debug版本PyPTO包并定位具体代码行。Triggers:"堆栈分析"、"堆栈反汇编"、"分析堆栈信息"、"地址到源码行"、"stack trace"、"backtrace"
PyPTO MACHINE 内存重叠检测与修复技能。通过系统化流程检测和修复 workspace 内存重叠、内存管理策略问题导致的精度异常。当怀疑精度问题由内存重叠、workspace 不足、内存管理异常引起时使用此技能。触发词:内存重叠、内存重叠检测、workspace问题、内存管理异常、内存复用错误。
| name | pypto-precision-overall |
| description | PyPTO 算子精度问题调试技能。提供场景路由式排查:根据用户问题自动选择排查路径,支持前端校验、Pass校验、特定问题排查、上板二分的自由组合。当需要调试 PyPTO 算子精度、定位精度差异来源时使用此技能。 |
提供场景路由式排查流程,根据用户问题自动选择排查路径,支持各阶段的自由组合。
请选择排查场景:
1. 全自动排查 — 从前端到上板逐层排查
2. 只怀疑前端问题 — 只做 tensor_graph 校验
3. 验证VF/同步/合轴 — 直接验证开关配置问题
4. 前端校验后排查特定问题 — tensor_graph 校验后直接查VF/同步/合轴
5. 只跑Pass对比 — 只做 Pass 层校验
6. 直接上板二分 — 直接添加检查点二分定位
| 场景 | 触发关键词 | 路由链 |
|---|---|---|
| 全自动排查 | 精度问题、精度调试、精度不对 | tensor-graph → pass校验 → 特定排查 → 二分 |
| 只怀疑前端问题 | 前端校验、tensor_graph、构图问题 | tensor-graph → 结束 |
| 验证VF/同步/合轴 | VF融合、同步问题、合轴、开关验证 | 特定问题排查 → 结束 |
| 前端校验后排查特定问题 | 先查前端再用配置定界、先查构图再查开关、tensor_graph后查特定问题 | tensor-graph → 特定问题排查 |
| 只跑Pass对比 | pass校验、pass_compare、Pass层 | pass校验 → 结束 |
| 直接上板二分 | 二分、上板二分、检查点tensor | 二分 → 结束 |
[precision-tensor-graph] 算子写法校验 + tensor_graph 校验 + 中间 tensor 对比
│
├── 定位到前端构图错误 / 首个计算结果不同的 op ──→ 结束
│
│ tensor_graph PASS
▼
[precision-pass] PreCheck/PostCheck 全链路校验 + pass_compare 逐 Op 对比
│
├── 定位到引入偏差的 Pass 和具体 Op ──→ 结束
│
│ 所有 Pass 校验通过
▼
[precision-pass] 特定问题排查(同步/VF融合/合轴等开关配置验证)
│
├── 通过开关配置定位到问题 ──→ 结束
│
│ 仍未定位
▼
[precision-binary-search] 添加检查点 tensor + 二分对比上板真实数据
│
└── 定位到上板执行阶段首个出错 op ──→ 结束
执行步骤:
[precision-tensor-graph] 算子写法校验 + tensor_graph 校验 + 中间 tensor 对比
│
├── FAIL → 阶段二定位首个计算结果不同的 op ──→ 结束
│
└── PASS → 前端构图正确 ──→ 结束
执行步骤:
[precision-pass] 特定问题排查(直接进入,跳过 Pass 校验)
│
├── 通过开关配置定位到问题 ──→ 结束
│
└── 未定位 ──→ 结束
执行步骤:
[precision-tensor-graph] 算子写法校验 + tensor_graph 校验 + 中间 tensor 对比
│
├── FAIL → 阶段二定位问题 op ──→ 结束
│
│ PASS(跳过 Pass 校验)
▼
[precision-pass] 特定问题排查
│
├── 定位到 ──→ 结束
│
└── 未定位 ──→ 结束
执行步骤:
[precision-pass] PreCheck/PostCheck 全链路校验 + pass_compare 逐 Op 对比
│
├── 定位到问题 Op ──→ 结束
│
└── 未定位 ──→ 结束
执行步骤:
[precision-binary-search] 添加检查点 tensor + 二分对比上板真实数据
│
└── 定位到上板执行阶段首个出错 op ──→ 结束
执行步骤:
| 特性 | precision-tensor-graph | precision-pass | precision-binary-search |
|---|---|---|---|
| 定位目标 | 前端构图错误 / 首个计算不同的 op | 引入偏差的 Pass 和 Op / 开关配置问题 | 上板执行阶段首个出错 op |
| 实现方式 | pass_verify_save() + torch.save() 对比 | PreCheck/PostCheck + pass_compare + 开关验证 | 检查点 tensor 作为输入参数对比 |
| 代码修改 | 添加 pass_verify_save() 调用 | 配置 verify_options + tile_fwk_config.json | 修改 kernel 函数签名,添加检查点参数 |
| 使用难度 | 简单 | 中等 | 较复杂 |