ncu-profiling
Use for kernel-level analysis with Nsight Compute after a benchmark is reproducible.
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
Use for kernel-level analysis with Nsight Compute after a benchmark is reproducible.
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
Use when creating or revising CUDA benchmark runners and result artifacts.
Use when CUDA availability, compiler setup, or profiler visibility may be broken or inconsistent.
Use when designing or reviewing handwritten CUDA FlashAttention kernels.
Use when designing or reviewing handwritten CUDA GEMM kernels.
Use for stream overlap, launch overhead, and end-to-end CUDA timeline analysis with Nsight Systems.
Use when deciding whether a CUDA kernel is likely memory-bound or compute-bound.
استنادا إلى تصنيف SOC المهني
| name | ncu-profiling |
| description | Use for kernel-level analysis with Nsight Compute after a benchmark is reproducible. |
Use this skill for kernel-level analysis with Nsight Compute.
scripts/perf/profile-ncu.ps1.artifacts/profiles/.Do not make optimization claims from one metric alone.