gemm-kernel-design
Use when designing or reviewing handwritten CUDA GEMM kernels.
Instalar con Codex o Claude Copia este prompt, pégalo en Codex, Claude u otro asistente, y deja que revise la página de la skill y la instale por ti.
Menú
Use when designing or reviewing handwritten CUDA GEMM kernels.
Instalar con Codex o Claude Copia este prompt, pégalo en Codex, Claude u otro asistente, y deja que revise la página de la skill y la instale por ti.
Basado en la clasificación ocupacional SOC
Use when creating or revising CUDA benchmark runners and result artifacts.
Use when CUDA availability, compiler setup, or profiler visibility may be broken or inconsistent.
Use when designing or reviewing handwritten CUDA FlashAttention kernels.
Use for kernel-level analysis with Nsight Compute after a benchmark is reproducible.
Use for stream overlap, launch overhead, and end-to-end CUDA timeline analysis with Nsight Systems.
Use when deciding whether a CUDA kernel is likely memory-bound or compute-bound.
| name | gemm-kernel-design |
| description | Use when designing or reviewing handwritten CUDA GEMM kernels. |
Use this skill when building or reviewing GEMM kernels.