Optimize Fused Mixture-of-Experts (MoE) kernels in Triton for NVIDIA and AMD GPUs. Covers token-expert routing, grouped GEMM, cache-aware scheduling, and top-k gating fusion. Use when writing or optimizing MoE layers, expert routing, or grouped matrix multiplication.
2026-03-31