优化面向 NVIDIA 和 AMD GPU 的 Triton 融合交叉熵损失 kernel。 覆盖融合 log-softmax + NLL、在线 log-sum-exp,以及大词表处理方式。 适用于编写或优化交叉熵、带 label smoothing 的交叉熵,或类似的损失函数 kernel。
优化面向 NVIDIA 和 AMD GPU 的 Triton FlashAttention 风格融合注意力 kernel。 覆盖在线 softmax、分块 QK/AV GEMM、因果掩码,以及内存高效注意力实现。 适用于编写或优化 self-attention、cross-attention,或任意基于 QKV 的注意力 kernel。
优化面向 NVIDIA 和 AMD GPU 的 Triton 融合 Mixture-of-Experts(MoE)kernel。 覆盖 token-expert 路由、grouped GEMM、cache 感知调度,以及 top-k gating 融合。 适用于编写或优化 MoE 层、专家路由,或 grouped matrix multiplication。
优化面向 NVIDIA 和 AMD GPU 的 Triton 稠密矩阵乘(GEMM)kernel。 覆盖分块 blocking、L2 cache grouping、tensor core 利用,以及双平台 autotune。 适用于编写或优化 matmul、线性层,以及任何基于 GEMM 的 kernel。
优化面向 NVIDIA 和 AMD GPU 的 Triton RMSNorm kernel。 覆盖按行归约、向量化加载、warp shuffle 模式,以及 rsqrt 的使用。 适用于编写或优化 RMSNorm、LayerNorm,以及类似的归一化 kernel。
优化面向 NVIDIA 和 AMD GPU 的 Triton Rotary Position Embedding(RoPE)kernel。 覆盖交错式与顺序式布局、sincos 预计算,以及多行处理。 适用于编写或优化 RoPE、位置编码,或各类 rotary 变换。
优化面向 NVIDIA 和 AMD GPU 的 Triton 融合 softmax kernel。 覆盖在线 max/sum 归约、多行处理、数值稳定性,以及 warp 级模式。 适用于编写或优化 softmax、log-softmax,以及类似的按行归一化 kernel。
为 GPU kernel(Triton/CUDA/HIP)选择 block 或 tile 尺寸、warp 数、pipeline stage, 以及面向 L2 的 block 分组策略。 适用于 autotune matmul 类 kernel、调 occupancy,或让 tile 几何与 M/N/K 规模及 NVIDIA/AMD 线程模型对齐。