triton-ascend-case-reduction-mean-large
大规模reduce最后根轴(mean)行二次切分优化:每个kernel计算多行减少线程块数量、kernel内二次切分避免超UB,grid=40且SUB切分不含尾块时性能最优(16.00us),尾块计算会显著降低性能,适用于非reduce轴中等、reduce轴较大的2D归约场景
Informações da origem
- Repositório
- mindspore-ai/akg
- Última atividade na origem
- 28 de março de 2026 às 06:51
- Idioma detectado do SKILL.md
- chinês
- Estrelas
- 259
- Forks
- 48
Opções de instalação
Por padrão, está selecionado o prompt que primeiro revisa a origem. Você pode mudar para um comando direto ou baixar uma cópia local.
Revise os arquivos de origem
Leia o SKILL.md e os arquivos complementares exibidos pelo SkillsMP antes de decidir se vai instalar.