triton-ascend-case-reduction-mean-large
大规模reduce最后根轴(mean)行二次切分优化:每个kernel计算多行减少线程块数量、kernel内二次切分避免超UB,grid=40且SUB切分不含尾块时性能最优(16.00us),尾块计算会显著降低性能,适用于非reduce轴中等、reduce轴较大的2D归约场景
Informations de source
- Dépôt
- mindspore-ai/akg
- Dernière activité de la source
- 28 mars 2026 à 06:51
- Langue détectée de SKILL.md
- chinois
- Étoiles
- 259
- Forks
- 48
Options d'installation
Le prompt qui vérifie d'abord la source est sélectionné par défaut. Vous pouvez passer à une commande directe ou télécharger une copie locale.
Vérifiez les fichiers source
Lisez SKILL.md et les fichiers associés affichés par SkillsMP avant de décider de l'installer.