Skip to main content

triton-ascend-case-reduction-mean-large

大规模reduce最后根轴(mean)行二次切分优化:每个kernel计算多行减少线程块数量、kernel内二次切分避免超UB,grid=40且SUB切分不含尾块时性能最优(16.00us),尾块计算会显著降低性能,适用于非reduce轴中等、reduce轴较大的2D归约场景

跳到安装

来源信息

仓库
mindspore-ai/akg
最近来源活动
2026年3月28日 06:51
检测到的 SKILL.md 语言
中文
星标
259
分支
48

安装方式

默认使用会先检查来源的 Prompt;你也可以切换为直接命令,或下载本地副本。

检查来源文件

决定是否安装前,请先阅读 SKILL.md,以及 SkillsMP 当前展示的配套文件。