Skip to main content

triton-cuda-matmul

矩阵乘法算子(matmul/bmm/linear)优化策略,包括分块 Tiling、共享内存缓存、Tensor Core 利用和大矩阵处理技巧。适用于实现 GEMM、批量矩阵乘、全连接层等矩阵运算的 CUDA 内核代码生成场景

跳到安装

来源信息

仓库
mindspore-ai/akg
最近来源活动
2026年4月8日 01:35
检测到的 SKILL.md 语言
中文
星标
259
分支
48

安装方式

默认使用会先检查来源的 Prompt;你也可以切换为直接命令,或下载本地副本。

检查来源文件

决定是否安装前,请先阅读 SKILL.md,以及 SkillsMP 当前展示的配套文件。