PyTorch 框架下 Triton CUDA 内核的完整集成示例,包括 vector_add、matmul、layer_norm、softmax 等标准算子实现。适用于需要参考 PyTorch 算子包装方式、torch.autograd.Function 实现模式的 CUDA 内核代码生成场景
Source text: Chinese
Menu
Skills in this repository
SkillsMP has collected 117 skills from mindspore-ai/akg. Open a skill to review its source and details.
mindspore-ai/akgShowing 37 of 117 collected skills.
PyTorch 框架下 Triton CUDA 内核的完整集成示例,包括 vector_add、matmul、layer_norm、softmax 等标准算子实现。适用于需要参考 PyTorch 算子包装方式、torch.autograd.Function 实现模式的 CUDA 内核代码生成场景
Source text: Chinese
Grid/Block 配置策略,包括线程块大小选择、SM 占用率优化和大 shape 算子处理方案。适用于需要确定 CUDA kernel 启动参数、优化 GPU 并行效率、或处理超大规模数据的内核代码生成场景
Source text: Chinese
Triton CUDA 三大核心编程模式(向量/逐元素、归约、矩阵乘法)的标准实现范式和代码模板。适用于需要快速确定算子属于哪种编程模式、或需要了解各模式基本代码结构的 CUDA 内核代码生成场景
Source text: Chinese
归约算子(reduce)优化策略,包含 sum/mean/max/min、softmax、layernorm、logsoftmax 等实现技巧。适用于需要在 CUDA GPU 上实现任意维度归约、规范化层或注意力分数计算的内核代码生成场景
Source text: Chinese
从 Cursor 对话历史(agent-transcripts JSONL)中提取算子优化经验,生成 SKILL.md。 适用于用户与 Agent 协作优化 kernel 代码后,沉淀方法论级优化经验供 KernelGen 参考。 触发词:'提取经验'、'沉淀经验'、'总结对话优化经验'、'extract insight'。
Source text: Chinese
算子鲁棒性测试。针对已在特定 shape/dtype 下验证通过的算子,系统性地测试其在不同 shape、dtype 下的精度正确性和性能表现。直接导入已有代码文件构造变异输入,利用 akg_agents DevicePool 支持多卡并行。触发词:'测试算子'、'算子测试'、'鲁棒性测试'、'泛化性测试'、'robustness test'、'shape test'等。
Source text: Chinese
通用性能优化验证 - 对代码优化结果进行单元测试验证,包括硬件环境检测、正确性验证和性能验证。支持vllm-mindspore、vllm-ascend等多种框架。
Source text: Chinese
用于从对话历史中提取可复用知识并生成新的 OpenCode skill。当用户要求: (1) "凝练当前上下文" 或 "总结上下文为skills"; (2) "任务成功" 后希望保存经验; (3) 查看 "available skills" 并希望创建新技能时使用。将有价值的发现转化为可重复使用的技能。
Source text: Chinese
Triton Ascend NPU编程指南,包含核心概念、标准模式和完整示例
Source text: Chinese
PyPTO 编程原则与核心模式
Source text: Chinese
KernelAgent 工作流程与用户交互指南
Source text: Chinese
自适应进化工作流,使用进化算法进行多轮迭代优化
Source text: Chinese
代码生成Agent,负责将设计方案转换为可执行代码
Source text: Chinese
CUDA编程基础知识,包括内存模型、线程层次和常用优化技巧
Source text: Chinese
算法设计Agent,负责生成算子设计方案和优化策略
Source text: Chinese
专业邮件编写技能,提供各类场景的邮件模板和写作指导
Source text: Chinese
GPU代码错误处理和边界检查最佳实践
Source text: Chinese
标准的算子生成工作流,包含设计、编码和验证三个阶段
Source text: Chinese
Triton语言语法和编程模式,简化GPU kernel开发
Source text: Chinese
验证Agent,负责测试代码正确性和性能profiling
Source text: Chinese
Sketch 设计中 Hint 模式参数空间配置指南,用于从任务描述中提取参数范围并生成可调优的参数空间配置
Source text: Chinese
算子草图设计语言规范和生成指导,包含 UnifiedSketch DSL 语法和算子草图设计方法论
Source text: Chinese
模式 A 示例:1D elementwise — GELU 激活,展示展平、无 tanh 时的手写公式、运算符使用
Source text: Chinese
模式 D 示例:Loss — CrossEntropyLoss,展示多输入 kernel、两段 tile、softmax+gather+sum、标量输出
Source text: Chinese
模式 B 示例:2D 矩阵乘法 + M 维 loop 分块 + 尾部处理
Source text: Chinese
矩阵-向量乘法:K > 65535 时用 elementwise mul + sum 替代 matmul
Source text: Chinese
模式 C 示例:3D Norm — BatchNorm,展示 3D 降维、连续单轴 sum 多维归约、expand_clone 广播
Source text: Chinese
模式 C 示例:2D Norm + Loop — LayerNorm,展示 forward 降维为 2D、kernel 内 sum 归约 + 归一化
Source text: Chinese
单轴归约示例:3D Sum reduction — 保持原始维度,最简 kernel
Source text: Chinese
PyPTO 全部 API 签名与约束速查
Source text: Chinese
pypto.loop + pypto.view 的正确写法:view shape 必须是编译期常量,适用于 matmul、norm、elementwise 等所有 loop 场景
Source text: Chinese
PyPTO 性能优化规则与调参顺序。适用于需要优化 tile/loop/归约性能、比较不同 tile 方案、解释同一算子不同 tile 性能差异(尤其 softmax/logsoftmax/reduction/norm/loss)的场景
Source text: Chinese
PyPTO 常见首次生成错误及正确写法
Source text: Chinese
从 PyTorch/Triton 代码仓中提取算子实现,构建为 KernelBench 格式的标准化单文件自包含任务。 支持代码提取、AST 依赖追踪、函数内联、import 清理、格式验证和参考对比测试。 当用户需要从现有代码构建 task_code 时使用此 Skill。
Source text: Chinese
Web scraping and data extraction best practices
AI Kernel 算子生成与优化工作流程。当用户需要生成、验证或优化 kernel 算子时使用此 Skill。支持 Triton、CUDA C、C++、TileLang等多种后端 DSL。
Source text: Chinese
用于汇总和对比多个算子的性能测试结果。当用户请求汇总多个算子的性能结果、对比算子 benchmark、生成性能报告、分析多个 kernel 的加速比时使用此 Skill。
Source text: Chinese