소스 정보
- 저장소
- tile-ai/tilelang-mlir-ascend
- 최근 소스 활동
- 2026년 8월 11일 06:42
- 감지된 SKILL.md 언어
- 중국어
- 스타
- 24
- 포크
- 37
설치 방법
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
소스 파일 검토
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
메뉴
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
직접 명령은 검토 Prompt를 거치지 않습니다. 실행하기 전에 소스를 확인하세요.
npx skills add https://github.com/tile-ai/tilelang-mlir-ascend --skill tilelang-op-optimize명령은 한 줄로 유지됩니다. 복사하기 전에 가로로 스크롤해 전체 내용을 확인하세요.
로컬 사본을 원하시나요? SkillsMP에서 현재 제공할 수 있는 파일을 다운로드하세요.
对 Stage 1 产出的算子设计文档(DESIGN.md)进行风险优先的检视,生成 REVIEW.md,必须给出明确结论(通过/不通过)与不通过时的具体修改建议。触发:review 设计文档、检视设计、生成 review.md。
根据算子需求生成 TileLang-NPUIR 算子设计文档(DESIGN.md)。涵盖编程模式选型(Developer/Expert/混合)、API 映射、内存层级规划、Tiling 策略、循环结构、同步策略、验证方案等。触发:设计算子、生成 DESIGN.md、算子方案设计、新算子开发、算子实现方案。
根据冻结的 DESIGN.md 生成算子实现({op}.py:kernel + golden),执行测试并返回三态判定。触发:实现算子、生成 kernel、算子开发、跑精度。
SOC 직업 분류 기준
SKILL.md 표시 중
| name | tilelang-op-optimize |
| description | 对精度通过的算子实现进行性能调优,产出 {op}.py 与调优日志。触发:性能调优、optimize、性能优化、perf tuning。 |
对 Stage 3 精度通过的 {op}.py 进行性能调优,每轮只改一个优化点,改完单独验证,产出优化后的 perf_opt/{op}.py 与调优日志,直到满足中止条件。
环境前提:本 skill 运行在已具备 NPU 设备的环境中,性能 profiling 在 NPU 上真实执行。调优分析(瓶颈识别、优化策略)与性能测量均为真实结果。
{op}.py 与 DESIGN.md 性能目标章节。注意,只能使用 msprof op 命令采集 kernel 本身的耗时, 命令参考下面所示:
msprof op --kernel-name=kernel_name --output=output --launch-count=10 --warm-up=5 python script.py
每轮迭代执行:
| 策略 | 适用场景 | 预期收益 |
|---|---|---|
| 调整 block size | 访存/计算不均衡 | 10-30% |
| 增加 T.Pipelined 流水深度 | 有多次循环迭代 | 10-20% |
| double-buffer / 多缓冲 | 搬运与计算可重叠 | 10-15% |
| v-prefix API 替换 npuir_xxx | Vector 类 | 5-15% |
| 减少中间 buffer | UB 压力 | 5-10% |
| data reuse / 寄存器化 | 重复访存 | 5-15% |
perf_opt/{op}}_v{iter}.py(基于上一版修改)。perf_opt/opt_log.md:迭代号、策略、latency、相对基线提升、精度状态。满足任一即结束:
perf_opt/{op}.py。TUNING_COMPLETED。examples/{project}/{op}/perf_opt/
├── {op}.py # 最终最优版本
├── {op}_opt_v1.py # 各迭代版本
├── {op}_opt_v2.py
├── opt_log.md # 调优日志
└── baseline.py -> ../{op}.py # 基线(软链或拷贝)
# {op} 性能调优日志
## 基线
- latency: {base} us
- 来源: {op}.py
## 迭代记录
| iter | 策略 | latency(us) | 提升 | 精度 |
|------|------|-------------|------|------|
| 1 | {策略} | {v} | {x}% | pass |
| 2 | {策略} | {v} | {x}% | pass |
## 结论
- 最优版本: {op}.py (iter {N})
- 最终 latency: {v} us
- 总提升: {x}%
- 中止原因: {达目标 / 迭代上限 / 连续无提升}
## Stage Result
- stage: 4
- project: {project}
- operator: {op}
- output: examples/{project}/{op}/perf_opt/{op}.py
- verdict: TUNING_COMPLETED
- iterations: {N}
- baseline_latency: {v} us
- final_latency: {v} us
- improvement: {x}%
- stop_reason: {达目标 / 迭代上限 / 连续无提升}
- skills_consulted: <引用的 skill 路径>
- summary: <一句话>
- issues: <若无则 none>