Skip to main content

fla-org/flash-linear-attention

O SkillsMP coletou 9 skills de fla-org/flash-linear-attention. Abra uma skill para revisar a origem e os detalhes.

Última atividade de origem registrada
Catálogo do SkillsMP atualizado
skills coletadas
9
Estrelas no GitHub
5.665
Forks no GitHub
683

Skills neste repositório

Mostrando 9 de 9 skills coletadas.

ocupação
sem classificação
descrição

Contract-first design and coverage discipline for FLA kernel and numerical changes. Use before implementation to define supported cells, numerical budgets, dispatch semantics, compatibility, tests, and benchmarks.

Idioma do texto original: inglês

atualizado
ocupação
sem classificação
descrição

Checklist and workflow for preparing an MR/PR in the FLA repo. Covers CONTRIBUTING.md compliance, test plan, benchmark evidence, and PR body structure.

Idioma do texto original: inglês

atualizado
ocupação
Desenvolvedores de software
descrição

Guidelines for Ascend NPU kernel / Triton-Ascend backend performance work in the FLA repo. Covers profiling with torch_npu, PipeUtilization/MemoryUB CSV analysis, Cube/Vector/MTE/UB bottleneck diagnosis, and kernel optimization (UB tiling, grid splits,…

Idioma do texto original: inglês

atualizado
ocupação
Desenvolvedores de software
descrição

Disciplined, reproducible loop for making an FLA kernel faster (Triton, Gluon, TileLang, CuTe) without ever breaking or gaming correctness. Synthesizes the task-contract / three-phase / iteration-protocol / silent-bug-catalog discipline of agent…

Idioma do texto original: inglês

atualizado
ocupação
Desenvolvedores de software
descrição

Workflow for porting an existing Triton kernel in `fla/ops/**` to Gluon (`triton.experimental.gluon`) to gain explicit control over tensor layouts, shared memory, async data movement (cp.async / TMA), MMA (WGMMA / tcgen05), and scheduling (persistent kernels,…

Idioma do texto original: inglês

atualizado
ocupação
Desenvolvedores de software
descrição

Guidelines for NVIDIA GPU kernel / Triton / Gluon / TileLang / CUDA backend performance work in the FLA repo. Covers profiling workflow, hardware baselines, and MR-ready performance evidence requirements. Uses an installed ncu-report-skill when a task needs…

Idioma do texto original: inglês

atualizado
ocupação
Analistas de garantia de qualidade de software e testadores
descrição

Guidelines for kernel correctness testing and coverage in fla/ops/** and related modules, including common Triton grid/addressing pitfalls. Helps decide what tests to add or run before an MR.

Idioma do texto original: inglês

atualizado
ocupação
Desenvolvedores de software
descrição

Workflow for FLA backend dispatch decorators and backend implementations. Use when touching fla.ops.backends, @dispatch-decorated functions, BaseBackend subclasses, backend verifier methods, backend env vars, or backend tests.

Idioma do texto original: inglês

atualizado
ocupação
Desenvolvedores de software
descrição

FLA KDA kernel workflow and public technical notes. Use when modifying or reviewing fla/ops/kda/**, KDA gate modes, chunk intra/inter kernels, safe_gate behavior, KDA backends, or KDA-specific tests and benchmarks.

Idioma do texto original: inglês

atualizado
Mostrando 9 de 9 skills coletadas.