Skip to main content

mixed-precision

Use FP16/BF16 mixed precision to accelerate training and reduce memory. Use when optimizing GPU performance.

Datos de origen

Repositorio
aiming-lab/AutoResearchClaw
Última actividad en el origen
23 de marzo de 2026 a las 01:46
Idioma detectado de SKILL.md
inglés
Estrellas
14.579
Forks
1698

Opciones de instalación

De forma predeterminada está seleccionado el prompt que primero revisa el origen. Puedes cambiar a un comando directo o descargar una copia local.

Revisa los archivos de origen

Lee SKILL.md y los archivos complementarios que muestra SkillsMP antes de decidir si quieres instalarlo.

Mostrando SKILL.md

SKILL.md
Instrucciones de origen · Vista previa de solo lectura
name
mixed-precision
description
Use FP16/BF16 mixed precision to accelerate training and reduce memory. Use when optimizing GPU performance.
metadata
{"category":"tooling","trigger-keywords":"training,gpu,memory,speed,precision,fp16,bf16","applicable-stages":"10,12","priority":"5","version":"1.0","author":"researchclaw","references":"Micikevicius et al., Mixed Precision Training, ICLR 2018","code-template":"scaler = torch.cuda.amp.GradScaler()\nfor batch in dataloader:\n optimizer.zero_grad()\n with torch.cuda.amp.autocast():\n output = model(batch)\n loss = criterion(output, target)\n scaler.scale(loss).backward()\n scaler.step(optimizer)\n scaler.update()\n"}
## Mixed Precision Training Best Practice Use torch.cuda.amp for automatic mixed precision: - Wrap forward pass in torch.cuda.amp.autocast() - Use GradScaler for loss scaling - BF16 preferred over FP16 on Ampere+ GPUs (RTX 3xxx, A100, RTX 4xxx) - Watch for NaN gradients — reduce learning rate if needed - Do NOT use amp with custom CUDA kernels unless tested
Ver en GitHub