Skip to main content

hpc-supercomputing-clusters

Provides architecture, engineering, and operations patterns for HPC (High Performance Computing) clusters and supercomputers based on Supercomputers for Linux SysAdmins (Sergey Zhumatiy). Covers workload managers (Slurm Workload Manager), low-latency interconnects (InfiniBand/RDMA), parallelism libraries (OpenMPI, MPICH), parallel file systems (Lustre, GPFS, Ceph), and GPU-accelerated computing.

Datos de origen

Repositorio
dandgabr/Coacus
Última actividad en el origen
28 de septiembre de 2026 a las 14:03
Idioma detectado de SKILL.md
inglés
Estrellas
4
Forks
3

Opciones de instalación

De forma predeterminada está seleccionado el prompt que primero revisa el origen. Puedes cambiar a un comando directo o descargar una copia local.

Revisa los archivos de origen

Lee SKILL.md y los archivos complementarios que muestra SkillsMP antes de decidir si quieres instalarlo.

Explorador de archivos
5 archivos

Mostrando SKILL.md

SKILL.md
Instrucciones de origen · Vista previa de solo lectura
name
hpc-supercomputing-clusters
description
Provides architecture, engineering, and operations patterns for HPC (High Performance Computing) clusters and supercomputers based on Supercomputers for Linux SysAdmins (Sergey Zhumatiy). Covers workload managers (Slurm Workload Manager), low-latency interconnects (InfiniBand/RDMA), parallelism libraries (OpenMPI, MPICH), parallel file systems (Lustre, GPFS, Ceph), and GPU-accelerated computing.
# HPC Clusters and Supercomputer Engineering This skill establishes the guidelines for designing, deploying, and operating **High Performance Computing (HPC)** environments and supercomputers on Linux, drawing on the book by **Sergey Zhumatiy**. --- ## 🚀 1. Topology of an HPC Cluster ``` ┌─────────────────────────┐ │ Head / Master Node │ │ (Slurm Controller) │ └────────────┬────────────┘ │ ┌────────────────────────┴────────────────────────┐ [ 10GbE Management Network ] [ InfiniBand / RDMA 200Gbps Network ] │ │ ┌─────────▼─────────┐ ┌─────────▼─────────┐ │ Parallel Storage │ │ Compute Nodes │ │ (Lustre / CephFS) │ │ (CPUs + GPUs H100)│ └───────────────────┘ └───────────────────┘ ``` --- ## 📋 2. Job Management with Slurm Workload Manager ### Batch Job Script Example (`submit_job.sh`) ```bash #!/bin/bash #SBATCH --job-name=scientific_sim #SBATCH --output=logs/sim_%j.log #SBATCH --error=logs/sim_%j.err #SBATCH --nodes=4 #SBATCH --ntasks-per-node=32 #SBATCH --cpus-per-task=1 #SBATCH --gres=gpu:4 #SBATCH --time=12:00:00 #SBATCH --partition=gpu_cluster module load openmpi/4.1.5-cuda-12.2 srun --mpi=pmix ./bin/simulation_engine --dataset /shared/lustre/input.dat ```
Ver en GitHub