一键导入
gpu-workload
GPU 工作負載管理技能。使用此技能來: - 安裝和配置 NVIDIA GPU Operator - 配置 DRA (Dynamic Resource Allocation) - 部署 GPU 推理服務 - 監控 GPU 使用狀況 專為 DGX Spark GB10 統一記憶體架構優化。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
GPU 工作負載管理技能。使用此技能來: - 安裝和配置 NVIDIA GPU Operator - 配置 DRA (Dynamic Resource Allocation) - 部署 GPU 推理服務 - 監控 GPU 使用狀況 專為 DGX Spark GB10 統一記憶體架構優化。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
前端網頁伺服器部署技能。當使用者需要: - 部署前端應用 (React, Vue, Angular, 靜態網站) - 配置 Web 流量路由 - 設定 HTTPS/TLS - 配置 CDN 或反向代理 IMPORTANT: 此技能使用 Gateway API + Envoy Gateway。 絕對不要使用 ingress-nginx,因為它將於 2026 年 3 月退役。
Ingress 流量管理遷移技能。 CRITICAL DEPRECATION NOTICE: - ingress-nginx 將於 2026-03 進入 kubernetes-retired - Kubernetes Dashboard 已退役 此技能處理所有 Ingress/流量路由相關請求, 自動使用 Gateway API 替代 ingress-nginx。 觸發場景: - 任何 Ingress 配置請求 - 網頁流量路由 - TLS/HTTPS 設定 - 負載均衡配置 - 反向代理設定
Kubernetes 叢集部署與管理技能。使用此技能來: - 部署新的 Kubernetes 叢集 (使用 Kubespray) - 升級現有叢集版本 - 添加或移除節點 - 配置 containerd、CNI、GPU Operator 適用於 DGX Spark ARM64 環境。
Kubernetes 安全公告追蹤技能。使用此技能來: - 檢查當前環境的 CVE 影響 - 獲取安全修補建議 - 追蹤已知漏洞 - 執行安全掃描
| name | gpu-workload |
| description | GPU 工作負載管理技能。使用此技能來: - 安裝和配置 NVIDIA GPU Operator - 配置 DRA (Dynamic Resource Allocation) - 部署 GPU 推理服務 - 監控 GPU 使用狀況 專為 DGX Spark GB10 統一記憶體架構優化。 |
| triggers | ["gpu operator","nvidia kubernetes","dra driver","gpu workload","推理服務","AI 部署"] |
DGX Spark GB10 使用統一記憶體架構 (UMA):
- 128GB DRAM 由 CPU 和 GPU 共享
- nvidia-smi 顯示 "Memory-Usage: Not Supported" 是正常的
- 需要 GPU Operator 25.10.0+ 才能正常運作
# 添加 NVIDIA Helm repo
helm repo add nvidia https://helm.ngc.nvidia.com/nvidia
helm repo update
# 安裝 GPU Operator (DGX Spark 配置)
# 注意:DGX Spark 已預裝驅動,設定 driver.enabled=false
helm install gpu-operator nvidia/gpu-operator \
--namespace gpu-operator \
--create-namespace \
--set driver.enabled=false \
--set toolkit.enabled=true \
--set devicePlugin.version=v0.17.4 \
--set migManager.enabled=false \
--set dcgmExporter.enabled=true
# 等待部署完成
kubectl wait --for=condition=ready pod \
-l app=nvidia-device-plugin-daemonset \
-n gpu-operator --timeout=300s
# 檢查 GPU 節點標籤
kubectl get nodes -o json | jq '.items[].metadata.labels | with_entries(select(.key | startswith("nvidia.com")))'
# 檢查 GPU 資源
kubectl describe node | grep -A5 "Capacity:" | grep nvidia
# 測試 GPU Pod
kubectl run gpu-test --rm -it --restart=Never \
--image=nvcr.io/nvidia/cuda:12.0-base-ubuntu22.04 \
--limits=nvidia.com/gpu=1 \
-- nvidia-smi
# DRA 需要 Kubernetes 1.32+ 且啟用 DynamicResourceAllocation
# 安裝 NVIDIA DRA Driver
helm install nvidia-dra-driver-gpu nvidia/nvidia-dra-driver-gpu \
--version="25.8.0" \
--namespace gpu-operator \
--set cdi.enabled=true
# 驗證 DRA 資源類別
kubectl get resourceclasses
kubectl get deviceclasses
apiVersion: resource.k8s.io/v1
kind: ResourceClaimTemplate
metadata:
name: gpu-claim
spec:
spec:
devices:
requests:
- name: gpu
deviceClassName: gpu.nvidia.com
apiVersion: v1
kind: Pod
metadata:
name: inference-pod
spec:
containers:
- name: inference
image: nvcr.io/nvidia/pytorch:24.01-py3
command: ["python", "-c", "import torch; print(torch.cuda.is_available())"]
resources:
claims:
- name: gpu
resourceClaims:
- name: gpu
resourceClaimTemplateName: gpu-claim
# ConfigMap for time-slicing
apiVersion: v1
kind: ConfigMap
metadata:
name: time-slicing-config
namespace: gpu-operator
data:
any: |-
version: v1
flags:
migStrategy: none
sharing:
timeSlicing:
renameByDefault: false
resources:
- name: nvidia.com/gpu
replicas: 4
# 使用 dcgm-exporter 指標
kubectl port-forward -n gpu-operator svc/nvidia-dcgm-exporter 9400:9400
# 查看指標
curl localhost:9400/metrics | grep DCGM
# 或使用 nvtop (DGX Spark 專用)
nvtop
這是 DGX Spark UMA 架構的已知問題,升級到 GPU Operator 25.10.0+ 可解決。
# 檢查節點是否有 GPU 資源
kubectl describe node | grep "nvidia.com/gpu"
# 檢查 device plugin 狀態
kubectl logs -n gpu-operator -l app=nvidia-device-plugin-daemonset
# 檢查 DRA controller 日誌
kubectl logs -n gpu-operator -l app=nvidia-dra-driver-gpu