Skip to main content

rhoai-distributed-workload-workflows

Use when documenting, reviewing, or authoring Red Hat OpenShift AI data scientist workflows for distributed workloads: preparing workbenches and training images, authenticating to OpenShift from notebooks, running Ray-based workloads with CodeFlare SDK, running distributed workloads from AI pipelines or disconnected environments, creating Kubeflow Training Operator PyTorchJob workloads, using the Training Operator SDK, running Kubeflow Trainer v2 TrainJob workloads, configuring training runtimes, fine-tuning with OSFT or SFT, configuring PVC or S3 checkpointing, monitoring distributed workload metrics and status, and troubleshooting user-facing Ray, Kueue, and training job failures. Do NOT use for distributed workload component installation (use rhoai-distributed-workloads), Kueue integration and namespace enforcement (use rhoai-kueue-workload-management), administrator ResourceFlavor/ClusterQueue/LocalQueue/RDMA operations (use rhoai-distributed-workload-operations), GPU enablement (use rhoai-nvidia-gpu-acce

Ir a la instalación

Datos de origen

Repositorio
adnan-drina/rhoai3-coding-demo
Última actividad en el origen
6 de julio de 2026 a las 18:02
Idioma detectado de SKILL.md
inglés
Estrellas
3
Forks
2

Opciones de instalación

De forma predeterminada está seleccionado el prompt que primero revisa el origen. Puedes cambiar a un comando directo o descargar una copia local.

Revisa los archivos de origen

Lee SKILL.md y los archivos complementarios que muestra SkillsMP antes de decidir si quieres instalarlo.