Skip to main content

rhoai-distributed-workload-workflows

Use when documenting, reviewing, or authoring Red Hat OpenShift AI data scientist workflows for distributed workloads: preparing workbenches and training images, authenticating to OpenShift from notebooks, running Ray-based workloads with CodeFlare SDK, running distributed workloads from AI pipelines or disconnected environments, creating Kubeflow Training Operator PyTorchJob workloads, using the Training Operator SDK, running Kubeflow Trainer v2 TrainJob workloads, configuring training runtimes, fine-tuning with OSFT or SFT, configuring PVC or S3 checkpointing, monitoring distributed workload metrics and status, and troubleshooting user-facing Ray, Kueue, and training job failures. Do NOT use for distributed workload component installation (use rhoai-distributed-workloads), Kueue integration and namespace enforcement (use rhoai-kueue-workload-management), administrator ResourceFlavor/ClusterQueue/LocalQueue/RDMA operations (use rhoai-distributed-workload-operations), GPU enablement (use rhoai-nvidia-gpu-acce

跳到安装

来源信息

仓库
adnan-drina/rhoai3-coding-demo
最近来源活动
2026年7月6日 18:02
检测到的 SKILL.md 语言
英语
星标
3
分支
2

安装方式

默认使用会先检查来源的 Prompt;你也可以切换为直接命令,或下载本地副本。

检查来源文件

决定是否安装前,请先阅读 SKILL.md,以及 SkillsMP 当前展示的配套文件。