From a9cd113b8fc355c6d7dd187260c9880badd7b616 Mon Sep 17 00:00:00 2001 From: selee Date: Mon, 9 Feb 2026 15:34:19 +0900 Subject: [PATCH] Add nodeSelector(nodegroup: nd) to all components, fix PriorityClass mismatch - Volcano: set default_ns.nodegroup: nd for all components - Kubeflow Trainer: set manager.nodeSelector.nodegroup: nd - JobSet: set controller.nodeSelector.nodegroup: nd - Fix PodGroup priorityClassName: normal-priority -> training-priority Co-Authored-By: Claude Opus 4.6 --- configs/kubeflow-trainer-values.yaml | 5 +++++ configs/volcano-trainjob-integration.yaml | 2 +- configs/volcano-values.yaml | 4 ++++ 3 files changed, 10 insertions(+), 1 deletion(-) diff --git a/configs/kubeflow-trainer-values.yaml b/configs/kubeflow-trainer-values.yaml index 4bd3bf3..1cd90b8 100644 --- a/configs/kubeflow-trainer-values.yaml +++ b/configs/kubeflow-trainer-values.yaml @@ -6,6 +6,9 @@ jobset: install: true fullnameOverride: jobset + controller: + nodeSelector: + nodegroup: nd image: registry: ghcr.io @@ -14,6 +17,8 @@ image: manager: replicas: 1 + nodeSelector: + nodegroup: nd resources: limits: cpu: 200m diff --git a/configs/volcano-trainjob-integration.yaml b/configs/volcano-trainjob-integration.yaml index 5960612..2cc6bbe 100644 --- a/configs/volcano-trainjob-integration.yaml +++ b/configs/volcano-trainjob-integration.yaml @@ -54,7 +54,7 @@ spec: # MinMember ensures all pods are scheduled together (gang scheduling) minMember: 2 queue: training-queue - priorityClassName: normal-priority + priorityClassName: training-priority minResources: cpu: "32" memory: "128Gi" diff --git a/configs/volcano-values.yaml b/configs/volcano-values.yaml index 27de39a..2bb24fe 100644 --- a/configs/volcano-values.yaml +++ b/configs/volcano-values.yaml @@ -45,6 +45,10 @@ custom: binpack.resources: nvidia.com/gpu binpack.resources.nvidia.com/gpu.weight: 5 + # Node selector - schedule Volcano components on non-GPU nodes + default_ns: + nodegroup: nd + # API rate limits scheduler_kube_api_qps: 2000 scheduler_kube_api_burst: 2000