diff --git a/configs/kubeflow-trainer-values.yaml b/configs/kubeflow-trainer-values.yaml index 4bd3bf3..1cd90b8 100644 --- a/configs/kubeflow-trainer-values.yaml +++ b/configs/kubeflow-trainer-values.yaml @@ -6,6 +6,9 @@ jobset: install: true fullnameOverride: jobset + controller: + nodeSelector: + nodegroup: nd image: registry: ghcr.io @@ -14,6 +17,8 @@ image: manager: replicas: 1 + nodeSelector: + nodegroup: nd resources: limits: cpu: 200m diff --git a/configs/volcano-trainjob-integration.yaml b/configs/volcano-trainjob-integration.yaml index 5960612..2cc6bbe 100644 --- a/configs/volcano-trainjob-integration.yaml +++ b/configs/volcano-trainjob-integration.yaml @@ -54,7 +54,7 @@ spec: # MinMember ensures all pods are scheduled together (gang scheduling) minMember: 2 queue: training-queue - priorityClassName: normal-priority + priorityClassName: training-priority minResources: cpu: "32" memory: "128Gi" diff --git a/configs/volcano-values.yaml b/configs/volcano-values.yaml index 27de39a..2bb24fe 100644 --- a/configs/volcano-values.yaml +++ b/configs/volcano-values.yaml @@ -45,6 +45,10 @@ custom: binpack.resources: nvidia.com/gpu binpack.resources.nvidia.com/gpu.weight: 5 + # Node selector - schedule Volcano components on non-GPU nodes + default_ns: + nodegroup: nd + # API rate limits scheduler_kube_api_qps: 2000 scheduler_kube_api_burst: 2000