From d65a01e6043e1b79bde1d7b339e5387f5e68d9ba Mon Sep 17 00:00:00 2001 From: Cloud User Date: Thu, 5 Mar 2026 09:44:34 +0900 Subject: [PATCH] docs: update Values Reference table to match current values.yaml --- README.md | 79 +++++++++++++++++++++++++++++++++++++++---------------- 1 file changed, 57 insertions(+), 22 deletions(-) diff --git a/README.md b/README.md index 1e42157..3918cb9 100644 --- a/README.md +++ b/README.md @@ -71,30 +71,65 @@ helm install nccl-perftest ./nccl-perftest \ ## Values Reference +### General + | Key | Default | Description | |-----|---------|-------------| -| `nameOverride` | `nccl-test` | 리소스 이름 | -| `replicaCount` | `2` | 노드(Pod) 수. NNODES에 자동 반영 | -| `image.repository` | `nvcr.io/nvidia/pytorch` | 컨테이너 이미지 | -| `image.tag` | `24.10-py3` | 이미지 태그 | -| `image.pullPolicy` | `IfNotPresent` | 이미지 풀 정책 | -| `training.nprocPerNode` | `8` | 노드당 GPU 프로세스 수 | -| `training.masterPort` | `29500` | 마스터 rendezvous 포트 | -| `training.batchSize` | `1200` | 글로벌 배치 사이즈 | -| `training.epochs` | `90` | 학습 에포크 수 | -| `training.lr` | `0.01` | 학습률 | -| `resources.gpu` | `8` | nvidia.com/gpu 요청 수 | -| `resources.hostdev` | `2` | nvidia.com/hostdev 요청 수 | -| `shmSize` | `128Gi` | /dev/shm 크기 | -| `network.nadName` | `hostdevice-net` | Multus NAD 이름 | -| `nccl.debug` | `INFO` | NCCL_DEBUG 레벨 | -| `nccl.debugSubsys` | `INIT,NET,IB` | NCCL_DEBUG_SUBSYS | -| `nccl.ibDisable` | `0` | NCCL_IB_DISABLE (0=IB 사용) | -| `nccl.socketIfname` | `net` | NCCL_SOCKET_IFNAME | -| `nccl.ibHCA` | `""` | NCCL_IB_HCA (비어있으면 미설정) | -| `nccl.debugFile` | `""` | NCCL_DEBUG_FILE (비어있으면 미설정) | -| `volumes.infiniband.hostPath` | `/dev/infiniband` | IB 장치 경로 | -| `volumes.dataset.hostPath` | `/home/ubuntu/cifar-10-batches-py` | CIFAR-10 데이터셋 경로 | +| `nameOverride` | `"nccl-test"` | K8s 리소스 이름 (StatefulSet, Service, ConfigMap에 공통 적용) | +| `replicaCount` | `2` | 노드(Pod) 수. StatefulSet replicas 및 NNODES 환경변수에 자동 반영 | + +### Image + +| Key | Default | Description | +|-----|---------|-------------| +| `image.repository` | `nvcr.io/nvidia/pytorch` | 컨테이너 이미지 레지스트리/이름 | +| `image.tag` | `"24.10-py3"` | 이미지 태그 (NGC PyTorch 버전) | +| `image.pullPolicy` | `IfNotPresent` | 이미지 풀 정책 (`Always`, `IfNotPresent`, `Never`) | + +### Training + +| Key | Default | Description | +|-----|---------|-------------| +| `training.nprocPerNode` | `8` | 노드당 GPU 프로세스 수 (torchrun `--nproc_per_node`) | +| `training.masterPort` | `29500` | 마스터 rendezvous 포트 (torchrun `--rdzv_endpoint`, Service port) | +| `training.batchSize` | `1200` | 글로벌 배치 사이즈 (train_nccl.py `--batch_size` 기본값) | +| `training.epochs` | `90` | 학습 에포크 수 (train_nccl.py `--epoch` 기본값) | +| `training.lr` | `0.01` | 학습률 (train_nccl.py `--lr` 기본값) | + +### Resources + +| Key | Default | Description | +|-----|---------|-------------| +| `resources.gpu` | `8` | Pod당 nvidia.com/gpu 요청/제한 수 | +| `resources.hostdev` | `2` | Pod당 nvidia.com/hostdev 요청/제한 수 (RDMA NIC) | +| `shmSize` | `"128Gi"` | /dev/shm 공유메모리 크기 (emptyDir sizeLimit) | + +### Network (HostDeviceNetwork) + +| Key | Default | Description | +|-----|---------|-------------| +| `network.nadName` | `"hostdevice-net"` | HostDeviceNetwork 이름 및 Pod network annotation 값 | +| `network.resourceName` | `"hostdev"` | RDMA 리소스 이름 (HostDeviceNetwork spec.resourceName) | +| `network.networkNamespace` | `"nvidia-network-operator"` | 네트워크 오퍼레이터 네임스페이스 | +| `network.ipam.range` | `"10.100.0.0/28"` | whereabouts IPAM 할당 대역 | +| `network.ipam.exclude` | `["10.100.0.0", "10.100.0.15"]` | IPAM 제외 IP 목록 (네트워크/브로드캐스트 주소) | + +### NCCL + +| Key | Default | Description | +|-----|---------|-------------| +| `nccl.debug` | `"INFO"` | NCCL_DEBUG 로그 레벨 (`WARN`, `INFO`, `TRACE`) | +| `nccl.debugSubsys` | `"INIT,NET,IB"` | NCCL_DEBUG_SUBSYS 디버그 서브시스템 필터 | +| `nccl.ibDisable` | `0` | NCCL_IB_DISABLE (0=InfiniBand 사용, 1=비활성화) | +| `nccl.socketIfname` | `"net"` | NCCL_SOCKET_IFNAME (OOB 통신용 네트워크 인터페이스) | +| `nccl.ibHCA` | `""` | NCCL_IB_HCA (사용할 IB HCA 목록, 비어있으면 미설정) | +| `nccl.debugFile` | `""` | NCCL_DEBUG_FILE (디버그 로그 파일 경로, 비어있으면 미설정) | + +### Volumes + +| Key | Default | Description | +|-----|---------|-------------| +| `volumes.dataset.hostPath` | `"/home/ubuntu/cifar-10-batches-py"` | CIFAR-10 데이터셋 호스트 경로 (Pod 내 `/workspace/data/cifar-10-batches-py`에 마운트) | ## 예시: 3노드 4GPU 설정