Commit Graph

2 Commits

Author SHA1 Message Date
selee fc045680c3 docs: 시나리오 1 5가지 변형 실험 결과 반영
실측 결과 plan.md의 핵심 가설("orphan CUDA context 발생")이 미검증.
대신 두 가지 진짜 문제 발견:
- 30초 grace period 동안 GPU 점유 (SIGTERM 무시 시)
- NCCL multi-GPU에서 한 rank 죽으면 나머지 hang으로 GPU 5.7GB 영구 점유

변경 내용:
- results/comparison.md 신규 — 5개 변형(driver, user, worker개수, NCCL) 비교 분석
- README.md — 실험 결과 요약 섹션, 시나리오 가설들에 검증 결과 추가
- plan.md — Phase 1 직전에 실험 결과 요약 + Step 3-B 절차 추가
                + 시나리오 2~4 가치 재정의

시나리오 2~4는 미실험 — 시나리오 1 결과를 반영해서 갱신된 예상치만 기재.

Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>
2026-04-15 15:58:24 +09:00
selee 1daa9bad24 Initial commit — GPU zombie/orphan/orphaned-CUDA-context 실험 프로젝트
- plan.md: Phase 0 (CI/CD) + 4 시나리오 (No Fix / tini only / tini+preStop / Full Fix)
- scripts/: observe, node-observe, gpu-pod-trace (cgroup v1), prestop
- scenario-1~4/: Dockerfile + worker py + Pod manifest
- .gitea/workflows/: ci.yaml (matrix 3 이미지 build), cd.yaml (v* tag → Helm OCI)
- charts/gpu-zombie-test/: Helm chart (4 Pod template + helper)
- argocd-app.yaml: Harbor OCI chart auto sync

Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>
2026-04-10 17:12:38 +09:00