클러스터 · 노드 · 네임스페이스 · 워크로드 · 스토리지
Kubernetes 제어판: 노드 cordon·drain, 네임스페이스와 워크로드, 스토리지 확인
필요 권한: 전역 관리자
Geo-MLOps 는 하나의 Kubernetes 클러스터에서 학습 Job·서빙·이미지 빌드를 돌립니다. 클러스터는 모든 테넌트가 함께 쓰는 자원이라, 이 제어판은 전역 관리자에게만 열립니다(서버의 모든 경로가 전역 관리자를 요구합니다). 클러스터에 연결되지 않았으면 각 화면이 Kubernetes 미연결 과 이유를 보여 줍니다.
클러스터 개요
활성 노드 수, 활성 Pod 수, Ready 비율과 노드 풀(노드 라벨로 묶은 무리)별 요약을 봅니다. 하루 한 번 훑어보는 화면입니다.
노드: cordon 과 drain
노드 목록에는 풀, 상태, CPU·메모리·GPU, Pod 수, 버전이 보입니다. 행을 누르면 옆 패널에 상태 조건·테인트·그 노드의 파드가 보여, 조치 전에 무엇이 영향을 받는지 확인할 수 있습니다.
| 동작 | 하는 일 | 되돌리기 |
|---|---|---|
| Cordon | 새 파드가 그 노드에 배치되지 않게 막습니다. 지금 도는 파드는 그대로 | Uncordon |
| Drain | 그 노드의 파드를 전부 내보냅니다(축출). 학습·서빙이 있으면 즉시 중단되고 다른 노드로 다시 배치됩니다 | 되돌릴 수 없음 |
- 점검할 노드에서 Cordon 을 눌러 새 작업이 들어오지 않게 합니다.
- 도는 작업이 끝나기를 기다리거나, 기다릴 수 없으면 Drain 을 누릅니다. 노드 이름을 정확히 입력해야 실행됩니다.
Drain 확인: 노드 이름을 입력해야 실행된다 (촬영에서는 실행하지 않음) - 점검이 끝나면 Uncordon 으로 되돌립니다.
네임스페이스
클러스터의 모든 네임스페이스가 카드로 보이고, 카드를 누르면 그 네임스페이스의 워크로드 화면으로 갑니다. 테넌트마다 tenant-{코드 소문자} 네임스페이스가 하나씩 있습니다(예: tenant-demo). 공유 이미지 등 시스템 몫의 네임스페이스도 함께 보입니다.
위 화면에서는 촬영용이 아닌 테넌트 네임스페이스를 가렸습니다.
워크로드
오른쪽 위에서 네임스페이스를 고르고, 종류 탭(Deployment, StatefulSet, DaemonSet, Job, CronJob, Pod)으로 봅니다.
| 버튼 | 하는 일 |
|---|---|
| Restart | 롤아웃을 다시 시작합니다(파드를 차례로 새로 띄움). 확인을 거칩니다 |
| Scale | 복제 수를 바꿉니다 |
| Delete (Pod 탭) | 파드 하나를 지웁니다. 컨트롤러가 있으면 새로 뜹니다 |
스토리지
StorageClass 카드, PersistentVolume(클러스터 전체) 표, PersistentVolumeClaim(네임스페이스를 골라서) 표를 봅니다. 읽기 전용입니다. PVC 는 실제 사용량도 함께 보여, "Bound 100Gi" 이지만 꽉 차서 학습이 실패하는 볼륨을 찾을 수 있습니다. 통계가 없는 볼륨은 0 이 아니라 — 로 보입니다.