운영 점검표
전역 관리자와 테넌트 관리자가 매일·매주·분기마다 확인할 것
필요 권한: 전역 관리자
아래 점검표는 운영 중인 Geo-MLOps 를 건강하게 유지하기 위한 최소한의 습관입니다. 항목마다 볼 화면을 링크했습니다.
매일 (5분)
| 누가 | 확인할 것 | 어디서 | 이상하면 |
|---|---|---|---|
| 전역 관리자 | 시스템 홈 카드의 배지(진단 총평, GPU 대기 파드, 테넌트 삭제 일부 실패) | 시스템 홈 | 해당 화면으로 들어가 원인 확인 |
| 전역 관리자 | 의존 컴포넌트가 모두 정상인가 | 시스템 진단 | 다시 점검, 해당 서비스 로그 확인 |
| 전역 관리자 | 발생 중인 경보 | Alertmanager | 점검 중이면 좁은 매처로 사일런스 |
| 전역 관리자 | 노드가 모두 Ready, Pod Ready 비율 | 클러스터 | 노드 상태 조건 확인, 필요하면 Cordon |
| 전역 관리자 | 오래 대기 중인 GPU 파드 | GPU 슬롯 | 배선·풀 슬롯 수 조정, 멈춘 학습 정리 요청 |
| 전역 관리자 | 패키지 프록시가 "죽음" 이 아닌가 | 빌드 캐시 | 프록시가 죽으면 모든 빌드가 실패합니다. 프록시 컨테이너를 재시작합니다 |
| 테넌트 관리자 | 준비 상태 세 줄, 오래 도는·멈춘 학습 Job | 관리자 홈, 학습 러너 | 중지, 안 되면 강제 종료 |
매주 (30분)
| 누가 | 확인할 것 | 어디서 |
|---|---|---|
| 테넌트 관리자 | 지난주 역할 변경·토큰 발급 기록에 모르는 것이 없나 (role., mlflow_token., registry_token.) | 감사 로그 |
| 테넌트 관리자 | 곧 만료되는 토큰, 무기한 토큰, 떠난 사람의 토큰 | 토큰 |
| 테넌트 관리자 | 떠난 사람·역할이 바뀐 사람의 멤버십 | 멤버 |
| 테넌트 관리자 | 오래 안 쓴 데이터셋 캐시, Released 로 남은 볼륨 | 데이터셋 캐시 |
| 전역 관리자 | 회수 가능한 빌드 레이어, 고아 가중치 객체 | 빌드 캐시, 가중치 미러 |
| 전역 관리자 | PVC 사용량이 상한에 가까운 볼륨 | 스토리지 |
| 전역 관리자 | 백업 타이머가 돌았나: journalctl -u geo-mlops-backup.service -n 20 출력에 backup finished 가 있는지 | 서버 셸 |
| 전역 관리자 | 설정 위생에 새 CRITICAL·WARNING 이 없나 | 시스템 진단 |
분기마다 (반나절)
-
복구 훈련: 백업을 실제로 되돌려 봅니다. 개발 서버에서 백업을 한 번 만들고 덤프 목록을 확인합니다.
BACKUP_DIR=/tmp/geo-backup-drill BACKUP_BUCKETS=build-logs deploy/backup/backup.sh docker exec -i geo-mlops-mlflow-postgres pg_restore --list \ < /tmp/geo-backup-drill/postgres/mlflow-*.dump | headDB 덤프와 오브젝트 미러는 서로를 가리키므로, 복구할 때는 같은 날의 덤프와 미러를 함께 씁니다.
-
감사 로그 보관: 지난 분기 전체 감사 로그를 CSV 로 받아 보관합니다.
-
권한 검토: 사용자에서 전역 관리자가 꼭 필요한 사람만인지, 테넌트마다 ADMIN 이 둘 이상인지 확인합니다.
-
공유 이미지 정리: 쓰지 않는 공유 변형·자기 변형을 정리하고, 기본이 비어 있는 테넌트(
기본 누락)가 없는지 봅니다. -
GPU 배선 검토: 테넌트별 실제 사용량에 맞게 공유 풀 슬롯 수·전용 슬롯을 조정합니다.
-
보존 기간 검토: 알림·빌드 로그·엣지 기록의 보존 기간(
GEO_MLOPS_*_RETENTION_DAYS)이 디스크 사정에 맞는지 봅니다. 감사 로그 보존은 기본 무기한입니다.