아래 점검표는 운영 중인 Geo-MLOps 를 건강하게 유지하기 위한 최소한의 습관입니다. 항목마다 볼 화면을 링크했습니다.

매일 (5분)

누가확인할 것어디서이상하면
전역 관리자시스템 홈 카드의 배지(진단 총평, GPU 대기 파드, 테넌트 삭제 일부 실패)시스템 홈해당 화면으로 들어가 원인 확인
전역 관리자의존 컴포넌트가 모두 정상인가시스템 진단다시 점검, 해당 서비스 로그 확인
전역 관리자발생 중인 경보Alertmanager점검 중이면 좁은 매처로 사일런스
전역 관리자노드가 모두 Ready, Pod Ready 비율클러스터노드 상태 조건 확인, 필요하면 Cordon
전역 관리자오래 대기 중인 GPU 파드GPU 슬롯배선·풀 슬롯 수 조정, 멈춘 학습 정리 요청
전역 관리자패키지 프록시가 "죽음" 이 아닌가빌드 캐시프록시가 죽으면 모든 빌드가 실패합니다. 프록시 컨테이너를 재시작합니다
테넌트 관리자준비 상태 세 줄, 오래 도는·멈춘 학습 Job관리자 홈, 학습 러너중지, 안 되면 강제 종료

매주 (30분)

누가확인할 것어디서
테넌트 관리자지난주 역할 변경·토큰 발급 기록에 모르는 것이 없나 (role., mlflow_token., registry_token.)감사 로그
테넌트 관리자곧 만료되는 토큰, 무기한 토큰, 떠난 사람의 토큰토큰
테넌트 관리자떠난 사람·역할이 바뀐 사람의 멤버십멤버
테넌트 관리자오래 안 쓴 데이터셋 캐시, Released 로 남은 볼륨데이터셋 캐시
전역 관리자회수 가능한 빌드 레이어, 고아 가중치 객체빌드 캐시, 가중치 미러
전역 관리자PVC 사용량이 상한에 가까운 볼륨스토리지
전역 관리자백업 타이머가 돌았나: journalctl -u geo-mlops-backup.service -n 20 출력에 backup finished 가 있는지서버 셸
전역 관리자설정 위생에 새 CRITICAL·WARNING 이 없나시스템 진단

분기마다 (반나절)

  • 복구 훈련: 백업을 실제로 되돌려 봅니다. 개발 서버에서 백업을 한 번 만들고 덤프 목록을 확인합니다.

    BACKUP_DIR=/tmp/geo-backup-drill BACKUP_BUCKETS=build-logs deploy/backup/backup.sh
    docker exec -i geo-mlops-mlflow-postgres pg_restore --list \
        < /tmp/geo-backup-drill/postgres/mlflow-*.dump | head

    DB 덤프와 오브젝트 미러는 서로를 가리키므로, 복구할 때는 같은 날의 덤프와 미러를 함께 씁니다.

  • 감사 로그 보관: 지난 분기 전체 감사 로그를 CSV 로 받아 보관합니다.

  • 권한 검토: 사용자에서 전역 관리자가 꼭 필요한 사람만인지, 테넌트마다 ADMIN 이 둘 이상인지 확인합니다.

  • 공유 이미지 정리: 쓰지 않는 공유 변형·자기 변형을 정리하고, 기본이 비어 있는 테넌트(기본 누락)가 없는지 봅니다.

  • GPU 배선 검토: 테넌트별 실제 사용량에 맞게 공유 풀 슬롯 수·전용 슬롯을 조정합니다.

  • 보존 기간 검토: 알림·빌드 로그·엣지 기록의 보존 기간(GEO_MLOPS_*_RETENTION_DAYS)이 디스크 사정에 맞는지 봅니다. 감사 로그 보존은 기본 무기한입니다.

2026-09-21 기준 플랫폼에 맞춰 작성했습니다.

© Geo-MLOps