모델을 내보낸 뒤에는 두 가지를 봅니다. 서비스가 잘 돌고 있는가(모니터링)와 들어오는 데이터가 학습 때와 달라졌는가(드리프트)입니다. 달라졌다면 새 데이터로 다시 학습해 한 바퀴를 다시 돕니다.

모니터링

  1. 사이드바 모니터링을 엽니다. 오른쪽 위에서 모델·엣지·기간(1h·24h·7d·30d)을 고릅니다. 위쪽 네 칸은 RPS·에러율·p95 지연(요청 95% 가 이 시간 안에 끝남)·데이터 지연, 그 아래는 학습 큐GPU 슬롯 추세입니다. 모델을 고르면 모델 성능과 입력 분포(PSI·KS) 차트가 더 나옵니다.
    모니터링: 운영 지표·학습 큐·GPU 슬롯, 모델을 고르면 성능과 입력 분포까지

기준값(임계값)을 넘는 상황은 경보로 올라옵니다. 알림이 너무 많으면 경보 음소거를 보세요.

드리프트

PSI(Population Stability Index)는 입력 데이터 분포가 기준과 얼마나 달라졌는지를 나타내는 값입니다. 0 에 가까울수록 같고, 테넌트 정책의 경고 임계값(기본 0.1)이나 위험 임계값(기본 0.2)을 넘으면 색이 바뀝니다. KS 검정은 같은 질문을 다른 통계로 확인합니다.

  1. 사이드바 드리프트에서 모델별 최근 PSI·KS 와 상태(드리프트·정상)를 봅니다. 모델을 누릅니다.
    드리프트 목록: 모델별 최근 PSI·KS 와 상태
  2. PSI 추이 (30일)①에서 막대가 언제부터 노랑(경고)·빨강(위험)이 됐는지 봅니다. CT 트리거 이력(CT 는 지속 학습, Continuous Training)에는 임계값을 넘어 재학습 계기가 기록된 이력이, 드리프트 정책에는 임계값이 있습니다(정책 수정은 관리자). 다시 학습하려면 이 모델 다시 학습하기②를 누릅니다.
    드리프트 상세: ① 정책 임계로 색칠된 PSI 추이 ② 이 모델 다시 학습하기

한 바퀴 다시

빠르게 다시 학습하는 방법은 둘입니다.

  1. 새 데이터 더하기: 현장에서 모은 사진을 2. 데이터셋의 같은 데이터셋에 올리면 매니페스트가 자동으로 다시 기록됩니다. 데이터셋 상세의 이 데이터셋으로 학습으로 마법사를 엽니다.
  2. 지난 설정 그대로 쓰기: 지난 학습 실행 상세에서 이 설정으로 다시 학습을 누르면 11단계가 모두 채워진 채 검토 단계로 갑니다. 같은 설정으로 다시 학습을 보세요.

같은 실험 이름등록 모델 이름을 쓰면 새 Run 이 같은 실험에 쌓이고 새 버전이 같은 모델에 붙으므로, 5. Run 비교에서 이전 버전과 바로 비교할 수 있습니다. 좋으면 다시 6. 승격 요청부터 진행합니다.

수고하셨습니다. 이제 자주 하는 일은 How-to에서 찾아보세요.

2026-09-21 기준 플랫폼에 맞춰 작성했습니다.

© Geo-MLOps