중지

  1. 학습 실행 상세에서 중지를 누르고 확인합니다. 대기 중인 학습이면 "대기 중인 학습을 취소할까요?" 가 뜨고 바로 취소됩니다.
    실행 중인 학습의 중지 확인

실행 중인 학습을 멈추면 이렇게 진행됩니다.

  1. 상태가 중지 중이 되고 "트레이너가 체크포인트(last.pt)를 저장한 뒤 안전하게 종료됩니다" 가 표시됩니다.
  2. 플랫폼이 학습 Job 을 지우면 컨테이너가 종료 신호(SIGTERM)를 받습니다. 내장 트레이너는 지금 에포크를 마치고 체크포인트를 저장한 뒤 MLflow 기록을 마저 보내고 끝냅니다. 서버는 기본 60초(training_grace_period)를 기다린 뒤 강제로 끝냅니다.
  3. 최종 상태는 종료 코드와 상관없이 중지됨입니다. MLflow Run 은 KILLED 가 됩니다.

멈춘 시점까지의 지표는 MLflow 에 그대로 남습니다. 하지만 학습 컨테이너의 작업 폴더(/geo/work)는 실행이 끝나면 사라지므로, 거기 저장된 last.pt 는 플랫폼이 회수하지 않습니다. 내장 트레이너는 중지된 학습의 모델을 MLflow 에 남기지 않으므로 레지스트리 등록도 되지 않습니다.

이어서 학습하기

플랫폼에 "중지한 학습 이어 하기" 버튼은 없습니다. 대신 내가 가진 체크포인트를 시작 가중치로 새 학습을 시작합니다.

  1. 학습사전학습 가중치에서 가중치 올리기①를 누릅니다. 위저드에 표시할 이름을 적고 태스크·프레임워크·모델 변형(예: YOLO · yolo26n)을 고른 뒤 .pt/.pth 파일을 올립니다. 체크포인트는 모델 구조에 묶여 있어서 같은 변형으로만 쓸 수 있습니다.
    사전학습 가중치: ① 가중치 올리기. 직접 올린 체크포인트에서 이어서 학습할 때 씁니다
  2. 목록의 상태가 올리는 중확인 중사용 가능으로 바뀔 때까지 기다립니다. 서버가 조각을 합치고 체크섬을 계산하는 동안에는 마법사에서 고를 수 없습니다.
  3. 새 학습 3단계 모델시작 가중치에서 방금 올린 가중치를 고릅니다. 나머지는 평소처럼 진행합니다. 지난 설정 그대로라면 같은 설정으로 다시 학습으로 들어가 3단계만 바꿉니다.

체크포인트는 어디서 구하나요?

  • 끝까지 돈 학습의 모델: 모델 레지스트리 → 버전 화면의 모델 다운로드로 모델 묶음을 받으면 그 안에 학습된 가중치 파일이 들어 있습니다.
  • 직접 만든 학습 컨테이너: 중지 신호를 받았을 때 체크포인트를 MLflow 아티팩트로 올려 두게 만들면, Run 상세 아티팩트 탭에서 받을 수 있습니다. 규칙은 연동 장의 학습 컨테이너 안내를 보세요.

큰 체크포인트는 명령행으로도 올릴 수 있습니다.

geo-mlops-client training-weights upload "helmet-last" ./last.pt \
    --framework yolo --model yolo26n

2026-09-21 기준 플랫폼에 맞춰 작성했습니다.

© Geo-MLOps