증상별로 먼저 확인할 것과 자세한 페이지를 모았습니다.

계정과 권한

버튼이 보이지 않습니다

권한이 없는 버튼은 숨겨지거나 비활성으로 보입니다. 아바타 메뉴 → 계정 설정 에서 지금 테넌트의 역할을 확인하고, 역할과 권한 표에서 필요한 권한을 찾으세요. 역할은 테넌트 관리자가 바꿉니다. 멤버를 보세요.

프로덕션 승격 버튼을 눌렀는데 Production 이 되지 않습니다

정상입니다. Production 승격은 권한이 있어도 언제나 승인 요청을 만들고, 승인 권한을 가진 사람이 승인해야 반영됩니다. 승인을 보세요.

비밀번호를 잊었습니다

로그인 화면에는 재설정 기능이 없습니다. 전역 관리자에게 초기화를 요청하세요. 사용자, 명령줄 도구를 보세요.

설치와 운영

시스템 진단이 "주의 필요"에서 내려오지 않습니다

서명 키, pepper(토큰을 해시할 때 섞는 비밀값), 관리자 비밀번호가 기본값이면 CRITICAL 로 남습니다. 연결이 모두 정상이어도 마찬가지입니다. 필수 보안 설정을 보세요.

큰 데이터셋·이미지 업로드가 중간에 실패합니다

CDN 이나 리버스 프록시 같은 앞단 프록시에는 요청 크기와 응답 시간 한도가 있습니다. 여기에 걸린 경우가 많습니다. 데이터셋은 CLI 로 조각내어 올리세요. 앞단 프록시 주의, 대용량 데이터셋 올리기를 보세요.

지운 테넌트가 재시작 후 다시 생깁니다

부트스트랩 테넌트(서버 설정에 적어 두어 자동으로 만드는 테넌트)는 서버가 시작할 때마다 다시 만들어집니다. 처음 띄우기 전에 부트스트랩 설정을 비우세요. docker compose 로 설치를 보세요.

학습

학습이 "대기"에서 넘어가지 않습니다

배선된 GPU(공유 풀·전용)를 다른 학습이 모두 쓰고 있으면 자리가 날 때까지 기다립니다. 배선되지 않은 테넌트는 GPU 를 쓸 수 없고 CPU 로만 실행합니다. 학습 상세의 진행 단계와 GPU 슬롯을 확인하세요. 테넌트의 Kubernetes 네임스페이스가 없으면 준비 단계에서 실패합니다. 학습 진행 보기를 보세요.

학습이 준비 단계에서 실패합니다 / 직접 만든 학습 이미지가 실패합니다

학습 컨테이너 문제 해결을 보세요.

중지한 학습을 이어서 할 수 있나요?

"이어서 하기" 기능은 없습니다. 체크포인트를 사전학습 가중치로 올려 새 학습의 출발점으로 쓰세요. 학습 중지하고 이어서 하기를 보세요.

학습 지표 그래프가 비어 있습니다

지표는 MLflow 에서 읽습니다. 트레이너가 mlflow.log_metrics(..., step=epoch) 로 기록하는지 확인하세요. 트레이너가 할 일을 보세요.

배포와 엣지

배포했는데 장비의 모델이 바뀌지 않습니다

배포 기록을 남기는 것과 모델을 장비에 보내는 것은 따로입니다. Edge Fleet 의 장비 상세 → 명령에서 모델 내려받기 를 보내세요. 현장 장비에 배포, 배포 롤백을 보세요.

장비가 "비정상"으로 보입니다

하트비트가 끊긴 것입니다. 장비의 에이전트 상태와 네트워크, 토큰을 확인하세요. Edge SDK 문제 해결을 보세요.

음소거했는데 경보가 계속 뜹니다

음소거는 Alertmanager 경보에만 적용됩니다. 엣지 장비·드리프트 경보는 확인·해결 로 처리하세요. 경보 음소거를 보세요.

연동

DataOps 동기화가 저절로 돌지 않습니다

지금은 수동 동기화만 있습니다. 데이터셋 화면에서 동기화 를 누르세요. 동기화 규칙을 보세요.

MLflow 로 기록할 때 "active experiment ID does not match" 가 납니다

플랫폼 학습 안에서는 set_experiment()·set_tracking_uri() 를 부르지 마세요. 서버가 미리 만든 Run 을 이어받아야 합니다. 트레이너가 할 일을 보세요.

2026-09-21 기준 플랫폼에 맞춰 작성했습니다.

© Geo-MLOps