본문으로 건너뛰기

클러스터 개요

로그인 직후 보이는 페이지입니다. *"플릿에 이상이 있나?"*라는 질문에 한 화면으로 답해줍니다.

클러스터 개요클러스터 개요

상단 KPI

페이지 맨 위 띠는 플릿 전체를 합산해서 보여줍니다.

타일의미
Nodes등록된 에이전트 총합, 아래에 온라인 / 오프라인 수 표시
GPUs플릿 전체의 가속기 개수
Power클러스터 전체 전력 소비 (kW)
GPU Util클러스터 평균 GPU 사용률
CPU Util클러스터 평균 CPU 사용률
Storage플릿 전체 디스크 중 정상 / 전체 개수

노드 상태 맵

등록된 에이전트마다 타일이 하나씩 그려지고, 색깔로 상태를 구분합니다.

  • Green — 정상
  • Yellow — 경고 (예: 버전 불일치, 컨테이너 비정상)
  • Red — 심각 (오프라인, 하드웨어 결함)
  • Gray — 최근 보고가 없는 에이전트

타일을 클릭하면 페이지 전체가 해당 노드 기준으로 필터링되고, 다시 클릭하면 필터가 해제됩니다.

Needs Attention

Needs Attention 섹션은 플릿 전체의 이슈를 한데 모아 카테고리별 카드로 보여줍니다.

  • Connectivity — 마스터와 통신이 안 되는 에이전트, SNMP 데이터가 오래된 스위치
  • Thermal — 임계치를 넘은 GPU / DPU / 흡기 센서
  • Error Logs — 최근 발생한 커널 ERR 또는 journal의 fatal 항목
  • Containersrestarting 상태에 갇혔거나 unhealthy 상태인 Docker 컨테이너
  • CPU / Memory / Storage — 사용률 급증
  • Version Drift — 클러스터의 대다수와 다른 소프트웨어 버전 (위 스크린샷에는 gpu_drivertoolkit의 불일치가 보입니다)
  • Node Status — 예정된 유지보수 유예 시간 내에 오프라인이 된 에이전트

오른쪽의 필터 칩 (Critical, Warning, Info)으로 분류할 때 노이즈를 걸러낼 수 있습니다. 칩 위의 노드별 드롭다운은 피드를 한 호스트로 좁힙니다.

Cluster Power

Needs Attention 아래에는 플릿의 총전력(W) 시계열 차트가 있습니다. 차트 위의 시간 범위 칩(1h / 6h / 24h / 7d / 30d)으로 용량 계획용 뷰까지 확장할 수 있습니다.

폴링 주기

페이지가 보이는 동안은 5초마다 새로고침되며, 다른 탭으로 이동하면 폴링이 멈춰 네트워크 사용량을 줄여줍니다.

다음으로