클러스터 개요
로그인 직후 보이는 페이지입니다. *"플릿에 이상이 있나?"*라는 질문에 한 화면으로 답해줍니다.


상단 KPI
페이지 맨 위 띠는 플릿 전체를 합산해서 보여줍니다.
| 타일 | 의미 |
|---|---|
| Nodes | 등록된 에이전트 총합, 아래에 온라인 / 오프라인 수 표시 |
| GPUs | 플릿 전체의 가속기 개수 |
| Power | 클러스터 전체 전력 소비 (kW) |
| GPU Util | 클러스터 평균 GPU 사용률 |
| CPU Util | 클러스터 평균 CPU 사용률 |
| Storage | 플릿 전체 디스크 중 정상 / 전체 개수 |
노드 상태 맵
등록된 에이전트마다 타일이 하나씩 그려지고, 색깔로 상태를 구분합니다.
- Green — 정상
- Yellow — 경고 (예: 버전 불일치, 컨테이너 비정상)
- Red — 심각 (오프라인, 하드웨어 결함)
- Gray — 최근 보고가 없는 에이전트
타일을 클릭하면 페이지 전체가 해당 노드 기준으로 필터링되고, 다시 클릭하면 필터가 해제됩니다.
Needs Attention
Needs Attention 섹션은 플릿 전체의 이슈를 한데 모아 카테고리별 카드로 보여줍니다.
- Connectivity — 마스터와 통신이 안 되는 에이전트, SNMP 데이터가 오래된 스위치
- Thermal — 임계치를 넘은 GPU / DPU / 흡기 센서
- Error Logs — 최근 발생한 커널 ERR 또는 journal의 fatal 항목
- Containers —
restarting상태에 갇혔거나 unhealthy 상태인 Docker 컨테이너 - CPU / Memory / Storage — 사용률 급증
- Version Drift — 클러스터의 대다수와 다른 소프트웨어 버전
(위 스크린샷에는
gpu_driver와toolkit의 불일치가 보입니다) - Node Status — 예정된 유지보수 유예 시간 내에 오프라인이 된 에이전트
오른쪽의 필터 칩 (Critical, Warning, Info)으로 분류할 때 노이즈를 걸러낼 수
있습니다. 칩 위의 노드별 드롭다운은 피드를 한 호스트로 좁힙니다.
Cluster Power
Needs Attention 아래에는 플릿의 총전력(W) 시계열 차트가 있습니다. 차트 위의 시간 범위 칩(1h / 6h / 24h / 7d / 30d)으로 용량 계획용 뷰까지 확장할 수 있습니다.
폴링 주기
페이지가 보이는 동안은 5초마다 새로고침되며, 다른 탭으로 이동하면 폴링이 멈춰 네트워크 사용량을 줄여줍니다.
다음으로
- 노이즈가 많은 노드를 골라 Hardware → Server에서 하드웨어를 살펴봅니다.
- Network Topology를 열어 패브릭이 정상인지 확인합니다.
- 온도 알림이 발생했다면 Power & Thermal로 바로 넘어갑니다.