본문으로 건너뛰기

LLMBoost

Services → LLMBoost 페이지는 등록된 에이전트 중 한 대에서 동작하는 LLMBoost 쿠버네티스 클러스터의 상태를 보여줍니다. 사이드바 링크는 항상 표시되며, 클러스터에 접근할 수 없으면 Disconnected 상태와 빈 노드 목록이 나타납니다.

LLMBoostLLMBoost

페이지 구성

Status

연결 상태, LLMBoost API 엔드포인트, K8s 컨트롤 플레인 노드, 그리고 ready / 전체 워커 노드 비율을 보여줍니다.

Kubernetes Access Token

페이지 상단에 토큰 입력란이 있습니다. 읽기 전용 K8s 서비스 어카운트 토큰을 붙여넣고 Save를 누르면 디플로이먼트와 파드 배치까지 포함된 전체 클러스터 뷰가 활성화됩니다. 토큰이 없어도 LLMBoost API에서 가져오는 모델과 실시간 메트릭은 계속 표시됩니다.

실시간 메트릭

  • Active Requests — 현재 처리 중인 추론 요청 수
  • Completed Requests — LLMBoost가 기동된 이후 완료된 요청 누적
  • Average Latency — 최근 1분 롤링 윈도우의 평균 지연 시간
  • Token Throughput — 초당 생성 토큰 수

메트릭 블록은 약 1초 주기로 갱신되며, 각 KPI 아래에 롤링 차트로 이어집니다.

클러스터 노드

K8s 노드마다 카드 하나씩, 다음 정보를 보여줍니다.

  • GPU 종류와 개수
  • 할당 막대 — LLMBoost 워크로드가 점유 중인 GPU 비율
  • 역할 태그 — control-plane / worker / inference / monitoring / dashboard
  • 상태 필 — ready / not-ready

서빙 중인 모델

LLMBoost가 현재 서빙 중인 모델 목록입니다 — 모델명, 호스팅 노드, GPU 할당, 동작 상태. 행을 클릭하면 모델별 메트릭 세부 (요청 수, 지연 시간, 생성 토큰, KV 캐시 사용량)가 열립니다. 모두 Prometheus의 model_name 라벨로 묶인 값입니다.

디플로이먼트 라이프사이클 제어

오퍼레이터 (와 어드민)는 LLMBoostDeployment CRD를 UI에서 직접 다룰 수 있습니다.

  • Scale — 디플로이먼트 키의 numInstancesnumActiveInstances 조정
  • Pause / ResumenumActiveInstances를 0으로 (pause), 또는 원래 numInstances 값으로 복구 (resume)
  • Add Key — 기존 CRD에 새 모델 디플로이먼트 항목 추가
  • Remove Key — merge-patch로 CRD에서 디플로이먼트 항목 삭제

실시간 GPU correlation 뷰는 각 디플로이먼트의 파드를 호스팅하는 GPU의 노드별· GPU별 DCGM 메트릭 (사용률, 메모리, 전력)을 보여줍니다 — 스케일 작업이 실제로 하드웨어에 반영되었는지 한눈에 확인할 수 있습니다.

대시보드 링크

상단 버튼은 LLMBoost 관리 UI (Headlamp)를 새 탭의 http://<node>:30080/manage/에서 엽니다 — 큐나 파드 수준 작업처럼 MAC에 노출되지 않은 작업을 처리할 때 활용하세요.

자동 탐색

api-server는 등록된 각 에이전트의 IP에서 30080 포트(LLMBoost NodePort)와 6443 포트 (K8s API)를 탐지합니다. 둘 다 응답하지 않으면 페이지는 Disconnected로 표시됩니다. 클러스터가 동작 중인데도 Disconnected 상태가 지속된다면 시작하기 → 최초 설정 → LLMBoost 자동 탐색 또는 LLMBoost 문제 해결 페이지를 참고하세요.