Prometheus

From HPCWIKI
Jump to navigation Jump to search

Prometheus

Template:Status

Template:TOC

Overview

Prometheus는 오픈소스 모니터링 및 알람 시스템. 메트릭 수집, 저장, 쿼리. Grafana와 함께 사용. 컨테이너/서버 모니터링 표준.

Summary

  • * 무엇인가? 메트릭 기반 모니터링 시스템. Time-series DB
  • * 왜 필요한가? 서버/컨테이너 상태 실시간 모니터링
  • * 언제 사용하는가? HPC, Kubernetes, Docker 모니터링

---

Purpose

이 문서가 존재하는 이유

  • Goal: Prometheus의 개념, 사용법, 설정 가이드 제공
  • Scope: 기본 개념, 설치/설정, 사용 예제, 모범 사례
  • Non-goals: 고급 커스터마이징, 내부 소스 코드 분석

---

Key Concepts

Template:KeyConcepts

---

Architecture

Prometheus는 서버(메트릭 수집 + 저장), Alertmanager(알람), Pushgateway(짧은 작업), Exporter(메트릭 수집기)로 구성. Grafana로 시각화.

---

Workflow

1. 1. Prometheus 설치

2. 2. Node Exporter 설치 (서버 메트릭)

3. 3. cAdvisor 설치 (컨테이너 메트릭)

4. 4. scrape_config 설정

5. 5. Grafana 대시보드 연동

6. 6. Alertmanager 설정

---

Configuration

global:
  scrape_interval: 15s

scrape_configs:
  - job_name: 'node'
    static_configs:
      - targets: ['node-exporter:9100']

  - job_name: 'cadvisor'
    static_configs:
      - targets: ['cadvisor:8080']

  - job_name: 'prometheus'
    static_configs:
      - targets: ['localhost:9090']

---

Best Practices

  • scrape_interval 15-60초로 설정
  • Node Exporter + cAdvisor 필수
  • Grafana 대시보드 활용
  • Alertmanager로 Slack/PagerDuty 연동
  • Retention 15-30일로 설정

---

Limitations

  • 단일 서버 저장소 (수평 확장 어려움)
  • 긴 쿼리 성능 저하
  • 설정 복잡도

---

References

---

Related Pages