본문 바로가기

직접 만든 소프트웨어, 두 가지 개발 기록

구현 구조와 적용 범위, 확인한 기능과 남은 한계를 함께 기록합니다.

소프트웨어개발

Grafana Cloud와 자체 Prometheus·Grafana 비교: 모니터링 비용·보존·운영 책임

by 아빠띠띠뽀 2026. 10. 5.

서버에서 수집한 시계열 샘플이 수집기를 거쳐 모니터링 그래프로 표시되는 개념 일러스트
AI로 직접 제작한 개념 일러스트입니다. 서로 다른 시계열 수와 샘플 수집 빈도를 구분해 모니터링 비용을 살펴봅니다.

Prometheus 지표와 Grafana 대시보드를 운영하려는데 저장 공간, 보존 기간, 장애 대응 부담이 커지고 있나요? 관리형 Grafana Cloud를 검토할 때는 서버 수만 적어 견적을 내기보다 활성 시계열 수와 수집 주기, 필요한 데이터 보존 범위를 먼저 확인해야 합니다. 자체 운영은 설정과 데이터 경로를 직접 통제할 수 있고, 관리형은 맡길 수 있는 운영 작업을 늘릴 수 있습니다. 어느 쪽이 항상 저렴한지는 같은 지표·보존·알림 조건을 맞춰 비교해야 판단할 수 있습니다.

1. 대시보드와 지표 저장소를 구분하기

이 글은 Prometheus 방식의 메트릭, 즉 시간에 따라 변하는 수치 지표를 중심으로 비교합니다. Grafana는 데이터를 조회하고 시각화하는 역할을 하고, 지표를 실제로 수집·저장하는 구성은 따로 필요합니다. 자체 운영안은 Prometheus 서버와 저장 공간, Grafana 및 알림 경로를 함께 관리하는 상황입니다. Grafana Cloud 안에서는 사용할 지표 서비스와 수집 경로를 확인해야 합니다. 화면만 클라우드로 옮겼다고 모든 저장소 운영이 없어지는 것은 아닙니다.

로그·트레이스·프로파일과 메트릭은 입력량과 요금 단위가 같지 않습니다. Grafana Cloud 공식 요금 안내에서 사용할 제품과 요금제를 나누어 확인하세요. 텍스트 로그의 보존·마스킹이 핵심이라면 기업용 로그 관리 선택 체크리스트를 별도로 적용하는 편이 좋습니다. 여러 데이터 유형을 묶어 비교할 때도 견적의 각 항목을 분리해야 사용량 증가 원인을 찾기 쉽습니다.

2. 관리형과 자체 운영의 비교표

검토 항목 Grafana Cloud의 관리형 지표 서비스 자체 Prometheus·Grafana 운영
지표 수집 수집기·인증·전송 상태를 직접 관리 수집 대상과 서버·저장소도 직접 관리
저장·보존 선택한 서비스·요금제·계약 범위 확인 디스크·보존 정책·용량·복구 절차 설계
비용 입력 활성 시계열·DPM·사용 제품 범위 CPU·메모리·디스크·전송·운영 시간
장애 책임 로컬 수집·전송·앱 계측 책임은 남음 수집·저장·조회·업그레이드 전반 책임
통제 요구 제공 기능·데이터 위치·접근 조건 확인 원하는 저장 위치와 설정을 직접 통제
알림 검증 규칙·평가·연락 경로를 실제로 시험 동일한 시험과 알림 구성 운영 필요
이전 검수 같은 지표·레이블·쿼리·알림 결과 비교 기존 보존 데이터·규칙·복구 기준 정리

관리형의 장점은 저장·조회 인프라 운영의 일부를 맡길 수 있다는 것이고, 제약은 계약과 지원 범위 안에서 사용해야 한다는 점입니다. 자체 운영은 데이터 경로와 설정을 통제할 수 있지만 용량 계획과 장애 대응 체계를 직접 유지해야 합니다. 무료 소프트웨어를 사용해도 디스크 비용과 관리 시간은 남습니다. Prometheus 저장소 문서를 기준으로 로컬 저장과 원격 연동을 나누어 보고, 필요한 보존 기간과 복구 방법을 정하세요.

3. 시계열 수와 DPM이 달라지는 가상 계산

시계열은 지표 이름과 레이블 조합으로 구분합니다. 같은 서버에서 같은 지표를 다시 읽는 것은 보통 기존 시계열에 샘플을 더하는 일이고, 레이블의 새로운 조합이 생기는 것은 시계열 수를 늘리는 일입니다. Grafana Cloud Metrics 요금 계산 문서는 활성 시계열과 분당 데이터 포인트(DPM)를 함께 설명합니다. 포함된 DPM과 과금 기간의 집계 방식을 확인해야 하므로 단순한 “서버당 월 비용”으로 예측하면 누락되는 항목이 생깁니다.

일반적인 수치 샘플을 보내는 고정된 시계열 5,000개가 있다고 가정해 보겠습니다. 60초마다 수집하면 약 5,000 DPM, 15초마다 수집하면 약 20,000 DPM입니다. 시계열 수는 그대로인데 입력 샘플 수는 4배가 됩니다. 이 예시는 수집량의 차이를 설명하며 청구액이 4배라는 뜻은 아닙니다. 실제 비용에는 포함 사용량, 집계 방식, 요금제, 할인과 다른 제품 사용량이 적용됩니다. 네이티브 히스토그램 등 다른 데이터 유형은 별도 계량 조건도 확인하세요.

가상 조건: 고정된 일반 시계열 5,000개
분당 샘플 수 = 시계열 수 × (60초 / 수집 주기)
60초 수집: 5,000 × 1 = 약 5,000 DPM
15초 수집: 5,000 × 4 = 약 20,000 DPM

비교할 입력값: 활성 시계열 / DPM / 보존 / 사용 제품 / 운영 시간

수집 간격을 늘리기 전에는 어떤 장애를 어느 시간 안에 발견해야 하는지 정하세요. 잠깐 발생한 오류나 급격한 부하를 놓칠 수 있으므로 모든 지표를 같은 간격으로 바꾸는 것이 답은 아닙니다. 반대로 화면에서만 사용하는 저빈도 지표까지 짧게 수집하면 유용성보다 입력량이 커질 수 있습니다. 대시보드의 조회 기간과 알림 규칙의 평가 주기까지 함께 비교하는 것이 좋습니다.

4. 레이블 설계와 전송 경로에서 줄일 수 있는 낭비

Prometheus의 지표·레이블 명명 가이드는 레이블 조합마다 새 시계열이 생기는 점을 설명합니다. 사용자 ID, 이메일, 요청별 고유 ID처럼 값이 계속 늘어나는 정보를 메트릭 레이블에 넣으면 시계열 수가 크게 증가할 수 있습니다. 예를 들어 경로 레이블을 “/orders/12345”처럼 개별 주문 번호까지 기록하는 대신 “/orders/{id}”처럼 분류하려면 애플리케이션의 계측 단계에서 안전하게 정규화해야 합니다. 이는 개념 예시이며 모든 지표에 같은 변환 규칙을 적용하라는 의미는 아닙니다.

Prometheus 지표 전송 안내에 맞춰 수집기와 원격 전송 경로를 점검합니다. 인증 정보의 범위, 네트워크 연결, 전송 실패와 대기 상태, 동일 대상을 중복 수집하는 구성부터 확인하세요. 연결이 오래 끊긴 상황에서 모든 샘플이 영구 보존된다고 가정해서는 안 됩니다. 수집기의 버퍼·보관 범위와 서비스 제한을 확인하고, 수집 경로 자체가 실패했을 때 이를 알릴 별도 관찰 방법을 준비해야 합니다.

클라우드로 보내는 레이블에 내부 호스트명이나 업무 식별 정보가 포함되는지도 확인합니다. 자체 운영안에서는 저장소의 접근 권한, 디스크 부족, 업그레이드와 데이터 복구도 점검합니다. 샘플을 줄이는 작업은 비용뿐 아니라 문제 해결에 필요한 지표가 남는지와 함께 평가해야 합니다. Kubernetes의 메모리 장애를 관찰하려는 경우에는 기존 OOMKilled 진단 글에서 다룬 컨테이너 제한과 노드 상태를 구분하는 관점도 도움이 됩니다.

5. 이전 파일럿의 합격 기준 정하기

한 서비스부터 지표 이름과 레이블 목록을 정리하고, 같은 기간의 쿼리 결과를 기존 경로와 새 경로에서 대조합니다. 서버 시계, 수집 간격과 평가 시점이 다르면 값이 정확히 일치하지 않을 수 있으므로 허용 차이를 먼저 정하세요. 정상 상태뿐 아니라 수집 대상 중단, 전송 실패, 권한 오류와 알림 연락 경로도 시험합니다. 시험 기간의 활성 시계열·DPM과 운영자가 수행한 작업을 함께 남기면 견적 근거가 됩니다.

확인 기록에는 ① 필요한 지표와 보존 기간, ② 레이블 증가 원인, ③ 수집·전송 실패 시 관찰 방법, ④ 알림 규칙과 수신 결과, ⑤ 데이터 위치·접근 조건, ⑥ 월간 입력량과 운영 시간을 적으세요. 작은 팀이 장기 저장과 운영 대응에 부담을 느낀다면 관리형부터 파일럿할 수 있습니다. 이미 검증된 자체 운영과 데이터 통제 요구가 있다면 이를 유지하면서 필요한 부분만 원격 연동하는 안도 비교할 수 있습니다.

6. 자주 묻는 질문

Grafana를 설치하면 지표가 자동으로 저장되나요?
대시보드와 데이터 저장소의 역할을 나누어 확인해야 합니다. 지표 수집기·저장소·데이터 소스 연결·알림 경로가 모두 갖춰져 있는지 보세요.

수집 간격을 60초로 바꾸면 비용이 반드시 줄어드나요?
입력 샘플 수는 줄어들 수 있지만 실제 과금은 요금제와 포함량, 집계 조건에 따라 달라집니다. 장애 탐지에 필요한 해상도와 알림 동작도 같이 검증해야 합니다.

클라우드로 보내면 로컬 수집기 관리도 필요 없나요?
애플리케이션 계측, 수집 대상 접근, 인증 정보와 전송 장애는 여전히 확인해야 합니다. 수집 경로가 멈춘 경우를 누가 어떻게 알아낼지 정하세요.

자료 확인: 2026년 10월 4일. 시계열 수와 DPM은 선택 방법을 설명하는 가상 예시이며 실제 사용량·청구액이 아닙니다. 도입 직전 공식 요금·서비스 제한·보존·데이터 위치 조건을 다시 확인하세요.