[실시간 대용량 서비스] 모니터링의 다음 단계: 로그 기반 관측 설계
·
Spring/Spring 실습
Prometheus와 Grafana를 통해 요청 수, 에러율, 응답 시간, JVM 상태 등 주요 지표를 실시간으로 확인할 수 있게 되었다.이를 통해 시스템의 이상 징후를 빠르게 감지할 수 있는 기틀은 마련되었다. 실제 운영 관점에서 한가지를 더 챙겨보아야 할 점이 있었는데어떤 API에서 에러를 발생 시켰는가?특정 사용자의 요청 흐름은 문제가 없는가?처리 시간이 비정상적으로 길었던 요청은 무엇이 있는가?동일한 예외가 언제부터 반복되고 있는가?Metrics는 무엇이 비정상적인가를 알려주지만, 왜 그런일이 발생했는가 까지의 설명은 해주지 않았다.이 지점에서 로그 기반 관측 환경 즉, ELK의 도입 필요성을 느끼게 되었다. ✓ Metrics와 Logs의 역할 구분Observability는 일반적으로 다음 세 가..