Observability (관측성)
원본 보기Elastic Observability 솔루션 개요
Elastic Observability는 애플리케이션과 인프라 전반에 걸친 통합 관측성을 제공합니다. 로그, 메트릭, 애플리케이션 트레이스, 사용자 경험 데이터 등을 하나의 통합 플랫폼으로 결합합니다. 이러한 통합을 통해 강력한 상호 참조 분석이 가능해지며, 팀은 문제를 탐지하는 단계에서 근본 원인을 빠르고 효율적으로 파악하는 단계로 나아갈 수 있습니다. Elasticsearch의 검색 및 분석 기능을 활용해 시스템 동작에 대한 총체적인 관점을 제공합니다.
Elastic Observability는 유연한 데이터 수집을 위해 OpenTelemetry와 같은 개방형 표준을 채택하며, 계층형 스토리지를 통해 확장 가능하고 비용 효율적인 데이터 보존을 지원합니다.
Elastic을 처음 사용하시나요? Elastic Fundamentals를 참고해 Elastic Stack과 그 구성 요소, 배포 옵션을 알아보세요.
다양한 시나리오에 Observability를 적용해 운영 인지도와 시스템 신뢰성을 향상시키세요.
- 로그 모니터링 및 분석: 모든 소스에서 발생하는 페타바이트 규모의 로그 데이터를 중앙에서 수집하고 분석합니다. 빠른 검색, ES|QL을 이용한 임시 쿼리, 사전 구축된 대시보드를 통한 시각화로 문제를 진단할 수 있습니다.
- 애플리케이션 성능 모니터링(APM): 애플리케이션 성능을 코드 수준까지 들여다볼 수 있습니다. 네이티브 OTel 지원으로 트레이스를 수집·분석해 병목 지점을 찾고, 오류를 추적하며, 최종 사용자 경험을 최적화할 수 있습니다.
- 인프라 모니터링: OpenTelemetry를 포함한 400개 이상의 기본 제공 통합 기능으로 서버, 가상 머신, 컨테이너, 서버리스 환경의 메트릭을 모니터링합니다. 이를 통해 리소스 사용률과 전반적인 시스템 상태에 대한 깊이 있는 인사이트를 얻을 수 있습니다.
- Streams를 활용한 AI 기반 로그 분석: 복잡한 에이전트 관리나 수동 파싱 파이프라인 없이도 어떤 형식의 원시 로그든 단일 엔드포인트로 바로 수집합니다. Streams는 AI를 활용해 로그 데이터를 실시간으로 자동 파싱하고 구조화하며 분석합니다.
- 디지털 경험 모니터링:
- 실사용자 모니터링(RUM): 실제 사용자가 웹 애플리케이션과 상호작용하는 방식에 대한 데이터를 수집·분석해 체감 성능을 개선합니다.
- 신서틱 모니터링: 사용자 여정과 API 호출을 선제적으로 시뮬레이션해 애플리케이션의 가용성과 기능을 테스트합니다.
- 가동 시간 모니터링: 서비스와 애플리케이션의 상태를 지속적으로 점검해 가용성을 보장합니다.
- LLM 관측성: 대규모 언어 모델(LLM) 프롬프트와 응답의 성능, 사용량, 비용에 대한 심층적인 인사이트를 얻습니다.
- 인시던트 대응 및 관리: 여러 소스의 데이터를 상호 연관 지어 운영 인시던트를 조사하고, 근본 원인 분석과 해결 속도를 높입니다.
- Universal Profiling: 애플리케이션 계측 없이도 시스템 성능을 파악하고 비용이 많이 드는 코드 라인을 찾아내, CPU 효율을 높이고 클라우드 지출을 줄이는 데 도움을 줍니다.
Observability 여정을 시작하려면 필수 단계와 유용한 리소스 링크를 모두 담은 시작하기 가이드를 읽어보세요. Observability 퀵스타트 가이드를 살펴볼 수도 있습니다.
Elastic Observability의 핵심에는 그 기능을 뒷받침하는 여러 주요 구성 요소가 있습니다.
Observability의 세 가지 기둥은 다음과 같습니다:
OpenTelemetry: Observability는 OpenTelemetry에 대해 최상위 수준의 프로덕션 등급 지원을 제공합니다. 이를 통해 조직은 벤더 중립적인 계측을 사용하고, Elastic OpenTelemetry를 활용해 독자 규격 에이전트 없이 네이티브 OTel 데이터를 스트리밍할 수 있습니다.
AIOps 및 AI Assistant: 예측 분석과 LLM 기반 AI Assistant를 활용해 인시던트를 탐지하고 조사하고 해결하는 데 걸리는 시간을 단축합니다. 여기에는 설정이 필요 없는 이상 탐지, 패턴 분석, 상관관계와 근본 원인을 드러내는 기능이 포함됩니다.
알림: 복잡한 조건을 탐지하고 작업을 수행하는 규칙을 만들 수 있습니다.
케이스: 케이스를 통해 팀은 잠재적인 문제를 파악하고 조사 내역을 추적하며, 작업을 배정하고 해결 방안을 함께 논의할 수 있습니다.
서비스 수준 목표(SLO): 서비스의 신뢰성을 정의하고 모니터링하기 위한 프레임워크입니다. Elastic Observability에서는 SLO를 생성하고 추적해 성능 목표 달성 여부를 확인할 수 있습니다.
Observability 레퍼런스 문서는 Elastic 레퍼런스 문서에서 확인할 수 있습니다.
다음 구성 요소의 레퍼런스 문서도 살펴볼 수 있습니다:
새로운 기능, 개선 사항, 수정 내역에 대한 자세한 내용은 최신 Observability 릴리스 노트를 참고하세요.