Skip to content

서비스 맵

전체 문서 PDF

서비스 맵은 최근 15분 동안 관찰된 서비스 연결을 토폴로지로 보여 줍니다. 문제가 있는 서비스를 중심으로 upstream과 downstream을 좁혀 보며 지연이나 실패가 전파되는 경로를 확인할 수 있습니다.

backend 서비스의 1-hop 연결과 상세 정보를 표시한 Service Map 화면

왼쪽 메뉴에서 Service Map을 선택합니다. 처음에는 한 서비스를 중심으로 직접 연결된 서비스가 표시됩니다.

영역 설명
상단 요약 전체 서비스와 edge 수, 관찰된 연결 수, 조회 구간을 보여 줍니다.
검색 서비스 또는 네임스페이스 이름으로 대상을 찾습니다.
Namespaces 네임스페이스별 서비스를 펼쳐 보고 분석할 서비스를 선택합니다.
토폴로지 범위 선택한 서비스를 기준으로 1 hop, 2 hops, All (aggregated) 범위를 전환합니다.
그래프 서비스 상태와 연결 방향, 연결 수, p95 지연 시간을 보여 줍니다.
상세 패널 선택한 서비스의 상태, 네임스페이스, 연결 수, 최대 p95 지연 시간, upstream·downstream 수를 보여 줍니다.
Layout 그래프를 다시 배치하거나 배치 방식과 간격을 조정합니다.
Refresh 최신 서비스 맵 데이터를 즉시 다시 불러옵니다.
  1. 검색창이나 Namespaces 목록에서 분석할 서비스를 선택합니다.
  2. 1 hop에서 직접 연결된 upstream과 downstream을 확인합니다.
  3. 원인을 더 넓게 추적해야 하면 2 hops로 전환합니다.
  4. 전체 토폴로지를 비교해야 할 때만 All (aggregated)을 사용합니다.
  5. 그래프의 노드 또는 오른쪽 Connected services 항목을 선택해 분석 대상을 이동합니다.

노드의 Healthy, Slow, Failed 상태와 p95 지연 시간을 함께 확인합니다. 연결이 많아 그래프가 복잡하면 1 hop부터 시작하고, Layout의 재배치 또는 Fit view를 사용해 화면을 정리합니다.

  1. Slow 또는 Failed 상태인 서비스를 선택합니다.
  2. 상세 패널에서 최대 p95 지연 시간과 연결 수를 확인합니다.
  3. 1 hop에서 직접 연결된 upstream과 downstream의 상태를 비교합니다.
  4. 원인 후보가 보이지 않으면 2 hops로 범위를 넓힙니다.
  5. 관련 인시던트가 있다면 인시던트 화면의 메트릭·로그·Trace·Kubernetes 이벤트를 함께 확인합니다.

Trace는 별도 메뉴나 독립 화면으로 제공하지 않습니다. 조직별 대시보드의 Trace 패널 또는 인시던트의 telemetry context에서 확인합니다.

  • 현재 조직에 dashboard.readdatasource.read 권한이 있는지 확인합니다.
  • Settings > ClickHouse에서 데이터소스가 활성화되어 있고 연결 테스트가 성공하는지 확인합니다.
  • 데이터가 비어 있으면 최근 15분에 서비스 간 호출이 있었는지와 Collector 또는 agent의 export 상태를 확인합니다.
  • 로딩에 실패하면 ClickHouse 연결과 Backend 응답을 차례로 점검합니다.