StorageGRID에서 일반적으로 사용되는 Prometheus 메트릭
Prometheus에서 일반적으로 사용되는 메트릭 목록을 참조하여 기본 알림 규칙의 조건을 더 잘 이해하거나 사용자 지정 알림 규칙의 조건을 구성하십시오.
또한 모든 지표의 전체 목록 가져오기할 수도 있습니다.
Prometheus 쿼리 구문에 대한 자세한 내용은 "Prometheus 쿼리"을 참조하십시오.
Prometheus 메트릭이란 무엇인가요?
프로메테우스 메트릭은 시계열 측정값입니다. 관리 노드의 프로메테우스 서비스는 모든 노드의 서비스에서 이러한 메트릭을 수집합니다. 메트릭은 프로메테우스 데이터 저장 공간이 가득 찰 때까지 각 관리 노드에 저장됩니다. /var/local/mysql_ibdata/ 볼륨이 가득 차면 가장 오래된 메트릭부터 삭제됩니다.
Prometheus 메트릭은 어디에 사용되나요?
Prometheus가 수집한 메트릭은 Grid Manager의 여러 곳에서 사용됩니다.
-
노드 페이지: 노드 페이지에서 사용할 수 있는 탭의 그래프와 차트는 Grafana 시각화 도구를 사용하여 Prometheus에서 수집한 시계열 메트릭을 표시합니다. Grafana는 시계열 데이터를 그래프 및 차트 형식으로 표시하고, Prometheus는 백엔드 데이터 소스 역할을 합니다.

-
경고: Prometheus 메트릭을 사용하는 경고 규칙 조건이 참으로 평가될 때 특정 심각도 수준에서 경고가 발생합니다.
-
그리드 관리 API: Prometheus 메트릭을 사용자 지정 알림 규칙이나 외부 자동화 도구와 함께 사용하여 StorageGRID 시스템을 모니터링할 수 있습니다. Prometheus 메트릭 전체 목록은 그리드 관리 API에서 확인할 수 있습니다. (그리드 관리자 상단에서 도움말 아이콘을 선택하고 API 문서 > *메트릭*을 선택합니다.) 1,000개 이상의 메트릭이 제공되지만, 가장 중요한 StorageGRID 운영을 모니터링하는 데 필요한 메트릭은 상대적으로 적습니다.
이름에 _private_이 포함된 메트릭은 내부 용도로만 사용되며, StorageGRID 릴리스 간에 예고 없이 변경될 수 있습니다. -
지원 > 도구 > 진단 페이지와 지원 > 도구 > 메트릭 페이지: 이 페이지는 주로 기술 지원에서 사용하도록 설계되었으며, Prometheus 메트릭 값을 활용하는 여러 도구와 차트를 제공합니다.
측정항목 페이지 내의 일부 기능 및 메뉴 항목은 의도적으로 작동하지 않도록 설정되어 있으며 변경될 수 있습니다.
가장 일반적인 측정 지표 목록
다음 목록에는 가장 일반적으로 사용되는 Prometheus 메트릭이 포함되어 있습니다.
|
|
이름에 _private_이 포함된 메트릭은 내부 용도로만 사용되며 StorageGRID 릴리스 간에 예고 없이 변경될 수 있습니다. |
- alertmanager_notifications_failed_total
-
실패한 경고 알림의 총개수입니다.
- node_filesystem_avail_bytes
-
루트 사용자가 아닌 사용자가 사용할 수 있는 파일 시스템 공간의 크기(바이트).
- node_memory_MemAvailable_bytes
-
메모리 정보 필드 MemAvailable_bytes.
- node_network_carrier
-
운송업체 값:
/sys/class/net/iface. - node_network_receive_errs_total
-
네트워크 장치 통계
receive_errs. - node_network_transmit_errs_total
-
네트워크 장치 통계
transmit_errs. - storagegrid_administratively_down
-
해당 노드가 예상된 이유로 그리드에 연결되지 않았습니다. 예를 들어, 노드 또는 노드의 서비스가 정상적으로 종료되었거나, 노드가 재부팅 중이거나, 소프트웨어가 업그레이드 중인 경우입니다.
- storagegrid_appliance_compute_controller_hardware_status
-
어플라이언스 내 컴퓨팅 컨트롤러 하드웨어의 상태입니다.
- storagegrid_appliance_failed_disks
-
어플라이언스의 스토리지 컨트롤러에서 최적 상태가 아닌 드라이브의 수입니다.
- storagegrid_appliance_storage_controller_hardware_status
-
어플라이언스 내 스토리지 컨트롤러 하드웨어의 전반적인 상태.
- StorageGRID 콘텐츠 버킷 및 컨테이너
-
이 스토리지 노드가 알고 있는 S3 버킷의 총 개수입니다.
- storagegrid_content_objects
-
이 스토리지 노드가 알고 있는 S3 데이터 객체의 총 개수입니다. 이 개수는 S3를 통해 시스템과 상호 작용하는 클라이언트 애플리케이션에서 생성한 데이터 객체에 대해서만 유효합니다.
- storagegrid_content_objects_lost
-
이 서비스가 StorageGRID 시스템에서 누락된 것으로 감지한 객체의 총 개수입니다. 손실 원인을 파악하고 복구 가능 여부를 확인하기 위한 조치를 취해야 합니다.
- storagegrid_http_sessions_incoming_attempted
-
스토리지 노드에 대한 HTTP 세션 시도 횟수입니다.
- storagegrid_http_sessions_incoming_currently_established
-
스토리지 노드에서 현재 활성화(열림)된 HTTP 세션 수입니다.
- storagegrid_http_sessions_incoming_failed
-
잘못된 HTTP 요청 또는 작업 처리 중 오류로 인해 성공적으로 완료되지 못한 HTTP 세션의 총 개수입니다.
- storagegrid_http_sessions_incoming_successful
-
성공적으로 완료된 HTTP 세션의 총 개수입니다.
- storagegrid_ilm_awaiting_background_objects
-
스캔에서 ILM 평가를 기다리는 이 노드의 총 객체 수입니다.
- storagegrid_ilm_awaiting_client_evaluation_objects_per_second
-
이 노드에서 객체가 ILM 정책에 대해 평가되는 현재 속도입니다.
- storagegrid_ilm_awaiting_client_objects
-
클라이언트 작업(예: 데이터 수집)에서 ILM 평가를 기다리는 이 노드의 총 객체 수입니다.
- storagegrid_ilm_awaiting_total_objects
-
ILM 평가를 기다리는 객체의 총 개수입니다.
- storagegrid_ilm_scan_objects_per_second
-
이 노드가 소유한 객체가 ILM을 위해 스캔되고 대기열에 추가되는 속도입니다.
- storagegrid_ilm_scan_period_estimated_minutes
-
이 노드에서 전체 ILM 스캔을 완료하는 데 걸리는 예상 시간입니다.
참고: 전체 스캔을 수행한다고 해서 이 노드가 소유한 모든 객체에 ILM이 적용되었다는 보장은 없습니다.
- storagegrid_load_balancer_endpoint_cert_expiry_time
-
로드 밸런서 엔드포인트 인증서의 만료 시간(에포크 이후 초 단위).
- storagegrid_metadata_queries_average_latency_milliseconds
-
이 서비스를 통해 메타데이터 저장소에 대한 쿼리를 실행하는 데 필요한 평균 시간입니다.
- storagegrid_network_received_bytes
-
설치 이후 수신된 총 데이터 양.
- storagegrid_network_transmitted_bytes
-
설치 이후 전송된 총 데이터 양.
- storagegrid_node_cpu_utilization_percentage
-
현재 이 서비스가 사용 중인 가용 CPU 시간의 비율입니다. 서비스의 사용량을 나타냅니다. 가용 CPU 시간은 서버의 CPU 개수에 따라 달라집니다.
- storagegrid_ntp_chosen_time_source_offset_milliseconds
-
선택된 시간 소스에서 제공되는 시간에 대한 체계적인 오프셋입니다. 오프셋은 시간 소스에 도달하는 데 걸리는 지연 시간이 시간 소스가 NTP 클라이언트에 도달하는 데 필요한 시간과 같지 않을 때 발생합니다.
- storagegrid_ntp_locked
-
해당 노드는 네트워크 시간 프로토콜(NTP) 서버에 고정되어 있지 않습니다.
- storagegrid_s3_data_transfers_bytes_ingested
-
해당 속성이 마지막으로 재설정된 이후 S3 클라이언트에서 이 스토리지 노드로 수집된 총 데이터 양입니다.
- storagegrid_s3_data_transfers_bytes_retrieved
-
해당 속성이 마지막으로 재설정된 이후 S3 클라이언트가 이 스토리지 노드에서 검색한 총 데이터 양입니다.
- storagegrid_s3_operations_failed
-
S3 인증 실패로 인한 작업을 제외한 S3 작업 실패(HTTP 상태 코드 4xx 및 5xx)의 총 개수입니다.
- storagegrid_s3_operations_successful
-
S3 작업 성공 횟수(HTTP 상태 코드 2xx)의 총합입니다.
- storagegrid_s3_operations_unauthorized
-
권한 부여 실패로 인해 발생한 S3 작업 실패 건수의 총합입니다.
- storagegrid_servercertificate_management_interface_cert_expiry_days
-
관리 인터페이스 인증서가 만료되기까지 남은 일수입니다.
- storagegrid_servercertificate_storage_api_endpoints_cert_expiry_days
-
객체 스토리지 API 인증서가 만료되기까지 남은 일수입니다.
- storagegrid_service_cpu_seconds
-
설치 이후 해당 서비스가 CPU를 사용한 누적 시간입니다.
- storagegrid_service_memory_usage_bytes
-
현재 이 서비스에서 사용 중인 메모리(RAM) 용량입니다. 이 값은 Linux의 top 유틸리티에서 RES로 표시되는 값과 동일합니다.
- storagegrid_service_network_received_bytes
-
이 서비스가 설치된 이후 수신한 총 데이터 양입니다.
- storagegrid_service_network_transmitted_bytes
-
이 서비스에서 전송된 총 데이터 양.
- storagegrid_service_restarts
-
서비스가 재시작된 총 횟수.
- storagegrid_service_runtime_seconds
-
서비스 설치 이후 현재까지 서비스가 실행된 총 시간입니다.
- storagegrid_service_uptime_seconds
-
서비스가 마지막으로 재시작된 이후 실행된 총 시간입니다.
- storagegrid_storage_state_current
-
스토리지 서비스의 현재 상태입니다. 속성 값은 다음과 같습니다.
-
10 = 오프라인
-
15 = 유지보수
-
20 = 읽기 전용
-
30 = 온라인
-
- storagegrid_storage_status
-
스토리지 서비스의 현재 상태입니다. 속성 값은 다음과 같습니다.
-
0 = 오류 없음
-
10 = 전환 중
-
20 = 여유 공간 부족
-
30 = 볼륨을 사용할 수 없습니다
-
40 = 오류
-
- storagegrid_storage_utilization_data_bytes
-
스토리지 노드에 복제 및 소거 코딩된 객체 데이터의 총 크기에 대한 추정치입니다.
- storagegrid_storage_utilization_metadata_allowed_bytes
-
각 스토리지 노드의 볼륨 0에서 객체 메타데이터에 허용된 총 공간입니다. 이 값은 노드의 메타데이터에 대해 실제로 예약된 공간보다 항상 작습니다. 예약 공간의 일부가 필수 데이터베이스 작업(예: 압축 및 복구)과 향후 하드웨어 및 소프트웨어 업그레이드에 필요하기 때문입니다. 객체 메타데이터에 허용된 공간은 전체 객체 용량을 제어합니다.
- storagegrid_storage_utilization_metadata_bytes
-
스토리지 볼륨 0에 있는 객체 메타데이터의 용량(바이트).
- storagegrid_storage_utilization_total_space_bytes
-
모든 객체 저장소에 할당된 총 스토리지 공간의 양입니다.
- storagegrid_storage_utilization_usable_space_bytes
-
남은 객체 스토리지 공간의 총량입니다. 스토리지 노드의 모든 객체 저장소에 사용 가능한 공간을 합산하여 계산합니다.
- storagegrid_tenant_usage_data_bytes
-
테넌트의 모든 객체에 대한 논리적 크기입니다.
- storagegrid_tenant_usage_object_count
-
테넌트의 오브젝트 수입니다.
- storagegrid_tenant_usage_quota_bytes
-
테넌트의 객체에 사용할 수 있는 최대 논리 공간입니다. 할당량 측정 기준이 제공되지 않으면 무제한 공간이 제공됩니다.