StorageGRID 시스템 문제 해결
StorageGRID 시스템 사용 중 문제가 발생하면 이 섹션의 팁과 지침을 참조하여 문제를 파악하고 해결하십시오.
대부분의 경우 문제를 스스로 해결할 수 있지만, 일부 문제는 기술 지원에 에스컬레이션해야 할 수도 있습니다.
문제 정의
문제를 해결하는 첫 번째 단계는 문제를 명확하게 정의하는 것입니다.
${post_edited_translations.segment}
| 질문 | 응답 예 |
|---|---|
StorageGRID 시스템이 현재 어떤 기능을 수행하고 있거나 수행하지 않고 있습니까? 시스템의 증상은 무엇입니까? |
클라이언트 애플리케이션에서 객체를 StorageGRID에 수집할 수 없다고 보고하고 있습니다. |
문제는 언제부터 시작되었나요? |
객체 수집이 처음으로 거부된 시각은 2020년 1월 8일 오후 2시 50분경입니다. |
문제를 처음 어떻게 알아차리셨나요? |
클라이언트 애플리케이션을 통해 알림을 받았습니다. 이메일 알림도 수신했습니다. |
문제가 지속적으로 발생하나요, 아니면 가끔씩만 발생하나요? |
문제는 계속되고 있습니다. |
문제가 정기적으로 발생한다면, 어떤 단계에서 문제가 발생하는 것입니까? |
클라이언트가 객체를 수집하려고 할 때마다 문제가 발생합니다. |
문제가 간헐적으로 발생하는 경우, 언제 발생합니까? 인지하고 있는 각 인시던트의 시간을 기록하십시오. |
문제는 간헐적으로 발생하는 것이 아닙니다. |
이 문제를 전에 보신 적이 있나요? 과거에 이 문제가 얼마나 자주 발생했나요? |
${post_edited_translations.segment} |
시스템에 미치는 위험과 영향을 평가합니다.
문제를 정의한 후에는 해당 문제가 StorageGRID 시스템에 미치는 위험과 영향을 평가하십시오. 예를 들어, 심각한 경고가 발생했다고 해서 시스템이 핵심 서비스를 제공하지 못하고 있다는 의미는 아닙니다.
이 표는 예시 문제가 시스템 운영에 미치는 영향을 요약한 것입니다.
| 질문 | 응답 예 |
|---|---|
StorageGRID 시스템은 콘텐츠를 수집할 수 있습니까? |
아니요. |
클라이언트 애플리케이션이 콘텐츠를 검색할 수 있습니까? |
일부 객체는 검색할 수 있지만, 다른 객체는 검색할 수 없습니다. |
데이터가 위험에 처해 있습니까? |
아니요. |
사업 운영 능력에 심각한 영향이 있습니까? |
예, 클라이언트 애플리케이션이 StorageGRID 시스템에 객체를 저장할 수 없고 데이터를 일관되게 검색할 수 없기 때문입니다. |
데이터를 수집합니다
문제를 정의하고 위험 및 영향을 평가한 후에는 분석을 위한 데이터를 수집하십시오. 수집하는 것이 가장 유용한 데이터 유형은 문제의 성격에 따라 다릅니다.
| 수집할 데이터 유형 | 이 데이터를 수집하는 이유 | 지침 |
|---|---|---|
최근 변경 사항의 타임라인 생성 |
StorageGRID 시스템, 시스템 구성 또는 환경이 변경되면 새로운 동작이 발생할 수 있습니다. |
|
알림 검토 |
알림은 문제의 근본 원인을 신속하게 파악하는 데 도움이 되며, 문제의 원인이 될 수 있는 근본적인 문제에 대한 중요한 단서를 제공합니다. StorageGRID 문제의 근본 원인을 파악했는지 확인하려면 현재 알림 목록을 검토하십시오. 추가적인 정보를 얻으려면 과거에 발생한 알림을 검토하세요. |
|
기준선 설정 |
다양한 운영 값의 정상 수준에 대한 정보를 수집하십시오. 이러한 기준값과 기준값으로부터의 편차는 귀중한 단서를 제공할 수 있습니다. |
|
수집 및 검색 테스트를 수행합니다. |
데이터 수집 및 검색 시 성능 문제를 해결하려면 워크스테이션을 사용하여 객체를 저장하고 검색하십시오. 클라이언트 애플리케이션을 사용할 때 나타나는 결과와 비교하십시오. |
|
감사 메시지 검토 |
StorageGRID 운영 상황을 자세히 추적하려면 감사 메시지를 검토하십시오. 감사 메시지에 포함된 세부 정보는 성능 문제를 비롯한 다양한 유형의 문제를 해결하는 데 유용할 수 있습니다. |
|
객체 위치 및 스토리지 무결성 확인 |
스토리지 문제가 발생하는 경우, 객체가 예상 위치에 저장되고 있는지 확인하십시오. 스토리지 노드에서 객체 데이터의 무결성을 검사하십시오. |
|
기술 지원을 위한 데이터 수집 |
기술 지원팀은 문제 해결을 위해 데이터 수집이나 특정 정보 검토를 요청할 수 있습니다. |
최근 변경 사항의 타임라인 생성
문제가 발생했을 때는 최근에 무엇이 바뀌었는지, 그리고 그 변화가 언제 발생했는지를 고려해야 합니다.
-
StorageGRID 시스템, 시스템 구성 또는 환경이 변경되면 새로운 동작이 발생할 수 있습니다.
-
변경 사항 타임라인을 통해 어떤 변경 사항이 문제의 원인이었는지, 그리고 각 변경 사항이 문제 발생에 어떤 영향을 미쳤는지 파악할 수 있습니다.
최근 시스템 변경 사항에 대한 표를 만드세요. 이 표에는 각 변경 사항이 발생한 시점과 변경 진행 중에 발생한 다른 작업 등 관련 세부 정보가 포함되어야 합니다.
| 변경 시간 | 변경 유형 | 세부 정보 |
|---|---|---|
예를 들면 다음과 같습니다.
|
무슨 일이 있었나요? 무엇을 하셨나요? |
변경 사항에 대한 관련 세부 정보를 모두 기록하십시오. 예를 들면 다음과 같습니다.
동시에 여러 변경 사항이 발생했는지 반드시 기록해 두십시오. 예를 들어, 업그레이드가 진행 중인 동안 해당 변경 사항이 적용되었는지 확인하십시오. |
최근 발생한 주요 변화의 사례
잠재적으로 중요한 변화의 몇 가지 예는 다음과 같습니다.
-
StorageGRID 시스템이 최근에 설치, 확장 또는 복구되었습니까?
-
시스템이 최근에 업그레이드되었습니까? 핫픽스가 적용되었습니까?
-
최근에 하드웨어를 수리하거나 교체한 적이 있습니까?
-
ILM 정책이 업데이트되었습니까?
-
클라이언트 워크로드가 변경되었습니까?
-
클라이언트 애플리케이션이나 그 동작 방식이 변경되었습니까?
-
로드 밸런서를 변경했거나, 관리 노드 또는 게이트웨이 노드의 고가용성 그룹을 추가 또는 제거했습니까?
-
완료하는 데 오랜 시간이 걸릴 수 있는 작업이 시작되었습니까? 예를 들면 다음과 같습니다.
-
장애가 발생한 스토리지 노드 복구
-
스토리지 노드 서비스 해제
-
-
사용자 인증에 테넌트 추가 또는 LDAP 구성 변경과 같은 변경 사항이 있었습니까?
-
데이터 마이그레이션이 진행 중입니까?
-
플랫폼 서비스가 최근에 활성화되었거나 변경되었습니까?
-
최근에 규정 준수 기능이 활성화되었습니까?
-
클라우드 스토리지 풀이 추가되었거나 제거되었습니까?
-
스토리지 압축 또는 암호화에 변경 사항이 있습니까?
-
네트워크 인프라에 변경 사항이 있었나요? 예를 들어 VLAN, 라우터 또는 DNS.
-
NTP 소스에 변경 사항이 있었습니까?
-
그리드, 관리자 또는 클라이언트 네트워크 인터페이스에 변경 사항이 있었습니까?
-
StorageGRID 시스템 또는 해당 환경에 다른 변경 사항이 있었습니까?
기준선 설정
시스템의 다양한 작동 값의 정상 수준을 기록하여 기준선을 설정할 수 있습니다. 향후 현재 값을 이러한 기준선과 비교하여 비정상적인 값을 감지하고 해결하는 데 도움을 받을 수 있습니다.
| 속성 | 가치 | 얻는 방법 |
|---|---|---|
평균 저장 공간 사용량 |
GB 소비량/일 일일 소비량 비율 |
그리드 관리자로 이동합니다. 노드 페이지에서 전체 그리드 또는 사이트를 선택하고 스토리지 탭으로 이동합니다. 저장 공간 사용량 - 객체 데이터 차트에서 선이 비교적 안정적인 기간을 찾습니다. 차트 위에 커서를 올려놓으면 매일 사용되는 저장 공간의 양을 추정할 수 있습니다. 이 정보는 전체 시스템 또는 특정 데이터 센터에 대해 수집할 수 있습니다. |
평균 메타데이터 소비량 |
GB 소비량/일 일일 소비량 비율 |
그리드 관리자로 이동합니다. 노드 페이지에서 전체 그리드 또는 사이트를 선택하고 스토리지 탭으로 이동합니다. '저장 공간 사용량 - 객체 메타데이터' 차트에서 선이 비교적 안정적인 기간을 찾습니다. 차트 위에 커서를 올려놓으면 매일 사용되는 메타데이터 저장 공간의 양을 추정할 수 있습니다. 이 정보는 전체 시스템 또는 특정 데이터 센터에 대해 수집할 수 있습니다. |
S3 작업 속도 |
초당 연산 횟수 |
그리드 관리자 대시보드에서 성능 > *스토리지 노드용 S3 작업*을 선택합니다. 특정 사이트 또는 노드의 수집 및 검색 속도와 횟수를 확인하려면 노드 > 사이트 또는 스토리지 노드 > *객체*를 선택하세요. S3 수집 및 검색 차트 위에 커서를 올려놓으세요. |
ILM 평가 비율 |
초당 객체 수 |
노드 페이지에서 grid > *ILM*을 선택합니다. ILM 큐 차트에서 선이 비교적 안정적인 구간을 찾습니다. 차트 위에 커서를 올려놓고 시스템의 *평가율*에 대한 기준값을 추정합니다. |
ILM 스캔 속도 |
초당 객체 수 |
노드 > 그리드 > ILM을 선택합니다. ILM 큐 차트에서 선이 비교적 안정적인 구간을 찾습니다. 차트 위에 커서를 올려놓고 시스템의 *스캔 속도*에 대한 기준값을 추정합니다. |
클라이언트 작업에서 대기열에 추가된 객체 |
초당 객체 수 |
노드 > 그리드 > ILM을 선택합니다. ILM 대기열 차트에서 선이 상당히 안정적인 기간을 찾습니다. 차트 위에 커서를 올려 시스템의 *대기 중인 개체(클라이언트 작업)*에 대한 기준값을 추정합니다. |
${post_edited_translations.segment} |
밀리초 |
노드 > 스토리지 노드 > 객체를 선택합니다. 쿼리 테이블에서 평균 지연 시간 값을 확인합니다. |
데이터 분석
수집한 정보를 활용하여 문제의 원인과 가능한 해결책을 파악하십시오.
분석은 문제에 따라 다르지만, 일반적으로 다음과 같습니다.
-
알림 기능을 활용하여 오류 발생 지점과 병목 현상을 파악하십시오.
-
경고 기록 및 차트를 사용하여 문제 발생 이력을 재구성합니다.
-
차트를 사용하여 이상 징후를 찾아내고 문제 상황을 정상 작동 상황과 비교하십시오.
에스컬레이션 정보 체크리스트
문제를 직접 해결할 수 없는 경우 기술 지원 부서에 문의하십시오. 기술 지원 부서에 문의하기 전에 다음 표에 나열된 정보를 준비하면 문제 해결에 도움이 됩니다.
![]() |
항목 | 참고 |
|---|---|---|
문제 제기 |
문제 증상은 무엇입니까? 문제가 언제 시작되었습니까? 일관되게 발생합니까, 아니면 간헐적으로 발생합니까? 간헐적으로 발생하는 경우, 어느 시간대에 발생했습니까? |
|
영향 평가 |
문제의 심각도는 어떻게 됩니까? 클라이언트 애플리케이션에 미치는 영향은 어떻게 됩니까?
|
|
StorageGRID 시스템 ID |
유지 관리 > 시스템 > *라이선스*를 선택하십시오. StorageGRID 시스템 ID는 현재 라이선스의 일부로 표시됩니다. |
|
소프트웨어 버전 |
${post_edited_translations.segment} |
|
맞춤 설정 |
StorageGRID 시스템 구성 방식을 요약하십시오. 예를 들어 다음 사항을 나열하십시오.
|
|
로그 파일 및 시스템 데이터 |
시스템의 로그 파일과 시스템 데이터를 수집합니다. 지원 > 도구 > *로그 수집*을 선택하십시오. 전체 그리드 또는 선택한 노드에 대한 로그를 수집할 수 있습니다. 선택한 노드에 대한 로그만 수집하는 경우, ADC 서비스가 포함된 스토리지 노드를 최소 하나 이상 포함해야 합니다. 사이트에 설치된 최초 3개의 스토리지 노드에는 ADC 서비스가 포함되어 있습니다. |
|
${post_edited_translations.segment} |
데이터 수집 작업, 데이터 검색 작업 및 저장 공간 사용량에 대한 기본 정보를 수집합니다. |
|
최근 변경 사항 타임라인 |
${post_edited_translations.segment} |
|
문제 진단을 위한 노력의 이력 |
문제를 직접 진단하거나 해결하기 위해 조치를 취했다면, 취한 조치와 그 결과를 기록해 두십시오. |
