疑難排解 StorageGRID 系統
如果您在使用 StorageGRID 系統時遇到問題,請參閱本節中的提示和指南,以協助您判斷並解決問題。
通常情況下,您可以自行解決問題;但是,您可能需要將某些問題提報給技術支援。
定義問題
解決問題的第一步是明確定義問題。
下表列舉了一些為定義問題而可能需要收集的資訊類型範例:
| 問題 | 範例回應 |
|---|---|
StorageGRID 系統正在做什麼或沒有做什麼?它有哪些症狀? |
用戶端應用程式報告無法將物件擷取至 StorageGRID。 |
問題是什麼時候開始出現的? |
2020 年 1 月 8 日 14:50 左右,物件擷取首次遭到拒絕。 |
您最初是如何發現此問題的? |
用戶端應用程式已發出通知。同時也收到了警報郵件通知。 |
這個問題是經常發生,還是偶爾發生? |
問題仍在持續中。 |
如果問題經常發生,是哪些步驟導致此問題發生 |
每次用戶端嘗試擷取物件時都會出現問題。 |
如果問題是間歇性發生的,它何時發生?請記錄您所知道的每次事件發生的時間。 |
問題並非間歇性出現。 |
您以前曾遇過這個問題嗎?過去您遇到這個問題的頻率為何? |
這是我第一次遇到這個問題。 |
評估風險及對系統的影響
在明確問題之後,評估其風險以及對 StorageGRID 系統的影響。例如,出現關鍵警示並不一定表示系統無法提供核心服務。
下表總結了範例問題對系統運作的影響:
| 問題 | 範例回應 |
|---|---|
StorageGRID 系統可以擷取內容嗎? |
${post_edited_translations.segment} |
用戶端應用程式能否擷取內容? |
有些物件可以擷取,有些則不能。 |
資料是否有風險? |
${post_edited_translations.segment} |
開展業務的能力是否受到嚴重影響? |
是的,因為用戶端應用程式無法將物件儲存到 StorageGRID 系統中,因此無法一致地擷取資料。 |
收集資料
在明確問題並評估其風險和影響之後,收集資料進行分析。最有用的資料類型取決於問題的性質。
| 要收集的資料類型 | 為什麼要收集這些資料 | 指示 |
|---|---|---|
建立近期變更時間線 |
StorageGRID 系統、其組態或其環境的變更可能會導致新的行為。 |
|
審查警示 |
警報可協助您快速判斷問題的根本原因,提供可能導致問題的潛在問題的重要線索。 查看目前警示清單,看看 StorageGRID 是否已為您找到問題的根本原因。 審查過去觸發的警示,以獲取更多資訊。 |
|
建立基線 |
收集各項運作指標正常水準的資訊。這些基準值及其偏差可以提供有價值的線索。 |
|
執行擷取和檢索測試 |
若要疑難排解擷取和檢索方面的效能問題,請使用工作站儲存和擷取物件。將結果與使用用戶端應用程式時所見的結果進行比較。 |
|
審查稽核訊息 |
審查稽核訊息,詳細了解 StorageGRID 的操作。稽核訊息中的詳細資訊有助於疑難排解多種問題,包括效能問題。 |
|
檢查物件位置和儲存設備完整性 |
如果遇到儲存設備問題,請確認物件是否放置在預期位置。檢查儲存節點上物件資料的完整性。 |
|
收集技術支援資料 |
技術支援可能會要求您收集資料或審查特定資訊,以協助疑難排解問題。 |
建立近期變更時間線
當發生問題時,您應該考慮最近發生了哪些變更,以及這些變更是何時發生的。
-
StorageGRID 系統、其組態或其環境的變更可能會導致新的行為。
-
變更時間軸可以幫助您確定哪些變更可能導致了某個問題,以及每項變更如何影響了問題的發展。
建立一張表格,記錄系統最近的變更,包括每次變更發生的時間以及與變更相關的任何詳細資訊,例如變更進行期間發生的其他情況:
| 變革的時代 | 變更類型 | 詳細資料 |
|---|---|---|
例如:
|
發生了什麼事?您做了什麼? |
記錄與變更相關的任何詳細資訊。例如:
務必附註是否同時發生了多項變更。例如,此變更是否在升級過程中進行? |
近期重大變更範例
以下是一些可能發生重大變化的例子:
-
StorageGRID 系統是最近安裝、擴充還是恢復的?
-
系統最近升級過嗎?是否套用了 Hotfix?
-
最近是否有任何硬體進行過維修或更換?
-
ILM 原則是否已更新?
-
用戶端的工作負載是否改變了?
-
用戶端應用程式或其行為是否發生了變化?
-
您是否更改了負載平衡器,或新增或移除了管理節點或閘道節點的高可用度群組?
-
是否有任何已啟動但可能需要很長時間才能完成的任務?例如:
-
恢復故障儲存節點
-
儲存節點退役
-
-
使用者身分驗證方面是否進行了任何變更,例如新增租戶或變更 LDAP 組態?
-
資料移轉正在進行嗎?
-
平台服務最近是否啟用或更改?
-
最近是否啟用了法規遵循功能?
-
雲端儲存池是否已新增或移除?
-
儲存設備壓縮或加密是否有任何變更?
-
網路基礎架構是否有任何變更?例如,VLAN、路由器或 DNS。
-
NTP 來源是否有任何變更?
-
網格、管理或用戶端網路介面是否有任何變更?
-
StorageGRID 系統或其環境是否有其他變更?
建立基線
您可以透過記錄各種運作值的正常等級來建立系統的基線。將來,您可以將目前值與這些基線進行比較,以協助偵測及解決異常值。
| 屬性 | 價值 | 如何獲得 |
|---|---|---|
平均儲存設備消耗量 |
每日消耗GB數 每日消耗百分比 |
前往 Grid Manager。在「節點」頁面上,選擇整個網格或站台,然後前往「儲存設備」標籤。 在「已使用儲存設備 - 物件資料」圖表中,找到線條相對穩定的時期。將遊標懸停在圖表上,估算每天消耗的儲存設備量。 您可以收集整個系統或特定資料中心的此類資訊。 |
平均中繼資料消耗量 |
每日消耗GB數 每日消耗百分比 |
前往 Grid Manager。在「節點」頁面上,選擇整個網格或站台,然後前往「儲存設備」標籤。 在「已使用儲存設備 - 物件中繼資料」圖表中,找到線條相對穩定的時期。將遊標停留在圖表上,即可估算每天消耗的中繼資料儲存設備容量。 您可以收集整個系統或特定資料中心的此類資訊。 |
S3 操作速率 |
每秒運算元 |
在 Grid Manager 儀表板上,選擇 效能 > 儲存節點的 S3 操作。 若要查看特定站台或節點的擷取和擷取速率及計數,請選擇 Nodes > site or Storage Node > Objects。將游標停留在 S3 擷取和擷取圖表上。 |
ILM 評估率 |
每秒物件數 |
從「節點」頁面中,選擇 grid > ILM。 在 ILM 佇列圖表中,找出一段線條相對穩定的時間段。將游標停留在圖表上,以估算系統的*評估率*基準值。 |
ILM 掃描速率 |
每秒物件數 |
選擇 節點 > grid > ILM。 在 ILM 佇列圖表上,找出線條相對穩定的時期。將遊標停留在圖表上,以估算系統的*掃描速率*基準值。 |
用戶端操作佇列中的物件 |
每秒物件數 |
選擇 節點 > grid > ILM。 在 ILM 佇列圖表中,找到線條相對穩定的時期。將游標停留在圖表上,以估算系統中「已排隊物件(來自用戶端操作)」的基準值。 |
平均查詢延遲 |
毫秒 |
選取 Nodes > Storage Node > Objects。在 Queries 表中,檢視 Average Latency 的值。 |
分析資料
利用收集到的資訊來確定問題的原因和潛在的解決方案。
分析方法取決於具體問題,但總體而言:
-
利用警示找出故障點和瓶頸。
-
利用警示歷史記錄和圖表重建問題歷史。
-
使用圖表尋找異常情況,並將問題狀況與正常運作情況進行比較。
升級資訊核對清單
如果您無法自行解決問題,請聯絡技術支援。在聯絡技術支援之前,請收集下表所列資訊,以利問題解決。
![]() |
項目 | 附註 |
|---|---|---|
問題聲明 |
問題症狀是什麼?問題是什麼時候開始出現的?是持續發生還是間歇性發生?如果是間歇性發生,具體發生在哪些時候? |
|
影響評估 |
問題的嚴重程度如何?對用戶端應用程式有何影響?
|
|
StorageGRID 系統 ID |
選擇 Maintenance > System > License。StorageGRID 系統 ID 會顯示為目前授權的一部分。 |
|
軟體版本 |
從 Grid Manager 頂端選取說明圖示,然後選取 關於 以查看 StorageGRID 版本。 |
|
客製化 |
請簡要概述您的 StorageGRID 系統配置。例如,列出以下內容:
|
|
日誌檔案和系統資料 |
收集系統的日誌檔案和系統資料。選擇 Support > Tools > Log collection。 您可以收集整個網格的日誌,也可以收集選定節點的日誌。 如果您僅收集特定節點的日誌,請確保至少包含一個具有 ADC 服務的 Storage Node。站台上安裝的前三個 Storage Node 均包含 ADC 服務。 |
|
基線資訊 |
收集有關擷取作業、擷取作業和儲存設備消耗的基準資訊。 |
|
近期變更時間表 |
建立時間表,彙整系統或其環境的近期變更。 |
|
診斷該問題的歷史嘗試 |
如果您已採取措施自行診斷或排除問題,請務必記錄您採取的步驟和結果。 |
