对 StorageGRID 系统进行故障排除
如果在使用 StorageGRID 系统时遇到问题,请参阅本节中的提示和指南,以获取有关确定和解决此问题的帮助。
通常,您可以自行解决问题;但是,您可能需要将某些问题上报给技术支持。
定义问题
解决问题的第一步是清晰地定义问题。
下表提供了为定义问题而可能收集的信息类型的示例:
| 问题 | 响应示例 |
|---|---|
StorageGRID 系统在做什么或不做什么?其症状是什么? |
客户端应用程序报告无法将对象接收到 StorageGRID。 |
问题是什么时候开始的? |
对象摄取于2020年1月8日约14:50首次被拒绝。 |
您最初是如何注意到这个问题的? |
由客户端应用程序通知。还收到了警报电子邮件通知。 |
问题是始终如一地发生,还是只是偶尔发生? |
问题仍然存在。 |
如果此问题经常发生,导致其发生的步骤是什么 |
每次客户端尝试摄取对象时都会出现问题。 |
如果问题间歇性发生,何时发生?记录您所知的每次事件发生的时间。 |
问题不是间歇性的。 |
您以前见过这个问题吗?您过去有多少次遇到过这个问题? |
这是我第一次看到此问题。 |
评估风险和对系统的影响
定义问题后,请评估其对 StorageGRID 系统的风险和影响。例如,存在关键警报并不一定意味着系统未能提供核心服务。
下表总结了示例问题对系统运行的影响:
| 问题 | 响应示例 |
|---|---|
StorageGRID 系统可以摄取内容吗? |
目标卷 |
客户端应用程序可以检索内容吗? |
某些对象可以检索,而其他对象则无法检索。 |
数据是否存在风险? |
目标卷 |
开展业务的能力是否受到严重影响? |
是的,因为客户端应用程序无法将对象存储到 StorageGRID 系统,并且无法一致地检索数据。 |
收集数据
定义问题并评估其风险和影响后,收集数据进行分析。最有用的数据类型取决于问题的性质。
| 要收集的数据类型 | 为何收集此数据 | AutoSupport |
|---|---|---|
创建最近更改的时间表 |
对 StorageGRID 系统、其配置或环境的更改可能会导致新的行为。 |
|
查看警报 |
通过提供可能导致问题的底层问题的重要线索,警报可以帮助您快速确定问题的根本原因。 查看当前警报列表,以查看 StorageGRID 是否已为您确定了问题的根本原因。 查看过去触发的提醒,获取更多见解。 |
|
建立基线 |
收集有关各种操作值的正常水平的信息。这些基线值以及与这些基线的偏差可以提供有价值的线索。 |
|
执行摄取和检索测试 |
要对接收和检索的性能问题进行故障排除,请使用工作站存储和检索对象。将结果与使用客户端应用程序时看到的结果进行比较。 |
|
查看审核消息 |
查看审核消息以详细跟踪 StorageGRID 操作。审核消息中的详细信息对于排除许多类型的问题(包括性能问题)非常有用。 |
|
检查对象位置和存储完整性 |
如果遇到存储问题,请验证对象是否放置在预期的位置。检查存储节点上对象数据的完整性。 |
|
收集数据以获得技术支持 |
技术支持可能会要求您收集数据或查看特定信息以帮助解决问题。 |
创建最近更改的时间表
当出现问题时,您应该考虑最近发生了什么变化以及何时发生这些变化。
-
对 StorageGRID 系统、其配置或环境的更改可能会导致新的行为。
-
变更时间线可以帮助您确定哪些变更可能是导致问题的原因,以及每个变更可能对其发展产生的影响。
创建系统最近更改的表格,其中包括有关每次更改发生时间的信息以及有关更改的任何相关详细信息,例如有关更改进行期间发生的其他情况的信息:
| 变更时间 | 变更类型 | 详细信息 |
|---|---|---|
例如:
|
发生了什么?您做了什么? |
记录有关更改的任何相关详细信息。例如:
请务必注意是否同时发生多个变更。例如,此更改是否在升级过程中进行? |
近期重大变化示例
以下是一些潜在重大变化的示例:
-
StorageGRID 系统最近是否安装、扩展或恢复?
-
系统最近是否已升级?是否已应用修补程序?
-
最近是否维修或更换过任何硬件?
-
是否已更新 ILM 策略?
-
客户工作负载是否发生了变化?
-
客户端应用程序或其行为是否已更改?
-
您是否更改了负载平衡器,或者添加或删除了管理节点或网关节点的高可用性组?
-
是否已开始执行任何可能需要很长时间才能完成的任务?示例包括:
-
发生故障的存储节点的恢复
-
存储节点退役
-
-
是否对用户身份验证进行了任何更改,例如添加租户或更改 LDAP 配置?
-
正在执行数据迁移吗?
-
最近是否启用或更改了平台服务?
-
最近是否启用了合规性?
-
是否已添加或删除云存储池?
-
是否对存储压缩或加密进行了任何更改?
-
网络基础设施是否有任何变化?例如,VLAN、路由器或 DNS。
-
是否对 NTP 源进行了任何更改?
-
是否对网格、管理或客户端网络接口进行了任何更改?
-
对 StorageGRID 系统或其环境是否进行了任何其他更改?
建立基线
您可以通过记录各种操作值的正常水平来为系统建立基线。未来,您可以将当前值与这些基线进行比较,以帮助检测和解决异常值。
| 属性 | 值 | 如何获取 |
|---|---|---|
平均存储消耗 |
每天消耗的 GB 每天消耗百分比 |
转到 Grid Manager。在"节点"页面上,选择整个网格或站点,然后转到"存储"选项卡。 在"使用的存储 - 对象数据"图表上,找到线条相当稳定的时间段。将光标放在图表上,以估计每天消耗的存储空间 您可以为整个系统或特定数据中心收集此信息。 |
平均元数据使用量 |
每天消耗的 GB 每天消耗百分比 |
转到 Grid Manager。在"节点"页面上,选择整个网格或站点,然后转到"存储"选项卡。 在"使用的存储 - 对象元数据"图表上,找到线条相当稳定的时间段。将光标放在图表上,以估计每天消耗的元数据存储量 您可以为整个系统或特定数据中心收集此信息。 |
S3 操作速率 |
操作/秒 |
在网格管理器仪表板上,选择 Performance > S3 operations for Storage Nodes。 要查看特定站点或节点的摄取和检索速率和计数,请选择 节点 > 站点或存储节点 > 对象。将光标放在 S3 摄取和检索图表上。 |
ILM评估率 |
对象/秒 |
在节点页面中,选择 grid > ILM。 在 ILM 队列图表中,找到线路相当稳定的时期。将光标放在图表上,以估计系统*评估率*的基线值。 |
ILM 扫描率 |
对象/秒 |
选择*节点* > 网格 > ILM。 在 ILM 队列图表中,找到线路相当稳定的时期。将光标放在图表上,以估计系统*扫描速率*的基线值。 |
从客户端操作排队的对象 |
对象/秒 |
选择*节点* > 网格 > ILM。 在 ILM 队列图表中,找到线路相当稳定的时期。将光标放在图表上,以估计系统的 Objects queued (from client operations) 的基线值。 |
平均查询延迟 |
毫秒 |
选择 Nodes > Storage Node > Objects。在"查询"表中,查看 Average Latency 的值。 |
分析数据
使用您收集的信息来确定问题的原因和潜在的解决方案。
分析取决于问题,但一般来说:
-
使用警报定位故障点和瓶颈。
-
使用警报历史记录和图表重建问题历史记录。
-
使用图表查找异常,并将问题情况与正常操作进行比较。
升级信息核对清单
如果您无法自行解决问题,请联系技术支持。在联系技术支持之前,请收集下表中列出的信息,以便于解决问题。
![]() |
个项目 | 说明 |
|---|---|---|
问题陈述 |
问题症状是什么?问题是什么时候开始的?这种情况是持续发生还是间歇性发生?如果是间歇性的,发生了几次? |
|
影响评估 |
问题的严重程度如何?对客户端应用程序有什么影响?
|
|
StorageGRID 系统 ID |
选择*维护* > 系统 > 许可证。StorageGRID 系统 ID 显示为当前许可证的一部分。 |
|
软件版本 |
从网格管理器顶端,选择帮助图标并选择*About*以查看 StorageGRID 版本。 |
|
自定义 |
总结 StorageGRID 系统的配置方式。例如,列出以下内容:
|
|
日志文件和系统数据 |
收集系统的日志文件和系统数据。选择*支持* > 工具 > 日志收集。 您可以收集整个网格或选定节点的日志。 如果仅收集选定节点的日志,请确保至少包含一个具有 ADC 服务的存储节点。安装在站点的前三个存储节点包括 ADC 服务。 |
|
基线信息 |
收集有关摄取操作、检索操作和存储消耗的基线信息。 |
|
最近更改的时间表 |
创建一个时间线,总结系统或其环境的任何最近更改。 |
|
诊断此问题的工作历史记录 |
如果您已自行采取措施诊断或排除问题,请务必记录您采取的步骤和结果。 |
