Skip to main content
本产品推出了新版本。
简体中文版经机器翻译而成,仅供参考。如与英语版出现任何冲突,应以英语版为准。

在 StorageGRID 中监控系统运行状况

每天监控 StorageGRID 系统的整体健康状况。

关于此任务

当网格的某些部分不可用时,StorageGRID 系统可以继续运行。警报指示的潜在问题不一定是系统操作问题。请调查 Grid Manager 信息板运行状况卡上汇总的问题。

若要在警报触发时立即收到通知,您可以 "为警报设置电子邮件通知""配置 SNMP 陷阱"

健康状态卡 - 控制面板

存在问题时,将显示允许您查看其他详细信息的链接:

链路 出现在……

网格详细信息

任何节点都已断开连接(连接状态未知或管理性关闭)。

当前警报(严重、重大、轻微)

警报是 <<${post_edited_translations.segment},当前活动>>。

最近已解决的提醒

过去一周内触发的警报 <<${post_edited_translations.segment},现已解决>>。

许可证

此 StorageGRID 系统的软件许可证存在问题。您可以"根据需要更新许可证信息"

监控节点连接状态

如果一个或多个节点与网格断开连接,则可能会影响关键的 StorageGRID 操作。监控节点连接状态并及时解决任何问题。

图标 问题描述 需采取行动

蓝色问号图标

未连接 - 未知

由于未知原因,节点断开连接或节点上的服务意外关闭。例如,节点上的服务可能已停止,或者节点可能因电源故障或意外中断而失去网络连接。

*无法与节点通信*警报也可能被触发。其他警报也可能处于活动状态。

需要立即注意。<<${post_edited_translations.segment},选择每个警报>>并遵循建议的操作。

例如,您可能需要重新启动已停止的服务或重新启动节点的主机。

注意:在托管关闭操作期间,节点可能显示为未知。在这些情况下,可以忽略未知状态。

灰色问号图标

未连接 - 管理性关闭

出于预期原因,节点未连接到网格。

例如,节点或节点上的服务已正常关闭、节点正在重新启动或软件正在升级。一个或多个警报也可能处于活动状态。

根据潜在问题,这些节点通常无需干预即可重新上线。

确定是否有任何警报影响此节点。

如果一个或多个警报处于活动状态,<<${post_edited_translations.segment},选择每个警报>>请按照建议的操作执行。

图标警报绿色复选标记

已连接

节点已连接到网格。

无需执行任何操作。

${post_edited_translations.segment}

当前警报:触发警报时,仪表板上会显示警报图标。节点页面上还会显示该节点的警报图标。如果"警报电子邮件通知已配置",则还会发送电子邮件通知,除非警报已被静音。

已解决的警报:您可以搜索和查看已解决的警报历史记录。

或者,您已观看视频:

警报概述

下表描述了当前和已解决警报在 Grid Manager 中显示的信息。

列标头 问题描述

名称或标题

警报的名称及其描述。

严重性

警报的严重程度。对于当前警报,如果对多个警报进行分组,标题行会显示该警报在每个严重程度下发生的实例数。

图标警报红色严重 严重:存在已停止 StorageGRID 节点或服务正常操作的异常情况。您必须立即解决根本问题。如果问题未得到解决,可能会导致服务中断和数据丢失。

图标警报橙色主要 重大:存在影响当前操作或接近严重警报阈值的异常情况。您应该调查重大警报并解决任何潜在问题,以确保异常情况不会阻止 StorageGRID 节点或服务的正常运行。

图标警报黄色轻微 Minor:系统正常运行,但存在异常情况,如果继续运行,可能会影响系统的运行能力。您应该监控并解决未自行清除的轻微警报,以确保它们不会导致更严重的问题。

时间触发

当前警报:在您的本地时间和 UTC 中触发警报的日期和时间。如果对多个警报进行了分组,标题行将显示警报最新实例(newest)和最旧实例(oldest)的时间。

已解决的警报:触发警报的时间。

站点/节点

正在发生或已发生警报的站点和节点的名称。

状态

警报是处于活动状态、静音状态还是已解决。如果对多个警报进行分组,并在下拉列表中选择了 All alerts,标题行将显示该警报处于活动状态的实例数以及已静默的实例数。

解决时间(仅限已解决的警报)

此警报已解决多久。

当前值或_数据值_

导致触发警报的指标值。对于某些警报,会显示其他值,以帮助您了解和调查警报。例如,为 Low object data storage 警报显示的值包括使用的磁盘空间百分比、磁盘空间总量以及使用的磁盘空间量。

注意: 如果对多个当前警报进行分组,则标题行中不会显示当前值。

触发值(仅已解决的警报)

导致触发警报的指标值。对于某些警报,会显示其他值,以帮助您了解和调查警报。例如,为 Low object data storage 警报显示的值包括使用的磁盘空间百分比、磁盘空间总量以及使用的磁盘空间量。

步骤
  1. 选择*当前警报*或*已解决警报*链接可查看这些类别中的警报列表。您还可以通过选择*节点* > node > 概览,然后从警报表中选择警报来查看警报的详细信息。

    默认情况下,当前警报显示如下:

    • 最近触发的警报将首先显示。

    • 相同类型的多个警报显示为一个组。

    • 已静音的警报不会显示。

    • 对于特定节点上的特定警报,如果超过一个严重程度达到阈值,则仅显示最严重的警报。也就是说,如果达到次要、主要和严重程度的警报阈值,则仅显示严重警报。

      "当前警报"页面每两分钟刷新一次。

  2. 要展开警报组,请选择向下插入符号 向下插入符号图标。要折叠组中的单个警报,请选择向上插入符号 向上插入符号图标,或选择组的名称。

  3. 要显示单个警报而不是警报组,请清除*Group alerts*复选框。

  4. 要对当前警报或警报组进行排序,请选择每个列标题中的向上/向下箭头 排序箭头图标

    • 当选择*组警报*时,每个组内的警报组和单个警报都会被排序。例如,您可能希望按*触发时间*对组中的警报进行排序,以查找特定警报的最新实例。

    • 清除*组警报*后,对整个警报列表进行排序。例如,您可能希望按*节点/站点*对所有警报进行排序,以查看影响特定节点的所有警报。

  5. 要按状态(All alertsActiveSilenced)过滤当前警报,请使用表格顶端的下拉菜单。

    请参阅 "静音警报通知"

  6. 要对已解决的警报进行排序:

    • 从*触发时*下拉菜单中选择时间段。

    • 从*严重程度*下拉菜单中选择一个或多个严重程度。

    • 从*警报规则*下拉菜单中选择一个或多个默认或自定义警报规则,以筛选与特定警报规则相关的已解决警报。

    • 从*节点*下拉菜单中选择一个或多个节点,以过滤与特定节点相关的已解决警报。

  7. 要查看特定警报的详细信息,请选择该警报。对话框提供所选警报的详细信息和建议操作。

  8. (可选)对于特定警报,选择"使此警报静音"可使导致触发此警报的警报规则静音。

    要使警报规则静音,您必须具有 "管理警报或 Root 访问权限"

    注意 决定将警报规则静音时要小心。如果警报规则被静音,则可能无法检测到潜在问题,直到该问题阻止关键操作完成。
  9. 要查看警报规则的当前条件:

    1. 在警报详细信息中,选择*查看条件*。

      出现一个弹出窗口,列出每个定义的严重程度的 Prometheus 表达式。

    2. 要关闭弹出窗口,请单击弹出窗口之外的任何位置。

  10. (可选)选择*编辑规则*以编辑触发此警报的警报规则。

    要编辑警报规则,您必须具有 "管理警报或 Root 访问权限"

    注意 在决定编辑警报规则时要小心。如果更改触发器值,则在阻止关键操作完成之前,可能无法检测到潜在问题。
  11. 要关闭警报详细信息,请选择*Close*。