在 StorageGRID 中监控系统运行状况
每天监控 StorageGRID 系统的整体健康状况。
当网格的某些部分不可用时,StorageGRID 系统可以继续运行。警报指示的潜在问题不一定是系统操作问题。请调查 Grid Manager 信息板运行状况卡上汇总的问题。
若要在警报触发时立即收到通知,您可以 "为警报设置电子邮件通知"或"配置 SNMP 陷阱"。

存在问题时,将显示允许您查看其他详细信息的链接:
| 链路 | 出现在…… |
|---|---|
网格详细信息 |
任何节点都已断开连接(连接状态未知或管理性关闭)。 |
当前警报(严重、重大、轻微) |
警报是 <<${post_edited_translations.segment},当前活动>>。 |
最近已解决的提醒 |
过去一周内触发的警报 <<${post_edited_translations.segment},现已解决>>。 |
许可证 |
此 StorageGRID 系统的软件许可证存在问题。您可以"根据需要更新许可证信息"。 |
监控节点连接状态
如果一个或多个节点与网格断开连接,则可能会影响关键的 StorageGRID 操作。监控节点连接状态并及时解决任何问题。
| 图标 | 问题描述 | 需采取行动 |
|---|---|---|
|
未连接 - 未知 由于未知原因,节点断开连接或节点上的服务意外关闭。例如,节点上的服务可能已停止,或者节点可能因电源故障或意外中断而失去网络连接。 *无法与节点通信*警报也可能被触发。其他警报也可能处于活动状态。 |
需要立即注意。<<${post_edited_translations.segment},选择每个警报>>并遵循建议的操作。 例如,您可能需要重新启动已停止的服务或重新启动节点的主机。 注意:在托管关闭操作期间,节点可能显示为未知。在这些情况下,可以忽略未知状态。 |
|
未连接 - 管理性关闭 出于预期原因,节点未连接到网格。 例如,节点或节点上的服务已正常关闭、节点正在重新启动或软件正在升级。一个或多个警报也可能处于活动状态。 根据潜在问题,这些节点通常无需干预即可重新上线。 |
确定是否有任何警报影响此节点。 如果一个或多个警报处于活动状态,<<${post_edited_translations.segment},选择每个警报>>请按照建议的操作执行。 |
|
已连接 节点已连接到网格。 |
无需执行任何操作。 |
${post_edited_translations.segment}
当前警报:触发警报时,仪表板上会显示警报图标。节点页面上还会显示该节点的警报图标。如果"警报电子邮件通知已配置",则还会发送电子邮件通知,除非警报已被静音。
已解决的警报:您可以搜索和查看已解决的警报历史记录。
或者,您已观看视频:
下表描述了当前和已解决警报在 Grid Manager 中显示的信息。
| 列标头 | 问题描述 |
|---|---|
名称或标题 |
警报的名称及其描述。 |
严重性 |
警报的严重程度。对于当前警报,如果对多个警报进行分组,标题行会显示该警报在每个严重程度下发生的实例数。
|
时间触发 |
当前警报:在您的本地时间和 UTC 中触发警报的日期和时间。如果对多个警报进行了分组,标题行将显示警报最新实例(newest)和最旧实例(oldest)的时间。 已解决的警报:触发警报的时间。 |
站点/节点 |
正在发生或已发生警报的站点和节点的名称。 |
状态 |
警报是处于活动状态、静音状态还是已解决。如果对多个警报进行分组,并在下拉列表中选择了 All alerts,标题行将显示该警报处于活动状态的实例数以及已静默的实例数。 |
解决时间(仅限已解决的警报) |
此警报已解决多久。 |
当前值或_数据值_ |
导致触发警报的指标值。对于某些警报,会显示其他值,以帮助您了解和调查警报。例如,为 Low object data storage 警报显示的值包括使用的磁盘空间百分比、磁盘空间总量以及使用的磁盘空间量。 注意: 如果对多个当前警报进行分组,则标题行中不会显示当前值。 |
触发值(仅已解决的警报) |
导致触发警报的指标值。对于某些警报,会显示其他值,以帮助您了解和调查警报。例如,为 Low object data storage 警报显示的值包括使用的磁盘空间百分比、磁盘空间总量以及使用的磁盘空间量。 |
-
选择*当前警报*或*已解决警报*链接可查看这些类别中的警报列表。您还可以通过选择*节点* > node > 概览,然后从警报表中选择警报来查看警报的详细信息。
默认情况下,当前警报显示如下:
-
最近触发的警报将首先显示。
-
相同类型的多个警报显示为一个组。
-
已静音的警报不会显示。
-
对于特定节点上的特定警报,如果超过一个严重程度达到阈值,则仅显示最严重的警报。也就是说,如果达到次要、主要和严重程度的警报阈值,则仅显示严重警报。
"当前警报"页面每两分钟刷新一次。
-
-
要展开警报组,请选择向下插入符号
。要折叠组中的单个警报,请选择向上插入符号
,或选择组的名称。 -
要显示单个警报而不是警报组,请清除*Group alerts*复选框。
-
要对当前警报或警报组进行排序,请选择每个列标题中的向上/向下箭头
。-
当选择*组警报*时,每个组内的警报组和单个警报都会被排序。例如,您可能希望按*触发时间*对组中的警报进行排序,以查找特定警报的最新实例。
-
清除*组警报*后,对整个警报列表进行排序。例如,您可能希望按*节点/站点*对所有警报进行排序,以查看影响特定节点的所有警报。
-
-
要按状态(All alerts、Active 或 Silenced)过滤当前警报,请使用表格顶端的下拉菜单。
请参阅 "静音警报通知"。
-
要对已解决的警报进行排序:
-
从*触发时*下拉菜单中选择时间段。
-
从*严重程度*下拉菜单中选择一个或多个严重程度。
-
从*警报规则*下拉菜单中选择一个或多个默认或自定义警报规则,以筛选与特定警报规则相关的已解决警报。
-
从*节点*下拉菜单中选择一个或多个节点,以过滤与特定节点相关的已解决警报。
-
-
要查看特定警报的详细信息,请选择该警报。对话框提供所选警报的详细信息和建议操作。
-
(可选)对于特定警报,选择"使此警报静音"可使导致触发此警报的警报规则静音。
要使警报规则静音,您必须具有 "管理警报或 Root 访问权限"。
决定将警报规则静音时要小心。如果警报规则被静音,则可能无法检测到潜在问题,直到该问题阻止关键操作完成。 -
要查看警报规则的当前条件:
-
在警报详细信息中,选择*查看条件*。
出现一个弹出窗口,列出每个定义的严重程度的 Prometheus 表达式。
-
要关闭弹出窗口,请单击弹出窗口之外的任何位置。
-
-
(可选)选择*编辑规则*以编辑触发此警报的警报规则。
要编辑警报规则,您必须具有 "管理警报或 Root 访问权限"。
在决定编辑警报规则时要小心。如果更改触发器值,则在阻止关键操作完成之前,可能无法检测到潜在问题。 -
要关闭警报详细信息,请选择*Close*。