StorageGRID 中的警报
此参考列出显示在 Grid Manager 中的默认警报。建议的操作在您收到的警报消息中。
根据需要,您可以创建自定义警报规则,以适应您的系统管理方法。
某些默认警报使用 "Prometheus 指标"。
设备警报
| 警报名称 | 问题描述 |
|---|---|
设备电池已过期 |
设备存储控制器中的电池已过期。 |
设备电池出现故障 |
设备存储控制器中的电池出现故障。 |
设备电池学习容量不足 |
设备存储控制器中的电池学习容量不足。 |
设备电池即将到期 |
设备存储控制器中的电池即将过期。 |
已取出设备电池 |
设备存储控制器中的电池缺失。 |
设备电池过热 |
设备存储控制器中的电池过热。 |
设备 BMC 通信错误 |
与基板管理控制器 (BMC) 的通信已中断。 |
检测到设备启动设备故障 |
在设备中检测到启动设备有问题。 |
设备缓存备份设备失败 |
永久缓存备份设备出现故障。 |
设备缓存备份设备容量不足 |
缓存备份设备容量不足。 |
设备缓存备份设备写保护 |
缓存备份设备受写保护。 |
设备缓存内存大小不匹配 |
设备中的两个控制器具有不同的缓存大小。 |
设备 CMOS 电池故障 |
检测到设备中的 CMOS 电池存在问题。 |
设备计算控制器机箱温度过高 |
StorageGRID 设备中计算控制器的温度已超过标称阈值。 |
设备计算控制器 CPU 温度过高 |
StorageGRID 设备中计算控制器中 CPU 的温度已超过标称阈值。 |
设备计算控制器需要注意 |
在 StorageGRID 设备的计算控制器中检测到硬件故障。 |
设备计算控制器电源 A 出现问题 |
计算控制器中的电源 A 出现问题。 |
设备计算控制器电源 B 出现问题 |
计算控制器中的电源 B 出现问题。 |
设备计算硬件监视器服务已停止 |
监控存储硬件状态的服务已停止。 |
设备 DAS 驱动器超出每天写入数据的限制 |
每天向驱动器写入的数据量过大,这可能会导致其保修失效。 |
检测到设备 DAS 驱动器故障 |
检测到设备中的直接连接存储(DAS)驱动器存在问题。 |
设备 DAS 驱动器在错误的插槽或节点中 |
直接连接存储(DAS)驱动器位于错误的插槽或节点中 |
设备 DAS 驱动器定位器指示灯亮起 |
设备存储节点中一个或多个直接连接存储(DAS)驱动器的驱动器定位器指示灯亮起。 |
设备 DAS 驱动器重建 |
正在重建直连存储 (DAS) 驱动器。如果最近更换或移除/重新插入,则这是正常现象。 |
检测到设备风扇故障 |
检测到设备中的风扇单元出现问题。 |
检测到设备光纤通道故障 |
检测到设备存储控制器和计算控制器之间存在光纤通道链接问题 |
设备光纤通道 HBA 端口故障 |
光纤通道 HBA 端口正在发生故障或已发生故障。 |
设备闪存缓存驱动器非最佳 |
用于 SSD 缓存的驱动器不是最佳驱动器。 |
设备互连/电池罐已拆除 |
缺少互连/电池罐。 |
设备 LACP 端口缺失 |
StorageGRID 设备上的端口未参与 LACP 绑定。 |
检测到设备网卡故障 |
检测到设备中的网络接口卡 (NIC) 存在问题。 |
设备整体电源降级 |
StorageGRID 设备的电源偏离了建议的工作电压。 |
需要更新设备 SANtricity 操作系统软件 |
SANtricity 软件版本低于此版本 StorageGRID 的建议最低版本。 |
设备 SSD 严重警告 |
设备 SSD 报告了严重警告。 |
设备存储控制器 A 故障 |
StorageGRID 设备中的存储控制器 A 出现故障。 |
设备存储控制器 B 故障 |
StorageGRID 设备中的存储控制器 B 出现故障。 |
设备存储控制器驱动器故障 |
StorageGRID 设备中的一个或多个驱动器出现故障或不是最佳状态。 |
设备存储控制器硬件问题 |
SANtricity 软件正在报告 StorageGRID 设备中某个组件的"需要注意"。 |
设备存储控制器电源A故障 |
StorageGRID 设备中的电源 A 偏离了建议的工作电压。 |
设备存储控制器电源 B 故障 |
StorageGRID 设备中的电源 B 偏离了建议的工作电压。 |
设备存储硬件监视器服务已停止 |
监控存储硬件状态的服务已停止。 |
设备存储架已降级 |
存储设备的存储架中的一个组件的状态已降级。 |
设备温度超出 |
已超出设备存储控制器的标称温度或最高温度。 |
已删除设备温度传感器 |
已删除温度传感器。 |
设备 UEFI 安全启动错误 |
设备尚未安全启动。 |
磁盘 I/O 非常慢 |
磁盘 I/O 速度非常慢,可能会影响网格性能。 |
检测到存储设备风扇故障 |
检测到设备的存储控制器中的风扇单元存在问题。 |
存储设备存储连接已降级 |
计算控制器和存储控制器之间的一个或多个连接存在问题。 |
存储设备无法访问 |
无法访问存储设备。 |
审核和 syslog 警报
| 警报名称 | 问题描述 |
|---|---|
正在将审核日志添加到内存中队列 |
节点无法将日志发送到本地 syslog 服务器,内存中队列正在填满。 |
外部syslog服务器转发错误 |
节点无法将日志转发到外部 syslog 服务器。 |
大型审核队列 |
审核消息的磁盘队列已满。如果不解决这种情况,S3 操作可能会失败。 |
正在将日志添加到磁盘上队列 |
节点无法将日志转发到外部 syslog 服务器,磁盘上的队列正在填满。 |
Bucket 警报
| 警报名称 | 问题描述 |
|---|---|
FabricPool 存储桶具有不受支持的存储桶一致性设置 |
FabricPool 存储区使用不支持的可用或强站点一致性级别。 |
FabricPool 存储桶具有不受支持的版本控制设置 |
FabricPool 存储桶已启用版本控制或 S3 对象锁定,不支持此功能。 |
Cassandra 警报
| 警报名称 | 问题描述 |
|---|---|
Cassandra 自动压缩器错误 |
Cassandra 自动压缩器出现错误。 |
Cassandra 自动压缩指标已过期 |
描述 Cassandra 自动压缩器的指标已过期。 |
Cassandra 通信错误 |
运行 Cassandra 服务的节点彼此通信时遇到问题。 |
Cassandra 压缩过载 |
Cassandra 压缩过程过载。 |
Cassandra超大写入错误 |
内部 StorageGRID 进程向 Cassandra 发送的写入请求太大。 |
Cassandra 修复指标已过期 |
描述 Cassandra 修复作业的指标已过期。 |
Cassandra 修复进度缓慢 |
Cassandra 数据库修复进度较慢。 |
Cassandra 修复服务不可用 |
Cassandra 修复服务不可用。 |
Cassandra表损坏 |
Cassandra 检测到表损坏。如果 Cassandra 检测到表损坏,它会自动重新启动。 |
云存储池警报
| 警报名称 | 问题描述 |
|---|---|
云存储池连接错误 |
云存储池的运行状况检查检测到一个或多个新错误。 |
IAM Roles Anywhere 端实体证书到期 |
IAM Roles Anywhere 最终实体证书即将过期。 |
跨网格复制警报
| 警报名称 | 问题描述 |
|---|---|
跨网格复制永久失败 |
出现跨网格复制错误,需要用户干预才能解决。 |
跨网格复制资源不可用 |
跨网格复制请求处于挂起状态,因为资源不可用。 |
DHCP警报
| 警报名称 | 问题描述 |
|---|---|
DHCP租用已过期 |
网络接口上的 DHCP 租约已过期。 |
DHCP租约即将到期 |
网络接口上的 DHCP 租约即将到期。 |
DHCP服务器不可用 |
DHCP 服务器不可用。 |
调试和跟踪警报
| 警报名称 | 问题描述 |
|---|---|
调试性能影响 |
启用调试模式后,系统性能可能会受到负面影响。 |
已启用跟踪配置 |
启用跟踪配置后,系统性能可能会受到负面影响。 |
电子邮件和AutoSupport警报
| 警报名称 | 问题描述 |
|---|---|
AutoSupport 消息发送失败 |
最近一条 AutoSupport 消息发送失败。 |
域名解析失败 |
StorageGRID 节点无法解析域名。 |
电子邮件通知失败 |
无法发送警报的电子邮件通知。 |
未找到日志存档目标存储桶 |
日志存档目标存储桶缺失,这会阻止日志存档到目标存储桶。 |
SNMP inform 错误 |
向陷阱目标发送 SNMP inform 通知时出错。 |
SSH外部访问已启用 |
SSH 外部访问已启用超过 24 小时。 |
检测到 SSH 或控制台登录 |
在过去 24 小时内,用户已使用 Web Console 或 SSH 登录。 |
纠删码 (EC) 警报
| 警报名称 | 问题描述 |
|---|---|
EC再平衡失败 |
EC再平衡程序失败或已停止。 |
EC修复失败 |
EC数据的修复作业已失败或已停止。 |
EC修复停滞 |
EC数据的修复作业已停止。 |
擦除编码片段验证错误 |
无法再验证擦除编码片段。损坏的片段可能无法修复。 |
证书过期警报
| 警报名称 | 问题描述 |
|---|---|
管理员代理 CA 证书过期 |
管理代理服务器 CA 捆绑包中的一个或多个证书即将过期。 |
客户端证书到期 |
一个或多个客户端证书即将过期。 |
S3 的全局服务器证书到期 |
S3 的全局服务器证书即将过期。 |
负载平衡器端点证书过期 |
一个或多个负载平衡器端点证书即将过期。 |
管理接口的服务器证书过期 |
用于管理接口的服务器证书即将过期。 |
外部 syslog CA 证书过期 |
用于对外部 syslog 服务器证书进行签名的证书颁发机构 (CA) 证书即将过期。 |
外部 syslog 客户端证书过期 |
外部 syslog 服务器的客户端证书即将过期。 |
外部系统日志服务器证书过期 |
外部 syslog 服务器提供的服务器证书即将过期。 |
网格网络警报
| 警报名称 | 问题描述 |
|---|---|
网格网络MTU不匹配 |
网格网络接口 (eth0) 的 MTU 设置在网格中各节点之间存在显著差异。 |
网格联合警报
| 警报名称 | 问题描述 |
|---|---|
网格联盟证书过期 |
一个或多个网格联合证书即将过期。 |
网格联盟连接失败 |
本地和远程网格之间的网格联合连接不起作用。 |
高使用率或高延迟警报
| 警报名称 | 问题描述 |
|---|---|
高 Java 堆使用率 |
正在使用大量 Java 堆空间。 |
元数据查询的高延迟 |
Cassandra 元数据查询的平均时间太长。 |
身份联合警报
| 警报名称 | 问题描述 |
|---|---|
身份联合同步失败 |
无法从身份源同步联合组和用户。 |
租户的标识联合同步失败 |
无法从租户配置的身份源同步联合组和用户。 |
信息生命周期管理 (ILM) 警报
| 警报名称 | 问题描述 |
|---|---|
ILM放置无法实现 |
无法为某些对象实现 ILM 规则中的放置指令。 |
ILM 扫描率低 |
ILM 扫描速率设置为小于 100 个对象/秒。 |
密钥管理服务器(KMS)警报
| 警报名称 | 问题描述 |
|---|---|
KMS CA 证书过期 |
用于对密钥管理服务器 (KMS) 证书进行签名的证书颁发机构 (CA) 证书即将过期。 |
KMS 客户端证书过期 |
密钥管理服务器的客户端证书即将过期 |
${post_edited_translations.segment} |
密钥管理服务器的配置已存在,但无法加载。 |
KMS 连接错误 |
设备节点无法连接到其站点的密钥管理服务器。 |
未找到 KMS 加密密钥名称 |
配置的密钥管理服务器没有与提供的名称匹配的加密密钥。 |
KMS加密密钥轮换失败 |
已成功解密所有设备卷,但一个或多个卷无法轮换到最新密钥。 |
${post_edited_translations.segment} |
此站点不存在密钥管理服务器。 |
${post_edited_translations.segment} |
无法使用当前 KMS 密钥解密启用了节点加密的设备上的一个或多个卷。 |
KMS 服务器证书过期 |
密钥管理服务器(KMS)使用的服务器证书即将过期。 |
KMS 服务器连接失败 |
设备节点无法连接到其站点的密钥管理服务器群集中的一个或多个服务器。 |
负载均衡器警报
| 警报名称 | 问题描述 |
|---|---|
负载均衡器零请求连接数偏高 |
连接到负载均衡器端点但未执行请求即断开的连接百分比偏高。 |
本地时钟偏移警报
| 警报名称 | 问题描述 |
|---|---|
本地时钟大时间偏移 |
本地时钟和网络时间协议 (NTP) 时间之间的偏移太大。 |
内存不足或空间不足警报
| 警报名称 | 问题描述 |
|---|---|
审核日志磁盘容量不足 |
可用于审核日志的空间不足。如果此情况未得到解决,则 S3 操作可能会失败。 |
可用节点内存不足 |
节点上可用的 RAM 量较低。 |
存储池可用空间不足 |
可用于在存储节点中存储对象数据的空间不足。 |
已安装的节点内存不足 |
节点上已安装的内存量较低。 |
低元数据存储 |
可用于存储对象元数据的空间不足。 |
指标磁盘容量低 |
可用于指标数据库的空间不足。 |
对象数据存储量低 |
可用于存储对象数据的空间不足。 |
低只读水印覆盖 |
存储卷软只读水印覆盖值小于存储节点的最小优化水印。 |
根磁盘容量不足 |
根磁盘上的可用空间不足。 |
系统数据容量低 |
/var/local 的可用空间不足。如果此情况未得到解决,S3 操作可能会失败。 |
tmp 目录可用空间不足 |
/tmp 目录中的可用空间不足。 |
节点或节点网络警报
| 警报名称 | 问题描述 |
|---|---|
未达到 ADC 仲裁 |
具有 ADC 服务的存储节点已脱机。在 ADC 仲裁恢复之前,扩展和停用操作将被阻止。 |
管理员网络接收使用情况 |
管理网络上的接收使用率很高。 |
管理网络传输使用情况 |
管理网络上的传输使用率很高。 |
防火墙配置失败 |
无法应用防火墙配置。 |
备用模式下的管理接口端点 |
所有管理接口端点回退到默认端口的时间过长。 |
节点网络连接错误 |
在节点之间传输数据时发生错误。 |
节点网络接收帧错误 |
节点接收的网络帧中有很大一部分存在错误。 |
节点与 NTP 服务器不同步 |
节点与网络时间协议(NTP)服务器不同步。 |
节点未与 NTP 服务器锁定 |
节点未锁定到网络时间协议(NTP)服务器。 |
非设备节点网络中断 |
一个或多个网络设备已关闭或断开连接。 |
管理网络上的服务设备链接断开 |
到管理网络 (eth1) 的设备接口已关闭或已断开连接。 |
管理网络端口 1 上的服务设备链路断开 |
设备上的管理网络端口 1 已关闭或已断开连接。 |
客户端网络上的服务设备链接断开 |
客户端网络(eth2)的设备接口已关闭或已断开连接。 |
网络端口 1 上的服务设备链路断开 |
设备上的网络端口 1 已关闭或已断开连接。 |
网络端口 2 上的服务设备链路断开 |
设备上的网络端口 2 已关闭或已断开连接。 |
网络端口 3 上的服务设备链路断开 |
设备上的网络端口 3 已关闭或已断开连接。 |
网络端口 4 上的服务设备链路断开 |
设备上的网络端口 4 已关闭或已断开连接。 |
管理网络上的存储设备链接断开 |
到管理网络 (eth1) 的设备接口已关闭或已断开连接。 |
管理网络端口 1 上的存储设备链路断开 |
设备上的管理网络端口 1 已关闭或已断开连接。 |
客户端网络上的存储设备链接断开 |
客户端网络(eth2)的设备接口已关闭或已断开连接。 |
网络端口 1 上的存储设备链路断开 |
设备上的网络端口 1 已关闭或已断开连接。 |
存储设备网络端口 2 链路断开 |
设备上的网络端口 2 已关闭或已断开连接。 |
网络端口 3 上的存储设备链路断开 |
设备上的网络端口 3 已关闭或已断开连接。 |
网络端口 4 上的存储设备链路断开 |
设备上的网络端口 4 已关闭或已断开连接。 |
存储节点未处于所需存储状态 |
由于内部错误或卷相关问题,存储节点上的 LDR 服务无法转换到所需状态 |
TCP 连接使用情况 |
此节点上的 TCP 连接数量接近可跟踪的最大数量。 |
无法与节点进行通信 |
一个或多个服务无响应,或者无法访问此节点。 |
意外节点重新启动 |
一个节点在过去 24 小时内意外重新启动。 |
对象警报
| 警报名称 | 问题描述 |
|---|---|
对象存在检查失败 |
对象存在性检查作业失败。 |
对象存在性检查已停顿 |
对象存在性检查作业已停止。 |
可能丢失的对象 |
一个或多个对象可能已从网格中丢失。 |
检测到孤立对象 |
检测到孤立对象。 |
S3 PUT 对象大小过大 |
客户端正在尝试执行超出 S3 大小限制的 PUT Object 操作。 |
检测到未识别的损坏对象 |
在已复制对象存储中找到无法识别为已复制对象的文件。 |
对象损坏警报
| 警报名称 | 问题描述 |
|---|---|
对象大小不匹配 |
在对象存在性检查过程中检测到意外的对象大小。 |
平台服务警报
| 警报名称 | 问题描述 |
|---|---|
平台服务待处理请求容量不足 |
Platform Services 待处理的请求数量正在接近容量上限。 |
平台服务不可用 |
站点上运行或可用的具有 RSM 服务的存储节点太少。 |
存储卷警报
| 警报名称 | 问题描述 |
|---|---|
存储卷需要注意 |
存储卷处于脱机状态,需要注意。 |
需要还原存储卷 |
已恢复存储卷,需要还原。 |
存储卷已脱机 |
存储卷已脱机超过 5 分钟。 |
已尝试重新挂载存储卷 |
存储卷已脱机并触发了自动重新装载。这可能表示驱动器问题或文件系统错误。 |
卷还原无法启动复制的数据修复 |
无法自动启动已修复卷的复制数据修复。 |
StorageGRID 服务警报
| 警报名称 | 问题描述 |
|---|---|
nginx 服务使用备份配置 |
nginx 服务的配置无效。当前正在使用以前的配置。 |
使用备份配置的 nginx-gw 服务 |
nginx-gw 服务的配置无效。此时正在使用以前的配置。 |
需要重新启动才能禁用 FIPS |
安全策略不需要 FIPS 模式,但正在使用 FIPS 模块。 |
启用 FIPS 需要重新启动 |
安全策略需要 FIPS 模式,但 FIPS 模块未使用。 |
使用备份配置的 SSH 服务 |
SSH 服务的配置无效。此时正在使用以前的配置。 |
租户警报
| 警报名称 | 问题描述 |
|---|---|
租户配额使用率高 |
正在使用高百分比的配额空间。默认情况下,此规则处于禁用状态,因为它可能会导致过多通知。 |