Skip to main content
简体中文版经机器翻译而成,仅供参考。如与英语版出现任何冲突,应以英语版为准。

了解 Workload Factory for EDA 中的 Overview 仪表板

贡献者 netapp-sineadd

Overview 仪表板为 IT 管理员提供了一个监控多个 FSx for ONTAP 文件系统的 EDA 工作负载的地方。使用它可以快速检查系统运行状况和使用情况,选择放置新卷或作业的位置,查找可能需要移动的卷或 SVM,并查看何时需要增加容量或吞吐量。

概述

概述仪表板收集与您配置的 AWS 凭据相关联的所有 FSx for ONTAP 文件系统的 CloudWatch 指标。

其中包括:

  • 集群运行状况:顶部的摘要突出显示了整个文件系统的延迟事件、SSD 使用情况、容量建议和 ONTAP EMS 事件。

  • 集群表:显示每个集群的使用情况和性能的可搜索表。您可以对数据进行筛选和排序,在页面之间移动,并将其导出为 CSV 文件。

它可以帮助您:

  • 放置新卷并重新平衡工作负载

  • 规划容量或吞吐量扩展

  • 大规模监控集群健康状况

  • 就卷放置做出明智的决定

  • 识别接近容量限制的集群

信息板组件

集群运行状况状态

集群运行状况显示所选文件系统中活动的快速视图。仅当至少有一个 FSx for ONTAP 链接连接到您的文件系统时,才会显示此内容。

健康状态包括以下方面:

延迟

显示在所选文件系统中发现的延迟事件数。仅在启用延迟监控时才会显示此信息。

SSD 容量管理

显示 SSD 使用率超过 80% 的文件系统数量和具有活动容量建议的文件系统数量。这有助于您快速识别可能需要注意容量的文件系统。

ONTAP 事件

显示检测到的 EMS 事件数量,按容量、可用性和保护以及安全性和其他分类。

Clusters 表

clusters 表提供了每个 FSx for ONTAP 文件系统的详细视图,按您的活动区域和 AWS 账户选择进行筛选。数据来自 CloudWatch 指标。

使用此表可执行以下操作:

  • 识别接近容量限制的文件系统(SSD 使用列)

  • 将吞吐量需求与配置的吞吐量 SKU(吞吐量使用率 P99 列)进行比较

  • 跨多个集群跟踪性能指标

  • 检查链接配置状态(关联链接列) - 每天验证连接有效性

  • 选择多个集群进行批量参数更新

SSD 容量管理

管理模式

自动化

当使用量达到设定限制时,Workload Factory 会自动添加更多 SSD 空间。它可以自行处理,因此无需手动操作。这适用于偏好自动管理的环境。

推荐

Workload Factory 会分析您如何使用 SSD,并建议何时增加容量。您查看这些建议,并决定是否应用它们。这使您能够完全控制容量变更,同时仍可受益于自动化分析。

系统不提出容量建议或采取自动操作。如果要自己管理容量,请使用此选项。

容量建议

当 Workload Factory 处于 Automate 或 Recommend 模式时,它会自动检查每个 FSx for ONTAP 文件系统,并运行容量推荐算法。系统每 24 小时扫描一次,以查看是否应调整 SSD 容量。

确定建议后:

  • 您会根据您的 Workload Factory 通知设置收到即时通知。

  • 通过使用 Last SSD increase timestampLast SSD increase description 列筛选集群表来识别具有建议的文件系统。

  • 该界面显示当前具有活动建议的文件系统的总数。

该建议解释了建议的更改及其背后的原因,例如:我们建议根据您的文件系统 SSD 使用模式增加 SSD 大小。

SSD 管理参数

参数控制容量管理系统如何分析 SSD 使用情况并采取相应措施:

阈值 (10-90%)

触发容量建议或自动化操作的 SSD 使用百分比。例如,阈值为 80% 意味着 SSD 使用率达到 80% 时会出现建议或操作。此设置在 Recommend 和 Automate 模式下均可用。

回顾 (1-200 小时)

用于分析历史 SSD 使用模式的时间段。更长的回顾期为容量决策提供了更多的历史背景。仅在 Automate 模式下可用。

提前 (1-200 小时)

用于预测未来容量需求的时间段。更长的未来时期计划未来的产能增长。仅在 Automate 模式下可用。

您可以为每个文件系统单独设置这些参数,也可以使用批量编辑将相同的设置应用于多个文件系统。

了解容量决策点

SSD 使用图标记了系统何时提出容量建议或采取自动操作。这些标记显示了容量管理算法在一段时间内的行为。

建议决策点

当系统检测到需要更多 SSD 容量时出现。如果容量未增加,这些点可能每 30 分钟出现一次。图表尽可能显示每个决策点。如果所选时间范围过于密集,则将这些点分组在一起。

自动化决策点

当自动化系统尝试增加 SSD 容量时出现。它们显示操作是成功还是失败。

使用 SSD 使用历史记录图表:

  • 查看您需要更改存储空间大小的频率

  • 确定自动化或推荐模式是否更适合您的使用模式

  • 发现重复出现的存储不足问题

  • 根据一段时间的增长来规划未来的存储需求

  • 调查自动化尝试失败的原因