了解 Workload Factory for EDA 中的 Overview 仪表板
Overview 仪表板为 IT 管理员提供了一个监控多个 FSx for ONTAP 文件系统的 EDA 工作负载的地方。使用它可以快速检查系统运行状况和使用情况,选择放置新卷或作业的位置,查找可能需要移动的卷或 SVM,并查看何时需要增加容量或吞吐量。
概述
概述仪表板收集与您配置的 AWS 凭据相关联的所有 FSx for ONTAP 文件系统的 CloudWatch 指标。
其中包括:
-
集群运行状况:顶部摘要重点显示了整个文件系统的延迟事件、SSD 使用情况、吞吐量模式状态、容量建议和 ONTAP EMS 事件。
-
集群表:显示每个集群的使用情况和性能的可搜索表。您可以对数据进行筛选和排序,在页面之间移动,并将其导出为 CSV 文件。
它可以帮助您:
-
放置新卷并重新平衡工作负载
-
规划容量或吞吐量扩展
-
大规模监控集群健康状况
-
就卷放置做出明智的决定
-
识别接近容量限制的集群
信息板组件
集群运行状况状态
集群运行状况显示所选文件系统中活动的快速视图。仅当至少有一个 FSx for ONTAP 链接连接到您的文件系统时,才会显示此内容。
健康状态包括以下方面:
- 延迟
-
显示在所选文件系统中发现的延迟事件数。仅在启用延迟监控时才会显示此信息。
- 文件系统弹性
-
-
SSD capacity:显示有多少文件系统使用 Automate、Recommend 或 None 来管理 SSD 容量。
-
吞吐量:显示有多少文件系统使用 Automate、Recommend 或 None 来管理吞吐量。
-
- ONTAP 事件
-
显示检测到的 EMS 事件数量,按容量、可用性和保护以及安全性和其他分类。
Clusters 表
clusters 表提供了每个 FSx for ONTAP 文件系统的详细视图,按您的活动区域和 AWS 账户选择进行筛选。数据来自 CloudWatch 指标。
使用此表可执行以下操作:
-
识别接近容量限制的文件系统(SSD 使用列)
-
将吞吐量需求与配置的吞吐量 SKU(吞吐量使用率 P99 列)进行比较
-
跨多个集群跟踪性能指标
-
检查链接配置状态(关联链接列) - 每天验证连接有效性
-
选择多个集群进行批量参数更新
选择文件系统以打开集群详细信息,包括集群信息、SSD 容量值和 SSD 随时间推移的容量图表。
SSD 容量管理
管理模式
- 仅通知(推荐模式)
-
Workload Factory 会分析您如何使用 SSD,并建议何时增加容量。您查看这些建议,并决定是否应用它们。这使您能够完全控制容量变更,同时仍可受益于自动化分析。
- 自动化
-
当使用量达到设定限制时,Workload Factory 会自动添加更多 SSD 空间。它可以自行处理,因此无需手动操作。这适用于偏好自动管理的环境。
- 无
-
如果未启用 SSD 容量管理,则系统不会提出容量建议或采取自动操作。如果要自己管理容量,请使用此选项。
SSD 管理参数
参数控制容量管理系统如何分析 SSD 使用情况并采取相应措施:
- 阈值 (10-90%)
-
触发容量建议或自动化操作的 SSD 使用百分比。例如,阈值为 80% 意味着 SSD 使用率达到 80% 时会出现建议或操作。此设置在 Recommend 和 Automate 模式下均可用。
- 回顾 (1-200 小时)
-
用于分析历史 SSD 使用模式的时间段。更长的回顾期为容量决策提供了更多的历史背景。仅在 Automate 模式下可用。
- Lookahead (1-200 小时)
-
用于预测未来容量需求的时间段。更长的未来时期计划未来的产能增长。仅在 Automate 模式下可用。
您可以为每个文件系统单独设置这些参数,也可以使用批量编辑将相同的设置应用于多个文件系统。
吞吐量管理
您可以为一个或多个文件系统配置弹性吞吐量增加行为。
管理模式
- 仅通知(推荐模式)
-
Workload Factory 评估吞吐量压力,并为您提供应用建议。
- 自动化
-
Workload Factory 在满足配置条件时自动提高吞吐量。
- 无
-
如果未启用吞吐量管理,系统不会提出建议或采取自动操作。如果要自己管理容量,请使用此选项。
吞吐量参数
吞吐量配置对话框包括:
-
利用率阈值(50-100%,默认 80%):触发建议或自动化的吞吐量利用率百分比。
高级吞吐量参数在可扩展的*高级配置*部分中提供。
-
评估时段(小时) (12-72 小时,默认 24 小时)
-
Breached metrics (%) (默认 66%):用于确定违规的百分比阈值
-
连续违规窗口(小时) (1-5 小时,默认 2)
-
连续违规指标(%)(默认 95%)
-
最小延迟(毫秒)(默认 10 毫秒)
-
最大吞吐量 SKU (默认为 None)
文件系统弹性建议
当 Workload Factory 处于 Automate 或 Recommend 模式时,它会自动检查每个 FSx for ONTAP 文件系统,并运行容量推荐算法。系统会定期扫描,以查看是否应调整 SSD 容量或吞吐量。
确定建议后:
-
您会根据您的 Workload Factory 通知设置收到即时通知。
-
通过筛选 Clusters 表来识别包含建议的文件系统。
-
该界面显示当前具有活动建议的文件系统的总数。
该建议解释了建议的更改及其背后的原因,例如:我们建议根据您的文件系统 SSD 使用模式增加 SSD 大小。
了解容量决策点
SSD 使用图标记了系统何时提出容量建议或采取自动操作。这些标记显示了容量管理算法在一段时间内的行为。
- 建议决策点
-
当系统检测到需要更多 SSD 容量时出现。如果未增加容量,这些点可能每 30 分钟出现一次。图表会尽可能显示每个决策点。如果所选时间范围过于密集,则这些点将被归为一组。
- 自动化决策点
-
当自动化系统尝试增加 SSD 容量时出现。它们显示操作是成功还是失败。
使用 SSD 使用历史记录图表:
-
查看您需要更改存储空间大小的频率
-
确定自动化或推荐模式是否更适合您的使用模式
-
发现重复出现的存储不足问题
-
根据一段时间的增长来规划未来的存储需求
-
调查自动化尝试失败的原因