分析 Workload Factory 中 EDA 的延迟趋势
检测到延迟违规后,使用图表查看卷延迟、IOPS 和吞吐量随时间的变化情况。这有助于您发现规律并验证修复措施是否改善了性能。
开始之前
您需要拥有 "已配置延迟监控" 并且至少检测到一次违规。要查看图表,请确保 AWS 凭据可用。要查看 QoS 延迟组件细分,请确保文件系统已链接。
分析延迟趋势
*详细延迟分析*页面提供了性能图表,可帮助您分析一段时间内的卷行为:延迟、IOPS 和吞吐量。
这些图表显示了受影响卷的 CloudWatch 指标。所有图表使用相同的时间线。它们会根据触发事件的警报自动显示指标。
您可以更改时间范围以查看不同时期的性能。您还可以在"全部"、"读取"、"写入"或"元数据"操作之间切换。
此可视化包括:
-
延迟图:显示一段时间内的卷延迟(毫秒),包括警告和关键阈值线以及违规标记。
-
IOPS graph:显示一段时间内的 IOPS,带有阈值和违规标记(如果已配置)。
-
吞吐量图:显示选定时间范围内随时间变化的吞吐量。如果在筛选器中选择了 Metadata,则吞吐量图将不显示任何数据。
-
阈值线:虚线水平线显示警告和临界阈值。
-
违规标记:可视标记表示检测到违规行为。将鼠标悬停在标记上可查看严重程度、检测时间、CloudWatch 中位延迟 (ms) 和 QoS 延迟组件细分。
-
在*延迟*选项卡中,在严重性列中选择事件。
延迟分析面板打开。
-
查看选定*时间范围*和*类型*的延迟图表和违规摘要。
-
选择*查看完整分析*以打开*详细延迟分析*。
-
在*延迟图表*中,使用*时间范围*(例如 72 小时)和*类型*(读取/写入/元数据)来调整图表。
-
请查看以下图表:
-
延迟(毫秒),带有警告/严重阈值线
-
IOPS(如果已配置阈值线)
-
同一时间范围内的*吞吐量*
-
-
使用峰值标记和违规摘要(例如,"在此时间范围内检测到 1 个严重违规")将延迟增加与 IOPS 和吞吐量变化相关联。
-
更改时间范围以查看其他期间并查找模式。
-
检查延迟、IOPS 和吞吐量的趋势线。IOPS 和延迟图包括用于比较的阈值线。
-
将鼠标悬停在违规标记上可查看违规详细信息(严重程度、检测时间、CW 中位数延迟和 QoS 延迟组件)。
-
使用图形洞察来:
-
查看延迟问题是发生一次还是重复发生
-
确定一天中延迟较高的时间
-
确定延迟峰值是短期的还是持久的
-
将延迟事件与工作负载模式或系统更改进行比较
-
您可以查看卷的延迟随时间的变化情况。这有助于您决定是立即采取行动、更改警报限制还是检查系统问题。
|
|
图表使用 CloudWatch 指标。这些可能与 QoS 报告的延迟组件略有不同,因为它们以不同的方式收集。 |
图形解释
查看响应时间变化时,请参考以下建议:
-
使用多个时间范围:查看不同时间范围内的图表,以区分短暂峰值和持续减速之间的差异。从 24 小时视图开始,了解整体背景。然后缩小到较短的时间段以查看特定事件,或切换到 72 小时视图以发现每日模式。
-
直观地比较阈值:使用图表上的阈值线来检查您的警告和关键设置是否适合您的工作负载。如果延迟通常接近阈值但未超出阈值,则阈值可能太高。如果您看到许多短暂的峰值超过阈值但不影响操作,则阈值可能过于敏感。
-
识别日常模式:使用 24 小时和 72 小时视图来发现白天的模式。如果延迟峰值在同一时间发生,请在较安静的时期安排繁重任务,或为繁忙时间增加更多容量。
-
区分尖峰类型:短暂的尖峰通常意味着暂时的问题,例如短暂的资源争用。长期持续的高延迟指向更深层次的系统问题,例如容量不足或配置问题。每种情况都需要不同的解决方案。
-
更改后监控趋势:在调整阈值、添加容量或更改设置后,请至少监控 72 小时的图表,以确保更改有效。