View a markdown version of this page

MES 中的彈性 - AWS 方案指引

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

MES 中的彈性

彈性是 MES 系統從基礎設施或服務中斷中復原、動態取得運算資源以滿足需求,以及減少中斷的能力,例如組態錯誤或暫時性網路問題。彈性是 AWS Well-Architected Framework 可靠性支柱所依賴的主要因素。

彈性可以分為兩個主要因素:可用性和災難復原。這兩個區域都依賴一些相同的最佳實務,例如監控故障、部署到多個位置,以及自動容錯移轉。不過,可用性著重於 MES 微服務的元件,而災難復原則著重於整個微服務,甚至是整個 MES 系統的分散副本。

可用性

我們將可用性定義為微型服務可供使用的時間百分比,如下列公式所示。此百分比在一段時間內計算,例如一個月、一年或三年後。

MES 架構的可用性公式

此公式需要了解在製造和設備維護中常見的三個指標:

  • 平均故障間隔時間 (MTBF):從開始微服務的一般操作到後續故障之間的平均時間。

  • 平均偵測時間 (MTTD):從發生失敗到開始修復操作的平均時間。

  • 平均修復時間 (MTTR):由於子系統故障及其修復或返回服務而無法使用微服務之間的平均時間。MTTD 是 MTTR 的子集。

下圖說明這些可用性指標。

MES 架構的可用性指標

彈性、高可用性的 MES 旨在減少 MTTR 和 MTTD,並增加 MTBF。雖然理想的設計可以消除故障,但並不實際。傳統的單體 MES 故障難以偵測,且需要更長的時間進行修復。現代的雲端原生 MES 可透過異地同步備份部署,實現更快的偵測、快速修復和業務連續性。如需具有相關 AWS 服務的高可用性現代系統的最佳實務,請參閱白皮書,可用性和其他:了解和改善分散式系統的彈性 AWS

災難復原

災難復原是指準備和復原技術相關災難的程序,例如重大硬體或軟體故障。阻止微服務或 MES 在其主要部署位置實現其業務目標的事件會被視為災難。災難復原與可用性不同,並以這兩個指標來衡量:

  • 復原時間目標 (RTO):微服務中斷與微服務還原之間的可接受延遲。當服務無法使用時,RTO 會決定哪些項目被視為可接受的時段。

  • 復原點目標 (RPO):自上次資料復原點以來可接受的時間上限。RPO 會決定在最後一個復原點與微服務中斷之間,哪些資料會被視為可接受的遺失。

下圖說明這些災難復原指標。

MES 架構的災難復原指標

下圖說明不同的災難復原策略。

MES 架構的災難復原策略

您可以在 Well-Architected Framework Guide, Disaster Recovery of Workloads on AWS: Recovery in the Cloud 中找到實作這些策略 AWS 的詳細指引。