目次を開く
結論
監視対象と同じ障害で失われない通知経路を設ける。
背景
監視基盤と通知経路が同じクラスタへ依存すると、クラスタ停止時に障害の通知も失う。外側から生存を確認する経路を設ける。
設計と検証の論点
構成を検討するときは、次の責任と境界を分けて確認します。
- 外部からの監視
- 監視停止を検知する仕組み
- アラートの通知経路
- クラスター障害
- 復旧
判断理由
外部からの監視と復旧の関係を軸に、採用案と代替案の責任範囲を比較します。既存の制約を残す理由と、新しい境界で変えられることを分けて記述します。
トレードオフ
監視停止を検知する仕組みを扱うために増える実装・保守・確認作業と、得られる制御可能性を比較します。障害時の経路と運用担当者の負担を含め、採用しない方がよい条件も示します。
制約
クラスタ停止、通知先停止、DNS障害の観測と通知結果を確認する。外部経路も独立性を点検する。
関連事例
関連事例の担当範囲や設計判断を参照します。記事で提案する実験・構成を、その事例で実施済みとするものではありません。