本文へスキップ
CoRISE

監視基盤の停止を誰が知るか — Kubernetesの外に観測点を置く

監視対象と同じ障害で失われない通知経路を設ける。

約2分で読めます
  • observability
  • reliability
目次を開く

結論

監視対象と同じ障害で失われない通知経路を設ける。

背景

監視基盤と通知経路が同じクラスタへ依存すると、クラスタ停止時に障害の通知も失う。外側から生存を確認する経路を設ける。

設計と検証の論点

構成を検討するときは、次の責任と境界を分けて確認します。

  • 外部からの監視
  • 監視停止を検知する仕組み
  • アラートの通知経路
  • クラスター障害
  • 復旧

判断理由

外部からの監視と復旧の関係を軸に、採用案と代替案の責任範囲を比較します。既存の制約を残す理由と、新しい境界で変えられることを分けて記述します。

トレードオフ

監視停止を検知する仕組みを扱うために増える実装・保守・確認作業と、得られる制御可能性を比較します。障害時の経路と運用担当者の負担を含め、採用しない方がよい条件も示します。

制約

クラスタ停止、通知先停止、DNS障害の観測と通知結果を確認する。外部経路も独立性を点検する。

関連事例

関連事例の担当範囲や設計判断を参照します。記事で提案する実験・構成を、その事例で実施済みとするものではありません。

Contact

技術的な課題を、お聞かせください。

設計や実装、運用の課題について、CoRISEにご相談いただけます。

相談する