ナレッジ

SEVレベルとは

インシデントの重要度を表す度合いであり、対応優先度の判断の目安となる

障害が起きたとき、「これはすぐ全員で対応すべきか、明日の通常業務でよいか」の判断が人によってぶれると、対応が遅れたり、逆に必要のない緊急招集が起きたりします。SEVレベルは、その判断をあらかじめ言語化しておくためのものです。

レベルが決まれば、誰に知らせるか、どこまで手を止めるか、あとでポストモーテムを書くかまでが自動的に決まります。

SEVレベルの定義

SEV1
定義多くの利用者に影響する重大な障害。経営層への報告や対外的な告知が必要
例長時間の停止によるSLA違反、データが漏れうる脆弱性の発見
対応重大インシデント。責任者を立て、内外に周知
ポストモーテム必須
SEV2
定義多くの利用者がサービスを使えない重大な障害
例ほぼ全員が画面を使えない、または性能が大きく低下
対応重大インシデント。責任者を立てて対応
ポストモーテム必須
SEV3
定義一部の利用者への影響や、安定性の問題。担当チームがすぐに対応すべきもの
例一部機能の停止、1台の故障で止まる構成
対応担当チームが最優先で調査。切り戻しも検討
ポストモーテム任意
SEV4
定義対応は必要だが、利用には影響しない
例性能の低下や遅延、1台の故障、主要でない定期ジョブの失敗
対応担当チームが通常作業より優先して対応
ポストモーテム任意
SEV5
定義利用に影響しない、見た目の問題やバグ
例すぐには影響しないバグ、表示の崩れ
対応課題として登録し、担当者が対応
ポストモーテム任意

各レベルの定義・例・対応は PagerDuty Incident Response Documentation、ポストモーテムの要否は Atlassian Incident Management Handbook をもとに作成しています。

運用上の重要な点

レベルは最初の連絡で決める

原因が分かってからでは遅いので、影響範囲が見えた時点で暫定のレベルを置きます。調査が進んで実態と合わなくなったら、その場で上げ下げします。

迷ったら高いほうに倒す

低く見積もって対応が遅れる損失のほうが、高く見積もって人が集まる損失より大きくなります。下げるのは後からでもできます。

SEV1・SEV2は振り返りまでを1セットにする

重大インシデントは、復旧して終わりにせず、ポストモーテムを書くところまでを対応に含めます。

クラウド基盤の構築・運用について、ご相談ください