インシデント管理と事後学習とは

インシデント管理と事後学習は、障害発生時に影響を抑えて迅速に復旧し、得られた学びを再発防止と組織の改善につなげる取り組みです。

対応体制、役割、連絡経路、判断手順をあらかじめ整え、復旧後は個人を責めずにプロセス・ツール・技術の要因を分析します。開発と運用の関係するチームが信頼性とインシデント対応の責任を共有し、協調して対応できる状態を目指します。

なお、このチェックリストは必ずしもすべて導入しなければならないわけではなく、むしろプロジェクトの性格に合わせて無理のない範囲で実践するものであることに留意ください。

背景

重大な障害時には、情報や作業が集中し、複数の担当者が同時に変更を行うことで状況を悪化させる可能性があります。復旧のために実行した自動化や変更が、かえって影響を広げることもあります。通常利用している連絡手段や管理画面が、障害の影響で使えなくなることもあります。

そのため、障害対応に必要な役割・技能・要員をあらかじめ確保し、待機(オンコール)、指揮、作業、連絡の役割を明確にして、代替手段を含む対応方法を平常時から準備する必要があります。担当者が単独でインシデント対応を担えるよう、学習プログラムと実践的な訓練によって知識・技能を確認することも必要です。

自動化や変更処理には、適用前の検証、段階的な適用、問題発生時のロールバックというガードレールを設け、影響を限定します。また、復旧後の分析と是正措置を確実に完了し、学びを他のチームにも共有することが重要です。

SREアセスメントでは、インシデント管理と事後学習に関する以下の事項を確認します。

チェックリスト

チェック項目
(非必須項目)障害対応に必要な役割・技能・要員を確保し、迅速かつ継続的に対応できる体制を整えているか
学習プログラムと実践的な訓練を通じて、担当者が単独でインシデント対応を担える知識・技能を備えていることを確認しているか
インシデント対応の各段階を示すランブックまたはプレイブックと、明確な連絡・エスカレーション経路が整備されているか
通常の接続経路が利用できない状況でも、代替のアクセス手段と障害対応に必要な通信経路を利用できるよう準備・検証しているか
インシデント対応の役割・連絡経路・進行状況を明確にし、対応情報を一元管理して継続的に引き継げる仕組みがあるか
開発・運用など関係するチームが信頼性とインシデント対応の責任を共有し、サービスに起因する問題へ協調して対応できるか
事前に定めた基準に該当するインシデントについて、個人を責めずプロセス・ツール・技術から学ぶ事後検証を実施しているか
事後検証で得られた是正措置を担当・進捗とともに追跡し、結果や解決知識を関係チームへ共有・蓄積しているか
既知の問題・解決策・調査手順を体系的に文書化し、トラブルシューティングの知識を継続的に蓄積・更新しているか
自動化や変更処理にガードレールを設け、適用前の検証・段階的な適用・問題発生時のロールバックによって影響を限定できるか

対応によって得られる効果

インシデント管理を整備することで、障害時の役割と判断が明確になり、混乱や重複作業を抑えながら復旧を進められます。代替連絡・操作手段を訓練しておくことで、重大障害時にも対応を継続しやすくなります。

事後検証(ポストモーテム)と是正措置を組織的に管理することで、同じ障害の再発を防ぎ、個々の対応で得た知識を他のサービスにも活用できます。