可観測性とモニタリングとは
可観測性とモニタリングは、メトリクス、ログ、トレースなどの情報から、システムとユーザー体験の状態を把握するための取り組みです。
異常を早期に検知するだけでなく、発生箇所や原因を迅速に調査できる状態を整え、安定したサービス運用を支えます。収集した指標と傾向はダッシュボードに集約し、関係者が同じ状況を見て判断できるようにします。
なお、このチェックリストは必ずしもすべて導入しなければならないわけではなく、むしろプロジェクトの性格に合わせて無理のない範囲で実践するものであることに留意ください。
背景
監視対象や指標が不足していると、ユーザー影響が発生しても検知できず、顧客からの連絡で初めて障害に気付く場合があります。一方、アラートを増やしすぎると、重要な通知がノイズに埋もれ、対応者の負担も増加します。
そのため、サービス内部の状態と、外部から実際のリクエストを送って確かめた利用者側から見た状態を組み合わせて観測し、対応が必要な異常に絞って通知することが重要です。アラートの条件はSLOとエラーバジェットにもとづいて定め、一時的な変動による誤通知を抑えます。テレメトリの収集・分析基盤と監視設定を自動化された再現可能な仕組みとして管理し、メトリクスやアラートの利用状況を継続的に見直す仕組みも必要です。
SREアセスメントでは、可観測性とモニタリングに関する以下の事項を確認します。
チェックリスト
| チェック項目 |
|---|
| リクエスト量、エラー、応答時間、リソース利用状況など、サービスの健全性を示す情報を適切な頻度と粒度で継続的に把握できているか |
| サービス内部の状態に加えて、外部から実際のリクエストを送り、利用者側から見た可用性・性能・応答内容を確認できているか |
| テレメトリの収集・分析基盤と監視設定が、自動化された再現可能な仕組みとして管理されているか |
| サービスの重要な指標と傾向をダッシュボードに集約し、関係者が共通の状況認識を持てるようになっているか |
| ログやトレースを任意の条件で調査し、処理経路・遅延・ボトルネックなどを後から追跡できる状態になっているか |
| アラートが重要な事象に絞られ、不要な通知による負荷を抑えながら、対応が必要な問題を速やかに把握できるようになっているか |
| SLOとエラーバジェットにもとづいてアラート条件を定め、一時的な変動による誤通知を抑えながら適切な単位で評価できているか |
| 関連するアラートの抑制や再通知の制御、重要度の区分によって、対応に必要な通知を適切に届けられているか |
| 監視で検知できなかったインシデントを事後に検証し、監視やアラートの不足を継続的に改善できているか |
| メトリクスやアラートの利用状況を定期的に見直し、不要な監視を整理して継続的な運用改善につなげているか |
対応によって得られる効果
可観測性とモニタリングを整備することで、ユーザー影響を早期に検知し、システム内部の情報と結び付けて原因を調査しやすくなります。
また、通知を対応が必要な問題に絞ることで、重要なアラートの見落としや対応者の負担を減らせます。メトリクスやアラートの利用状況を継続的に分析することで、サービスの成長や構成変更に合わせて観測方法を改善できます。
