stackbook

← 辞書(分野別)

§14

監視・可観測性・運用

最終確認:2026年9月

エラー監視
計装(トレース・メトリクス)
可観測性基盤(コスト重視)
Grafana Cloud(Loki:ログ、Tempo:トレース、Mimir/Prometheus:メトリクス)
  • セルフホストのGrafanaスタックオンプレ要件
可観測性基盤(予算あり・一体型)
  • New Relic既存の契約や資産があるとき
AWS標準
CloudWatch(ログの一次保管・アラーム)
外形監視・ステータスページ
オンコール・通知
  • incident.ioSlack中心でインシデント対応を回したいとき

小規模ならSlack通知のみ

ログ形式
構造化ログ(JSON)
負荷試験
  • LocustPythonでシナリオを書きたいとき
RUM(実ユーザーの表示速度)
Sentry(パフォーマンス機能)

運用ドキュメント

障害対応手順
リポジトリ内 `docs/runbooks/`
ポストモーテム
テンプレートを決めて `docs/postmortems/` に蓄積
SLO
可用性とレイテンシの2指標から始める