Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Observabilityとダッシュボードのベストプラクティス
Search
o11yfes
October 05, 2023
Technology
0
710
Observabilityとダッシュボードのベストプラクティス
o11yfes
October 05, 2023
Tweet
Share
More Decks by o11yfes
See All by o11yfes
サーバレス、コンテナ、データベース特化型機能をご紹介。CloudWatch をもっと使いこなそう!
o11yfes2023
0
330
Amazon CloudWatch を使って NW 監視を行うには
o11yfes2023
0
340
CloudWatch 大好きなSAが語る CloudWatch キホンのキ
o11yfes2023
0
360
Amazon CloudWatchで始める エンドユーザー体験のモニタリング
o11yfes2023
0
340
Observabilityジャーニーを実現するためのAWSサービス:CloudWatch編
o11yfes2023
0
660
Observability はじめの一歩 CloudWatch Synthetics
o11yfes2023
0
450
Observabilityジャーニーを実現するためのAWSサービス:OSS編
o11yfes2023
1
500
AWS Observability ベストプラクティス 大紹介
o11yfes2023
0
890
AWS Observability 関連最新アップデート
o11yfes2023
0
360
Other Decks in Technology
See All in Technology
「良さそう」と「とても良い」の間には 「良さそうだがホンマか」がたくさんある / 2025.07.01 LLM品質Night
smiyawaki0820
1
490
5min GuardDuty Extended Threat Detection EKS
takakuni
0
180
AI導入の理想と現実~コストと浸透〜
oprstchn
0
180
Frontier airlines®️ USA Contact Numbers: Complete 2025 Support Guide
oliversmith12
0
110
低レイヤを知りたいPHPerのためのCコンパイラ作成入門 完全版 / Building a C Compiler for PHPers Who Want to Dive into Low-Level Programming - Expanded
tomzoh
4
3.4k
Witchcraft for Memory
pocke
1
740
Operating Operator
shhnjk
0
410
SmartNewsにおける 1000+ノード規模 K8s基盤 でのコスト最適化 – Spot・Gravitonの大規模導入への挑戦
vsanna2
0
120
mrubyと micro-ROSが繋ぐロボットの世界
kishima
3
400
モバイル界のMCPを考える
naoto33
0
410
asken AI勉強会(Android)
tadashi_sato
0
170
LangChain Interrupt & LangChain Ambassadors meetingレポート
os1ma
2
270
Featured
See All Featured
Code Review Best Practice
trishagee
69
18k
BBQ
matthewcrist
89
9.7k
XXLCSS - How to scale CSS and keep your sanity
sugarenia
248
1.3M
Automating Front-end Workflow
addyosmani
1370
200k
The Invisible Side of Design
smashingmag
301
51k
Improving Core Web Vitals using Speculation Rules API
sergeychernyshev
18
960
What’s in a name? Adding method to the madness
productmarketing
PRO
23
3.5k
Side Projects
sachag
455
42k
Adopting Sorbet at Scale
ufuk
77
9.4k
Performance Is Good for Brains [We Love Speed 2024]
tammyeverts
10
950
Docker and Python
trallard
44
3.5k
Gamification - CAS2011
davidbonilla
81
5.3k
Transcript
Observabilityと Dashboard Best Practice 2023/9/22 ソリューションアーキテクト 宮崎 友貴 © 2023,
Amazon Web Services, Inc. or its affiliates.
© 2023, Amazon Web Services, Inc. or its affiliates. 2
⾃⼰紹介 名前︓宮崎 友貴 所属︓技術統括本部 エンタープライズ技術本部 通信・メディアグループ 通信ソリューション第⼀部 担当アカウント︓通信業界のお客様 好きなAWSサービス︓CloudWatch / Lambda
© 2023, Amazon Web Services, Inc. or its affiliates. アジェンダ
1. Observability ベストプラクティス 2. ダッシュボード ベストプラクティス 3. CloudWatch Dashboard の活⽤
Observability ベストプラクティス
© 2023, Amazon Web Services, Inc. or its affiliates. Observability(可観測性)
視認性 迅速なトラブル シューティング 顧客体験
© 2023, Amazon Web Services, Inc. or its affiliates. Observability
ベストプラクティス 1. 成功の基準を明確にし、重要なものを監視する 2. システム全体の健全性の把握とツールの選定をする 3. ワークロードの全てのレイヤーからテレメトリーデータを収集する 4. データは重要だが、細部にとらわれすぎない 5. 最初からObservabilityを組み込む ワークロード︓クラウドアプリケーションを構成するリソースとコードのコレクション テレメトリーデータ︓メトリクス、ログ、トレースなどのシステムの状態を表すデータ AWS Observability Best Practices︓ https://aws-observability.github.io/observability-best-practices/guides/#best-practices-overview
© 2023, Amazon Web Services, Inc. or its affiliates. Observability
のサイクル インストルメンテーション* ログ、メトリクス、 トレース アラーム、 ダッシュボード 質問 運⽤の カイゼン *Instrumentation = ログ、メトリクス、トレースなどのデータを取得し 外部に送信できるようシステムに組み込むこと
© 2023, Amazon Web Services, Inc. or its affiliates. Amazonにおけるインシデントの対応例
ポストモーテム 様々なツール による分析 アラーム ダッシュボード メトリクス分析 ログ分析 ⽣ログ トレース 抽 象 度 ⾼ 低 インシデントによる影響から 再発防⽌策などをまとめた⽂書
© 2023, Amazon Web Services, Inc. or its affiliates. Amazonにおけるインシデントの対応例
ポストモーテム 様々なツール による分析 アラーム ダッシュボード メトリクス分析 ログ分析 ⽣ログ トレース 抽 象 度 ⾼ 低 インシデントによる影響から 再発防⽌策などをまとめた⽂書
ダッシュボード ベストプラクティス
© 2023, Amazon Web Services, Inc. or its affiliates. ダッシュボードベストプラクティス
1. ⽬的別ダッシュボードの構築 2. 適切な情報を適切な⽅法で表⽰するダッシュボードの設計 3. 常に改善と拡張を繰り返すダッシュボードのメンテナンス
© 2023, Amazon Web Services, Inc. or its affiliates. ⽬的別ダッシュボードの構築
ユーザー AWS Cloud API マイクロサービス EC2インスタンス データベース バックエンド マイクロサービス コンテナ Lambda バックエンド マイクロサービス
© 2023, Amazon Web Services, Inc. or its affiliates. インフラストラクチャ
ダッシュボード ⽬的別ダッシュボードの構築 ユーザー マイクロサービス ダッシュボード システム ダッシュボード カスタマーエクスペリエンス ダッシュボード 依存関係 ダッシュボード AWS Cloud API マイクロサービス EC2インスタンス データベース バックエンド マイクロサービス コンテナ Lambda バックエンド マイクロサービス 使⽤するユーザーおよび使⽤する理由に基づいて、 各ダッシュボードを作成することが重要 ⾼レベル ⾼レベル ビジネスオーナー サービスオペレーター あらゆる関係者 低レベル 低レベル 低レベル インフラ 運⽤担当 各サービス 主管/開発者 各サービス 主管/開発者 システム 運⽤担当
© 2023, Amazon Web Services, Inc. or its affiliates. 14
⾼レベル 低レベル ︓サービスレイヤー ︓インフラレイヤー カスタマーエクスペリエンスダッシュボード • Amazon で最も重要かつ広く使われている • 「影響を受ける顧客の数は︖」といった質問に答える • サービスの健全性や外型監視、RUM の情報など システムレベルでのダッシュボード • システムやエンドポイントが動作していることを確認 • ⼊⼒関連、処理関連、出⼒関連の情報を表⽰する キャパシティプランニングと予測ダッシュボード • サービス成⻑の視覚化により⻑期的な予測に役⽴てる 伝えたいメッセージを絞るため、 これらのダッシュボードでは情報の過多を避ける マイクロサービス固有のダッシュボード • サービスの実装に特化したデータを表⽰ • 運⽤メンバーはデータの異常を特定するのに活⽤ インフラストラクチャのダッシュボード • インフラのリソースを確認 依存関係のダッシュボード • 他チームのマイクロサービスと依存関係がある場合作成 • 依存関係に特化した専⽤のダッシュボードを⽤意する 各チームがリクエストに関する特定の処理を担当するので 1つ以上の専⽤マイクロサービスに特化した ダッシュボードを作成する ビジネスオーナー サービスオペレーター あらゆる関係者 各サービス主管/開発者 インフラ運⽤担当 使⽤するユーザーおよび使⽤する理由に基づいて、 各ダッシュボードを作成することが重要 ⽬的別ダッシュボードの構築
© 2023, Amazon Web Services, Inc. or its affiliates. ダッシュボードの設計
参照︓https://aws.amazon.com/builders-library/building-dashboards-for-operational-visibility/ 最重要なメトリクスは最上部に⼤きく表⽰ 想定しうる最⼩のディスプレイサイズにレイアウト 単⼀のタイムゾーン (例:UTC) を表⽰ エラー時だけメトリクス表⽰するような グラフには頼らない 最⼩の時間間隔とデータポイントピリオドを使⽤ ⾒る⼈がすぐに理解し使うことができることが 重要
© 2023, Amazon Web Services, Inc. or its affiliates. ダッシュボードの設計
同⼀の時間幅と分解能でデータを表⽰ アラームのしきい値でグラフに注釈を付ける 1 つのグラフ内で過多な情報表⽰を避ける 縮⼩表⽰によりデータポイントの範囲に合わせる 左と右の両⽅の y 軸をすでに表⽰しているグラフでは、 ⽔平ラインを追加表⽰しないかグラフを分ける データの範囲が⼤きく異なる複数のメトリクスでは、 過多な表⽰を避ける
© 2023, Amazon Web Services, Inc. or its affiliates. ダッシュボードの設計
設計書や⼿順書のリンクを挿⼊ グラフの説明⽂をテキストで表⽰ ユースケースによって、 メトリクスの最新値、アラームステータスを活⽤
© 2023, Amazon Web Services, Inc. or its affiliates. ダッシュボードのメンテナンス
新機能のデプロイ前 “ ダッシュボードに何か変更はありますか ? ” ポイント • 開発プロセスに組み込み、ダッシュボードを更新する • ステージング環境にも同様のダッシュボードを⽤意する • ダッシュボードのレイアウトに IaC を採⽤する ダッシュボードを更新する 常に改善と拡張を続けることが重要 ダッシュボードは⼀度作ったら終わりではない
© 2023, Amazon Web Services, Inc. or its affiliates. ダッシュボードのメンテナンス
ダッシュボードは⼀度作ったら終わりではない “ ダッシュボードはお客様への影響を明確にしましたか? ” “障害原因を明確にすることに貢献しましたか? ” “ 修復時間を短くすることの助けになりましたか? ” 常に改善と拡張を続けることが重要 ポイント • 根本原因をより早く特定できたか、平均復旧時間を短縮できたかどうかを検討する • 価値のなくなったグラフは積極的に削除する ダッシュボードを改良する 障害発⽣後
© 2023, Amazon Web Services, Inc. or its affiliates. 週次のオペレーション会議でレビュー
約15分のスロットで分割 参照︓https://aws.amazon.com/jp/blogs/opensource/the-wheel/
CloudWatch Dashboard の活用
© 2023, Amazon Web Services, Inc. or its affiliates. CloudWatch
Dashboard • 折れ線グラフ、数値、ゲージ、テキスト、ア ラーム、Lambdaによるカスタムウィジェット でお好みのダッシュボードを作成 • 異なるアカウント、異なるリージョンの リソースでも、ダッシュボード化が可能 • ⾃動更新間隔(10s, 1m, 2m, 5m, 15m)、 時間範囲、タイムゾーンの調整が可能 • 異なる時間範囲での⽐較が可能 • ⾃動⽣成ダッシュボードも活⽤可能 カスタマイズ可能なダッシュボードを作成 Amazon CloudWatch
Q&A
Thank you!