ユニット 4 / 11

容量とパフォーマンスの監視: メトリクスの読み取りと将来の計画

利益:

  • 人工知能のサポートにより、平均ではなくパーセンタイル (p95/p99) とベースラインを使用してメトリクスを正しく解釈する機能
  • 季節性と傾向を区別し、単一の数値ではなく楽観的または悲観的な範囲として容量予測を作成する機能
  • リソースへの投資とアラームしきい値の決定は、リソースのリード タイムとビジネス コンテキストとともに人間によるものであることを理解します。

容量とパフォーマンスの監視: AI によるメトリクスの読み取りと将来の計画

システムの健全性を自分の目で見ることはできません。それは指標を通じて理解できます。メトリクスは、システムの測定可能な特性の時間依存の数値です。CPU 使用率、メモリ占有率、ディスク空き容量、ネットワーク遅延、1 秒あたりのリクエスト数などです。パフォーマンス監視はこれらのメトリクスを継続的に収集し、「システムは今大丈夫ですか?」という質問に答えます。キャパシティ プランニングはさらに一歩進んで、「このままでは、いつリソースが足りなくなり、いつ新しいリソースを購入すべきか?」という質問に答えます。ここで AI は、山積みの指標を解釈し、異常をマークし、傾向を読み取り、将来の予測を作成する高度なスキルを持つアシスタントです。ただし、何よりも注意すべき点が 1 つあります。AI は履歴データからパターンを抽出します。コンテキストに応じて、リソースの投資、スケーリング、およびアラートしきい値の決定を行うのはユーザーです。

このユニットでは、ベースライン (正常な動作ライン)、異常 (正常からの逸脱)、パーセンタイル (パーセンタイル) などの概念を監視します。 AI による指標の解釈。傾向と成長予測。そして、正しいアラームしきい値を設定する方法を学びます。

平均的な嘘: なぜパーセンタイルなのか?

追跡における最も一般的な間違いは、すべてを平均値で測定することです。応答時間が平均 200 ミリ秒だとしましょう。いいですね。しかし、ユーザーの 5% は 8 秒待っている可能性があります。平均値はこれを隠します。専門家がパーセンタイルを使用するのはこのためです: p95 = 「リクエストの 95% はこの期間を下回っています。」 p95 の応答時間が 8 秒の場合、20 人に 1 人のユーザーがひどい経験をしていることになりますが、平均値ではそれがわかりません。 AI に指標を与えるときは、どの統計が必要かを明確にしてください。「平均ではなく、p50、p95、p99 を解釈してください」。このたった 1 つの習慣が、隠れた問題を明らかにします。

ヒント: ユーザー エクスペリエンス (応答時間、遅延) に関するすべての指標のパーセンタイルを確認してください。 p95/p99 では、平均ではなく、真に苦しんでいる少数派を知ることができます。リソース メトリクス (CPU、メモリ) では、ピーク値と持続値の両方を確認します。

ベースラインがなければ異常はない

メトリクスが「異常」かどうかを判断するには、まず「正常」を知る必要があります。ベースラインは、正常な日のシステムの典型的な動作範囲です。「このサービスの平日正午の CPU は通常 40 ~ 60%」です。ベースラインがなければ、70% という値が恐ろしいのか、それとも正常なのかを知ることができません。過去の健全なデータを AI に与え、「このメトリクスの正常範囲と日次/週次パターンを抽出する」と言うことで、ベースラインを設定できます。次に、「この値は通常のどこにあるのか?」というベースラインに従って新しいデータを解釈します。異常とは、ベースラインからの大幅かつ持続的な逸脱です。単一の突然のジャンプは、多くの場合ノイズです。

ステップバイステップ: キャパシティ予測

  1. クリーンで適切な履歴を収集します。傾向には少なくとも数週間、できれば毎月のデータが必要です。少ないデータから作成された予測は推測であり、予測ではありません。
  2. 季節性を分離します。トラフィックは週末に減少し、月末に増加し、キャンペーン中に急増します。成長と季節変動を混同しないように、これらのサイクルを AI に伝えます。
  3. トレンドを脱ぎ捨てる。 「過去 8 週間で、このディスクは 1 週間あたり平均何 GB 増加しましたか?」 AIが成長率を計算します。
  4. 投影を求めて、間隔をあけてください。 「このままでは、ディスクが 90% いっぱいになるのはいつですか?」 — ただし、単一の日付ではなく、楽観的/悲観的な範囲を尋ねてください。未来は不確実です。奇数は偽の精度です。
  5. 人々との意思決定の閾値を決定します。予測に「6 週間で完了する」と表示されている場合は、調達時間 (購入、承認) を考慮して、今日行動を起こすかどうかを決定します。
  6. アラームを正しく設定してください。非常に敏感なアラームはノイズとアラーム疲労を引き起こします。アラームが緩すぎるとイベントを見逃してしまいます。 AI から推奨されるしきい値を取得しますが、最終的なしきい値は独自のリスク許容度で決定します。

ミニケース3個

ケース 1 — 平均的に隠蔽され、p99 が表示されました。あるチームは、自分たちの API は「平均 180 ミリ秒で、問題ない」と考えていました。 AI にメトリクスを入力してパーセンタイルの解釈を求めたところ、p99 は 6,400 ミリ秒であることが判明しました。リクエストの 100 件に 1 件が 6 秒未満でした。根本的な原因はデータベース クエリの遅さでした。平均的な人々は健康そうに見えましたが、少数の人たちはひどい経験をしました。

ケース 2 — 予測は 3 週間前に警告されます。管理者はログのディスク占有率データを AI に渡しました。 AI は、毎週最大 7 GB の増加傾向を推測し、現在のペースで 19 日以内に 90% に達し、楽観的または悲観的な範囲は 16 ~ 23 日であると予測しました。新しいディスクを供給するのに 10 日かかったため、チームはすぐに注文し、停止が発生する前に防止しました。

ケース 3 — 誤った異常からの復帰。毎週日曜日の夜に監視アラームが鳴り、CPU が 95% に達していることを知らせました。パニックになる前に、エンジニアは AI にベースラインを上げるように指示しました。このジャンプは毎週同じ時間に行われる計画されたバックアップ ジョブであったため、標準の一部でした。それは異常ではありませんでした。ベースラインが欠落していました。その時間帯のアラームしきい値が修正され、不要な夜間覚醒がなくなりました。

コピー可能な 4 つのテンプレート

1) メトリクスの解釈 (パーセンタイル):

以下は、[サービス] 応答時間のメトリクス (マスクされています) です。 p50、p95、p99 は平均ではなく、私にコメントしてください。 p99 と p50 の違いは何を意味しますか? どのようなユーザー エクスペリエンスの問題を示していますか?でっちあげの値を追加しないでください。私が提供するデータを解釈してください。データ: [メトリクス]

2) ベースラインの減算:

以下は、過去 4 週間の健全な [指標] データです。このメトリクスの (1) 正常範囲 (2) 日次および週次パターン (夜間の最低値、正午の最高値など) を抽出します。次に、1 つの新しい値を与えます。このベースラインに基づいて「正常/注意/異常」に分類します。データ: [過去の指標]

3) 生産能力の予測 (範囲あり):

以下は、過去 8 週間の [リソース] 占有率データです。 (1) 週平均成長率を計算し、(2) 季節的影響を示し、(3) 現在の速度で 90% のしきい値に達するまでの時間を楽観的および悲観的な範囲で推定します。単一の日付と範囲を指定して、仮定を書き留めます。データ: [時系列]

4) アラームしきい値の推奨事項:

[メトリック] のベースラインは [範囲] です。私の目標は、実際の問題を見逃さずに誤報を最小限に抑えることです。 (1) 警告と (2) 重大なしきい値について、それぞれを正当化し、アラーム疲労のリスクを評価するための推奨事項を教えてください。最終的な閾値は私が決めさせていただきます。

弱いプロンプト / 強いプロンプト

弱いプロンプト:

私のサーバーは遅いですか?

コンテキストも指標もベースラインもありません。 AIは「遅い」の定義も知りませんし、それを比較するための正常な値も持ちません。答えは単なる推測です。

強力なプロンプト:

あなたの役割: キャパシティ プランニングのスペシャリスト。以下は、過去 14 日間の p95 応答時間と API のリクエスト/秒データ (マスクされています) です。私のベースラインは、p95 の場合 250 ~ 400 ミリ秒です。教えてください (1) 過去 14 日間でベースラインから外れた日をマークしてください、(2) 応答時間とリクエスト負荷の間に目に見える関係があるかどうか (仮説として) 教えてください、(3) この傾向が続いた場合に p95 が 30 日間でどこに行くかを予測してください。データ: [時系列]

メトリックタイプ

間違った測定

正確な測定

応答時間

ちょうど平均的

p50、p95、p99

CPU/メモリ

瞬時値

ピーク + 持続 + ベースライン

椎間板の成長

本日の占有状況

週間トレンド + 予測

異常

シングルバウンス

ベースラインからの継続的な逸脱

アラーム

任意の単一のしきい値

理由のある警告 + クリティカルしきい値

よくある間違い

  • すべてを平均値で測定します。平均値は少数の人々の悪い経験を隠します。パーセンタイルを参照してください。
  • ベースラインを持たない異常の検索。何が正常なのかを知らずに、値が異常であるとは言えません。誤報を作成してしまいます。
  • 季節性をトレンドと間違える。キャンペーンのピークを永続的な成長として扱い、不必要なリソースを取るとコストがかかります。
  • 奇数投影に依存します。 「ちょうど 19 日」は誤った精度です。楽観的と悲観的な範囲を使用します。
  • 調達時間を忘れる。予測のしきい値を考慮せず、時間を一緒に購入しないチームは中断に巻き込まれることになります。
注意: AI のトレンド予測は、過去が将来も継続することを前提としています。新製品の発売、顧客の移行、またはアーキテクチャの変更により、この前提が崩れます。コンテキストに応じて投影を修正するのはあなたの仕事です。

要約すれば

パフォーマンス監視は、「今は大丈夫ですか?」という質問に答えます。キャパシティ プランニングは、「いつ十分ではないのか?」という質問に答えます。 AI は、メトリクスの解釈、ベースラインの確立、異常の警告、傾向の予測における強力なパートナーです。しかし、平均的な嘘はパーセンタイルを使用します。ベースラインがなければ異常はありません。最初に正常を確立します。季節性をトレンドから切り離す。そして、投影を単一の数値ではなく範囲として受け取ります。リソースへの投資とアラートしきい値の決定は、リソースのリード タイムとビジネス コンテキストとともに人間によって行われます。

アプリケーションタスク

独自のシステムからリソース (ディスク、メモリ、応答時間) の過去数週間のデータを取得し、機密領域をマスクします。上記の「ベースライン減算」テンプレートを使用して、正常な範囲とパターンを減算します。次に、「キャパシティ予測」テンプレートを使用して、楽観的または悲観的な範囲で、いつしきい値に達するかを予測させます。また、「パーセンタイル」テンプレートを使用して応答時間メトリックを解釈させ、平均に隠れているものがないかどうかを確認します。気づいたことと今後のアクションを5つの項目に書き出します。

チェックリスト

  • [ ] 応答時間メトリクスの平均ではなく p95/p99 を見ましたか?
  • [ ] 異常を探す前に、健全なデータからベースラインを確立しましたか?
  • [ ] 季節変動と永続的な傾向を区別しましたか?
  • [ ] 私はこの予測を単一の日付ではなく、楽観的または悲観的な範囲として捉えましたか?
  • [ ] 予測しきい値とともに調達時間を評価しましたか?
  • [ ] AI の推奨ではなく、私自身のリスク許容度に基づいてアラームのしきい値を設定しましたか?