Gains :
- Capacité à interpréter correctement les métriques avec la prise en charge de l'intelligence artificielle en utilisant le centile (p95/p99) et la référence au lieu de la moyenne
- Capacité à séparer la saisonnalité de la tendance et à produire une projection de capacité sous la forme d'une fourchette optimiste-pessimiste plutôt que d'un chiffre unique.
- Comprendre que les investissements en ressources et les décisions relatives aux seuils d'alarme sont humains, tout comme les délais d'exécution des ressources et le contexte commercial.
Surveillance de la capacité et des performances : lire les métriques avec l'IA et planifier l'avenir
Vous ne pouvez pas voir la santé d’un système de vos propres yeux ; Vous le comprenez à travers des métriques. Une métrique est une valeur numérique dépendant du temps d'une caractéristique mesurable d'un système : utilisation du processeur, occupation de la mémoire, espace disque libre, latence du réseau, requêtes par seconde. La surveillance des performances collecte en permanence ces mesures et répond à la question « le système est-il OK maintenant ? » La planification des capacités va encore plus loin : elle répond à la question « à ce rythme, quand vais-je devenir insuffisant, quand dois-je acheter de nouvelles ressources ? Ici, l’IA est un assistant hautement qualifié pour interpréter des piles de mesures, marquer les anomalies, lire la tendance et produire des projections futures. Mais une mise en garde s’impose avant tout : l’IA extrait des modèles à partir de données historiques ; C'est vous qui prenez les décisions d'investissement en ressources, de mise à l'échelle et de seuil d'alerte en fonction du contexte.
Dans cette unité, les concepts de surveillance tels que la ligne de base (ligne de comportement normal), l'anomalie (écart par rapport à la normale), le percentile (percentile) ; Interprétation métrique avec IA ; tendances et prévisions de croissance ; et vous apprendrez à définir le seuil d'alarme correct.
La moyenne ment : pourquoi le percentile ?
L’erreur la plus courante en matière de suivi est de tout mesurer avec une moyenne. Disons que votre temps de réponse est de 200 ms en moyenne. Ça a l'air bien. Mais 5 % des utilisateurs peuvent attendre 8 secondes ; La moyenne cache cela. C'est pourquoi les professionnels utilisent le percentile : p95 = "95% des demandes sont en dessous de ce délai." Si le temps de réponse du p95 est de 8 secondes, un utilisateur sur vingt vit une expérience épouvantable – la moyenne ne le montre jamais. Lorsque vous donnez des mesures à l'IA, indiquez clairement quelle statistique vous souhaitez : "interprètez-moi p50, p95 et p99, pas la moyenne". Cette seule habitude révèle des problèmes cachés.
Astuce : examinez le centile de chaque métrique concernant l'expérience utilisateur (temps de réponse, latence) ; p95/p99 au lieu de la moyenne vous amène à la véritable minorité qui souffre. Dans les métriques de ressources (CPU, mémoire), examinez à la fois les valeurs maximales et soutenues.
Il n'y a pas d'anomalie sans référence
Avant de pouvoir déterminer si une mesure est « anormale », vous devez savoir « normale ». La ligne de base est la plage de comportement typique du système les jours sains : "ce CPU de service à midi en semaine est généralement de 40 à 60 %". Sans base de référence, vous ne pouvez pas savoir si une valeur de 70 % est effrayante ou normale. Vous pouvez définir une référence en fournissant des données historiques saines à l'IA et en disant « extraire la plage normale et le modèle quotidien/hebdomadaire de cette métrique ». Ensuite vous interprétez les nouvelles données selon cette ligne de base : « où est cette valeur en normal ? Une anomalie est un écart significatif et soutenu par rapport à la ligne de base : un seul saut soudain est souvent du bruit.
Étape par étape : projection de capacité
- Recueillir un historique propre et adéquat. Une tendance nécessite au moins quelques semaines de données, de préférence mensuelles. Une projection réalisée avec peu de données est une supposition et non une prédiction.
- Saisonnalité séparée. Le trafic baisse le week-end, augmente en fin de mois et explose pendant la campagne. Informez l'IA de ces cycles afin qu'elle ne confonde pas croissance et fluctuation saisonnière.
- Retirez la tendance. "De combien de Go en moyenne ce disque a-t-il augmenté par semaine au cours des 8 dernières semaines ?" L'IA calcule le taux de croissance.
- Demandez une projection, espacez-la. « A ce rythme, quand le disque sera-t-il plein à 90 % ? – mais demandez une fourchette optimiste/pessimiste, pas une seule date. L'avenir est incertain ; un nombre impair est une fausse précision.
- Déterminez le seuil de décision avec les gens. Si la projection indique « Cela sera terminé dans 6 semaines », vous considérez le temps de sourcing (achat, approbation) et décidez si vous devez agir aujourd'hui.
- Réglez correctement l'alarme. Une alarme très sensible produit du bruit et une fatigue d'alarme ; trop lâche, l'alarme manquera l'événement. Obtenez une recommandation de seuil de la part de l’IA, mais déterminez le seuil final en fonction de votre propre tolérance au risque.
trois mini-cases
Cas 1 — Moyenne dissimulée, p99 montré. Une équipe pensait que son API était "de 180 ms en moyenne, très bien". Lorsque j'ai transmis les métriques à l'IA et demandé une interprétation centile, il s'est avéré que p99 était de 6 400 ms – une requête sur cent était plus lente que 6 secondes. La cause première était une requête lente dans la base de données. Alors que la moyenne semblait en bonne santé, la minorité a vécu une expérience terrible.
Cas 2 — Projection prévenue 3 semaines à l'avance. Un administrateur a transmis les données d'occupation du disque du journal à AI. AI a déduit une tendance de croissance hebdomadaire d'environ 7 Go et a prévu qu'au rythme actuel, 90 % seraient atteints dans les 19 jours, avec une fourchette optimiste-pessimiste de 16 à 23 jours. Comme il fallait 10 jours pour fournir de nouveaux disques, l'équipe a immédiatement commandé et évité la panne avant qu'elle ne se produise.
Cas 3 — Retour d’une fausse anomalie. Une alarme de surveillance s'est déclenchée tous les dimanches soir, indiquant que le processeur montait à 95 %. Avant de paniquer, l'ingénieur a demandé à l'IA d'augmenter la ligne de base : ce saut était un travail de sauvegarde planifié qui se produisait à la même heure chaque semaine, il faisait donc partie de la norme. Ce n'était pas une anomalie ; la ligne de base manquait. Le seuil d'alarme a été corrigé pour cette période et les réveils nocturnes inutiles ont disparu.
Quatre modèles copiables
1) Interprétation métrique (centile) :
Vous trouverez ci-dessous les mesures du temps de réponse du [service] (masquées). Commentez-moi p50, p95 et p99, pas la moyenne. Que signifie la différence entre p99 et p50, quel problème d'expérience utilisateur cela indique-t-elle ? N'ajoutez pas de valeurs inventées, interprétez simplement les données que je vous donne. Données : [métriques]
2) Soustraction de la ligne de base :
Vous trouverez ci-dessous les données [métriques] saines des 4 dernières semaines. Extrayez la (1) plage normale (2) le modèle quotidien et hebdomadaire (par exemple, le plus bas de la nuit, le plus haut de midi) de cette métrique. Ensuite, je donnerai une seule nouvelle valeur ; classez-le comme « normal/prudence/anormal » en fonction de cette référence. Données : [métrique historique]
3) Projection de capacité (avec plage) :
Vous trouverez ci-dessous les 8 dernières semaines de données d'occupation de [ressource]. (1) Calculer le taux de croissance moyen hebdomadaire, (2) indiquer les effets saisonniers, (3) estimer le temps pour atteindre le seuil de 90 % au rythme actuel, avec des plages OPTIMISTE et PÉSIMISTE. Donnez une seule date, donnez une plage et notez vos hypothèses. Données : [série chronologique]
4) Recommandation de seuil d'alarme :
Ma référence pour [métrique] est [plage]. Mon objectif est de minimiser les fausses alarmes sans passer à côté de vrais problèmes. Donnez-moi une recommandation pour (1) le seuil d'avertissement et (2) le seuil critique, en justifiant chacun et en évaluant le risque de fatigue des alarmes. Je déterminerai le seuil final.
Invite faible/Invite forte
Invite faible :
Mon serveur est-il lent ?
Il n’y a pas de contexte, pas de mesures et pas de référence. L'IA ne connaît pas la définition de « lent » et n'a pas non plus de valeur normale à laquelle la comparer. La réponse est une hypothèse vaine.
Invite puissante :
Votre rôle : spécialiste en planification de capacité. Vous trouverez ci-dessous les 14 derniers jours de temps de réponse p95 et de données requêtes/seconde d'une API (masquées). Ma ligne de base est de 250 à 400 ms pour p95. Dites-moi (1) marquez les jours qui sont sortis de la ligne de base au cours des 14 derniers jours, (2) dites-moi s'il existe une relation visible entre le temps de réponse et la charge des demandes (à titre d'hypothèse), (3) prédisez où ira p95 dans 30 jours si cette tendance se poursuit. Données : [série chronologique]
Type métrique
mauvaise mesure
mesure précise
temps de réponse
Juste moyen
p50, p95, p99
Processeur/mémoire
valeur instantanée
Pic + soutenu + ligne de base
croissance du disque
Occupation d'aujourd'hui
Tendance hebdomadaire + projection
Anomalie
rebond unique
Écart continu par rapport à la ligne de base
alarme
Seuil unique arbitraire
Avertissement motivé + seuil critique
Erreurs courantes
- Tout mesurer avec une moyenne. La moyenne cache la mauvaise expérience de quelques-uns ; Voir centile.
- Recherche d'anomalies sans référence. On ne peut pas dire qu’une valeur est anormale sans savoir ce qui est normal ; Vous créez une fausse alerte.
- Confondre la saisonnalité avec une tendance. Traiter le pic de campagne comme une croissance permanente et prendre des ressources inutiles coûte de l’argent.
- S'appuyant sur la projection de nombres impairs. « Exactement 19 jours » est une fausse précision ; Utilisez la fourchette optimiste-pessimiste.
- Oublier le temps de sourcing. L'équipe qui ne considère pas le seuil de projection et n'achète pas de temps ensemble sera prise dans l'interruption.
Attention : la projection des tendances d'IA suppose que le passé se poursuivra dans le futur. Un lancement de nouveau produit, une migration de client ou un changement d'architecture perturbe cette hypothèse. C'est votre travail de corriger la projection avec votre contexte.
En résumé
Le suivi des performances répond à la question « est-ce que tout va bien maintenant ? » et la planification des capacités répond à la question « quand cela ne suffit-il pas ? L’IA est un partenaire puissant pour interpréter les mesures, établir des références, signaler les anomalies et projeter les tendances. Mais la moyenne ment : utilisez le centile ; Sans ligne de base, il n’y a pas d’anomalie – établissez d’abord la normale ; séparer la saisonnalité de la tendance ; et prenez la projection comme une plage, pas comme un seul nombre. L’investissement en ressources et les décisions relatives aux seuils d’alerte sont humains, tout comme les délais d’exécution des ressources et le contexte commercial.
Tâche de candidature
Récupérez les dernières semaines de données d'une ressource (disque, mémoire, temps de réponse) de vos propres systèmes et masquez les zones sensibles. Soustrayez la plage normale et le motif avec le modèle « Soustraction de ligne de base » ci-dessus. Demandez ensuite au modèle « Projection de capacité » de prédire quand vous atteindrez un seuil, avec une plage optimiste-pessimiste. Faites également interpréter votre mesure de temps de réponse à l’aide du modèle « centile » et voyez si la moyenne cache quelque chose. Notez vos découvertes et les mesures que vous prendrez en 5 éléments.
liste de contrôle
- [ ] Ai-je regardé p95/p99 au lieu de la moyenne dans les mesures de temps de réponse ?
- [ ] Ai-je établi une base de référence à partir de données saines avant de rechercher des anomalies ?
- [ ] Ai-je fait la distinction entre les fluctuations saisonnières et les tendances permanentes ?
- [ ] Ai-je considéré la projection comme une fourchette optimiste-pessimiste plutôt que comme une date unique ?
- [ ] Ai-je évalué le temps de sourcing ainsi que le seuil de projection ?
- [ ] Ai-je défini le seuil d'alarme en fonction de ma propre tolérance au risque et non d'une recommandation de l'IA ?