Fitimet:
- Aftësia për të interpretuar saktë metrikat me mbështetjen e inteligjencës artificiale duke përdorur përqindjen (p95/p99) dhe bazën në vend të mesatares
- Aftësia për të ndarë sezonalitetin nga trendi dhe për të prodhuar projeksionin e kapacitetit si një diapazon optimist-pesimist dhe jo si një numër i vetëm
- Të kuptuarit se investimi i burimeve dhe vendimet e pragut të alarmit janë njerëzore, së bashku me kohën e shfrytëzimit të burimeve dhe kontekstin e biznesit.
Kapaciteti dhe Monitorimi i Performancës: Leximi i Metrikës me AI dhe Planifikimi i së Ardhmes
Ju nuk mund ta shihni shëndetin e një sistemi me sytë tuaj; Ju e kuptoni atë përmes metrikës. Një metrikë është një vlerë numerike e varur nga koha e një karakteristike të matshme të një sistemi: përdorimi i CPU, zënia e memories, hapësira e lirë në disk, vonesa e rrjetit, kërkesat për sekondë. Monitorimi i performancës mbledh vazhdimisht këto metrikë dhe i përgjigjet pyetjes "a është sistemi në rregull tani?" Planifikimi i kapaciteteve shkon një hap më tej: Ai i përgjigjet pyetjes "me këtë ritëm, kur do të bëhem i pamjaftueshëm, kur duhet të blej burime të reja?" Këtu, AI është një asistent shumë i aftë në interpretimin e grumbujve të metrikës, shënimin e anomalive, leximin e trendit dhe prodhimin e projeksioneve të ardhshme. Por mbi të gjitha mbizotëron një paralajmërim: AI nxjerr modele nga të dhënat historike; Ju jeni ai që bën investimin e burimeve, shkallëzimin dhe vendimet e pragut të alarmit me kontekst.
Në këtë njësi, konceptet e monitorimit si vija bazë (vijë e sjelljes normale), anomali (devijim nga normalja), përqindje (përqindje); Interpretimi metrikë me AI; tendenca dhe parashikimi i rritjes; dhe do të mësoni të vendosni pragun e saktë të alarmit.
Gënjeshtrat mesatare: pse përqindje?
Gabimi më i zakonshëm në gjurmim është matja e gjithçkaje me një mesatare. Le të themi se koha juaj e përgjigjes është mesatarisht 200 ms. Tingëllon mirë. Por 5% e përdoruesve mund të presin 8 sekonda; Mesatarja e fsheh këtë. Kjo është arsyeja pse profesionistët përdorin përqindjen: p95 = "95% e kërkesave janë nën këtë periudhë kohore." Nëse koha e përgjigjes p95 është 8 sekonda, një në njëzet përdorues ka një përvojë të tmerrshme - mesatarja nuk e tregon kurrë këtë. Kur jepni metrikë për AI, jini të qartë se cilën statistikë dëshironi: "interpretoni p50, p95 dhe p99 për mua, jo mesataren." Ky zakon zbulon problemet e fshehura.
Këshillë: Shikoni përqindjen për çdo metrikë që ka të bëjë me përvojën e përdoruesit (koha e përgjigjes, vonesa); P95/p99 në vend të mesatares ju çon në pakicën e vërtetë që vuan. Në matjet e burimeve (CPU, memorie), shikoni si vlerat maksimale ashtu edhe ato të qëndrueshme.
Nuk ka anomali pa një bazë
Përpara se të dalloni nëse një metrikë është "jonormale", duhet të dini "normale". Baza bazë është diapazoni tipik i sjelljes së sistemit në ditë të shëndetshme: "Ky shërbim CPU gjatë ditës së javës është zakonisht 40–60%". Pa një bazë, nuk mund të dini nëse një vlerë 70% është e frikshme apo normale. Mund të vendosni një bazë duke i dhënë të dhëna të shëndetshme historike AI dhe duke thënë "ekstrakto diapazonin normal dhe modelin ditor/javor të kësaj metrike". Pastaj ju interpretoni të dhënat e reja sipas kësaj bazë: "ku është kjo vlerë në normale?" Një anomali është një devijim i rëndësishëm dhe i qëndrueshëm nga baza - një kërcim i vetëm i papritur shpesh është zhurmë.
Hap pas hapi: projeksioni i kapacitetit
- Mblidhni një histori të pastër dhe të përshtatshme. Një trend kërkon të paktën disa javë të dhëna, mundësisht mujore. Një projeksion i bërë me pak të dhëna është një supozim, jo një parashikim.
- Sezonaliteti i veçantë. Trafiku bie në fundjavë, rritet në fund të muajit dhe shpërthen gjatë fushatës. Tregojuni AI këto cikle në mënyrë që të mos ngatërrojë rritjen me luhatjet sezonale.
- Hiqni trendin. "Sa GB mesatarisht është rritur ky disk në javë në 8 javët e fundit?" AI llogarit normën e rritjes.
- Kërkoni projeksion, hapeni atë. "Me këtë ritëm, kur do të mbushet disku 90%?" — por kërkoni një gamë optimiste/pesimiste, jo një datë të vetme. E ardhmja është e pasigurt; numri tek është saktësi e rreme.
- Përcaktoni pragun e vendimit me njerëzit. Nëse projeksioni thotë "Do të përfundojë brenda 6 javësh", ju merrni parasysh kohën e burimit (blerje, miratim) dhe vendosni nëse do të veproni sot.
- Vendosni saktë alarmin. Alarmi shumë i ndjeshëm prodhon zhurmë dhe lodhje alarmi; shumë i lirë alarmi do të humbasë ngjarjen. Merrni një rekomandim të pragut nga AI, por përcaktoni pragun përfundimtar me tolerancën tuaj ndaj rrezikut.
tre mini kuti
Rasti 1 - Mesatarja e fshehur, tregoi p99. Një ekip mendoi se API-ja e tyre ishte "180 ms mesatarisht, mirë." Kur futa metrikën në AI dhe kërkova interpretimin e përqindjes, doli që p99 ishte 6,400 ms - një në çdo njëqind kërkesa ishte më e ngadaltë se 6 sekonda. Shkaku kryesor ishte një pyetje e ngadaltë e bazës së të dhënave. Ndërsa mesatarja dukej e shëndetshme, pakica kishte një përvojë të tmerrshme.
Rasti 2 — Paralajmërimi i projektimit 3 javë përpara. Një administrator i dha AI të dhënat e zënies së diskut të regjistrit. AI nxori një tendencë rritjeje javore prej ~ 7 GB dhe parashikoi që me normën aktuale, 90% do të arrihej brenda 19 ditëve, me një interval optimist-pesimist prej 16-23 ditësh. Meqenëse u deshën 10 ditë për të furnizuar disqe të rinj, ekipi urdhëroi menjëherë dhe parandaloi ndërprerjen përpara se të ndodhte.
Rasti 3 - Kthimi nga anomalia e rreme. Një alarm monitorimi binte çdo të dielë mbrëma duke thënë se CPU po shkonte deri në 95%. Para se të vinte paniku, inxhinieri kërkoi që AI të ngrinte bazën: ky kërcim ishte një punë rezervë e planifikuar që ndodhte në të njëjtën kohë çdo javë, kështu që ishte pjesë e normës. Nuk ishte një anomali; mungonte linja bazë. Pragu i alarmit është korrigjuar për atë periudhë kohore dhe zgjimet e panevojshme të natës janë zhdukur.
Katër shabllone të kopjueshëm
1) Interpretimi metrik (përqindja):
Më poshtë janë matjet e kohës së përgjigjes [shërbimi] (të maskuara). Komentoni për mua p50, p95 dhe p99, jo mesatarja. Çfarë do të thotë ndryshimi midis p99 dhe p50, cilin problem të përvojës së përdoruesit tregon? Mos shtoni vlera të sajuara, thjesht interpretoni të dhënat që ju jap. Të dhënat: [metrika]
2) Zbritja bazë:
Më poshtë janë të dhënat [metrike] të shëndetshme për 4 javët e fundit. Ekstraktoni diapazonin (1) normal (2) modelin ditor dhe javor (p.sh. niveli i ulët i natës, i lartë i mesditës) të kësaj metrike. Pastaj do të jap një vlerë të re të vetme; klasifikojeni atë si "normale/kujdes/anormale" bazuar në këtë bazë. Të dhënat: [metrika historike]
3) Projeksioni i kapacitetit (me diapazon):
Më poshtë janë 8 javët e fundit të të dhënave të zënies së [burimeve]. (1) Llogaritni normën mesatare javore të rritjes, (2) tregoni efektet sezonale, (3) vlerësoni kohën për të arritur pragun 90% me normën aktuale, me diapazon OPTIMISTIK dhe PESIMISTIK. Jepni një datë të vetme, jepni një interval dhe shkruani supozimet tuaja. Të dhënat: [seritë kohore]
4) Rekomandimi i pragut të alarmit:
Baza ime për [metrik] është [varg]. Qëllimi im është të minimizoj alarmet e rreme pa humbur probleme reale. Më jep një rekomandim për (1) paralajmërim dhe (2) pragun kritik, duke justifikuar secilin dhe duke vlerësuar rrezikun e lodhjes së alarmit. Unë do të përcaktoj pragun përfundimtar.
Prompt i dobët / Prompt i fortë
Njoftim i dobët:
A është serveri im i ngadalshëm?
Nuk ka asnjë kontekst, asnjë metrikë dhe asnjë bazë. AI as nuk e njeh përkufizimin e "ngadalës" dhe as nuk ka një vlerë normale për ta krahasuar atë. Përgjigja është një supozim i kotë.
Njoftim i fuqishëm:
Roli juaj: specialist i planifikimit të kapaciteteve. Më poshtë janë 14 ditët e fundit të kohës së përgjigjes p95 dhe të dhënat e kërkesave/sekondës së një API (të maskuar). Baza ime është 250-400 ms për p95. Më thuaj (1) shëno ditët që dolën jashtë bazës në 14 ditët e fundit, (2) më thuaj nëse ka një lidhje të dukshme midis kohës së përgjigjes dhe ngarkesës së kërkesës (si hipotezë), (3) parashiko se ku do të shkojë p95 në 30 ditë nëse kjo prirje vazhdon. Të dhënat: [seritë kohore]
Lloji metrikë
matje e gabuar
matje e saktë
koha e përgjigjes
Vetëm mesatare
p50, f95, f99
CPU/memorie
vlerë e menjëhershme
Pika + e qëndrueshme + bazë
rritja e diskut
Okupimi i sotëm
Trendi javor + projeksion
Anomali
kërcim i vetëm
Devijim i vazhdueshëm nga baza
alarmi
Pragu i vetëm arbitrar
Paralajmërim i arsyetuar + pragu kritik
Gabimet e zakonshme
- Matja e gjithçkaje me një mesatare. Mesatarja fsheh përvojën e keqe të disave; Shih përqindjen.
- Kërkimi i anomalive pa një bazë. Nuk mund të thuash se një vlerë është anormale pa e ditur se çfarë është normale; Ju krijoni një alarm të rremë.
- Gabimi i sezonalitetit për një trend. Trajtimi i kulmit të fushatës si rritje e përhershme dhe marrja e burimeve të panevojshme kushton para.
- Duke u mbështetur në projeksionin e numrave tek. "Saktësisht 19 ditë" është saktësi e rreme; Përdorni diapazonin optimist-pesimist.
- Duke harruar kohën e burimit. Ekipi që nuk merr parasysh pragun e projeksionit dhe kohën e blerjes së bashku do të kapet në ndërprerje.
Kujdes: Projeksioni i tendencës së AI supozon se e kaluara do të vazhdojë në të ardhmen. Një lançim i produktit të ri, një migrim klienti ose një ndryshim arkitektonik e prish këtë supozim. Është detyra juaj të korrigjoni projeksionin me kontekstin tuaj.
Në përmbledhje
Monitorimi i performancës i përgjigjet pyetjes "a është mirë tani?" dhe planifikimi i kapaciteteve i përgjigjet pyetjes "kur nuk mjafton?" AI është një partner i fuqishëm në interpretimin e metrikës, vendosjen e linjave bazë, shënjimin e anomalive dhe projektimin e tendencave. Por mesatarja gënjeshtra - përdorni përqindjen; Pa bazë nuk ka anomali - vendos normalen fillimisht; ndani sezonalitetin nga trendi; dhe merrni projeksionin si një varg, jo një numër të vetëm. Investimi i burimeve dhe vendimet e pragut të alarmit janë njerëzore, së bashku me kohën e shfrytëzimit të burimeve dhe kontekstin e biznesit.
Detyra e aplikimit
Merrni të dhënat e javëve të fundit për një burim (disku, memorie, koha e përgjigjes) nga sistemet tuaja dhe maskoni zonat e ndjeshme. Zbrisni diapazonin dhe modelin normal me shabllonin "Zbritja bazë" më sipër. Më pas bëni që shablloni "Projeksioni i kapacitetit" të parashikojë se kur do të arrini një prag, me një diapazon optimist-pesimist. Gjithashtu, interpretoni metrikën tuaj të kohës së përgjigjes duke përdorur shabllonin "përqindëshe" dhe shikoni nëse ka ndonjë gjë që mesatarja fsheh. Shkruani gjetjet tuaja dhe veprimin që do të bëni në 5 artikuj.
listë kontrolli
- [ ] A shikova p95/p99 në vend të matjeve mesatare në kohën e përgjigjes?
- [ ] A kam krijuar një bazë nga të dhënat e shëndetshme përpara se të kërkoj anomali?
- [ ] A e kam dalluar luhatjen sezonale nga tendenca e përhershme?
- [ ] A e mora projeksionin si një diapazon optimist-pesimist dhe jo si një datë të vetme?
- [ ] A e kam vlerësuar kohën e burimit së bashku me pragun e projeksionit?
- [ ] A e vendosa pragun e alarmit bazuar në tolerancën time të rrezikut dhe jo në një rekomandim të AI?