Njësia 11 / 11

Integrimi nga fundi në fund: Menaxhimi i një incidenti nga fillimi në fund

Fitimet:

  • Menaxhimi nga fundi në fund i një incidenti me mbështetje të inteligjencës artificiale në fazat e zbulimit, diagnostikimit, zbutjes, zgjidhjes së përhershme dhe mësimit
  • Aftësia për të ruajtur disiplinën e verifikimit edhe në kohë paniku duke ndarë hapat që mund të transferohen në inteligjencën artificiale dhe ato që kërkojnë vendim njerëzor në çdo fazë.
  • Aftësia për ta kthyer rregullin e artë se inteligjenca artificiale ka përparësi ndaj pyetjeve 'çfarë po ndodh, si të shkruajmë' dhe njerëzit kanë përparësi ndaj pyetjeve 'a duhet ta bëj, kush është garantuesi', në një refleks biznesi.

Integrimi nga fundi në fund: Menaxhimi i një incidenti nga fundi në fund me AI

I mësuat pjesët në dhjetë njësitë e mëparshme: skriptimin, analizën e regjistrave, monitorimin, konfigurimin, IaC, dokumentacionin, mirëmbajtjen parashikuese, menaxhimin e ndryshimeve dhe sigurinë. Por në botën reale këto pjesë nuk vijnë një nga një, por ndërthuren brenda një ngjarjeje. Në këtë njësi përfundimtare, ne i bashkojmë pjesët: do të shihni në tërësinë e tij se si të menaxhoni një incident që filloi në mes të natës, nga fundi në fund, nga zbulimi te shkaku kryesor, nga korrigjimi te dokumentimi dhe duke përdorur dozën e duhur të AI në çdo fazë. Qëllimi nuk është të mësohet një teknikë e re; duke lidhur së bashku atë që keni mësuar si refleks inxhinieri, duke përforcuar të vërtetën e vetme të përsëritur gjatë gjithë modulit: AI përshpejton, ndriçon dhe harton në çdo fazë; por është gjithmonë njeriu që konfirmon diagnozën, drejton komandën, konfirmon ndryshimin dhe mban përgjegjësi për rezultatin.

Në këtë njësi, ju do të integroni ciklin e jetës së një incidenti - zbulimin, diagnozën, ndërhyrjen, zgjidhjen, mësimin - dhe rolin dhe kufijtë e AI në çdo fazë përmes një shembulli.

Cikli jetësor i një ngjarjeje

Çdo incident serioz kalon nëpër faza të ngjashme, dhe AI ​​ka një rol të ndryshëm në secilën fazë. Zbulimi: bie një alarm, një përdorues ankohet, një metrikë devijon nga baza (Njësia 4). Vlefshmëria dhe shtrirja: a është vërtet një çështje, sa e gjerë është? Diagnoza: arritja e shkakut rrënjësor nga regjistrat dhe metrikat (Kapitulli 3). Reagimi dhe zbutja: ndalimi i dëmit, zgjidhje. Zgjidhje e përhershme: rregulloni me menaxhimin e ndryshimeve (Njësia 9), skriptin (Njësia 2) ose konfigurimi nëse është e nevojshme (Njësia 5). Mësimi: përditësimi pas vdekjes dhe librit të përgjithshëm (Kapitulli 7). AI shënon anomalinë në zbulim, prodhon hipoteza në diagnozë, ofron opsione në ndërhyrje, shkruan drafte në zgjidhje, prodhon dokumente në mësim - por në çdo fazë, njerëzit qëndrojnë në pikën e vendimit.

Këshillë: Momenti më i rrezikshëm i një incidenti është momenti i diagnostikimit dhe reagimit kur stresi është më i lartë - pikërisht kur dëshira për t'i besuar verbërisht AI është më e fortë. Sa më shumë të nxitoni, aq më fort e mbani refleksin "lexo, verifiko, përgatitu për kthim". Një verifikim i vetëm i anashkaluar në një moment paniku e dyfishon ngjarjen.

Një shembull nga fillimi në fund

Le ta konkretizojmë. Një alarm në orën 02:10: koha e përgjigjes së shërbimit të pagesave p99 është 6 sekonda, shumë mbi bazën (250–400 ms). Zbulimi i saktë: gjurmimi funksionoi. Konfirmim: konfirmim nga shumë vende, një ngjarje e vërtetë. Diagnostifikimi: inxhinieri i jep inteligjencës artificiale regjistrin e maskuar dhe metrikat e 20 minutave të fundit; Inteligjenca artificiale përcakton një afat kohor dhe shënon ngadalësimin që fillon menjëherë pas vendosjes në orën 02:08 - një korrelacion i fortë, por ende një hipotezë. Inxhinieri e konfirmon këtë me regjistrin e vendosjes: po, një lëshim u lëshua në orën 02:08. Përgjigja: reduktimi më i shpejtë është kthimi i shpërndarjes; Hapi i rikthimit në kërkesën për ndryshim është gati (Njësia 9). Inxhinieri fillimisht zbaton rikthimin në një server me logjikë kanarine, koha e përgjigjes përmirësohet dhe më pas e përhap atë. Zgjidhja e përhershme: shkaku i vërtetë rrënjësor (kërkesa e paindeksuar në versionin e ri) do të rregullohet me qetësi të nesërmen. Mësimi: Hartohet një post-mortem pa inteligjencë artificiale dhe hapi "monitorimi p99 pas vendosjes" i shtohet librit të ri. Në çdo fazë, AI u përshpejtua; njerëzore të vërtetuara në çdo pikë vendimi.

Rregulli i artë i ndarjes së punës Njerëz-AI

Dallimi që shihni në të gjithë modulin bëhet një rregull këtu: AI është përpara në pyetjet "çfarë po ndodh, çfarë mund të ndodhë, si të shkruhet"; Njerëzit janë përpara kur bëhet fjalë për pyetje të tilla si "a duhet ta bëj këtë tani, kush mund të garantojë për këtë?" Inteligjenca artificiale është e palodhur, e shpejtë, skanon informacione të gjera dhe gjeneron plane – por nuk njeh kontekstin e plotë, mund të prodhojë halucinacione, nuk mund të përballojë përgjegjësinë dhe nuk sheh varësitë e fshehura të organizatës suaj. Njeriu është i ngadalshëm, por mbart kontekst, përgjegjësi dhe gjykim. Rezultati më i mirë është në ndarjen e saktë të punës midis të dyjave: delegoni punë të përsëritura, tekstuale, të prodhuara tek AI; Mbani verifikimin, vendimin dhe ekzekutimin njerëzor.

tre mini kuti

Rasti 1 - 40 minuta nga fundi në fund. Në një ngjarje të plotë të diskut, një SRE përshpejtoi të gjithë zinxhirin me AI: konfirmoi alarmin me vijën bazë (5 min), e kishte përmbledhur regjistrin e maskuar në YZ dhe gjeti gabimin e parë (5 min), verifikoi hipotezën "rotacioni i regjistrave ndaloi" të AI në sistemin real (5 minuta), ekzekutoi dhe zbatoi një skemë të gatshme për pastrimin e postimit të shkruar dhe 10 min. verifikuar faktet (15 min). Gjithsej 40 minuta; Përafërsisht dy herë më shumë pa AI. Por kishte një hap verifikimi në çdo fazë.

Rasti 2 - Verifikimi i anashkaluar në një moment paniku. Një ekip tjetër nxitoi një prerje. Ai pranoi hipotezën e parë të shkakut rrënjësor të AI (një shërbim varësie) pa e verifikuar dhe rifilloi atë shërbim. Problemi nuk u rregullua sepse shkaku i vërtetë ishte diçka tjetër; Për më tepër, rindezja e panevojshme krijoi një ndërprerje të dytë. Mësimi: nxitimi nuk është justifikim për të anashkaluar verifikimin; Përpara se hipoteza e AI të konfirmohet, veprimi e përshkallëzon ngjarjen.

Rasti 3 - Të qenit i vetëdijshëm për kufirin. Një inxhinier ishte gati të zbatonte një ndryshim konfigurimi që AI kishte kërkuar për një çështje komplekse të rrjetit. Por ndryshimi dukej i pakthyeshëm dhe AI ​​nuk i dinte rregullat specifike të rrugëtimit të agjencisë. Inxhinieri ndaloi, u konsultua me një ekspert të lartë të rrjetit dhe mësoi se propozimi i AI do të krijonte një lak rutimi në këtë topologji të veçantë. Njohja e kufirit të AI parandaloi një ndërprerje.

Katër shabllone të kopjueshëm

1) Përmbledhja e nxitjes së ngjarjes (triazh):

Roli juaj: SRE i lartë, ndihmës komandant incidenti. Ka një ngjarje aktive. Sinjalizimi/metrika/regjistri i maskuar që ju jap më jep një klasifikim të shpejtë: (1) cila është simptoma, (2) cila është shtrirja e ndikimit, (3) 3 zona për t'u parë në fillim, (4) një komandë kontrolli vetëm për lexim për secilën. Vendimi dhe ekzekutimi është i imi; Dërgo rrugën. Të dhënat: [të maskuara]

2) Udhëzues për menaxhimin e incidentit me faza:

Më çoni hap pas hapi përmes ciklit jetësor të incidentit për simptomë [simptomë]: konfirmimi i zbulimit, diagnoza, zbutja, zgjidhja e përhershme, mësimi. Në çdo fazë, më tregoni (a) çfarë duhet të bëj, (b) kur mund t'ia delegoj atë në mënyrë të sigurt AI, (c) çfarë vendimi DUHET të marr vetë. Shënoni hapat e verifikimit që nuk duhet t'i kapërcej edhe nëse nxitoj.

3) Kontrolli i pikës së vendimit:

Jam në mes të një ngjarjeje dhe jam gati të ndërmarr veprimet e mëposhtme: [veprim]. Përpara zbatimit, më pyesni: (1) a është ky i kthyeshëm, (2) çfarë verifikimi kam bërë/nuk kam bërë, (3) a kam një plan rikthimi, (4) a kam prova që ky veprim ka zgjidhur në të vërtetë shkakun kryesor? Nëse shihni diçka që mungon, më ndaloni.

4) Mësimi i integruar pas ngjarjes:

Për incidentin e sapo zgjidhur, [përmbledhja] më jep: (1) një draft pas vdekjes pa faj, (2) 3 përmirësime të përhershme (monitorimi/automatizimi/konfigurimi) që do ta parandalojnë këtë incident, (3) hapat e librit të ri që duhet të përditësohen, (4) sugjerimin e sinjalit të hershëm të paralajmërimit për incident të ngjashëm. Shkrimi i shkakut rrënjësor pa prova; bazuar në fakte.

Prompt i dobët / Prompt i fortë

Njoftim i dobët:

Sistemi u rrëzua, çfarë duhet të bëj?

Në panik, pa kontekst dhe pa verifikim, kjo kërkesë merr këshilla gjenerike dhe ndoshta të rrezikshme nga AI. Nxitimi çon në gabime në këtë pikë më së shumti.

Njoftim i fuqishëm:

Roli juaj: ndihmës komandant incidenti. Ngjarja aktive: shërbimi i pagesësip99 koha e përgjigjes 15 herë bazë (250-400 ms) që nga ora 02:10. E di që ka pasur një shpërndarje në orën 02:08. Më jep: (1) hipotezën më të mundshme dhe si ta verifikoj atë VETËM PËR LEXUAR, (2) opsionin më të shpejtë dhe të Kthyeshëm të zbutjes, (3) rreziqet që duhet të kontrolloj përpara se të aplikoj këtë zbutje. Unë kam ekzekutimin dhe miratimin. Të dhëna shtesë: [metrik i maskuar/log]

faza e ngjarjes

Roli i AI

Vendim kritik njerëzor

zbulimi

Shënoni anomalinë

A është ngjarja aktuale, cili është qëllimi?

Diagnoza

gjenerimi i hipotezave

Cila hipotezë u vërtetua?

reduktim

Mos ofroni opsione

Cili reduktim është i kthyeshëm?

zgjidhje e përhershme

Drafti/skenari

Miratoni dhe ekzekutoni ndryshimin

Të mësuarit

Skicë pas vdekjes

Vërtetimi i fakteve dhe mësimeve

Gabimet e zakonshme

  • Anashkalimi i verifikimit në panik. Nxitimi nuk është justifikim për braktisjen e refleksit “lexo-verifiko-përgatit kthimin”; Ndërsa stresi rritet, disiplina duhet të rritet.
  • Gabimi i një hipoteze për provë. Marrja e veprimeve pa konfirmuar sugjerimin e parë të shkakut rrënjësor të AI do të përshkallëzojë incidentin.
  • Harrimi i kufirit të kontekstit të AI. AI nuk i njeh varësitë e fshehura të organizatës; Në ndryshimin kritik, gjykimi njerëzor mbizotëron.
  • Kapërcimi i fazës së të mësuarit. Ngjarja, pa përditësime post-mortem dhe runbook, fillon përsëri në të njëjtën natë.
  • Vënia e përgjegjësisë mbi AI. "UA tha kështu" nuk është një mbrojtje; Përgjegjësia për ekzekutimin i takon gjithmonë qenies njerëzore.
Kujdes: Përdorimi i AI në menaxhimin e incidenteve nuk zëvendëson menaxhimin e incidenteve të të mësuarit. Automjeti mund të përplaset, të përplaset ose të jetë i paarritshëm. Inxhinieri që di bazat është më i shpejtë me AI; Një inxhinier që nuk di bazat do të bëjë gabime më shpejt me AI. Fillimisht vendosni disiplinë, pastaj merrni shpejtësinë nga AI.

Në përmbledhje

Në botën reale, pjesët nuk vijnë një nga një por ndërthuren brenda një ngjarjeje. Kur menaxhon një ngjarje nga zbulimi tek mësimi, AI përshpejtohet në çdo fazë: shënon anomalinë, gjeneron hipoteza, ofron opsione, harton, përgatit pas vdekjes. Por në çdo pikë vendimi ndalet - konfirmon diagnozën, zgjedh të zvogëlojë, miraton ndryshimin, zotëron rezultatin. Rregulli i artë është i qartë: AI është përpara në pyetjet "çfarë ndodh, si të shkruajmë", dhe njerëzit janë përpara në pyetjet "a duhet ta bëj unë, kush është garantuesi?" Në kohë paniku, rrisni disiplinën, ndani hipotezën nga provat, mbani mend kufirin e kontekstit të AI dhe nxirrni një mësim nga çdo ngjarje. Thelbi i këtij moduli është një fjali: AI është një asistent i fuqishëm; Përgjegjësia inxhinierike nuk mund të delegohet.

Detyra e aplikimit

Konsideroni një ngjarje që keni përjetuar (ose imagjinuar) në të kaluarën tuaj, nga fillimi në fund. Me shabllonin "Udhëzues për menaxhimin e incidentit me faza" më sipër, kërkoni nga AI që ta drejtojë incidentin nëpër fazat e zbulimit-diagnostikimit-zbutjes-zgjidhjes-mësimit; Në çdo fazë, shkruani veçmas hapin që mund t'i delegoni AI dhe hapin që duhet të vendosni vetë. Konfirmoni të paktën një hipotezë të AI me një komandë verifikimi gjatë fazës së diagnostikimit. Së fundi, krijoni një draft të përditësimit pas vdekjes dhe të runbook me shabllonin "Mësimi i integruar pas ngjarjes". Përmblidhni ndarjen e punës njeri-AI në të gjithë procesin në 7 artikuj.

listë kontrolli

  • [ ] A e kam ndarë incidentin në fazat e zbulimit, diagnostikimit, zbutjes, zgjidhjes dhe mësimit?
  • [ ] A kam bërë dallimin midis hapave që mund t'i delegohen AI dhe atyre që kërkojnë vendimmarrje njerëzore në çdo fazë?
  • [ ] Në diagnozë, a e kam ndarë hipotezën e AI nga provat dhe e konfirmova atë me një komandë verifikimi?
  • [ ] A e kam vlerësuar zbutjen për sa i përket planit të kthyeshmërisë dhe rikthimit?
  • [ ] A e ruajta refleksin "lexo-verifiko-përgatit kthimin" edhe në kohë paniku?
  • [ ] A mësova një mësim pas vdekjes dhe një libër nga incidenti?

Provimi i Modulit

1. Cili nga sa vijon është pozicionimi më i saktë për inteligjencën artificiale në menaxhimin e sistemit dhe rrjetit?

  • A) Inteligjenca artificiale është një asistent dhe mjet mbështetës vendimesh; Përgjegjësia dhe miratimi përfundimtar i vendimeve kritike ekzekutive u takon njerëzve ✔
  • B) Inteligjenca artificiale mund të ekzekutojë komanda dhe të zbatojë ndryshime në prodhim pa miratimin e njeriut
  • C) Inteligjenca artificiale funksionon vetëm në shkrimin e tekstit, nuk ka të bëjë me punën e sistemit dhe rrjetit
  • D) Inteligjenca artificiale merr gjithmonë vendime më të sakta se njerëzit, ndaj verifikimi është i panevojshëm

Përshkrimi: Inteligjenca artificiale është një asistent dhe mjet mbështetës vendimesh që prodhon drafte dhe analiza të tilla si skriptet, analizat e regjistrave dhe dokumentet. Përgjegjësia dhe miratimi përfundimtar i vendimeve ekzekutive që ndikojnë në kohën e ndërprerjes, humbjen e të dhënave dhe sigurinë, si ekzekutimi i një komande ose miratimi i një ndryshimi, i takon inxhinierit kompetent.

2. Cilat janë katër hapat e refleksit të verifikimit që duhet të zbatohen përpara se të ekzekutohet një komandë e krijuar nga inteligjenca artificiale në prodhim?

  • A) Kopjo, ngjit, ekzekuto, shpreso
  • B) Lexoni dhe kuptoni, dokumentoni, provoni në një mjedis të izoluar, përgatituni për reagime ✔
  • C) Pëlqeje, shpërndaje, ruaj, arkivoj
  • D) Fshij, rishkruaj, ngjesh, dërgo

Përshkrimi: Katër hapa për t'u zbatuar në një dalje kritike: (1) lexoni dhe kuptoni vijën pas rreshtit të komandës, (2) lidhni flamujt dhe sintaksën me dokumentacionin zyrtar, (3) provojeni në një mjedis të izoluar/testues, ekzekutoni në të thatë nëse është e mundur, (4) përgatitni një plan kthimi (rezervë, fotografi) nëse shkon keq.

3. Çfarë do të thotë që një skenar automatizimi të jetë 'idempotent' dhe pse është i rëndësishëm?

  • A) Skripti prodhon rezultate të ndryshme në çdo ekzekutim
  • B) Skripti mund të ekzekutohet vetëm një herë dhe më pas të fshihet
  • C) Skenari nuk shkakton ndonjë dëm kur ekzekutohet për herë të dytë; ✔ I sigurt edhe nëse aktivizohet përsëri
  • D) Skripti nuk përmban menaxhimin e gabimeve

Shpjegim: Idempotenca do të thotë që kur i njëjti skript ekzekutohet dy ose më shumë herë, ai nuk shkakton dëme ose nuk prodhon gabime në ekzekutimin e dytë. Logjika të tilla si 'kaloni nëse përdoruesi ekziston tashmë', 'krijo direktoriumin nëse nuk ekziston, mos e prek nëse ekziston' vendoset. Kjo siguron që automatizimi të funksionojë në mënyrë të sigurt edhe nëse aktivizohet përsëri aksidentalisht.

4. Cila është mënyra më themelore për të siguruar një skript që përmban operacione shkatërruese (fshirje, rinisje)?

  • A) Ekzekutoni skenarin sa më shpejt që të jetë e mundur
  • B) Fshehja e mesazheve të gabimit
  • C) Testimi i skenarit direkt në prodhim
  • D) Vendosja e operacioneve shkatërruese pas funksionimit të paracaktuar të thatë dhe lidhja e zbatimit aktual me një shenjë të qartë ✔

Shpjegim: Mbajtja e proceseve shkatërruese në modalitetin e ekzekutimit të thatë si parazgjedhje dhe ekzekutimi i aplikacionit aktual vetëm me një flamur të qartë miratimi (p.sh. --aplikoni) ju lejon të shihni fillimisht se çfarë do të ndodhë kur skripti të ekzekutohet. Gjithashtu kontrollimi i ndryshores null (VAR:?) parandalon gabimet e rrugës.

5. Çfarë do të thotë parimi i 'korrelacionit nuk është shkakësi' në analizën log?

  • A) Dy ngjarje që ndryshojnë së bashku nuk janë domosdoshmërisht në një marrëdhënie shkak-pasojë; Duhet verifikuar edhe shkakësia ✔
  • B) Kërkimi i korrelacionit në regjistrat është humbje kohe
  • C) Nga dy ngjarje që ndryshojnë së bashku, njëra është padyshim shkaku i tjetrës.
  • D) Kauzaliteti mund të përcaktohet vetëm nga inteligjenca artificiale

Shpjegimi: Vetëm për shkak se dy ngjarje ndodhin në të njëjtën kohë (korrelacion) nuk do të thotë se njëra shkakton tjetrën (shkakësinë); Të dyja mund të jenë rezultat i një ngjarjeje të tretë. Sugjerimi i AI se 'X ndoshta shkaktoi Y' është një hipotezë dhe nuk konsiderohet një gjetje derisa të verifikohet në sistem.

6. Pse përqindja (p95/p99) preferohet mbi mesataren kur matet koha e përgjigjes në monitorimin e performancës?

  • A) Përqindja është më e lehtë për t'u llogaritur se mesatarja
  • B) Mesatarja fsheh përvojën e keqe të pakicës; përqindja zbulon këto probleme të fshehura ✔
  • C) Mesatarja është gjithmonë e gabuar dhe nuk duhet përdorur
  • D) Përqindja vlen vetëm për metrikat e CPU

Shpjegim: Mesatarja fsheh përvojën shumë të keqe që kanë një pjesë të vogël të përdoruesve. Edhe pse mesatarja duket të jetë 200 ms, p99 mund të jetë 6 sekonda; Kjo do të thotë se një në çdo njëqind kërkesa është tmerrësisht e ngadaltë. Përqindja e bën të dukshme dhimbjen e këtij minoriteti që fshihet nga mesatarja.

7. Çfarë është 'drift' në menaxhimin e konfigurimit dhe pse është i rrezikshëm?

  • A) Trafiku i rrjetit bie natën
  • B) Zhvendosja fizike e një serveri
  • C) Serverët devijojnë nga njëri-tjetri dhe standardi me kalimin e kohës; ✔ I padukshëm derisa të shfaqet një problem
  • D) Rezervimi automatik i skedarëve të konfigurimit

Përshkrimi: Drift është devijimi i serverëve nga njëri-tjetri dhe nga standardi përmes ndryshimeve manuale të padokumentuara me kalimin e kohës. Rreziku i tij është heshtja e tij: nuk është i dukshëm derisa të shfaqet problemi, atëherë një server sillet ndryshe nga të tjerët dhe diagnoza kërkon orë të tëra. AI e bën lëvizjen të dukshme në krahasim; Parimi i saldimit të arit parandalon.

8. Pse hapi 'plan' është parmaku më jetik i sigurisë në mjetet IaC (si Terraform)?

  • A) Plani e ekzekuton kodin më shpejt
  • B) Fshin skedarin e gjendjes së planit
  • C) Plani rregullon vetëm formatimin e kodit
  • D) Plani tregon se çfarë do të shtohet, ndryshohet dhe fshihet përpara zbatimit; Parandalon humbjen e të dhënave ✔

Përshkrimi: Plani (plani terraform / ansible --kontrolli) jep një pamje paraprake 'çfarë do të ndryshojë' përpara ekzekutimit të kodit: sa burime do të shtohen, ndryshohen, fshihen. Në veçanti, linjat "shkatërrim" dhe "zëvendësimi i forcës" tregojnë rrezikun e humbjes së të dhënave përpara zbatimit. Aplikimi pa lexuar planin është një nga gabimet më të shtrenjta.

9. Pse skedari shtetëror Terraform duhet të mbrohet me kujdes dhe të mos ngjitet në AI ose në depo të hapura?

  • A) Sekretet e tekstit të thjeshtë mund të përfshihen në dosjen shtetërore; Nëse zbulohet, informacioni i identitetit do të zbulohet ✔
  • B) Sepse dosja e shtetit është shumë e madhe
  • C) Skedari i gjendjes tashmë është i koduar në mënyrë të palexueshme.
  • D) Kodi funksionon më shpejt kur ndahet skedari shtetëror

Përshkrimi: Skedari i shtetit ruan gjendjen aktuale të infrastrukturës së menaxhuar dhe mund të përfshijë sekrete të tekstit të thjeshtë (fjalëkalimet e bazës së të dhënave, çelësat). Prandaj, ai duhet të mbahet në një prapavijë të largët të enkriptuar, të kufizuar me akses dhe të kyçur; Asnjëherë nuk duhet të vendoset në një automjet publik ose depo, përndryshe sekreti do të rrjedhë.

10. Çfarë thekson në dokumentacion thënia 'një libër i gabuar është më i rrezikshëm se jo'?

  • A) Shkrimi i një libri është humbje kohe
  • B) Një runbook i patestuar zbatohet verbërisht në një krizë; Një hap i gabuar mund të çojë në fatkeqësi ✔
  • C) Runbooks janë shkruar vetëm për administratorët
  • D) Dokumentacioni nuk duhet të përditësohet kurrë

Shpjegim: Një skuadër pa një konkurs është e kujdesshme dhe e dyshimtë gjatë një krize; por personi me një libër 'zyrtar' e zbaton atë nën stres pa pyetur. Nëse runbook nuk është testuar dhe ka një hap të gabuar, zbatimi i verbër do të çojë në katastrofë. Kjo është arsyeja pse çdo runbook duhet të testohet tërësisht dhe të stampohet në një mjedis real.

11. Në mirëmbajtjen parashikuese, cila është qasja e saktë për të kuptuar kur një disku po i afrohet dështimit?

  • A) Zëvendësoni menjëherë një disk të vetëm të keq SMART
  • B) Injorimi i plotë i të dhënave SMART
  • C) Shikimi i trendit të vlerave në kohë; ✔ Numri i sinjaleve të rritjes së vazhdueshme dhe të përshpejtuar
  • D) Marrja e veprimeve vetëm pasi disku të jetë shembur plotësisht

Shpjegim: Një lexim i vetëm i keq SMART nuk është shkak për panik; Është normale që disqet të korrigjohen herë pas here gabimet. Sinjali real është tendenca: rritja konsistente dhe përshpejtuese e vlerave të tilla si sektori i rialokuar me kalimin e kohës. Kjo është arsyeja pse AI-së i jepet një seri kohore, jo një lexim i vetëm.

12. Cilat janë dy pjesët më të anashkaluara, por kritike të një ndryshimi prodhimi?

  • A) Ngjyra dhe emri i ndryshimit
  • B) Titulli dhe departamenti i personit që bën ndryshimin
  • C) Njoftimi i ndryshimit në rrjetet sociale
  • D) Plani i rikthimit dhe kriteret e verifikimit të suksesit ✔

Shpjegim: Nëse nuk ka përgjigje me shkrim për pyetjet "si saktësisht të rikthehem nëse shkon keq" (plani i rikthimit) dhe "si ta provoj se është i suksesshëm" (kriteret e verifikimit të suksesit) përpara se të zbatohet një ndryshim, ai ndryshim nuk është ende gati. Pa këto dy, një ndryshim i prishur mund të konsiderohet 'i plotë'.

13. Pse preferohet qasja 'kanare' në vend që të hapet një vendosje sigurie (versioni/patch i ri) në të gjithë serverët në të njëjtën kohë?

  • A) Ndryshimi aplikohet fillimisht në një pjesë të vogël; Një defekt prek një pjesë të vogël, jo të gjithë flotën, dhe kapet herët ✔
  • B) Shpërndarja Kanarie konsumon më pak energji elektrike
  • C) Canary e bën verifikimin e vendosjes krejtësisht të panevojshëm
  • D) Dislokimi i Kanareve zbatohet vetëm për bazat e të dhënave

Përshkrimi: Vendosja e Canary po aplikon ndryshimin në një pjesë të vogël (një server, 5% e përdoruesve) së pari dhe monitoron. Në këtë mënyrë, një defekt prek një pjesë të vogël, jo të gjithë flotën, dhe kapet herët. Një gabim që përhapet menjëherë godet të gjithë përdoruesit në të njëjtën kohë.

14. Cili është rregulli etik dhe ligjor i pandryshueshëm gjatë përdorimit të inteligjencës artificiale në punën e sigurisë?

  • A) Inteligjenca artificiale mund të përdoret lirisht për të skanuar për dobësi në çdo sistem
  • B) Kodi i etikës vlen vetëm për institucionet e mëdha
  • C) Përdoret vetëm në sisteme të autorizuara dhe për qëllime mbrojtjeje; Përdorimi për akses ose sulm të paautorizuar është krim ✔
  • D) Është falas të depërtosh në sistemin e dikujt tjetër për të mësuar.

Përshkrimi: Informacioni i sistemit dhe i rrjetit është me përdorim të dyfishtë. Inteligjenca artificiale mund të përdoret vetëm në sistemet për të cilat ju keni autorizim me shkrim dhe për qëllime mbrojtëse (zbulimi i kërcënimit në regjistër, forcimi, reagimi ndaj incidentit). Përdorimi i tij për të skanuar ose për të infiltruar një sistem që nuk ju përket është akses i paautorizuar dhe krim; Për të mësuar duhet të përdoret një laborator i izoluar.