Vienība 11 / 11

Pilnīga integrācija: negadījuma pārvaldība no sākuma līdz beigām

Ieguvumi:

  • Negadījuma pilnīga pārvaldība ar mākslīgā intelekta atbalstu atklāšanas, diagnostikas, mazināšanas, pastāvīga risinājuma un mācīšanās posmos
  • Spēja saglabāt verifikācijas disciplīnu pat panikas laikā, nodalot soļus, ko var pārnest uz mākslīgo intelektu, un tos, kuriem katrā posmā nepieciešams cilvēka lēmums.
  • Spēja pārvērst zelta likumu, ka mākslīgajam intelektam ir virsroka pār jautājumiem “kas notiek, kā rakstīt”, un cilvēkiem ir prioritāte pār jautājumiem “vai man tas jādara, kurš ir garants” – biznesa refleksā

Pilnīga integrācija: incidenta pārvaldīšana no gala līdz galam, izmantojot AI

Jūs iemācījāties iepriekšējās desmit daļās: skriptu veidošana, žurnālu analīze, uzraudzība, konfigurēšana, IaC, dokumentācija, paredzamā apkope, izmaiņu pārvaldība un drošība. Taču reālajā pasaulē šīs daļas nenāk pa vienai, bet ir savītas notikuma ietvaros. Šajā pēdējā daļā mēs apkopojam detaļas: jūs pilnībā redzēsit, kā pārvaldīt incidentu, kas sākās nakts vidū, no gala līdz galam, no atklāšanas līdz pamatcēloņiem, no novēršanas līdz dokumentācijai un izmantojot pareizo AI devu katrā posmā. Mērķis nav iemācīt jaunu tehniku; sasaistot to, ko esat iemācījušies kā inženiera refleksu, nostiprinot vienu patiesību, kas tiek atkārtota visā modulī: AI paātrina, izgaismo un plāno katrā posmā; bet cilvēks vienmēr ir tas, kurš apstiprina diagnozi, izpilda komandu, apstiprina izmaiņas un uzņemas atbildību par rezultātu.

Šajā nodaļā, izmantojot piemēru, jūs integrēsit incidenta dzīves ciklu — atklāšanu, diagnostiku, iejaukšanos, atrisināšanu, mācīšanos — un AI lomu un robežas katrā posmā.

Notikuma dzīves cikls

Katrs nopietns incidents iziet cauri līdzīgiem posmiem, un AI katrā posmā ir atšķirīga loma. Atklāšana: atskan trauksmes signāls, lietotājs sūdzas, metrika atšķiras no bāzes līnijas (4. vienība). Validācija un darbības joma: vai tā patiešām ir problēma, cik tā ir plaša? Diagnoze: pamatcēloņa nokļūšana, izmantojot žurnālus un metriku (3. nodaļa). Reakcija un mazināšana: bojājumu apturēšana, risinājums. Pastāvīgs risinājums: labojiet, izmantojot izmaiņu pārvaldību (9. nodaļa), skriptu (2. nodaļa) vai konfigurāciju, ja nepieciešams (5. nodaļa). Mācības: pēcnāves un rokasgrāmatas atjaunināšana (7. nodaļa). AI iezīmē anomāliju noteikšanā, izvirza hipotēzes diagnostikā, piedāvā intervences iespējas, raksta risinājuma uzmetumus, sagatavo dokumentus mācībās, taču katrā posmā cilvēki ir pie lēmuma pieņemšanas punkta.

Padoms: visbīstamākais incidenta brīdis ir diagnozes noteikšanas un reakcijas brīdis, kad stress ir vislielākais – tieši tad, kad vēlme akli uzticēties AI ir visspēcīgākā. Jo vairāk jūs steidzaties, jo ciešāk turaties pie refleksa "lasīt, pārbaudīt, sagatavoties atgriešanai". Viena panikas brīdī izlaista pārbaude dubulto notikumu.

Piemērs no sākuma līdz beigām

Konkrētu. Trauksme 02:10: maksājumu pakalpojuma p99 reakcijas laiks ir 6 sekundes, krietni virs bāzes līnijas (250–400 ms). Pareiza noteikšana: izsekošana darbojās. Apstiprinājums: apstiprinājums no vairākām vietām, reāls notikums. Diagnostika: inženieris sniedz AI maskētu žurnālu un pēdējo 20 minūšu metriku; AI nosaka laika grafiku un atzīmē, ka palēninājums sākas tūlīt pēc izvietošanas plkst. 02:08 — spēcīga korelācija, bet joprojām ir hipotēze. Inženieris to apstiprina ar izvietošanas žurnālu: jā, izlaidums tika izlaists plkst. 02:08. Atbilde: ātrākais samazinājums ir izplatīšanas atcelšana; Atcelšanas darbība izmaiņu pieprasījumā ir gatava (9. vienība). Inženieris vispirms ievieš atcelšanu serverī ar kanāriju loģiku, uzlabojas reakcijas laiks un pēc tam to izplata. Pastāvīgs risinājums: īstais cēlonis (jaunajā versijā neindeksēts vaicājums) tiks mierīgi novērsts nākamajā dienā. Mācīšanās: tiek izstrādāts pēcnāves pētījums bez mākslīgā intelekta, un izpildgrāmatai tiek pievienota darbība “p99 uzraudzība pēc izvietošanas”. Katrā posmā AI paātrinājās; cilvēks apstiprināts katrā lēmuma pieņemšanas punktā.

Cilvēka un mākslīgā intelekta darba dalīšanas zelta likums

Atšķirība, ko redzat visā modulī, šeit kļūst par noteikumu: AI ir priekšā jautājumos "kas notiek, kas var notikt, kā rakstīt"; Cilvēki ir priekšā, kad runa ir par tādiem jautājumiem kā "vai man tas jādara tagad, kas par to var galvot?" AI ir nenogurstošs, ātrs, skenē plašu informāciju un ģenerē projektus, taču tas nezina pilnu kontekstu, var izraisīt halucinācijas, nespēj uzņemties atbildību un neredz jūsu organizācijas slēptās atkarības. Cilvēks ir lēns, bet nes kontekstu, atbildību un spriedumu. Labākais rezultāts ir pareiza darba sadale starp abiem: deleģēt atkārtotu, tekstuālu, producējamu darbu AI; Pārbaudi, lēmumu pieņemšanu un izpildi saglabājiet cilvēku.

trīs mini futrāļi

1. gadījums — 40 minūtes no beigām līdz beigām. Diska pilna notikuma gadījumā SRE paātrināja visu ķēdi ar AI: apstiprināja trauksmi ar bāzes līniju (5 min), lika maskētajam žurnālam apkopot YZ un atrada pirmo kļūdu (5 min), pārbaudīja AI hipotēzi “žurnāla rotācija ir apturēta” reālajā sistēmā (5 min), palaida un ieviesa gatavu tīrīšanas skriptu ar sauso palaišanu, AIch tika pārbaudīts un pēc tam tika pārbaudīts postmor (10 minūtes). fakti (15 min). Kopā 40 minūtes; Aptuveni divreiz vairāk bez AI. Bet katrā posmā bija verifikācijas posms.

2. gadījums — panikas brīdī izlaista pārbaude. Cita komanda steidzās samazināt. Tā pieņēma AI pirmo pamatcēloņa hipotēzi (atkarības pakalpojumu), nepārbaudot to, un restartēja šo pakalpojumu. Problēma netika novērsta, jo patiesais cēlonis bija kaut kas cits; Turklāt nevajadzīgā atsāknēšana radīja otru pārtraukumu. Nodarbība: steiga nav attaisnojums pārbaudes izlaišanai; Pirms AI hipotēzes apstiprināšanas darbība saasina notikumu.

3. gadījums — ierobežojumu apzināšanās. Inženieris gatavojās ieviest konfigurācijas izmaiņas, ko AI bija mudinājusi saistībā ar sarežģītu tīkla problēmu. Taču izmaiņas šķita neatgriezeniskas, un AI nezināja aģentūras īpašos maršrutēšanas noteikumus. Inženieris apstājās, konsultējās ar vecāko tīkla ekspertu un uzzināja, ka AI priekšlikums radīs maršrutēšanas cilpu šajā konkrētajā topoloģijā. Zinot AI ierobežojumu, tika novērsti traucējumi.

Četras kopējamas veidnes

1) Notikuma aktivizētāja kopsavilkums (šķirošana):

Jūsu loma: vecākais SRE, incidentu komandiera palīgs. Notiek aktīvs pasākums. Maskētais brīdinājums/metrika/žurnāls, ko es jums sniedzu, sniedz man ātru kategoriju: (1) kāds ir simptoms, (2) kāds ir ietekmes apjoms, (3) 3 apgabali, kas vispirms jāapskata, (4) tikai lasāma vadības komanda katram. Lēmums un izpilde ir mans; Sūti ceļu. Dati: [maskēts]

2) Pakāpeniskas incidentu pārvaldības rokasgrāmata:

Soli pa solim apskatiet simptoma [simptoma] incidenta dzīves ciklu: noteikšanas apstiprinājums, diagnoze, mazināšana, pastāvīga atrisināšana, mācīšanās. KATRĀ posmā pastāstiet man (a) kas man jādara, (b) kad es varu droši deleģēt to AI, (c) kāds lēmums man ir jāpieņem pašam. Atzīmējiet verifikācijas darbības, kuras nevajadzētu izlaist, pat ja es steidzos.

3) Lēmuma punkta kontrole:

Es esmu notikuma vidū un gatavojos veikt šādu darbību: [darbība]. Pirms ieviešanas pajautājiet man: (1) vai tas ir atgriezenisks, (2) kādu verifikāciju es veicu/neveicu, (3) vai man ir atcelšanas plāns, (4) vai man ir pierādījumi, ka šī darbība patiešām novērsa galveno cēloni? Ja redzat, ka kaut kā trūkst, pārtrauciet mani.

4) Integrētā mācīšanās pēc pasākuma:

Tikko atrisinātajam incidentam [kopsavilkums] sniedz: (1) pēcnāves uzmetumu bez vainas, (2) 3 pastāvīgus uzlabojumus (uzraudzība/automatizācija/konfigurācija), kas novērsīs šo incidentu, (3) izpildgrāmatas darbības, kas ir jāatjaunina, (4) agrā brīdinājuma signāla ieteikums līdzīgam incidentam. Rakstīt pamatcēloņu bez pierādījumiem; pamatojoties uz faktiem.

Vāja uzvedne / spēcīga uzvedne

Vāja uzvedne:

Sistēma avarēja, kas man jādara?

Panikā, bez konteksta un bez pārbaudes, šī uzvedne saņem vispārīgus un, iespējams, bīstamus padomus no AI. Steigāšana šajā brīdī noved pie kļūdām visvairāk.

Spēcīga uzvedne:

Jūsu loma: incidentu komandiera palīgs. Aktīvs notikums: maksājuma serviceip99 reakcijas laiks 15 reizes salīdzinājumā ar sākotnējo līmeni (250–400 ms) kopš plkst. 02:10. Es zinu, ka 02:08 notika izplatīšana. Sniedziet man: (1) visticamāko hipotēzi un to, kā to pārbaudīt TIKAI LASĪT, (2) ātrāko un ATgriezeniskāko mazināšanas iespēju, (3) riskus, kas man jākontrolē pirms šīs mazināšanas piemērošanas. Man ir izpilde un apstiprinājums. Papildu dati: [maskēta metrika/žurnāls]

notikuma fāze

AI loma

Kritisks cilvēka lēmums

atklāšana

Atzīmējiet anomāliju

Vai tas ir faktiskais notikums, kāds ir apjoms?

Diagnoze

hipotēžu ģenerēšana

Kura hipotēze tika apstiprināta?

samazināšana

Nepiedāvājiet iespējas

Kurš samazinājums ir atgriezenisks?

pastāvīgs risinājums

Melnraksts/skripts

Apstipriniet un izpildiet izmaiņas

Mācīšanās

Pēcnāves skice

Faktu un mācību apstiprināšana

Biežas kļūdas

  • Pārbaudes izlaišana panikā. Steigšanās nav attaisnojums, lai atteiktos no refleksa “lasīt-pārbaudīt-sagatavot atgriešanos”; Pieaugot stresam, jāpalielina disciplīna.
  • Hipotēzes maldināšana par pierādījumu. Ja veiksit darbības, neapstiprinot AI pirmo pamatcēloņa ieteikumu, incidents saasināsies.
  • Aizmirstot AI konteksta robežu. AI nezina organizācijas slēptās atkarības; Kritiskās pārmaiņās cilvēka spriedums ņem virsroku.
  • Mācību fāzes izlaišana. Pasākums bez pēcnāves un runbook atjauninājumiem sākas no jauna tajā pašā vakarā.
  • Atbildības uzlikšana AI. “AI teica tā” nav aizsardzība; Atbildība par izpildi vienmēr gulstas uz cilvēku.
Uzmanību: AI izmantošana incidentu pārvaldībā neaizstāj mācību incidentu pārvaldību. Transportlīdzeklis var avarēt, sadurties vai būt nepieejams. Inženieris, kurš zina pamatus, ir ātrāks ar AI; Inženieris, kurš nezina pamatus, ar AI kļūdīsies ātrāk. Vispirms izveidojiet disciplīnu, pēc tam iegūstiet ātrumu no AI.

Rezumējot

Reālajā pasaulē daļas nenāk pa vienai, bet ir savītas notikuma ietvaros. Pārvaldot notikumu no atklāšanas līdz mācīšanās procesam, AI paātrinās katrā posmā: atzīmē anomāliju, ģenerē hipotēzes, piedāvā iespējas, uzmet, sagatavo pēcnāves. Bet katrā lēmuma pieņemšanas brīdī cilvēks apstājas – apstiprina diagnozi, izvēlas samazināt, apstiprina izmaiņas, pieder iznākums. Zelta likums ir skaidrs: AI ir priekšā jautājumos "kas notiek, kā rakstīt", un cilvēki ir priekšā jautājumos "vai man tas jādara, kas ir garants?" Panikas laikā pastipriniet disciplīnu, atdaliet hipotēzes no pierādījumiem, atcerieties AI konteksta ierobežojumu un no katra notikuma smeļieties no rokasgrāmatas. Šī moduļa būtība ir viens teikums: AI ir spēcīgs palīgs; Inženiertehnisko atbildību nevar deleģēt.

Lietojumprogrammas uzdevums

Apsveriet notikumu, kuru piedzīvojāt (vai iedomājāties) savā pagātnē, no sākuma līdz beigām. Izmantojot iepriekš redzamo veidni “Pakāpeniska incidentu pārvaldības rokasgrāmata”, lūdziet AI vadīt incidentu, izmantojot atklāšanas-diagnostikas-mīkstināšanas-risināšanas-mācīšanās posmus; Katrā posmā atsevišķi uzrakstiet soli, ko varat deleģēt AI, un soli, kas jums jāizlemj pats. Diagnozes fāzē apstipriniet vismaz vienu AI hipotēzi ar pārbaudes komandu. Visbeidzot, izveidojiet pēcnāves un izpildgrāmatas atjaunināšanas melnrakstu, izmantojot veidni “Integrētā mācīšanās pēc notikuma”. Apkopojiet cilvēka un mākslīgā intelekta darba dalīšanu visā procesā 7 pozīcijās.

kontrolsaraksts

  • [ ] Vai esmu sadalījis incidentu atklāšanas, diagnostikas, mazināšanas, risināšanas un mācīšanās posmos?
  • [ ] Vai esmu nošķīris soļus, ko var deleģēt AI, no tiem, kuriem katrā posmā ir jāpieņem lēmums?
  • [ ] Vai diagnozē es atdalīju AI hipotēzi no pierādījumiem un apstiprināju to ar pārbaudes komandu?
  • [ ] Vai esmu novērtējis seku mazināšanu attiecībā uz atgriezeniskumu un atcelšanas plānu?
  • [ ] Vai es saglabāju refleksu "lasīt-pārbaudīt-sagatavot atgriešanos" pat panikas laikā?
  • [ ] Vai no incidenta es mācījos pēcnāves un runbook mācību?

Moduļa eksāmens

1. Kura no šīm ir visprecīzākā mākslīgā intelekta pozicionēšana sistēmu un tīklu pārvaldībā?

  • A) Mākslīgais intelekts ir palīgs un lēmumu atbalsta instruments; Atbildība un kritisku izpildvaras lēmumu galīgā apstiprināšana gulstas uz cilvēkiem ✔
  • B) Mākslīgais intelekts var palaist komandas un ieviest izmaiņas ražošanā bez cilvēka apstiprinājuma
  • C) Mākslīgais intelekts darbojas tikai teksta rakstīšanā, tam nav nekāda sakara ar sistēmas un tīkla darbu
  • D) Mākslīgais intelekts vienmēr pieņem precīzākus lēmumus nekā cilvēki, tāpēc pārbaude nav nepieciešama

Apraksts: Mākslīgais intelekts ir palīgs un lēmumu atbalsta rīks, kas veido melnrakstus un analīzi, piemēram, skriptus, žurnālu analīzi un dokumentus. Atbildība un galīgā apstiprināšana par izpildvaras lēmumiem, kas ietekmē dīkstāvi, datu zudumu un drošību, piemēram, komandas izpilde vai izmaiņu apstiprināšana, pieder kompetentajam inženierim.

2. Kādi ir četri verifikācijas refleksa soļi, kas jāīsteno pirms mākslīgā intelekta ģenerētas komandas palaišanas ražošanā?

  • A) Kopēt, ielīmēt, palaist, cerēt
  • B) Lasīt un saprast, dokumentēt, izmēģināt izolētā vidē, sagatavoties atsauksmēm ✔
  • C) Patīk, kopīgot, saglabāt, arhivēt
  • D) Dzēst, pārrakstīt, saspiest, nosūtīt

Apraksts: Četras darbības, kas jāpiemēro kritiskai izvadei: (1) izlasiet un izprotiet komandrindu pa rindiņai, (2) saistiet karogus un sintaksi ar oficiālo dokumentāciju, (3) izmēģiniet to izolētā/pārbaudes vidē, ja iespējams, veiciet sauso darbību, (4) sagatavojiet rezerves plānu (dublējums, momentuzņēmums), ja tas noiet greizi.

3. Ko nozīmē, ka automatizācijas skripts ir "idempotents" un kāpēc tas ir svarīgi?

  • A) Skripts katrā izpildē rada dažādus rezultātus
  • B) Skriptu var palaist tikai vienu reizi un pēc tam dzēst
  • C) skripts, palaižot otrreiz, nerada nekādu kaitējumu; ✔ Drošs pat tad, ja tas atkal tiek aktivizēts
  • D) Skripts nesatur kļūdu pārvaldību

Paskaidrojums: Idempotence nozīmē, ka, palaižot vienu un to pašu skriptu divas vai vairāk reizes, tas neizraisa bojājumus vai neizraisa kļūdas otrajā izpildē. Tiek izveidota loģika, piemēram, “izlaist, ja lietotājs jau pastāv”, “izveidot direktoriju, ja tas neeksistē, nepieskarieties tam, ja tas pastāv”. Tas nodrošina, ka automatizācija darbojas droši pat tad, ja tā tiek nejauši iedarbināta vēlreiz.

4. Kāds ir visvienkāršākais veids, kā nodrošināt skriptu, kas satur destruktīvas darbības (dzēšana, restartēšana)?

  • A) Palaidiet skriptu pēc iespējas ātrāk
  • B) Kļūdu ziņojumu slēpšana
  • C) Skripta testēšana tieši ražošanā
  • D) destruktīvu darbību atstāšana aiz noklusējuma sausās darbības un faktiskās ieviešanas saistīšana ar skaidru atzīmi ✔

Paskaidrojums: Ja destruktīvie procesi tiek turēti sausās palaišanas režīmā pēc noklusējuma un tiek palaists tikai faktiskā lietojumprogramma ar skaidru apstiprinājuma karogu (piem., --apply), vispirms varat redzēt, kas notiks, kad skripts tiks palaists. Arī nulles mainīgā pārbaude (VAR:?) novērš ceļa kļūdas.

5. Ko log analīzē nozīmē princips “korelācija nav cēloņsakarība”?

  • A) divi notikumi, kas mainās kopā, ne vienmēr ir cēloņsakarības; Jāpārbauda arī cēloņsakarība ✔
  • B) Korelācijas meklēšana žurnālos ir laika izšķiešana
  • C) No diviem notikumiem, kas mainās kopā, viens noteikti ir iemesls otram.
  • D) Cēloņsakarību var noteikt tikai mākslīgais intelekts

Paskaidrojums: Tas, ka divi notikumi notiek vienlaikus (korelācija), nenozīmē, ka viens izraisa otru (cēloņsakarība); Abi var būt trešā notikuma rezultāts. AI ierosinājums, ka “X, iespējams, izraisīja Y”, ir hipotēze un netiek uzskatīts par atradumu, kamēr tas nav pārbaudīts sistēmā.

6. Kāpēc, mērot reakcijas laiku veiktspējas uzraudzībā, priekšroka tiek dota procentilei (p95/p99) salīdzinājumā ar vidējo?

  • A) Procentili ir vieglāk aprēķināt nekā vidējo
  • B) Vidējais slēpj mazākuma slikto pieredzi; procentile atklāj šīs slēptās problēmas ✔
  • C) Vidējais rādītājs vienmēr ir nepareizs, un to nevajadzētu izmantot
  • D) Procentile attiecas tikai uz CPU metriku

Paskaidrojums: Vidējais slēpj ļoti slikto pieredzi, kas ir nelielai lietotāju daļai. Lai gan šķiet, ka vidējais rādītājs ir 200 ms, p99 var būt 6 sekundes; Tas nozīmē, ka viens no simts pieprasījumiem ir šausmīgi lēns. Percentile padara redzamu šīs mazākuma sāpes, ko slēpj vidējais rādītājs.

7. Kas ir “drift” konfigurācijas pārvaldībā un kāpēc tas ir bīstams?

  • A) Tīkla trafiks samazinās naktī
  • B) Servera fiziska pārvietošana
  • C) Serveri laika gaitā atšķiras viens no otra un standarta; ✔ Neredzams, līdz rodas problēma
  • D) Automātiska konfigurācijas failu dublēšana

Apraksts: novirze ir serveru novirze viens no otra un no standarta, laika gaitā veicot nedokumentētas manuālas izmaiņas. Tā bīstamība ir tā klusums: tas nav redzams, līdz rodas problēma, tad viens serveris uzvedas savādāk nekā citi, un diagnostika prasa stundas. AI padara dreifēšanu redzamu salīdzinājumā; Zelta metināšanas princips novērš.

8. Kāpēc “plāna” solis ir vissvarīgākais drošības margas IaC rīkos (piemēram, Terraform)?

  • A) Plāns palaiž kodu ātrāk
  • B) Izdzēš plāna stāvokļa failu
  • C) Plāns nosaka tikai koda formatējumu
  • D) plāns parāda, kas tiks pievienots, mainīts un dzēsts pirms ieviešanas; Novērš datu zudumu ✔

Apraksts: plāns (terraform plan / ansible --check) pirms koda izpildes sniedz priekšskatījumu "kas mainīsies": cik daudz resursu tiks pievienots, mainīts, dzēsts. Jo īpaši rindas “iznīcināt” un “piespiest nomainīt” norāda uz datu zaudēšanas risku pirms ieviešanas. Pieteikšanās, neizlasot plānu, ir viena no dārgākajām kļūdām.

9. Kāpēc Terraform statusa fails ir rūpīgi jāaizsargā, nevis jāielīmē AI vai atvērtos krātuvēs?

  • A) Valsts lietā var tikt iekļauti teksta noslēpumi; Ja tiks nopludināta, identitātes informācija tiks atklāta ✔
  • B) Jo valsts fails ir pārāk liels
  • C) Stāvokļa fails jau ir nesalasāmi šifrēts.
  • D) Kods darbojas ātrāk, kad tiek koplietots stāvokļa fails

Apraksts: State fails saglabā pašreizējo pārvaldītās infrastruktūras stāvokli un var ietvert vienkārša teksta noslēpumus (datu bāzes paroles, atslēgas). Tāpēc tas ir jāglabā šifrētā, ierobežotas piekļuves, bloķētā attālā aizmugursistēmā; To nekādā gadījumā nedrīkst novietot sabiedriskajā transportlīdzeklī vai krātuvē, pretējā gadījumā noslēpums noplūdīs.

10. Ko dokumentācijā akcentē apgalvojums “nepareizs runbook ir bīstamāks nekā bez runbook”?

  • A) Runbook rakstīšana ir laika izšķiešana
  • B) nepārbaudīts runbook tiek akli ieviests krīzes apstākļos; Viens nepareizs solis var izraisīt katastrofu ✔
  • C) Runbooks ir paredzēts tikai administratoriem
  • D) Dokumentāciju nekad nevajadzētu atjaunināt

Paskaidrojums: komanda bez rokasgrāmatas krīzes laikā ir piesardzīga un aizdomīga; bet persona ar "oficiālu" runbook to piemēro stresa apstākļos bez apšaubīšanas. Ja izpildgrāmata nav pārbaudīta un tajā ir viens solis nepareizs, aklā ieviešana novedīs pie katastrofas. Tāpēc katrs runbook ir rūpīgi jāpārbauda un jāapzīmogo reālā vidē.

11. Kura ir pareizā pieeja paredzamajā apkopē, lai saprastu, kad disks tuvojas kļūmei?

  • A) Nekavējoties nomainiet vienu bojātu SMART disku
  • B) SMART datu pilnīga ignorēšana
  • C) Vērtību tendences aplūkošana laika gaitā; ✔ Pastāvīgs un paātrināts signālu skaita palielinājums
  • D) Rīkojieties tikai pēc tam, kad disks ir pilnībā sabrukis

Paskaidrojums: viens slikts SMART lasījums nav iemesls panikai; Tas ir normāli, ja diskos ik pa laikam tiek izlabotas kļūdas. Patiesais signāls ir tendence: konsekvents un straujš vērtību pieaugums, piemēram, pārdalīts sektors laika gaitā. Tāpēc AI tiek dota laikrinda, nevis viens rādījums.

12. Kuras ir divas visbiežāk aizmirstās, bet kritiskās ražošanas pārejas daļas?

  • A) Izmaiņu krāsa un nosaukums
  • B) Personas, kas veic izmaiņas, nosaukums un nodaļa
  • C) Paziņojums par izmaiņām sociālajos medijos
  • D) Atcelšanas plāns un panākumu pārbaudes kritēriji ✔

Paskaidrojums. Ja pirms izmaiņu ieviešanas nav rakstiskas atbildes uz jautājumiem “kā tieši es varu atsaukt, ja tas sabojājas” (atcelšanas plāns) un “kā es varu pierādīt, ka tas ir veiksmīgs” (veiksmes pārbaudes kritēriji) pirms izmaiņu ieviešanas, šīs izmaiņas vēl nav gatavas. Bez šiem diviem bojātas izmaiņas var uzskatīt par “pabeigtām”.

13. Kāpēc priekšroka tiek dota "kanārijputniņu" pieejai, nevis drošības izvietošanai (jaunai versijai/ielāpui) visiem serveriem vienlaikus?

  • A) Izmaiņas vispirms tiek piemērotas nelielai daļai; Kļūda skar nelielu daļu, nevis visu floti, un tiek pieķerta agri ✔
  • B) Kanāriju sadale patērē mazāk elektrības
  • C) Kanārija padara izvietošanas pārbaudi pilnīgi nevajadzīgu
  • D) Kanāriju izvietošana attiecas tikai uz datu bāzēm

Apraksts: Canary izvietošana vispirms piemēro izmaiņas nelielai daļai (vienam serverim, 5% lietotāju) un pārrauga. Tādā veidā kļūda skar nelielu daļu, nevis visu floti, un tiek agri noķerta. Kļūda, kas izplatās uzreiz, skar visus lietotājus vienlaikus.

14. Kāds ir nemainīgs ētiskais un tiesiskais noteikums, izmantojot mākslīgo intelektu drošības darbā?

  • A) Mākslīgo intelektu var brīvi izmantot, lai meklētu ievainojamības jebkurā sistēmā
  • B) Ētikas kodekss attiecas tikai uz lielām iestādēm
  • C) to izmanto tikai autorizētās sistēmās un aizsardzības nolūkos; Izmantošana nesankcionētai piekļuvei vai uzbrukumam ir noziegums ✔
  • D) Lai mācītos, var brīvi iefiltrēties kāda cita sistēmā.

Apraksts: Sistēmas un tīkla informācija ir divējāda lietojuma. Mākslīgo intelektu var izmantot tikai sistēmās, kurām jums ir rakstiska atļauja, un aizsardzības nolūkos (reģistrācijas draudu noteikšana, sacietēšana, reaģēšana uz incidentiem). Tās izmantošana, lai skenētu vai iefiltrētos sistēmā, kas jums nepieder, ir nesankcionēta piekļuve un noziegums; Lai mācītos, jāizmanto izolēta laboratorija.