Yunit 11 / 11

End-to-End Integration: Pamamahala ng Insidente mula Simula hanggang Tapos

Mga nadagdag:

  • End-to-end na pamamahala ng isang insidente na may suporta sa artificial intelligence sa detection, diagnosis, mitigation, permanenteng solusyon at mga yugto ng pag-aaral
  • Kakayahang mapanatili ang disiplina sa pag-verify kahit na sa panahon ng gulat sa pamamagitan ng paghihiwalay ng mga hakbang na maaaring ilipat sa artificial intelligence at ang mga nangangailangan ng desisyon ng tao sa bawat yugto.
  • Kakayahang gawin ang ginintuang tuntunin na ang artificial intelligence ay nangunguna sa 'kung ano ang nangyayari, kung paano magsulat' ng mga tanong, at ang mga tao ay may priyoridad kaysa sa 'dapat ko bang gawin ito, kung sino ang guarantor', sa isang business reflex

End-to-End Integration: Pamamahala ng Insidente mula Dulo hanggang Dulo gamit ang AI

Natutunan mo ang mga piraso sa nakaraang sampung unit: scripting, log analysis, monitoring, configuration, IaC, documentation, predictive maintenance, change management, at security. Ngunit sa totoong mundo, ang mga bahaging ito ay hindi dumarating nang isa-isa, ngunit magkakaugnay sa loob ng isang kaganapan. Sa panghuling unit na ito, pinagsasama-sama namin ang mga piraso: makikita mo sa kabuuan nito kung paano pamahalaan ang isang insidente na nagsimula sa kalagitnaan ng gabi, end-to-end, mula sa pagtuklas hanggang sa ugat, mula sa remediation hanggang sa dokumentasyon, at paggamit ng tamang dosis ng AI sa bawat yugto. Ang layunin ay hindi magturo ng bagong pamamaraan; pinagsama-sama ang iyong mga natutunan bilang isang engineer's reflex, na nagpapatibay sa isang katotohanang inulit sa buong module: AI accelerates, illuminates at blueprints sa bawat yugto; ngunit palaging ang tao ang nagpapatunay sa diagnosis, nagpapatakbo ng utos, nagpapatunay sa pagbabago, at nananagot sa kinalabasan.

Sa unit na ito, isasama mo ang lifecycle ng isang insidente—detection, diagnosis, intervention, resolution, learning—at ang papel at limitasyon ng AI sa bawat yugto sa pamamagitan ng isang halimbawa.

Siklo ng buhay ng isang kaganapan

Ang bawat seryosong insidente ay dumadaan sa magkatulad na mga yugto, at ang AI ay may iba't ibang papel sa bawat yugto. Detection: tumunog ang alarm, nagreklamo ang user, lumihis ang sukatan mula sa baseline (Unit 4). Pagpapatunay at saklaw: ito ba ay talagang isang isyu, gaano ito kalawak? Diagnosis: pagkuha sa ugat mula sa mga log at sukatan (Unit 3). Tugon at pagpapagaan: paghinto ng pinsala, solusyon. Permanenteng solusyon: ayusin gamit ang change management (Unit 9), script (Unit 2) o configuration kung kinakailangan (Unit 5). Pag-aaral: post-mortem at pag-update ng runbook (Unit 7). Minarkahan ng AI ang anomalya sa pagtuklas, gumagawa ng mga hypotheses sa diagnosis, nag-aalok ng mga opsyon sa interbensyon, nagsusulat ng mga draft sa solusyon, gumagawa ng mga dokumento sa pag-aaral - ngunit sa bawat yugto, ang mga tao ay nakatayo sa punto ng desisyon.

Tip: Ang pinaka-mapanganib na sandali ng isang insidente ay ang sandali ng diagnosis at pagtugon kapag ang stress ay pinakamataas — tiyak na kapag ang pagnanasang bulag na magtiwala sa AI ay pinakamalakas. Kung mas nagmamadali ka, mas mahigpit kang kumapit sa "read, verify, prepare for return" reflex. Ang isang solong pag-verify ay nilaktawan sa isang sandali ng pagkasindak ay nagdodoble sa kaganapan.

Isang halimbawa mula simula hanggang katapusan

Gawin natin itong kongkreto. Isang alarm sa 02:10: ang serbisyo ng pagbabayad p99 oras ng pagtugon ay 6 na segundo, na mas mataas sa baseline (250–400 ms). Tama ang pagtuklas: gumana ang pagsubaybay. Kumpirmasyon: kumpirmasyon mula sa maraming lokasyon, isang tunay na kaganapan. Diagnostics: binibigyan ng engineer ang nakamaskara na log at mga sukatan ng huling 20 minuto sa AI; Ang AI ​​ay nagtatatag ng timeline at minarkahan ang pagbagal bilang nagsisimula kaagad pagkatapos ng deployment sa 02:08 — isang malakas na ugnayan, ngunit isang hypothesis pa rin. Kinumpirma ito ng engineer gamit ang deployment log: oo, isang release ang inilabas noong 02:08. Tugon: ang pinakamabilis na pagbawas ay ang pagbabalik ng pamamahagi; Handa na ang rollback step sa kahilingan sa pagbabago (Unit 9). Ang engineer ay unang nagpapatupad ng rollback sa isang server na may canary logic, ang oras ng pagtugon ay bumubuti, at pagkatapos ay ipapalaganap ito. Permanenteng solusyon: ang tunay na dahilan (hindi na-index na query sa bagong bersyon) ay maayos na maayos sa susunod na araw. Pag-aaral: Ang isang AI-free post-mortem ay ginawa at ang "post-deployment p99 monitoring" na hakbang ay idinagdag sa runbook. Sa bawat yugto, bumilis ang AI; napatunayan ng tao sa bawat punto ng pagpapasya.

Ang ginintuang tuntunin ng Human-AI division of labor

Ang pagkakaibang nakikita mo sa buong modyul ay nagiging panuntunan dito: Nangunguna ang AI sa mga tanong ng "kung ano ang nangyayari, kung ano ang maaaring mangyari, kung paano magsulat"; Ang mga tao ay nauuna pagdating sa mga tanong tulad ng "dapat ko bang gawin ito ngayon, sino ang makapagpapatunay para dito?" Ang AI ay walang pagod, mabilis, nag-scan ng malawak na impormasyon at bumubuo ng mga blueprint — ngunit hindi nito alam ang buong konteksto, maaaring gumawa ng mga guni-guni, hindi makayanan ang pananagutan, at hindi nakikita ang mga nakatagong dependency ng iyong organisasyon. Ang tao ay mabagal, ngunit nagdadala ng konteksto, responsibilidad at paghatol. Ang pinakamahusay na resulta ay nasa tamang dibisyon ng paggawa sa pagitan ng dalawa: italaga ang paulit-ulit, tekstuwal, nagagawang gawain sa AI; Panatilihin ang pagpapatunay, pagpapasya at pagpapatupad ng tao.

tatlong mini case

Case 1 — 40 minuto mula hanggang dulo. Sa isang disk full event, pinabilis ng isang SRE ang buong chain gamit ang AI: nakumpirma ang alarma gamit ang baseline (5 min), ang naka-mask na log ay nai-summarize sa YZ at nakita ang unang error (5 min), na-verify ang hypothesis ng "log rotation na tumigil" ng AI sa totoong system (5 min), tumakbo at nagpatupad ng isang ready-made na script ng paglilinis na may dry-run (10 min), at na-verketch ang katotohanan ng post-mortem1 (10 min), at na-verketch ang katotohanan ng post-mortem1). Kabuuang 40 minuto; Humigit-kumulang dalawang beses ang dami nang walang AI. Ngunit mayroong isang hakbang sa pag-verify sa bawat yugto.

Case 2 — Nilaktawan ang pag-verify sa isang sandali ng gulat. Ang isa pang koponan ay sumugod ng isang hiwa. Tinanggap nito ang unang root cause hypothesis ng AI (isang serbisyo ng dependency) nang hindi ito bini-verify at na-restart ang serbisyong iyon. Ang problema ay hindi naayos dahil ang tunay na dahilan ay iba; Bukod dito, ang hindi kinakailangang pag-reboot ay lumikha ng pangalawang outage. Aral: ang pagmamadali ay hindi katwiran para sa paglaktaw sa pagpapatunay; Bago makumpirma ang hypothesis ng AI, pinalalaki ng aksyon ang kaganapan.

Kaso 3 — Ang pagiging kamalayan sa limitasyon. Ang isang inhinyero ay magpapatupad ng pagbabago sa pagsasaayos na hinihimok ng AI sa isang kumplikadong isyu sa network. Ngunit ang pagbabago ay tila hindi maibabalik, at ang AI ay hindi alam ang mga tiyak na panuntunan sa pagruruta ng ahensya. Huminto ang engineer, kumunsulta sa isang senior network expert, at nalaman na ang panukala ng AI ay lilikha ng routing loop sa partikular na topology na ito. Ang pag-alam sa limitasyon ng AI ay pumigil sa isang pagkagambala.

Apat na maaaring kopyahin na mga template

1) Buod ng trigger ng kaganapan (triage):

Ang iyong tungkulin: senior SRE, assistant incident commander. Mayroong aktibong kaganapan. Ang masked alert/metric/log na ibinibigay ko sa iyo ay nagbibigay sa akin ng mabilis na pagsubok: (1) ano ang sintomas, (2) ano ang saklaw ng epekto, (3) 3 lugar na unang titingnan, (4) isang read-only na control command para sa bawat isa. Ang desisyon at pagpapatupad ay akin; Ipadala ang daan. Data: [nakamaskara]

2) Gabay sa pamamahala ng insidente ng phased:

Dalhin ako nang hakbang-hakbang sa lifecycle ng insidente para sa sintomas [symptom]: pagkumpirma ng pagtuklas, diagnosis, pagpapagaan, permanenteng paglutas, pag-aaral. Sa BAWAT yugto, sabihin sa akin (a) kung ano ang kailangan kong gawin, (b) kapag ligtas kong maitalaga ito sa AI, (c) kung anong desisyon ang DAPAT kong gawin sa aking sarili. Markahan ang mga hakbang sa pag-verify na hindi ko dapat laktawan kahit na nagmamadali ako.

3) Kontrol sa punto ng desisyon:

Nasa kalagitnaan ako ng isang kaganapan at gagawa ako ng sumusunod na aksyon: [action]. Bago ipatupad, tanungin ako: (1) nababaligtad ba ito, (2) anong pag-verify ang ginawa/hindi ko ginawa, (3) mayroon ba akong rollback na plano, (4) mayroon ba akong ebidensya na ang aksyong ito ay aktwal na nalutas ang pangunahing dahilan? Kung may nakikita kang kulang, pigilan mo ako.

4) Post-event integrated learning:

Para sa insidenteng karesolba pa lang, binibigyan ako ng [summary] ng: (1) post-mortem draft na walang sinisisi, (2) 3 permanenteng pagpapahusay (monitoring/automation/configuration) na pipigil sa insidenteng ito, (3) runbook na mga hakbang na kailangang i-update, (4) early warning signal suggestion para sa katulad na insidente. Pagsusulat ng ugat na sanhi nang walang ebidensya; batay sa mga katotohanan.

Mahinang prompt / Malakas na prompt

Mahinang prompt:

Nag-crash ang system, ano ang dapat kong gawin?

Nataranta, walang konteksto at walang pag-verify, nakakatanggap ang prompt na ito ng generic at posibleng mapanganib na payo mula sa AI. Ang pagmamadali ay humahantong sa mga pagkakamali sa puntong ito.

Napakahusay na prompt:

Ang iyong tungkulin: assistant incident commander. Aktibong kaganapan: serbisyo ng pagbabayadip99 oras ng pagtugon 15 beses baseline (250-400 ms) mula 02:10. Alam kong may distribusyon noong 02:08. Bigyan mo ako ng:(1) ang pinaka-malamang na hypothesis at kung paano ito i-verify na READ-ONLY, (2) ang pinakamabilis at REVERSIBLE mitigation na opsyon, (3) ang mga panganib na kailangan kong kontrolin bago ilapat ang mitigation na ito. Nasa akin ang pagpapatupad at pag-apruba. Karagdagang data: [masked metric/log]

yugto ng kaganapan

Papel ng AI

Kritikal na desisyon ng tao

pagtuklas

Markahan ang anomalya

Ito ba ang aktwal na kaganapan, ano ang saklaw?

Diagnosis

pagbuo ng hypothesis

Aling hypothesis ang nakumpirma?

pagbabawas

Huwag mag-alok ng mga pagpipilian

Aling pagbabawas ang mababaligtad?

permanenteng solusyon

Draft/script

Aprubahan at isagawa ang pagbabago

Pag-aaral

Post-mortem sketch

Pagpapatunay ng mga katotohanan at aral

Mga karaniwang pagkakamali

  • Nilaktawan ang pag-verify sa gulat. Ang pagmamadali ay hindi pagbibigay-katwiran para sa pag-abandona sa "read-verify-prepare return" reflex; Habang tumataas ang stress, dapat tumaas ang disiplina.
  • Pagkakamali ng isang hypothesis para sa ebidensya. Ang pagsasagawa ng pagkilos nang hindi kinukumpirma ang unang suhestiyon ng ugat ng AI ay magpapalaki sa insidente.
  • Nakalimutan ang hangganan ng konteksto ng AI. Hindi alam ng AI ang mga nakatagong dependencies ng organisasyon; Sa kritikal na pagbabago, nananaig ang paghatol ng tao.
  • Nilaktawan ang yugto ng pag-aaral. Ang kaganapan, nang walang post-mortem at mga update sa runbook, ay magsisimula muli sa parehong gabi.
  • Paglalagay ng responsibilidad sa AI. "Sinabi ng AI" ay hindi isang pagtatanggol; Ang responsibilidad para sa pagpapatupad ay palaging nasa tao.
Babala: Ang paggamit ng AI sa pamamahala ng insidente ay hindi pinapalitan ang pag-aaral ng pamamahala ng insidente. Maaaring bumagsak, bumagsak, o hindi ma-access ang sasakyan. Ang inhinyero na nakakaalam ng mga pangunahing kaalaman ay mas mabilis sa AI; Ang isang engineer na hindi alam ang mga pangunahing kaalaman ay makakagawa ng mga pagkakamali nang mas mabilis sa AI. Magtatag muna ng disiplina, pagkatapos ay makuha ang bilis mula sa AI.

Sa buod

Sa totoong mundo, ang mga bahagi ay hindi dumarating nang isa-isa ngunit magkakaugnay sa loob ng isang kaganapan. Kapag pinamamahalaan ang isang kaganapan mula sa pagtuklas hanggang sa pag-aaral, ang AI ay bumibilis sa bawat yugto: ibina-flag ang anomalya, bumubuo ng mga hypotheses, nag-aalok ng mga opsyon, nag-draft, naghahanda ng post-mortem. Ngunit sa bawat punto ng pagpapasya may humihinto — kinukumpirma ang diagnosis, pinipiling bawasan, aprubahan ang pagbabago, pagmamay-ari ang resulta. Ang ginintuang tuntunin ay malinaw: Ang AI ay nauuna sa mga tanong ng "kung ano ang mangyayari, kung paano magsulat", at ang mga tao ay nangunguna sa mga tanong na "dapat ko bang gawin ito, sino ang tagagarantiya?" Sa panahon ng gulat, dagdagan ang disiplina, ihiwalay ang hypothesis sa ebidensya, tandaan ang limitasyon ng konteksto ng AI, at gumuhit ng isang runbook na aral mula sa bawat kaganapan. Ang esensya ng modyul na ito ay isang pangungusap: AI ay isang makapangyarihang katulong; Ang responsibilidad sa engineering ay hindi maaaring italaga.

Gawain ng aplikasyon

Isaalang-alang ang isang kaganapan na iyong naranasan (o naisip) sa iyong nakaraan, mula simula hanggang wakas. Gamit ang template na "Phased incident management guide" sa itaas, hilingin sa AI na gabayan ang insidente sa mga yugto ng detection-diagnosis-mitigation-resolution-learning; Sa bawat yugto, isulat nang hiwalay ang hakbang na maaari mong italaga sa AI at ang hakbang na kailangan mong magpasya sa iyong sarili. Kumpirmahin ang hindi bababa sa isang AI hypothesis na may command sa pag-verify sa panahon ng yugto ng diagnosis. Panghuli, gumawa ng post-mortem at runbook update draft gamit ang template na "Post-event integrated learning." Ibuod ang human-AI division of labor sa buong proseso sa 7 item.

checklist

  • [ ] Hinati ko ba ang insidente sa detection, diagnosis, mitigation, solusyon at mga yugto ng pag-aaral?
  • [ ] Natukoy ko ba ang pagitan ng mga hakbang na maaaring italaga sa AI at yaong nangangailangan ng paggawa ng desisyon ng tao sa bawat yugto?
  • [ ] Sa diagnosis, inihiwalay ko ba ang AI hypothesis mula sa ebidensya at kinumpirma ito sa isang utos sa pag-verify?
  • [ ] Nasuri ko ba ang pagpapagaan sa mga tuntunin ng reversibility at rollback plan?
  • [ ] Napanatili ko ba ang reflex na "read-verify-prepare return" kahit sa mga oras ng gulat?
  • [ ] May natutunan ba akong post-mortem at runbook lesson mula sa insidente?

Pagsusulit sa Module

1. Alin sa mga sumusunod ang pinakatumpak na pagpoposisyon para sa artificial intelligence sa pamamahala ng system at network?

  • A) Ang artificial intelligence ay isang katulong at tool sa suporta sa desisyon; Ang responsibilidad at panghuling pag-apruba sa mga kritikal na desisyon ng executive ay nasa mga tao ✔
  • B) Ang artificial intelligence ay maaaring magpatakbo ng mga utos at magpatupad ng mga pagbabago sa produksyon nang walang pag-apruba ng tao
  • C) Gumagana lamang ang artificial intelligence sa pagsulat ng teksto, wala itong kinalaman sa gawain ng system at network
  • D) Ang artificial intelligence ay palaging gumagawa ng mas tumpak na mga desisyon kaysa sa mga tao, kaya hindi kailangan ang pag-verify

Paglalarawan: Ang artificial intelligence ay isang assistant at decision support tool na gumagawa ng mga draft at pagsusuri gaya ng mga script, log analysis at mga dokumento. Ang pananagutan at panghuling pag-apruba sa mga desisyon ng executive na nakakaapekto sa downtime, pagkawala ng data at seguridad, tulad ng pagsasagawa ng command o pag-apruba ng pagbabago, ay pagmamay-ari ng karampatang engineer.

2. Ano ang apat na hakbang ng verification reflex na dapat ipatupad bago magpatakbo ng command na nabuo ng artificial intelligence sa produksyon?

  • A) Kopyahin, i-paste, tumakbo, umasa
  • B) Basahin at unawain, idokumento, subukan sa isang hiwalay na kapaligiran, maghanda para sa feedback ✔
  • C) I-like, ibahagi, i-save, i-archive
  • D) Tanggalin, muling isulat, i-compress, ipadala

Paglalarawan: Apat na hakbang upang mailapat sa isang kritikal na output: (1) basahin at unawain ang command line sa pamamagitan ng linya, (2) i-link ang mga flag at syntax sa opisyal na dokumentasyon, (3) subukan ito sa isang nakahiwalay/pansubok na kapaligiran, dry-run kung maaari, (4) maghanda ng fallback plan (backup, snapshot) kung magkamali.

3. Ano ang ibig sabihin ng pagiging 'idempotent' ng automation script at bakit ito mahalaga?

  • A) Ang script ay gumagawa ng iba't ibang resulta sa bawat pagtakbo
  • B) Ang script ay maaari lamang tumakbo nang isang beses at pagkatapos ay tatanggalin
  • C) Ang script ay hindi nagdudulot ng anumang pinsala kapag tumakbo sa pangalawang pagkakataon; ✔ Ligtas kahit na-trigger muli
  • D) Ang script ay hindi naglalaman ng pamamahala ng error

Paliwanag: Ang ibig sabihin ng Idempotency ay kapag ang parehong script ay pinapatakbo ng dalawa o higit pang beses, hindi ito nagdudulot ng pinsala o gumagawa ng mga error sa pangalawang pagtakbo. Ang lohika tulad ng 'laktawan kung umiiral na ang gumagamit', 'lumikha ng direktoryo kung wala ito, huwag hawakan ito kung mayroon na' ay itinatag. Tinitiyak nito na gumagana nang ligtas ang automation kahit na hindi sinasadyang na-trigger muli.

4. Ano ang pinakapangunahing paraan upang ma-secure ang isang script na naglalaman ng mga mapanirang operasyon (pagtanggal, pag-restart)?

  • A) Patakbuhin ang script nang mabilis hangga't maaari
  • B) Pagtatago ng mga mensahe ng error
  • C) Pagsubok sa script nang direkta sa produksyon
  • D) Ang paglalagay ng mga mapanirang operasyon sa likod ng default na dry-run at pagbibigkis sa aktwal na pagpapatupad sa isang tahasang marka ng marka ✔

Paliwanag: Ang pagpapanatiling mapanirang proseso sa dry-run mode bilang default at pagpapatakbo lang ng aktwal na application na may tahasang flag ng pag-apruba (hal. --apply) ay nagbibigay-daan sa iyong makita muna kung ano ang mangyayari kapag tumakbo ang script. Pinipigilan din ng null variable checking (VAR:?) ang mga error sa landas.

5. Ano ang ibig sabihin ng prinsipyo ng 'correlation is not causation' sa log analysis?

  • A) Dalawang kaganapan na nagbabago nang magkasama ay hindi kinakailangang nasa isang sanhi-epektong relasyon; Dapat ding mapatunayan ang sanhi ✔
  • B) Ang paghahanap ng ugnayan sa mga log ay isang pag-aaksaya ng oras
  • C) Sa dalawang kaganapan na nagbabago nang magkasama, ang isa ay tiyak na sanhi ng isa pa.
  • D) Ang sanhi ay maaari lamang matukoy sa pamamagitan ng artificial intelligence

Paliwanag: Dahil lamang sa dalawang pangyayari ang nangyari sa parehong oras (kaugnayan) ay hindi nangangahulugan na ang isa ay nagiging sanhi ng isa pa (sanhi); Parehong maaaring resulta ng ikatlong kaganapan. Ang mungkahi ng AI na ang 'X ay malamang na sanhi ng Y' ay isang hypothesis at hindi itinuturing na isang paghahanap hanggang sa ito ay na-verify sa system.

6. Bakit mas pinipili ang percentile (p95/p99) kaysa average kapag sinusukat ang oras ng pagtugon sa pagsubaybay sa pagganap?

  • A) Mas madaling kalkulahin ang Percentile kaysa average
  • B) Itinatago ng karaniwan ang masamang karanasan ng minorya; percentile ay nagpapakita ng mga nakatagong problema ✔
  • C) Ang karaniwan ay palaging mali at hindi dapat gamitin
  • D) Nalalapat lang ang Percentile sa mga sukatan ng CPU

Paliwanag: Itinatago ng average ang napakasamang karanasan na mayroon ang isang maliit na bahagi ng mga user. Kahit na ang average ay lumilitaw na 200 ms, ang p99 ay maaaring 6 na segundo; Nangangahulugan ito na ang isa sa bawat daang kahilingan ay napakabagal. Ipinakikita ng Percentile ang sakit ng minoryang ito na itinago ng karaniwan.

7. Ano ang 'drift' sa pamamahala ng pagsasaayos at bakit ito mapanganib?

  • A) Bumababa ang trapiko sa network sa gabi
  • B) Pisikal na relokasyon ng isang server
  • C) Ang mga server ay lumihis sa isa't isa at ang pamantayan sa paglipas ng panahon; ✔ Invisible hanggang sa magkaroon ng problema
  • D) Awtomatikong backup ng mga configuration file

Paglalarawan: Ang Drift ay ang paglihis ng mga server mula sa isa't isa at mula sa pamantayan sa pamamagitan ng mga hindi dokumentadong manu-manong pagbabago sa paglipas ng panahon. Ang panganib nito ay ang katahimikan nito: hindi ito makikita hanggang sa mangyari ang problema, pagkatapos ay kumilos ang isang server nang iba sa iba at tumatagal ng ilang oras ang diagnosis. Ginagawa ng AI na nakikita ang drift sa pamamagitan ng paghahambing; Pinipigilan ng prinsipyo ng gintong hinang.

8. Bakit ang 'plano' na hakbang ang pinakamahalagang security guardrail sa IaC tool (tulad ng Terraform)?

  • A) Ang plano ay nagpapatakbo ng code nang mas mabilis
  • B) Tinatanggal ang file ng estado ng plano
  • C) Inaayos lamang ng plano ang pag-format ng code
  • D) Ipinapakita ng plano kung ano ang idadagdag, babaguhin, at DELETE bago ang pagpapatupad; Pinipigilan ang pagkawala ng data ✔

Paglalarawan: Ang Plano (plano ng terraform / ansible --check) ay nagbibigay ng preview na 'ano ang magbabago' bago isagawa ang code: kung gaano karaming mga mapagkukunan ang idaragdag, babaguhin, tatanggalin. Sa partikular, ang mga linyang 'sirain' at 'pinipilit na palitan' ay nagpapahiwatig ng panganib ng pagkawala ng data bago ang pagpapatupad. Ang pag-apply nang hindi binabasa ang plano ay isa sa mga pinakamahal na pagkakamali.

9. Bakit dapat maingat na protektahan ang Terraform state file at hindi idikit sa AI o mga bukas na repository?

  • A) Ang mga simpleng lihim ng teksto ay maaaring isama sa file ng Estado; Kung ma-leak, ang impormasyon ng pagkakakilanlan ay ibubunyag ✔
  • B) Dahil ang file ng estado ay masyadong malaki
  • C) Ang file ng estado ay hindi nababasa na naka-encrypt.
  • D) Ang code ay tumatakbo nang mas mabilis kapag ang state file ay ibinahagi

Paglalarawan: Pinapanatili ng State file ang kasalukuyang estado ng pinamamahalaang imprastraktura at maaaring magsama ng mga simpleng lihim ng text (mga password sa database, mga key). Samakatuwid, dapat itong itago sa isang naka-encrypt, pinaghihigpitan ng access, naka-lock na remote na backend; Hindi ito dapat ilagay sa pampublikong sasakyan o repositoryo, kung hindi, ang sikreto ay tatagas.

10. Ano ang binibigyang-diin ng pahayag na 'mas mapanganib ang isang maling runbook kaysa walang runbook' sa dokumentasyon?

  • A) Ang pagsulat ng isang runbook ay isang pag-aaksaya ng oras
  • B) Ang isang hindi pa nasubok na runbook ay bulag na ipinatupad sa isang krisis; Ang isang maling hakbang ay maaaring humantong sa kapahamakan ✔
  • C) Ang mga runbook ay isinulat para sa mga administrator lamang
  • D) Hindi dapat i-update ang dokumentasyon

Paliwanag: Ang isang pangkat na walang runbook ay maingat at kahina-hinala sa panahon ng isang krisis; ngunit ang taong may 'opisyal' na runbook ay inilalapat ito sa ilalim ng stress nang hindi nagtatanong. Kung ang runbook ay hindi pa nasubok at may isang hakbang na mali, ang bulag na pagpapatupad ay hahantong sa kapahamakan. Iyon ang dahilan kung bakit ang bawat runbook ay dapat na lubusang masuri at maselyohan sa isang tunay na kapaligiran.

11. Sa predictive maintenance, alin ang tamang diskarte upang maunawaan kapag ang isang disk ay papalapit sa pagkabigo?

  • A) Agad na palitan ang isang masamang SMART disk
  • B) Ganap na binabalewala ang SMART data
  • C) Pagtingin sa takbo ng mga halaga sa paglipas ng panahon; ✔ Pare-pareho at pabilis ng pagtaas ng bilang ng signal
  • D) Gumagawa lamang ng aksyon pagkatapos na ganap na bumagsak ang disk

Paliwanag: Ang isang masamang pagbabasa ng SMART ay hindi dahilan ng pagkataranta; Normal para sa mga disc na magkaroon ng paminsan-minsang mga error. Ang tunay na senyales ay ang kalakaran: ang pare-pareho at pabilis na pagtaas ng mga halaga tulad ng muling inilalaang sektor sa paglipas ng panahon. Iyon ang dahilan kung bakit ang AI ay binibigyan ng isang serye ng oras, hindi isang solong pagbabasa.

12. Ano ang dalawang madalas na hindi napapansin ngunit kritikal na bahagi ng pagbabago ng produksyon?

  • A) Kulay at pangalan ng pagbabago
  • B) Pamagat at departamento ng taong gumagawa ng pagbabago
  • C) Anunsyo ng pagbabago sa social media
  • D) Plano ng rollback at pamantayan sa pag-verify ng tagumpay ✔

Paliwanag: Kung walang nakasulat na sagot sa mga tanong na 'paano ba talaga ako babalik kung ito ay masira' (rollback plan) at 'paano ko mapapatunayang matagumpay ito' (success verification criteria) bago ipatupad ang pagbabago, hindi pa handa ang pagbabagong iyon. Kung wala ang dalawang ito, ang isang sirang pagbabago ay maaaring ituring na 'kumpleto'.

13. Bakit mas pinipili ang 'canary' approach kaysa sa paglunsad ng security deployment (bagong bersyon/patch) sa lahat ng server nang sabay-sabay?

  • A) Ang pagbabago ay unang inilapat sa isang maliit na bahagi; Nakakaapekto ang isang bug sa isang maliit na bahagi, hindi sa buong fleet, at maagang nahuhuli ✔
  • B) Ang pamamahagi ng canary ay kumokonsumo ng mas kaunting kuryente
  • C) Ginagawa ng Canary na ganap na hindi kailangan ang pag-verify ng deployment
  • D) Ang pag-deploy ng Canary ay nalalapat lamang sa mga database

Paglalarawan: Inilalapat ng Canary deployment ang pagbabago sa isang maliit na bahagi (isang server, 5% ng mga user) muna at pagsubaybay. Sa ganitong paraan, naaapektuhan ng isang bug ang isang maliit na bahagi, hindi ang buong fleet, at maagang nahuhuli. Ang isang bug na kumakalat nang sabay-sabay ay tumama sa lahat ng user nang sabay-sabay.

14. Ano ang hindi nababagong etikal at legal na tuntunin kapag gumagamit ng artificial intelligence sa gawaing panseguridad?

  • A) Ang artificial intelligence ay maaaring malayang magamit upang i-scan ang mga kahinaan sa anumang sistema
  • B) Ang code of ethics ay nalalapat lamang sa malalaking institusyon
  • C) Ito ay ginagamit lamang sa mga awtorisadong sistema at para sa mga layunin ng pagtatanggol; Ang paggamit para sa hindi awtorisadong pag-access o pag-atake ay isang krimen ✔
  • D) Libre ang makalusot sa sistema ng ibang tao upang matuto.

Paglalarawan: Ang impormasyon ng system at network ay dalawahang gamit. Magagamit lang ang artificial intelligence sa mga system kung saan mayroon kang nakasulat na awtorisasyon at para sa mga layunin ng pagtatanggol (pag-detect ng banta ng log, hardening, pagtugon sa insidente). Ang paggamit nito upang i-scan o i-infiltrate ang isang sistema na hindi sa iyo ay hindi awtorisadong pag-access at isang krimen; Ang isang nakahiwalay na laboratoryo ay dapat gamitin upang matuto.