이득:
- 탐지, 진단, 완화, 영구 해결, 학습 단계에서 인공지능 지원을 통해 사고에 대한 엔드투엔드 관리
- 모든 단계에서 인공지능으로 전환할 수 있는 단계와 인간의 결정이 필요한 단계를 분리하여 패닉 상황에서도 검증 규율을 유지할 수 있는 능력.
- '무슨 일이 일어나고 있는지, 어떻게 작성하는가'라는 질문보다 인공지능이 우선하고, '보증인이 누구인가'라는 질문보다 인간이 우선이라는 황금률을 비즈니스 반사로 바꾸는 능력
엔드투엔드 통합: AI를 통해 엔드투엔드 사고 관리
스크립팅, 로그 분석, 모니터링, 구성, IaC, 문서화, 예측 유지 관리, 변경 관리, 보안 등 이전 10개 단원의 내용을 배웠습니다. 하지만 현실 세계에서는 이러한 부분들이 하나씩 찾아오는 것이 아니라 하나의 사건 속에서 서로 얽혀 있습니다. 이 마지막 단원에서는 모든 부분을 하나로 모았습니다. 한밤중에 시작된 사고를 처음부터 끝까지, 탐지부터 근본 원인, 해결부터 문서화까지, 각 단계에서 적절한 양의 AI를 사용하여 관리하는 방법을 전체적으로 살펴보겠습니다. 목표는 새로운 기술을 가르치는 것이 아닙니다. 엔지니어의 반사 작용으로 배운 내용을 통합하여 모듈 전체에서 반복되는 한 가지 진실을 강화합니다. AI는 모든 단계에서 가속하고, 조명하고, 청사진을 만듭니다. 그러나 진단을 확인하고, 명령을 실행하고, 변경을 확인하고, 결과에 대한 책임을 지는 사람은 항상 인간입니다.
본 단원에서는 사건의 수명주기(탐지, 진단, 개입, 해결, 학습)를 사례를 통해 각 단계에서 AI의 역할과 한계를 통합합니다.
이벤트의 수명주기
모든 심각한 사건은 유사한 단계를 거치며, AI는 각 단계에서 다른 역할을 수행합니다. 감지: 알람이 울리고, 사용자가 불평하고, 측정항목이 기준에서 벗어납니다(단위 4). 검증 및 범위: 정말 문제인가요? 범위가 얼마나 넓나요? 진단: 로그 및 측정항목을 통해 근본 원인 파악(3단원) 대응 및 완화: 피해 중지, 해결 방법. 영구적인 해결 방법: 변경 관리(단원 9), 스크립트(단원 2) 또는 필요한 경우 구성(단원 5)을 통해 수정합니다. 학습: 사후 분석 및 런북 업데이트(7단원) AI는 탐지 시 이상 징후를 표시하고, 진단 시 가설을 생성하고, 개입 옵션을 제공하고, 솔루션 초안을 작성하고, 학습 시 문서를 생성합니다. 그러나 모든 단계에서 인간이 결정 지점에 서 있습니다.
팁: 사건의 가장 위험한 순간은 스트레스가 가장 높은 진단과 대응의 순간, 즉 AI를 맹목적으로 신뢰하려는 충동이 가장 강한 순간입니다. 서두를수록 "읽고, 확인하고, 반납 준비" 반사를 더욱 엄격하게 유지하게 됩니다. 당황한 순간에 한 번의 인증을 건너뛰면 이벤트가 두 배로 늘어납니다.
처음부터 끝까지의 예
구체적으로 만들어 봅시다. 02:10에 알람이 울림: 결제 서비스 p99 응답 시간은 6초로 기준선(250~400ms)보다 훨씬 높습니다. 올바른 감지: 추적이 작동했습니다. 확인: 여러 위치에서 확인되는 실제 이벤트입니다. 진단: 엔지니어는 지난 20분 동안의 마스크된 로그와 측정항목을 AI에 제공합니다. AI는 타임라인을 설정하고 02:08에 배포 직후 감속이 시작되는 것으로 표시합니다. 이는 강한 상관관계가 있지만 여전히 가설입니다. 엔지니어는 배포 로그를 통해 이를 확인합니다. 예, 릴리스가 02:08에 릴리스되었습니다. 대응: 가장 빠른 감소는 배포를 롤백하는 것입니다. 변경 요청의 롤백 단계가 준비되었습니다(단위 9). 엔지니어는 먼저 카나리아 로직을 사용하여 서버에서 롤백을 구현하고 응답 시간이 개선된 다음 이를 전파합니다. 영구적인 해결 방법: 실제 근본 원인(새 버전에서는 인덱싱되지 않은 쿼리)이 다음날 조용히 해결됩니다. 학습: AI가 없는 사후 분석 초안이 작성되고 "배포 후 p99 모니터링" 단계가 런북에 추가됩니다. 모든 단계에서 AI가 가속화되었습니다. 모든 결정 지점에서 인간의 검증을 거쳤습니다.
휴먼-AI 분업의 황금률
모듈 전반에 걸쳐 볼 수 있는 구별은 여기서 규칙이 됩니다. AI는 "무슨 일이 일어나고 있는지, 무슨 일이 일어날 수 있는지, 어떻게 작성하는지"에 대한 질문에서 앞서 있습니다. “이걸 지금 해야 하나, 누가 보증할 수 있느냐”는 질문에는 사람들이 앞서 있다. AI는 지치지 않고 빠르며 방대한 정보를 스캔하고 청사진을 생성합니다. 그러나 전체 맥락을 알지 못하고 환각을 일으킬 수 있으며 책임을 처리할 수 없으며 조직의 숨겨진 종속성을 확인하지 못합니다. 인간은 느리지만 상황, 책임 및 판단을 수행합니다. 가장 좋은 결과는 둘 사이의 올바른 노동 분담에 있습니다. 즉, 반복적이고 텍스트이며 생산 가능한 작업을 AI에 위임합니다. 검증, 결정 및 실행을 인간이 유지하십시오.
세 개의 미니 케이스
사례 1 — 끝까지 40분. 디스크 가득 참 이벤트에서 SRE는 AI로 전체 체인을 가속화했습니다. 기준선으로 경보 확인(5분), 마스킹된 로그를 YZ로 요약하고 첫 번째 오류 발견(5분), 실제 시스템에서 AI의 "로그 회전 중지" 가설 확인(5분), 테스트 실행(10분)으로 미리 만들어진 청소 스크립트 실행 및 구현, AI에 사후 스케치 작성 및 사실 확인(15분). 총 40분; AI가 없으면 약 2배 더 많습니다. 하지만 모든 단계마다 검증 단계가 있었습니다.
사례 2 - 당황한 순간에 확인을 건너뛰었습니다. 다른 팀이 서둘러 컷을 찍었습니다. AI의 첫 번째 근본 원인 가설(종속성 서비스)을 검증하지 않고 수락하고 해당 서비스를 다시 시작했습니다. 실제 원인은 다른 것이기 때문에 문제가 해결되지 않았습니다. 게다가 불필요한 재부팅으로 인해 두 번째 중단이 발생했습니다. 교훈: 서두르는 것은 검증을 건너뛰는 것을 정당화할 수 없습니다. AI 가설이 확인되기 전에 조치가 이벤트를 확대합니다.
사례 3 — 한계를 인식합니다. 엔지니어는 복잡한 네트워크 문제에 대해 AI가 촉구했던 구성 변경을 구현하려고 했습니다. 하지만 그 변화는 되돌릴 수 없을 것 같았고, AI는 기관의 구체적인 라우팅 규칙을 알지 못했습니다. 엔지니어는 작업을 멈추고 선임 네트워크 전문가에게 문의한 후 AI의 제안이 이 특정 토폴로지에서 라우팅 루프를 생성한다는 사실을 알게 되었습니다. AI의 한계를 알면 혼란이 방지됩니다.
복사 가능한 템플릿 4개
1) 이벤트 트리거 요약(분류):
귀하의 역할: 선임 SRE, 사건 부사령관. 활성화된 이벤트가 있습니다. 제가 제공하는 마스킹된 경고/메트릭/로그는 (1) 증상은 무엇인지, (2) 영향 범위는 무엇인지, (3) 먼저 살펴봐야 할 3개 영역, (4) 각각에 대한 읽기 전용 제어 명령을 제공합니다. 결정과 실행은 나의 몫입니다. 길을 보내십시오. 데이터: [마스크됨]
2) 단계별 사고 관리 가이드:
증상[증상]에 대한 인시던트 수명주기(감지 확인, 진단, 완화, 영구 해결, 학습)를 단계별로 안내해 드립니다. 각 단계에서 (a) 무엇을 해야 하는지, (b) 언제 AI에 안전하게 위임할 수 있는지, (c) 내가 직접 내려야 하는 결정을 알려주세요. 서두르더라도 건너뛰면 안되는 인증단계를 표시해 보세요.
3) 결정 포인트 제어:
저는 이벤트 진행 중이며 다음과 같은 조치를 취하려고 합니다: [action]. 구현하기 전에 다음 사항을 물어보십시오. (1) 이 작업을 되돌릴 수 있습니까? (2) 어떤 확인을 수행했거나 수행하지 않았습니까? (3) 롤백 계획이 있습니까? (4) 이 작업으로 실제로 근본 원인이 해결되었다는 증거가 있습니까? 빠진 것이 있으면 저를 멈춰주세요.
4) 행사 후 통합 학습:
방금 해결된 사건에 대해 [요약]은 다음을 제공합니다. (1) 비난할 수 없는 사후 분석 초안, (2) 이 사건을 방지할 3가지 영구적 개선(모니터링/자동화/구성), (3) 업데이트해야 하는 런북 단계, (4) 유사한 사건에 대한 조기 경고 신호 제안. 증거 없이 근본 원인을 작성합니다. 사실에 근거합니다.
약한 프롬프트 / 강한 프롬프트
약한 프롬프트:
시스템이 다운됐는데 어떻게 해야 하나요?
당황한 상태에서 맥락이나 확인 없이 이 프롬프트는 AI로부터 일반적이고 위험할 수 있는 조언을 받습니다. 서두르면 이 지점에서 실수가 가장 많이 발생합니다.
강력한 프롬프트:
귀하의 역할: 보조 사건 지휘관. 활성 이벤트: 결제 서비스ip99 응답 시간은 02:10 이후 기준 15배(250-400ms)입니다. 02:08에 배포가 있었던 것으로 알고 있습니다. (1) 가장 가능성이 높은 가설과 이를 읽기 전용으로 확인하는 방법, (2) 가장 빠르고 되돌릴 수 있는 완화 옵션, (3) 이 완화를 적용하기 전에 제어해야 하는 위험을 알려주세요. 나는 집행과 승인을 받았습니다. 추가 데이터: [마스킹된 측정항목/로그]
이벤트 단계
AI의 역할
인간의 중요한 결정
탐지
이상 징후 표시
실제 사건인가요? 범위는 어떻게 되나요?
진단
가설 생성
어떤 가설이 확인되었나요?
감소
옵션을 제공하지 마세요
어느 감소가 가역적입니까?
영구적인 해결책
초안/스크립트
변경 승인 및 실행
학습
사후 스케치
사실과 교훈 검증
일반적인 실수
- 패닉 상태에서 인증을 건너뛰는 중입니다. 서두르는 것은 "읽기-검증-반환 준비" 반사를 포기하는 것에 대한 정당화가 아닙니다. 스트레스가 증가할수록 규율도 강화되어야 합니다.
- 가설을 증거로 착각하는 것. AI의 첫 번째 근본 원인 제안을 확인하지 않고 조치를 취하면 사건이 확대됩니다.
- AI의 컨텍스트 경계를 잊어버립니다. AI는 조직의 숨겨진 종속성을 알지 못합니다. 중대한 변화에서는 인간의 판단이 우선합니다.
- 학습 단계를 건너뜁니다. 사후 분석 및 런북 업데이트 없이 이벤트는 같은 날 밤에 다시 시작됩니다.
- AI에 책임을 맡기다. “AI가 그렇게 말했다”는 변호가 아닙니다. 실행에 대한 책임은 항상 인간에게 있습니다.
주의: 사고 관리에 AI를 사용한다고 해서 사고 관리 학습을 대체할 수는 없습니다. 차량이 충돌하거나 충돌하거나 접근이 불가능할 수 있습니다. AI를 사용하면 기본을 아는 엔지니어가 더 빠릅니다. 기본을 모르는 엔지니어는 AI로 실수를 더 빨리 저지르게 됩니다. 먼저 규율을 확립한 다음 AI로부터 속도를 얻으십시오.
요약하면
현실 세계에서는 부품이 하나씩 나오는 것이 아니라 이벤트 내에서 얽혀 있습니다. 감지부터 학습까지 이벤트를 관리할 때 AI는 이상 징후 표시, 가설 생성, 옵션 제공, 초안 제공, 사후 준비 등 모든 단계에서 가속화됩니다. 그러나 모든 결정 지점에서 진단을 확인하고, 감소를 선택하고, 변경을 승인하고, 결과를 소유하는 등의 작업을 중단합니다. 황금률은 분명합니다. "무슨 일이 일어나는지, 어떻게 작성해야 하는지"에 대한 질문에서는 AI가 앞서고, "해야 하는지, 보증인은 누구인지"에 대한 질문에서는 인간이 앞서는 것입니다. 공황 상황에서는 규율을 강화하고, 가설과 증거를 분리하고, AI의 맥락 한계를 기억하고, 모든 사건에서 실행서 교훈을 도출하세요. 이 모듈의 핵심은 다음과 같은 한 문장입니다. AI는 강력한 보조자입니다. 엔지니어링 책임은 위임할 수 없습니다.
응용과제
과거에 경험한(또는 상상한) 사건을 처음부터 끝까지 생각해 보세요. 위의 "단계적 사건 관리 가이드" 템플릿을 사용하여 AI에게 탐지-진단-완화-해결-학습 단계를 통해 사건을 안내하도록 요청합니다. 각 단계마다 AI에게 위임할 수 있는 단계와 스스로 결정해야 하는 단계를 별도로 작성하세요. 진단 단계에서 검증 명령을 통해 AI 가설을 하나 이상 확인합니다. 마지막으로 "이벤트 후 통합 학습" 템플릿을 사용하여 사후 분석 및 런북 업데이트 초안을 생성합니다. 전체 과정에서 인간-AI 분업을 7개 항목으로 요약한다.
체크리스트
- [ ] 사고를 탐지, 진단, 완화, 해결, 학습 단계로 나누었나요?
- [ ] AI에 위임할 수 있는 단계와 각 단계에서 인간의 의사결정이 필요한 단계를 구분했나요?
- [ ] 진단시 AI 가설을 증거와 분리하여 검증명령으로 확인하였는가?
- [ ] 가역성 및 롤백 계획 측면에서 완화를 평가했습니까?
- [ ] 패닉 상황에서도 "읽기-검증-반환 준비" 반사를 유지했습니까?
- [ ] 사건을 통해 사후 분석 및 실행서 교훈을 얻었습니까?
모듈 시험
1. 다음 중 시스템 및 네트워크 관리에 있어서 인공지능의 포지셔닝으로 가장 정확한 것은 무엇입니까?
- A) 인공지능은 보조자이자 의사결정 지원 도구입니다. 중요한 경영진 결정의 책임과 최종 승인은 인간에게 있습니다 ✔
- B) 인공 지능은 사람의 승인 없이 명령을 실행하고 생산 변경 사항을 구현할 수 있습니다.
- 다) 인공지능은 텍스트 작성에만 작동하며, 시스템 및 네트워크 작업과는 아무런 관련이 없습니다.
- D) 인공지능은 항상 인간보다 더 정확한 판단을 하기 때문에 검증이 불필요하다.
설명: 인공지능은 스크립트, 로그 분석, 문서 등 초안과 분석을 생성하는 보조자이자 의사결정 지원 도구입니다. 명령 실행이나 변경 승인 등 가동 중지 시간, 데이터 손실 및 보안에 영향을 미치는 실행 결정에 대한 책임과 최종 승인은 유능한 엔지니어에게 있습니다.
2. 프로덕션에서 인공지능이 생성한 명령을 실행하기 전에 구현해야 하는 검증 반사의 4단계는 무엇입니까?
- A) 복사, 붙여넣기, 실행, 희망
- B) 읽고 이해하고, 문서화하고, 격리된 환경에서 시도하고, 피드백 준비 ✔
- 다) 좋아요, 공유, 저장, 보관
- D) 삭제, 다시 쓰기, 압축, 보내기
설명: 중요한 출력에 적용하기 위한 4단계: (1) 명령줄을 한 줄씩 읽고 이해합니다. (2) 플래그와 구문을 공식 문서에 연결합니다. (3) 격리된/테스트 환경에서 시도하고 가능하면 테스트 실행합니다. (4) 문제가 발생할 경우 대체 계획(백업, 스냅샷)을 준비합니다.
3. 자동화 스크립트가 '멱등성'이라는 것은 무엇을 의미하며 왜 중요한가요?
- A) 스크립트는 실행될 때마다 다른 결과를 생성합니다.
- B) 스크립트는 한 번만 실행된 후 삭제될 수 있습니다.
- C) 스크립트를 두 번째로 실행해도 아무런 해를 끼치지 않습니다. ✔ 다시 발동되어도 안전함
- D) 스크립트에는 오류 관리가 포함되어 있지 않습니다.
설명: 멱등성은 동일한 스크립트가 두 번 이상 실행될 때 두 번째 실행에서 손상을 일으키거나 오류를 생성하지 않음을 의미합니다. '사용자가 이미 있으면 건너뛰기', '디렉토리가 없으면 생성하고, 있으면 건드리지 마세요' 등의 논리가 성립됩니다. 이렇게 하면 실수로 다시 트리거되더라도 자동화가 안전하게 작동합니다.
4. 파괴적인 작업(삭제, 재시작)이 포함된 스크립트를 보호하는 가장 기본적인 방법은 무엇입니까?
- A) 가능한 한 빨리 스크립트를 실행하십시오.
- B) 오류 메시지 숨기기
- C) 프로덕션에서 직접 스크립트 테스트
- D) 기본 테스트 실행 뒤에 파괴적인 작업을 배치하고 실제 구현을 명시적인 틱 플래그에 바인딩 ✔
설명: 기본적으로 파괴적인 프로세스를 테스트 실행 모드로 유지하고 명시적인 승인 플래그(예: --apply)를 사용하여 실제 애플리케이션만 실행하면 스크립트가 실행될 때 어떤 일이 발생하는지 먼저 확인할 수 있습니다. 또한 널 변수 검사(VAR:?)는 경로 오류를 방지합니다.
5. 로그분석에서 '상관관계는 인과관계가 아니다'라는 원칙은 무엇을 의미하나요?
- A) 함께 변하는 두 사건이 반드시 인과관계에 있는 것은 아닙니다. 인과관계도 검증해야 합니다 ✔
- B) 로그에서 상관관계를 찾는 것은 시간낭비이다
- C) 함께 변화하는 두 가지 사건 중 하나는 분명히 다른 하나의 원인입니다.
- 라) 인과관계는 인공지능에 의해서만 판단될 수 있다
설명: 두 가지 사건이 동시에 발생한다고 해서(상관관계) 하나가 다른 사건을 유발한다는 의미는 아닙니다(인과관계). 둘 다 세 번째 사건의 결과일 수 있습니다. 'X가 Y의 원인일 수 있다'는 AI의 제안은 가설이며 시스템에서 검증될 때까지 결과로 간주되지 않습니다.
6. 성능 모니터링에서 응답 시간을 측정할 때 평균보다 백분위수(p95/p99)가 선호되는 이유는 무엇입니까?
- A) 백분위수는 평균보다 계산하기 쉽습니다.
- B) 평균은 소수의 나쁜 경험을 숨깁니다. 백분위수는 숨겨진 문제를 드러냅니다 ✔
- 다) 평균은 항상 틀리기 때문에 사용해서는 안 된다.
- D) 백분위수는 CPU 지표에만 적용됩니다.
설명: 평균은 소수의 사용자가 겪는 매우 나쁜 경험을 숨깁니다. 평균이 200ms로 나타나더라도 p99는 6초일 수 있습니다. 즉, 요청 100개 중 하나는 매우 느립니다. 백분위수는 평균에 가려진 소수자의 고통을 가시화한다.
7. 구성 관리에서 '드리프트'란 무엇이며 왜 위험한가요?
- A) 밤에는 네트워크 트래픽이 떨어집니다.
- 나) 서버의 물리적 이전
- C) 서버는 시간이 지남에 따라 서로 및 표준에서 벗어납니다. ✔ 문제가 발생할 때까지 보이지 않음
- D) 구성 파일의 자동 백업
설명: 드리프트는 시간이 지남에 따라 문서화되지 않은 수동 변경으로 인해 서버가 서로 및 표준에서 벗어나는 현상입니다. 위험은 침묵입니다. 문제가 발생할 때까지 표시되지 않으며 한 서버가 다른 서버와 다르게 동작하며 진단에는 몇 시간이 걸립니다. AI는 비교를 통해 드리프트를 가시화합니다. 금 용접 원리로 방지됩니다.
8. IaC 도구(예: Terraform)에서 '계획' 단계가 가장 중요한 보안 가드레일인 이유는 무엇입니까?
- A) 계획에 따라 코드가 더 빠르게 실행됩니다.
- B) 계획 상태 파일을 삭제합니다.
- C) 계획은 코드 형식만 수정합니다.
- D) 계획에는 구현 전에 추가, 변경 및 삭제될 내용이 표시됩니다. 데이터 손실 방지 ✔
설명: 계획(terraform plan / ansible --check)은 코드를 실행하기 전에 '변경 사항' 미리 보기(추가, 변경, 삭제될 리소스 수)를 제공합니다. 특히 '파기' 및 '강제 교체' 행은 구현 전 데이터 손실 위험을 나타냅니다. 계획을 읽지 않고 신청하는 것은 가장 비용이 많이 드는 실수 중 하나입니다.
9. Terraform 상태 파일을 신중하게 보호하고 AI나 공개 저장소에 붙여넣어서는 안 되는 이유는 무엇입니까?
- A) 일반 텍스트 비밀이 상태 파일에 포함될 수 있습니다. 유출시 신상정보가 공개됩니다✔
- B) 상태 파일이 너무 크기 때문에
- C) 상태 파일이 이미 읽을 수 없게 암호화되어 있습니다.
- D) 상태 파일이 공유되면 코드가 더 빠르게 실행됩니다.
설명: 상태 파일은 관리형 인프라의 현재 상태를 유지하며 일반 텍스트 비밀(데이터베이스 비밀번호, 키)을 포함할 수 있습니다. 따라서 암호화되고 액세스가 제한되며 잠긴 원격 백엔드에 보관되어야 합니다. 공공 차량이나 저장소에 보관해서는 안 됩니다. 그렇지 않으면 비밀이 유출될 수 있습니다.
10. 설명서에서 '잘못된 런북이 없는 것보다 잘못된 런북이 더 위험합니다'라는 문구는 무엇을 강조합니까?
- A) Runbook을 작성하는 것은 시간 낭비입니다.
- B) 테스트되지 않은 런북은 위기 상황에서 맹목적으로 구현됩니다. 한 번의 잘못된 발걸음은 재앙으로 이어질 수 있습니다 ✔
- C) Runbook은 관리자만을 위해 작성되었습니다.
- D) 문서를 절대 업데이트해서는 안 됩니다.
설명: 런북이 없는 팀은 위기 상황에서 조심스럽고 의심스럽습니다. 하지만 '공식적인' 런북을 갖고 있는 사람은 스트레스를 받는 상황에서도 질문 없이 이를 적용합니다. Runbook이 테스트되지 않았고 한 단계 잘못된 경우 맹목적인 구현은 재앙으로 이어질 것입니다. 그렇기 때문에 모든 런북은 실제 환경에서 철저하게 테스트되고 스탬프가 찍혀야 합니다.
11. 예측 유지 관리에서 디스크 장애가 가까워지는 시점을 이해하는 올바른 접근 방식은 무엇입니까?
- A) 불량 SMART 디스크 1개를 즉시 교체합니다.
- B) SMART 데이터를 완전히 무시함
- C) 시간에 따른 가치의 추세를 살펴보는 것; ✔ 일관되고 가속화되는 증가 신호 수
- D) 디스크가 완전히 붕괴된 후에만 조치를 취함
설명: 잘못된 SMART 판독값이 하나만 있어도 패닉이 발생하지 않습니다. 디스크에서 가끔 오류가 수정되는 것은 정상적인 현상입니다. 실제 신호는 추세입니다. 즉, 시간이 지남에 따라 재할당된 부문과 같은 가치가 일관되고 가속화되는 것입니다. 그렇기 때문에 AI에는 단일 판독이 아닌 시계열이 제공됩니다.
12. 생산 전환에서 가장 자주 간과되지만 중요한 두 가지 부분은 무엇입니까?
- 가) 변경사항의 색상 및 명칭
- 나) 변경하는 사람의 직위 및 부서
- 다) 소셜미디어에 변경사항 공지
- 라) 롤백 계획 및 성공 검증 기준 ✔
설명: 변경이 구현되기 전에 '문제가 발생하면 정확히 어떻게 롤백합니까?'(롤백 계획) 및 '성공임을 어떻게 증명합니까'(성공 확인 기준)라는 질문에 대한 서면 답변이 없으면 해당 변경은 아직 준비되지 않은 것입니다. 이 두 가지가 없으면 깨진 변경은 '완료'된 것으로 간주될 수 있습니다.
13. 동시에 모든 서버에 보안 배포(새 버전/패치)를 배포하는 것보다 '카나리아' 접근 방식을 선호하는 이유는 무엇입니까?
- A) 변경 사항은 작은 부분에 먼저 적용됩니다. 버그는 전체 차량이 아닌 작은 부분에 영향을 미치며 조기에 발견됩니다 ✔
- 나) 카나리아 분포는 전력 소모가 적다
- C) Canary는 배포 확인을 완전히 불필요하게 만듭니다.
- D) 카나리아 배포는 데이터베이스에만 적용됩니다.
설명: Canary 배포는 작은 부분(서버 1개, 사용자 5%)에 먼저 변경 사항을 적용하고 모니터링합니다. 이렇게 하면 버그가 전체 함대가 아닌 작은 부분에 영향을 미치고 조기에 발견됩니다. 한 번에 퍼지는 버그는 모든 사용자에게 동시에 영향을 미칩니다.
14. 보안업무에 인공지능을 활용할 때 불변의 윤리적, 법적 원칙은 무엇입니까?
- A) 인공지능을 자유롭게 활용하여 모든 시스템의 취약점을 검사할 수 있습니다.
- 나) 윤리강령은 대규모 기관에만 적용된다.
- C) 승인된 시스템 및 방어 목적으로만 사용됩니다. 무단 접근이나 공격에 사용하는 것은 범죄입니다 ✔
- D) 학습을 위해 다른 사람의 시스템에 침투하는 것은 자유입니다.
설명: 시스템 및 네트워크 정보는 이중 용도로 사용됩니다. 인공 지능은 서면 승인을 받은 시스템에서만 방어 목적(로그 위협 탐지, 강화, 사고 대응)으로 사용할 수 있습니다. 이를 사용하여 귀하의 소유가 아닌 시스템을 검색하거나 침투하는 것은 무단 액세스 및 범죄입니다. 학습을 위해서는 격리된 실험실을 사용해야 합니다.