Добивки:
- Брзо пронајдете сигнал во шум со користење на вештачка интелигенција за сумирање, групирање и дневници на временската линија
- Способност да се одделат корелацијата и каузалноста и да се третираат сугестиите за основната причина на вештачката интелигенција како хипотези кои треба да се потврдат
- Способност да се дојде до вистинската основна причина со користење на методот „5 Зошто“ со вештачка интелигенција и поддршка на секој чекор со вистински докази
Анализа на дневници и анализа на основната причина: Пронаоѓање на сигналот во шум со вештачка интелигенција
Кога системот ќе падне, првото место што го гледате се дневниците. Дневникот е текстуален тек кој води евиденција со временски печат за „што направив, што се случи, што пукна“ на систем или апликација. Но, модерната инфраструктура произведува милиони линии трупци на час; тоа не е море од информации, туку често океан од бучава. Анализата на дневниците е уметност на пронаоѓање на важниот сигнал (грешка, абнормалност, шема) во овој шум. Процесот на одговарање на прашањето „која беше вистинската причина“ по некој настан се нарекува анализа на основната причина (RCA - Root Cause Analysis). Овде, вештачката интелигенција е многу моќна во сумирање на илјадници линии во секунда, извлекување шеми, воспоставување временски линии и наведување можни причини. Но, еден збор на претпазливост: вештачката интелигенција генерира можни причини; Вие сте тој што проверува во системот кој е вистински и ја носи одлуката.
Во оваа единица ќе научите како самоуверено да ги сумирате дневниците со вештачка интелигенција, како да воспоставите временска линија на настанот, како да разликувате помеѓу корелацијата (заедно се менува) и каузалноста (едната предизвикува друга) и како да извршите метод RCA како што е „5 зошто“ со вештачка интелигенција.
Зошто корелацијата не е каузална?
Ова е најкритичниот концепт на оваа единица. Само затоа што два настани се случуваат во исто време, едниот не го предизвикува другиот. Процесорот на серверот и мрежниот сообраќај може да се зголемат во исто време; но едното не е резултат на другото, и двете можат да бидат резултат на трет настан (на пример, почеток на сериска работа). Кога вештачката интелигенција гледа дека метриките се менуваат заедно, таа претпоставува „веројатно X го предизвика Y“. Ова е почетна точка, а не заклучок. За да ја потврдите каузалноста, треба или да ја изолирате променливата (да го активирате X во околината за тестирање и да видите дали Y се случува) или да го докажете механизмот (да ги покажете техничките средства со кои X произведува Y).
Внимание: земете ја реченицата на вештачката интелигенција „ова веројатно го предизвика ова“ како хипотеза, а не како наод. Во RCA, неточната основна причина доведува до неправилна корекција и повторување на настанот. Го најдовте првиот осомничен, а не причината; Работата започнува таму.
Чекор по чекор: Анализа на дневници со вештачка интелигенција
- Намалете го опсегот. Наведете го прозорецот за настанот, а не целиот дневник: „настанот започна во 14:05 часот, критично од 14:00–14:20 часот“. Кажете ѝ на вештачката интелигенција за релевантниот временски период и услугата.
- Маска. Дневниците содржат внатрешна IP адреса, име на домаќин, корисник и токен. Маскирајте ги (10.x.x.x, домаќин-A, user1, REDACTED) па извезете.
- Побарајте резиме и групирање. „Групирајте го овој дневник по сериозност, броете ги повторувачките грешки, пронајдете го временскиот печат на првата грешка“. Прашајте ја структурата, а не суровиот дневник.
- Поставете временска линија. „Наредете ги овие настани по временски редослед и покажете што следи што следи. Пронаоѓањето на првото домино е патот до основната причина.
- Побарајте хипотеза, а не докази. „Наведете ги можните основни причини по редослед на веројатност и дајте ми команда за верификација што ќе ја извршувам на системот за секоја од нив“. Побарајте дијагноза, а не резултат.
- Потврдете во системот. Тестирајте ја секоја хипотеза со дијагностички команди само за читање (log grep, статус барање, метрика). Елиминирајте додека не постои само една потврдена основна причина.
5 Зошто метод
Класичната и моќна алатка на RCA е „5 зошто“: почнувајќи со еден симптом и прашувајќи „зошто? пет пати. Со тоа што прашувате, доаѓате до основната причина под површинскиот симптом. Пример: "Ваб-страницата падна. Зошто? Апликацијата почина бидејќи снема меморија. Зошто? Барањето ја потроши целата меморија. Зошто? Барањето не користеше индекс. Зошто? Индексот беше избришан во последното издание. Зошто? Ова не беше забележано во прегледот на промените." Основната причина не е површината „падна страницата“, туку „слабиот процес на преглед на промените“. Вештачката интелигенција би била добар партнер во градењето на овој синџир - но мора да го поткрепите секој чекор „зошто“ со вистински докази, или вештачката интелигенција може да излезе со веродостојна, но лажна синџир.
три мини футроли
Случај 1 - 40.000 линии, 3 минути. Администратор почна рачно да скенира 40.000 линии дневници на апликации за време на прекин во текот на ноќта. Тој го даде соодветниот 20-минутен дел од маскираниот дневник на вештачката интелигенција и побара резиме и групирање. Вештачката интелигенција ја означи првата грешка OutOfMemory во 02:14, веднаш по зголемените грешки за истекување. Инженерот го добил временскиот лист за 3 минути; ја потврди оригиналната дијагноза на сопствената метричка табла.
Случај 2 - Враќање од погрешна основна причина. Еден тим сметаше дека првата хипотеза на вештачката интелигенција („дневниците го исполнија дискот“) е точна и ги исчистија дневниците. Но, инцидентот се повтори следниот ден. Во вториот круг, тие ги имплементираа „5 зошто“ со дисциплина: вистинската причина беше што грешката на апликацијата пишуваше стотици основни депонии во секунда. Првата хипотеза беше корелација; Вистинската причина беше поинаква. Прифаќањето без верификација обезбеди само еднодневно одложување.
Случај 3 - Времепловот го најде виновникот. Имаше дневници на десетици уреди за време на наизменичен прекин на мрежата. Инженерот ги дал маскираните дневници на вештачката интелигенција и побарал да создаде унифицирана временска рамка. Графиконот покажа дека секој прекин започнува точно 30 секунди по пораката за здравствена проверка на прекинувачот за технолошки вишок. Оваа корелација беше силна трага; Тимот ја потврди грешката на фирмверот на клучот на уредот и го замени.
Четири шаблони за копирање
1) Резиме и групирање на дневникот:
Подолу е маскиран дневник за [услуга] од 14:00 до 14:20 часот. Кажете ми: (1) групирајте ги и броете ги линиите по сериозност (ГРЕШКА/ПРЕДУПРЕДУВАЊЕ/ИНФО), (2) наведете ги првите 5 шеми на грешки кои се повторуваат, (3) пронајдете го временскиот печат на првата ГРЕШКА. Не го препишувајте необработениот дневник, само дајте структурирано резиме. Додавање составена линија.Дневник: [маскиран дневник]
2) Поставување временска рамка:
Следниве маскирани записи за настани ги подредивме во една временска линија (временски печат + извор + настан). Покажете го она што следи и означете го настанот што се чини дека е првиот активирач. Забележете дека ова е ХИПОТЕЗА и каузалноста треба да се потврди. Снимки: [маскирани снимки]
3) 5 причини поради кои RCA партнер:
Вашата улога: RCA олеснувач. Симптом: [симптом]. Направете ги „5-те зошто“ со мене: а „зошто?“ на секој чекор. Прашај, јас ќе одговорам со доказите што ги имам, ти постави го следното прашање. Ако мојот доказ е слаб, предупреди ме и кажи ми кои податоци треба да ги соберам. Не објавувајте основна причина без докази.
4) Хипотеза + команда за верификација:
Наведете ги можните основни причини за овој симптом [симптом] по редослед на веројатност. Од секоја причина: (а) во што се сомневате, (б) дајте ми команда за потврда САМО ЗА ЧИТАЊЕ да се извршува на мојот систем (без бришење/промена). Објаснете кој исход ја потврдува или побива хипотезата.
Слаб промпт / Силен промпт
Слаба навестување:
Што не е во ред со овој дневник? [10.000 линии суров трупец]
Ова ги поттикнува и протекуваат чувствителни податоци демаскирани и ја остава вештачката интелигенција без контекст. ВИ може да се сопне на случајна линија и да даде површна, па дури и измислена причина.
Моќен потсетник:
Вашата улога: постар SRE. Настан: услугата за плаќање даде 50% грешка помеѓу 02:10-02:25 часот. Подолу е маскиран дневник на тој прозорец. Дајте ми (1) резимето групирано по сериозност, (2) временскиот печат на првата грешка, (3) можните основни причини по редослед на веројатност и команда за проверка само за читање за секоја. Означете ги тврдењата за каузалност како хипотези. Дневник: [маскиран дневник]
чекор
Цел
Улогата на вештачката интелигенција
улогата на човекот
Резиме/групирање
намалување на бучавата
Конфигурирање на илјадници редови
Определете го опсегот и маската
времеплов
Наоѓање на првото домино
сортирање настани
Потврдете ги поштенските марки
генерирање хипотеза
сортирање на осомничените
наведете ги можностите
филтрирајте по контекст
верификација
најдете ја вистинската причина
Предложете дијагностичка команда
Извршете ја командата и коментирајте ја
одлука
Избор да се поправи
понуди опции
Донесете ја одлуката и потврдете
Вообичаени грешки
- Погрешна корелација за каузалност. Прифаќањето на две метрики кои се менуваат заедно како „едната го предизвикала другата“ произведува лажна корекција.
- Лепење на сировиот дневник без маска. Давањето на дневникот што содржи IP, токен и корисник на отворена алатка е безбедносно прекршување.
- Декларирање на првата хипотеза како основна причина. Прифаќањето на првиот предлог на вештачката интелигенција без да се потврди е покана за повторување на настанот.
- Извезување на целиот дневник. Огромниот дневник без контекст ја приклучува вештачката интелигенција во случајна линија; Собери до прозорецот на настанот.
- 5 причини без докази. Ако не направите резервна копија на секој чекор „зошто“ со вистински податоци, ќе завршите со веродостоен, но измислен синџир.
Совет: пред да завршите со RCA, прашајте „ако оваа основна причина е навистина поправена, нема ли да се случи повторно?“ Поставете го прашањето. Ако одговорот е „можеби“, сè уште не сте стигнале до основната причина; Прашајте друг „зошто“.
Сумирано
Анализата на дневниците е за пронаоѓање на сигналот во океан од бучава; Вештачката интелигенција го сумира и структурира овој океан во секунди, воспоставува временска линија и генерира хипотези. Но, корелацијата не е причинска врска: причината предложена од вештачката интелигенција е првично сомневање, а не наод додека не се потврди. Склопете го дневникот во прозорецот за настани, маскирајте го, побарајте структура, копнете длабоко со „5 зошто“ и тестирајте ја секоја хипотеза на системот со команди само за читање. Вие сте тој што ја наоѓа основната причина и ја потврдува исправката; ВИ е вашиот придружник.
Задача за апликација
Земете ги дневниците од минат настан (или тест настан), соберете ги во прозорецот за настани и маскирајте ги сите чувствителни области. Побарајте резиме и распоред од вештачката интелигенција со горенаведените шаблони „Резиме на дневник“ и „Времеплов“. Потоа преминете од симптом до основна причина со шаблонот „5 причини RCA партнер“; Напишете свој доказ за секој чекор. Конечно, тестирајте ја почетната хипотеза на вештачката интелигенција со команда за верификација и запишете дали е потврдена или отфрлена. Сумирајте го процесот во 6 ставки.
листа за проверка
- [ ] Дали го склопив дневникот во прозорецот за настани и ги маскирав чувствителните области?
- [ ] Дали побарав од вештачката интелигенција структурирано резиме и временска рамка, а не необработен дневник?
- [ ] Дали ги означив тврдењата за каузалност на ВИ како хипотези?
- [ ] Дали ја тестирав секоја хипотеза на системот со команда за проверка само за читање?
- [ ] Дали секој чекор од „5-те зошто“ го поткрепив со вистински докази?
- [ ] Дали се сомневав и донесов одлука дали основната причина навистина ќе го спречи настанот?