Добивки:
- Способност да се сумираат големи депонии од дневници со маскирање и филтрирање на вештачка интелигенција и создавање временска линија
- Да се биде во можност да се проценат временските врски воспоставени со ВИ како хипотези, а не како каузалност
- Способност да се потврди хипотезата за основната причина со метрика и код и да се подготви постмортална скица
Кога софтверот работи во производство (околина во живо), само трагите, метриката и дневниците (линиите за дневници со временски печат произведени од апликацијата додека работи) ви кажуваат што прави таа. Повлекувањето на значаен сигнал од илјадници, понекогаш и милиони, дневници за време на прекин е најстресниот и најкритичниот момент за одговор на инцидентот. Овде, вештачката интелигенција може да биде помошник, да резимира масивни текстови, да извлекува обрасци и да генерира хипотези - се додека ги почитувате ограничувањата за приватност и проверка.
Во оваа единица, учиме да користиме вештачка интелигенција во контекст на набљудување - способност да ја разбереме внатрешната состојба на системот со гледање на неговите надворешни излези: извлекување значење од бучавата од дневникот, утврдување на временската линија на грешка, наоѓање шеми за повторување и изготвување постмортам. Критично предупредување однапред: необработените дневници за производство често содржат лични податоци и тајни; Случајното ставање во алатка за вештачка интелигенција е сериозно прекршување.
Зошто дневниците се тешки, зошто вештачката интелигенција е корисна?
Дневниците се тешки поради три причини: јачина на звук (има премногу), шум (многу линии се неважни) и неред (настанот е расфрлен низ дневниците на различни услуги). Човечкото око се уморува во овој куп и ја промашува важната линија.
Вештачката интелигенција е добра во сумирање на големи блокови од текст, броење на обрасци кои се повторуваат и прашува „што се смени пред тој наплив на грешки? Тој е моќен во воспоставувањето временски врски како што се Сепак, постојат две граници. Првиот е контекстниот прозорец: количината на дневници што може да ги соберете во модел е ограничена, така што прво треба да филтрирате и да земете примерок. Второ, валидација: вештачката интелигенција која вели „тука е основната причина“ е хипотеза; Не донесувајте одлука без да ја потврдите со метрика и код.
Внимание: Дневниците на необработеното производство може да содржат IP адреса, е-пошта, токен, ID на сесија и понекогаш отворена тајна. Маскирајте ги пред да ги нахраните со вештачка интелигенција или користете само алатки кои се одобрени од претпријатието, обезбедени со податоци. Оваа тема ја продлабочуваме во единица 10.
Чекор по чекор: од дневник до основна причина
- Стеснете го временскиот прозорец. Определете ги записниците кога настанот започнал; Испитај го тој прозорец, а не цел ден.
- Филтрирајте ја бучавата. Отстранете ги познатите повторливи, безопасни линии; Фокусирајте се на грешката (ERROR), предупредувањето (WARN) и првиот момент на отстапување.
- Маскирај ги чувствителните податоци. Исчистете ги личните податоци и тајни пред да ги дадете на вештачката интелигенција.
- Направете резиме и временска рамка. Побарајте од вештачката интелигенција да го сумира настанот во хронологија („прво ова, потоа она“).
- Потврдете ја хипотезата со метрика и код. Причината посочена од АИ; Потврдете со контролната табла, релевантниот код и временската рамка за распоредување, доколку е применливо.
- Наученото ставете го во писмена форма. Направете постмортална скица и наведете превентивни активности.
Три мини футроли
Случај 1 — 40.000 редови сумирани во 5 минути. Услуга за плаќање пријави наизменична грешка за 12 минути. Тимот го нахрани соодветниот 20-минутен прозорец со маскирани дневници (приближно 40.000 линии, земени примероци) на вештачката интелигенција и генерираше временска рамка. Моделот покажа дека пукањето на грешката се совпадна со моментот кога времето на одговор на услугата за зависност се зголеми од 200 ms на 8 секунди. Тимот го потврди ова на контролната табла и ја намали причината во рок од 10 минути.
Случај 2 - Лажна корелација. Во друг инцидент, вештачката интелигенција ја обвини велејќи дека грешките се случуваат „во исто време“ како извршување на cron (закажано задача). Кога тимот ги проверил метриките, тие виделе дека кронот всушност завршил пред настанот; Корелацијата беше случајност. Вистинската причина беше истекување на меморијата. Поука: Временската корелација воспоставена од вештачката интелигенција е поим, а не доказ.
Случај 3 - Постморта е забрзана. По прекинот, тимот ги нахранил (маскираните) транскрипти на пораката и временската линија од каналот на настанот до вештачката интелигенција и го наложиле да произведе постмортална скица: резиме, влијание, временска рамка, основна причина, дејства. Човечкиот уредник ги коригирал фактите и назначил сопственици на акции. Документот, кој обично трае 2 часа, беше завршен за приближно 40 минути со поконзистентна структура.
Четири шаблони за копирање
Резиме на дневник и временска линија (со маскиран дневник):
Подолу е прозорец за настани од маскираниот дневник за производство.1) Истурете го настанот во хронолошка временска линија (означете го моментот на првото отстапување).2) Бројте ги и групирајте ги најчесто повторуваните типови на грешки/предупредувања.3) „Што се промени непосредно порано?“ Наведете ги кандидатските настани за прашањето. Ова се хипотези; Означете го како „мора да се потврди“. {{ дневници }}
Извлекување на шема на грешка:
Најдете повторливи шеми на грешки во овие линии за дневници. За секоја шема: примерок линија (маскиран), проценет извор и можно значење. Соберете ретки, но критични единечни грешки во посебна листа „внимание“.{{ дневници}}
Структурно барање/генерирање филтри:
За {{log tool: grep/jq/Kibana KQL/CloudWatch Insights}}, напишете барање што го исполнува следниот услов: {{на пр. 5xx грешки во последните 15 минути, со исклучок на корисникот X}}. Објаснете го барањето; Осигурајте се дека не ги измислувате имињата на домени, прашајте дали не сте сигурни.
Постмортална скица:
Напишете постмортем скица од следнава (маскирана) временска линија за настани: Резиме / Влијание (времетраење, засегнат од корисникот) / Времеплов / Основна причина / Што помина добро / Дејства (оставете го полето на сопственикот празно за секој). НЕ користете обвинувачки јазик; Бидете фактички и проактивни.{{времеплов}}
Слаб промпт / Силен промпт
Слаб: "Погледни ги овие трупци, што не е во ред?" (Сурови дневник од целиот ден, со лични податоци, нетаргетирани.)
Силно: „Подолу е маскиран дневник за производство од 14:02–14:20 (филтриран на 5xxs). Во овој прозорец, пронајдете го моментот кога започнала грешката, избројте го најчестиот тип на грешка и наведете ги отстапувањата што се појавиле во 60 секунди непосредно пред експлозијата; означете ги сите како „хипотеза што треба да се потврди“.
Моќна верзија; Го стеснува временскиот прозорец, го филтрира и маскира дневникот, поставува јасно прашање и од самиот почеток утврдува дека излезот е хипотеза.
Потрага
ВИ е силна
Ограничување / верификација
Резиме на голем дневник
Да, брзо
Може да има загуба на земање мостри
Воспоставување на временска врска
генерира навестувања
Корелација ≠ каузалност
Генерирање на барање/филтри
добар нацрт
Дали имињата на домени се реални?
Постмортална скица
Структура и јазик
Случаите се човечки потврдени
Корелацијата не е причинско-последична врска
Најчеста замка во анализата на дневниците е заблудата „тоа се случи во исто време, па затоа“. ВИ паѓа во оваа замка лесно, ако не и полесно, отколку луѓето; затоа што мисли дека истовременоста во текстот е силен сигнал. Да може да каже дека еден настан всушност води до друг; Потребен е тајминг, механизам и, ако е можно, повторливост. За секое каузално тврдење што го утврдува вештачката интелигенција, прашуваме „кои други докази го потврдуваат ова? Тестирајте го со прашањето.
Совет: Кога се најавувате на вештачката интелигенција, наместо депонија за текст, ако е можно, прво испечатете барање/филтер и стартувајте го во вашето возило; На овој начин и двајцата ги намалувате чувствителните податоци и го одделувате контекстниот прозорец на моделот во навистина важните редови.
Вообичаени грешки
- Лепење суров, демаскиран дневник. Откривање на лични податоци и тајни; сериозно нарушување на приватноста.
- Давање на цел ден одеднаш. Го надминува контекстниот прозорец, сигналот е удавен во бучава.
- Погрешна корелација за каузалност. Временската врска воспоставена со вештачката интелигенција е поим, а не доказ.
- Потпирајќи се на барање со измислено име на домен. Моделот може да предложи име на поле за дневник што не постои; проверете со шемата.
- Објавување на постмортемот без да се потврди. Фактите и бројките за влијанието мора да бидат човечко потврдени.
Сумирано
Вештачката интелигенција е моќна алатка за надминување на јачината и бучавата во анализата на дневниците: сумирање на големи транскрипти, воспоставување временски линии, извлекување обрасци и подготовка на постмортални скици. Но, запомнете три ограничувања: не извезувајте чувствителни податоци без да ги маскирате, филтрирајте и примерете ги за да одговараат на контекстниот прозорец и проверете го секое тврдење за каузалност со метрика и код. Корелацијата не е причинско-последична врска; Вештачката интелигенција дава индиции, вие ја донесувате одлуката со докази.
Задача за апликација
Изберете прозорец од 15–20 минути од дневникот за настан или тест средина што го имате. Прво маскирајте ги личните податоци и тајните (или изгответе синтетички дневник). Потоа извлечете ја хронологијата и најчестите типови на грешки од вештачката интелигенција со шаблонот „резиме на дневник и временска рамка“. Обидете се да ја потврдите хипотезата за основната причина што вештачката интелигенција ја предложи со метрика или парче код што го имате: дали хипотезата се одржа или беше погрешна корелација? Запишете го вашиот наод во една реченица.
листа за проверка
- [ ] Ги маскирам личните податоци и тајните пред да го дадам дневникот на вештачката интелигенција.
- [ ] Ја намалувам анализата на тесен временски прозорец и филтрирам.
- [ ] Јас ги гледам временските односи воспоставени од ВИ како хипотези, а не како каузалност.
- [ ] Го потврдувам тврдењето за основната причина со метрика и код.
- [ ] Потврдувам дека имињата на домени на барањата/филтрите што ги генерирам се реални.
- [ ] Човечки ги потврдувам фактите и бројките во постморталната скица.