એકમ 7 / 12

લોગ વિશ્લેષણ અને અવલોકનક્ષમતા

નફો:

  • મોટા લોગ ડમ્પ્સને AI માં માસ્ક કરીને અને ફિલ્ટર કરીને અને સમયરેખા બનાવીને સારાંશ આપવાની ક્ષમતા
  • AI દ્વારા પ્રસ્થાપિત સમયના સંબંધોને પૂર્વધારણા તરીકે મૂલ્યાંકન કરવામાં સક્ષમ બનવું, કાર્યકારણ તરીકે નહીં
  • મેટ્રિક્સ અને કોડ સાથે મૂળ કારણની પૂર્વધારણાને માન્ય કરવાની અને પોસ્ટમોર્ટમ સ્કેચ તૈયાર કરવાની ક્ષમતા

જ્યારે કોઈ સોફ્ટવેર પ્રોડક્શનમાં ચાલી રહ્યું હોય (લાઇવ એન્વાયર્નમેન્ટ), ત્યારે માત્ર ટ્રેસ, મેટ્રિક્સ અને લૉગ્સ (તે ચાલુ હોય ત્યારે એપ્લિકેશન દ્વારા ઉત્પાદિત સમય-સ્ટેમ્પ્ડ લોગ લાઇન્સ) તમને જણાવે છે કે તે શું કરી રહ્યું છે. આઉટેજ દરમિયાન હજારો, ક્યારેક લાખો, લોગ લાઇનમાંથી અર્થપૂર્ણ સિગ્નલ ખેંચવું એ ઘટના પ્રતિભાવની સૌથી તણાવપૂર્ણ અને સમય-નિર્ણાયક ક્ષણ છે. અહીં, AI સહાયક બની શકે છે, વિશાળ ટેક્સ્ટનો સારાંશ આપી શકે છે, પેટર્ન કાઢી શકે છે અને પૂર્વધારણાઓ જનરેટ કરી શકે છે — જ્યાં સુધી તમે ગોપનીયતા અને ચકાસણી મર્યાદાઓનો આદર કરો છો.

આ એકમમાં, આપણે અવલોકનક્ષમતાના સંદર્ભમાં AI નો ઉપયોગ કરવાનું શીખીએ છીએ - તેના બાહ્ય આઉટપુટને જોઈને સિસ્ટમની આંતરિક સ્થિતિને સમજવાની ક્ષમતા: લોગ અવાજમાંથી અર્થ કાઢવો, ભૂલની સમયરેખા સ્થાપિત કરવી, પુનરાવર્તિત પેટર્ન શોધવી અને પોસ્ટમોર્ટમનો મુસદ્દો તૈયાર કરવો. ગંભીર ચેતવણી: કાચા ઉત્પાદન લોગમાં ઘણીવાર વ્યક્તિગત ડેટા અને રહસ્યો હોય છે; આડેધડ રીતે તેમને AI ટૂલમાં ચોંટાડવું એ ગંભીર ઉલ્લંઘન છે.

શા માટે લોગ્સ મુશ્કેલ છે, શા માટે AI મદદરૂપ છે?

લોગ ત્રણ કારણોસર મુશ્કેલ છે: વોલ્યુમ (ઘણા બધા છે), ઘોંઘાટ (ઘણી રેખાઓ અપ્રસ્તુત છે), અને ક્લટર (એક ઘટના વિવિધ સેવાઓના લોગમાં ફેલાયેલી છે). માનવ આંખ આ થાંભલામાં થાકી જાય છે અને મહત્વપૂર્ણ લાઇન ચૂકી જાય છે.

AI ટેક્સ્ટના મોટા બ્લોક્સનો સારાંશ આપવા, પુનરાવર્તિત પેટર્નની ગણતરી કરવા અને "ભૂલોના વિસ્ફોટ પહેલા શું બદલાયું છે?" તે સમય સંબંધો સ્થાપિત કરવામાં શક્તિશાળી છે જેમ કે જો કે, ત્યાં બે મર્યાદાઓ છે. પ્રથમ સંદર્ભ વિન્ડો છે: તમે મોડેલમાં ફિટ કરી શકો છો તે લોગની સંખ્યા મર્યાદિત છે, તેથી તમારે પહેલા ફિલ્ટર અને નમૂના લેવાની જરૂર છે. બીજું, માન્યતા: AI કહે છે કે "અહીં મૂળ કારણ છે" એ એક પૂર્વધારણા છે; મેટ્રિક્સ અને કોડ સાથે તેની પુષ્ટિ કર્યા વિના નિર્ણય ન લો.

સાવધાન: કાચા ઉત્પાદન લોગમાં IP સરનામું, ઈમેલ, ટોકન, સત્ર ID અને ક્યારેક ઓપન સિક્રેટ હોઈ શકે છે. તેમને AI માં ખવડાવતા પહેલા તેમને માસ્ક કરો અથવા ફક્ત એન્ટરપ્રાઇઝ-મંજૂર, ડેટા-સુરક્ષિત સાધનોનો ઉપયોગ કરો. અમે એકમ 10 માં આ વિષયને વધુ ગહન કરીએ છીએ.

સ્ટેપ બાય સ્ટેપ: લોગથી રુટ કોઝ સુધી

  1. સમય વિન્ડો સાંકડી. જ્યારે ઇવેન્ટ શરૂ થઈ ત્યારે મિનિટો નક્કી કરો; તે વિંડોની તપાસ કરો, આખો દિવસ નહીં.
  2. અવાજને ફિલ્ટર કરો. જાણીતી પુનરાવર્તિત, હાનિકારક રેખાઓ બહાર કાઢો; ભૂલ (ERROR), ચેતવણી (WARN) અને પ્રથમ વિચલન ક્ષણ પર ધ્યાન કેન્દ્રિત કરો.
  3. સંવેદનશીલ ડેટાને માસ્ક કરો. વ્યક્તિગત ડેટા અને રહસ્યોને AI ને આપતા પહેલા તેને સાફ કરો.
  4. સારાંશ અને સમયરેખા બનાવો. AI ને ઘટનાક્રમમાં ઘટનાનો સારાંશ આપવા માટે કહો ("પહેલા આ, પછી તે").
  5. મેટ્રિક્સ અને કોડ સાથે પૂર્વધારણાને માન્ય કરો. AI દ્વારા નિર્દેશિત કારણ; જો લાગુ હોય તો ડેશબોર્ડ, સંબંધિત કોડ અને ડિપ્લોયમેન્ટ સમયરેખા સાથે પુષ્ટિ કરો.
  6. જે શીખ્યા તે લેખિતમાં મૂકો. પોસ્ટમોર્ટમ સ્કેચ બનાવો અને નિવારક ક્રિયાઓની સૂચિ બનાવો.

ત્રણ મિની કેસ

કેસ 1 — 5 મિનિટમાં 40,000 લાઇનોનો સારાંશ. ચુકવણી સેવાએ 12 મિનિટ માટે તૂટક તૂટક ભૂલની જાણ કરી. ટીમે AI ને સંબંધિત 20-મિનિટની માસ્ક્ડ લૉગ્સ (અંદાજે 40,000 લાઇન, નમૂનારૂપ) ફીડ કરી અને સમયરેખા જનરેટ કરી. મોડેલે દર્શાવ્યું હતું કે ભૂલ તે ક્ષણ સાથે એકરુપ હતી જ્યારે નિર્ભરતા સેવાનો પ્રતિભાવ સમય 200 ms થી વધીને 8 સેકન્ડ થયો હતો. ટીમે ડેશબોર્ડ પર આની પુષ્ટિ કરી અને 10 મિનિટની અંદર કારણને સંકુચિત કર્યું.

કેસ 2 - ભ્રામક સહસંબંધ. અન્ય એક ઘટનામાં, AI એ ક્રોન (શેડ્યુલ્ડ ટાસ્ક) રન તરીકે "તે જ સમયે" થઈ રહી હોવાનું કહીને તેને દોષી ઠેરવ્યો હતો. જ્યારે ટીમે મેટ્રિક્સ તપાસ્યા, ત્યારે તેઓએ જોયું કે ક્રોન ખરેખર ઇવેન્ટ પહેલા સમાપ્ત થઈ ગયું હતું; સહસંબંધ સંયોગ હતો. વાસ્તવિક કારણ મેમરી લીક હતું. પાઠ: AI દ્વારા સ્થાપિત સમયનો સહસંબંધ એ એક ચાવી છે, પુરાવા નથી.

કેસ 3 - પોસ્ટમોર્ટમ ઝડપી. આઉટેજ પછી, ટીમે ઇવેન્ટ ચેનલમાંથી AI ને (માસ્ક્ડ) મેસેજ ટ્રાન્સક્રિપ્ટ અને સમયરેખા ખવડાવી અને તેને પોસ્ટમોર્ટમ સ્કેચ બનાવ્યો: સારાંશ, અસર, સમયરેખા, મૂળ કારણ, ક્રિયાઓ. માનવ સંપાદકે હકીકતો સુધારી અને કાર્યવાહીના માલિકોની નિમણૂક કરી. દસ્તાવેજ, જે સામાન્ય રીતે 2 કલાક લે છે, તે વધુ સુસંગત માળખું સાથે લગભગ 40 મિનિટમાં પૂર્ણ થયું હતું.

ચાર નકલ કરી શકાય તેવા નમૂનાઓ

લોગ સારાંશ અને સમયરેખા (માસ્ક્ડ લોગ સાથે):

નીચે માસ્ક્ડ પ્રોડક્શન લોગની ઇવેન્ટ વિન્ડો છે. 1) ઇવેન્ટને કાલક્રમિક સમયરેખામાં રેડો (પ્રથમ વિચલનની ક્ષણને ચિહ્નિત કરો). 2) સૌથી વધુ વારંવાર આવતી ભૂલ/ચેતવણીના પ્રકારોની ગણતરી કરો અને જૂથ બનાવો.3) "હમણાં પહેલા શું બદલાયું?" પ્રશ્ન માટે ઉમેદવારની ઘટનાઓની યાદી બનાવો. આ પૂર્વધારણાઓ છે; તેને "ચકાસાયેલ હોવું આવશ્યક છે" તરીકે ચિહ્નિત કરો. {{લોગ}}

ભૂલ પેટર્ન નિષ્કર્ષણ:

આ લોગ લાઈનોમાં રિકરિંગ એરર પેટર્ન શોધો. દરેક પેટર્ન માટે: નમૂના રેખા (માસ્ક્ડ), અંદાજિત સ્ત્રોત અને સંભવિત અર્થ. એક અલગ "ધ્યાન" સૂચિમાં દુર્લભ પરંતુ ગંભીર એકલ ભૂલો એકત્રિત કરો.{{logs}}

સ્ટ્રક્ચર્ડ ક્વેરી/ફિલ્ટર જનરેશન:

{{લોગ ટૂલ: grep/jq/Kibana KQL/CloudWatch Insights}} માટે, નીચેની શરતને પૂર્ણ કરતી ક્વેરી લખો: {{દા.ત. છેલ્લા 15 મિનિટમાં 5xx ભૂલો, વપરાશકર્તા X}}ને બાદ કરતાં. ક્વેરી સમજાવો; ખાતરી કરો કે તમે ડોમેન નામો બનાવતા નથી, જો તમને ખાતરી ન હોય તો પૂછો.

પોસ્ટમોર્ટમ સ્કેચ:

નીચેની (માસ્ક્ડ) ઇવેન્ટ સમયરેખામાંથી પોસ્ટમોર્ટમ સ્કેચ લખો: સારાંશ / અસર (સમયગાળો, વપરાશકર્તા અસરગ્રસ્ત) / સમયરેખા / મૂળ કારણ / શું સારું થયું / ક્રિયાઓ (દરેક માટે માલિક ફીલ્ડ ખાલી છોડો). આક્ષેપાત્મક ભાષાનો ઉપયોગ કરશો નહીં; હકીકતલક્ષી અને સક્રિય બનો.{{timeline}}

નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ

નબળા: "આ લોગ જુઓ, શું ખોટું છે?" (વ્યક્તિગત ડેટા સાથે, આખા દિવસનો કાચો લોગ, લક્ષ્ય વિનાનો.)
સશક્ત: "નીચે 14:02–14:20 (5xxs પર ફિલ્ટર કરેલ) નો માસ્ક કરેલ પ્રોડક્શન લોગ છે. આ વિન્ડોમાં, જ્યારે ભૂલ બર્સ્ટ શરૂ થઈ ત્યારે તે ક્ષણ શોધો, સૌથી વધુ વારંવાર આવતી ભૂલના પ્રકારને ગણો, અને વિસ્ફોટની તરત પહેલા 60 સેકન્ડમાં દેખાતા વિચલનોની સૂચિ બનાવો; તે બધાને 'હાઇપોથિસિસ' તરીકે ચિહ્નિત કરો."

શક્તિશાળી સંસ્કરણ; તે ટાઈમ વિન્ડોને સાંકડી કરે છે, લોગને ફિલ્ટર કરે છે અને માસ્ક કરે છે, સ્પષ્ટ પ્રશ્ન પૂછે છે અને શરૂઆતથી જ સ્થાપિત કરે છે કે આઉટપુટ એક પૂર્વધારણા છે.

ક્વેસ્ટ

AI મજબૂત છે

મર્યાદા / ચકાસણી

મોટા લોગ સારાંશ

હા, ઝડપી

સેમ્પલિંગની ખોટ હોઈ શકે છે

સમય સંબંધની સ્થાપના

સંકેતો પેદા કરે છે

સહસંબંધ ≠ કારણ

ક્વેરી/ફિલ્ટર જનરેશન

સારો ડ્રાફ્ટ

શું ડોમેન નામો વાસ્તવિક છે?

પોસ્ટમોર્ટમ સ્કેચ

માળખું અને ભાષા

કેસો માનવ પુષ્ટિ થયેલ છે

સહસંબંધ એ કારણ નથી

લોગ પૃથ્થકરણમાં સૌથી સામાન્ય ક્ષતિ એ છે કે "તે તે જ સમયે થયું, તેથી જ" ભ્રમણા. AI આ જાળમાં માણસો કરતાં આસાનીથી, જો વધુ સરળતાથી નહીં, તો પડે છે; કારણ કે તે વિચારે છે કે ટેક્સ્ટમાં એક સાથે એક મજબૂત સંકેત છે. એવું કહેવા માટે સમર્થ થવા માટે કે એક ઘટના વાસ્તવમાં બીજી ઘટના તરફ દોરી જાય છે; સમય, પદ્ધતિ અને, જો શક્ય હોય તો, પુનરાવર્તિતતા જરૂરી છે. દરેક કાર્યકારણ દાવા માટે કે જે AI સ્થાપિત કરે છે, અમે પૂછીએ છીએ કે "અન્ય કયા પુરાવા આની પુષ્ટિ કરે છે?" પ્રશ્ન સાથે તેનું પરીક્ષણ કરો.

ટીપ: AI માં લોગીંગ કરતી વખતે, ટેક્સ્ટ ડમ્પને બદલે, જો શક્ય હોય તો, પહેલા ક્વેરી/ફિલ્ટર પ્રિન્ટ કરો અને તેને તમારા વાહનમાં ચલાવો; આ રીતે તમે બંને સંવેદનશીલ ડેટા ઘટાડી શકો છો અને મોડેલની સંદર્ભ વિન્ડોને ખરેખર મહત્વપૂર્ણ પંક્તિઓમાં અલગ કરો છો.

સામાન્ય ભૂલો

  • કાચો, અનમાસ્ક્ડ લોગ પેસ્ટ કરી રહ્યું છે. વ્યક્તિગત ડેટા અને રહસ્યોની જાહેરાત; ગોપનીયતાનો ગંભીર ભંગ.
  • એકસાથે આખો દિવસ આપવો. તે સંદર્ભ વિંડોને ઓળંગે છે, સિગ્નલ અવાજમાં ડૂબી જાય છે.
  • કાર્યકારણ માટે સહસંબંધની ભૂલ. AI દ્વારા સ્થાપિત સમયનો સંબંધ એક ચાવી છે, પુરાવા નથી.
  • મેડ-અપ ડોમેન નામ સાથેની ક્વેરી પર આધાર રાખવો. મોડેલ લોગ ફીલ્ડનું નામ સૂચવી શકે છે જે અસ્તિત્વમાં નથી; યોજનાકીય સાથે ચકાસો.
  • તેની ચકાસણી કર્યા વિના પોસ્ટમોર્ટમ પ્રકાશિત કરવું. હકીકતો અને અસરના આંકડા માનવ દ્વારા પુષ્ટિ થયેલ હોવા જોઈએ.

સારાંશમાં

AI એ લોગ વિશ્લેષણમાં વોલ્યુમ અને ઘોંઘાટને હરાવવા માટે એક શક્તિશાળી સાધન છે: મોટા ટ્રાન્સક્રિપ્ટનો સારાંશ, સમયરેખા સ્થાપિત કરવા, પેટર્ન કાઢવા અને પોસ્ટમોર્ટમ સ્કેચ તૈયાર કરવા. પરંતુ ત્રણ મર્યાદાઓ યાદ રાખો: સંવેદનશીલ ડેટાને માસ્ક કર્યા વિના નિકાસ કરશો નહીં, તેને ફિલ્ટર કરો અને તેને સંદર્ભ વિન્ડોમાં ફિટ કરવા માટે નમૂના બનાવો અને દરેક કાર્યકારણના દાવાને મેટ્રિક્સ અને કોડ સાથે ચકાસો. સહસંબંધ એ કારણ નથી; AI સંકેતો આપે છે, તમે પુરાવા સાથે નિર્ણય લો.

એપ્લિકેશન કાર્ય

તમારી પાસે હોય તે ઇવેન્ટ અથવા ટેસ્ટ એન્વાયર્નમેન્ટ લોગમાંથી 15-20 મિનિટની વિન્ડો પસંદ કરો. પ્રથમ વ્યક્તિગત ડેટા અને રહસ્યોને માસ્ક કરો (અથવા સિન્થેટીક લોગ બનાવો). પછી "લોગ સારાંશ અને સમયરેખા" ટેમ્પલેટ સાથે AI માંથી ઘટનાક્રમ અને સૌથી વધુ વારંવાર આવતી ભૂલના પ્રકારો કાઢો. તમારી પાસે મેટ્રિક અથવા કોડના ટુકડા સાથે AI એ આગળ મૂકેલ મૂળ કારણની પૂર્વધારણાને ચકાસવાનો પ્રયાસ કરો: શું પૂર્વધારણા પકડી રાખે છે, અથવા તે ભ્રામક સહસંબંધ હતો? તમારી શોધને એક વાક્યમાં લખો.

ચેકલિસ્ટ

  • [ ] હું AI ને લોગ આપતા પહેલા અંગત ડેટા અને રહસ્યોને માસ્ક કરું છું.
  • [ ] હું વિશ્લેષણને સાંકડી સમયની વિન્ડો અને ફિલ્ટરમાં ઘટાડું છું.
  • [ ] હું AI દ્વારા સ્થાપિત સમયના સંબંધોને પૂર્વધારણા તરીકે જોઉં છું, કાર્યકારણ તરીકે નહીં.
  • [ ] હું મેટ્રિક્સ અને કોડ સાથે મૂળ કારણ દાવાની ચકાસણી કરું છું.
  • [ ] હું પુષ્ટિ કરું છું કે મેં જનરેટ કરેલી ક્વેરી/ફિલ્ટર્સના ડોમેન નામો વાસ્તવિક છે.
  • [ ] હું પોસ્ટમોર્ટમ સ્કેચમાંના તથ્યો અને આંકડાઓને માનવીય રીતે પ્રમાણિત કરું છું.