એકમો
1. ડેટા વિજ્ઞાન અને વિશ્લેષણમાં કૃત્રિમ બુદ્ધિનો પરિચય: વર્કફ્લો, ભૂમિકાઓ, સીમાઓ, માન્યતા અને નીતિશાસ્ત્ર 2. ડેટા કલેક્શન અને સોર્સ અન્ડરસ્ટેન્ડિંગ: સ્કીમા, સેમ્પલિંગ, ક્વોલિટી અને લીક અવેરનેસ 3. ડેટા ક્લીનિંગ અને પ્રીપ્રોસેસિંગ: ખૂટતું મૂલ્ય, આઉટલાયર અને પ્રકારનું રૂપાંતરણ 4. સંશોધનાત્મક ડેટા વિશ્લેષણ (EDA): વિતરણ, સંબંધો અને પ્રારંભિક આંતરદૃષ્ટિ 5. ફિચર એન્જિનિયરિંગ: વેરિઅન્ટ્સ જનરેટ કરવું, કોડિંગ, સ્કેલિંગ અને લિકેજ ટાળવું 6. મોડલ બિલ્ડીંગ: સમસ્યાની વ્યાખ્યા, અલ્ગોરિધમ પસંદગી અને તાલીમ/પરીક્ષણ વિભાજન 7. મોડલ મૂલ્યાંકન: મેટ્રિક્સ, ક્રોસ-વેલિડેશન અને એક્સ્ટ્રીમ લર્નિંગ 8. વિઝ્યુલાઇઝેશન અને સ્ટોરીટેલિંગ: સચોટ ગ્રાફિક્સ, પ્રમાણિક ગ્રાફિક્સ 9. કોડ જનરેશન: પાયથોન (પાંડા) અને SQL સાથે AI-આસિસ્ટેડ વિશ્લેષણ 10. ડેટા લિકેજ અને પુનઃઉત્પાદનક્ષમતા: સાયલન્ટ ડિઝાસ્ટર અને શિસ્ત 11. MLOps ફાઉન્ડેશન, એથિક્સ, પ્રાઈવસી અને રિસ્પોન્સિબલ એનાલિટિક્સ
એકમ 2 / 11

ડેટા કલેક્શન અને સોર્સ અન્ડરસ્ટેન્ડિંગ: સ્કીમા, સેમ્પલિંગ, ક્વોલિટી અને લીક અવેરનેસ

નફો:

  • વિવિધ ડેટા સ્ત્રોતો (ડેટાબેઝ, API, ફાઇલ, વેબ સ્ક્રેપિંગ) અને દરેકની ખામીઓને ઓળખવાની ક્ષમતા અને સ્કીમાને યોગ્ય રીતે સમજવાની ક્ષમતા
  • નમૂના વસ્તી અને પસંદગીના પૂર્વગ્રહનું પ્રતિનિધિત્વ કરે છે કે કેમ તેનું મૂલ્યાંકન કરીને પુનરાવર્તિત નમૂના લેવાની ક્ષમતા
  • સંગ્રહના તબક્કે ડેટા લીકેજને દૂર કરવાની ક્ષમતા અને દરેક કૉલમમાં 'શું આગાહી સમયે મારી પાસે હશે' એવો પ્રશ્ન પૂછીને કાનૂની/નૈતિક સીમાઓનું પાલન કરવાની ક્ષમતા?

દરેક વિશ્લેષણ તમે એકત્રિત કરો છો તે ડેટાની ગુણવત્તા જેટલું સારું છે. વિશ્વનું સૌથી અદ્યતન મોડલ પણ અવિશ્વસનીય પરિણામો ઉત્પન્ન કરશે જો તે ખોટી રીતે એકત્રિત કરવામાં આવેલ ડેટા સાથે કામ કરે છે, પક્ષપાતી રીતે નમૂના લેવામાં આવે છે અથવા ભવિષ્ય વિશેની માહિતી ધરાવે છે. કોમ્પ્યુટર વિજ્ઞાનમાં, આ સિદ્ધાંતનો સારાંશ "કચરો અંદર, કચરો બહાર" (કચરો અંદર, કચરો બહાર) તરીકે આપવામાં આવે છે. આ એકમમાં, અમે ડેટા કલેક્શનના તબક્કાને આવરી લઈશું: સ્ત્રોતને સમજવું, સેમ્પલિંગ કરવું, ગુણવત્તાયુક્ત પ્રશ્નો પૂછવા અને પહેલા દિવસથી ડેટા લીક થવાના જોખમ પ્રત્યે સજાગ રહેવું. આ તબક્કે કૃત્રિમ બુદ્ધિ એક શક્તિશાળી સહાયક છે; SQL ક્વેરી લખે છે, API દસ્તાવેજનો સારાંશ આપે છે, ડેટા કોન્ટ્રાક્ટ ડ્રાફ્ટ કરે છે. પરંતુ તે માણસ છે જે નક્કી કરે છે કે તમે કયો ડેટા એકત્રિત કરો છો અને તે ડેટા તમને રજૂ કરે છે કે કેમ.

ડેટા સ્ત્રોતો વિશે જાણકારી મેળવવી

ડેટા વિવિધ સ્થળોએથી આવે છે, અને દરેક સ્ત્રોતની પોતાની ખામીઓ હોય છે. ડેટાબેઝ (કોષ્ટકોમાં સંગ્રહિત સ્ટ્રક્ચર્ડ ડેટા, સામાન્ય રીતે એસક્યુએલ સાથે પૂછવામાં આવે છે) સૌથી સામાન્ય સ્ત્રોત છે; તે વિશ્વસનીય છે, પરંતુ તેની યોજનાને સારી રીતે સમજવી જરૂરી છે. API (એપ્લિકેશન પ્રોગ્રામિંગ ઈન્ટરફેસ) લાઈવ ડેટા પ્રદાન કરે છે પરંતુ ઝડપ મર્યાદા અને ફોર્મેટ ફેરફારોનું જોખમ વહન કરે છે. ફાઇલો (CSV, Excel, JSON) લવચીક છે પરંતુ ફોર્મેટમાં અસંગતતાની સંભાવના છે. વેબ સ્ક્રેપિંગ શક્તિશાળી છે, પરંતુ તેની કાનૂની અને નૈતિક મર્યાદાઓ છે; દરેક સાઇટને સ્ક્રેપ કરી શકાતી નથી.

ધ્યાન: વેબ સ્ક્રેપિંગ અને સ્વચાલિત ડેટા સંગ્રહ માટે, સાઇટની ઉપયોગની શરતો, robots.txt ફાઇલ અને KVKK/GDPRનું પાલન કરો. અનધિકૃત ડેટા સંગ્રહ કાનૂની જવાબદારી બનાવે છે. માહિતી સુરક્ષાના સંદર્ભમાં, ડેટા સંગ્રહ સાધનોનો ઉપયોગ ફક્ત તે સિસ્ટમ પર કરો કે જેના માટે તમે અધિકૃત છો અને સંરક્ષણ/વિશ્લેષણ હેતુઓ માટે; અનધિકૃત ઍક્સેસ અથવા સ્ક્રેપિંગ પ્રતિબંધિત છે.

સ્કીમાને સમજવું: ડેટા સાથે પરિચિત થવું

ડેટા સેટ એકત્રિત કરતા પહેલા, તમારે તેની સ્કીમા (કૉલમના નામ, તેમના ડેટા પ્રકારો, તેમના અર્થો અને એકબીજા સાથેના તેમના સંબંધો) ને સમજવું આવશ્યક છે. AI અહીં "ડેટા શબ્દકોશ" બનાવવા માટે ખૂબ જ ઉપયોગી છે — દરેક કૉલમનો અર્થ શું છે તે સમજાવતું કોષ્ટક. પરંતુ AI જે સ્પષ્ટીકરણો ઉત્પન્ન કરે છે તે આગાહીઓ છે; ડેટા બનાવનાર ટીમ સાથે દરેક કૉલમના સાચા અર્થની પુષ્ટિ કરો. ઉદાહરણ તરીકે, "સ્ટેટસ" નામની કૉલમમાં 0/1/2 હોઈ શકે છે; ફક્ત મૂળ ટીમ જ જાણે છે કે આ "બાકી/મંજૂર/રદ" છે કે બીજું કંઈક.

નીચેનું કોષ્ટક મૂળભૂત સંસાધન પ્રકારો અને સાવચેતીઓનો સારાંશ આપે છે:

સ્ત્રોત

મજબૂત બિંદુ

છટકું

AI કેવી રીતે મદદ કરે છે

SQL ડેટાબેઝ

માળખાકીય, વિશ્વસનીય

જટિલ જોડાઓ

ક્વેરી ડ્રાફ્ટ લખે છે

API

જીવંત ડેટા

ઝડપ મર્યાદા, આકાર ફેરફાર

દસ્તાવેજ સારાંશ, પુલ કોડ

CSV/Excel

લવચીક, ઝડપી

ફોર્મેટ અસંગતતા

કોડ વાંચો/પાર્સ કરો

વેબ સ્ક્રેપિંગ

વિશાળ પહોંચ

કાનૂની/નૈતિક મર્યાદા

ડ્રાફ્ટ પાર્સિંગ (ઓથોરિટીની અંદર)

લોગ/ઇવેન્ટ ડેટા

વિગતવાર

વિશાળ વોલ્યુમ

ફિલ્ટરિંગ ક્વેરી

દ્રષ્ટાંત: શું ભાગ સમગ્રનું પ્રતિનિધિત્વ કરે છે?

મોટાભાગે, તમે સમગ્ર ડેટાને બદલે નમૂના (વસ્તીમાંથી પસંદ કરેલ સબસેટ) સાથે કામ કરો છો. નિર્ણાયક પ્રશ્ન છે: શું આ નમૂના વસ્તીનું પ્રતિનિધિત્વ કરે છે? પસંદગીનો પક્ષપાત એ સૌથી સામાન્ય છટકું છે. ઉદાહરણ તરીકે, જો તમે મોબાઈલ એપમાંથી માત્ર યુઝર્સને જ સેમ્પલ કરો છો, તો તમને વેબ યુઝર્સ દેખાશે નહીં અને તમારા પરિણામો ભ્રામક હશે. રેન્ડમ સેમ્પલિંગ (દરેક રેકોર્ડમાં પસંદગીની સમાન તક હોય છે) મોટાભાગના કિસ્સાઓમાં સૌથી સુરક્ષિત છે; પરંતુ સમય શ્રેણીના ડેટામાં, વિભાજન રેન્ડમને બદલે ક્રોનોલોજિકલ રીતે કરવામાં આવે છે (આપણે એકમો 7 અને 10 માં જોઈશું).

લીક જાગૃતિ પ્રથમ દિવસથી

ડેટા લીકેજ એ મોટાભાગની આપત્તિઓનો સ્ત્રોત છે અને સામાન્ય રીતે ડેટા સંગ્રહના તબક્કા દરમિયાન ઉદ્ભવે છે. ઉદાહરણ: "શું તે રદ કરવામાં આવ્યું હતું" આગાહી કરતી વખતે, જો તમે ડેટામાં "રદ કરવાની તારીખ" કૉલમ ઉમેરો છો, તો મોડેલ ભવિષ્યમાં જુએ છે. એકત્રીકરણના તબક્કા દરમિયાન, દરેક કૉલમ માટે એક પ્રશ્ન પૂછો: "શું હું આગાહી કરું ત્યારે ખરેખર મારી પાસે આ માહિતી હશે?" જો જવાબ ના હોય, તો તે કોલમ લીક થઈ રહી છે. અમે એકમ 10 માં આ વિષયને ઊંડાણમાં આવરી લઈશું; પરંતુ જાગૃતિ પહેલા દિવસથી શરૂ થવી જોઈએ.

ત્રણ નાના કેસો

કેસ 1 - રજૂઆતની સમસ્યા. એક બેંકે તેના ક્રેડિટ રિસ્ક મોડલ (18,500 રેકોર્ડ) માટે માત્ર માન્ય લોન પર જ ડેટા એકત્રિત કર્યો હતો. અસ્વીકાર ડેટામાં ન હતા. વાસ્તવિક દુનિયામાં મોડેલ ખોટું હતું કારણ કે તેણે ક્યારેય જોયું નથી કે અસ્વીકાર કેવી રીતે વર્તે છે. પાઠ: નમૂના એ સમગ્ર વસ્તીનો પ્રતિનિધિ હોવો જોઈએ જેમાંથી તમે તમારો નિર્ણય લઈ રહ્યા છો.

કેસ 2 - સાયલન્ટ ફોર્મ ફેરફાર. એક ટીમ દરરોજ API માંથી કિંમત ડેટા ખેંચી રહી હતી. એક દિવસ, API પ્રદાતાએ ચલણને USD થી EUR માં બદલ્યું, પરંતુ ડોમેન નામ એ જ રહ્યું. ખોટા એકમમાં 12 દિવસ માટે ડેટા એકત્રિત કરવામાં આવ્યો હતો; 3,200 લાઇન બગડી હતી. પાઠ: API ડેટામાં નિયમિતપણે વોલ્યુમ અને ફોર્મેટ સુસંગતતા તપાસો.

કેસ 3 - પ્રારંભિક લિકેજ. એક વિશ્લેષકે "મંથન" અંદાજ માટે ડેટા એકત્રિત કરતી વખતે "એકાઉન્ટ બંધ થવાનું કારણ" કૉલમનો સમાવેશ કર્યો હતો. ગ્રાહક ગયા પછી જ આ કોલમ ભરાઈ હતી. મોડેલે ટેસ્ટ સેટ પર 97% ચોકસાઈ પ્રાપ્ત કરી; તે ઉત્પાદનમાં કામ કરતું ન હતું કારણ કે આગાહી સમયે તે કૉલમ ખાલી હતી. પાઠ: દરેક કૉલમને પ્રશ્ન પૂછો "શું તે આગાહી સમયે મારી પાસે છે?"

ચાર નકલ કરી શકાય તેવા નમૂનાઓ

1) ડેટા શબ્દકોશ નિષ્કર્ષણ:

તમારી ભૂમિકા: ડેટા સાયન્ટિસ્ટ સહાયક. નીચે કોષ્ટકના કૉલમના નામ અને નમૂના (અનામી) મૂલ્યો છે. દરેક કૉલમ માટે, કોષ્ટકમાં તેના અંદાજિત અર્થ, ડેટાટાઇપ અને સંભવિત ગુણવત્તા જોખમોની યાદી બનાવો. "પુષ્ટિ જરૂરી" તરીકે તમને ખાતરી ન હોય તેવા કૉલમ્સને ચિહ્નિત કરો; જેનો અર્થ થાય છે.કૉલમ્સ: [અહીં પેસ્ટ કરો]

2) સેમ્પલિંગ કોડ (રેન્ડમ, રિપીટેબલ):

મારી પાસે પાંડા ડીએફ છે. કોડ લખો જે 200,000 પંક્તિઓમાંથી પ્રતિનિધિ 5% રેન્ડમ નમૂનાને બહાર કાઢે છે. random_state=42 (પુનઃઉત્પાદનક્ષમતા માટે) નો ઉપયોગ કરો. નમૂનાનું વર્ગ વિતરણ વસ્તી સમાન છે તે ચકાસવા માટે કોડ ઉમેરો.

3) લીક સ્કેનિંગ પ્રશ્ન:

હું તમને આ સ્તંભોની યાદી આપીશ. મારો ધ્યેય "શું તે રદ થયેલ છે" (0/1) ની આગાહી કરવાનો છે. દરેક કૉલમ માટે, આગાહીના સમયે મારી પાસે તે ખરેખર હશે કે કેમ તેનું મૂલ્યાંકન કરો અને તેને "સુરક્ષિત/શંકાસ્પદ/લીક" તરીકે ચિહ્નિત કરો. તમારું તર્ક એક વાક્યમાં લખો. કૉલમ્સ: [સૂચિ]

4) SQL પુલ ક્વેરી ડ્રાફ્ટ:

મારી પાસે PostgreSQL માં "ઓર્ડર" અને "ગ્રાહકો" કોષ્ટકો છે. એક JOIN ક્વેરી લખો જે ગ્રાહક શહેર સાથે છેલ્લા 90 દિવસના ઓર્ડરને જોડે છે અને શહેર દીઠ ઓર્ડરની કુલ રકમ અને સંખ્યા પરત કરે છે. તારીખ ફિલ્ટર અને NULL શહેરોને કેવી રીતે હેન્ડલ કરવામાં આવે છે તે સમજાવો. હું ક્વેરી ચલાવીશ અને તેની ચકાસણી કરીશ.

નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ

નબળા પ્રોમ્પ્ટ:

મને આ ડેટાબેઝમાંથી સારો સેમ્પલ ડેટા ખેંચો.

"સારું" અસ્પષ્ટ છે; કઈ પેઇન્ટિંગ, કયો સમયગાળો, કયો કદ, કયો હેતુ સ્પષ્ટ નથી. AI માત્ર એક સામાન્ય, સંભવતઃ ખોટી ક્વેરી પેદા કરશે.

શક્તિશાળી પ્રોમ્પ્ટ:

તમારી ભૂમિકા: SQL સહાયક. મારી પાસે "ટ્રાન્ઝેક્શન્સ" ટેબલ છે: કૉલમ id, customer_id, તારીખ (ટાઇમસ્ટેમ્પ), રકમ (આંકડાકીય), ચેનલ (ટેક્સ્ટ: 'વેબ'/'મોબાઇલ'). કાર્ય: પુનરાવર્તિત (ORDER BY સાથે નિર્ધારિત) ક્વેરી લખો જે વર્ષ 2024 માટે દરેક ચેનલમાંથી 10,000 પ્રતિનિધિ પંક્તિઓ પરત કરે છે. હેતુ: ચેનલ તુલનાત્મક વિશ્લેષણ. તમારા પ્રશ્નની ધારણાઓની યાદી બનાવો.

અહીં કોષ્ટક, હેતુ, કદ અને પુનરાવર્તિતતા સ્પષ્ટ છે.

સામાન્ય ભૂલો

  • નમૂનાની પ્રતિનિધિત્વ પર પ્રશ્ન નથી. સરળતાથી સુલભ ડેટા ચોક્કસ ડેટા નથી; પસંદગી પૂર્વગ્રહ પરિણામને વિકૃત કરે છે.
  • AI માં કૉલમના અર્થોને અનુકૂલિત કરવું. સ્ત્રોત ટીમ અર્થ જાણે છે; તેની પુષ્ટિ કર્યા વિના AI આગાહીનો ઉપયોગ કરશો નહીં.
  • API ફોર્મેટ/એકમ ફેરફારને ટ્રૅક કરતું નથી. મૌન પરિવર્તન દિવસો માટે ભ્રષ્ટ ડેટા એકત્રિત કરે છે.
  • સંગ્રહના તબક્કે લીકને અવગણવું. જો પ્રશ્ન "મારી પાસે આગાહીના સમયે છે" પ્રારંભિક પૂછવામાં ન આવે, તો મોડેલ ખોટી સફળતા આપશે.
  • અનધિકૃત અથવા ગેરકાયદે ડેટા એકત્રિત કરવો. robots.txt, ઉપયોગની શરતો અને KVKK નું ઉલ્લંઘન એ ગંભીર જોખમ છે.
ટીપ: દરેક નવા ડેટા સ્ત્રોત માટે એક-પૃષ્ઠનું "ડેટા કાર્ડ" રાખો: સ્ત્રોત, પુલ તારીખ, પંક્તિઓની સંખ્યા, જાણીતી સીમાઓ અને લિકેજના જોખમે કૉલમ. આ કાર્ડ "આ ડેટા શું હતો" પ્રશ્ન અને મહિનાઓ પછી પુનઃઉત્પાદનક્ષમતાને સાચવે છે.

સારાંશમાં

વિશ્લેષણની ગુણવત્તા એકત્રિત ડેટાની ગુણવત્તા દ્વારા મર્યાદિત છે. સ્ત્રોત (ડેટાબેઝ, API, ફાઇલ, સ્ક્રેપ) અને સ્કીમા સારી રીતે જાણો; ખાતરી કરો કે નમૂના વસ્તીના પ્રતિનિધિ છે; દરેક કૉલમને પૂછીને પ્રથમ દિવસથી લીકેજને દૂર કરો "શું તે આગાહી સમયે મારી પાસે છે?" AI એ ક્વેરી અને ડોક્યુમેન્ટ વર્ક માટે એક ઉત્તમ પ્રવેગક છે, પરંતુ મનુષ્યો નક્કી કરે છે કે કયો ડેટા એકત્રિત કરવો અને તેની પ્રતિનિધિત્વ. સત્તા, કાયદો અને ગોપનીયતાની મર્યાદા હંમેશા પ્રથમ આવે છે.

એપ્લિકેશન કાર્ય

ડેટા સ્રોત પસંદ કરો (તમારા પોતાના વ્યવસાયમાંથી અથવા અનુમાનિત). ઉપરના “ડેટા ડિક્શનરી એક્સટ્રેક્શન” ટેમ્પલેટ સાથે AI માંથી ડેટા ડિક્શનરીનો ડ્રાફ્ટ મેળવો; પછી તે લીક થઈ ગઈ છે કે કેમ તે જોવા માટે દરેક કૉલમનું મેન્યુઅલી મૂલ્યાંકન કરો. ઓછામાં ઓછી એક શંકાસ્પદ/લીક કૉલમ શોધવાનો પ્રયાસ કરો અને એક વાક્યમાં લખો કે તે શા માટે જોખમી છે.

ચેકલિસ્ટ

  • [ ] શું મેં સ્રોત ટીમ સાથે ડેટા સ્ત્રોત અને સ્કીમાની પુષ્ટિ કરી છે?
  • [ ] શું મેં તપાસ કરી છે કે નમૂના વસ્તીનો પ્રતિનિધિ છે?
  • [ ] શું મેં દરેક કૉલમમાં પ્રશ્ન પૂછ્યો છે કે "શું તે અંદાજના સમયે મારી પાસે હશે?"
  • [ ] શું મેં નમૂનાને પુનરાવર્તિત કરી શકાય તેવું (નિશ્ચિત બીજ) બનાવ્યું છે?
  • [ ] શું મેં સંગ્રહની કાનૂની/નૈતિક (ઓથોરિટી, robots.txt, KVKK) મર્યાદાઓ તપાસી છે?