નફો:
- વિવિધ ડેટા સ્ત્રોતો (ડેટાબેઝ, API, ફાઇલ, વેબ સ્ક્રેપિંગ) અને દરેકની ખામીઓને ઓળખવાની ક્ષમતા અને સ્કીમાને યોગ્ય રીતે સમજવાની ક્ષમતા
- નમૂના વસ્તી અને પસંદગીના પૂર્વગ્રહનું પ્રતિનિધિત્વ કરે છે કે કેમ તેનું મૂલ્યાંકન કરીને પુનરાવર્તિત નમૂના લેવાની ક્ષમતા
- સંગ્રહના તબક્કે ડેટા લીકેજને દૂર કરવાની ક્ષમતા અને દરેક કૉલમમાં 'શું આગાહી સમયે મારી પાસે હશે' એવો પ્રશ્ન પૂછીને કાનૂની/નૈતિક સીમાઓનું પાલન કરવાની ક્ષમતા?
દરેક વિશ્લેષણ તમે એકત્રિત કરો છો તે ડેટાની ગુણવત્તા જેટલું સારું છે. વિશ્વનું સૌથી અદ્યતન મોડલ પણ અવિશ્વસનીય પરિણામો ઉત્પન્ન કરશે જો તે ખોટી રીતે એકત્રિત કરવામાં આવેલ ડેટા સાથે કામ કરે છે, પક્ષપાતી રીતે નમૂના લેવામાં આવે છે અથવા ભવિષ્ય વિશેની માહિતી ધરાવે છે. કોમ્પ્યુટર વિજ્ઞાનમાં, આ સિદ્ધાંતનો સારાંશ "કચરો અંદર, કચરો બહાર" (કચરો અંદર, કચરો બહાર) તરીકે આપવામાં આવે છે. આ એકમમાં, અમે ડેટા કલેક્શનના તબક્કાને આવરી લઈશું: સ્ત્રોતને સમજવું, સેમ્પલિંગ કરવું, ગુણવત્તાયુક્ત પ્રશ્નો પૂછવા અને પહેલા દિવસથી ડેટા લીક થવાના જોખમ પ્રત્યે સજાગ રહેવું. આ તબક્કે કૃત્રિમ બુદ્ધિ એક શક્તિશાળી સહાયક છે; SQL ક્વેરી લખે છે, API દસ્તાવેજનો સારાંશ આપે છે, ડેટા કોન્ટ્રાક્ટ ડ્રાફ્ટ કરે છે. પરંતુ તે માણસ છે જે નક્કી કરે છે કે તમે કયો ડેટા એકત્રિત કરો છો અને તે ડેટા તમને રજૂ કરે છે કે કેમ.
ડેટા સ્ત્રોતો વિશે જાણકારી મેળવવી
ડેટા વિવિધ સ્થળોએથી આવે છે, અને દરેક સ્ત્રોતની પોતાની ખામીઓ હોય છે. ડેટાબેઝ (કોષ્ટકોમાં સંગ્રહિત સ્ટ્રક્ચર્ડ ડેટા, સામાન્ય રીતે એસક્યુએલ સાથે પૂછવામાં આવે છે) સૌથી સામાન્ય સ્ત્રોત છે; તે વિશ્વસનીય છે, પરંતુ તેની યોજનાને સારી રીતે સમજવી જરૂરી છે. API (એપ્લિકેશન પ્રોગ્રામિંગ ઈન્ટરફેસ) લાઈવ ડેટા પ્રદાન કરે છે પરંતુ ઝડપ મર્યાદા અને ફોર્મેટ ફેરફારોનું જોખમ વહન કરે છે. ફાઇલો (CSV, Excel, JSON) લવચીક છે પરંતુ ફોર્મેટમાં અસંગતતાની સંભાવના છે. વેબ સ્ક્રેપિંગ શક્તિશાળી છે, પરંતુ તેની કાનૂની અને નૈતિક મર્યાદાઓ છે; દરેક સાઇટને સ્ક્રેપ કરી શકાતી નથી.
ધ્યાન: વેબ સ્ક્રેપિંગ અને સ્વચાલિત ડેટા સંગ્રહ માટે, સાઇટની ઉપયોગની શરતો, robots.txt ફાઇલ અને KVKK/GDPRનું પાલન કરો. અનધિકૃત ડેટા સંગ્રહ કાનૂની જવાબદારી બનાવે છે. માહિતી સુરક્ષાના સંદર્ભમાં, ડેટા સંગ્રહ સાધનોનો ઉપયોગ ફક્ત તે સિસ્ટમ પર કરો કે જેના માટે તમે અધિકૃત છો અને સંરક્ષણ/વિશ્લેષણ હેતુઓ માટે; અનધિકૃત ઍક્સેસ અથવા સ્ક્રેપિંગ પ્રતિબંધિત છે.
સ્કીમાને સમજવું: ડેટા સાથે પરિચિત થવું
ડેટા સેટ એકત્રિત કરતા પહેલા, તમારે તેની સ્કીમા (કૉલમના નામ, તેમના ડેટા પ્રકારો, તેમના અર્થો અને એકબીજા સાથેના તેમના સંબંધો) ને સમજવું આવશ્યક છે. AI અહીં "ડેટા શબ્દકોશ" બનાવવા માટે ખૂબ જ ઉપયોગી છે — દરેક કૉલમનો અર્થ શું છે તે સમજાવતું કોષ્ટક. પરંતુ AI જે સ્પષ્ટીકરણો ઉત્પન્ન કરે છે તે આગાહીઓ છે; ડેટા બનાવનાર ટીમ સાથે દરેક કૉલમના સાચા અર્થની પુષ્ટિ કરો. ઉદાહરણ તરીકે, "સ્ટેટસ" નામની કૉલમમાં 0/1/2 હોઈ શકે છે; ફક્ત મૂળ ટીમ જ જાણે છે કે આ "બાકી/મંજૂર/રદ" છે કે બીજું કંઈક.
નીચેનું કોષ્ટક મૂળભૂત સંસાધન પ્રકારો અને સાવચેતીઓનો સારાંશ આપે છે:
સ્ત્રોત
મજબૂત બિંદુ
છટકું
AI કેવી રીતે મદદ કરે છે
SQL ડેટાબેઝ
માળખાકીય, વિશ્વસનીય
જટિલ જોડાઓ
ક્વેરી ડ્રાફ્ટ લખે છે
API
જીવંત ડેટા
ઝડપ મર્યાદા, આકાર ફેરફાર
દસ્તાવેજ સારાંશ, પુલ કોડ
CSV/Excel
લવચીક, ઝડપી
ફોર્મેટ અસંગતતા
કોડ વાંચો/પાર્સ કરો
વેબ સ્ક્રેપિંગ
વિશાળ પહોંચ
કાનૂની/નૈતિક મર્યાદા
ડ્રાફ્ટ પાર્સિંગ (ઓથોરિટીની અંદર)
લોગ/ઇવેન્ટ ડેટા
વિગતવાર
વિશાળ વોલ્યુમ
ફિલ્ટરિંગ ક્વેરી
દ્રષ્ટાંત: શું ભાગ સમગ્રનું પ્રતિનિધિત્વ કરે છે?
મોટાભાગે, તમે સમગ્ર ડેટાને બદલે નમૂના (વસ્તીમાંથી પસંદ કરેલ સબસેટ) સાથે કામ કરો છો. નિર્ણાયક પ્રશ્ન છે: શું આ નમૂના વસ્તીનું પ્રતિનિધિત્વ કરે છે? પસંદગીનો પક્ષપાત એ સૌથી સામાન્ય છટકું છે. ઉદાહરણ તરીકે, જો તમે મોબાઈલ એપમાંથી માત્ર યુઝર્સને જ સેમ્પલ કરો છો, તો તમને વેબ યુઝર્સ દેખાશે નહીં અને તમારા પરિણામો ભ્રામક હશે. રેન્ડમ સેમ્પલિંગ (દરેક રેકોર્ડમાં પસંદગીની સમાન તક હોય છે) મોટાભાગના કિસ્સાઓમાં સૌથી સુરક્ષિત છે; પરંતુ સમય શ્રેણીના ડેટામાં, વિભાજન રેન્ડમને બદલે ક્રોનોલોજિકલ રીતે કરવામાં આવે છે (આપણે એકમો 7 અને 10 માં જોઈશું).
લીક જાગૃતિ પ્રથમ દિવસથી
ડેટા લીકેજ એ મોટાભાગની આપત્તિઓનો સ્ત્રોત છે અને સામાન્ય રીતે ડેટા સંગ્રહના તબક્કા દરમિયાન ઉદ્ભવે છે. ઉદાહરણ: "શું તે રદ કરવામાં આવ્યું હતું" આગાહી કરતી વખતે, જો તમે ડેટામાં "રદ કરવાની તારીખ" કૉલમ ઉમેરો છો, તો મોડેલ ભવિષ્યમાં જુએ છે. એકત્રીકરણના તબક્કા દરમિયાન, દરેક કૉલમ માટે એક પ્રશ્ન પૂછો: "શું હું આગાહી કરું ત્યારે ખરેખર મારી પાસે આ માહિતી હશે?" જો જવાબ ના હોય, તો તે કોલમ લીક થઈ રહી છે. અમે એકમ 10 માં આ વિષયને ઊંડાણમાં આવરી લઈશું; પરંતુ જાગૃતિ પહેલા દિવસથી શરૂ થવી જોઈએ.
ત્રણ નાના કેસો
કેસ 1 - રજૂઆતની સમસ્યા. એક બેંકે તેના ક્રેડિટ રિસ્ક મોડલ (18,500 રેકોર્ડ) માટે માત્ર માન્ય લોન પર જ ડેટા એકત્રિત કર્યો હતો. અસ્વીકાર ડેટામાં ન હતા. વાસ્તવિક દુનિયામાં મોડેલ ખોટું હતું કારણ કે તેણે ક્યારેય જોયું નથી કે અસ્વીકાર કેવી રીતે વર્તે છે. પાઠ: નમૂના એ સમગ્ર વસ્તીનો પ્રતિનિધિ હોવો જોઈએ જેમાંથી તમે તમારો નિર્ણય લઈ રહ્યા છો.
કેસ 2 - સાયલન્ટ ફોર્મ ફેરફાર. એક ટીમ દરરોજ API માંથી કિંમત ડેટા ખેંચી રહી હતી. એક દિવસ, API પ્રદાતાએ ચલણને USD થી EUR માં બદલ્યું, પરંતુ ડોમેન નામ એ જ રહ્યું. ખોટા એકમમાં 12 દિવસ માટે ડેટા એકત્રિત કરવામાં આવ્યો હતો; 3,200 લાઇન બગડી હતી. પાઠ: API ડેટામાં નિયમિતપણે વોલ્યુમ અને ફોર્મેટ સુસંગતતા તપાસો.
કેસ 3 - પ્રારંભિક લિકેજ. એક વિશ્લેષકે "મંથન" અંદાજ માટે ડેટા એકત્રિત કરતી વખતે "એકાઉન્ટ બંધ થવાનું કારણ" કૉલમનો સમાવેશ કર્યો હતો. ગ્રાહક ગયા પછી જ આ કોલમ ભરાઈ હતી. મોડેલે ટેસ્ટ સેટ પર 97% ચોકસાઈ પ્રાપ્ત કરી; તે ઉત્પાદનમાં કામ કરતું ન હતું કારણ કે આગાહી સમયે તે કૉલમ ખાલી હતી. પાઠ: દરેક કૉલમને પ્રશ્ન પૂછો "શું તે આગાહી સમયે મારી પાસે છે?"
ચાર નકલ કરી શકાય તેવા નમૂનાઓ
1) ડેટા શબ્દકોશ નિષ્કર્ષણ:
તમારી ભૂમિકા: ડેટા સાયન્ટિસ્ટ સહાયક. નીચે કોષ્ટકના કૉલમના નામ અને નમૂના (અનામી) મૂલ્યો છે. દરેક કૉલમ માટે, કોષ્ટકમાં તેના અંદાજિત અર્થ, ડેટાટાઇપ અને સંભવિત ગુણવત્તા જોખમોની યાદી બનાવો. "પુષ્ટિ જરૂરી" તરીકે તમને ખાતરી ન હોય તેવા કૉલમ્સને ચિહ્નિત કરો; જેનો અર્થ થાય છે.કૉલમ્સ: [અહીં પેસ્ટ કરો]
2) સેમ્પલિંગ કોડ (રેન્ડમ, રિપીટેબલ):
મારી પાસે પાંડા ડીએફ છે. કોડ લખો જે 200,000 પંક્તિઓમાંથી પ્રતિનિધિ 5% રેન્ડમ નમૂનાને બહાર કાઢે છે. random_state=42 (પુનઃઉત્પાદનક્ષમતા માટે) નો ઉપયોગ કરો. નમૂનાનું વર્ગ વિતરણ વસ્તી સમાન છે તે ચકાસવા માટે કોડ ઉમેરો.
3) લીક સ્કેનિંગ પ્રશ્ન:
હું તમને આ સ્તંભોની યાદી આપીશ. મારો ધ્યેય "શું તે રદ થયેલ છે" (0/1) ની આગાહી કરવાનો છે. દરેક કૉલમ માટે, આગાહીના સમયે મારી પાસે તે ખરેખર હશે કે કેમ તેનું મૂલ્યાંકન કરો અને તેને "સુરક્ષિત/શંકાસ્પદ/લીક" તરીકે ચિહ્નિત કરો. તમારું તર્ક એક વાક્યમાં લખો. કૉલમ્સ: [સૂચિ]
4) SQL પુલ ક્વેરી ડ્રાફ્ટ:
મારી પાસે PostgreSQL માં "ઓર્ડર" અને "ગ્રાહકો" કોષ્ટકો છે. એક JOIN ક્વેરી લખો જે ગ્રાહક શહેર સાથે છેલ્લા 90 દિવસના ઓર્ડરને જોડે છે અને શહેર દીઠ ઓર્ડરની કુલ રકમ અને સંખ્યા પરત કરે છે. તારીખ ફિલ્ટર અને NULL શહેરોને કેવી રીતે હેન્ડલ કરવામાં આવે છે તે સમજાવો. હું ક્વેરી ચલાવીશ અને તેની ચકાસણી કરીશ.
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા પ્રોમ્પ્ટ:
મને આ ડેટાબેઝમાંથી સારો સેમ્પલ ડેટા ખેંચો.
"સારું" અસ્પષ્ટ છે; કઈ પેઇન્ટિંગ, કયો સમયગાળો, કયો કદ, કયો હેતુ સ્પષ્ટ નથી. AI માત્ર એક સામાન્ય, સંભવતઃ ખોટી ક્વેરી પેદા કરશે.
શક્તિશાળી પ્રોમ્પ્ટ:
તમારી ભૂમિકા: SQL સહાયક. મારી પાસે "ટ્રાન્ઝેક્શન્સ" ટેબલ છે: કૉલમ id, customer_id, તારીખ (ટાઇમસ્ટેમ્પ), રકમ (આંકડાકીય), ચેનલ (ટેક્સ્ટ: 'વેબ'/'મોબાઇલ'). કાર્ય: પુનરાવર્તિત (ORDER BY સાથે નિર્ધારિત) ક્વેરી લખો જે વર્ષ 2024 માટે દરેક ચેનલમાંથી 10,000 પ્રતિનિધિ પંક્તિઓ પરત કરે છે. હેતુ: ચેનલ તુલનાત્મક વિશ્લેષણ. તમારા પ્રશ્નની ધારણાઓની યાદી બનાવો.
અહીં કોષ્ટક, હેતુ, કદ અને પુનરાવર્તિતતા સ્પષ્ટ છે.
સામાન્ય ભૂલો
- નમૂનાની પ્રતિનિધિત્વ પર પ્રશ્ન નથી. સરળતાથી સુલભ ડેટા ચોક્કસ ડેટા નથી; પસંદગી પૂર્વગ્રહ પરિણામને વિકૃત કરે છે.
- AI માં કૉલમના અર્થોને અનુકૂલિત કરવું. સ્ત્રોત ટીમ અર્થ જાણે છે; તેની પુષ્ટિ કર્યા વિના AI આગાહીનો ઉપયોગ કરશો નહીં.
- API ફોર્મેટ/એકમ ફેરફારને ટ્રૅક કરતું નથી. મૌન પરિવર્તન દિવસો માટે ભ્રષ્ટ ડેટા એકત્રિત કરે છે.
- સંગ્રહના તબક્કે લીકને અવગણવું. જો પ્રશ્ન "મારી પાસે આગાહીના સમયે છે" પ્રારંભિક પૂછવામાં ન આવે, તો મોડેલ ખોટી સફળતા આપશે.
- અનધિકૃત અથવા ગેરકાયદે ડેટા એકત્રિત કરવો. robots.txt, ઉપયોગની શરતો અને KVKK નું ઉલ્લંઘન એ ગંભીર જોખમ છે.
ટીપ: દરેક નવા ડેટા સ્ત્રોત માટે એક-પૃષ્ઠનું "ડેટા કાર્ડ" રાખો: સ્ત્રોત, પુલ તારીખ, પંક્તિઓની સંખ્યા, જાણીતી સીમાઓ અને લિકેજના જોખમે કૉલમ. આ કાર્ડ "આ ડેટા શું હતો" પ્રશ્ન અને મહિનાઓ પછી પુનઃઉત્પાદનક્ષમતાને સાચવે છે.
સારાંશમાં
વિશ્લેષણની ગુણવત્તા એકત્રિત ડેટાની ગુણવત્તા દ્વારા મર્યાદિત છે. સ્ત્રોત (ડેટાબેઝ, API, ફાઇલ, સ્ક્રેપ) અને સ્કીમા સારી રીતે જાણો; ખાતરી કરો કે નમૂના વસ્તીના પ્રતિનિધિ છે; દરેક કૉલમને પૂછીને પ્રથમ દિવસથી લીકેજને દૂર કરો "શું તે આગાહી સમયે મારી પાસે છે?" AI એ ક્વેરી અને ડોક્યુમેન્ટ વર્ક માટે એક ઉત્તમ પ્રવેગક છે, પરંતુ મનુષ્યો નક્કી કરે છે કે કયો ડેટા એકત્રિત કરવો અને તેની પ્રતિનિધિત્વ. સત્તા, કાયદો અને ગોપનીયતાની મર્યાદા હંમેશા પ્રથમ આવે છે.
એપ્લિકેશન કાર્ય
ડેટા સ્રોત પસંદ કરો (તમારા પોતાના વ્યવસાયમાંથી અથવા અનુમાનિત). ઉપરના “ડેટા ડિક્શનરી એક્સટ્રેક્શન” ટેમ્પલેટ સાથે AI માંથી ડેટા ડિક્શનરીનો ડ્રાફ્ટ મેળવો; પછી તે લીક થઈ ગઈ છે કે કેમ તે જોવા માટે દરેક કૉલમનું મેન્યુઅલી મૂલ્યાંકન કરો. ઓછામાં ઓછી એક શંકાસ્પદ/લીક કૉલમ શોધવાનો પ્રયાસ કરો અને એક વાક્યમાં લખો કે તે શા માટે જોખમી છે.
ચેકલિસ્ટ
- [ ] શું મેં સ્રોત ટીમ સાથે ડેટા સ્ત્રોત અને સ્કીમાની પુષ્ટિ કરી છે?
- [ ] શું મેં તપાસ કરી છે કે નમૂના વસ્તીનો પ્રતિનિધિ છે?
- [ ] શું મેં દરેક કૉલમમાં પ્રશ્ન પૂછ્યો છે કે "શું તે અંદાજના સમયે મારી પાસે હશે?"
- [ ] શું મેં નમૂનાને પુનરાવર્તિત કરી શકાય તેવું (નિશ્ચિત બીજ) બનાવ્યું છે?
- [ ] શું મેં સંગ્રહની કાનૂની/નૈતિક (ઓથોરિટી, robots.txt, KVKK) મર્યાદાઓ તપાસી છે?