એકમો
1. ડેટા વિજ્ઞાન અને વિશ્લેષણમાં કૃત્રિમ બુદ્ધિનો પરિચય: વર્કફ્લો, ભૂમિકાઓ, સીમાઓ, માન્યતા અને નીતિશાસ્ત્ર 2. ડેટા કલેક્શન અને સોર્સ અન્ડરસ્ટેન્ડિંગ: સ્કીમા, સેમ્પલિંગ, ક્વોલિટી અને લીક અવેરનેસ 3. ડેટા ક્લીનિંગ અને પ્રીપ્રોસેસિંગ: ખૂટતું મૂલ્ય, આઉટલાયર અને પ્રકારનું રૂપાંતરણ 4. સંશોધનાત્મક ડેટા વિશ્લેષણ (EDA): વિતરણ, સંબંધો અને પ્રારંભિક આંતરદૃષ્ટિ 5. ફિચર એન્જિનિયરિંગ: વેરિઅન્ટ્સ જનરેટ કરવું, કોડિંગ, સ્કેલિંગ અને લિકેજ ટાળવું 6. મોડલ બિલ્ડીંગ: સમસ્યાની વ્યાખ્યા, અલ્ગોરિધમ પસંદગી અને તાલીમ/પરીક્ષણ વિભાજન 7. મોડલ મૂલ્યાંકન: મેટ્રિક્સ, ક્રોસ-વેલિડેશન અને એક્સ્ટ્રીમ લર્નિંગ 8. વિઝ્યુલાઇઝેશન અને સ્ટોરીટેલિંગ: સચોટ ગ્રાફિક્સ, પ્રમાણિક ગ્રાફિક્સ 9. કોડ જનરેશન: પાયથોન (પાંડા) અને SQL સાથે AI-આસિસ્ટેડ વિશ્લેષણ 10. ડેટા લિકેજ અને પુનઃઉત્પાદનક્ષમતા: સાયલન્ટ ડિઝાસ્ટર અને શિસ્ત 11. MLOps ફાઉન્ડેશન, એથિક્સ, પ્રાઈવસી અને રિસ્પોન્સિબલ એનાલિટિક્સ
એકમ 1 / 11

ડેટા વિજ્ઞાન અને વિશ્લેષણમાં કૃત્રિમ બુદ્ધિનો પરિચય: વર્કફ્લો, ભૂમિકાઓ, સીમાઓ, માન્યતા અને નીતિશાસ્ત્ર

નફો:

  • ડેટા સાયન્સના છ-તબક્કાના વર્કફ્લો (સમસ્યાની વ્યાખ્યા, સંગ્રહ, સફાઈ, શોધ, મોડેલિંગ, સંદેશાવ્યવહાર) અને કાર્ય જોખમ સ્તર અનુસાર, દરેક તબક્કે આર્ટિફિશિયલ ઈન્ટેલિજન્સ કાર્ય કરે છે તે સત્તાને અલગ પાડવાની ક્ષમતા
  • દરેક આર્ટિફિશિયલ ઇન્ટેલિજન્સ આઉટપુટને સ્ત્રોત સાથે કનેક્ટ કરીને, તેને ચલાવીને અને તેની તુલના કરીને અને નિષ્ણાત ફિલ્ટરિંગ દ્વારા પસાર કરીને તેને ચકાસતી શિસ્ત લાગુ કરવાની ક્ષમતા.
  • પુનઃઉત્પાદનક્ષમતા અને ગોપનીયતા સિદ્ધાંતો (કોડમાં લખવું, અનામીકરણ) ને પ્રથમ દિવસથી વિશ્લેષણની ટેવમાં ફેરવવાની ક્ષમતા

કાચો, અવ્યવસ્થિત અને ઘણીવાર "જૂઠું" ડેટા ડેટા વૈજ્ઞાનિકના ડેસ્ક પર દરરોજ ઉતરે છે. વેચાણ કોષ્ટકમાં, તારીખ કૉલમ ત્રણ અલગ અલગ ફોર્મેટમાં લખાયેલ છે; ગ્રાહક નંબરો અમુક લીટીઓમાં ખાલી છે; કૉલમનું નામ "આવક" છે, પરંતુ તેમાં TL અને USD બંને મૂલ્યો છે. ડેટા સાયન્સનું કાર્ય આ અંધાધૂંધીમાંથી વિશ્વસનીય નિર્ણય લેવાનું છે: ડેટા એકત્રિત કરો, તેને સાફ કરો, તેનું અન્વેષણ કરો, એક મોડેલ બનાવો, પરિણામને માન્ય કરો અને તેને વાર્તામાં ફેરવો. આર્ટિફિશિયલ ઇન્ટેલિજન્સ (એઆઈ, અથવા ટૂંકી કમ્પ્યુટર સિસ્ટમ્સ માટે AI જે ટેક્સ્ટ અને કોડ જનરેટ કરી શકે છે, પેટર્ન ઓળખી શકે છે, સારાંશ આપી શકે છે અને આગાહીઓ કરી શકે છે) આ સાંકળની દરેક લિંકને સ્પર્શ કરી શકે છે: મિનિટોમાં ક્લિનઅપ કોડ લખવા, સંશોધન વિશ્લેષણ માટે આલેખની ભલામણ કરવી, મોડેલના મેટ્રિકનું અર્થઘટન કરવું, SQL ક્વેરી સુધારવી. પરંતુ તે જ AI તમને ક્યારેય જોયો ન હોય તેવા ડેટા માટે "કોરિલેશન 0.72" જેવા વિશ્વાસપૂર્ણ બનાવટ પણ આપી શકે છે.

આ પ્રથમ એકમ પુસ્તકાલય પરિચય નથી. તેનો હેતુ એ સ્પષ્ટ કરવાનો છે કે ડેટા સાયન્સ વર્કફ્લોમાં AI ને ક્યાં મૂકવું અને ક્યાં મૂકવું નહીં. ચાલો શરૂઆતથી જ મૂળભૂત સિદ્ધાંત મૂકીએ: AI એ સહાયક છે, ડેટા સાયન્ટિસ્ટ નથી. કયો ડેટા એકત્રિત કરવો, કયા મેટ્રિક પર નિર્ણય લેવો, ઉત્પાદનમાં મોડેલ મૂકવું કે કેમ અને નૈતિક સીમાઓ ક્યાં દોરવી તેનો નિર્ણય સક્ષમ નિષ્ણાત પર રહેલો છે. બિન-સહી કરેલ વિશ્લેષણ અહેવાલની જેમ વણચકાસાયેલ AI આઉટપુટ જોખમી છે.

ડેટા સાયન્સ વર્કફ્લો: એન્ડ-ટુ-એન્ડ મેપ

ડેટા પ્રોજેક્ટને સમજવા માટે, તેને છ તબક્કામાં વિભાજિત કરવું મદદરૂપ છે. આ સમગ્ર મોડ્યુલ આ નકશાને અનુસરે છે.

1. સમસ્યાની વ્યાખ્યા: કયા નિર્ણયને સમર્થન આપવા માટે આપણે શું માપીએ છીએ, શા માટે? આ તબક્કો એઆઈને સોંપવામાં આવ્યો નથી; તે વ્યક્તિ છે જે કામને વ્યાખ્યાયિત કરે છે.

2. ડેટા સંગ્રહ: સ્ત્રોતોને ઓળખવા, ડેટા કાઢવા, નમૂના લેવા. (એકમ 2)

3. ડેટા સફાઈ અને પ્રીપ્રોસેસિંગ: ખૂટે છે મૂલ્ય, આઉટલીયર, પ્રકાર રૂપાંતરણ. (એકમ 3)

4. સંશોધનાત્મક ડેટા વિશ્લેષણ (EDA - સંશોધનાત્મક ડેટા વિશ્લેષણ, "આંખ દ્વારા" ડેટાના વિતરણ અને સંબંધોને ઓળખવાનો તબક્કો): (યુનિટ 4)

5. ફીચર એન્જિનિયરિંગ અને મોડેલિંગ: વેરિયેબલ જનરેશન, અલ્ગોરિધમ સિલેક્શન, ટ્રેનિંગ, મૂલ્યાંકન. (એકમ 5, 6, 7)

6. કોમ્યુનિકેશન અને પ્રોડક્શન: વિઝ્યુલાઇઝેશન, સ્ટોરી, MLOps (મૉડલને લાઇવ લેવાની અને તેનું નિરીક્ષણ કરવાની શિસ્ત). (એકમ 8, 11)

AI આ છ તબક્કામાંના દરેકમાં અલગ-અલગ સત્તા સાથે કાર્ય કરે છે. નીચે આપેલ કોષ્ટક સત્તાના આ વિતરણનો સારાંશ આપે છે; આ મોડ્યુલનું એકમાત્ર સૌથી મહત્વપૂર્ણ કોષ્ટક છે.

સ્ટેજ

AI ની ભૂમિકા

જોખમ સ્તર

કોણ મંજૂર કરે છે

સમસ્યાની વ્યાખ્યા

વિચારશીલ ભાગીદાર

નીચું

ડેટા વૈજ્ઞાનિક + હિસ્સેદાર

સફાઈ કોડ લખો

કોડ સ્કેચ જનરેટર

મધ્યમ

ડેટા સાયન્ટિસ્ટ (કોડ વાંચે છે)

EDA ટિપ્પણી

પેટર્ન સૂચક

મધ્યમ

ડેટા વૈજ્ઞાનિક

ફીચર જનરેશન

આઈડિયા અને કોડ જનરેટર

મધ્યમ-ઉચ્ચ

લીક નિયંત્રણ આવશ્યક છે

મોડલ પસંદગી/મેટ્રિક

સલાહકાર

ઉચ્ચ

ડેટા વૈજ્ઞાનિક

ઉત્પાદનમાં મૂકવાનો નિર્ણય

સહાયક ઇનપુટ

ખૂબ ઊંચી

ટીમ + વ્યવસાય માલિક

નૈતિકતા/ગોપનીયતાની મંજૂરી

ઉત્તેજક

ખૂબ ઊંચી

માનવ, હંમેશા

આ ચાર્ટમાંથી એક વાક્ય ધ્યાનમાં રાખો: જેમ જેમ દાવ વધે છે તેમ, AI ની ભૂમિકા સંકોચાય છે અને માનવીય મંજૂરી વધે છે.

શા માટે ચકાસણી આ વ્યવસાયનું હૃદય છે

AI ભાષાના મૉડલ્સ ખાતરીપૂર્વક લાગે છે, પરંતુ તેઓ ચોક્કસ ન પણ હોઈ શકે. તકનીકી ભાષામાં, આને આભાસ કહેવામાં આવે છે: તે અસ્ખલિત વાક્યમાં અવિદ્યમાન માહિતીનું મોડેલ બનાવટ છે જાણે તે સાચું હોય. ડેટા સાયન્સમાં, આ ત્રણ સ્વરૂપોમાં આવે છે. પહેલો નકલી નંબર છે: જો તમે કોઈ ડેટા આપ્યા વિના મોડેલને "સરેરાશ ઓર્ડરની રકમ શું છે" પૂછો, તો તે તમારો ડેટા ક્યારેય જોયો ન હોવા છતાં, તે વિશ્વાસપૂર્વક તમને નંબર કહેશે. બીજું એક ફંક્શન છે જે અસ્તિત્વમાં નથી: મોડેલ એવું ફંક્શન સૂચવે છે જે બિલકુલ અસ્તિત્વમાં નથી, જેમ કે pandas.read_excel_fast(). ત્રીજું, ખોટું આંકડાકીય અર્થઘટન: મોડેલ ક્લાસિક આંકડાકીય ભૂલને સરળતાથી પુનરાવર્તિત કરી શકે છે જેમ કે "p-વેલ્યુ 0.04 છે, તેથી પૂર્વધારણા 96% સાચી છે".

ચકાસણી શિસ્ત ત્રણ પગલાંઓ સમાવે છે:

  1. સ્રોતની લિંક: દરેક નંબર, દર અને વલણ તમારા ડેટામાંથી આવવું જોઈએ, AIની મેમરીમાંથી નહીં. ડેટાને યાદ રાખવા માટે નહીં, પરંતુ ડેટા પર કામ કરતા કોડ માટે AI નો ઉપયોગ કરો.
  2. ચલાવો અને સરખામણી કરો: એઆઈ દ્વારા આપેલ કોડના દરેક ભાગને જાતે ચલાવો; તે બનાવેલ દરેક મેટ્રિકની તુલના સ્વતંત્ર આધારરેખા સાથે કરો.
  3. નિષ્ણાત ફિલ્ટર: તમારા માટે પરીક્ષણ કરો કે શું આઉટપુટ આંકડા અને ડોમેન જ્ઞાનનો વિરોધાભાસ કરે છે.
સાવધાન: AI દ્વારા લખાયેલ વિશ્લેષણને ચલાવ્યા વિના પ્રેઝન્ટેશનમાં મૂકવું અને તેને વાંચવું એ સહી વિનાનો અહેવાલ રજૂ કરવા જેવું છે. કોડ કામ કરે છે એનો અર્થ એ નથી કે તે સાચો છે; કોડ કે જે ખોટા કૉલમનો સરવાળો કરે છે તે પણ ભૂલો વિના કામ કરે છે.

પુનઃઉત્પાદનક્ષમતા: સમાન પરિણામ બે વાર ઉત્પન્ન કરવામાં સક્ષમ હોવું

ડેટા સાયન્સનો શાંત પરંતુ નિર્ણાયક સિદ્ધાંત પ્રજનનક્ષમતા છે: જ્યારે તમે છ મહિના પછી અથવા બીજા કમ્પ્યુટર પર ફરીથી વિશ્લેષણ ચલાવો છો, ત્યારે તમને સમાન પરિણામ મળે છે. AI સાથે કામ કરતી વખતે આ જોખમ વધે છે, કારણ કે જ્યારે તમે AI ને "આ ગ્રાફ બનાવવા" અને તેને મેન્યુઅલી ચલાવવા માટે કહો છો, ત્યારે સ્ટેપ્સ અદૃશ્ય થઈ જાય છે. નિયમ: દરેક પગલું કોડ અને સંસ્કરણ નિયંત્રણમાં નોંધાયેલ હોવું આવશ્યક છે (જેમ કે Git); રેન્ડમનેસ સાથે સંકળાયેલા પગલાઓમાં, રેન્ડમ સીડ (રેન્ડમ નંબર જનરેટરનું પ્રારંભિક મૂલ્ય; જો નિશ્ચિત હોય, તો પરિણામ પુનરાવર્તિત થશે) નિશ્ચિત હોવું જોઈએ. અમે એકમ 10 માં આ વિષયને વધુ ઊંડો કરીશું; હમણાં માટે, આ ટેવ પાડો: "હાથથી ક્લિક કરશો નહીં, કોડમાં લખો."

ત્રણ નાના કેસો

કેસ 1 - સલામત પ્રવેગક. ઈ-કોમર્સ વિશ્લેષક સામાન્ય રીતે 240 હજાર પંક્તિઓના ઓર્ડર ટેબલને સાફ કરવામાં અડધો દિવસ પસાર કરે છે. તેણે AI ને કૉલમના નામ અને પ્રથમ 5 પંક્તિઓ (વ્યક્તિગત ડેટા વિના) આપી અને પાંડા સફાઈ કોડ માંગ્યો. AI એ 8 સેકન્ડમાં ડ્રાફ્ટ બનાવ્યો; વિશ્લેષકે લાઇન દ્વારા કોડ લાઇન વાંચી, તારીખ પદચ્છેદનમાં ભૂલ સુધારી અને તેને ચલાવી. અવધિ: 4 કલાકને બદલે 35 મિનિટ. AI એ કોડ પ્રદાન કર્યો, ચકાસણી માનવ પાસે રહી.

કેસ 2 - બનાવેલ મેટ્રિક ટ્રેપ. એક ઇન્ટર્નએ એઆઈને પૂછ્યું, "આ ડેટા પર રેન્ડમ ફોરેસ્ટ કેટલું સચોટ છે?" મોડેલને બિલકુલ તાલીમ આપ્યા વિના. "લગભગ 89%," એઆઈએ કહ્યું. ઇન્ટર્ન આને પ્રસ્તુતિમાં મૂકે છે; જ્યારે વાસ્તવિક મોડેલને તાલીમ આપવામાં આવી હતી, ત્યારે ચોકસાઈ 71% હતી. ભૂલ: AI ને ડેટા અને મોડેલ આપ્યા વિના મેટ્રિક્સની રાહ જોવી.

કેસ 3 - સાયલન્ટ લીક. એક ટીમે "લક્ષ્ય વેરીએબલના સરેરાશને લક્ષણ તરીકે ઉમેરો" ના AI-સૂચવેલ વિચારને પ્રશ્ન કર્યા વિના અમલમાં મૂક્યો. મોડેલે ટેસ્ટ સેટ પર 98% પ્રદર્શન કર્યું પરંતુ ઉત્પાદનમાં ક્રેશ થયું કારણ કે આ સુવિધા ભવિષ્યની માહિતી લીક કરી રહી હતી (ડેટા લીક, યુનિટ 10). ભૂલ: આંકડાકીય રીતે AI ભલામણને ફિલ્ટર કરતી નથી.

નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ

નબળા પ્રોમ્પ્ટ:

આ વેચાણ ડેટાનું વિશ્લેષણ કરો અને મને સરેરાશ આવક જણાવો.

આ દાવો ખામીયુક્ત છે: AI ને ડેટા આપવામાં આવ્યો ન હતો, તેથી "સરેરાશ આવક" ફક્ત બનાવી શકાય છે. ન તો સ્તંભો, ન સમયગાળો, ન ચલણ સ્પષ્ટ છે.

શક્તિશાળી પ્રોમ્પ્ટ:

તમારી ભૂમિકા: ડેટા સાયન્ટિસ્ટને મદદ કરનાર સહાયક. મારી પાસે પાંડા ડેટાફ્રેમ છે: df. કૉલમ્સ:- order_date (ટેક્સ્ટ, ફોર્મેટમાં "2024-03-01")- amount_tl (દશાંશ, કેટલીક પંક્તિઓમાં NaN) - customer_id (પૂર્ણાંક) કાર્ય: (1) સરેરાશ રકમની ગણતરી કરતા પાંડા કોડ લખો, (2) તે NaN મૂલ્યોને કેવી રીતે હેન્ડલ કરે છે તે સમજાવો, (3) કોડ ધારણાઓને સૂચિબદ્ધ કરે છે. ડેટા સામગ્રી બનાવશો નહીં; માત્ર કોડ જનરેટ કરો અને હું ચલાવીશ અને પરિણામ ચકાસીશ.

આ વિનંતીમાં, યોજના, અપેક્ષા અને "બનાવટ પર પ્રતિબંધ" સ્પષ્ટ છે. તમે હજી પણ ચલાવો છો અને આઉટપુટ જાતે ચકાસો છો.

નૈતિકતા અને ગોપનીયતાની શરૂઆત

ડેટા વિજ્ઞાન ઘણીવાર વ્યક્તિગત ડેટા સાથે કામ કરે છે: ગ્રાહક, દર્દી, કર્મચારી રેકોર્ડ. Türkiye માં KVKK (પર્સનલ ડેટા પ્રોટેક્શન લો) અને યુરોપમાં GDPR આ ડેટાને સુરક્ષિત કરે છે. સાર્વજનિક AI ટૂલમાં તમારું વાસ્તવિક નામ, ID, ઇમેઇલ અથવા સરનામું પેસ્ટ કરવું એ ઉલ્લંઘન છે. નિયમ: શેર કરતા પહેલા ડેટાને અનામી બનાવો, જો જરૂરી હોય તો માત્ર સ્કીમા (કૉલમના નામ, પ્રકાર) અને ડમી ઉદાહરણ પંક્તિ પ્રદાન કરો. અમે એકમ 11 માં નીતિશાસ્ત્રના વિષયને વધુ ઊંડો કરીશું; ચાલો શરૂઆતથી સિદ્ધાંત મૂકીએ: ડેટાને સમજવા માટે, તેની રચનાને શેર કરવી, તેની સામગ્રી નહીં, ઘણીવાર પૂરતી છે.

સામાન્ય ભૂલો

  • AI ને ડેટા આપ્યા વિના સંખ્યાઓ/મેટ્રિક્સની રાહ જોવી. મોડેલ ડેટાને ઍક્સેસ કરી શકતું નથી; તે જે નંબર આપે છે તે નકલી છે. હંમેશા પરિણામની ગણતરી કરો અને ચલાવો.
  • વિચારીને કે વર્કિંગ કોડ સાચો છે. કોડ કે જે ખોટા કૉલમમાં ચાલાકી કરે છે તે પણ ભૂલો વિના ચાલે છે; તર્ક વાંચ્યા વિના વિશ્વાસ ન કરવો.
  • ખુલ્લા ટૂલમાં વાસ્તવિક વ્યક્તિગત ડેટા પેસ્ટ કરવું. નામ, આઈડી નંબર, ઈ-મેલ ક્યારેય શેર કરવામાં આવતા નથી; આકૃતિ પૂરતી છે.
  • સ્ટેપ્સ મેન્યુઅલી કરવું અને કોડમાં લખવું નહીં. પુનઃઉત્પાદન ન કરી શકાય તેવું વિશ્લેષણ અવિશ્વસનીય છે.
  • AI ના આંકડાઓના અર્થઘટનને પ્રશ્ન વિના સ્વીકારવું. AI પી-વેલ્યુ અને સહસંબંધ જેવા ખ્યાલોમાં ક્લાસિક ભૂલોનું પુનરાવર્તન કરી શકે છે.
ટીપ: તમારા દરેક AI સત્રોમાં ટૂંકી "નિયમ રેખા" શામેલ કરો: "ડેટા સામગ્રી બનાવશો નહીં; ફક્ત કોડ/વિશ્લેષણ બનાવો અને હું પરિણામ ચલાવીશ અને ચકાસીશ; જ્યાં તમને ખાતરી નથી ત્યાં 'ચોક્કસ નથી' સૂચવો." આ એક વાક્ય આભાસના જોખમને નોંધપાત્ર રીતે ઘટાડે છે.

સારાંશમાં

AI ડેટા વિજ્ઞાનમાં એક શક્તિશાળી સહાયક છે: તે સફાઈ કોડ, EDA અર્થઘટન, મોડેલ ભલામણ અને વિઝ્યુલાઇઝેશનને વેગ આપે છે. પરંતુ સમસ્યાની વ્યાખ્યા, મેટ્રિક પસંદગી, ઉત્પાદન નિર્ણય અને નૈતિક સીમાઓ મનુષ્યની છે. વર્કફ્લોમાં છ તબક્કા હોય છે અને જોખમ વધે તેમ AI ની ભૂમિકા નાની થતી જાય છે. ત્રણ આદતો દરેક વસ્તુનો પાયો છે: સ્ત્રોત લિંકિંગ (માન્યતા), પુનઃઉત્પાદનક્ષમતા (કોડિંગ), અને અનામીકરણ (ગોપનીયતા). એકવાર તમે આ ત્રણને આંતરિક બનાવી લો, પછી બાકીના મોડ્યુલમાં દરેક સાધન તમારા માટે સલામત પ્રવેગક બની જાય છે.

એપ્લિકેશન કાર્ય

ફક્ત તમારી પાસેના નાના ટેબલની સ્કીમા બનાવો (અથવા કાલ્પનિક એક): કૉલમના નામ, પ્રકારો અને 2-3 ડમી ઉદાહરણ પંક્તિઓ (વાસ્તવિક વ્યક્તિગત ડેટા વિના). ઉપરના "પાવરફુલ પ્રોમ્પ્ટ" ટેમ્પલેટનો ઉપયોગ કરીને સારાંશ આંકડા કોડ માટે AI ને પૂછો. કોડ ચલાવો, આઉટપુટને મેન્યુઅલ મૂલ્ય સાથે સરખાવો, કોઈપણ બનાવટી ધારણાઓ માટે તપાસો અને 5 બુલેટ પોઈન્ટ્સમાં તમારા તારણો નોંધો.

ચેકલિસ્ટ

  • શું મેં વાસ્તવિક વ્યક્તિગત ડેટાને બદલે માત્ર AI ને સ્કીમા અને નકલી નમૂનો આપ્યો છે?
  • [ ] શું મેં તે કોડને વાંચ્યો અને ચલાવ્યો જે તે લાઇન બાય લાઇન બનાવે છે?
  • [ ] શું મેં આઉટપુટમાં દરેક નંબરની સ્વતંત્ર રીતે ચકાસણી કરી છે?
  • [ ] શું મેં વિશ્લેષણના દરેક પગલાને કોડમાં લખ્યા છે અને તેને પુનરાવર્તિત કર્યા છે?
  • [ ] શું મેં મિશનનું જોખમ સ્તર નક્કી કર્યું છે અને અંતિમ નિર્ણય માનવને સોંપ્યો છે?