નફો:
- ડેટા સાયન્સના છ-તબક્કાના વર્કફ્લો (સમસ્યાની વ્યાખ્યા, સંગ્રહ, સફાઈ, શોધ, મોડેલિંગ, સંદેશાવ્યવહાર) અને કાર્ય જોખમ સ્તર અનુસાર, દરેક તબક્કે આર્ટિફિશિયલ ઈન્ટેલિજન્સ કાર્ય કરે છે તે સત્તાને અલગ પાડવાની ક્ષમતા
- દરેક આર્ટિફિશિયલ ઇન્ટેલિજન્સ આઉટપુટને સ્ત્રોત સાથે કનેક્ટ કરીને, તેને ચલાવીને અને તેની તુલના કરીને અને નિષ્ણાત ફિલ્ટરિંગ દ્વારા પસાર કરીને તેને ચકાસતી શિસ્ત લાગુ કરવાની ક્ષમતા.
- પુનઃઉત્પાદનક્ષમતા અને ગોપનીયતા સિદ્ધાંતો (કોડમાં લખવું, અનામીકરણ) ને પ્રથમ દિવસથી વિશ્લેષણની ટેવમાં ફેરવવાની ક્ષમતા
કાચો, અવ્યવસ્થિત અને ઘણીવાર "જૂઠું" ડેટા ડેટા વૈજ્ઞાનિકના ડેસ્ક પર દરરોજ ઉતરે છે. વેચાણ કોષ્ટકમાં, તારીખ કૉલમ ત્રણ અલગ અલગ ફોર્મેટમાં લખાયેલ છે; ગ્રાહક નંબરો અમુક લીટીઓમાં ખાલી છે; કૉલમનું નામ "આવક" છે, પરંતુ તેમાં TL અને USD બંને મૂલ્યો છે. ડેટા સાયન્સનું કાર્ય આ અંધાધૂંધીમાંથી વિશ્વસનીય નિર્ણય લેવાનું છે: ડેટા એકત્રિત કરો, તેને સાફ કરો, તેનું અન્વેષણ કરો, એક મોડેલ બનાવો, પરિણામને માન્ય કરો અને તેને વાર્તામાં ફેરવો. આર્ટિફિશિયલ ઇન્ટેલિજન્સ (એઆઈ, અથવા ટૂંકી કમ્પ્યુટર સિસ્ટમ્સ માટે AI જે ટેક્સ્ટ અને કોડ જનરેટ કરી શકે છે, પેટર્ન ઓળખી શકે છે, સારાંશ આપી શકે છે અને આગાહીઓ કરી શકે છે) આ સાંકળની દરેક લિંકને સ્પર્શ કરી શકે છે: મિનિટોમાં ક્લિનઅપ કોડ લખવા, સંશોધન વિશ્લેષણ માટે આલેખની ભલામણ કરવી, મોડેલના મેટ્રિકનું અર્થઘટન કરવું, SQL ક્વેરી સુધારવી. પરંતુ તે જ AI તમને ક્યારેય જોયો ન હોય તેવા ડેટા માટે "કોરિલેશન 0.72" જેવા વિશ્વાસપૂર્ણ બનાવટ પણ આપી શકે છે.
આ પ્રથમ એકમ પુસ્તકાલય પરિચય નથી. તેનો હેતુ એ સ્પષ્ટ કરવાનો છે કે ડેટા સાયન્સ વર્કફ્લોમાં AI ને ક્યાં મૂકવું અને ક્યાં મૂકવું નહીં. ચાલો શરૂઆતથી જ મૂળભૂત સિદ્ધાંત મૂકીએ: AI એ સહાયક છે, ડેટા સાયન્ટિસ્ટ નથી. કયો ડેટા એકત્રિત કરવો, કયા મેટ્રિક પર નિર્ણય લેવો, ઉત્પાદનમાં મોડેલ મૂકવું કે કેમ અને નૈતિક સીમાઓ ક્યાં દોરવી તેનો નિર્ણય સક્ષમ નિષ્ણાત પર રહેલો છે. બિન-સહી કરેલ વિશ્લેષણ અહેવાલની જેમ વણચકાસાયેલ AI આઉટપુટ જોખમી છે.
ડેટા સાયન્સ વર્કફ્લો: એન્ડ-ટુ-એન્ડ મેપ
ડેટા પ્રોજેક્ટને સમજવા માટે, તેને છ તબક્કામાં વિભાજિત કરવું મદદરૂપ છે. આ સમગ્ર મોડ્યુલ આ નકશાને અનુસરે છે.
1. સમસ્યાની વ્યાખ્યા: કયા નિર્ણયને સમર્થન આપવા માટે આપણે શું માપીએ છીએ, શા માટે? આ તબક્કો એઆઈને સોંપવામાં આવ્યો નથી; તે વ્યક્તિ છે જે કામને વ્યાખ્યાયિત કરે છે.
2. ડેટા સંગ્રહ: સ્ત્રોતોને ઓળખવા, ડેટા કાઢવા, નમૂના લેવા. (એકમ 2)
3. ડેટા સફાઈ અને પ્રીપ્રોસેસિંગ: ખૂટે છે મૂલ્ય, આઉટલીયર, પ્રકાર રૂપાંતરણ. (એકમ 3)
4. સંશોધનાત્મક ડેટા વિશ્લેષણ (EDA - સંશોધનાત્મક ડેટા વિશ્લેષણ, "આંખ દ્વારા" ડેટાના વિતરણ અને સંબંધોને ઓળખવાનો તબક્કો): (યુનિટ 4)
5. ફીચર એન્જિનિયરિંગ અને મોડેલિંગ: વેરિયેબલ જનરેશન, અલ્ગોરિધમ સિલેક્શન, ટ્રેનિંગ, મૂલ્યાંકન. (એકમ 5, 6, 7)
6. કોમ્યુનિકેશન અને પ્રોડક્શન: વિઝ્યુલાઇઝેશન, સ્ટોરી, MLOps (મૉડલને લાઇવ લેવાની અને તેનું નિરીક્ષણ કરવાની શિસ્ત). (એકમ 8, 11)
AI આ છ તબક્કામાંના દરેકમાં અલગ-અલગ સત્તા સાથે કાર્ય કરે છે. નીચે આપેલ કોષ્ટક સત્તાના આ વિતરણનો સારાંશ આપે છે; આ મોડ્યુલનું એકમાત્ર સૌથી મહત્વપૂર્ણ કોષ્ટક છે.
સ્ટેજ
AI ની ભૂમિકા
જોખમ સ્તર
કોણ મંજૂર કરે છે
સમસ્યાની વ્યાખ્યા
વિચારશીલ ભાગીદાર
નીચું
ડેટા વૈજ્ઞાનિક + હિસ્સેદાર
સફાઈ કોડ લખો
કોડ સ્કેચ જનરેટર
મધ્યમ
ડેટા સાયન્ટિસ્ટ (કોડ વાંચે છે)
EDA ટિપ્પણી
પેટર્ન સૂચક
મધ્યમ
ડેટા વૈજ્ઞાનિક
ફીચર જનરેશન
આઈડિયા અને કોડ જનરેટર
મધ્યમ-ઉચ્ચ
લીક નિયંત્રણ આવશ્યક છે
મોડલ પસંદગી/મેટ્રિક
સલાહકાર
ઉચ્ચ
ડેટા વૈજ્ઞાનિક
ઉત્પાદનમાં મૂકવાનો નિર્ણય
સહાયક ઇનપુટ
ખૂબ ઊંચી
ટીમ + વ્યવસાય માલિક
નૈતિકતા/ગોપનીયતાની મંજૂરી
ઉત્તેજક
ખૂબ ઊંચી
માનવ, હંમેશા
આ ચાર્ટમાંથી એક વાક્ય ધ્યાનમાં રાખો: જેમ જેમ દાવ વધે છે તેમ, AI ની ભૂમિકા સંકોચાય છે અને માનવીય મંજૂરી વધે છે.
શા માટે ચકાસણી આ વ્યવસાયનું હૃદય છે
AI ભાષાના મૉડલ્સ ખાતરીપૂર્વક લાગે છે, પરંતુ તેઓ ચોક્કસ ન પણ હોઈ શકે. તકનીકી ભાષામાં, આને આભાસ કહેવામાં આવે છે: તે અસ્ખલિત વાક્યમાં અવિદ્યમાન માહિતીનું મોડેલ બનાવટ છે જાણે તે સાચું હોય. ડેટા સાયન્સમાં, આ ત્રણ સ્વરૂપોમાં આવે છે. પહેલો નકલી નંબર છે: જો તમે કોઈ ડેટા આપ્યા વિના મોડેલને "સરેરાશ ઓર્ડરની રકમ શું છે" પૂછો, તો તે તમારો ડેટા ક્યારેય જોયો ન હોવા છતાં, તે વિશ્વાસપૂર્વક તમને નંબર કહેશે. બીજું એક ફંક્શન છે જે અસ્તિત્વમાં નથી: મોડેલ એવું ફંક્શન સૂચવે છે જે બિલકુલ અસ્તિત્વમાં નથી, જેમ કે pandas.read_excel_fast(). ત્રીજું, ખોટું આંકડાકીય અર્થઘટન: મોડેલ ક્લાસિક આંકડાકીય ભૂલને સરળતાથી પુનરાવર્તિત કરી શકે છે જેમ કે "p-વેલ્યુ 0.04 છે, તેથી પૂર્વધારણા 96% સાચી છે".
ચકાસણી શિસ્ત ત્રણ પગલાંઓ સમાવે છે:
- સ્રોતની લિંક: દરેક નંબર, દર અને વલણ તમારા ડેટામાંથી આવવું જોઈએ, AIની મેમરીમાંથી નહીં. ડેટાને યાદ રાખવા માટે નહીં, પરંતુ ડેટા પર કામ કરતા કોડ માટે AI નો ઉપયોગ કરો.
- ચલાવો અને સરખામણી કરો: એઆઈ દ્વારા આપેલ કોડના દરેક ભાગને જાતે ચલાવો; તે બનાવેલ દરેક મેટ્રિકની તુલના સ્વતંત્ર આધારરેખા સાથે કરો.
- નિષ્ણાત ફિલ્ટર: તમારા માટે પરીક્ષણ કરો કે શું આઉટપુટ આંકડા અને ડોમેન જ્ઞાનનો વિરોધાભાસ કરે છે.
સાવધાન: AI દ્વારા લખાયેલ વિશ્લેષણને ચલાવ્યા વિના પ્રેઝન્ટેશનમાં મૂકવું અને તેને વાંચવું એ સહી વિનાનો અહેવાલ રજૂ કરવા જેવું છે. કોડ કામ કરે છે એનો અર્થ એ નથી કે તે સાચો છે; કોડ કે જે ખોટા કૉલમનો સરવાળો કરે છે તે પણ ભૂલો વિના કામ કરે છે.
પુનઃઉત્પાદનક્ષમતા: સમાન પરિણામ બે વાર ઉત્પન્ન કરવામાં સક્ષમ હોવું
ડેટા સાયન્સનો શાંત પરંતુ નિર્ણાયક સિદ્ધાંત પ્રજનનક્ષમતા છે: જ્યારે તમે છ મહિના પછી અથવા બીજા કમ્પ્યુટર પર ફરીથી વિશ્લેષણ ચલાવો છો, ત્યારે તમને સમાન પરિણામ મળે છે. AI સાથે કામ કરતી વખતે આ જોખમ વધે છે, કારણ કે જ્યારે તમે AI ને "આ ગ્રાફ બનાવવા" અને તેને મેન્યુઅલી ચલાવવા માટે કહો છો, ત્યારે સ્ટેપ્સ અદૃશ્ય થઈ જાય છે. નિયમ: દરેક પગલું કોડ અને સંસ્કરણ નિયંત્રણમાં નોંધાયેલ હોવું આવશ્યક છે (જેમ કે Git); રેન્ડમનેસ સાથે સંકળાયેલા પગલાઓમાં, રેન્ડમ સીડ (રેન્ડમ નંબર જનરેટરનું પ્રારંભિક મૂલ્ય; જો નિશ્ચિત હોય, તો પરિણામ પુનરાવર્તિત થશે) નિશ્ચિત હોવું જોઈએ. અમે એકમ 10 માં આ વિષયને વધુ ઊંડો કરીશું; હમણાં માટે, આ ટેવ પાડો: "હાથથી ક્લિક કરશો નહીં, કોડમાં લખો."
ત્રણ નાના કેસો
કેસ 1 - સલામત પ્રવેગક. ઈ-કોમર્સ વિશ્લેષક સામાન્ય રીતે 240 હજાર પંક્તિઓના ઓર્ડર ટેબલને સાફ કરવામાં અડધો દિવસ પસાર કરે છે. તેણે AI ને કૉલમના નામ અને પ્રથમ 5 પંક્તિઓ (વ્યક્તિગત ડેટા વિના) આપી અને પાંડા સફાઈ કોડ માંગ્યો. AI એ 8 સેકન્ડમાં ડ્રાફ્ટ બનાવ્યો; વિશ્લેષકે લાઇન દ્વારા કોડ લાઇન વાંચી, તારીખ પદચ્છેદનમાં ભૂલ સુધારી અને તેને ચલાવી. અવધિ: 4 કલાકને બદલે 35 મિનિટ. AI એ કોડ પ્રદાન કર્યો, ચકાસણી માનવ પાસે રહી.
કેસ 2 - બનાવેલ મેટ્રિક ટ્રેપ. એક ઇન્ટર્નએ એઆઈને પૂછ્યું, "આ ડેટા પર રેન્ડમ ફોરેસ્ટ કેટલું સચોટ છે?" મોડેલને બિલકુલ તાલીમ આપ્યા વિના. "લગભગ 89%," એઆઈએ કહ્યું. ઇન્ટર્ન આને પ્રસ્તુતિમાં મૂકે છે; જ્યારે વાસ્તવિક મોડેલને તાલીમ આપવામાં આવી હતી, ત્યારે ચોકસાઈ 71% હતી. ભૂલ: AI ને ડેટા અને મોડેલ આપ્યા વિના મેટ્રિક્સની રાહ જોવી.
કેસ 3 - સાયલન્ટ લીક. એક ટીમે "લક્ષ્ય વેરીએબલના સરેરાશને લક્ષણ તરીકે ઉમેરો" ના AI-સૂચવેલ વિચારને પ્રશ્ન કર્યા વિના અમલમાં મૂક્યો. મોડેલે ટેસ્ટ સેટ પર 98% પ્રદર્શન કર્યું પરંતુ ઉત્પાદનમાં ક્રેશ થયું કારણ કે આ સુવિધા ભવિષ્યની માહિતી લીક કરી રહી હતી (ડેટા લીક, યુનિટ 10). ભૂલ: આંકડાકીય રીતે AI ભલામણને ફિલ્ટર કરતી નથી.
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા પ્રોમ્પ્ટ:
આ વેચાણ ડેટાનું વિશ્લેષણ કરો અને મને સરેરાશ આવક જણાવો.
આ દાવો ખામીયુક્ત છે: AI ને ડેટા આપવામાં આવ્યો ન હતો, તેથી "સરેરાશ આવક" ફક્ત બનાવી શકાય છે. ન તો સ્તંભો, ન સમયગાળો, ન ચલણ સ્પષ્ટ છે.
શક્તિશાળી પ્રોમ્પ્ટ:
તમારી ભૂમિકા: ડેટા સાયન્ટિસ્ટને મદદ કરનાર સહાયક. મારી પાસે પાંડા ડેટાફ્રેમ છે: df. કૉલમ્સ:- order_date (ટેક્સ્ટ, ફોર્મેટમાં "2024-03-01")- amount_tl (દશાંશ, કેટલીક પંક્તિઓમાં NaN) - customer_id (પૂર્ણાંક) કાર્ય: (1) સરેરાશ રકમની ગણતરી કરતા પાંડા કોડ લખો, (2) તે NaN મૂલ્યોને કેવી રીતે હેન્ડલ કરે છે તે સમજાવો, (3) કોડ ધારણાઓને સૂચિબદ્ધ કરે છે. ડેટા સામગ્રી બનાવશો નહીં; માત્ર કોડ જનરેટ કરો અને હું ચલાવીશ અને પરિણામ ચકાસીશ.
આ વિનંતીમાં, યોજના, અપેક્ષા અને "બનાવટ પર પ્રતિબંધ" સ્પષ્ટ છે. તમે હજી પણ ચલાવો છો અને આઉટપુટ જાતે ચકાસો છો.
નૈતિકતા અને ગોપનીયતાની શરૂઆત
ડેટા વિજ્ઞાન ઘણીવાર વ્યક્તિગત ડેટા સાથે કામ કરે છે: ગ્રાહક, દર્દી, કર્મચારી રેકોર્ડ. Türkiye માં KVKK (પર્સનલ ડેટા પ્રોટેક્શન લો) અને યુરોપમાં GDPR આ ડેટાને સુરક્ષિત કરે છે. સાર્વજનિક AI ટૂલમાં તમારું વાસ્તવિક નામ, ID, ઇમેઇલ અથવા સરનામું પેસ્ટ કરવું એ ઉલ્લંઘન છે. નિયમ: શેર કરતા પહેલા ડેટાને અનામી બનાવો, જો જરૂરી હોય તો માત્ર સ્કીમા (કૉલમના નામ, પ્રકાર) અને ડમી ઉદાહરણ પંક્તિ પ્રદાન કરો. અમે એકમ 11 માં નીતિશાસ્ત્રના વિષયને વધુ ઊંડો કરીશું; ચાલો શરૂઆતથી સિદ્ધાંત મૂકીએ: ડેટાને સમજવા માટે, તેની રચનાને શેર કરવી, તેની સામગ્રી નહીં, ઘણીવાર પૂરતી છે.
સામાન્ય ભૂલો
- AI ને ડેટા આપ્યા વિના સંખ્યાઓ/મેટ્રિક્સની રાહ જોવી. મોડેલ ડેટાને ઍક્સેસ કરી શકતું નથી; તે જે નંબર આપે છે તે નકલી છે. હંમેશા પરિણામની ગણતરી કરો અને ચલાવો.
- વિચારીને કે વર્કિંગ કોડ સાચો છે. કોડ કે જે ખોટા કૉલમમાં ચાલાકી કરે છે તે પણ ભૂલો વિના ચાલે છે; તર્ક વાંચ્યા વિના વિશ્વાસ ન કરવો.
- ખુલ્લા ટૂલમાં વાસ્તવિક વ્યક્તિગત ડેટા પેસ્ટ કરવું. નામ, આઈડી નંબર, ઈ-મેલ ક્યારેય શેર કરવામાં આવતા નથી; આકૃતિ પૂરતી છે.
- સ્ટેપ્સ મેન્યુઅલી કરવું અને કોડમાં લખવું નહીં. પુનઃઉત્પાદન ન કરી શકાય તેવું વિશ્લેષણ અવિશ્વસનીય છે.
- AI ના આંકડાઓના અર્થઘટનને પ્રશ્ન વિના સ્વીકારવું. AI પી-વેલ્યુ અને સહસંબંધ જેવા ખ્યાલોમાં ક્લાસિક ભૂલોનું પુનરાવર્તન કરી શકે છે.
ટીપ: તમારા દરેક AI સત્રોમાં ટૂંકી "નિયમ રેખા" શામેલ કરો: "ડેટા સામગ્રી બનાવશો નહીં; ફક્ત કોડ/વિશ્લેષણ બનાવો અને હું પરિણામ ચલાવીશ અને ચકાસીશ; જ્યાં તમને ખાતરી નથી ત્યાં 'ચોક્કસ નથી' સૂચવો." આ એક વાક્ય આભાસના જોખમને નોંધપાત્ર રીતે ઘટાડે છે.
સારાંશમાં
AI ડેટા વિજ્ઞાનમાં એક શક્તિશાળી સહાયક છે: તે સફાઈ કોડ, EDA અર્થઘટન, મોડેલ ભલામણ અને વિઝ્યુલાઇઝેશનને વેગ આપે છે. પરંતુ સમસ્યાની વ્યાખ્યા, મેટ્રિક પસંદગી, ઉત્પાદન નિર્ણય અને નૈતિક સીમાઓ મનુષ્યની છે. વર્કફ્લોમાં છ તબક્કા હોય છે અને જોખમ વધે તેમ AI ની ભૂમિકા નાની થતી જાય છે. ત્રણ આદતો દરેક વસ્તુનો પાયો છે: સ્ત્રોત લિંકિંગ (માન્યતા), પુનઃઉત્પાદનક્ષમતા (કોડિંગ), અને અનામીકરણ (ગોપનીયતા). એકવાર તમે આ ત્રણને આંતરિક બનાવી લો, પછી બાકીના મોડ્યુલમાં દરેક સાધન તમારા માટે સલામત પ્રવેગક બની જાય છે.
એપ્લિકેશન કાર્ય
ફક્ત તમારી પાસેના નાના ટેબલની સ્કીમા બનાવો (અથવા કાલ્પનિક એક): કૉલમના નામ, પ્રકારો અને 2-3 ડમી ઉદાહરણ પંક્તિઓ (વાસ્તવિક વ્યક્તિગત ડેટા વિના). ઉપરના "પાવરફુલ પ્રોમ્પ્ટ" ટેમ્પલેટનો ઉપયોગ કરીને સારાંશ આંકડા કોડ માટે AI ને પૂછો. કોડ ચલાવો, આઉટપુટને મેન્યુઅલ મૂલ્ય સાથે સરખાવો, કોઈપણ બનાવટી ધારણાઓ માટે તપાસો અને 5 બુલેટ પોઈન્ટ્સમાં તમારા તારણો નોંધો.
ચેકલિસ્ટ
- શું મેં વાસ્તવિક વ્યક્તિગત ડેટાને બદલે માત્ર AI ને સ્કીમા અને નકલી નમૂનો આપ્યો છે?
- [ ] શું મેં તે કોડને વાંચ્યો અને ચલાવ્યો જે તે લાઇન બાય લાઇન બનાવે છે?
- [ ] શું મેં આઉટપુટમાં દરેક નંબરની સ્વતંત્ર રીતે ચકાસણી કરી છે?
- [ ] શું મેં વિશ્લેષણના દરેક પગલાને કોડમાં લખ્યા છે અને તેને પુનરાવર્તિત કર્યા છે?
- [ ] શું મેં મિશનનું જોખમ સ્તર નક્કી કર્યું છે અને અંતિમ નિર્ણય માનવને સોંપ્યો છે?