ஆதாயங்கள்:
- தரவு அறிவியலின் ஆறு-நிலை பணிப்பாய்வு (சிக்கல் வரையறை, சேகரிப்பு, சுத்தம் செய்தல், கண்டுபிடிப்பு, மாடலிங், தகவல் தொடர்பு) மற்றும் ஒவ்வொரு கட்டத்திலும் செயற்கை நுண்ணறிவு செயல்படும் அதிகாரம், பணி அபாய நிலைக்கு ஏற்ப வேறுபடுத்தும் திறன்
- ஒவ்வொரு செயற்கை நுண்ணறிவு வெளியீட்டையும் மூலத்துடன் இணைப்பதன் மூலம் சரிபார்க்கும் ஒரு ஒழுக்கத்தைப் பயன்படுத்துவதற்கான திறன், அதை இயக்குதல் மற்றும் ஒப்பிடுதல் மற்றும் நிபுணர் வடிகட்டுதல் மூலம் அனுப்புதல்.
- மறுஉருவாக்கம் மற்றும் தனியுரிமைக் கொள்கைகளை (குறியீடு, அநாமதேயமாக்கல்) முதல் நாளிலிருந்து பகுப்பாய்வு பழக்கமாக மாற்றும் திறன்
கச்சா, குழப்பமான மற்றும் அடிக்கடி "பொய்" தரவு ஒவ்வொரு நாளும் ஒரு தரவு விஞ்ஞானியின் மேசையில் இறங்குகிறது. விற்பனை அட்டவணையில், தேதி நெடுவரிசை மூன்று வெவ்வேறு வடிவங்களில் எழுதப்பட்டுள்ளது; சில வரிகளில் வாடிக்கையாளர் எண்கள் காலியாக உள்ளன; நெடுவரிசையின் பெயர் "வருமானம்", ஆனால் அதில் TL மற்றும் USD மதிப்புகள் உள்ளன. இந்த குழப்பத்தில் இருந்து நம்பகமான முடிவை எடுப்பதே தரவு அறிவியலின் பணி: தரவைச் சேகரித்தல், சுத்தம் செய்தல், அதை ஆய்வு செய்தல், மாதிரியை உருவாக்குதல், முடிவைச் சரிபார்த்தல் மற்றும் அதை ஒரு கதையாக மாற்றுதல். செயற்கை நுண்ணறிவு (AI, அல்லது சுருக்கமான கணினி அமைப்புகளுக்கான AI, உரை மற்றும் குறியீட்டை உருவாக்குதல், வடிவங்களை அடையாளம் காணுதல், சுருக்கம் மற்றும் கணிப்புகளை உருவாக்குதல்) இந்த சங்கிலியில் உள்ள ஒவ்வொரு இணைப்பையும் தொடலாம்: நிமிடங்களில் தூய்மைப்படுத்தல் குறியீட்டை எழுதுதல், ஆய்வுக்கு வரைபடங்களைப் பரிந்துரைத்தல், மாதிரியின் அளவீட்டை விளக்குதல், SQL வினவலை சரிசெய்தல். ஆனால் அதே AI ஆனது இதுவரை பார்த்திராத தரவுகளுக்கு "தொடர்பு 0.72" போன்ற நம்பிக்கையான புனைகதையையும் உங்களுக்கு வழங்க முடியும்.
இந்த முதல் அலகு நூலக அறிமுகம் அல்ல. தரவு அறிவியல் பணிப்பாய்வுகளில் AI ஐ எங்கு வைக்க வேண்டும் மற்றும் எங்கு வைக்கக்கூடாது என்பதை தெளிவுபடுத்துவதே இதன் நோக்கம். ஆரம்பத்திலிருந்தே அடிப்படைக் கொள்கையை உருவாக்குவோம்: AI ஒரு உதவியாளர், தரவு விஞ்ஞானி அல்ல. எந்தத் தரவைச் சேகரிக்க வேண்டும், எந்த அளவுகோலைத் தீர்மானிக்க வேண்டும், ஒரு மாதிரியை தயாரிப்பில் வைப்பதா, நெறிமுறை எல்லைகளை எங்கு வரையலாம் என்ற முடிவு திறமையான நிபுணரிடம் உள்ளது. கையொப்பமிடப்படாத பகுப்பாய்வு அறிக்கையைப் போலவே சரிபார்க்கப்படாத AI வெளியீடு ஆபத்தானது.
தரவு அறிவியல் பணிப்பாய்வு: முடிவு முதல் இறுதி வரை வரைபடம்
தரவுத் திட்டத்தைப் புரிந்து கொள்ள, அதை ஆறு கட்டங்களாகப் பிரிப்பது உதவியாக இருக்கும். இந்த முழு தொகுதியும் இந்த வரைபடத்தைப் பின்பற்றுகிறது.
1. சிக்கல் வரையறை: நாம் எதை அளவிடுகிறோம், ஏன், எந்த முடிவை ஆதரிக்க வேண்டும்? இந்த கட்டம் AI க்கு வழங்கப்படவில்லை; அந்த நபரே வேலையை வரையறுப்பார்.
2. தரவு சேகரிப்பு: ஆதாரங்களைக் கண்டறிதல், தரவைப் பிரித்தெடுத்தல், மாதிரி எடுத்தல். (அலகு 2)
3. தரவு சுத்திகரிப்பு மற்றும் முன்செயலாக்கம்: காணவில்லை மதிப்பு, அவுட்லியர், வகை மாற்றம். (அலகு 3)
4. ஆய்வு தரவு பகுப்பாய்வு (EDA - ஆய்வு தரவு பகுப்பாய்வு, "கண் மூலம்" தரவுகளின் விநியோகம் மற்றும் உறவுகளை அங்கீகரிக்கும் நிலை): (அலகு 4)
5. அம்சம் பொறியியல் மற்றும் மாடலிங்: மாறி தலைமுறை, வழிமுறை தேர்வு, பயிற்சி, மதிப்பீடு. (அலகு 5, 6, 7)
6. தொடர்பு மற்றும் தயாரிப்பு: காட்சிப்படுத்தல், கதை, MLOps (மாதிரியை நேரலையில் எடுத்து அதைக் கண்காணிக்கும் ஒழுங்குமுறை). (அலகு 8, 11)
இந்த ஆறு நிலைகளில் ஒவ்வொன்றிலும் AI வெவ்வேறு அதிகாரத்துடன் செயல்படுகிறது. கீழே உள்ள அட்டவணை இந்த அதிகார விநியோகத்தை சுருக்கமாகக் கூறுகிறது; இது தொகுதியின் மிக முக்கியமான அட்டவணை.
மேடை
AI இன் பங்கு
ஆபத்து நிலை
யார் அங்கீகரிக்கிறார்கள்
பிரச்சனை வரையறை
மூளைச்சலவை செய்யும் பங்குதாரர்
குறைந்த
தரவு விஞ்ஞானி + பங்குதாரர்
தூய்மைப்படுத்தும் குறியீட்டை எழுதவும்
குறியீடு ஸ்கெட்ச் ஜெனரேட்டர்
நடுத்தர
தரவு விஞ்ஞானி (குறியீட்டைப் படிக்கிறார்)
EDA கருத்து
மாதிரி பரிந்துரையாளர்
நடுத்தர
தரவு விஞ்ஞானி
அம்சம் உருவாக்கம்
யோசனை மற்றும் குறியீடு ஜெனரேட்டர்
நடுத்தர உயர்
கசிவு கட்டுப்பாடு அவசியம்
மாதிரி தேர்வு/மெட்ரிக்
ஆலோசகர்
உயர்
தரவு விஞ்ஞானி
உற்பத்தியில் ஈடுபட முடிவு
துணை உள்ளீடு
மிக உயர்ந்தது
குழு + வணிக உரிமையாளர்
நெறிமுறைகள்/தனியுரிமை ஒப்புதல்
ஊக்கி
மிக உயர்ந்தது
மனிதன், எப்போதும்
இந்த விளக்கப்படத்தின் ஒரு வாக்கியத்தை நினைவில் கொள்ளுங்கள்: பங்குகள் உயரும் போது, AI இன் பங்கு சுருங்குகிறது மற்றும் மனித அங்கீகாரம் அதிகரிக்கிறது.
ஏன் சரிபார்ப்பு இந்த வணிகத்தின் இதயம்
AI மொழி மாதிரிகள் உறுதியாகத் தெரிகிறது, ஆனால் அவை உறுதியாக இல்லாமல் இருக்கலாம். தொழில்நுட்ப மொழியில், இது மாயத்தோற்றம் என்று அழைக்கப்படுகிறது: இது மாதிரி இல்லாத தகவல்களை ஒரு சரளமான வாக்கியத்தில் உண்மையாக இருப்பது போல் புனையப்பட்டது. தரவு அறிவியலில், இது மூன்று வடிவங்களில் வருகிறது. முதலாவது ஒரு போலி எண்: எந்த டேட்டாவையும் கொடுக்காமல் "சராசரி ஆர்டர் தொகை என்ன" என்று மாடலிடம் கேட்டால், அது உங்கள் டேட்டாவை இதுவரை பார்க்காத போதும், நம்பிக்கையுடன் ஒரு எண்ணைச் சொல்லும். இரண்டாவதாக இல்லாத ஒரு செயல்பாடு: pandas.read_excel_fast() போன்ற, இல்லாத ஒரு செயல்பாட்டை மாதிரி பரிந்துரைக்கலாம். மூன்றாவதாக, தவறான புள்ளிவிவர விளக்கம்: "p-மதிப்பு 0.04, எனவே கருதுகோள் 96% சரியானது" போன்ற உன்னதமான புள்ளிவிவரப் பிழையை மாதிரியானது சீராக மீண்டும் செய்யலாம்.
சரிபார்ப்பு ஒழுங்குமுறை மூன்று படிகளைக் கொண்டுள்ளது:
- மூலத்திற்கான இணைப்பு: ஒவ்வொரு எண், விகிதம் மற்றும் போக்கு ஆகியவை உங்கள் தரவிலிருந்து வர வேண்டும், AI இன் நினைவகத்திலிருந்து அல்ல. தரவை நினைவில் வைத்துக் கொள்வதற்காக அல்ல, தரவில் செயல்படும் குறியீட்டிற்கு AI ஐப் பயன்படுத்தவும்.
- இயக்கவும் மற்றும் ஒப்பிடவும்: AI வழங்கிய ஒவ்வொரு குறியீட்டையும் நீங்களே இயக்கவும்; அது உருவாக்கும் ஒவ்வொரு அளவீட்டையும் ஒரு சுயாதீன அடிப்படையுடன் ஒப்பிடுக.
- நிபுணர் வடிப்பான்: வெளியீடு புள்ளிவிவரங்களுக்கும் டொமைன் அறிவுக்கும் முரண்படுகிறதா என்பதை நீங்களே சோதித்துப் பாருங்கள்.
எச்சரிக்கை: AI ஆல் எழுதப்பட்ட பகுப்பாய்வை இயங்காமல் ஒரு விளக்கக்காட்சியில் வைப்பது மற்றும் அதைப் படிக்காமல் கையொப்பமிடாத அறிக்கையை வழங்குவது போன்றது. குறியீடு செயல்படுவதால் அது சரியானது என்று அர்த்தமல்ல; தவறான நெடுவரிசையைத் தொகுக்கும் குறியீடும் பிழைகள் இல்லாமல் வேலை செய்கிறது.
மறுஉருவாக்கம்: ஒரே முடிவை இரண்டு முறை உருவாக்க முடியும்
தரவு அறிவியலின் அமைதியான ஆனால் முக்கியமான கொள்கை மறுஉருவாக்கம்: ஆறு மாதங்களுக்குப் பிறகு அல்லது வேறு கணினியில் மீண்டும் ஒரு பகுப்பாய்வை இயக்கும்போது, அதே முடிவைப் பெறுவீர்கள். AI உடன் பணிபுரியும் போது இந்த ஆபத்து அதிகரிக்கிறது, ஏனெனில் "இந்த வரைபடத்தை உருவாக்கவும்" மற்றும் அதை கைமுறையாக இயக்க AI யிடம் கூறினால், படிகள் மறைந்துவிடும். விதி: ஒவ்வொரு அடியும் குறியீடு மற்றும் பதிப்புக் கட்டுப்பாட்டில் (Git போன்றவை) பதிவு செய்யப்பட வேண்டும்; சீரற்ற தன்மையை உள்ளடக்கிய படிகளில், சீரற்ற விதை (ரேண்டம் எண் ஜெனரேட்டரின் ஆரம்ப மதிப்பு; சரி செய்யப்பட்டால், விளைவு மீண்டும் மீண்டும் வரும்) சரி செய்யப்பட வேண்டும். இந்த தலைப்பை நாங்கள் அலகு 10 இல் ஆழப்படுத்துவோம்; இப்போதைக்கு, இந்த பழக்கத்திற்கு வரவும்: "கையால் கிளிக் செய்யாதீர்கள், குறியீட்டில் எழுதுங்கள்."
மூன்று சிறிய வழக்குகள்
வழக்கு 1 - பாதுகாப்பான முடுக்கம். ஒரு ஈ-காமர்ஸ் ஆய்வாளர் பொதுவாக 240 ஆயிரம் வரிசைகள் கொண்ட ஆர்டர் அட்டவணையை அழிக்க அரை நாள் செலவிடுவார். அவர் நெடுவரிசை பெயர்கள் மற்றும் முதல் 5 வரிசைகளை (தனிப்பட்ட தரவு இல்லாமல்) AI க்கு அளித்தார் மற்றும் பாண்டாக்களை சுத்தம் செய்யும் குறியீட்டைக் கேட்டார். AI 8 வினாடிகளில் வரைவைத் தயாரித்தது; ஆய்வாளர் குறியீட்டு வரியை வரியாகப் படித்து, தேதிப் பாகுபடுத்தலில் ஏற்பட்ட பிழையைச் சரிசெய்து, அதை இயக்கினார். கால அளவு: 4 மணிநேரத்திற்கு பதிலாக 35 நிமிடங்கள். AI குறியீட்டை வழங்கியது, சரிபார்ப்பு மனிதனிடம் இருந்தது.
வழக்கு 2 - உருவாக்கப்பட்ட மெட்ரிக் பொறி. ஒரு பயிற்சியாளர் AIயிடம், "இந்தத் தரவுகளில் ரேண்டம் காடு எவ்வளவு துல்லியமானது?" மாதிரி பயிற்சி இல்லாமல். "சுமார் 89%," AI கூறினார். பயிற்சியாளர் இதை விளக்கக்காட்சியில் வைத்தார்; உண்மையான மாதிரி பயிற்சியளிக்கப்பட்டபோது, துல்லியம் 71% ஆக இருந்தது. தவறு: AIக்கு தரவு மற்றும் மாதிரிகளை வழங்காமல் அளவீடுகளுக்காகக் காத்திருக்கிறது.
வழக்கு 3 - அமைதியான கசிவு. "இலக்கு மாறியின் சராசரியை ஒரு அம்சமாகச் சேர்" என்ற AI-பரிந்துரைக்கப்பட்ட யோசனையை ஒரு குழு கேள்வி கேட்காமல் செயல்படுத்தியது. இந்த மாடல் சோதனைத் தொகுப்பில் 98% செயல்பட்டது, ஆனால் இந்த அம்சம் எதிர்காலத் தகவல்களைக் கசியவிட்டதால் உற்பத்தியில் செயலிழந்தது (தரவு கசிவு, யூனிட் 10). தவறு: AI பரிந்துரையை புள்ளிவிவர ரீதியாக வடிகட்டவில்லை.
பலவீனமான வரியில் / வலுவான வரியில்
பலவீனமான உடனடி:
இந்த விற்பனைத் தரவை பகுப்பாய்வு செய்து சராசரி வருவாயைக் கூறவும்.
இந்த கூற்று குறைபாடுடையது: AI க்கு தரவு வழங்கப்படவில்லை, எனவே "சராசரி வருமானம்" மட்டுமே செய்ய முடியும். நெடுவரிசைகளோ, காலமோ, நாணயமோ தெளிவாக இல்லை.
சக்திவாய்ந்த தூண்டுதல்:
உங்கள் பங்கு: தரவு விஞ்ஞானிக்கு உதவியாளர். என்னிடம் ஒரு pandas DataFrame உள்ளது: df. நெடுவரிசைகள்:- order_date (உரை, வடிவத்தில் "2024-03-01")- amount_tl (தசமம், சில வரிசைகளில் NaN)- customer_id (முழு) பணி: (1) சராசரித் தொகையைக் கணக்கிடும் பாண்டாஸ் குறியீட்டை எழுதவும், (2) NaN மதிப்புகளை அது எவ்வாறு கையாளுகிறது என்பதை விளக்கவும், (3) குறியீட்டை அனுமானத்தை பட்டியலிடவும். தரவு உள்ளடக்கத்தை உருவாக்க வேண்டாம்; குறியீட்டை உருவாக்கவும், முடிவை இயக்கி சரிபார்ப்பேன்.
இந்த கோரிக்கையில், திட்டம், எதிர்பார்ப்பு மற்றும் "புனைவுத் தடை" ஆகியவை தெளிவாக உள்ளன. நீங்கள் இன்னும் இயங்கி, வெளியீட்டை நீங்களே சரிபார்க்கவும்.
நெறிமுறைகள் மற்றும் தனியுரிமையின் ஆரம்பம்
தரவு அறிவியல் பெரும்பாலும் தனிப்பட்ட தரவுகளுடன் செயல்படுகிறது: வாடிக்கையாளர், நோயாளி, பணியாளர் பதிவுகள். Türkiye இல் KVKK (தனிப்பட்ட தரவு பாதுகாப்பு சட்டம்) மற்றும் ஐரோப்பாவில் GDPR ஆகியவை இந்தத் தரவைப் பாதுகாக்கின்றன. உங்கள் உண்மையான பெயர், ஐடி, மின்னஞ்சல் அல்லது முகவரியை பொது AI கருவியில் ஒட்டுவது மீறலாகும். விதி: பகிர்வதற்கு முன் தரவை அநாமதேயமாக்குங்கள், தேவைப்பட்டால் ஸ்கீமா (நெடுவரிசைப் பெயர்கள், வகைகள்) மற்றும் போலி உதாரண வரிசையை மட்டும் வழங்கவும். அலகு 11 இல் நெறிமுறைகள் என்ற தலைப்பை ஆழப்படுத்துவோம்; ஆரம்பத்தில் இருந்தே கொள்கையை வைப்போம்: தரவைப் புரிந்து கொள்ள, அதன் கட்டமைப்பைப் பகிர்வது, அதன் உள்ளடக்கம் அல்ல, பெரும்பாலும் போதுமானது.
பொதுவான தவறுகள்
- AIக்கு தரவை வழங்காமல் எண்கள்/அளவீடுகளுக்காக காத்திருக்கிறது. மாதிரியால் தரவை அணுக முடியாது; அவர் கொடுத்த எண் போலியானது. முடிவை எப்போதும் கணக்கிட்டு இயக்கவும்.
- வேலை செய்யும் குறியீடு சரியானது என்று நினைத்து. தவறான நெடுவரிசையைக் கையாளும் குறியீடும் பிழைகள் இல்லாமல் இயங்கும்; தர்க்கத்தைப் படிக்காமல் நம்பாதீர்கள்.
- திறந்த கருவியில் உண்மையான தனிப்பட்ட தரவை ஒட்டுதல். பெயர், அடையாள எண், மின்னஞ்சல் ஆகியவை பகிரப்படாது; விளக்கப்படம் போதும்.
- படிகளை கைமுறையாகச் செய்வது மற்றும் குறியீட்டில் எழுதாமல் இருப்பது. மீண்டும் உருவாக்க முடியாத பகுப்பாய்வு நம்பகத்தன்மையற்றது.
- AI இன் புள்ளிவிவரங்களின் விளக்கத்தை கேள்வியின்றி ஏற்றுக்கொள்வது. AI ஆனது p-மதிப்பு மற்றும் தொடர்பு போன்ற கருத்துகளில் கிளாசிக் தவறுகளை மீண்டும் செய்யலாம்.
உதவிக்குறிப்பு: உங்களின் ஒவ்வொரு AI அமர்வுகளிலும் ஒரு சிறிய "விதி வரி"யைச் சேர்க்கவும்: "தரவு உள்ளடக்கத்தை உருவாக்க வேண்டாம்; குறியீடு/பகுப்பாய்வு உருவாக்கினால் போதும், முடிவை இயக்கிச் சரிபார்ப்பேன்; உங்களுக்குத் தெரியாத இடத்தில் 'நிச்சயமில்லை' என்பதைக் குறிப்பிடவும்." இந்த ஒற்றை வாக்கியம் மாயத்தோற்றங்களின் அபாயத்தை கணிசமாகக் குறைக்கிறது.
சுருக்கமாக
AI என்பது தரவு அறிவியலில் ஒரு சக்திவாய்ந்த உதவியாளர்: இது துப்புரவு குறியீடு, EDA விளக்கம், மாதிரி பரிந்துரை மற்றும் காட்சிப்படுத்தல் ஆகியவற்றை துரிதப்படுத்துகிறது. ஆனால் சிக்கல் வரையறை, மெட்ரிக் தேர்வு, உற்பத்தி முடிவு மற்றும் நெறிமுறை எல்லைகள் மனிதர்களுக்கு சொந்தமானது. பணிப்பாய்வு ஆறு நிலைகளைக் கொண்டுள்ளது, மேலும் ஆபத்து அதிகரிக்கும் போது AI இன் பங்கு சிறியதாகிறது. மூன்று பழக்கவழக்கங்கள் அனைத்திற்கும் அடித்தளமாக உள்ளன: மூல இணைப்பு (சரிபார்த்தல்), மறுஉருவாக்கம் (குறியீடு) மற்றும் அநாமதேயமாக்கல் (ரகசியம்). இந்த மூன்றையும் நீங்கள் உள்வாங்கியவுடன், மீதமுள்ள தொகுதியில் உள்ள ஒவ்வொரு கருவியும் உங்களுக்கு பாதுகாப்பான முடுக்கியாக மாறும்.
விண்ணப்ப பணி
உங்களிடம் உள்ள ஒரு சிறிய அட்டவணையை (அல்லது அனுமானமானது): நெடுவரிசைப் பெயர்கள், வகைகள் மற்றும் 2-3 போலி உதாரண வரிசைகள் (உண்மையான தனிப்பட்ட தரவு இல்லாமல்). மேலே உள்ள "பவர்ஃபுல் ப்ராம்ட்" டெம்ப்ளேட்டைப் பயன்படுத்தி சுருக்கமான புள்ளிவிவரக் குறியீட்டை AIயிடம் கேளுங்கள். குறியீட்டை இயக்கவும், வெளியீட்டை கையேடு மதிப்புடன் ஒப்பிடவும், ஏதேனும் போலி அனுமானங்களைச் சரிபார்க்கவும், மேலும் உங்கள் கண்டுபிடிப்புகளை 5 புல்லட் புள்ளிகளில் குறிப்பிடவும்.
சரிபார்ப்பு பட்டியல்
- [ ] நான் AI க்கு உண்மையான தனிப்பட்ட தரவுக்கு பதிலாக ஒரு திட்டத்தையும் போலி மாதிரியையும் கொடுத்தேனா?
- [ ] அது உருவாக்கிய குறியீட்டை வரி வரியாக நான் படித்து இயக்கியுள்ளேனா?
- [ ] வெளியீட்டில் உள்ள ஒவ்வொரு எண்ணையும் நான் சுயாதீனமாக சரிபார்த்திருக்கிறேனா?
- [ ] நான் பகுப்பாய்வின் ஒவ்வொரு அடியையும் குறியீட்டில் எழுதி அதை மீண்டும் மீண்டும் செய்யக்கூடியதாக மாற்றியுள்ளேனா?
- [] நான் பணியின் அபாய அளவை தீர்மானித்து, இறுதி முடிவை ஒரு மனிதனுக்கு ஒதுக்கியுள்ளேனா?