ඒකක
1. දත්ත විද්‍යාව සහ විශ්ලේෂණ පිළිබඳ කෘතිම බුද්ධිය හැඳින්වීම: කාර්ය ප්‍රවාහය, භූමිකාවන්, සීමා මායිම්, වලංගුකරණය සහ ආචාර ධර්ම 2. දත්ත රැස් කිරීම සහ මූලාශ්‍ර අවබෝධය: යෝජනා ක්‍රමය, නියැදීම, ගුණාත්මකභාවය සහ කාන්දුවීම් පිළිබඳ දැනුවත් කිරීම 3. දත්ත පිරිසිදු කිරීම සහ පෙර සැකසුම: අස්ථානගත වූ අගය, පිටස්තර සහ වර්ගය පරිවර්තනය 4. ගවේෂණාත්මක දත්ත විශ්ලේෂණය (EDA): බෙදාහැරීම්, සබඳතා සහ මූලික තීක්ෂ්ණ බුද්ධිය 5. විශේෂාංග ඉංජිනේරු: ප්‍රභේද ජනනය කිරීම, කේතනය කිරීම, පරිමාණය කිරීම සහ කාන්දු වීම වැළැක්වීම 6. ආදර්ශ ගොඩනැගීම: ගැටළු නිර්වචනය, ඇල්ගොරිතම තේරීම සහ පුහුණුව/පරීක්ෂණ බෙදීම 7. ආදර්ශ ඇගයීම: ප්‍රමිතික, හරස් වලංගුකරණය සහ අන්ත ඉගෙනීම 8. දෘශ්‍යකරණය සහ කතන්දර කීම: නිවැරදි ග්‍රැෆික්ස්, අවංක ග්‍රැෆික්ස් 9. කේත උත්පාදනය: Python (pandas) සහ SQL සමඟ AI-සහාය විශ්ලේෂණය 10. දත්ත කාන්දු වීම සහ ප්‍රතිනිෂ්පාදනය: නිහඬ විපත් සහ විනය 11. MLOps පදනම, ආචාර ධර්ම, පෞද්ගලිකත්වය සහ වගකීම් විශ්ලේෂණ
ඒකකය 3 / 11

දත්ත පිරිසිදු කිරීම සහ පෙර සැකසුම: අස්ථානගත වූ අගය, පිටස්තර සහ වර්ගය පරිවර්තනය

ලාභ:

  • නැතිවූ අගයන්ට හේතුව (අහඹු, ක්‍රමානුකූල, අර්ථවත්) වෙන්කර හඳුනා ගැනීමට සහ සුදුසු උපාය මාර්ගයක් තෝරාගෙන පුහුණුවෙන් පමණක් පිරවුම් අගය ගණනය කිරීමේ හැකියාව
  • ඒවා මකා දැමීමට පෙර පිටස්තරයන් පරීක්ෂා කිරීමට සහ දත්ත දෝෂයක් සහ සත්‍ය දුර්ලභ සිදුවීමක් අතර වෙනස හඳුනා ගැනීමේ හැකියාව
  • වර්ගය සහ ආකෘතියේ නොගැලපීම් සම්මතයට ගෙන ඒමේදී රේඛා/හිස් තැන් ගණනට එක් එක් පියවරේ බලපෑම නිරීක්ෂණය කිරීමෙන් නිහඬ අලාභ වළක්වා ගැනීමේ හැකියාව

දත්ත විද්‍යාඥයකුගේ කාලයෙන් ආසන්න වශයෙන් සියයට 60-80 ක් පමණ පිරිසිදු කිරීමට යයි; කර්මාන්තය තුළ, මෙය අඩක් විහිළුවක් ලෙස හඳුන්වනු ලබන්නේ "දත්ත පොරබැදීම" (data wrangling හෝ data cleaning) යනුවෙනි. තථ්‍ය-ලෝක දත්ත කිසිදා විශ්ලේෂණ සඳහා සූදානම් නොවන නිසා: දින මිශ්‍ර ආකෘති, අංක පෙළ ලෙස ගබඩා කර ඇත, සමහර කොටු හිස් ය, පාරිභෝගිකයෙකු විවිධ අක්ෂර වින්‍යාස දෙකකින් එකම වගුවක තුන් වරක් පෙනී සිටියි. මෙම ඒකකය තුළ අපි පිරිසිදු කිරීමේ මූලික අංග තුනක් ආවරණය කරන්නෙමු: නැතිවූ අගයන්, පිටස්තරයන් සහ වර්ගය/ආකෘති පරිවර්තනය. කෘතිම බුද්ධිය යනු මෙම කාර්යයේ අසාමාන්‍ය ලෙස වේගවත් සහායකයෙකි; නමුත් පිරිසිදු කළ යුත්තේ කුමක්ද සහ කෙසේද යන්න තීරණය කරන්නේ ඔබයි, මන්ද එක් එක් පිරිසිදු කිරීමේ තේරීම විශ්ලේෂණය වෙනස් කරයි.

පිරිසිදු කිරීමේ රන් රීතිය: සෑම වෙනස්කමක්ම තීරණයකි

කොටුවක් මකා දැමීම, නැතිවූ අගයක් මධ්‍යන්‍යයෙන් පිරවීම, පිටස්තරයක් කැපීම - මේ කිසිවක් “උදාසීන” ක්‍රියාවන් නොවේ. ඒ සෑම එකක්ම දත්ත වෙනස් කරන අතර ප්‍රතිඵලයට බලපායි. එබැවින් පිරිසිදු කිරීමේ ස්වර්ණමය රීතිය: සෑම වෙනස්කමක්ම කේතයට ලියන්න, තාර්කිකත්වය සටහන් කරන්න, කිසි විටෙකත් මුල් දත්ත උඩින් ලියන්න එපා. AI ඔබට ඉක්මන් පිරිසිදු කිරීමේ කේතයක් ලබා දෙයි, නමුත් එම කේතය කරන්නේ කුමක්ද යන්න තේරුම් ගැනීම ඔබේ වගකීමකි; "හිස් ලයින් මකන්න" කිව්වම ලයින් කීයක් ගියාද කියලා බලන්නේ නැතුව දුවන්න එපා.

අවවාදයයි: කිසි විටෙකත් මුල් අමු දත්ත වෙනස් නොකරන්න. පිරිසිදු කළ අනුවාදය වෙනම ගොනුවකට/වගුවකට ලියන්න. මේ ආකාරයට, ඔබ දෝෂයක් දුටුවහොත්, ඔබට නැවත වර්ග එක වෙත ගොස් ප්‍රතිනිෂ්පාදනය පවත්වා ගත හැක.

අස්ථානගත වූ අගයන්: එය හිස් වන්නේ ඇයි, කුමක් කළ යුතුද?

නැතිවූ අගයක් (සාමාන්‍යයෙන් NaN ලෙස දිස්වේ - පැන්ඩා වල "අංකයක් නොවේ") යනු සෛලයක් හිස් වූ විටය. නමුත් පරතරය ඇතිවීමට හේතුව විසඳුම තීරණය කරයි. සාමාන්ය තත්වයන් තුනක් තිබේ. අහඹු ලෙස අතුරුදහන්: සංවේදකය මොහොතකට වැඩ කළේ නැත; එය පිරවීම සාධාරණ විය හැකිය. ක්‍රමානුකූලව අතුරුදහන්: පෝරම ක්ෂේත්‍රයක් ඉල්ලා සිටින්නේ ඇතැම් පාරිභෝගිකයින් සඳහා පමණි; මෙහි ඇති පරතරය ඇත්ත වශයෙන්ම තොරතුරු වේ. සැලකිය යුතු අතුරුදහන්: "ආපසු පැමිණීමේ දිනය" හිස් නම්, පාරිභෝගිකයා ආපසු නොපැමිණියේය; මෙම අවකාශය 0 හෝ "කිසිවක් නැත" යන්නෙන් අදහස් වේ, එය පුරවා නැත.

ප්රධාන උපාය මාර්ග:

උපාය මාර්ගය

එය සුදුසු වන්නේ කවදාද?

අවදානම

පේළිය මකන්න

නැතිවීමේ අනුපාතය ඉතා අඩු (<5%) සහ අහඹු වේ

දත්ත සහ නියෝජනය අහිමි වීම

තීරුවක් මකන්න

බොහෝ තීරු හිස් (>60%)

තොරතුරු නැතිවීම

සාමාන්‍ය/මධ්‍ය පිරවීම

සංඛ්‍යාත්මක, අහඹු ලෙස අතුරුදහන්

එය විචලනය අඩු කරන අතර බෙදා හැරීම විකෘති කරයි

"නොදන්නා" කාණ්ඩය

වර්ගීකරණය, ක්රමානුකූලව අතුරුදහන්

අතිරේක කාණ්ඩ උත්පාදනය කරයි

ආකෘතිය සමඟ අනාවැකි

සංකීර්ණ, වටිනා තීරුව

කාන්දු වීමේ අවදානම, සංකීර්ණත්වය

තීරණාත්මක කරුණ: ආරෝපණ අගය ගණනය කළ යුත්තේ පුහුණු දත්ත වලින් පමණක් වන අතර එම අගයම පරීක්ෂණ දත්ත සඳහා යෙදිය යුතුය. ඔබ පරීක්ෂණ දත්තවල සාමාන්‍යය ඇතුළත් කළහොත්, ඔබ කාන්දුවක් ඇති කරයි (ඒකක 10). මධ්‍යන්‍ය (සාමාන්‍ය දත්තවල මධ්‍ය අගය) බොහෝ විට මධ්‍යන්‍යයට වඩා කැමති වන්නේ එය මධ්‍යයට වඩා පිටස්තරයන්ට වඩා ශක්තිමත් බැවිනි.

පිටස්තරයන්: දෝෂයක් හෝ සැබෑවක්ද?

පිටස්තරයෙක් දේවල් දෙකෙන් එකක් විය හැකිය: දත්ත දෝෂයක් (වයස තීරුවේ 999) හෝ සැබෑ නමුත් දුර්ලභ සිදුවීමක් (පාරිභෝගිකයෙකුගේ ඩොලර් මිලියන 2 ක ඇණවුම). මේ දෙක ව්‍යාකූල කිරීම විනාශකාරී ය: සැබෑ පිටස්තරයෙක් මකා දැමීම සහ ඔබ වැදගත් තොරතුරු ඉවත දමන්න; ඔබ වැරැද්දක් අත්හැරියහොත්, ඔබේ සාමාන්යය දුක් විඳිනු ඇත. එමනිසා, එය ස්වයංක්‍රීයව මකා දැමීම නොව, ප්‍රථමයෙන් පිටස්තරය පරීක්ෂා කිරීම අවශ්‍ය වේ.

පොදු හඳුනාගැනීමේ ක්‍රම: IQR ක්‍රමය (අන්තර් හතරැස් පරාසය; දත්තවල 25% සහ 75% ක්වින්ටයිල් අතර වෙනස මෙන් 1.5 ගුණයකට වඩා වැඩි අගයන් පිටස්තරයන් ලෙස සැලකේ) සහ z-ස්කෝර් (මධ්‍යන්‍ය අගයෙන් බැහැර සම්මත අපගමන සංඛ්‍යාව; සාමාන්‍යයෙන් එය 3 ට වඩා වැඩි නම් පිටස්තර වේ). AI මෙම ගණනය කිරීම් සඳහා කේතය තත්පර කිහිපයකින් ලියයි; නමුත් ඔබ "මකන්න" කීමට පෙර, එම අගයන් මොනවාදැයි පරීක්ෂා කරන්න.

වර්ගය සහ ආකෘති පරිවර්තනය: නිහඬ දෝෂ මූලාශ්රය

වඩාත්ම හිසරදය වන්නේ දත්ත ආකාරයේ ව්යාකූලත්වයයි. "මුදල්" තීරුවක් පෙළ ලෙස ගබඩා කර ඇත්නම්, ඔබට එකතු කළ නොහැක; වැඩසටහන "එක්දහස් දෙසිය පනහ" වෙනුවට "1,250.50" වැනි තුර්කි ආකෘතිගත අංකයක් වැරදි ලෙස කියවයි. දිනයන් ("01/03/2024" දින-මාසය හෝ මාසය-දිනය?), කාණ්ඩ ("පිරිමි"/"පිරිමි"/"M" යනු එකම දෙයද?) සහ ඒකක (TL හෝ kuruş?) නිශ්ශබ්දව වැරදි ප්‍රතිඵල නිපදවයි. පිරිසිදු කිරීමේ විශාල කොටසක් වන්නේ මෙම නොගැලපීම් සම්මතයට ඇද දැමීමයි: දිනයන් එක් ආකෘතියකට, කාණ්ඩ එක් අක්ෂර වින්‍යාසයකට, අංක එක ඒකකයකට.

කුඩා නඩු තුනක්

නඩුව 1 - සාමාන්ය උගුල. කණ්ඩායමක් ආදායම් තීරුවේ නැතිවූ අගයන් 320 සාමාන්‍යයෙන් ($48,500) පුරවා ඇත. එහෙත් අඩුපාඩු ක්රමානුකූල විය: මේවා කිසි විටෙක ආදායම ප්රකාශ නොකළ අඩු ආදායම්ලාභී කොටසකි. සාමාන්‍ය පිරවීම මෙම කණ්ඩායම කෘතිමව පොහොසත් කළ අතර ණය ආකෘතිය වැරදියි. පාඩම: එය පිරවීමට පෙර "එය හිස් වන්නේ ඇයි" කියා අසන්න.

නඩුව 2 - මකා නොදැමිය යුතු පිටත. සිල්ලර විශ්ලේෂකයෙකු විකුණුම් දත්තවල විශාල ඇණවුම් 4 ක් (ටීඑල් මිලියන 1.8 බැගින්) මකා දැමුවේ ඒවා "දෝෂ" යැයි සිතමිනි. කෙසේ වෙතත්, මේවා සැබෑ ආයතනික ඇණවුම් වූ අතර මුළු පිරිවැටුමෙන් 22% ක් විය. පශ්චාත් මකාදැමීමේ පුරෝකථන ආකෘතියට ආයතනික ඉල්ලුම සම්පූර්ණයෙන්ම මග හැරී ගියේය. පාඩම: එය මකා දැමීමට පෙර පිටස්තරය පරීක්ෂා කරන්න.

නඩුව 3 - දින ආකෘති ව්යසනය. CSV එකක, දිනයන් "2024-03-01" සහ "01.03.2024" යන දෙකටම මිශ්‍ර කර ඇත. YZ විසින් ලියන ලද කේතය පළමු ආකෘතියට අනුව විග්‍රහ කළ විට, පේළි 6,400 "අවලංගු දිනය" ලෙස NaT බවට පත් වූ අතර විශ්ලේෂණයෙන් නිහඬව බැහැර කරන ලදී. විශ්ලේෂකයා මෙය දුටුවේ පේළි ගණන අඩු වූ විට පමණි. පාඩම: පරිවර්තනයෙන් පසු සෑම විටම රේඛා සහ හිස් තැන් ගණන පරීක්ෂා කරන්න.

පිටපත් කළ හැකි සැකිලි හතරක්

1) අස්ථානගත අගය සිතියම:

මට pandas df තියෙනවා. එක් එක් තීරුව සඳහා අතුරුදහන් වූ සංඛ්‍යාව සහ ප්‍රතිශතය (NaN) පෙන්වන වගුවක් නිපදවන කේතය ලියන්න. ඉන්පසුව, 40% ඉක්මවන අස්ථානගත වූ අනුපාතයක් ඇති තීරු සහ 5%ට වඩා අඩු අගයක් ඇති තීරු වෙන වෙනම ලැයිස්තුගත කරන්න. මෙම රෝග විනිශ්චය කේතය ජනනය කරන්න, ඔබ යෝජනා කරන උපාය මාර්ගය නොවේ; මම තීරණය කරන්නම්.

2) පිටත පරීක්ෂාව (මකා දැමීම නොවේ):

IQR ක්‍රමය භාවිතයෙන් මගේ "මුදල" තීරුව සඳහා පිටතින් හඳුනා ගන්නා (මකන්නේ නැත!) කේතය ලියන්න. පිටත පේළි වෙනම df එකක දමන්න එවිට මට ඒවා අතින් පරීක්ෂා කළ හැක. පිටස්තරයින් ගණන සහ මුළු කොටසෙහි ඔවුන්ගේ කොටස ද මුද්‍රණය කරන්න.

3) වර්ගය/ආකෘතිය ප්‍රමිතිකරණය:

පහත තීරු සම්මත කරන කේතය ලියන්න:- "දිනය": මිශ්‍ර ආකෘති විය හැක ("2024-03-01" සහ "01.03.2024"); ඒවා සියල්ල දින වේලාවට පරිවර්තනය කරන්න, පරිවර්තනය කළ නොහැකි ඒවා ගණන් කර වාර්තා කරන්න (නිහඬව ඉවතට විසි කරන්න). - "ලිංගභේදය": "පිරිමි"/"පිරිමි"/"එම්" -> "එම්", "ගැහැණු"/"ගැහැණු"/"එෆ්" -> "කේ". - "මුදල": තුර්කි ආකෘතිගත පෙළ ("1.250,50") -> දශම අංකය. එක් එක් පරිවර්තනයෙන් පසු පේළි කීයකට බලපාන්නේ දැයි මුද්‍රණය කරන්න.

4) පිරිසිදු කිරීමට පෙර/පසු පරීක්ෂා කරන්න:

පිරිසිදු කිරීමේ පියවරකට පෙර සහ පසු තෝරාගත් තීරුවල df.shape, නැතිවූ ගණන සහ සාරාංශ සංඛ්‍යාලේඛන (මධ්‍යන්‍ය, මධ්‍ය, මිනි, උපරිම) සංසන්දනය කරන කේතය ලියන්න. අරමුණ: පිරිසිදු කිරීමේ වෙනස්කම් මොනවාදැයි බැලීමට.

දුර්වල ක්ෂණික / ශක්තිමත් විමසුම

දුර්වල ක්ෂණික:

මෙම දත්ත හිස් කරන්න.

"පැහැදිලි" යන්න අපැහැදිලි ය; නැතිවූ කොටස් මකා දැමිය යුතු දේ, පිරවිය යුතු දේ, කුමන තීරුව සැකසීමට සහ කෙසේද යන්න AI දන්නේ නැත. ප්රතිඵලය: අන්ධ, ආපසු හැරවිය නොහැකි වෙනස්කම්.

බලවත් විමසුම:

ඔබේ කාර්යභාරය: දත්ත පිරිසිදු කිරීමේ සහකාර. df තීරු: customer_id (int), ලියාපදිංචි_දිනය (මිශ්‍ර ආකෘති පෙළ), income_tl (පෙළ, "1,200.00"), නගරය (පෙළ, නොගැලපෙන අක්ෂර වින්‍යාසය). රීති:- මුල් df වෙනස් කිරීම; df_clean නම් පිටපතෙහි වැඩ කරන්න.- income_tl අංකයට පරිවර්තනය කරන්න, පරිවර්තනය කළ නොහැකි දේ ගණන් කරන්න.- record_date දිනය දිනයට වෙනස් කරන්න, දෝෂය වාර්තා කරන්න.- මගේ අනුමැතියකින් තොරව කිසිම පේළියක් මකන්න එපා; අපේක්ෂකයන් වෙන වෙනම පෙන්වන්න. එක් එක් පියවරෙන් පසු, df_temiz.shape සහ නැතිවූ අංකය මුද්‍රණය කරන්න.

මෙහිදී මූලාශ්රය ආරක්ෂා කර ඇත, සෑම පරිවර්තනයක්ම ගණනය කරනු ලැබේ, මකාදැමීම මිනිසාට ඉතිරි වේ.

පොදු වැරදි

  • "ඇයි හිස්ද" කියා නොවිමසා හිඩැස් පුරවා ගැනීම. ක්‍රමානුකූල/සැලකිය යුතු නැතිවීම් මධ්‍යන්‍යයන් සමඟ පිරවීම දත්ත විකෘති කරයි.
  • එය පරීක්ෂා නොකර පිටස්තරය මකා දැමීම. සැබෑ නමුත් දුර්ලභ සිදුවීම් ඉවත දැමීම වැදගත් තොරතුරු විනාශ කරයි.
  • සියලුම දත්ත වලින් පිරවුම් අගය ගණනය කිරීම. පරීක්ෂණ දත්ත ඇතුළුව කාන්දු වීම නිර්මාණය කරයි; පුහුණුවෙන් පමණක් ගණනය කරන්න.
  • පරිවර්තනයෙන් පසු පේළි/හිස් තැන් ගණන පරීක්ෂා නොකිරීම. නිහඬව NaT/NaN වන පේළි විශ්ලේෂණයෙන් බැහැර කර ඇත.
  • මුල් දත්ත නැවත ලිවීම. ආපසු පැමිණීම සහ ප්රතිනිෂ්පාදනය නැති වී යයි.
ඉඟිය: "පෙර-පසු" සංසන්දනය සමඟ පිරිසිදු කිරීම ධාවනය කරන්න. එක් එක් පියවරෙන් පසු තීරනාත්මක තීරු වල df.shape, නැතිවූ ගණන සහ සාරාංශ සංඛ්‍යාලේඛන මුද්‍රණය කරන්න. එබැවින් එක් පියවරක් අනපේක්ෂිත ලෙස පේළි 6,000 ක් විනාශ කරන බව ඔබට වහාම පෙනේ.

සාරාංශයක් ලෙස

පිරිසිදු කිරීම යනු දත්ත විද්‍යාවේ වඩාත්ම කාලය ගතවන සහ තීරණ අවශ්‍ය අවධියයි. සෑම වෙනස්කමක්ම දත්ත වෙනස් කරයි, එබැවින් සෑම එකක්ම සවිඥානක තීරණයකි. නැතිවූ අගයන් සඳහා, "එය හිස් වන්නේ ඇයි?" ඒවා මකා දැමීමට පෙර ඕනෑම පිටස්තරයන් සමාලෝචනය කරන්න; වර්ගය සහ ආකෘතිය සම්මතයට ගෙන එන්න. පුහුණු දත්ත වලින් පමණක් පිරවුම් අගය ගණනය කරන්න, මුල් පිටපත තබා ගන්න, සහ ගණන් කිරීමෙන් එක් එක් පියවරේ බලපෑම නිරීක්ෂණය කරන්න. AI යනු මෙම ව්‍යාපාරයේ දැවැන්ත ත්වරණයකි, නමුත් ඔබ පිරිසිදු කරන්නේ කුමක්ද සහ ඇයි දැයි මිනිසුන් තීරණය කරයි.

යෙදුම් කාර්යය

කුඩා වගුවක් ගෙන (හෝ සාදන්න) හිතාමතාම ගැටළු තුනක් එයට ඇතුල් කරන්න: නැතිවූ අගයක්, පිටසක්වලයක්, මිශ්‍ර දින ආකෘතියක්. ඉහත සැකිලි සමඟ AI වෙතින් රෝග විනිශ්චය සහ ප්‍රමිතිකරණ කේතය ඉල්ලන්න; එක් එක් පියවරට පෙර/පසු පේළි ගණන සහ හිස් තැන් සසඳන්න. අවම වශයෙන් එක් "නිහඬ පාඩුවක්" අල්ලා ගැනීමට උත්සාහ කරන්න සහ ඔබ එය දුටු ආකාරය සටහන් කරන්න.

පිරික්සුම් ලැයිස්තුව

  • [ ] මම මුල් අමු දත්ත තබාගෙන පිටපත මත වැඩ කළාද?
  • [ ] එක් එක් නැතිවූ තීරුව සඳහා "ඇයි එය හිස්" යන ප්‍රශ්නය මා අසා තිබේද?
  • [ ] මම ඒවා මැකීමට පෙර ඒවා සමාලෝචනය කළේද?
  • [ ] මම පිරවුම් අගය ගණනය කළේ පුහුණු දත්ත වලින් පමණක්ද?
  • [ ] මම එක් එක් පියවරෙන් පසු පේළි/හිස් තැන් ගණන පරීක්ෂා කර නිහඬ පාඩුව ඉවත් කරනවාද?