ඒකක
1. දත්ත විද්‍යාව සහ විශ්ලේෂණ පිළිබඳ කෘතිම බුද්ධිය හැඳින්වීම: කාර්ය ප්‍රවාහය, භූමිකාවන්, සීමා මායිම්, වලංගුකරණය සහ ආචාර ධර්ම 2. දත්ත රැස් කිරීම සහ මූලාශ්‍ර අවබෝධය: යෝජනා ක්‍රමය, නියැදීම, ගුණාත්මකභාවය සහ කාන්දුවීම් පිළිබඳ දැනුවත් කිරීම 3. දත්ත පිරිසිදු කිරීම සහ පෙර සැකසුම: අස්ථානගත වූ අගය, පිටස්තර සහ වර්ගය පරිවර්තනය 4. ගවේෂණාත්මක දත්ත විශ්ලේෂණය (EDA): බෙදාහැරීම්, සබඳතා සහ මූලික තීක්ෂ්ණ බුද්ධිය 5. විශේෂාංග ඉංජිනේරු: ප්‍රභේද ජනනය කිරීම, කේතනය කිරීම, පරිමාණය කිරීම සහ කාන්දු වීම වැළැක්වීම 6. ආදර්ශ ගොඩනැගීම: ගැටළු නිර්වචනය, ඇල්ගොරිතම තේරීම සහ පුහුණුව/පරීක්ෂණ බෙදීම 7. ආදර්ශ ඇගයීම: ප්‍රමිතික, හරස් වලංගුකරණය සහ අන්ත ඉගෙනීම 8. දෘශ්‍යකරණය සහ කතන්දර කීම: නිවැරදි ග්‍රැෆික්ස්, අවංක ග්‍රැෆික්ස් 9. කේත උත්පාදනය: Python (pandas) සහ SQL සමඟ AI-සහාය විශ්ලේෂණය 10. දත්ත කාන්දු වීම සහ ප්‍රතිනිෂ්පාදනය: නිහඬ විපත් සහ විනය 11. MLOps පදනම, ආචාර ධර්ම, පෞද්ගලිකත්වය සහ වගකීම් විශ්ලේෂණ
ඒකකය 4 / 11

ගවේෂණාත්මක දත්ත විශ්ලේෂණය (EDA): බෙදාහැරීම්, සබඳතා සහ මූලික තීක්ෂ්ණ බුද්ධිය

ලාභ:

  • සුදුසු ප්‍රස්ථාර (histogram, box plot, scatter plot) සමඟ විචල්‍යවල ව්‍යාප්තිය, කේන්ද්‍රය, පැතිරීම සහ විෂමතා ගවේෂණය කිරීමේ හැකියාව.
  • සහසම්බන්ධය නිවැරදිව අර්ථකථනය කිරීමේ හැකියාව සහ එය හේතුකාරකය සමඟ පටලවා නොගෙන, විසිරුණු කුමන්ත්‍රණය සමඟ එය කියවීමේ හැකියාව
  • සාරාංශ සංඛ්‍යාලේඛන නොමඟ යවන සුළු විය හැකි බව තේරුම් ගැනීමේ හැකියාව (Anscombe පාඩම) සහ ආකෘති නිර්මාණයේ දිශාව තීරණය කරන උපකල්පන වර්ධනය කිරීම.

ආකෘතියක් තැනීමට පෙර, දත්ත දැනගැනීම අවශ්ය වේ. වෛද්‍යවරයකු රෝගියා පරීක්‍ෂා නොකර ඖෂධ නියම නොකරන්නා සේම දත්ත විද්‍යාඥයකු දත්ත “පරීක්‍ෂා නොකර” ආකෘතියක් ගොඩනඟන්නේ නැත. මෙම පරීක්ෂණය ගවේෂණාත්මක දත්ත විශ්ලේෂණය (කෙටියෙන් EDA) ලෙස හැඳින්වේ: එය දත්තවල බෙදාහැරීම, සබඳතා, විස්මයන් සහ උගුල් දෘෂ්‍යමය හා චිත්‍රක ලෙස සොයා ගැනීමේ අදියරයි. EDA හි අරමුණ වන්නේ උපකල්පන උත්පාදනය කිරීම, දෝෂ අල්ලා ගැනීම සහ ආකෘති නිර්මාණය කිරීමේ දිශාව තීරණය කිරීමයි. කෘතිම බුද්ධිය මෙම අදියරේදී ඉතා බලවත් සහායකයෙකි: එය කුමන ප්‍රස්ථාරය සුදුසු දැයි යෝජනා කරයි, එහි කේතය ලියයි, බෙදා හැරීමක් අර්ථ නිරූපණය කරයි. නමුත් පුද්ගලයෙකු තමා දකින රටාව සැබෑද අහම්බයක්ද යන්න ඔහුගේ/ඇයගේ ක්ෂේත්‍ර දැනුමෙන් තීරණය කරයි.

EDA සොයන්නේ කුමක් ද?

EDA ප්‍රශ්න හතරකට පිළිතුරු සොයයි. බෙදා හැරීම: සෑම විචල්‍යයක්ම බෙදා හරිනු ලබන්නේ කෙසේද - එය සමමිතික, ඇලවූ හෝ ද්වි-උච්චද? මධ්‍යම ප්‍රවණතාවය සහ ව්‍යාප්තිය: මධ්‍ය, මධ්‍ය, සම්මත අපගමනය යනු කුමක්ද? සබඳතා: විචල්‍යයන් එකිනෙකට සම්බන්ධ වන්නේ කෙසේද? විෂමතා: අනපේක්ෂිත අගයන්, හිඩැස්, කණ්ඩායම් තිබේද? මෙම ප්‍රශ්න හතර තීරණය කරන්නේ කුමන විශේෂාංගය ක්‍රියා කරන්නේද සහ කුමන ආකෘතිය සුදුසුද යන්නයි.

මූලික සංකල්ප කිහිපයක් නිර්වචනය කරමු. හිස්ටෝග්‍රෑම් යනු සංඛ්‍යාත්මක විචල්‍යයක අගයන් ප්‍රස්ථාරවලට බෙදන ප්‍රස්ථාරයකි සහ එක් එක් කාල පරතරය තුළ නිරීක්ෂණ කීයක් තිබේද යන්න පෙන්වයි; බෙදාහැරීම දැකීමට වේගවත්ම ක්රමය එයයි. Skewness යනු එක් දිශාවකට බෙදා හැරීමේ මාරුවයි; ආදායම වැනි විචල්‍ය දකුණට නැඹුරු වේ (බහුතරය අඩු, ස්වල්පයක් ඉතා ඉහළ). කොටු කුමන්ත්‍රණයක් බැලූ බැල්මට මධ්‍ය, හතරැස් සහ පිටස්තර පෙන්වයි. විසිරුණු කුමන්ත්‍රණයක් ලකුණු වලාකුළක් සමඟ සංඛ්‍යාත්මක විචල්‍ය දෙකක සම්බන්ධය පෙන්වයි.

සහසම්බන්ධය: සම්බන්ධතාවයක් ඇත නමුත් ප්රවේශම් වන්න

සහසම්බන්ධය - විචල්‍ය දෙකක් එකට ගමන් කරන ආකාරය පිළිබඳ මිනුමක්; -1 සහ +1 අතර සංඛ්‍යාවක් - EDA හි වැඩිපුරම භාවිතා වන සහ වැරදි ලෙස වටහා ගත් මෙවලම වේ. +1 යනු පරිපූර්ණ සම-වැඩිවීම, -1 යනු පරිපූර්ණ ප්‍රතිලෝම සම්බන්ධතාවය, 0 යනු රේඛීය සම්බන්ධතාවයක් නොමැති බවයි. විශාල උගුල් දෙකක් තිබේ. පළමුව, ප්රසිද්ධ රීතිය: සහසම්බන්ධය හේතුකාරක නොවේ. අයිස්ක්‍රීම් අලෙවිය සමඟ හුස්ම හිරවීම වැඩි වේ; එකක් අනෙකට මඟ පෙන්වන නිසා නොව, ගිම්හානය (සැඟවුණු තුන්වන විචල්යය) දෙකම අවුලුවන බැවිනි. දෙවනුව, සහසම්බන්ධය රේඛීය සම්බන්ධතාවය පමණක් මනිනු ලැබේ; එය 0 ට ආසන්න ශක්තිමත් නමුත් වක්‍ර රේඛීය සම්බන්ධතාවයක් පෙන්නුම් කරයි. එබැවින් සහසම්බන්ධය දෙස බලන විට, විසිරුණු කුමන්ත්‍රණය දෙස බැලීමට වග බලා ගන්න.

අවවාදයයි: AI සහසම්බන්ධතා අංකයක් ලබා දෙන විට, එය "A වැඩි කරයි B" වැනි හේතුකාරක භාෂාවට ලිස්සා යා හැක. මෙය භයානකයි. සහසම්බන්ධය පෙන්නුම් කරන්නේ එකට චලනය පමණි; අත්දැකීම, වසම් දැනුම සහ සුපරීක්ෂාකාරී අනුමාන පමණක් හේතුව තහවුරු කරයි.

Anscombe quartet: ඇයි අංකය දෙස බලන්නේ නැත්තේ

සංඛ්යා ලේඛනවල ප්රසිද්ධ උදාහරණයක් තිබේ: Anscombe quartet. විවිධ දත්ත කට්ටල හතරක් පාහේ එකම මධ්‍යන්‍ය, එකම විචලනය සහ එකම සහසම්බන්ධතාව (0.82) ඇත; නමුත් ප්‍රස්ථාරගත කළ විට, ඒවා සම්පූර්ණයෙන්ම වෙනස් ලෙස පෙනේ - එක් සරල රේඛාවක්, එක් වක්‍ර රේඛාවක්, එක් වලාකුළක් තනි පිටස්තරයකින් ඇද ඇත. පාඩම පැහැදිලිය: සාරාංශ සංඛ්‍යාලේඛන නොමඟ යවන සුළුය, ප්‍රස්ථාරය දෙස බැලීම අත්‍යවශ්‍ය වේ. AI ඔබට සාමාන්‍ය සහ සහසම්බන්ධතා ලබා දිය හැක, නමුත් ප්‍රස්ථාරය නොදැක එම සංඛ්‍යා විශ්වාස කිරීම Anscombe උගුලට හසු වේ.

කුමන ප්‍රශ්නයට ගැලපෙන ප්‍රස්ථාරය පහත වගුවේ සාරාංශ කරයි:

ප්රශ්නය

සුදුසු ග්රැෆික්

මොනවද පෙන්නන්නේ

තනි විචල්‍යයක් බෙදා හැරීම

Histogram / KDE

හැඩය, ඇලවීම, සිරස් ගණන

මධ්යස්ථානය සහ පිටස්තර

පෙට්ටි කුමන්ත්රණය

මධ්‍ය, හතරැස්, පිටස්තර

අංක දෙකක සම්බන්ධතාවය

විසිරුම් සටහන

දිශාව, ශක්තිය, වක්රය

වර්ග සංසන්දනය

තීරු වගුව

කණ්ඩායම් අතර වෙනස

කාලයත් සමඟ වෙනස් වේ

රේඛා සටහන

ප්රවණතාවය, සෘතුමය බව

බහුවිධ සම්බන්ධතාවය

සහසම්බන්ධතා තාප සිතියම

සාමාන්ය සම්බන්ධතා අනුකෘතිය

සිම්ප්සන්ගේ විරුද්ධාභාසය: එකතු කළ දත්ත බොරු විය හැක

දැනුවත් විය යුතු EDA හි ඇති හොර උගුලක් වන්නේ සිම්ප්සන්ගේ විරුද්ධාභාසයයි: රටාවක් සියලු දත්ත එකට පරීක්‍ෂා කරන විට එක් දිශාවක් පෙන්විය හැක, නමුත් දත්ත අර්ථවත් උප කාණ්ඩවලට බෙදූ විට ආපසු හැරවිය හැක. සම්භාව්‍ය උදාහරණය: විශ්ව විද්‍යාලයක කාන්තා අයදුම්කරුවන් සඳහා සමස්ත පිළිගැනීමේ අනුපාතය පිරිමින්ට වඩා අඩු බව පෙනේ; නමුත් දෙපාර්තමේන්තු අනුව බලන විට, බොහෝ දෙපාර්තමේන්තු වල පිරිමින්ට වඩා කාන්තාවන්ගේ පිළිගැනීමේ අනුපාතය වැඩි ය. කොහෙන් ද? කාන්තාවන් වඩාත් තරඟකාරී (අඩු පිළිගැනීමේ අනුපාත) දෙපාර්තමේන්තු සඳහා අයදුම් කර ඇත; ඒකාබද්ධ අංකය මෙම සැඟවුණු විචල්‍යය ගබඩා කරයි. පාඩම පැහැදිලිය: සමස්තයක් හෝ සාමාන්‍යයක් දෙස බලන විට, අර්ථවත් උප සමූහවලට (ඛණ්ඩය, කාල පරිච්ඡේදය, නාලිකාව) කැඩී ගිය විට එම සංඛ්‍යාව එකම කතාව කියයිද යන්න පරීක්ෂා කිරීමට වග බලා ගන්න. AI ඔබට ඒකාබද්ධ අනුපාතයක් ලබා දෙන විට, "ඔබ එය කොටස් කරන විට එය තවමත් වලංගුද" යනුවෙන් විමසීමෙන් බොහෝ නොමඟ යවන සුළු ප්‍රතිඵල ඉක්මනින්ම ලැබෙනු ඇත.

කුඩා නඩු තුනක්

නඩුව 1 - සැඟවුණු කඳු දෙකක්. එක් විශ්ලේෂකයෙකු සාමාන්‍ය පාරිභෝගික වයස අවුරුදු 41 ක් බව සොයා ගත් අතර එය "මැදි වයසේ පිරිසක්" ලෙස වාර්තා කළේය. නමුත් හිස්ටෝග්‍රෑම් උච්ච දෙකක් පෙන්නුම් කළේය: 22-28 සහ 55-62 වයස් කාණ්ඩ. සාමාන්‍ය 41 ඇත්ත වශයෙන්ම කිසිවෙකු නියෝජනය කළේ නැත. පාඩම: මධ්යන්යය විශ්වාස කිරීමට පෙර බෙදාහැරීම සැලසුම් කරන්න.

නඩුව 2 - ව්යාජ සහසම්බන්ධය. එක් කණ්ඩායමක් "දැන්වීම් වියදම්" සහ "විකුණුම්" අතර 0.78 සහසම්බන්ධයක් සොයා ගත් අතර අයවැය දෙගුණ කළේය. කෙසේ වෙතත්, දෙකම අවුලුවාලූයේ සෘතුමය උද්ඝෝෂණ ය; ප්‍රචාරණයෙන් පිටත කාලය තුළ, සම්බන්ධතාවය 0.10 දක්වා පහත වැටුණි. 340,000 TL අතිරේක ප්‍රචාරණය අපේක්ෂිත ප්‍රතිලාභය ලබා දුන්නේ නැත. පාඩම: හේතුව සඳහා වැරදි සහසම්බන්ධය මිල අධිකයි.

නඩුව 3 - හුදකලා ප්රතිවිරෝධය විසින් ඇද ගන්නා ලද රේඛාව. නිශ්චල දේපල විශ්ලේෂණයකින් වර්ග අඩි ප්‍රමාණය සහ මිල (r=0.80) අතර ප්‍රබල සම්බන්ධතාවයක් පෙන්නුම් කරන ලදී. විසිරුණු කුමන්ත්‍රණය අඳින විට, සම්පූර්ණ සම්බන්ධතාවයම පාහේ නිර්මාණය කර ඇත්තේ තනි මිලියන 12ක TL සුඛෝපභෝගී විලා එකක් මගිනි; එම ලක්ෂ්‍යය ඉවත් කළ විට සහසම්බන්ධය 0.31 දක්වා පහත වැටුණි. පාඩම: සෑම විටම විසුරුම කුමන්ත්‍රණය සමඟ සහසම්බන්ධය කියවන්න.

පිටපත් කළ හැකි සැකිලි හතරක්

1) ස්වයංක්‍රීය EDA සාරාංශය:

මට pandas df තියෙනවා. නිෂ්පාදනය කරන කේතය ලියන්න: (1) df.info() සහ df.describe(), (2) එක් එක් සංඛ්‍යාත්මක තීරු සඳහා හිස්ටෝග්‍රෑම්, (3) එක් එක් වර්ගීකරණ තීරු සඳහා ගණන් කරන්න. අදහස් දක්වන්න එපා, සොයාගැනීමේ කේතය ජනනය කරන්න; මම රටා අර්ථකථනය කරමි.

2) සහසම්බන්ධය + දෘශ්‍ය (හේතුකත්වයේ අවවාදය සමඟ):

සංඛ්‍යාත්මක තීරු සඳහා සහසම්බන්ධ අනුකෘතියක් සහ තාප සිතියමක් අඳින කේතයක් ලියන්න. ඉහළම සහසම්බන්ධිත යුගල 3 ක විසිරුම් බිම් කැබැල්ලක් ද අඳින්න. සහසම්බන්ධතාවය හේතුකාරක නොවන බව ඔබට මතක් කර දෙන ප්‍රතිදානයට විවරණ රේඛාවක් එක් කරන්න. හේතු ප්‍රකාශ කරන්න එපා.

3) බෙදා හැරීමේ රෝග විනිශ්චය:

"income_tl" තීරුව සඳහා: histogram, box plot, skewness value සහ median/mean comparison නිපදවන කේතය ලියන්න. බෙදා හැරීම විකෘති වී තිබේද නැද්ද යන්න මම අර්ථ නිරූපණය කරමි; කේතය පමණක් දෙන්න.

4) ඛණ්ඩ සංසන්දනය:

"නාලිකාව" (වෙබ්/ජංගම) මගින් පාරිභෝගිකයින් සසඳන්න: එක් එක් නාලිකාව සඳහා සාමාන්‍ය මුදල, මධ්‍ය ප්‍රමාණය, ඇණවුම් ගණන සහ බෙදා හැරීමේ ප්‍රමාණයෙන් පෙට්ටියක් නිපදවන කේතය ලියන්න. නාලිකා දෙක අතර වෙනසෙහි සංඛ්‍යානමය වැදගත්කම සඳහා සුදුසු පරීක්ෂණය කුමක්දැයි යෝජනා කරන්න, නමුත් තීරණය මට භාරයි.

දුර්වල ක්ෂණික / ශක්තිමත් විමසුම

දුර්වල ක්ෂණික:

මෙම දත්තවල රසවත් යමක් සොයන්න.

"රසවත්" යන්න නිර්වචනය කර නැත; AI දත්ත නොදකියි, එබැවින් එය එය සකස් කරයි හෝ සාමාන්‍ය ප්‍රකාශ කරයි. දිශාවක්, විචල්‍යයක්, අරමුණක් නැත.

බලවත් විමසුම:

ඔබේ භූමිකාව: EDA සහකාර. df තීරු: වයස (int), income_tl (float), නගරය (ප්‍රවර්ගය), නාලිකාව (වෙබ්/ජංගම), මුදල (float). අරමුණ: "ප්‍රමාණයට" බලපාන සාධක සොයා ගැනීමට. කාර්යය: (1) මුදල බෙදා හැරීම සැලසුම් කරන කේතය, (2) මුදල සහ වයස සහ ආදායම්_tl අතර බෙදා හැරීමේ ප්‍රස්තාර, (3) නාලිකා බිඳවැටීමේ දී ඇති පෙට්ටි බිම් කොටස. හේතුවාදී හිමිකම් පෑමක් ස්ථාපිත කිරීම; සොයාගැනීමේ කේතය ජනනය කරන්න, මම රටාව අර්ථකථනය කරන්නම්.

මෙහි අරමුණ, විචල්‍යයන් සහ "හේතුකත්වය ප්‍රකාශ කිරීමේ" සීමාව පැහැදිලිය.

පොදු වැරදි

  • සාරාංශ සංඛ්යා ලේඛන මත පමණක් රඳා පවතී. Anscombe quartet පෙන්නුම් කරන පරිදි, එම මධ්යන්යය ඉතා වෙනස් බෙදාහැරීම් සඟවයි; වගුව බලන්න.
  • හේතුව සඳහා වැරදි සහසම්බන්ධය. සහයෝගී ක්‍රියාවෙන් එකක් අනෙකකට මඟ පෙන්වන බවක් නොපෙන්වයි; සැඟවුණු විචල්‍යයන්ගෙන් පරිස්සම් වන්න.
  • විසිරුණු කුමන්ත්‍රණයකින් තොරව සහසම්බන්ධය දෙස බැලීම. තනි පිටස්තර හෝ වක්‍ර රේඛාවක් අංකය නොමඟ යවයි.
  • මධ්යන්ය සමඟ ද්වි-උච්ච/ආක්රමණ ව්යාප්තිය සාරාංශ කිරීම. සාමාන්යය කිසිවෙකු නියෝජනය නොකළ හැකිය.
  • EDA මඟ හැර කෙලින්ම ආකෘතියට යන්න. හඳුනා නොගත් දත්ත යනු අන්ධ ආකෘතියයි.
ඉඟිය: සෑම නව දත්ත කට්ටලයක් සමඟම, ප්‍රස්ථාර ඇඳීම සඳහා පළමු මිනිත්තු 30 ගත කරන්න: එක් එක් සංඛ්‍යාවල හිස්ටෝග්‍රෑම්, සැලකිය යුතු යුගලවල විසිරුණු කුමන්ත්‍රණය, කාණ්ඩවල තීරු ප්‍රස්ථාරය. මෙම මිනිත්තු 30 ඉදිරි දින සඳහා අනාගත ආකෘති නිර්මාණ දෝෂ වලක්වයි.

සාරාංශයක් ලෙස

EDA යනු ආකෘතියක් ගොඩනැගීමට පෙර දත්ත දැනගැනීමේ අදියර වන අතර ප්‍රශ්න හතරකට පිළිතුරු සොයයි: බෙදාහැරීම, මධ්‍ය ව්‍යාප්තිය, සම්බන්ධතා සහ විෂමතා. සාරාංශ සංඛ්‍යාලේඛන නොමඟ යවන සුළු විය හැක; ප්‍රස්ථාරය දෙස බැලීම අනිවාර්ය වේ (Anscombe දේශනය). සහසම්බන්ධය යනු ප්‍රබල මෙවලමකි, නමුත් හේතුකාරකය එසේ නොවන අතර නියත වශයෙන්ම විසිරුණු කුමන්ත්‍රණයක් සමඟ ඒකාබද්ධව කියවිය යුතුය. AI යනු ග්‍රැෆික්ස් සහ ලිවීමේ කේතය යෝජනා කිරීම සඳහා විශිෂ්ට ත්වරණයකි; නමුත් මිනිසුන් තමන් දකින රටාව සැබෑද අහම්බයක්ද යන්න තම ක්ෂේත්‍ර දැනුමෙන් විග්‍රහ කරයි.

යෙදුම් කාර්යය

දත්ත කට්ටලයක් තෝරා EDA කරන්න: අවම වශයෙන් සංඛ්‍යාත්මක විචල්‍ය තුනක හිස්ටෝග්‍රෑම් එකක්, විචල්‍ය යුගල දෙකක විසිරුණු කුමන්ත්‍රණයක් සහ සහසම්බන්ධතා තාප සිතියමක් උපුටා ගන්න. අවම වශයෙන් එක් "පුදුමයක්" (උච්ච දෙකක් සහිත බෙදා හැරීමක්, ව්‍යාජ සහසම්බන්ධයක් සඳහා අපේක්ෂකයෙකු, තනි පිටස්තරයෙකු විසින් ආකර්ෂණය කරන ලද සම්බන්ධතාවයක් වැනි) සොයාගෙන එය එක් වාක්‍යයකින් පැහැදිලි කරන්න. කිසිදු හේතු ප්‍රකාශයක් නොකර ලියන්න.

පිරික්සුම් ලැයිස්තුව

  • [ ] මම එක් එක් සංඛ්‍යාත්මක විචල්‍යයේ ව්‍යාප්තිය ප්‍රස්තාරගත කර තිබේද?
  • [ ] මම විසුරුම සමඟ සහසම්බන්ධතා දෙස බැලුවද?
  • [ ] මම හේතුඵල සහ සහසම්බන්ධය වෙන වෙනම තබා තිබේද?
  • [ ] මම නැමුණු හෝ උච්ච දෙකේ බෙදාහැරීම් දුටුවේ නැති අතර මධ්‍යන්‍යය අන්ධ ලෙස විශ්වාස කළේ නැද්ද?
  • [ ] මම මගේ EDA සොයාගැනීම් වලින් අවම වශයෙන් එක් ආකෘතිකරණ අංගයක්/උපකල්පනයක්වත් ලබාගෙන තිබේද?