ඒකක
1. ආර්ථිකමිතික සහ සංඛ්‍යාලේඛනවල කෘතිම බුද්ධිය: භූමිකාවන්, සීමා මායිම්, සත්‍යාපනය සහ පෞද්ගලිකත්වය 2. දත්ත පිරිසිදු කිරීම සහ සකස් කිරීම: අතුරුදහන් වූ දත්ත, පිටස්තරයන් සහ කේතීකරණය 3. ගවේෂණාත්මක දත්ත විශ්ලේෂණය සහ දෘශ්‍යකරණය: කෘත්‍රිම බුද්ධිය සමඟ ප්‍රස්තාරගත කිරීම සහ අර්ථ නිරූපණය 4. රේඛීය ප්‍රතිගාමීත්වය: ආදර්ශ ගොඩනැගීම, සංගුණක අර්ථ නිරූපණය සහ උපකල්පන 5. ප්‍රතිගාමී රෝග විනිශ්චය සහ උල්ලංඝනය කිරීම්: සහසම්බන්ධතාව, විෂමජාතීත්වය, ස්වයං සහසම්බන්ධතා 6. උපකල්පන පරීක්ෂාව සහ p-අගය: වැදගත්කම, බලය සහ බහු සංසන්දනය 7. p-හැකින්ග්, HARKing සහ සංඛ්‍යාන අඛණ්ඩතාව: කෘතිම බුද්ධියේ යුගයේ අන්තරායන් 8. කාල ශ්‍රේණි විශ්ලේෂණය: ස්ථාවරත්වය, ARIMA සහ අනාවැකි 9. හේතුව සහ ප්‍රතිපත්ති විශ්ලේෂණය: DiD, IV, RDD සහ කෘතිම බුද්ධිය 10. කේත උත්පාදනය සහ ප්‍රතිනිෂ්පාදනය: R/Python, අනුවාදනය සහ ප්‍රතිනිෂ්පාදනය 11. වාර්තා ලිවීම, සන්නිවේදනය සහ ආචාර ධර්ම: ප්‍රතිඵල ඉදිරිපත් කිරීම සහ සීමා මායිම් සන්නිවේදනය කිරීම
ඒකකය 2 / 11

දත්ත පිරිසිදු කිරීම සහ සකස් කිරීම: අතුරුදහන් වූ දත්ත, පිටස්තරයන් සහ කේතීකරණය

ලාභ:

  • නැතිවූ දත්ත වර්ග (MCAR/MAR/MNAR), පිටස්තරයන් සහ කේතීකරණ දෝෂ හඳුනාගැනීමේ හැකියාව සහ පිරිසිදු කිරීමේ කේතය සහ රෝග විනිශ්චය නිෂ්පාදනය කිරීමට නිවැරදි දත්ත සමඟ AI භාවිතා කිරීම
  • කෘතිම බුද්ධිය විසින් යෝජනා කරන ලද සෑම පිරිසිදු කිරීමේ පියවරක්ම (මකා දැමීම, පැවරීම, පරිවර්තනය) විශ්ලේෂණ ප්‍රතිඵලයට බලපාන ආකාරය සහ ආපසු හැරවිය හැකි සහ ලේඛනගත කාර්ය ප්‍රවාහයක් ස්ථාපිත කරන්නේ කෙසේදැයි බැලීමේ හැකියාව
  • පිරිසිදු කිරීමේ තීරණ පදනම් වන්නේ දත්ත උත්පාදනය කරන ක්‍රියාවලිය පිළිබඳ දැනුම මත බවත්, කෘත්‍රිම බුද්ධිය යනු අන්ධ ස්වයංක්‍රීය යන්ත්‍රයක් නොව අධීක්‍ෂණ සහකාරයෙක් බවත් පවත්වා ගැනීම

සෑම පළපුරුදු විශ්ලේෂකයෙක්ම එක් සත්‍යයක් දනී: බොහෝ විට ආනුභවික ව්‍යාපෘතියක ආකෘති නිර්මාණය නොවේ, නමුත් දත්ත පිරිසිදු කිරීම (දත්තවල දෝෂ, අතපසුවීම් සහ නොගැලපීම් නිවැරදි කිරීමේ කාර්යය සහ එය විශ්ලේෂණය සඳහා සූදානම් කිරීම). දළ රීතියක් ලෙස, කාලයෙන් 70-80% පමණ දත්ත අවබෝධ කර ගැනීම, පිරිසිදු කිරීම සහ පරිවර්තනය කිරීම සිදු කරයි; සැබෑ විශ්ලේෂණය සඳහා ඉතිරිව ඇත්තේ 20-30% ක් පමණි. මෙම ඒකකය තුළ, කෘතිම බුද්ධිය (AI) මෙම අධික බර ලිහිල් කරන්නේ කෙසේදැයි අපි පියවරෙන් පියවර බලමු, නමුත් කුමන තීරණ තවමත් ඔබ සමඟ පැවතිය යුතුද සහ ඇයි.

අපි මූලික කරුණු දෙකක් මුලින්ම තබමු. පළමුව, පිරිසිදු කිරීමේ තීරණ පදනම් වන්නේ දත්ත නිපදවන ක්‍රියාවලිය පිළිබඳ ඔබේ දැනුම මත ය: අගයක් අස්ථානගත වී ඇත්තේ මන්දැයි, සංඛ්‍යාවක් ඕනෑවට වඩා විශාල වන්නේ මන්දැයි ඔබ පමණක් දනී. AI දත්ත නොදකියි, සන්දර්භය නොදනී; කේතය ලියයි, තීරණ ගන්නේ නැත. දෙවනුව, සෑම පිරිසිදු කිරීමේ පියවරක්ම විශ්ලේෂණ ප්රතිඵලය වෙනස් කළ හැකිය. පිටස්තරයක් මකා දැමීමෙන් සංගුණකය ප්‍රතිලෝම කළ හැක; මධ්යන්යය සමඟ අතුරුදහන් වූ දේ පිරවීමෙන් කෘතිමව විචලනය අඩු කළ හැකිය. එබැවින් පිරිසිදු කිරීම ආපසු හැරවිය හැකි සහ ලේඛනගත කළ යුතුය: කිසි විටෙකත් අමු දත්ත ස්පර්ශ නොකරන්න, කේතයේ සෑම පියවරක්ම කරන්න, එක් එක් පියවරේ බලපෑම වාර්තා කරන්න.

පියවරෙන් පියවර පිරිසිදු කිරීමේ කාර්ය ප්රවාහය

1. දත්ත දැනගන්න. පළමුව ව්‍යුහය බලන්න: පේළි ගණන (නිරීක්ෂණ) සහ තීරු (විචල්‍ය), එක් එක් විචල්‍යයේ වර්ගය (සංඛ්‍යාත්මක, වර්ගීකරණය, දිනය), සාරාංශ සංඛ්‍යාලේඛන, අතුරුදහන් වූ ගණන. ඔබට මෙම "දත්ත පැතිකඩ" කේතය සඳහා AI වෙතින් ඉල්ලා සිටිය හැක; නමුත් ඔබ ප්‍රතිදානය කියවා "මෙම විචල්‍යය පෙළ ලෙස පැමිණියේ ඇයි?" වැනි ප්‍රශ්න අසන්න.

2. නැතිවූ දත්ත තේරුම් ගෙන වර්ගීකරණය කරන්න. නැතිවූ දත්ත වර්ග තුනකට බෙදා ඇත. MCAR (සම්පූර්ණයෙන්ම අහඹු ලෙස අතුරුදහන් වීම): අතුරුදහන් වීම කිසිවක් නිසා නොවේ, උදාහරණයක් ලෙස සංවේදකයක් අහඹු ලෙස අසමත් විය. MAR (අහඹු ලෙස අතුරුදහන්): අතුරුදහන් වීම අනෙකුත් නිරීක්ෂිත විචල්‍යයන් මත රඳා පවතී, උදාහරණයක් ලෙස වැඩිහිටි පුද්ගලයින් බොහෝ විට ප්‍රශ්නයක් හිස්ව තබයි, නමුත් ඔබ වයස දන්නවා. MNAR (අතුරුදහන් නොවේ අහඹු ලෙස): අතුරුදහන් වීම රඳා පවතින්නේ නිරීක්ෂණය නොකළ අගය මත ය, උදාහරණයක් ලෙස ඉහළ ආදායම් ලබන්නන් ඔවුන්ගේ ආදායම වාර්තා නොකරයි. මෙම වෙනස ඉතා වැදගත් වන්නේ එය විසඳුම් ක්‍රමය තීරණය කරන නිසා සහ AI හට ඔබ වෙනුවෙන් මෙය තීරණය කළ නොහැකි බැවිනි.

3. අඩුපාඩුව සමඟ කටයුතු කරන්න. විකල්ප: ලැයිස්තුගතව මකාදැමීම, මධ්‍යන්‍ය/මධ්‍ය ආරෝපණය, ආකෘතිය මත පදනම් වූ බහු ආරෝපණය. MCAR හි මකාදැමීම සාපේක්ෂව ආරක්ෂිත නමුත් නියැදි ප්රමාණය අඩු කරයි. MAR හි බහු පැවරීම වඩාත් සුදුසුය. MNAR හි අපක්ෂපාතී බව කිසිදු සරල ක්‍රමයක් සහතික නොකරයි; ඌනතා යාන්ත්රණය ආකෘතිගත කළ යුතුය හෝ අවම වශයෙන් සංවේදීතා විශ්ලේෂණයක් සිදු කළ යුතුය. මධ්යන්ය පිරවීම පහසු නමුත් භයානක ය: එය විචලනය අඩු කරයි, සබඳතා දුර්වල කරයි, සහ අවිනිශ්චිතතාවය සඟවයි.

4. පිටස්තරයන් පරීක්ෂා කරන්න. පිටස්තරයෙක් යනු අනෙක් අයගෙන් ඉතා ඈතින් සිටින නිරීක්ෂණයකි. ප්‍රශ්න දෙක වෙන් කරන්න: මෙය දෝෂයක්ද (අවුරුදු 999 දත්ත ඇතුළත් කිරීමේ ලියා ඇත) නැතහොත් එය සැබෑ නමුත් ඊට වඩා වැඩි වටිනාකමක් (ප්‍රකෝටිපතියෙකුගේ ආදායම) ද? දෝෂ නිවැරදි කරන්න; සත්‍ය පිටස්තර ඒවා දත්ත නියෝජනය කරන බැවින් ඒවා මකා නොදමන්න. "එය කරදර කරන නිසා" පිටස්තරය මකා දැමීමෙන් ඔබ දත්ත ප්‍රතිඵලය දෙසට හරවයි.

5. කේතීකරණය සහ අනුකූලතාව. ප්‍රවර්ග ප්‍රමිතිකරණය කරන්න ("පිරිමි", "පිරිමි", "ඊ" සියල්ල එකම කේතයකට), දින එක් ආකෘතියකට, ඒකක එක් පරිමාණයකට, අනුපිටපත් පේළි හඳුනා ගන්න. AI හොඳම උපකාර කරන අවම අවදානම් අවධිය මෙයයි.

6. ලේඛනය සහ කැටි කිරීම. අමු සහ පිරිසිදු කළ දත්ත වෙන වෙනම තබා ගනිමින් සෑම පියවරක්ම කේතයක් සහ විවරණ රේඛාවක් සමඟ සටහන් කරන්න. ඉතින් විනිසුරුවෙක් ඇහුවම "ඇයි මේ නිරීක්ෂණ අතහැරියේ?" ඔබ ඔබේ පිළිතුර සූදානම් කර ඇත.

අවවාදයයි: ප්රතිඵල මත පදනම්ව පිරිසිදු කිරීමේ තීරණ ගන්න එපා. "ඔබ මෙම රේඛාව මකා දැමූ විට, සංගුණකය සැලකිය යුතු වේ" යනුවෙන් පේළියක් මකා දැමීම p-හැක් කිරීමේ වඩාත් ද්‍රෝහී ආකාරයකි, එය අපි ඊළඟ ඒකකයෙන් දකිමු.

සංසන්දන වගුව: දත්ත ක්‍රම අතුරුදහන්

ක්රමය

එය සුදුසු වන්නේ කවදාද?

අවදානම

AI හි කාර්යභාරය

පේළියක් මකන්න

MCAR, අඩු අතුරුදහන් අනුපාතය

නියැදිය කුඩා වේ, MAR/MNAR හි පක්ෂග්‍රාහී වේ

කේතය ලියයි; ඔබ තීරණය කරන්න

මධ්‍ය/මධ්‍ය පැවරුම

ඉක්මන් මූලික විශ්ලේෂණය

විචලනය අඩු කරයි, සබඳතා සඟවයි

එය පහසු නමුත් එය නිර්දේශ නොකරයි; අනතුරු ඇඟවිය යුතුය

බහු පැවරුම් (MI)

MAR, වැදගත් විචල්‍යයන්

නිවැරදිව ස්ථාපනය නොකළහොත් එය නොමඟ යවන සුළු වනු ඇත

කේතය සහ පැකේජය නිර්දේශ කරයි (මීයන්)

යාන්ත්‍රික ආකෘති නිර්මාණය

MNAR

සංකීර්ණ, උපකල්පන-දැඩි

කෙටුම්පත පමණි; විශේෂඥ අවශ්ය වේ

පිටපත් කළ හැකි විමසීම් හතරක්

1. දත්ත පැතිකඩ:

ඔබේ කාර්යභාරය: දත්ත පිරිසිදු කිරීමේ සහකාර. මම දත්ත බෙදා නොගනිමි, මට R කේතය අවශ්‍යයි. මා සතුව 'ඩිජිට්' නමින් දත්ත රාමුවක් ඇත; විචල්යයන්: id, වයස (සංඛ්‍යා), ආදායම (සංඛ්‍යා), අධ්‍යාපනය (වර්ගගත), කලාපය (වර්ගගත), දිනය (දිනය). කාර්යය: එක් එක් විචල්‍ය සඳහා වර්ගය, නැතිවූ අංකය සහ අනුපාතය නිපදවන කේතය ලියන්න, සංඛ්‍යාත්මක ඒවා සඳහා සාරාංශ සංඛ්‍යාලේඛන සහ වර්ගීකරණය සඳහා සංඛ්‍යාත වගුව. අදහස් පේළිය එක් කරන්න.

2. නැතිවූ දත්ත රෝග විනිශ්චය:

ඉහත 'ඉලක්කම්' දත්ත සඳහා නැතිවූ රටාව පරීක්ෂා කරන කේතය ලියන්න: - එක් එක් විචල්‍යයේ නැතිවූ අනුපාතය, - වෙනත් විචල්‍යයන් සමඟ අතුරුදහන් වීමේ සම්බන්ධය පෙන්වන සරල වගුවක්/ප්‍රස්තාරයක්. මම කේතයේ ප්‍රතිදානය දෙස බලා MCAR/MAR/MNAR වෙනස කරන්නෙමි; ඔබ හුදෙක් රෝග විනිශ්චය මෙවලම නිෂ්පාදනය කරයි, පැවරුම් ක්‍රමය තීරණය නොකරන්න.

3. බාහිර පරීක්ෂාව (මකා දැමීම නොවේ):

විචල්‍ය 'ආදායම්' සඳහා කේතය ලියන්න, එය මැකීමකින් තොරව පිටස්තරයන් පරීක්ෂා කරයි: බොක්ස්ප්ලොට්, IQR-පාදක සීමාවන් සහ වගු ලැයිස්තුගත බාහිර නිරීක්ෂණ + අගයන්. මම බලන්නම් මේවා වැරදිද ඇත්තද කියලා. ස්වයංක්‍රීය මකාදැමීම එක් කරන්න.

4. කේතීකරණ ප්‍රමිතිකරණය:

'අධ්‍යාපනය' විචල්‍යයේ, අගයන් මිශ්‍ර ලෙස ලියා ඇත: "ප්‍රාථමික පාසල", "ප්‍රාථමික පාසල", "ප්‍රාථමික", "උසස් පාසල", "උසස් පාසල", "විශ්ව විද්‍යාලය", "විශ්ව විද්‍යාලය". මේවා ස්ථාවර කාණ්ඩවලට නැවත කේතනය කරන R කේතය ලියන්න; සිතියම්ගත කිරීමේ වගුව පැහැදිලිව පෙන්වන්න එවිට මට එක් එක් පරිවර්තනය තහවුරු කළ හැක. ඔබ හඳුනා නොගත් අගය "නොදන්නා" ලෙස සකසන්න.

දුර්වල ක්ෂණික / ශක්තිමත් විමසුම

දුර්වල ක්ෂණික:

දත්ත පිරිසිදු කරන්න, හිඩැස් පුරවන්න, පිටස්තර ඉවත් කරන්න.

මෙම ඉල්ලුම භයානක ය: එය AI සඳහා අන්ධ අධිකාරියක් ලබා දෙයි. කුමන ආකාරයේ අතුරුදහන්වීම්, කුමන ආකාරයේ පිරවීම, කුමන පරස්පර සත්යය - කිසිවක් පැහැදිලි නැත. ප්රතිඵලය රහසිගතව පක්ෂග්රාහී දත්ත කට්ටලයක් විය හැකිය.

බලවත් විමසුම:

ඔබේ කාර්යභාරය: පිරිසිදු කිරීමේ සහකාර, ඔබ තීරණ ගන්නෙකු නොවේ. පියවරෙන් පියවර ගොස් සෑම පියවරකම බලපෑම වාර්තා කරන කේතය ලියන්න: 1) නැතිවූ රටාව පෙන්වන්න (මකන්න/පුරවන්න එපා), 2) පිටස්තර අපේක්ෂකයින් ලැයිස්තුගත කරන්න (මකන්න එපා), 3) සිතියම්ගත කිරීමේ වගුව සමඟ කාණ්ඩ නොගැලපීම් නිවැරදි කරන්න. එක් එක් පියවරෙන් පසු පේළි ගණන සහ සාරාංශ සංඛ්‍යාලේඛන මුද්‍රණය කරන්න එවිට මට වෙනස දැකීමට සහ තහවුරු කිරීමට හැකි වේ. ස්වයංක්‍රීය පැවරීම/මැකීම ඇතුළත් කිරීම.

වෙනස පැහැදිලිය: ප්‍රබල කැමැත්ත AI අධීක්ෂණ සහකාරයෙකු ලෙස ස්ථානගත කරයි, ආපසු හැරවිය හැකි සහ ලේඛනගත පියවර නිෂ්පාදනය කරයි.

කුඩා නඩු තුනක්

නඩුව 1 - සාමාන්ය පැවරුම් උගුල. පුද්ගලයන් 5,000ක් සඳහා එක් විශ්ලේෂකයෙකුගේ ආදායම් දත්ත 18%ක් අතුරුදහන් විය. ඔහු AI ට පැවසුවේ "හිඩැස් පුරවන්න"; AI ඒවා සියල්ල සාමාන්‍යකරණය කළේය. ප්රතිඵලය: ආදායමේ විචලනය 22% කින් අඩු වූ අතර අධ්යාපන-ආදායම් සම්බන්ධතාවයේ සංගුණකය එය වඩා දුර්වල විය. නිවැරදි මාර්ගය: අඩුපාඩුව MAR විය (අධ්‍යාපනය හේතුවෙන්), බහු පැවරුම් (මීයන්) මගින් පිරවිය යුතු විය. පාඩම: පිරවුම් ක්රමය යාන්ත්රණය මත රඳා පවතී.

නඩුව 2 - පිටත පිරිසිදු කිරීම සොයා ගැනීම ආපසු හරවයි. එක් ස්ථිර දත්තයක ඉතා විශාල සමාගම් 3 ක් (සම්පූර්ණ නිරීක්ෂණවලින් 0.6%) විය. AI හි "පිරිසිදු කිරීමේ" යෝජනාව මගින් මේවා මකා දමන ලදී; පරිමාණ සංගුණකයේ ආර්ථිකයන් ධන සිට සෘණ වෙත හැරී ඇත. කෙසේ වෙතත්, එම සමාගම් 3 සැබෑ සහ කර්මාන්තයේ වැදගත් කොටසක් විය. නිවැරදි ක්‍රමය වූයේ මැකීම වෙනුවට සම්පූර්ණ සහ ශක්තිමත් ඇස්තමේන්තුවක් සහිතව වාර්තා කිරීමයි. පාඩම: සැබෑ පිටස්තරයන් යනු දත්ත මිස ශබ්දය නොවේ.

නඩුව 3 - නිහඬ කේතීකරණ දෝෂය. එක් පුවරුවක, දින විචල්‍යය විවිධ ආකෘති දෙකකින් ("2020-03-01" සහ "01/03/2020") පැමිණ ඇත. AI විසින් නිපදවන ලද සංයෝජන කේතය ඒවා විවිධ අගයන් ලෙස වරදවා වටහාගත් විට, නිරීක්ෂණ 1,400 ක් නොගැලපෙන අතර වර්ධන අනුපාත හාස්‍යජනක විය. විශ්ලේෂකයා පේළි ගණන පරීක්ෂා නොකළේ නම් කමක් නැත. පාඩම: එක් එක් පියවරෙන් පසු නිරීක්ෂණ ගණන් සහ සනීපාරක්ෂාව පරීක්ෂා කිරීම අනිවාර්ය වේ.

පොදු වැරදි

  • අන්ධ ලෙස සාමාන්යය සමඟ පරතරය පිරවීම. එය විචලනය අඩු කරයි, අවිනිශ්චිතතාවය සඟවයි, සහ MAR/MNAR හි පක්ෂග්‍රාහීත්වයක් ඇති කරයි. මුලින්ම යාන්ත්රණය වර්ග කරන්න.
  • "එය කරදර වන නිසා" පිටස්තරය මකා දැමීම. සත්‍ය පිටස්තරයන් දත්ත නියෝජනය කරයි; මකා දැමීම ප්‍රතිඵලය නැමීමකි. වැරදි දේ නිවැරදි කරන්න, සැබෑ දේ තබා ගන්න.
  • අමු දත්ත තට්ටු කිරීම. කිසිවිටක අමු දත්ත වෙනස් නොකරන්න; කේතය සමඟ සියලු පිරිසිදු කිරීම් වෙනම පිටපතකින් කරන්න, එවිට එය ආපසු හැරවිය හැක.
  • පියවරවල බලපෑම මැනීම නොවේ. එක් එක් පියවරෙන් පසු පේළි ගණන සහ සාරාංශ සංඛ්‍යාලේඛන පරීක්ෂා නොකළහොත්, නිහඬ දෝෂ එකතු වේ.
  • ප්රතිඵලයක් ලෙස පිරිසිදු කිරීම. "ඔබ මෙම රේඛාව එකතු කරන විට, ප්රතිඵලය වඩා හොඳ වනු ඇත" යන තර්කය p-හැක් කිරීම; විශ්ලේෂණ ප්රතිඵලය පෙර සහ ස්වාධීනව පිරිසිදු කිරීම සැලසුම් කළ යුතුය.
ඉඟිය: පිරිසිදු කිරීමට පෙර සහ පසු එකම මූලික සංඛ්‍යාලේඛන (මධ්‍යන්‍ය, මධ්‍ය, නිරීක්ෂණ සංඛ්‍යාව, සහසම්බන්ධතා කිහිපයක්) එක පැත්තකින් තබන “පෙර/පසු” වගුවක් තබා ගන්න. අනපේක්ෂිත පැනීම සැඟවුණු දෝෂයක හොඳම පෙර නිමිත්තයි.

සාරාංශයක් ලෙස

දත්ත පිරිසිදු කිරීම යනු ආනුභවික කාර්යයේ වඩාත්ම කාලය ගතවන සහ තීරණ අවශ්‍ය අවධියයි. AI යනු මෙහි ප්‍රබල කේත උත්පාදක යන්ත්‍රයකි, නමුත් එයට වෙඩි තැබීම් ඇමතීමට නොහැක: ඔබ අතුරුදහන් වූ දත්ත වර්ගය (MCAR/MAR/MNAR) වර්ගීකරණය කරයි, පිටස්තරය දෝෂයක්ද සැබෑවක්ද යන්න තීරණය කරන්න, සෑම පියවරක්ම ආපසු හැරවිය හැකි සහ ලේඛනගත කරන්න. AI අන්ධ "පැහැදිලි" අධිකාරියක් ලබා දෙනවා වෙනුවට, බලපෑම මනිනු ලබන සහ වලංගු කරන ලද පියවරෙන් පියවර කාර්ය ප්‍රවාහයක් ස්ථාපිත කරන්න. එක් එක් පියවරෙන් පසු නිරීක්ෂණ ගණන සහ සාරාංශ සංඛ්‍යාලේඛන පරීක්ෂා කිරීම නිහඬ දෝෂ සඳහා හොඳම ප්‍රතිවිරෝධයයි.

යෙදුම් කාර්යය

දත්ත කට්ටලයක (ඔබගේම දත්ත හෝ නියැදි කට්ටලයක්) අතුරුදහන් වූ සහ පිටස්තර අඩංගු අවම වශයෙන් විචල්‍ය දෙකක් තෝරන්න. ඉහත "පියවරෙන් පියවර, මකන්න/පුරවන්න එපා" ප්‍රේරකය හරහා AI වෙතින් රෝග විනිශ්චය කේතයක් ඉල්ලා එය ක්‍රියාත්මක කරන්න. අඩුපාඩුව MCAR/MAR/MNAR ලෙස වර්ග කර ඔබේ සාධාරණීකරණය එක වාක්‍යයකින් ලියන්න. පරස්පර අපේක්ෂකයන් එකින් එක පරීක්ෂා කර, වැරැද්ද කුමක්ද සහ සැබෑ එක තීරණය කරන්න. අවසාන වශයෙන්, පිරිසිදු කිරීමට පෙර/පසු "පෙර-පසු" වගුවක් සාදා අනපේක්ෂිත වෙනස්කම් ඇත්නම් වාර්තා කරන්න.

පිරික්සුම් ලැයිස්තුව

  • [ ] මම අමු දත්ත වෙනස් නොකර වෙනම පිටපතක පිරිසිදු කළෙමි.
  • [ ] මම ඌනතාවය MCAR/MAR/MNAR ලෙස වර්ග කර ඒ අනුව ක්‍රමය තෝරා ගත්තෙමි.
  • [ ] මම ඒවා වැරදිද සැබෑද යන්න එකින් එක පරීක්ෂා කළෙමි; මම එය අන්ධ ලෙස මකා දැමුවේ නැත.
  • [ ] මම එක් එක් පිරිසිදු කිරීමේ පියවරෙන් පසු නිරීක්ෂණ ගණන සහ සාරාංශ සංඛ්‍යාලේඛන පරීක්ෂා කළෙමි.
  • [ ] මම සියලු පියවරයන් කේතය සහ විවරණ රේඛාව සමඟ ලේඛනගත කළෙමි; ආපසු හැරවිය හැකි.
  • [ ] මම පිරිසිදු කිරීම පදනම් කර ගත්තේ දත්ත නිපදවන ක්‍රියාවලිය පිළිබඳ දැනුම මත මිස විශ්ලේෂණ ප්‍රතිඵලය මත නොවේ.