ලාභ:
- කෘත්රිම බුද්ධි සහාය ඇතිව විස්තරාත්මක සංඛ්යාලේඛන සහ බෙදාහැරීමේ/සම්බන්ධතා ප්රස්ථාර නිෂ්පාදනය කිරීමේ හැකියාව සහ දත්ත සහ ප්රශ්නය අනුව නිවැරදි ප්රස්ථාර වර්ගය තෝරා ගැනීමේ හැකියාව
- කෘතිම බුද්ධිය මගින් නිපදවන ලද රූපවල නොමඟ යවන තේරීම් (ඉරි සහිත අක්ෂය, නුසුදුසු පරිමාණය, අධික සුමට කිරීම) හඳුනා ගැනීමට සහ අවංක දෘශ්යකරණ මූලධර්ම යෙදීමේ හැකියාව
- ගවේෂණාත්මක විශ්ලේෂණය යනු උපකල්පන උත්පාදනය කිරීම සහ එකම දත්ත සමඟ සොයාගැනීම් සහ තහවුරු කිරීමේ උගුල (p-හැක් කිරීම සඳහා දොර විවර කරන) බව වෙන්කර හඳුනා ගැනීමට හැකි වීම.
දත්ත පිරිසිදු කිරීමෙන් පසු, අනුභූතික පර්යේෂකයාගේ පළමු කාර්යය වන්නේ එය දැන ගැනීමයි. මෙම අදියර ගවේෂණාත්මක දත්ත විශ්ලේෂණය (EDA - ගවේෂණ දත්ත විශ්ලේෂණය) ලෙස හැඳින්වේ: එය ප්රස්ථාර සහ සාරාංශ සංඛ්යාලේඛන සමඟ දත්ත පරීක්ෂා කර එහි ව්යුහය, රටා සහ විස්මයන් දැකීමේ ක්රියාවලියයි. පරමාර්ථය තවමත් උපකල්පනයක් පරීක්ෂා කිරීම නොව, දත්ත සමඟ දැන හඳුනා ගැනීම, ප්රශ්න උත්පාදනය කිරීම සහ අනාගතයේදී ඔබ ගොඩනඟන ආකෘතිය සඳහා අඩිතාලම දැමීමයි. මෙම ඒකකය තුළ, කෘතිම බුද්ධිය (AI) EDA සහ දෘශ්යකරණය වේගවත් කරන්නේ කෙසේදැයි අපි බලමු, නමුත් එය නිපදවන ග්රැෆික්ස් ප්රවේශමෙන් විගණනය කළ යුත්තේ ඇයි.
අපි මුලින්ම මූලික වෙනස්කම් දෙකක් කරමු. පළමුව, විස්තරාත්මක සංඛ්යාලේඛන (මධ්යන්ය, මධ්යන්ය, සම්මත අපගමනය, හතරැස් වැනි දත්ත සාරාංශ කරන සංඛ්යා) සහ දෘශ්යකරණය (එකම තොරතුරු චිත්රක වශයෙන් පෙන්වමින්) එකිනෙකට අනුපූරක වේ; ඔවුන් එක්ව දත්ත විස්තර කරයි. දෙවනුව, සහ වඩාත්ම විවේචනාත්මක: සොයා ගැනීම සහ තහවුරු කිරීම වෙන්කර හඳුනාගත යුතුය. ගවේෂණාත්මක විශ්ලේෂණය උපකල්පන ජනනය කිරීම සඳහා වේ; එම දත්ත සමඟ උපකල්පනය ගවේෂණය කිරීම සහ "මම එය පරීක්ෂා කළ අතර එය වැදගත් බව සොයා ගත්තා" යැයි පැවසීම p-හැක් කිරීම සඳහා දොර විවර කරයි, එය අපි ඊළඟ ඒකකයෙන් දකිමු. දත්ත බැලීම සහ රටාවක් බැලීම නොමිලේ; නමුත් එම දත්තවලම එම රටාව "ඔප්පු කළ සොයාගැනීමක්" ලෙස ප්රකාශ කිරීම නොමඟ යවන සුළුය.
පියවරෙන් පියවර ගවේෂණාත්මක විශ්ලේෂණය
1. Univariate view. එක් එක් විචල්යය තනි තනිව පරීක්ෂා කරන්න: එහි ව්යාප්තිය සමමිතික හෝ විකෘතිද; කඳු කීයක් තිබේද; පිටස්තරයෝ කොහෙද? සංඛ්යාත්මක විචල්යයන් සඳහා, histogram (පරාසවලට අගයන් බෙදීමෙන් සංඛ්යාතය පෙන්වන කුමන්ත්රණය) සහ boxplot (boxplot - මධ්යස්ථ, quartile සහ අන්ත අගයන් පෙන්වන ප්රස්ථාරය); වර්ගීකරණ විචල්ය සඳහා, සංඛ්යාත වගු සහ තීරු ප්රස්ථාර භාවිතා කරන්න.
2. Bivariate view. විචල්ය දෙකක් අතර සම්බන්ධය බලන්න: සංඛ්යාත්මක විචල්ය දෙකක් සඳහා විසිරුම් කුමන්ත්රණය (එක් එක් නිරීක්ෂණ x-y තලයේ ලක්ෂ්යයක් ලෙස පෙන්වයි), සංඛ්යාත්මක-ප්රවර්ග සඳහා සමූහ කොටු කුමන්ත්රණය, වර්ගීකරණය දෙකක් සඳහා හරස් ටැබ්. සහසම්බන්ධතා සංගුණකය බැලීමට පෙර, විසිරුණු කුමන්ත්රණය දෙස බැලීමට වග බලා ගන්න: එකම සහසම්බන්ධයට බෙහෙවින් වෙනස් රටා පෙන්විය හැකිය (ප්රසිද්ධ Anscombe quartet මෙය පෙන්නුම් කරයි; දත්ත කට්ටල හතරක් පාහේ සමාන සංඛ්යාලේඛන ඇත, නමුත් සැලසුම් කළ විට ඒවා සම්පූර්ණයෙන්ම වෙනස් වේ).
3. නිවැරදි ප්රස්ථාර වර්ගය තෝරන්න. ප්රස්ථාර වර්ගය ඔබගේ ප්රශ්නය සහ දත්ත වර්ගය මත රඳා පවතී. බෙදා හැරීම සඳහා හිස්ටෝග්රෑම්; සම්බන්ධතාවය සඳහා විසිරීම; කාලයත් සමඟ වෙනස් කිරීම සඳහා රේඛා සටහන; කාණ්ඩ සංසන්දනය සඳහා තීරු වගුව; (ප්රවේශමෙන්) කොටස්වල සමස්ත අනුපාතය සඳහා ගොඩගැසූ තීරුව. AI ඉක්මනින් ඔබ සඳහා කේතය ජනනය කරයි, නමුත් "කුමන ප්රශ්නය සඳහා කුමන ප්රස්ථාරය" යන තීරණය ඔබගේ වේ.
4. රටාව සටහන් කරන්න, ප්රතිඵල ප්රකාශ නොකරන්න. ඔබ "සොයාගැනීමේ සටහනක්" ලෙස දකින ඕනෑම රසවත් රටාවක් වාර්තා කරන්න, නමුත් එය තහවුරු කළ සොයාගැනීමක් ලෙස සලකන්න එපා. තහවුරු කිරීම වෙනම පියවරකින් සිදු කරනු ලැබේ, වඩාත් සුදුසු වන්නේ වෙනම දත්ත හෝ කලින් තීරණය කළ කාලසටහනකිනි.
අවංක දෘශ්යකරණ මූලධර්ම
ග්රැෆික් ඒත්තු ගන්වයි; එබැවින් එහි නොමග යැවීමේ බලයද ඉහළය. AI හට සෞන්දර්යාත්මක නමුත් සමහර විට නොමග යවන තේරීම් කළ හැක. මෙම ප්රතිපත්ති පරීක්ෂා කරන්න:
- තීරු ප්රස්ථාරවල, y-අක්ෂය බිංදුවෙන් ආරම්භ විය යුතුය. ඉරි සහිත අක්ෂය කුඩා වෙනස්කම් විශාල ලෙස පෙන්වයි.
- පරිමාණය අනුකූල විය යුතුය. ප්රස්ථාර දෙකක් සංසන්දනය කරන්නේ නම්, එකම අක්ෂ පරාසය භාවිතා කරන්න.
- අධික සිනිඳු කිරීම සැබෑ රටාව සැඟවිය හැක. ප්රවණතා රේඛාවක් ලස්සනට පෙනේ, නමුත් එය දත්ත ඕනෑවට වඩා "සුමට" කරන්නේ නම්, එය නොමඟ යවන සුළු විය හැකිය.
- වර්ණ සහ 3D සැරසිලි අවධානය විකෘති කරයි, දත්ත නොවේ. සරල බව තෝරන්න.
- නැතිවූ දත්ත සහ නියැදි ප්රමාණය දෘශ්යමාන විය යුතුය. "n=12" සහ "n=12,000" එක සමාන නොවිය යුතුය.
අවධානය: AI විසින් නිෂ්පාදනය කරන ලද ග්රැෆික්ස් ලස්සන නිසා ඒවා සත්ය නොවේ. ඔහු කරන වඩාත්ම පොදු වැරැද්ද නම් තීරු ප්රස්ථාරයේ බිංදුවෙන් අක්ෂය ආරම්භ නොකිරීම සහ කණ්ඩායම් දෙක අතර වෙනස අතිශයෝක්තියට නැංවීමයි. සෑම විටම අක්ෂය පරීක්ෂා කරන්න.
සංසන්දනාත්මක සටහන: ප්රශ්නය → වගුව
අහන්න
නිවැරදි සටහන
පොදු වැරැද්ද
මෙම විචල්යය බෙදා හරිනු ලබන්නේ කෙසේද?
හිස්ටෝග්රෑම්/කොටු කුමන්ත්රණය
පයි ප්රස්ථාරය භාවිතා කරන්න
සංඛ්යාත්මක විචල්ය දෙකක් සම්බන්ධද?
විසිරුම් කුමන්ත්රණය
සහසම්බන්ධතා ගණන දෙස බැලීම පමණි
කාලයත් සමඟ එය වෙනස් වී ඇත්තේ කෙසේද?
රේඛා සටහන
තීරු ප්රස්ථාරයක් සමඟ ප්රවණතාවක් පැවසීම
කණ්ඩායම් අතර වෙනස කුමක්ද?
සමූහගත කොටුව/තීරුව (මුල සිට)
කපන ලද අක්ෂ දණ්ඩ
කොටසින් සම්පූර්ණ අනුපාතය?
ගොඩගැසූ තීරුව (ප්රවේශමෙන්)
බහු පෙති පයි ප්රස්ථාරය
පිටපත් කළ හැකි විමසීම් හතරක්
1. ස්වයංක්රීය සොයාගැනීමේ කේතය:
ඔබේ භූමිකාව: EDA සහකාර. මම දත්ත බෙදා නොගනිමි, මට R (ggplot2) කේතය අවශ්යයි. 'data' data.frame හි සංඛ්යාත්මක (ආදායම්, වයස, වියදම්) සහ වර්ගික (කලාපය, අධ්යාපනය) විචල්යයන් ඇත. කාර්යය: එක් එක් සංඛ්යා සඳහා හිස්ටෝග්රෑම් එකක්, එක් එක් වර්ගීකරණය සඳහා තීරු ප්රස්ථාරයක් සහ ආදායම්~ වයස සඳහා විසිරුණු බිම් කැබැල්ලක් නිපදවන කේතයක් ලියන්න. තීරු ප්රස්ථාරවල, y-අක්ෂය ZERO වෙතින් ආරම්භ කිරීමට ඉඩ දෙන්න. අදහස් පේළිය එක් කරන්න.
2. සහසම්බන්ධතා සමාලෝචනය (සහසම්බන්ධය + දෘශ්ය එකට):
ආදායම සහ වියදම් සඳහා පියර්සන් සහසම්බන්ධය යන දෙකම ගණනය කරන කේතයක් ලියන්න සහ විසිරුණු කුමන්ත්රණයක් + රේඛීය ප්රවණතාවක් සැලසුම් කරන්න. සහසම්බන්ධතා ගණන විශ්වාස කිරීමට පෙර ප්රස්ථාරය පරීක්ෂා කිරීමට මට මතක් කරන අදහස් පේළියක් එක් කරන්න (Anscombe අනතුරු ඇඟවීම). ප්රවණතා රේඛාව ඕනෑවට වඩා සුමට නොකරන්න.
3. අඛණ්ඩතා විගණනය:
අවංක දෘශ්යකරණය සඳහා පහත ggplot කේතය පරීක්ෂා කරන්න:[කේතය]. පහත ඒවා පරීක්ෂා කර නිවැරදි කරන්න: y-අක්ෂය ආරම්භ වන්නේ ශුන්යයෙන්ද, පරිමාණය අනුකූලද, නියැදි ප්රමාණය දෘශ්යමානද, අධික සුමට කිරීමක් තිබේද? ඔබ විසින් කරන ලද එක් එක් නිවැරදි කිරීම සඳහා සාධාරණීකරණය පැහැදිලි කරන්න.
4. සොයාගැනීම් සටහනක් නිෂ්පාදනය කිරීම (සොයාගැනීමක් නොවේ):
මා නිෂ්පාදනය කරන ප්රස්ථාර මත පදනම්ව, නිරීක්ෂණ 'සොයාගැනීමේ සටහනක්' ලෙස ලැයිස්තුගත කරන්න; සෑම අයිතමයක්ම 'පරීක්ෂා කළ යුතු උපකල්පනය' භාෂාවෙන් ලියන්න, 'අනිවාර්ය සොයාගැනීම' නොවේ. උදාහරණය: 'උසස් අධ්යාපනයේ ආදායම වැඩි වශයෙන් පැතිරී ඇති බව පෙනේ; වෙනම දත්ත සමඟ පරීක්ෂා කළ යුතුය.' හේතු සහ නිශ්චිත ප්රකාශ වලින් වළකින්න.
දුර්වල ක්ෂණික / ශක්තිමත් විමසුම
දුර්වල ක්ෂණික:
අස්වැන්නෙන් ලස්සන ප්රස්ථාර සාදා ඒවායින් අදහස් කරන්නේ කුමක්දැයි මට කියන්න.
මෙම විමසුම නොමඟ යවන ප්රතිදානයට ආරාධනා කරයි: “ලස්සන” සෞන්දර්යය කෙරෙහි අවධානය යොමු කරන අතර “එයින් අදහස් කරන්නේ කුමක්ද” AI සොයාගැනීමේ සිට නිශ්චිත නිගමනයට පැනීමට තල්ලු කරයි. හේතුවාදී, අතිශයෝක්තියෙන් යුත් අදහස් පහත දැක්වේ.
බලවත් විමසුම:
ඔබේ භූමිකාව: අවංක EDA සහකාර. කාර්යය: (1) මගේ ප්රශ්නයට ගැලපෙන ප්රස්ථාර වර්ගය තෝරා සාධාරණීකරණය ලියන්න, (2) තීරු ප්රස්ථාරවල අක්ෂය බිංදුවෙන් ආරම්භ කරන්න, (3) සොයාගැනීම් සටහන භාෂාවෙන් ප්රතිදානය අර්ථකථනය කරන්න: නිශ්චිත/හේතුක හිමිකම් ප්රකාශයක් යෝජනා නොකරයි: "නියැදිය පරීක්ෂා කළ යුතුයි" (4 නියැදිය කුඩා නම්, මම ධාවනය කළ යුතුයි) භාෂාවෙන් කල්පිතය ක්රියාත්මක කරන්නම්,(3) මගේම පරිසරයේ ප්රස්ථාර කර එය සත්යාපනය කරන්න.
වෙනස: ශක්තිමත් කැමැත්ත ප්රස්ථාර වර්ගය සාධාරණීකරණය කරයි, අවංකභාවයේ නීති පනවයි සහ සොයාගැනීම තහවුරු කිරීම සමඟ පටලවා නොගනී.
කුඩා නඩු තුනක්
නඩුව 1 - විවික්ත අක්ෂය අතිශයෝක්තිය. විශ්ලේෂකයෙකු තීරු ප්රස්ථාරයක ශාඛා දෙකක (7.8 සහ 8.0; 10 න්) තෘප්තිමත් ලකුණු පෙන්වීය. YZ අක්ෂය 7.5 සිට ආරම්භ කරන විට, දෙවන ශාඛාව පළමු එකට වඩා දෙගුණයක් පමණ ඉහළින් දිස් විය; වෙනස වූයේ 2.5% ක් පමණි. කළමනාකාරීත්වය වැරදි හැඟීමක් යටතේ ශාඛාවකට විපාක දීමට සූදානම් විය. මම මුල සිට අක්ෂය ආරම්භ කළ විට වෙනස පාහේ නොපෙනී ගියේය. පාඩම: අක්ෂ තේරීම පමණක් සංජානනය වෙනස් කරයි.
2 වන අවස්ථාව - සහසම්බන්ධය විශ්වාස කිරීම සහ ප්රස්ථාරය මඟ හැරීම. පර්යේෂකයෙක් විචල්ය දෙකක් අතර r = 0.81 දැක "ශක්තිමත් රේඛීය සම්බන්ධතාවය" ලිවීය. ඔහුගේ උපදේශකයා විසිරුණු ප්ලොට් එක ඉල්ලා සිටි විට, එම සම්බන්ධය ඇත්ත වශයෙන්ම එක් අන්ත නිරීක්ෂණයක් නිසා ඇති වූවක් බව පෙනී ගිය අතර, එම ලක්ෂ්යය ඉවත් කළ විට සහසම්බන්ධය 0.12 දක්වා පහත වැටුණි. පාඩම: සහසම්බන්ධතා ගණන ප්රස්ථාරයක් සඳහා ආදේශකයක් නොවේ; සෑම විටම විසිරීම දෙස බලන්න.
නඩුව 3 - තහවුරු කිරීම සමඟ ව්යාකූල සොයා ගැනීම. එක් සිසුවෙක් 40-විචල්ය දත්ත කට්ටලයක සියලුම යුගල සහසම්බන්ධතා දෙස බලා, ඉහළම එක (r=0.52) තෝරාගෙන, "අපි අධ්යාපනය සහ ඉතුරුම් (p=0.004) අතර සැලකිය යුතු සම්බන්ධයක් සොයා ගත්තෙමු" යනුවෙන් ලිවීය. කෙසේ වෙතත්, විචල්ය 40 කින් යුගල සිය ගණනක් විය; ඉහළම දේ තෝරා ගැනීම අහම්බයක් නිසා වැරදි සොයා ගැනීමකි. පාඩම: සොයාගත් රටාව එකම දත්තවල "පරීක්ෂා කර සැලකිය යුතු ලෙස ප්රකාශ කළ නොහැක"; වෙනම තහවුරු කිරීමක් අවශ්ය වේ.
පොදු වැරදි
- තීරු ප්රස්ථාරයේ බිංදුවෙන් අක්ෂය ආරම්භ නොකිරීම. එය කුඩා වෙනස අතිශයෝක්තියට නංවයි; වඩාත් පොදු දෘශ්ය බොරුව. සෑම විටම පරීක්ෂා කරන්න.
- සහසම්බන්ධය දෙස බැලීම සහ ප්රස්ථාරය මඟ හැරීම. එකම සහසම්බන්ධය බොහෝ වෙනස් රටා වලින් පැමිණේ; බාහිර සම්බන්ධතාවයකට ගැලපේ. පළමුව, විසිරීම.
- සොයාගැනීමේදී සොයාගත් රටාව එම දත්තවලම "සාක්ෂි" ලෙස සැලකීම. මෙය p-හැක් කිරීමේ දොරටුවයි; තහවුරු කිරීම වෙන වෙනම සිදු කෙරේ.
- වැරදි ප්රස්ථාර වර්ගය. ප්රවණතාවය සඳහා තීරුව සහ බෙදා හැරීම සඳහා පයි වැනි ගැලපීම් නොමඟ යවන සුළුය. ප්රශ්නය මත පදනම්ව ප්රභේදයක් තෝරන්න.
- නියැදි ප්රමාණය සැඟවීම. n=8 සහ n=8,000 එකම ප්රස්ථාරයේ සමාන නොවිය යුතුය; අවිනිශ්චිත බව පෙන්විය යුතුය.
ඉඟිය: ප්රස්ථාරයක් ප්රකාශයට පත් කිරීමට පෙර, ඔබෙන්ම මෙසේ අසන්න: "මම අක්ෂය වෙනස් කළහොත් කතාව වෙනස් වේවිද?" පිළිතුර ඔව් නම්, ඔබ බොහෝ විට වංක ස්ථානයක සිට හැරීම ආරම්භ කර ඇත.
සාරාංශයකින්
ගවේෂණාත්මක දත්ත විශ්ලේෂණය යනු දත්ත හමුවීමේ, රටා දැකීමේ සහ උපකල්පන ජනනය කිරීමේ අදියරයි; එය තහවුරු කිරීමක් නොවේ. AI ඉක්මනින් විස්තරාත්මක සංඛ්යාලේඛන සහ ප්රස්ථාර කේතය ජනනය කරයි, නමුත් ඔබ ඔබේ ප්රශ්නය මත පදනම්ව ප්රස්ථාර වර්ගය තෝරා සාධාරණත්වයේ මූලධර්ම පාලනය කරයි (ශුන්ය අක්ෂය, ස්ථාවර පරිමාණය, පෙනෙන අවිනිශ්චිතතාවය). සහසම්බන්ධ අංකය විශ්වාස කිරීමට පෙර විසිරීම දෙස බලන්න; ඔබ සොයාගැනීමේදී සොයාගත් රටාව එකම දත්තවල "සාක්ෂි" ලෙස ප්රකාශ නොකරන්න. AI හි ලස්සන ප්රස්ථාරයක් යනු නිවැරදි ප්රස්ථාරයක් නොවේ.
යෙදුම් කාර්යය
දත්ත කට්ටලයක අවම වශයෙන් විචල්ය තුනක්වත් තෝරන්න. අවංක නීති බලාත්මක කරන ප්රේරකයක් සමඟ ගවේෂණාත්මක ප්රස්ථාර (හිස්ටෝග්රෑම්, විසිරුණු, කොටු) නිෂ්පාදනය කරන කේතය සඳහා AI ගෙන් විමසන්න. එක් එක් ප්රස්ථාරය සඳහා: (1) ප්රශ්නයට ප්රස්ථාර වර්ගයෙහි යෝග්යතාවය, (2) අක්ෂයේ අවංකභාවය, (3) නියැදි ප්රමාණයේ දෘශ්යතාව පරීක්ෂා කරන්න. උපකල්පන භාෂාවෙන් අවම වශයෙන් එක් "සොයාගැනීමේ සටහනක්" ලියන්න ("...වෙනම පරීක්ෂා කර ඇති බව පෙනේ"). ගණන් කිරීම සහ විසිරීම යන දෙකම සමඟ සහසම්බන්ධයක් පරීක්ෂා කර ඒවා අතර විෂමතාවයක් තිබේ නම් වාර්තා කරන්න.
පිරික්සුම් ලැයිස්තුව
- [ ] මම මගේ ප්රශ්නය සහ දත්ත වර්ගය මත පදනම්ව ප්රස්ථාර වර්ගය තෝරා ගත්තෙමි.
- [ ] තීරු ප්රස්ථාරවල, මම y අක්ෂය බිංදුවෙන් ආරම්භ කරමි; මම අක්ෂයේ අවංකභාවය පරීක්ෂා කළා.
- [ ] සහසම්බන්ධය විශ්වාස කිරීමට පෙර මම විසිරුණු කොටස දෙස බැලුවෙමි.
- [ ] මම ප්රස්ථාරයේ නියැදි ප්රමාණය සහ අවිනිශ්චිත බව පිළිබිඹු කළෙමි.
- [ ] මම ගවේෂණයේදී සොයාගත් රටා "සාක්ෂි" වෙනුවට "පරීක්ෂා කළ යුතු උපකල්පනය" ලෙස ලිව්වෙමි.
- [ ] මම තහවුරු කිරීම සඳහා එකම දත්ත භාවිතා නොකරන බවත් වෙනම පියවරක් අවශ්ය බවත් සටහන් කළෙමි.