ಘಟಕಗಳು
1. ಅರ್ಥಶಾಸ್ತ್ರ ಮತ್ತು ಅಂಕಿಅಂಶಗಳಲ್ಲಿ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ: ಪಾತ್ರಗಳು, ಗಡಿಗಳು, ದೃಢೀಕರಣ ಮತ್ತು ಗೌಪ್ಯತೆ 2. ಡೇಟಾ ಶುಚಿಗೊಳಿಸುವಿಕೆ ಮತ್ತು ತಯಾರಿ: ಕಾಣೆಯಾದ ಡೇಟಾ, ಔಟ್‌ಲೈಯರ್‌ಗಳು ಮತ್ತು ಕೋಡಿಂಗ್ 3. ಪರಿಶೋಧನಾತ್ಮಕ ಡೇಟಾ ವಿಶ್ಲೇಷಣೆ ಮತ್ತು ದೃಶ್ಯೀಕರಣ: ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯೊಂದಿಗೆ ಗ್ರಾಫಿಂಗ್ ಮತ್ತು ವ್ಯಾಖ್ಯಾನ 4. ಲೀನಿಯರ್ ರಿಗ್ರೆಷನ್: ಮಾಡೆಲ್ ಬಿಲ್ಡಿಂಗ್, ಗುಣಾಂಕ ವ್ಯಾಖ್ಯಾನ ಮತ್ತು ಊಹೆಗಳು 5. ರಿಗ್ರೆಶನ್ ಡಯಾಗ್ನೋಸ್ಟಿಕ್ಸ್ ಮತ್ತು ಉಲ್ಲಂಘನೆಗಳು: ಕೊಲಿನಿಯರಿಟಿ, ಹೆಟೆರೊಸೆಡೆಸ್ಟಿಸಿಟಿ, ಆಟೋಕೊರೆಲೇಶನ್ 6. ಕಲ್ಪನೆಯ ಪರೀಕ್ಷೆ ಮತ್ತು p-ಮೌಲ್ಯ: ಮಹತ್ವ, ಶಕ್ತಿ ಮತ್ತು ಬಹು ಹೋಲಿಕೆಗಳು 7. ಪಿ-ಹ್ಯಾಕಿಂಗ್, ಹಾರ್ಕಿಂಗ್ ಮತ್ತು ಅಂಕಿಅಂಶಗಳ ಸಮಗ್ರತೆ: ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯ ಯುಗದಲ್ಲಿ ಮೋಸಗಳು 8. ಸಮಯ ಸರಣಿ ವಿಶ್ಲೇಷಣೆ: ಸ್ಥಾಯಿತ್ವ, ARIMA ಮತ್ತು ಮುನ್ಸೂಚನೆ 9. ಕಾರಣ ಮತ್ತು ನೀತಿ ವಿಶ್ಲೇಷಣೆ: ಡಿಐಡಿ, IV, ಆರ್ಡಿಡಿ ಮತ್ತು ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ 10. ಕೋಡ್ ಉತ್ಪಾದನೆ ಮತ್ತು ಪುನರುತ್ಪಾದನೆ: ಆರ್/ಪೈಥಾನ್, ಆವೃತ್ತಿ ಮತ್ತು ಪುನರುತ್ಪಾದನೆ 11. ವರದಿ ಬರವಣಿಗೆ, ಸಂವಹನ ಮತ್ತು ನೀತಿಶಾಸ್ತ್ರ: ಫಲಿತಾಂಶಗಳನ್ನು ಪ್ರಸ್ತುತಪಡಿಸುವುದು ಮತ್ತು ಗಡಿಗಳನ್ನು ಸಂವಹನ ಮಾಡುವುದು
ಘಟಕ 2 / 11

ಡೇಟಾ ಶುಚಿಗೊಳಿಸುವಿಕೆ ಮತ್ತು ತಯಾರಿ: ಕಾಣೆಯಾದ ಡೇಟಾ, ಔಟ್‌ಲೈಯರ್‌ಗಳು ಮತ್ತು ಕೋಡಿಂಗ್

ಲಾಭಗಳು:

  • ಕಾಣೆಯಾದ ಡೇಟಾ ಪ್ರಕಾರಗಳು (MCAR/MAR/MNAR), ಔಟ್‌ಲೈಯರ್‌ಗಳು ಮತ್ತು ಕೋಡಿಂಗ್ ದೋಷಗಳನ್ನು ಗುರುತಿಸುವ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ಕ್ಲೀನಪ್ ಕೋಡ್ ಮತ್ತು ಡಯಾಗ್ನೋಸ್ಟಿಕ್‌ಗಳನ್ನು ತಯಾರಿಸಲು ಸರಿಯಾದ ಡೇಟಾದೊಂದಿಗೆ AI ಅನ್ನು ಬಳಸುವ ಸಾಮರ್ಥ್ಯ
  • ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯಿಂದ ಸೂಚಿಸಲಾದ ಪ್ರತಿ ಶುಚಿಗೊಳಿಸುವ ಹಂತ (ಅಳಿಸುವಿಕೆ, ನಿಯೋಜನೆ, ರೂಪಾಂತರ) ವಿಶ್ಲೇಷಣೆಯ ಫಲಿತಾಂಶದ ಮೇಲೆ ಹೇಗೆ ಪರಿಣಾಮ ಬೀರುತ್ತದೆ ಮತ್ತು ಹಿಂತಿರುಗಿಸಬಹುದಾದ ಮತ್ತು ದಾಖಲಿತ ಕೆಲಸದ ಹರಿವನ್ನು ಹೇಗೆ ಸ್ಥಾಪಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ನೋಡುವ ಸಾಮರ್ಥ್ಯ
  • ಸ್ವಚ್ಛಗೊಳಿಸುವ ನಿರ್ಧಾರಗಳು ಡೇಟಾವನ್ನು ಉತ್ಪಾದಿಸುವ ಪ್ರಕ್ರಿಯೆಯ ಜ್ಞಾನವನ್ನು ಆಧರಿಸಿವೆ ಮತ್ತು ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯು ಮೇಲ್ವಿಚಾರಣೆಯ ಸಹಾಯಕವಾಗಿದೆ, ಕುರುಡು ಆಟೊಮ್ಯಾಟನ್ ಅಲ್ಲ ಎಂದು ನಿರ್ವಹಿಸುವುದು

ಪ್ರತಿಯೊಬ್ಬ ಅನುಭವಿ ವಿಶ್ಲೇಷಕನಿಗೆ ಒಂದು ಸತ್ಯ ತಿಳಿದಿದೆ: ಪ್ರಾಯೋಗಿಕ ಯೋಜನೆಯ ಹೆಚ್ಚಿನ ಸಮಯವು ಮಾಡೆಲಿಂಗ್ ಅಲ್ಲ, ಆದರೆ ಡೇಟಾ ಶುಚಿಗೊಳಿಸುವಿಕೆ (ದತ್ತಾಂಶದಲ್ಲಿನ ದೋಷಗಳು, ಲೋಪಗಳು ಮತ್ತು ಅಸಂಗತತೆಗಳನ್ನು ಸರಿಪಡಿಸುವ ಮತ್ತು ವಿಶ್ಲೇಷಣೆಗೆ ಸಿದ್ಧಪಡಿಸುವ ಕೆಲಸ). ಹೆಬ್ಬೆರಳಿನ ಒರಟು ನಿಯಮದಂತೆ, ಸುಮಾರು 70-80% ಸಮಯವು ಡೇಟಾವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು, ಸ್ವಚ್ಛಗೊಳಿಸಲು ಮತ್ತು ಪರಿವರ್ತಿಸಲು ಹೋಗುತ್ತದೆ; ನಿಜವಾದ ವಿಶ್ಲೇಷಣೆಗೆ ಕೇವಲ 20-30% ಮಾತ್ರ ಉಳಿದಿದೆ. ಈ ಘಟಕದಲ್ಲಿ, ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ (AI) ಈ ಭಾರವನ್ನು ಹೇಗೆ ಸರಾಗಗೊಳಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ನಾವು ಹಂತ ಹಂತವಾಗಿ ನೋಡುತ್ತೇವೆ, ಆದರೆ ಯಾವ ನಿರ್ಧಾರಗಳು ಇನ್ನೂ ನಿಮ್ಮೊಂದಿಗೆ ಉಳಿಯಬೇಕು ಮತ್ತು ಏಕೆ.

ಎರಡು ಮೂಲಭೂತ ಸಂಗತಿಗಳನ್ನು ಮೊದಲು ಇಡೋಣ. ಮೊದಲನೆಯದಾಗಿ, ಶುಚಿಗೊಳಿಸುವ ನಿರ್ಧಾರಗಳು ಡೇಟಾವನ್ನು ಉತ್ಪಾದಿಸುವ ಪ್ರಕ್ರಿಯೆಯ ನಿಮ್ಮ ಜ್ಞಾನವನ್ನು ಆಧರಿಸಿವೆ: ಮೌಲ್ಯವು ಏಕೆ ಕಾಣೆಯಾಗಿದೆ, ಏಕೆ ಸಂಖ್ಯೆಯು ಅತಿಯಾಗಿ ದೊಡ್ಡದಾಗಿದೆ ಎಂದು ನಿಮಗೆ ಮಾತ್ರ ತಿಳಿದಿದೆ. AI ಡೇಟಾವನ್ನು ನೋಡುವುದಿಲ್ಲ, ಸಂದರ್ಭವನ್ನು ತಿಳಿದಿಲ್ಲ; ಕೋಡ್ ಬರೆಯುತ್ತಾರೆ, ನಿರ್ಧಾರಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳುವುದಿಲ್ಲ. ಎರಡನೆಯದಾಗಿ, ಪ್ರತಿ ಶುಚಿಗೊಳಿಸುವ ಹಂತವು ವಿಶ್ಲೇಷಣೆಯ ಫಲಿತಾಂಶವನ್ನು ಬದಲಾಯಿಸಬಹುದು. ಔಟ್ಲೈಯರ್ ಅನ್ನು ಅಳಿಸುವುದು ಗುಣಾಂಕವನ್ನು ವಿಲೋಮಗೊಳಿಸಬಹುದು; ಕಾಣೆಯಾದದ್ದನ್ನು ಸರಾಸರಿಯೊಂದಿಗೆ ಭರ್ತಿ ಮಾಡುವುದರಿಂದ ವ್ಯತ್ಯಾಸವನ್ನು ಕೃತಕವಾಗಿ ಕಡಿಮೆ ಮಾಡಬಹುದು. ಆದ್ದರಿಂದ ಶುಚಿಗೊಳಿಸುವಿಕೆಯು ಹಿಂತಿರುಗಿಸಬಹುದಾದ ಮತ್ತು ದಾಖಲೆಯಾಗಿರಬೇಕು: ಕಚ್ಚಾ ಡೇಟಾವನ್ನು ಎಂದಿಗೂ ಸ್ಪರ್ಶಿಸಬೇಡಿ, ಕೋಡ್‌ನಲ್ಲಿ ಪ್ರತಿ ಹಂತವನ್ನು ಮಾಡಿ, ಪ್ರತಿ ಹಂತದ ಪರಿಣಾಮವನ್ನು ದಾಖಲಿಸಿ.

ಹಂತ-ಹಂತದ ಶುಚಿಗೊಳಿಸುವ ಕೆಲಸದ ಹರಿವು

1. ಡೇಟಾವನ್ನು ತಿಳಿಯಿರಿ. ಮೊದಲು ರಚನೆಯನ್ನು ನೋಡಿ: ಸಾಲುಗಳ ಸಂಖ್ಯೆ (ವೀಕ್ಷಣೆಗಳು) ಮತ್ತು ಕಾಲಮ್‌ಗಳು (ವೇರಿಯಬಲ್‌ಗಳು), ಪ್ರತಿ ವೇರಿಯಬಲ್‌ನ ಪ್ರಕಾರ (ಸಂಖ್ಯಾ, ವರ್ಗೀಯ, ದಿನಾಂಕ), ಸಾರಾಂಶ ಅಂಕಿಅಂಶಗಳು, ಕಾಣೆಯಾದ ಸಂಖ್ಯೆ. ಈ "ಡೇಟಾ ಪ್ರೊಫೈಲ್" ಕೋಡ್‌ಗಾಗಿ ನೀವು AI ಅನ್ನು ಕೇಳಬಹುದು; ಆದರೆ ನೀವು ಔಟ್ಪುಟ್ ಅನ್ನು ಓದುತ್ತೀರಿ ಮತ್ತು "ಈ ವೇರಿಯೇಬಲ್ ಪಠ್ಯವಾಗಿ ಏಕೆ ಬಂದಿತು?"

2. ಕಾಣೆಯಾದ ಡೇಟಾವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಿ ಮತ್ತು ವರ್ಗೀಕರಿಸಿ. ಕಾಣೆಯಾದ ಡೇಟಾವನ್ನು ಮೂರು ವಿಧಗಳಾಗಿ ವಿಂಗಡಿಸಲಾಗಿದೆ. MCAR (ಯಾದೃಚ್ಛಿಕವಾಗಿ ಸಂಪೂರ್ಣವಾಗಿ ಕಾಣೆಯಾಗಿದೆ): ಕಾಣೆಯಾಗಿರುವುದು ಯಾವುದಕ್ಕೂ ಕಾರಣವಲ್ಲ, ಉದಾಹರಣೆಗೆ ಸಂವೇದಕವು ಯಾದೃಚ್ಛಿಕವಾಗಿ ವಿಫಲವಾಗಿದೆ. MAR (ಯಾದೃಚ್ಛಿಕವಾಗಿ ಕಾಣೆಯಾಗಿದೆ): ಕಾಣೆಯಾಗಿರುವುದು ಇತರ ಗಮನಿಸಿದ ಅಸ್ಥಿರಗಳ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ, ಉದಾಹರಣೆಗೆ ವಯಸ್ಸಾದ ಜನರು ಹೆಚ್ಚಾಗಿ ಪ್ರಶ್ನೆಯನ್ನು ಖಾಲಿ ಬಿಡುತ್ತಾರೆ, ಆದರೆ ನಿಮಗೆ ವಯಸ್ಸು ತಿಳಿದಿದೆ. MNAR (ಯಾದೃಚ್ಛಿಕವಾಗಿ ಕಾಣೆಯಾಗಿದೆ): ಕಾಣೆಯಾಗಿರುವುದು ಗಮನಿಸದ ಮೌಲ್ಯವನ್ನು ಅವಲಂಬಿಸಿರುತ್ತದೆ, ಉದಾಹರಣೆಗೆ ಹೆಚ್ಚು ಗಳಿಸುವವರು ತಮ್ಮ ಆದಾಯವನ್ನು ವರದಿ ಮಾಡುವುದಿಲ್ಲ. ಈ ವ್ಯತ್ಯಾಸವು ನಿರ್ಣಾಯಕವಾಗಿದೆ ಏಕೆಂದರೆ ಇದು ಪರಿಹಾರ ವಿಧಾನವನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ ಮತ್ತು AI ನಿಮಗೆ ಇದನ್ನು ನಿರ್ಧರಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ.

3. ಕೊರತೆಯನ್ನು ನಿಭಾಯಿಸಿ. ಆಯ್ಕೆಗಳು: ಪಟ್ಟಿಯಿಂದ ಅಳಿಸುವಿಕೆ, ಸರಾಸರಿ/ಮಧ್ಯಮ ಇಂಪ್ಯುಟೇಶನ್, ಮಾದರಿ ಆಧಾರಿತ ಬಹು ಆಪಾದನೆ. MCAR ನಲ್ಲಿ ಅಳಿಸುವಿಕೆಯು ತುಲನಾತ್ಮಕವಾಗಿ ಸುರಕ್ಷಿತವಾಗಿದೆ ಆದರೆ ಮಾದರಿ ಗಾತ್ರವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ. MAR ನಲ್ಲಿ ಬಹು ನಿಯೋಜನೆ ಹೆಚ್ಚು ಸೂಕ್ತವಾಗಿದೆ. MNAR ನಲ್ಲಿ ಯಾವುದೇ ಸರಳ ವಿಧಾನವು ಪಕ್ಷಪಾತವಿಲ್ಲದಿರುವಿಕೆಯನ್ನು ಖಾತರಿಪಡಿಸುವುದಿಲ್ಲ; ಕೊರತೆಯ ಕಾರ್ಯವಿಧಾನವನ್ನು ರೂಪಿಸಬೇಕು ಅಥವಾ ಕನಿಷ್ಠ ಸೂಕ್ಷ್ಮತೆಯ ವಿಶ್ಲೇಷಣೆಯನ್ನು ನಡೆಸಬೇಕು. ಮೀನ್-ಫಿಲ್ಲಿಂಗ್ ಸುಲಭ ಆದರೆ ಅಪಾಯಕಾರಿ: ಇದು ವ್ಯತ್ಯಾಸವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ಸಂಬಂಧಗಳನ್ನು ದುರ್ಬಲಗೊಳಿಸುತ್ತದೆ ಮತ್ತು ಅನಿಶ್ಚಿತತೆಯನ್ನು ಮರೆಮಾಡುತ್ತದೆ.

4. ಹೊರಗಿನವರನ್ನು ಪರೀಕ್ಷಿಸಿ. ಔಟ್ಲೈಯರ್ ಎನ್ನುವುದು ಇತರರಿಂದ ಬಹಳ ದೂರದಲ್ಲಿ ನಿಂತಿರುವ ಒಂದು ವೀಕ್ಷಣೆಯಾಗಿದೆ. ಎರಡು ಪ್ರಶ್ನೆಗಳನ್ನು ಪ್ರತ್ಯೇಕಿಸಿ: ಇದು ದೋಷವೇ (ವಯಸ್ಸು 999 ಅನ್ನು ಡೇಟಾ ಎಂಟ್ರಿಯಲ್ಲಿ ಬರೆಯಲಾಗಿದೆ) ಅಥವಾ ಇದು ನಿಜವಾದ ಆದರೆ ಹೊರಗಿನ ಮೌಲ್ಯವೇ (ಬಿಲಿಯನೇರ್‌ನ ಆದಾಯ)? ದೋಷಗಳನ್ನು ಸರಿಪಡಿಸಿ; ನಿಜವಾದ ಔಟ್ಲೈಯರ್ಗಳನ್ನು ಅಳಿಸಬೇಡಿ ಏಕೆಂದರೆ ಅವುಗಳು ಡೇಟಾವನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತವೆ. "ಏಕೆಂದರೆ ಅದು ತೊಂದರೆ ಕೊಡುತ್ತದೆ" ಎಂದು ಹೊರಗನ್ನು ಅಳಿಸುವುದರಿಂದ ನೀವು ಫಲಿತಾಂಶದ ಕಡೆಗೆ ಡೇಟಾವನ್ನು ತಿರುಗಿಸುತ್ತಿದ್ದೀರಿ.

5. ಕೋಡಿಂಗ್ ಮತ್ತು ಸ್ಥಿರತೆ. ವರ್ಗಗಳನ್ನು ಪ್ರಮಾಣೀಕರಿಸಿ ("ಪುರುಷ", "ಪುರುಷ", "ಇ" ಎಲ್ಲಾ ಒಂದೇ ಕೋಡ್‌ಗೆ), ದಿನಾಂಕಗಳನ್ನು ಒಂದು ಸ್ವರೂಪಕ್ಕೆ, ಘಟಕಗಳನ್ನು ಒಂದು ಮಾಪಕಕ್ಕೆ ತನ್ನಿ, ನಕಲಿ ಸಾಲುಗಳನ್ನು ಪತ್ತೆ ಮಾಡಿ. ಇದು AI ಅತ್ಯುತ್ತಮವಾಗಿ ಸಹಾಯ ಮಾಡುವ ಕಡಿಮೆ ಅಪಾಯಕಾರಿ ಹಂತವಾಗಿದೆ.

6. ಡಾಕ್ಯುಮೆಂಟ್ ಮತ್ತು ಫ್ರೀಜ್. ಪ್ರತಿ ಹಂತವನ್ನು ಕೋಡ್ ಮತ್ತು ಕಾಮೆಂಟ್ ಲೈನ್‌ನೊಂದಿಗೆ ರೆಕಾರ್ಡ್ ಮಾಡಿ, ಕಚ್ಚಾ ಮತ್ತು ಸ್ವಚ್ಛಗೊಳಿಸಿದ ಡೇಟಾವನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ಇರಿಸಿ. ಆದ್ದರಿಂದ ತೀರ್ಪುಗಾರ "ಈ ಅವಲೋಕನಗಳನ್ನು ಏಕೆ ಕೈಬಿಡಲಾಗಿದೆ?" ಎಂದು ಕೇಳಿದಾಗ ನಿಮ್ಮ ಉತ್ತರ ಸಿದ್ಧವಾಗಿದೆ.

ಎಚ್ಚರಿಕೆ: ಫಲಿತಾಂಶಗಳ ಆಧಾರದ ಮೇಲೆ ಶುಚಿಗೊಳಿಸುವ ನಿರ್ಧಾರಗಳನ್ನು ಮಾಡಬೇಡಿ. "ನೀವು ಈ ಸಾಲನ್ನು ಅಳಿಸಿದಾಗ, ಗುಣಾಂಕವು ಗಮನಾರ್ಹವಾಗುತ್ತದೆ" ಎಂದು ಹೇಳುವ ಸಾಲನ್ನು ಅಳಿಸುವುದು ಪಿ-ಹ್ಯಾಕಿಂಗ್‌ನ ಅತ್ಯಂತ ಕಪಟ ರೂಪವಾಗಿದೆ, ಇದನ್ನು ನಾವು ಮುಂದಿನ ಘಟಕದಲ್ಲಿ ನೋಡುತ್ತೇವೆ.

ಹೋಲಿಕೆ ಕೋಷ್ಟಕ: ಕಾಣೆಯಾದ ಡೇಟಾ ವಿಧಾನಗಳು

ವಿಧಾನ

ಅದು ಯಾವಾಗ ಸೂಕ್ತ?

ಅಪಾಯ

AI ನ ಪಾತ್ರ

ಸಾಲನ್ನು ಅಳಿಸಿ

MCAR, ಕಡಿಮೆ ಕಾಣೆಯಾದ ದರ

ಮಾದರಿ ಚಿಕ್ಕದಾಗುತ್ತದೆ, MAR/MNAR ನಲ್ಲಿ ಪಕ್ಷಪಾತ

ಕೋಡ್ ಬರೆಯುತ್ತಾರೆ; ನೀವು ನಿರ್ಧರಿಸಿ

ಸರಾಸರಿ/ಮಧ್ಯಮ ನಿಯೋಜನೆ

ತ್ವರಿತ ಪ್ರಾಥಮಿಕ ವಿಶ್ಲೇಷಣೆ

ವ್ಯತ್ಯಾಸವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ಸಂಬಂಧವನ್ನು ಮರೆಮಾಡುತ್ತದೆ

ಇದು ಸುಲಭ ಆದರೆ ಅದನ್ನು ಶಿಫಾರಸು ಮಾಡುವುದಿಲ್ಲ; ಎಚ್ಚರಿಸಬೇಕು

ಬಹು ನಿಯೋಜನೆ (MI)

MAR, ಪ್ರಮುಖ ಅಸ್ಥಿರಗಳು

ಸರಿಯಾಗಿ ಸ್ಥಾಪಿಸದಿದ್ದರೆ ಅದು ತಪ್ಪುದಾರಿಗೆಳೆಯುತ್ತದೆ

ಕೋಡ್ ಮತ್ತು ಪ್ಯಾಕೇಜ್ ಅನ್ನು ಶಿಫಾರಸು ಮಾಡುತ್ತದೆ (ಇಲಿಗಳು)

ಮೆಕ್ಯಾನಿಸಂ ಮಾಡೆಲಿಂಗ್

MNAR

ಸಂಕೀರ್ಣ, ಊಹೆ-ತೀವ್ರ

ಡ್ರಾಫ್ಟ್ ಮಾತ್ರ; ತಜ್ಞ ಅಗತ್ಯವಿದೆ

ನಕಲಿಸಬಹುದಾದ ನಾಲ್ಕು ಪ್ರಾಂಪ್ಟ್‌ಗಳು

1. ಡೇಟಾ ಪ್ರೊಫೈಲಿಂಗ್:

ನಿಮ್ಮ ಪಾತ್ರ: ಡೇಟಾ ಶುದ್ಧೀಕರಣ ಸಹಾಯಕ. ನಾನು ಡೇಟಾವನ್ನು ಹಂಚಿಕೊಳ್ಳುವುದಿಲ್ಲ, ನನಗೆ R ಕೋಡ್ ಬೇಕು. ನನ್ನ ಬಳಿ 'ಅಂಕಿ' ಎಂಬ ಡೇಟಾ.ಫ್ರೇಮ್ ಇದೆ; ಅಸ್ಥಿರಗಳು: ಐಡಿ, ವಯಸ್ಸು (ಸಂಖ್ಯೆ), ಆದಾಯ (ಸಂಖ್ಯಾಶಾಸ್ತ್ರ), ಶಿಕ್ಷಣ (ವರ್ಗೀಕರಣ), ಪ್ರದೇಶ (ವರ್ಗೀಕರಣ), ದಿನಾಂಕ (ದಿನಾಂಕ). ಕಾರ್ಯ: ಪ್ರತಿ ವೇರಿಯಬಲ್‌ಗೆ ಪ್ರಕಾರ, ಕಾಣೆಯಾದ ಸಂಖ್ಯೆ ಮತ್ತು ದರವನ್ನು ಉತ್ಪಾದಿಸುವ ಕೋಡ್ ಬರೆಯಿರಿ, ಸಂಖ್ಯಾವಾಚಕಗಳಿಗೆ ಸಾರಾಂಶ ಅಂಕಿಅಂಶಗಳು ಮತ್ತು ವರ್ಗೀಯ ಪದಗಳಿಗೆ ಆವರ್ತನ ಕೋಷ್ಟಕ. ಕಾಮೆಂಟ್ ಲೈನ್ ಸೇರಿಸಿ.

2. ಕಾಣೆಯಾದ ಡೇಟಾ ರೋಗನಿರ್ಣಯ:

ಮೇಲಿನ 'ಅಂಕಿಯ' ಡೇಟಾಗಾಗಿ ಕಾಣೆಯಾದ ನಮೂನೆಯನ್ನು ಪರೀಕ್ಷಿಸುವ ಕೋಡ್ ಬರೆಯಿರಿ: - ಪ್ರತಿ ವೇರಿಯಬಲ್‌ನ ಕಾಣೆಯಾದ ದರ, - ಇತರ ವೇರಿಯಬಲ್‌ಗಳಿಗೆ ಕಾಣೆಯಾಗಿರುವ ಸಂಬಂಧವನ್ನು ತೋರಿಸುವ ಸರಳ ಕೋಷ್ಟಕ/ಗ್ರಾಫ್. ನಾನು ಕೋಡ್‌ನ ಔಟ್‌ಪುಟ್ ಅನ್ನು ನೋಡುತ್ತೇನೆ ಮತ್ತು MCAR/MAR/MNAR ವ್ಯತ್ಯಾಸವನ್ನು ಮಾಡುತ್ತೇನೆ; ನೀವು ಕೇವಲ ರೋಗನಿರ್ಣಯದ ಸಾಧನವನ್ನು ತಯಾರಿಸುತ್ತೀರಿ, ನಿಯೋಜನೆ ವಿಧಾನವನ್ನು ನಿರ್ಧರಿಸಬೇಡಿ.

3. ಹೊರಗಿನ ತಪಾಸಣೆ (ಅಳಿಸುವಿಕೆ ಅಲ್ಲ):

ವೇರಿಯೇಬಲ್ 'ಆದಾಯ' ಗಾಗಿ ಕೋಡ್ ಬರೆಯಿರಿ ಅದು ಅಳಿಸದೆಯೇ ಔಟ್‌ಲೈಯರ್‌ಗಳನ್ನು ಪರಿಶೀಲಿಸುತ್ತದೆ: ಬಾಕ್ಸ್‌ಪ್ಲಾಟ್, IQR-ಆಧಾರಿತ ಬೌಂಡ್‌ಗಳು ಮತ್ತು ಟೇಬಲ್ ಲಿಸ್ಟಿಂಗ್ ಔಟ್‌ಲೈಯರ್ ಅವಲೋಕನಗಳು + ಮೌಲ್ಯಗಳು. ಇವು ತಪ್ಪುಗಳು ಅಥವಾ ನಿಜವೇ ಎಂದು ನಾನು ನೋಡುತ್ತೇನೆ. ಸ್ವಯಂಚಾಲಿತ ಅಳಿಸುವಿಕೆಯನ್ನು ಸೇರಿಸಿ.

4. ಕೋಡಿಂಗ್ ಪ್ರಮಾಣೀಕರಣ:

'ಶಿಕ್ಷಣ' ವೇರಿಯೇಬಲ್‌ನಲ್ಲಿ, ಮೌಲ್ಯಗಳನ್ನು ಮಿಶ್ರವಾಗಿ ಬರೆಯಲಾಗಿದೆ: "ಪ್ರಾಥಮಿಕ ಶಾಲೆ", "ಪ್ರಾಥಮಿಕ ಶಾಲೆ", "ಪ್ರಾಥಮಿಕ", "ಪ್ರೌಢಶಾಲೆ", "ಪ್ರೌಢಶಾಲೆ", "ವಿಶ್ವವಿದ್ಯಾಲಯ", "ವಿಶ್ವವಿದ್ಯಾಲಯ". ಇವುಗಳನ್ನು ಸ್ಥಿರವಾದ ವರ್ಗಗಳಾಗಿ ಮರುಸಂಕೇತಿಸುವ R ಕೋಡ್ ಬರೆಯಿರಿ; ಮ್ಯಾಪಿಂಗ್ ಟೇಬಲ್ ಅನ್ನು ಸ್ಪಷ್ಟವಾಗಿ ತೋರಿಸಿ ಇದರಿಂದ ನಾನು ಪ್ರತಿ ಪರಿವರ್ತನೆಯನ್ನು ದೃಢೀಕರಿಸಬಹುದು. ನೀವು ಗುರುತಿಸದ ಮೌಲ್ಯವನ್ನು "ಅಜ್ಞಾತ" ಎಂದು ಹೊಂದಿಸಿ.

ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್ / ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್

ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್:

ಡೇಟಾವನ್ನು ಸ್ವಚ್ಛಗೊಳಿಸಿ, ಅಂತರವನ್ನು ಭರ್ತಿ ಮಾಡಿ, ಹೊರಗಿರುವವರನ್ನು ತಿರಸ್ಕರಿಸಿ.

ಈ ಬೇಡಿಕೆ ಅಪಾಯಕಾರಿ: ಇದು AI ಗೆ ಕುರುಡು ಅಧಿಕಾರವನ್ನು ನೀಡುತ್ತದೆ. ಯಾವ ರೀತಿಯ ಕಾಣೆಯಾಗಿದೆ, ಯಾವ ರೀತಿಯ ಭರ್ತಿ, ಯಾವ ವಿರೋಧಾತ್ಮಕ ಸತ್ಯ - ಯಾವುದೂ ಸ್ಪಷ್ಟವಾಗಿಲ್ಲ. ಫಲಿತಾಂಶವು ರಹಸ್ಯವಾಗಿ ಪಕ್ಷಪಾತದ ಡೇಟಾ ಸೆಟ್ ಆಗಿರಬಹುದು.

ಶಕ್ತಿಯುತ ಪ್ರಾಂಪ್ಟ್:

ನಿಮ್ಮ ಪಾತ್ರ: ಸ್ವಚ್ಛಗೊಳಿಸುವ ಸಹಾಯಕ, ನೀವು ನಿರ್ಧಾರ ತೆಗೆದುಕೊಳ್ಳುವವರಲ್ಲ. ಹಂತ ಹಂತವಾಗಿ ಹೋಗಿ ಮತ್ತು ಪ್ರತಿ ಹಂತದ ಪ್ರಭಾವವನ್ನು ವರದಿ ಮಾಡುವ ಕೋಡ್ ಅನ್ನು ಬರೆಯಿರಿ: 1) ಕಾಣೆಯಾದ ಪ್ಯಾಟರ್ನ್ ಅನ್ನು ತೋರಿಸಿ (ಅಳಿಸಬೇಡಿ/ಭರ್ತಿ ಮಾಡಬೇಡಿ), 2) ಔಟ್‌ಲೈಯರ್ ಅಭ್ಯರ್ಥಿಗಳನ್ನು ಪಟ್ಟಿ ಮಾಡಿ (ಅಳಿಸಬೇಡಿ), 3) ಮ್ಯಾಪಿಂಗ್ ಟೇಬಲ್‌ನೊಂದಿಗೆ ವರ್ಗದ ಅಸಂಗತತೆಗಳನ್ನು ಸರಿಪಡಿಸಿ. ಪ್ರತಿ ಹಂತದ ನಂತರ ಸಾಲು ಎಣಿಕೆ ಮತ್ತು ಸಾರಾಂಶ ಅಂಕಿಅಂಶವನ್ನು ಮುದ್ರಿಸಿ ಇದರಿಂದ ನಾನು ಬದಲಾವಣೆಯನ್ನು ನೋಡಬಹುದು ಮತ್ತು ದೃಢೀಕರಿಸಬಹುದು. ಸ್ವಯಂಚಾಲಿತ ನಿಯೋಜನೆ/ಅಳಿಸುವಿಕೆ ಅಳವಡಿಕೆ.

ವ್ಯತ್ಯಾಸವು ಸ್ಪಷ್ಟವಾಗಿದೆ: ಬಲವಾದ ಇಚ್ಛೆಯು AI ಅನ್ನು ಮೇಲ್ವಿಚಾರಣೆಯ ಸಹಾಯಕರಾಗಿ ಇರಿಸುತ್ತದೆ, ಹಿಂತಿರುಗಿಸಬಹುದಾದ ಮತ್ತು ದಾಖಲಿತ ಹಂತಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ.

ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು

ಪ್ರಕರಣ 1 - ಸರಾಸರಿ ನಿಯೋಜನೆ ಬಲೆ. 5,000 ಜನರಿಗೆ ಒಬ್ಬ ವಿಶ್ಲೇಷಕರ ಆದಾಯದ ಮಾಹಿತಿಯು 18% ನಷ್ಟು ಕಾಣೆಯಾಗಿದೆ. ಅವರು AI ಗೆ "ಅಂತರವನ್ನು ತುಂಬಲು" ಹೇಳಿದರು; AI ಅವೆಲ್ಲವನ್ನೂ ಸರಾಸರಿ ಮಾಡಿದೆ. ಫಲಿತಾಂಶ: ಆದಾಯದ ವ್ಯತ್ಯಾಸವು 22% ರಷ್ಟು ಕಡಿಮೆಯಾಗಿದೆ ಮತ್ತು ಶಿಕ್ಷಣ-ಆದಾಯ ಸಂಬಂಧದ ಗುಣಾಂಕವು ಅದಕ್ಕಿಂತ ದುರ್ಬಲವಾಗಿದೆ. ಸರಿಯಾದ ಮಾರ್ಗ: ಕೊರತೆಯು MAR ಆಗಿತ್ತು (ಶಿಕ್ಷಣದ ಕಾರಣದಿಂದಾಗಿ), ಬಹು ನಿಯೋಜನೆ (ಇಲಿಗಳು) ಮೂಲಕ ತುಂಬಬೇಕಾಗಿತ್ತು. ಪಾಠ: ಭರ್ತಿ ಮಾಡುವ ವಿಧಾನವು ಕಾರ್ಯವಿಧಾನವನ್ನು ಅವಲಂಬಿಸಿರುತ್ತದೆ.

ಪ್ರಕರಣ 2 - ಔಟ್ಲೈಯರ್ ಕ್ಲೀನಿಂಗ್ ಅನ್ವೇಷಣೆಯನ್ನು ಹಿಮ್ಮುಖಗೊಳಿಸುತ್ತದೆ. ಒಂದು ಸಂಸ್ಥೆಯ ಡೇಟಾದಲ್ಲಿ 3 ದೊಡ್ಡ ಸಂಸ್ಥೆಗಳು (ಒಟ್ಟು ವೀಕ್ಷಣೆಯ 0.6%) ಇದ್ದವು. AI ಯ "ಸ್ವಚ್ಛಗೊಳಿಸುವ" ಸಲಹೆಯಿಂದ ಇವುಗಳನ್ನು ಅಳಿಸಲಾಗಿದೆ; ಪ್ರಮಾಣದ ಗುಣಾಂಕದ ಆರ್ಥಿಕತೆಯು ಧನಾತ್ಮಕದಿಂದ ಋಣಾತ್ಮಕವಾಗಿ ತಿರುಗಿತು. ಆದಾಗ್ಯೂ, ಆ 3 ಕಂಪನಿಗಳು ನೈಜ ಮತ್ತು ಉದ್ಯಮದ ಪ್ರಮುಖ ಭಾಗವಾಗಿತ್ತು. ಅಳಿಸುವ ಬದಲು ಪೂರ್ಣ ಮತ್ತು ದೃಢವಾದ ಅಂದಾಜಿನೊಂದಿಗೆ ವರದಿ ಮಾಡುವುದು ಸರಿಯಾದ ಮಾರ್ಗವಾಗಿದೆ. ಪಾಠ: ನಿಜವಾದ ಔಟ್ಲೈಯರ್ಗಳು ಡೇಟಾ, ಶಬ್ದವಲ್ಲ.

ಪ್ರಕರಣ 3 - ಸೈಲೆಂಟ್ ಕೋಡಿಂಗ್ ದೋಷ. ಒಂದು ಪ್ಯಾನೆಲ್‌ನಲ್ಲಿ, ದಿನಾಂಕ ವೇರಿಯಬಲ್ ಎರಡು ವಿಭಿನ್ನ ಸ್ವರೂಪಗಳಲ್ಲಿ ಬಂದಿದೆ ("2020-03-01" ಮತ್ತು "01/03/2020"). AI ನಿರ್ಮಿಸಿದ ಸಂಯೋಜನೆಯ ಕೋಡ್ ಅವುಗಳನ್ನು ವಿಭಿನ್ನ ಮೌಲ್ಯಗಳಿಗೆ ತಪ್ಪಾಗಿ ಗ್ರಹಿಸಿದಾಗ, 1,400 ಅವಲೋಕನಗಳು ಹೊಂದಿಕೆಯಾಗಲಿಲ್ಲ ಮತ್ತು ಬೆಳವಣಿಗೆಯ ದರಗಳು ಹಾಸ್ಯಾಸ್ಪದವಾಗಿವೆ. ವಿಶ್ಲೇಷಕರು ಸಾಲು ಎಣಿಕೆಯನ್ನು ಪರಿಶೀಲಿಸದಿದ್ದರೂ ಪರವಾಗಿಲ್ಲ. ಪಾಠ: ಪ್ರತಿ ಹಂತದ ನಂತರ ವೀಕ್ಷಣಾ ಎಣಿಕೆಗಳು ಮತ್ತು ವಿವೇಕ ತಪಾಸಣೆಗಳು ಅತ್ಯಗತ್ಯ.

ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು

  • ಕುರುಡಾಗಿ ಅಂತರವನ್ನು ಸರಾಸರಿಯೊಂದಿಗೆ ತುಂಬುವುದು. ಇದು ವ್ಯತ್ಯಾಸವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ಅನಿಶ್ಚಿತತೆಯನ್ನು ಮರೆಮಾಡುತ್ತದೆ ಮತ್ತು MAR/MNAR ನಲ್ಲಿ ಪಕ್ಷಪಾತವನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ. ಮೊದಲು ಯಾಂತ್ರಿಕತೆಯನ್ನು ವರ್ಗೀಕರಿಸಿ.
  • "ಏಕೆಂದರೆ ಅದು ತೊಂದರೆ ಕೊಡುತ್ತದೆ" ಎಂದು ಔಟ್ಲೈಯರ್ ಅನ್ನು ಅಳಿಸುವುದು. ನಿಜವಾದ ಔಟ್ಲೈಯರ್ಗಳು ಡೇಟಾವನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತವೆ; ಅಳಿಸುವಿಕೆಯು ಫಲಿತಾಂಶವನ್ನು ಬಗ್ಗಿಸುತ್ತದೆ. ತಪ್ಪಿದ್ದನ್ನು ಸರಿಪಡಿಸಿ, ನಿಜವಾಗಿರುವುದನ್ನು ಉಳಿಸಿಕೊಳ್ಳಿ.
  • ಕಚ್ಚಾ ಡೇಟಾವನ್ನು ಟ್ಯಾಪ್ ಮಾಡಲಾಗುತ್ತಿದೆ. ಕಚ್ಚಾ ಡೇಟಾವನ್ನು ಎಂದಿಗೂ ಮಾರ್ಪಡಿಸಬೇಡಿ; ಕೋಡ್‌ನೊಂದಿಗೆ ಎಲ್ಲಾ ಕ್ಲೀನ್‌ಅಪ್ ಅನ್ನು ಪ್ರತ್ಯೇಕ ನಕಲಿನಲ್ಲಿ ಮಾಡಿ ಆದ್ದರಿಂದ ಅದನ್ನು ಹಿಂತಿರುಗಿಸಬಹುದು.
  • ಹಂತಗಳ ಪ್ರಭಾವವನ್ನು ಅಳೆಯುತ್ತಿಲ್ಲ. ಪ್ರತಿ ಹಂತದ ನಂತರ ಸಾಲು ಎಣಿಕೆ ಮತ್ತು ಸಾರಾಂಶ ಅಂಕಿಅಂಶಗಳನ್ನು ಪರಿಶೀಲಿಸದಿದ್ದರೆ, ಮೂಕ ದೋಷಗಳು ಸಂಗ್ರಹಗೊಳ್ಳುತ್ತವೆ.
  • ಪರಿಣಾಮವಾಗಿ ಸ್ವಚ್ಛಗೊಳಿಸುವಿಕೆ. "ನೀವು ಈ ಸಾಲನ್ನು ಸೇರಿಸಿದಾಗ, ಫಲಿತಾಂಶವು ಉತ್ತಮಗೊಳ್ಳುತ್ತದೆ" ಎಂಬ ತರ್ಕವು p-ಹ್ಯಾಕಿಂಗ್ ಆಗಿದೆ; ವಿಶ್ಲೇಷಣೆಯ ಫಲಿತಾಂಶದ ಮೊದಲು ಮತ್ತು ಸ್ವತಂತ್ರವಾಗಿ ಸ್ವಚ್ಛಗೊಳಿಸುವಿಕೆಯನ್ನು ಯೋಜಿಸಬೇಕು.
ಸಲಹೆ: ಸ್ವಚ್ಛಗೊಳಿಸುವ ಮೊದಲು ಮತ್ತು ನಂತರ ಅದೇ ಮೂಲ ಅಂಕಿಅಂಶಗಳನ್ನು (ಸರಾಸರಿ, ಸರಾಸರಿ, ವೀಕ್ಷಣೆಗಳ ಸಂಖ್ಯೆ, ಕೆಲವು ಪರಸ್ಪರ ಸಂಬಂಧಗಳು) ಪಕ್ಕದಲ್ಲಿ ಇರಿಸುವ "ಮೊದಲು/ನಂತರ" ಟೇಬಲ್ ಅನ್ನು ಇರಿಸಿ. ಅನಿರೀಕ್ಷಿತ ಜಂಪ್ ಗುಪ್ತ ದೋಷದ ಅತ್ಯುತ್ತಮ ಮುಂಚೂಣಿಯಲ್ಲಿದೆ.

ಸಾರಾಂಶದಲ್ಲಿ

ಡೇಟಾ ಶುಚಿಗೊಳಿಸುವಿಕೆಯು ಪ್ರಾಯೋಗಿಕ ಕೆಲಸದ ಅತ್ಯಂತ ಸಮಯ ತೆಗೆದುಕೊಳ್ಳುವ ಮತ್ತು ನಿರ್ಧಾರ-ಅಗತ್ಯವಿರುವ ಹಂತವಾಗಿದೆ. AI ಇದರಲ್ಲಿ ಶಕ್ತಿಯುತವಾದ ಕೋಡ್ ಜನರೇಟರ್ ಆಗಿದೆ, ಆದರೆ ಇದು ಶಾಟ್‌ಗಳನ್ನು ಕರೆಯಲು ಸಾಧ್ಯವಿಲ್ಲ: ನೀವು ಕಾಣೆಯಾದ ಡೇಟಾ ಪ್ರಕಾರವನ್ನು (MCAR/MAR/MNAR) ವರ್ಗೀಕರಿಸಿ, ಔಟ್‌ಲೈಯರ್ ದೋಷ ಅಥವಾ ನಿಜವೇ ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸಿ, ಪ್ರತಿ ಹಂತವನ್ನು ಹಿಂತಿರುಗಿಸುವಂತೆ ಮತ್ತು ದಾಖಲಿಸಲಾಗಿದೆ. AI ಕುರುಡು "ಸ್ಪಷ್ಟ" ಅಧಿಕಾರವನ್ನು ನೀಡುವ ಬದಲು, ಹಂತ-ಹಂತದ ಕೆಲಸದ ಹರಿವನ್ನು ಸ್ಥಾಪಿಸಿ, ಅದರ ಪರಿಣಾಮವನ್ನು ಅಳೆಯಲಾಗುತ್ತದೆ ಮತ್ತು ಮೌಲ್ಯೀಕರಿಸಲಾಗುತ್ತದೆ. ಪ್ರತಿ ಹಂತದ ನಂತರ ಅವಲೋಕನಗಳ ಸಂಖ್ಯೆ ಮತ್ತು ಸಾರಾಂಶ ಅಂಕಿಅಂಶಗಳನ್ನು ಪರಿಶೀಲಿಸುವುದು ಮೂಕ ದೋಷಗಳಿಗೆ ಉತ್ತಮ ಪ್ರತಿವಿಷವಾಗಿದೆ.

ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ

ಡೇಟಾ ಸೆಟ್‌ನಲ್ಲಿ (ನಿಮ್ಮ ಸ್ವಂತ ಡೇಟಾ ಅಥವಾ ಮಾದರಿ ಸೆಟ್) ಕಾಣೆಯಾದ ಮತ್ತು ಔಟ್‌ಲೈಯರ್‌ಗಳನ್ನು ಒಳಗೊಂಡಿರುವ ಕನಿಷ್ಠ ಎರಡು ವೇರಿಯಬಲ್‌ಗಳನ್ನು ಆಯ್ಕೆಮಾಡಿ. ಮೇಲಿನ "ಹಂತ ಹಂತವಾಗಿ, ಅಳಿಸಬೇಡಿ/ಭರ್ತಿ ಮಾಡಬೇಡಿ" ಪ್ರಾಂಪ್ಟ್ ಮೂಲಕ AI ನಿಂದ ಡಯಾಗ್ನೋಸ್ಟಿಕ್ ಕೋಡ್ ಅನ್ನು ವಿನಂತಿಸಿ ಮತ್ತು ಅದನ್ನು ರನ್ ಮಾಡಿ. ಕೊರತೆಯನ್ನು MCAR/MAR/MNAR ಎಂದು ವರ್ಗೀಕರಿಸಿ ಮತ್ತು ನಿಮ್ಮ ಸಮರ್ಥನೆಯನ್ನು ಒಂದೇ ವಾಕ್ಯದಲ್ಲಿ ಬರೆಯಿರಿ. ವ್ಯತಿರಿಕ್ತ ಅಭ್ಯರ್ಥಿಗಳನ್ನು ಒಂದೊಂದಾಗಿ ಪರೀಕ್ಷಿಸಿ ಮತ್ತು ಯಾವುದು ತಪ್ಪು ಮತ್ತು ಯಾವುದು ನಿಜ ಎಂದು ನಿರ್ಧರಿಸಿ. ಅಂತಿಮವಾಗಿ, ಸ್ವಚ್ಛಗೊಳಿಸುವ ಮೊದಲು/ನಂತರ "ಮೊದಲು-ನಂತರ" ಟೇಬಲ್ ಅನ್ನು ತಯಾರಿಸಿ ಮತ್ತು ಯಾವುದೇ ಅನಿರೀಕ್ಷಿತ ಬದಲಾವಣೆಗಳಿದ್ದರೆ ವರದಿ ಮಾಡಿ.

ಪರಿಶೀಲನಾಪಟ್ಟಿ

  • [ ] ನಾನು ಕಚ್ಚಾ ಡೇಟಾವನ್ನು ಬದಲಾಯಿಸದೆ ಪ್ರತ್ಯೇಕ ಪ್ರತಿಯಲ್ಲಿ ಸ್ವಚ್ಛಗೊಳಿಸಿದೆ.
  • [ ] ನಾನು ಕೊರತೆಯನ್ನು MCAR/MAR/MNAR ಎಂದು ವರ್ಗೀಕರಿಸಿದ್ದೇನೆ ಮತ್ತು ಅದಕ್ಕೆ ಅನುಗುಣವಾಗಿ ವಿಧಾನವನ್ನು ಆರಿಸಿಕೊಂಡಿದ್ದೇನೆ.
  • [ ] ನಾನು ಹೊರಗಿರುವವರನ್ನು ಒಂದೊಂದಾಗಿ ಅವು ದೋಷಗಳು ಅಥವಾ ನಿಜವೇ ಎಂದು ಪರಿಶೀಲಿಸಿದೆ; ನಾನು ಅದನ್ನು ಕುರುಡಾಗಿ ಅಳಿಸಿಲ್ಲ.
  • [ ] ನಾನು ಪ್ರತಿ ಶುಚಿಗೊಳಿಸುವ ಹಂತದ ನಂತರ ವೀಕ್ಷಣೆಗಳ ಸಂಖ್ಯೆ ಮತ್ತು ಸಾರಾಂಶ ಅಂಕಿಅಂಶಗಳನ್ನು ಪರಿಶೀಲಿಸಿದ್ದೇನೆ.
  • [ ] ನಾನು ಎಲ್ಲಾ ಹಂತಗಳನ್ನು ಕೋಡ್ ಮತ್ತು ಕಾಮೆಂಟ್ ಲೈನ್‌ನೊಂದಿಗೆ ದಾಖಲಿಸಿದ್ದೇನೆ; ಹಿಂತಿರುಗಿಸಬಹುದಾದ.
  • [ ] ನಾನು ದತ್ತಾಂಶವನ್ನು ಉತ್ಪಾದಿಸುವ ಪ್ರಕ್ರಿಯೆಯ ಜ್ಞಾನದ ಮೇಲೆ ಸ್ವಚ್ಛಗೊಳಿಸುವಿಕೆಯನ್ನು ಆಧರಿಸಿದೆ, ವಿಶ್ಲೇಷಣೆಯ ಫಲಿತಾಂಶದ ಮೇಲೆ ಅಲ್ಲ.