ಲಾಭಗಳು:
- ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳ ಕಾರಣವನ್ನು ಪ್ರತ್ಯೇಕಿಸುವ ಸಾಮರ್ಥ್ಯ (ಯಾದೃಚ್ಛಿಕ, ವ್ಯವಸ್ಥಿತ, ಅರ್ಥಪೂರ್ಣ) ಮತ್ತು ಸೂಕ್ತವಾದ ತಂತ್ರವನ್ನು ಆರಿಸಿ ಮತ್ತು ತರಬೇತಿಯಿಂದ ಮಾತ್ರ ಭರ್ತಿ ಮೌಲ್ಯವನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡಿ
- ಅವುಗಳನ್ನು ಅಳಿಸುವ ಮೊದಲು ಔಟ್ಲೈಯರ್ಗಳನ್ನು ಪರೀಕ್ಷಿಸುವ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ಡೇಟಾ ದೋಷ ಮತ್ತು ನಿಜವಾದ ಅಪರೂಪದ ಘಟನೆಯ ನಡುವೆ ವ್ಯತ್ಯಾಸ
- ಗುಣಮಟ್ಟಕ್ಕೆ ಪ್ರಕಾರ ಮತ್ತು ಸ್ವರೂಪದ ಅಸಂಗತತೆಯನ್ನು ತರುವಾಗ ಸಾಲುಗಳು/ಖಾಲಿಗಳ ಸಂಖ್ಯೆಯ ಮೇಲೆ ಪ್ರತಿ ಹಂತದ ಪ್ರಭಾವವನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡುವ ಮೂಲಕ ಮೌನ ನಷ್ಟವನ್ನು ತಡೆಯುವ ಸಾಮರ್ಥ್ಯ
ಸುಮಾರು 60-80 ಪ್ರತಿಶತ ದತ್ತಾಂಶ ವಿಜ್ಞಾನಿಯ ಸಮಯವು ಸ್ವಚ್ಛಗೊಳಿಸಲು ಹೋಗುತ್ತದೆ; ಉದ್ಯಮದಲ್ಲಿ, ಇದನ್ನು ಅರ್ಧ ತಮಾಷೆಯಾಗಿ "ಡೇಟಾ ವ್ರಾಂಗ್ಲಿಂಗ್" (ಡೇಟಾ ರಾಂಗ್ಲಿಂಗ್ ಅಥವಾ ಡೇಟಾ ಕ್ಲೀನಿಂಗ್) ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ. ಏಕೆಂದರೆ ನೈಜ-ಪ್ರಪಂಚದ ಡೇಟಾವು ಎಂದಿಗೂ ವಿಶ್ಲೇಷಣೆಗೆ ಸಿದ್ಧವಾಗುವುದಿಲ್ಲ: ದಿನಾಂಕಗಳು ಮಿಶ್ರ ಸ್ವರೂಪಗಳಲ್ಲಿವೆ, ಸಂಖ್ಯೆಗಳನ್ನು ಪಠ್ಯವಾಗಿ ಸಂಗ್ರಹಿಸಲಾಗುತ್ತದೆ, ಕೆಲವು ಕೋಶಗಳು ಖಾಲಿಯಾಗಿರುತ್ತವೆ, ಗ್ರಾಹಕರು ಒಂದೇ ಕೋಷ್ಟಕದಲ್ಲಿ ಎರಡು ವಿಭಿನ್ನ ಕಾಗುಣಿತಗಳೊಂದಿಗೆ ಮೂರು ಬಾರಿ ಕಾಣಿಸಿಕೊಳ್ಳುತ್ತಾರೆ. ಈ ಘಟಕದಲ್ಲಿ ನಾವು ಶುದ್ಧೀಕರಣದ ಮೂರು ಮೂಲಭೂತ ಅಂಶಗಳನ್ನು ಒಳಗೊಳ್ಳುತ್ತೇವೆ: ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳು, ಔಟ್ಲೈಯರ್ಗಳು ಮತ್ತು ಪ್ರಕಾರ/ಫಾರ್ಮ್ಯಾಟ್ ಪರಿವರ್ತನೆ. ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ ಈ ಕೆಲಸದಲ್ಲಿ ಅಸಾಧಾರಣ ವೇಗದ ಸಹಾಯಕ; ಆದರೆ ನೀವು ಏನು ಸ್ವಚ್ಛಗೊಳಿಸಬೇಕು ಮತ್ತು ಹೇಗೆ ನಿರ್ಧರಿಸುತ್ತೀರಿ, ಏಕೆಂದರೆ ಪ್ರತಿ ಶುಚಿಗೊಳಿಸುವ ಆಯ್ಕೆಯು ವಿಶ್ಲೇಷಣೆಯನ್ನು ಬದಲಾಯಿಸುತ್ತದೆ.
ಶುಚಿಗೊಳಿಸುವ ಸುವರ್ಣ ನಿಯಮ: ಪ್ರತಿ ಬದಲಾವಣೆಯು ನಿರ್ಧಾರವಾಗಿದೆ
ಕೋಶವನ್ನು ಅಳಿಸುವುದು, ಕಾಣೆಯಾದ ಮೌಲ್ಯವನ್ನು ಸರಾಸರಿಯೊಂದಿಗೆ ತುಂಬುವುದು, ಹೊರಗುತ್ತಿಗೆಯನ್ನು ಟ್ರಿಮ್ ಮಾಡುವುದು-ಇವುಗಳಲ್ಲಿ ಯಾವುದೂ "ತಟಸ್ಥ" ಕಾರ್ಯಾಚರಣೆಗಳಲ್ಲ. ಪ್ರತಿಯೊಂದೂ ಡೇಟಾವನ್ನು ಬದಲಾಯಿಸುತ್ತದೆ ಮತ್ತು ಫಲಿತಾಂಶದ ಮೇಲೆ ಪರಿಣಾಮ ಬೀರುತ್ತದೆ. ಆದ್ದರಿಂದ ಶುದ್ಧೀಕರಣದ ಸುವರ್ಣ ನಿಯಮ: ಪ್ರತಿ ಬದಲಾವಣೆಯನ್ನು ಕೋಡ್ನಲ್ಲಿ ಬರೆಯಿರಿ, ತಾರ್ಕಿಕತೆಯನ್ನು ಗಮನಿಸಿ, ಮೂಲ ಡೇಟಾವನ್ನು ಎಂದಿಗೂ ತಿದ್ದಿ ಬರೆಯಬೇಡಿ. AI ನಿಮಗೆ ತ್ವರಿತ ಕ್ಲೀನಪ್ ಕೋಡ್ ನೀಡುತ್ತದೆ, ಆದರೆ ಆ ಕೋಡ್ ಏನು ಮಾಡುತ್ತದೆ ಎಂಬುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು ನಿಮ್ಮ ಜವಾಬ್ದಾರಿಯಾಗಿದೆ; "ಖಾಲಿ ಸಾಲುಗಳನ್ನು ಅಳಿಸಿ" ಎಂದು ನೀವು ಹೇಳಿದಾಗ ಎಷ್ಟು ಸಾಲುಗಳು ಹೋಗಿವೆ ಎಂದು ನೋಡದೆ ಅದನ್ನು ಚಲಾಯಿಸಬೇಡಿ.
ಎಚ್ಚರಿಕೆ: ಮೂಲ ಕಚ್ಚಾ ಡೇಟಾವನ್ನು ಎಂದಿಗೂ ಮಾರ್ಪಡಿಸಬೇಡಿ. ಸ್ವಚ್ಛಗೊಳಿಸಿದ ಆವೃತ್ತಿಯನ್ನು ಪ್ರತ್ಯೇಕ ಫೈಲ್/ಟೇಬಲ್ಗೆ ಬರೆಯಿರಿ. ಈ ರೀತಿಯಾಗಿ, ನೀವು ದೋಷವನ್ನು ಗುರುತಿಸಿದರೆ, ನೀವು ಚದರ ಒಂದಕ್ಕೆ ಹಿಂತಿರುಗಬಹುದು ಮತ್ತು ಪುನರುತ್ಪಾದನೆಯನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳಬಹುದು.
ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳು: ಅದು ಏಕೆ ಖಾಲಿಯಾಗಿದೆ, ಏನು ಮಾಡಬೇಕು
ಕಾಣೆಯಾದ ಮೌಲ್ಯವು (ಸಾಮಾನ್ಯವಾಗಿ NaN ಆಗಿ ಕಾಣಿಸಿಕೊಳ್ಳುತ್ತದೆ - ಪಾಂಡಾಗಳಲ್ಲಿ "ಸಂಖ್ಯೆಯಲ್ಲ") ಕೋಶವು ಖಾಲಿಯಾಗಿದ್ದಾಗ. ಆದರೆ ಅಂತರದ ಕಾರಣವು ಪರಿಹಾರವನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ. ಮೂರು ವಿಶಿಷ್ಟ ಸನ್ನಿವೇಶಗಳಿವೆ. ಯಾದೃಚ್ಛಿಕ ಕಾಣೆಯಾಗಿದೆ: ಸಂವೇದಕ ಒಂದು ಕ್ಷಣ ಕೆಲಸ ಮಾಡಲಿಲ್ಲ; ಅದನ್ನು ಭರ್ತಿ ಮಾಡುವುದು ಸಮಂಜಸವಾಗಿರಬಹುದು. ವ್ಯವಸ್ಥಿತವಾಗಿ ಕಾಣೆಯಾಗಿದೆ: ಫಾರ್ಮ್ ಕ್ಷೇತ್ರವನ್ನು ಕೆಲವು ಗ್ರಾಹಕರಿಗೆ ಮಾತ್ರ ಕೇಳಲಾಗುತ್ತದೆ; ಇಲ್ಲಿ ಅಂತರವು ವಾಸ್ತವವಾಗಿ ಮಾಹಿತಿಯಾಗಿದೆ. ಗಮನಾರ್ಹವಾದ ಕಾಣೆಯಾಗಿದೆ: "ರಿಟರ್ನ್ ದಿನಾಂಕ" ಖಾಲಿಯಾಗಿದ್ದರೆ, ಗ್ರಾಹಕರು ಹಿಂತಿರುಗಲಿಲ್ಲ; ಈ ಜಾಗವು 0 ಅಥವಾ "ಯಾವುದೂ ಇಲ್ಲ" ಎಂದರ್ಥ, ಅದು ತುಂಬಿಲ್ಲ.
ಪ್ರಮುಖ ತಂತ್ರಗಳು:
ತಂತ್ರ
ಅದು ಯಾವಾಗ ಸೂಕ್ತ?
ಅಪಾಯ
ಸಾಲನ್ನು ಅಳಿಸಿ
ಕಾಣೆಯಾದ ದರವು ತುಂಬಾ ಕಡಿಮೆ (<5%) ಮತ್ತು ಯಾದೃಚ್ಛಿಕವಾಗಿದೆ
ಡೇಟಾ ಮತ್ತು ಪ್ರಾತಿನಿಧ್ಯದ ನಷ್ಟ
ಕಾಲಮ್ ಅನ್ನು ಅಳಿಸಿ
ಹೆಚ್ಚಿನ ಕಾಲಮ್ ಖಾಲಿಯಾಗಿದೆ (>60%)
ಮಾಹಿತಿಯ ನಷ್ಟ
ಸರಾಸರಿ/ಮಧ್ಯಮ ಭರ್ತಿ
ಸಂಖ್ಯಾತ್ಮಕ, ಯಾದೃಚ್ಛಿಕವಾಗಿ ಕಾಣೆಯಾಗಿದೆ
ಇದು ವ್ಯತ್ಯಾಸವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ ಮತ್ತು ವಿತರಣೆಯನ್ನು ವಿರೂಪಗೊಳಿಸುತ್ತದೆ
ವರ್ಗ "ಅಜ್ಞಾತ"
ವರ್ಗೀಯ, ವ್ಯವಸ್ಥಿತವಾಗಿ ಕಾಣೆಯಾಗಿದೆ
ಹೆಚ್ಚುವರಿ ವರ್ಗಗಳನ್ನು ರಚಿಸುತ್ತದೆ
ಮಾದರಿಯೊಂದಿಗೆ ಭವಿಷ್ಯ
ಸಂಕೀರ್ಣ, ಅಮೂಲ್ಯ ಕಾಲಮ್
ಸೋರಿಕೆ ಅಪಾಯ, ಸಂಕೀರ್ಣತೆ
ನಿರ್ಣಾಯಕ ಅಂಶ: ಇಂಪ್ಯುಟೇಶನ್ ಮೌಲ್ಯವನ್ನು ತರಬೇತಿ ಡೇಟಾದಿಂದ ಮಾತ್ರ ಲೆಕ್ಕಹಾಕಬೇಕು ಮತ್ತು ಅದೇ ಮೌಲ್ಯವನ್ನು ಪರೀಕ್ಷಾ ಡೇಟಾಗೆ ಅನ್ವಯಿಸಬೇಕು. ನೀವು ಪರೀಕ್ಷಾ ಡೇಟಾದ ಸರಾಸರಿಯನ್ನು ಸೇರಿಸಿದರೆ, ನೀವು ಸೋರಿಕೆಯನ್ನು ರಚಿಸುತ್ತೀರಿ (ಘಟಕ 10). ಸರಾಸರಿ (ಆರ್ಡಿನಲ್ ಡೇಟಾದ ಮಧ್ಯಮ ಮೌಲ್ಯ) ಅನ್ನು ಸಾಮಾನ್ಯವಾಗಿ ಸರಾಸರಿಗೆ ಆದ್ಯತೆ ನೀಡಲಾಗುತ್ತದೆ ಏಕೆಂದರೆ ಇದು ಸರಾಸರಿಗಿಂತ ಹೊರಗಿನವರಿಗೆ ಹೆಚ್ಚು ದೃಢವಾಗಿರುತ್ತದೆ.
ಹೊರಗಿನವರು: ದೋಷ ಅಥವಾ ನಿಜವೇ?
ಹೊರಗಿನವರು ಎರಡು ವಿಷಯಗಳಲ್ಲಿ ಒಂದಾಗಿರಬಹುದು: ಡೇಟಾ ದೋಷ (ವಯಸ್ಸಿನ ಅಂಕಣದಲ್ಲಿ 999) ಅಥವಾ ನಿಜವಾದ ಆದರೆ ಅಪರೂಪದ ಘಟನೆ (ಗ್ರಾಹಕರ $2 ಮಿಲಿಯನ್ ಆರ್ಡರ್). ಎರಡನ್ನು ಗೊಂದಲಗೊಳಿಸುವುದು ವಿನಾಶಕಾರಿಯಾಗಿದೆ: ನಿಜವಾದ ಔಟ್ಲೈಯರ್ ಅನ್ನು ಅಳಿಸಿ ಮತ್ತು ನೀವು ಪ್ರಮುಖ ಮಾಹಿತಿಯನ್ನು ಎಸೆಯಿರಿ; ನೀವು ತಪ್ಪನ್ನು ಬಿಟ್ಟರೆ, ನಿಮ್ಮ ಸರಾಸರಿಗಳು ಹಾನಿಗೊಳಗಾಗುತ್ತವೆ. ಆದ್ದರಿಂದ, ಅದನ್ನು ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಅಳಿಸಲು ಅಲ್ಲ, ಹೊರಗಿನದನ್ನು ಮೊದಲು ಪರೀಕ್ಷಿಸುವುದು ಅವಶ್ಯಕ.
ಸಾಮಾನ್ಯ ಪತ್ತೆ ವಿಧಾನಗಳು: IQR ವಿಧಾನ (ಇಂಟರ್ಕ್ವಾರ್ಟೈಲ್ ರೇಂಜ್; ಡೇಟಾದ 25% ಮತ್ತು 75% ಕ್ವಿಂಟೈಲ್ಗಳ ನಡುವಿನ ವ್ಯತ್ಯಾಸಕ್ಕಿಂತ 1.5 ಪಟ್ಟು ಹೆಚ್ಚು ಮೌಲ್ಯಗಳನ್ನು ಔಟ್ಲೈಯರ್ಗಳು ಎಂದು ಪರಿಗಣಿಸಲಾಗುತ್ತದೆ) ಮತ್ತು z- ಸ್ಕೋರ್ (ಸರಾಸರಿ ಮೌಲ್ಯದಿಂದ ದೂರವಿರುವ ಪ್ರಮಾಣಿತ ವಿಚಲನಗಳ ಸಂಖ್ಯೆ; ಸಾಮಾನ್ಯವಾಗಿ ಅದು 3 ಕ್ಕಿಂತ ಹೆಚ್ಚಿದ್ದರೆ ಹೊರಗಿದೆ). AI ಈ ಲೆಕ್ಕಾಚಾರಗಳಿಗೆ ಕೋಡ್ ಅನ್ನು ಸೆಕೆಂಡುಗಳಲ್ಲಿ ಬರೆಯುತ್ತದೆ; ಆದರೆ ನೀವು "ಅಳಿಸು" ಎಂದು ಹೇಳುವ ಮೊದಲು, ಆ ಮೌಲ್ಯಗಳು ಯಾವುವು ಎಂಬುದನ್ನು ಪರಿಶೀಲಿಸಿ.
ಟೈಪ್ ಮತ್ತು ಫಾರ್ಮ್ಯಾಟ್ ಪರಿವರ್ತನೆ: ಮೂಕ ದೋಷ ಮೂಲ
ಹೆಚ್ಚಿನ ತಲೆನೋವಿನ ವಿಷಯವೆಂದರೆ ಡೇಟಾ ಪ್ರಕಾರದ ಗೊಂದಲ. "ಮೊತ್ತ" ಕಾಲಮ್ ಅನ್ನು ಪಠ್ಯವಾಗಿ ಸಂಗ್ರಹಿಸಿದ್ದರೆ, ನೀವು ಸೇರಿಸಲಾಗುವುದಿಲ್ಲ; ಪ್ರೋಗ್ರಾಂ "ಒಂದು ಸಾವಿರದ ಇನ್ನೂರ ಐವತ್ತು" ಬದಲಿಗೆ "1,250.50" ನಂತಹ ಟರ್ಕಿಶ್ ಫಾರ್ಮ್ಯಾಟ್ ಮಾಡಿದ ಸಂಖ್ಯೆಯನ್ನು ತಪ್ಪಾಗಿ ಓದುತ್ತದೆ. ದಿನಾಂಕಗಳು ("01/03/2024" ದಿನ-ತಿಂಗಳು ಅಥವಾ ತಿಂಗಳು-ದಿನ?), ವಿಭಾಗಗಳು ("ಪುರುಷ"/"ಪುರುಷ"/"M" ಒಂದೇ ವಿಷಯವೇ?) ಮತ್ತು ಘಟಕಗಳು (TL ಅಥವಾ kuruş?) ಮೌನವಾಗಿ ತಪ್ಪಾದ ಫಲಿತಾಂಶಗಳನ್ನು ನೀಡುತ್ತವೆ. ಸ್ವಚ್ಛಗೊಳಿಸುವ ಒಂದು ದೊಡ್ಡ ಭಾಗವು ಈ ಅಸಂಗತತೆಯನ್ನು ಪ್ರಮಾಣಿತಕ್ಕೆ ಎಳೆಯುತ್ತದೆ: ದಿನಾಂಕಗಳನ್ನು ಒಂದು ಸ್ವರೂಪಕ್ಕೆ, ವರ್ಗಗಳನ್ನು ಒಂದು ಕಾಗುಣಿತಕ್ಕೆ, ಸಂಖ್ಯೆಗಳನ್ನು ಒಂದು ಘಟಕಕ್ಕೆ.
ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು
ಪ್ರಕರಣ 1 - ಸರಾಸರಿ ಬಲೆ. ಒಂದು ತಂಡವು ಆದಾಯದ ಅಂಕಣದಲ್ಲಿ 320 ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳನ್ನು ಸರಾಸರಿ ($48,500) ನೊಂದಿಗೆ ತುಂಬಿದೆ. ಆದರೆ ನ್ಯೂನತೆಗಳು ವ್ಯವಸ್ಥಿತವಾಗಿದ್ದವು: ಇವು ಕಡಿಮೆ ಆದಾಯದ ವಿಭಾಗವಾಗಿದ್ದು ಅದು ಎಂದಿಗೂ ಆದಾಯವನ್ನು ಘೋಷಿಸಲಿಲ್ಲ. ಸರಾಸರಿ ತುಂಬುವಿಕೆಯು ಈ ಗುಂಪನ್ನು ಕೃತಕವಾಗಿ ಶ್ರೀಮಂತಗೊಳಿಸಿತು ಮತ್ತು ಕ್ರೆಡಿಟ್ ಮಾದರಿಯು ತಪ್ಪಾಗಿದೆ. ಪಾಠ: ಅದನ್ನು ಭರ್ತಿ ಮಾಡುವ ಮೊದಲು "ಅದು ಏಕೆ ಖಾಲಿಯಾಗಿದೆ" ಎಂದು ಕೇಳಿ.
ಪ್ರಕರಣ 2 - ಅಳಿಸಬಾರದು ಎಂದು ಔಟ್ಲೈಯರ್. ಚಿಲ್ಲರೆ ವಿಶ್ಲೇಷಕರು ಮಾರಾಟದ ಡೇಟಾದಲ್ಲಿ 4 ದೊಡ್ಡ ಆರ್ಡರ್ಗಳನ್ನು (ಪ್ರತಿ 1.8 ಮಿಲಿಯನ್ TL) ಅಳಿಸಿದ್ದಾರೆ, ಅವುಗಳು "ದೋಷಗಳು" ಎಂದು ಭಾವಿಸಿ. ಆದಾಗ್ಯೂ, ಇವು ನಿಜವಾದ ಕಾರ್ಪೊರೇಟ್ ಆದೇಶಗಳಾಗಿವೆ ಮತ್ತು ಒಟ್ಟು ವಹಿವಾಟಿನ 22% ಆಗಿತ್ತು. ಅಳಿಸುವಿಕೆಯ ನಂತರದ ಮುನ್ಸೂಚನೆಯ ಮಾದರಿಯು ಸಾಂಸ್ಥಿಕ ಬೇಡಿಕೆಯನ್ನು ಸಂಪೂರ್ಣವಾಗಿ ಕಳೆದುಕೊಂಡಿದೆ. ಪಾಠ: ಅದನ್ನು ಅಳಿಸುವ ಮೊದಲು ಔಟ್ಲೈಯರ್ ಅನ್ನು ಪರೀಕ್ಷಿಸಿ.
ಪ್ರಕರಣ 3 - ದಿನಾಂಕ ಸ್ವರೂಪ ವಿಪತ್ತು. CSV ನಲ್ಲಿ, ದಿನಾಂಕಗಳನ್ನು "2024-03-01" ಮತ್ತು "01.03.2024" ಎರಡಕ್ಕೂ ಬೆರೆಸಲಾಗಿದೆ. YZ ಬರೆದ ಕೋಡ್ ಅನ್ನು ಮೊದಲ ಸ್ವರೂಪದ ಪ್ರಕಾರ ಪಾರ್ಸ್ ಮಾಡಿದಾಗ, 6,400 ಸಾಲುಗಳು NaT ಆಗಿ "ಅಮಾನ್ಯ ದಿನಾಂಕ" ವಾಗಿ ಮಾರ್ಪಟ್ಟವು ಮತ್ತು ವಿಶ್ಲೇಷಣೆಯಿಂದ ಮೌನವಾಗಿ ಹೊರಗಿಡಲಾಗಿದೆ. ಸಾಲುಗಳ ಸಂಖ್ಯೆ ಕಡಿಮೆಯಾದಾಗ ಮಾತ್ರ ವಿಶ್ಲೇಷಕರು ಇದನ್ನು ಗಮನಿಸಿದರು. ಪಾಠ: ಪರಿವರ್ತನೆಯ ನಂತರ ಯಾವಾಗಲೂ ಸಾಲುಗಳು ಮತ್ತು ಖಾಲಿ ಜಾಗಗಳ ಸಂಖ್ಯೆಯನ್ನು ಪರಿಶೀಲಿಸಿ.
ನಾಲ್ಕು ನಕಲಿಸಬಹುದಾದ ಟೆಂಪ್ಲೇಟ್ಗಳು
1) ಕಾಣೆಯಾದ ಮೌಲ್ಯದ ನಕ್ಷೆ:
ನನ್ನ ಬಳಿ ಪಾಂಡಾಗಳು ಡಿಎಫ್ ಇದೆ. ಪ್ರತಿ ಕಾಲಮ್ಗೆ ಕಾಣೆಯಾದ ಸಂಖ್ಯೆ ಮತ್ತು ಶೇಕಡಾವಾರು (NaN) ಅನ್ನು ತೋರಿಸುವ ಕೋಷ್ಟಕವನ್ನು ಉತ್ಪಾದಿಸುವ ಕೋಡ್ ಅನ್ನು ಬರೆಯಿರಿ. ನಂತರ, 40% ಕ್ಕಿಂತ ಹೆಚ್ಚು ಕಾಣೆಯಾದ ದರದೊಂದಿಗೆ ಮತ್ತು 5% ಕ್ಕಿಂತ ಕಡಿಮೆ ದರವನ್ನು ಹೊಂದಿರುವ ಕಾಲಮ್ಗಳನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ಪಟ್ಟಿ ಮಾಡಿ. ಈ ರೋಗನಿರ್ಣಯ ಕೋಡ್ ಅನ್ನು ರಚಿಸಿ, ನೀವು ಸೂಚಿಸುವ ತಂತ್ರವಲ್ಲ; ನಾನು ನಿರ್ಧಾರ ತೆಗೆದುಕೊಳ್ಳುತ್ತೇನೆ.
2) ಹೊರಗಿನ ತಪಾಸಣೆ (ಅಳಿಸುವಿಕೆ ಅಲ್ಲ):
IQR ವಿಧಾನವನ್ನು ಬಳಸಿಕೊಂಡು ನನ್ನ "ಮೊತ್ತ" ಕಾಲಮ್ಗೆ ಔಟ್ಲೈಯರ್ಗಳನ್ನು ಪತ್ತೆ ಮಾಡುವ (ಅಳಿಸುವುದಿಲ್ಲ!) ಕೋಡ್ ಬರೆಯಿರಿ. ಹೊರಗಿನ ಸಾಲುಗಳನ್ನು ಪ್ರತ್ಯೇಕ ಡಿಎಫ್ನಲ್ಲಿ ಇರಿಸಿ ಇದರಿಂದ ನಾನು ಅವುಗಳನ್ನು ಹಸ್ತಚಾಲಿತವಾಗಿ ಪರಿಶೀಲಿಸಬಹುದು. ಹೊರಹೋಗುವವರ ಸಂಖ್ಯೆ ಮತ್ತು ಒಟ್ಟು ಅವರ ಪಾಲನ್ನು ಸಹ ಮುದ್ರಿಸಿ.
3) ಪ್ರಕಾರ/ಫಾರ್ಮ್ಯಾಟ್ ಪ್ರಮಾಣೀಕರಣ:
ಕೆಳಗಿನ ಕಾಲಮ್ಗಳನ್ನು ಪ್ರಮಾಣೀಕರಿಸುವ ಕೋಡ್ ಬರೆಯಿರಿ:- "ದಿನಾಂಕ": ಮಿಶ್ರ ಸ್ವರೂಪಗಳಾಗಿರಬಹುದು ("2024-03-01" ಮತ್ತು "01.03.2024"); ಅವೆಲ್ಲವನ್ನೂ ದಿನಾಂಕದ ಸಮಯಕ್ಕೆ ಪರಿವರ್ತಿಸಿ, ಅನುವಾದಿಸಲಾಗದವುಗಳನ್ನು ಎಣಿಸಿ ಮತ್ತು ವರದಿ ಮಾಡಿ (ಮೌನವಾಗಿ ಎಸೆಯಿರಿ). - "ಲಿಂಗ": "ಪುರುಷ"/"ಪುರುಷ"/"ಎಂ" -> "ಎಂ", "ಹೆಣ್ಣು"/"ಹೆಣ್ಣು"/"ಎಫ್" -> "ಕೆ". - "ಮೊತ್ತ": ಟರ್ಕಿಶ್ ಫಾರ್ಮ್ಯಾಟ್ ಮಾಡಲಾದ ಪಠ್ಯ ("1.250,50") -> ದಶಮಾಂಶ ಸಂಖ್ಯೆ. ಪ್ರತಿ ಪರಿವರ್ತನೆಯ ನಂತರ ಎಷ್ಟು ಸಾಲುಗಳು ಪರಿಣಾಮ ಬೀರುತ್ತವೆ ಎಂಬುದನ್ನು ಮುದ್ರಿಸಿ.
4) ಸ್ವಚ್ಛಗೊಳಿಸುವ ಮೊದಲು/ನಂತರ ಪರಿಶೀಲಿಸಿ:
ಸ್ವಚ್ಛಗೊಳಿಸುವ ಹಂತದ ಮೊದಲು ಮತ್ತು ನಂತರ ಆಯ್ಕೆಮಾಡಿದ ಕಾಲಮ್ಗಳ df.shape, ಕಾಣೆಯಾದ ಎಣಿಕೆ ಮತ್ತು ಸಾರಾಂಶ ಅಂಕಿಅಂಶಗಳನ್ನು (ಸರಾಸರಿ, ಸರಾಸರಿ, ನಿಮಿಷ, ಗರಿಷ್ಠ) ಹೋಲಿಸುವ ಕೋಡ್ ಅನ್ನು ಬರೆಯಿರಿ. ಉದ್ದೇಶ: ಸ್ವಚ್ಛಗೊಳಿಸುವ ಬದಲಾವಣೆಗಳನ್ನು ನೋಡಲು.
ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್ / ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್
ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್:
ಈ ಡೇಟಾವನ್ನು ತೆರವುಗೊಳಿಸಿ.
"ಸ್ಪಷ್ಟ" ಎಂಬುದು ಅಸ್ಪಷ್ಟವಾಗಿದೆ; ಯಾವ ಕಾಣೆಯಾದ ಭಾಗಗಳನ್ನು ಅಳಿಸಬೇಕು, ಯಾವುದನ್ನು ತುಂಬಬೇಕು, ಯಾವ ಕಾಲಮ್ ಅನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಬೇಕು ಮತ್ತು ಹೇಗೆ ಎಂದು AI ಗೆ ತಿಳಿದಿಲ್ಲ. ಫಲಿತಾಂಶ: ಕುರುಡು, ಬದಲಾಯಿಸಲಾಗದ ಬದಲಾವಣೆಗಳು.
ಶಕ್ತಿಯುತ ಪ್ರಾಂಪ್ಟ್:
ನಿಮ್ಮ ಪಾತ್ರ: ಡೇಟಾ ಶುದ್ಧೀಕರಣ ಸಹಾಯಕ. df ಕಾಲಮ್ಗಳು: customer_id (int), registration_date (ಮಿಶ್ರ ಸ್ವರೂಪದ ಪಠ್ಯ), ಆದಾಯ_tl (ಪಠ್ಯ, "1,200.00"), ನಗರ (ಪಠ್ಯ, ಅಸಮಂಜಸ ಕಾಗುಣಿತ). ನಿಯಮಗಳು:- ಮೂಲ ಡಿಎಫ್ ಅನ್ನು ಬದಲಾಯಿಸುವುದು; df_clean ಹೆಸರಿನ ನಕಲಿನಲ್ಲಿ ಕೆಲಸ ಮಾಡಿ.- income_tl ಅನ್ನು ಸಂಖ್ಯೆಗೆ ಪರಿವರ್ತಿಸಿ, ಅನುವಾದಿಸಲಾಗದದನ್ನು ಎಣಿಸಿ.- record_date ಅನ್ನು ದಿನಾಂಕದ ಸಮಯಕ್ಕೆ ಬದಲಾಯಿಸಿ, ದೋಷವನ್ನು ವರದಿ ಮಾಡಿ.- ನನ್ನ ಅನುಮೋದನೆಯಿಲ್ಲದೆ ಯಾವುದೇ ಸಾಲುಗಳನ್ನು ಅಳಿಸಬೇಡಿ; ಅಭ್ಯರ್ಥಿಗಳನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ತೋರಿಸಿ. ಪ್ರತಿ ಹಂತದ ನಂತರ, df_temiz.shape ಮತ್ತು ಕಾಣೆಯಾದ ಸಂಖ್ಯೆಯನ್ನು ಮುದ್ರಿಸಿ.
ಇಲ್ಲಿ ಮೂಲವನ್ನು ರಕ್ಷಿಸಲಾಗಿದೆ, ಪ್ರತಿ ರೂಪಾಂತರವನ್ನು ಎಣಿಸಲಾಗುತ್ತದೆ, ಅಳಿಸುವಿಕೆಯನ್ನು ಮಾನವನಿಗೆ ಬಿಡಲಾಗುತ್ತದೆ.
ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು
- "ಯಾಕೆ ಖಾಲಿಯಾಗಿದೆ?" ಎಂದು ಕೇಳದೆ ಅಂತರವನ್ನು ತುಂಬುವುದು. ವ್ಯವಸ್ಥಿತ/ಮಹತ್ವದ ಕೊರತೆಯನ್ನು ಸರಾಸರಿಯೊಂದಿಗೆ ತುಂಬುವುದು ಡೇಟಾವನ್ನು ವಿರೂಪಗೊಳಿಸುತ್ತದೆ.
- ಅದನ್ನು ಪರಿಶೀಲಿಸದೆ ಹೊರಗಿರುವದನ್ನು ಅಳಿಸುವುದು. ನೈಜ ಆದರೆ ಅಪರೂಪದ ಘಟನೆಗಳನ್ನು ತಿರಸ್ಕರಿಸುವುದು ಪ್ರಮುಖ ಮಾಹಿತಿಯನ್ನು ನಾಶಪಡಿಸುತ್ತದೆ.
- ಎಲ್ಲಾ ಡೇಟಾದಿಂದ ಪ್ಯಾಡಿಂಗ್ ಮೌಲ್ಯವನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡಲಾಗುತ್ತಿದೆ. ಪರೀಕ್ಷಾ ಡೇಟಾವನ್ನು ಒಳಗೊಂಡಂತೆ ಸೋರಿಕೆಯನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ; ಕೇವಲ ತರಬೇತಿಯಿಂದ ಲೆಕ್ಕ ಹಾಕಿ.
- ಪರಿವರ್ತನೆಯ ನಂತರ ಸಾಲುಗಳು/ಖಾಲಿಗಳ ಸಂಖ್ಯೆಯನ್ನು ಪರಿಶೀಲಿಸುತ್ತಿಲ್ಲ. ಮೌನವಾಗಿ NaT/NaN ಇರುವ ಸಾಲುಗಳನ್ನು ವಿಶ್ಲೇಷಣೆಯಿಂದ ಹೊರಗಿಡಲಾಗಿದೆ.
- ಮೂಲ ಡೇಟಾವನ್ನು ಓವರ್ರೈಟ್ ಮಾಡುವುದು. ಹಿಂತಿರುಗುವಿಕೆ ಮತ್ತು ಪುನರುತ್ಪಾದನೆಯು ಕಳೆದುಹೋಗುತ್ತದೆ.
ಸಲಹೆ: "ಮೊದಲು-ನಂತರ" ಹೋಲಿಕೆಯೊಂದಿಗೆ ಶುದ್ಧೀಕರಣವನ್ನು ರನ್ ಮಾಡಿ. ಪ್ರತಿ ಹಂತದ ನಂತರ ನಿರ್ಣಾಯಕ ಕಾಲಮ್ಗಳ df.shape, ಕಾಣೆಯಾದ ಎಣಿಕೆ ಮತ್ತು ಸಾರಾಂಶ ಅಂಕಿಅಂಶಗಳನ್ನು ಮುದ್ರಿಸಿ. ಆದ್ದರಿಂದ ನೀವು ತಕ್ಷಣ ಒಂದು ಹೆಜ್ಜೆ ಅನಿರೀಕ್ಷಿತವಾಗಿ 6,000 ಸಾಲುಗಳನ್ನು ನಾಶಪಡಿಸುತ್ತದೆ ಎಂದು ನೋಡುತ್ತೀರಿ.
ಸಾರಾಂಶದಲ್ಲಿ
ಶುದ್ಧೀಕರಣವು ದತ್ತಾಂಶ ವಿಜ್ಞಾನದ ಹೆಚ್ಚು ಸಮಯ ತೆಗೆದುಕೊಳ್ಳುವ ಮತ್ತು ನಿರ್ಧಾರ-ಅಗತ್ಯವಿರುವ ಹಂತವಾಗಿದೆ. ಪ್ರತಿಯೊಂದು ಬದಲಾವಣೆಯು ಡೇಟಾವನ್ನು ಬದಲಾಯಿಸುತ್ತದೆ, ಆದ್ದರಿಂದ ಪ್ರತಿಯೊಂದೂ ಪ್ರಜ್ಞಾಪೂರ್ವಕ ನಿರ್ಧಾರವಾಗಿದೆ. ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳಿಗಾಗಿ, "ಅದು ಏಕೆ ಖಾಲಿಯಾಗಿದೆ?" ಯಾವುದೇ ಔಟ್ಲೈಯರ್ಗಳನ್ನು ಅಳಿಸುವ ಮೊದಲು ಅವುಗಳನ್ನು ಪರಿಶೀಲಿಸಿ; ಮಾದರಿ ಮತ್ತು ಸ್ವರೂಪವನ್ನು ಪ್ರಮಾಣಿತಕ್ಕೆ ತನ್ನಿ. ತರಬೇತಿ ಡೇಟಾದಿಂದ ಮಾತ್ರ ಭರ್ತಿ ಮೌಲ್ಯವನ್ನು ಲೆಕ್ಕಹಾಕಿ, ಮೂಲವನ್ನು ಇರಿಸಿ ಮತ್ತು ಅದನ್ನು ಎಣಿಸುವ ಮೂಲಕ ಪ್ರತಿ ಹಂತದ ಪ್ರಭಾವವನ್ನು ಟ್ರ್ಯಾಕ್ ಮಾಡಿ. AI ಈ ವ್ಯವಹಾರದಲ್ಲಿ ಪ್ರಚಂಡ ವೇಗವರ್ಧಕವಾಗಿದೆ, ಆದರೆ ನೀವು ಏನು ಸ್ವಚ್ಛಗೊಳಿಸುತ್ತೀರಿ ಮತ್ತು ಏಕೆ ಎಂದು ಮನುಷ್ಯರು ನಿರ್ಧರಿಸುತ್ತಾರೆ.
ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ
ಸಣ್ಣ ಕೋಷ್ಟಕವನ್ನು ತೆಗೆದುಕೊಳ್ಳಿ (ಅಥವಾ ರಚಿಸಿ) ಮತ್ತು ಅದರಲ್ಲಿ ಮೂರು ಸಮಸ್ಯೆಗಳನ್ನು ಉದ್ದೇಶಪೂರ್ವಕವಾಗಿ ಸೇರಿಸಿ: ಕಾಣೆಯಾದ ಮೌಲ್ಯದ ಟ್ಯೂಪಲ್, ಔಟ್ಲೈಯರ್, ಮಿಶ್ರ ದಿನಾಂಕ ಸ್ವರೂಪ. ಮೇಲಿನ ಟೆಂಪ್ಲೇಟ್ಗಳೊಂದಿಗೆ AI ನಿಂದ ರೋಗನಿರ್ಣಯ ಮತ್ತು ಪ್ರಮಾಣೀಕರಣ ಕೋಡ್ ಅನ್ನು ವಿನಂತಿಸಿ; ಪ್ರತಿ ಹಂತದ ಮೊದಲು/ನಂತರ ಸಾಲುಗಳು ಮತ್ತು ಖಾಲಿ ಜಾಗಗಳ ಸಂಖ್ಯೆಯನ್ನು ಹೋಲಿಕೆ ಮಾಡಿ. ಕನಿಷ್ಠ ಒಂದು "ಮೂಕ ನಷ್ಟ" ವನ್ನು ಹಿಡಿಯಲು ಪ್ರಯತ್ನಿಸಿ ಮತ್ತು ನೀವು ಅದನ್ನು ಹೇಗೆ ಗಮನಿಸಿದ್ದೀರಿ ಎಂಬುದನ್ನು ಗಮನಿಸಿ.
ಪರಿಶೀಲನಾಪಟ್ಟಿ
- [ ] ನಾನು ಮೂಲ ಕಚ್ಚಾ ಡೇಟಾವನ್ನು ಇಟ್ಟುಕೊಂಡಿದ್ದೇನೆ ಮತ್ತು ನಕಲಿನಲ್ಲಿ ಕೆಲಸ ಮಾಡಿದ್ದೇನೆಯೇ?
- [ ] ನಾನು ಪ್ರತಿ ಕಾಣೆಯಾದ ಕಾಲಮ್ಗೆ "ಏಕೆ ಖಾಲಿಯಾಗಿದೆ" ಎಂಬ ಪ್ರಶ್ನೆಯನ್ನು ಕೇಳಿದ್ದೇನೆಯೇ?
- [ ] ನಾನು ಔಟ್ಲೈಯರ್ಗಳನ್ನು ಅಳಿಸುವ ಮೊದಲು ಪರಿಶೀಲಿಸಿದ್ದೇನೆಯೇ?
- [ ] ನಾನು ಪ್ಯಾಡಿಂಗ್ ಮೌಲ್ಯವನ್ನು ತರಬೇತಿ ಡೇಟಾದಿಂದ ಮಾತ್ರ ಲೆಕ್ಕಾಚಾರ ಮಾಡಿದ್ದೇನೆಯೇ?
- [ ] ನಾನು ಪ್ರತಿ ಹಂತದ ನಂತರ ಸಾಲುಗಳು/ಖಾಲಿಗಳ ಸಂಖ್ಯೆಯನ್ನು ಪರಿಶೀಲಿಸುತ್ತಿದ್ದೇನೆ ಮತ್ತು ನಿಶ್ಯಬ್ದ ನಷ್ಟವನ್ನು ತೆಗೆದುಹಾಕುತ್ತಿದ್ದೇನೆಯೇ?