ಲಾಭಗಳು:
- ವಿಭಿನ್ನ ಡೇಟಾ ಮೂಲಗಳನ್ನು (ಡೇಟಾಬೇಸ್, API, ಫೈಲ್, ವೆಬ್ ಸ್ಕ್ರ್ಯಾಪಿಂಗ್) ಮತ್ತು ಪ್ರತಿಯೊಂದರ ಮೋಸಗಳನ್ನು ಗುರುತಿಸುವ ಮತ್ತು ಸ್ಕೀಮಾವನ್ನು ಸರಿಯಾಗಿ ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಸಾಮರ್ಥ್ಯ
- ಮಾದರಿಯು ಜನಸಂಖ್ಯೆ ಮತ್ತು ಆಯ್ಕೆಯ ಪಕ್ಷಪಾತವನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆಯೇ ಎಂಬುದನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವ ಮೂಲಕ ಪುನರಾವರ್ತಿತ ಮಾದರಿಯನ್ನು ನಿರ್ವಹಿಸುವ ಸಾಮರ್ಥ್ಯ
- ಸಂಗ್ರಹದ ಹಂತದಲ್ಲಿ ಡೇಟಾ ಸೋರಿಕೆಯನ್ನು ತೊಡೆದುಹಾಕಲು ಮತ್ತು ಪ್ರತಿ ಕಾಲಮ್ನಲ್ಲಿ 'ಮುನ್ಸೂಚನೆಯ ಸಮಯದಲ್ಲಿ ನಾನು ಅದನ್ನು ಹೊಂದಬಹುದೇ' ಎಂಬ ಪ್ರಶ್ನೆಯನ್ನು ಕೇಳುವ ಮೂಲಕ ಕಾನೂನು/ನೈತಿಕ ಗಡಿಗಳನ್ನು ವೀಕ್ಷಿಸುವ ಸಾಮರ್ಥ್ಯ?
ಪ್ರತಿ ವಿಶ್ಲೇಷಣೆಯು ನೀವು ಸಂಗ್ರಹಿಸುವ ಡೇಟಾದ ಗುಣಮಟ್ಟದಂತೆ ಉತ್ತಮವಾಗಿದೆ. ವಿಶ್ವದ ಅತ್ಯಂತ ಮುಂದುವರಿದ ಮಾದರಿಯು ಸಹ ತಪ್ಪಾಗಿ ಸಂಗ್ರಹಿಸಿದ ಡೇಟಾದೊಂದಿಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸಿದರೆ, ಪೂರ್ವಾಗ್ರಹ ಪೀಡಿತವಾಗಿ ಅಥವಾ ಭವಿಷ್ಯದ ಬಗ್ಗೆ ಮಾಹಿತಿಯನ್ನು ಒಳಗೊಂಡಿದ್ದರೆ ಅದು ವಿಶ್ವಾಸಾರ್ಹವಲ್ಲದ ಫಲಿತಾಂಶಗಳನ್ನು ನೀಡುತ್ತದೆ. ಕಂಪ್ಯೂಟರ್ ವಿಜ್ಞಾನದಲ್ಲಿ, ಈ ತತ್ವವನ್ನು "ಗಾರ್ಬೇಜ್ ಇನ್, ಗಾರ್ಬೇಜ್ ಔಟ್" (ಗಾರ್ಬೇಜ್ ಇನ್, ಗಾರ್ಬೇಜ್ ಔಟ್) ಎಂದು ಸಂಕ್ಷೇಪಿಸಲಾಗಿದೆ. ಈ ಘಟಕದಲ್ಲಿ, ನಾವು ಡೇಟಾ ಸಂಗ್ರಹಣಾ ಹಂತವನ್ನು ಒಳಗೊಳ್ಳುತ್ತೇವೆ: ಮೂಲವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು, ಮಾದರಿ ಮಾಡುವುದು, ಗುಣಮಟ್ಟದ ಪ್ರಶ್ನೆಗಳನ್ನು ಕೇಳುವುದು ಮತ್ತು ಮೊದಲ ದಿನದಿಂದ ಡೇಟಾ ಸೋರಿಕೆಯ ಅಪಾಯದ ಬಗ್ಗೆ ಎಚ್ಚರವಾಗಿರುವುದು. ಈ ಹಂತದಲ್ಲಿ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯು ಪ್ರಬಲವಾದ ಸಹಾಯವಾಗಿದೆ; SQL ಪ್ರಶ್ನೆಯನ್ನು ಬರೆಯುತ್ತದೆ, API ಡಾಕ್ಯುಮೆಂಟ್ ಅನ್ನು ಸಾರಾಂಶಗೊಳಿಸುತ್ತದೆ, ಡೇಟಾ ಒಪ್ಪಂದವನ್ನು ಕರಡು ಮಾಡುತ್ತದೆ. ಆದರೆ ನೀವು ಯಾವ ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸುತ್ತೀರಿ ಮತ್ತು ಆ ಡೇಟಾ ನಿಮ್ಮನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆಯೇ ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸುವವನು ಮಾನವ.
ಡೇಟಾ ಮೂಲಗಳನ್ನು ತಿಳಿದುಕೊಳ್ಳುವುದು
ಡೇಟಾವು ವಿವಿಧ ಸ್ಥಳಗಳಿಂದ ಬರುತ್ತದೆ ಮತ್ತು ಪ್ರತಿ ಮೂಲವು ತನ್ನದೇ ಆದ ಅಪಾಯಗಳನ್ನು ಹೊಂದಿದೆ. ಡೇಟಾಬೇಸ್ (ಕೋಷ್ಟಕಗಳಲ್ಲಿ ಸಂಗ್ರಹಿಸಲಾದ ರಚನಾತ್ಮಕ ಡೇಟಾ, ಸಾಮಾನ್ಯವಾಗಿ SQL ನೊಂದಿಗೆ ಪ್ರಶ್ನಿಸಲಾಗುತ್ತದೆ) ಅತ್ಯಂತ ಸಾಮಾನ್ಯ ಮೂಲವಾಗಿದೆ; ಇದು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿದೆ, ಆದರೆ ಅದರ ಯೋಜನೆಯನ್ನು ಚೆನ್ನಾಗಿ ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು ಅವಶ್ಯಕ. API (ಅಪ್ಲಿಕೇಶನ್ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಇಂಟರ್ಫೇಸ್) ಲೈವ್ ಡೇಟಾವನ್ನು ಒದಗಿಸುತ್ತದೆ ಆದರೆ ವೇಗ ಮಿತಿಗಳು ಮತ್ತು ಸ್ವರೂಪ ಬದಲಾವಣೆಗಳ ಅಪಾಯವನ್ನು ಹೊಂದಿರುತ್ತದೆ. ಫೈಲ್ಗಳು (CSV, Excel, JSON) ಹೊಂದಿಕೊಳ್ಳುವ ಆದರೆ ಫಾರ್ಮ್ಯಾಟ್ ಅಸಂಗತತೆಗೆ ಒಳಗಾಗುತ್ತವೆ. ವೆಬ್ ಸ್ಕ್ರ್ಯಾಪಿಂಗ್ ಶಕ್ತಿಯುತವಾಗಿದೆ, ಆದರೆ ಇದು ಕಾನೂನು ಮತ್ತು ನೈತಿಕ ಮಿತಿಗಳನ್ನು ಹೊಂದಿದೆ; ಪ್ರತಿಯೊಂದು ಸೈಟ್ ಅನ್ನು ಸ್ಕ್ರ್ಯಾಪ್ ಮಾಡಲಾಗುವುದಿಲ್ಲ.
ಗಮನ: ವೆಬ್ ಸ್ಕ್ರ್ಯಾಪಿಂಗ್ ಮತ್ತು ಸ್ವಯಂಚಾಲಿತ ಡೇಟಾ ಸಂಗ್ರಹಣೆಗಾಗಿ, ಸೈಟ್ನ ಬಳಕೆಯ ನಿಯಮಗಳು, robots.txt ಫೈಲ್ ಮತ್ತು KVKK/GDPR ಅನ್ನು ಅನುಸರಿಸಿ. ಅನಧಿಕೃತ ಡೇಟಾ ಸಂಗ್ರಹಣೆಯು ಕಾನೂನು ಹೊಣೆಗಾರಿಕೆಯನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ. ಮಾಹಿತಿ ಭದ್ರತೆಯ ಸಂದರ್ಭದಲ್ಲಿ, ನೀವು ಅಧಿಕೃತವಾಗಿರುವ ವ್ಯವಸ್ಥೆಗಳಲ್ಲಿ ಮತ್ತು ರಕ್ಷಣಾ/ವಿಶ್ಲೇಷಣೆ ಉದ್ದೇಶಗಳಿಗಾಗಿ ಮಾತ್ರ ಡೇಟಾ ಸಂಗ್ರಹಣೆ ಪರಿಕರಗಳನ್ನು ಬಳಸಿ; ಅನಧಿಕೃತ ಪ್ರವೇಶ ಅಥವಾ ಸ್ಕ್ರ್ಯಾಪಿಂಗ್ ಅನ್ನು ನಿಷೇಧಿಸಲಾಗಿದೆ.
ಸ್ಕೀಮಾವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು: ಡೇಟಾದೊಂದಿಗೆ ಪರಿಚಯ ಮಾಡಿಕೊಳ್ಳುವುದು
ಡೇಟಾ ಸೆಟ್ ಅನ್ನು ಸಂಗ್ರಹಿಸುವ ಮೊದಲು, ನೀವು ಅದರ ಸ್ಕೀಮಾವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಬೇಕು (ಕಾಲಮ್ಗಳ ಹೆಸರುಗಳು, ಅವುಗಳ ಡೇಟಾ ಪ್ರಕಾರಗಳು, ಅವುಗಳ ಅರ್ಥಗಳು ಮತ್ತು ಪರಸ್ಪರ ಸಂಬಂಧಗಳು). AI ಇಲ್ಲಿ "ಡೇಟಾ ಡಿಕ್ಷನರಿ" ಅನ್ನು ರಚಿಸಲು ತುಂಬಾ ಉಪಯುಕ್ತವಾಗಿದೆ - ಪ್ರತಿ ಕಾಲಮ್ ಎಂದರೆ ಏನು ಎಂದು ವಿವರಿಸುವ ಟೇಬಲ್. ಆದರೆ AI ಉತ್ಪಾದಿಸುವ ವಿವರಣೆಗಳು ಮುನ್ನೋಟಗಳಾಗಿವೆ; ಡೇಟಾವನ್ನು ತಯಾರಿಸಿದ ತಂಡದೊಂದಿಗೆ ಪ್ರತಿ ಕಾಲಮ್ನ ನಿಜವಾದ ಅರ್ಥವನ್ನು ದೃಢೀಕರಿಸಿ. ಉದಾಹರಣೆಗೆ, "ಸ್ಥಿತಿ" ಹೆಸರಿನ ಕಾಲಮ್ 0/1/2 ಅನ್ನು ಹೊಂದಿರಬಹುದು; ಇವುಗಳು "ಬಾಕಿ ಉಳಿದಿವೆ/ಅನುಮೋದಿಸಲಾಗಿದೆ/ರದ್ದು ಮಾಡಲಾಗಿದೆ" ಅಥವಾ ಇನ್ನೇನಾದರೂ ಎಂಬುದನ್ನು ಮೂಲ ತಂಡಕ್ಕೆ ಮಾತ್ರ ತಿಳಿದಿದೆ.
ಕೆಳಗಿನ ಕೋಷ್ಟಕವು ಮೂಲ ಸಂಪನ್ಮೂಲ ಪ್ರಕಾರಗಳು ಮತ್ತು ಎಚ್ಚರಿಕೆಗಳನ್ನು ಸಂಕ್ಷಿಪ್ತಗೊಳಿಸುತ್ತದೆ:
ಮೂಲ
ಬಲವಾದ ಬಿಂದು
ಬಲೆ
AI ಹೇಗೆ ಸಹಾಯ ಮಾಡುತ್ತದೆ
SQL ಡೇಟಾಬೇಸ್
ರಚನಾತ್ಮಕ, ವಿಶ್ವಾಸಾರ್ಹ
ಸಂಕೀರ್ಣ ಸೇರ್ಪಡೆಗಳು
ಪ್ರಶ್ನೆ ಕರಡು ಬರೆಯುತ್ತಾರೆ
API
ಲೈವ್ ಡೇಟಾ
ವೇಗದ ಮಿತಿ, ಆಕಾರ ಬದಲಾವಣೆ
ಡಾಕ್ಯುಮೆಂಟ್ ಸಾರಾಂಶಗಳು, ಪುಲ್ ಕೋಡ್
CSV/ಎಕ್ಸೆಲ್
ಹೊಂದಿಕೊಳ್ಳುವ, ವೇಗದ
ಸ್ವರೂಪದ ಅಸಂಗತತೆ
ಕೋಡ್ ಓದಿ/ಪಾರ್ಸ್ ಮಾಡಿ
ವೆಬ್ ಸ್ಕ್ರ್ಯಾಪಿಂಗ್
ವ್ಯಾಪಕ ವ್ಯಾಪ್ತಿ
ಕಾನೂನು/ನೈತಿಕ ಮಿತಿ
ಪಾರ್ಸಿಂಗ್ ಡ್ರಾಫ್ಟ್ (ಅಧಿಕಾರದೊಳಗೆ)
ಲಾಗ್/ಈವೆಂಟ್ ಡೇಟಾ
ವಿವರವಾದ
ಬೃಹತ್ ಪರಿಮಾಣ
ಫಿಲ್ಟರಿಂಗ್ ಪ್ರಶ್ನೆ
ವಿವರಣೆ: ಭಾಗವು ಸಂಪೂರ್ಣ ಪ್ರತಿನಿಧಿಸುತ್ತದೆಯೇ?
ಹೆಚ್ಚಿನ ಸಮಯ, ನೀವು ಸಂಪೂರ್ಣ ಡೇಟಾಕ್ಕಿಂತ ಹೆಚ್ಚಾಗಿ ಮಾದರಿಯೊಂದಿಗೆ (ಜನಸಂಖ್ಯೆಯಿಂದ ಆಯ್ಕೆಮಾಡಲಾದ ಉಪವಿಭಾಗ) ಕೆಲಸ ಮಾಡುತ್ತೀರಿ. ನಿರ್ಣಾಯಕ ಪ್ರಶ್ನೆಯೆಂದರೆ: ಈ ಮಾದರಿಯು ಜನಸಂಖ್ಯೆಯನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆಯೇ? ಆಯ್ಕೆ ಪಕ್ಷಪಾತವು ಅತ್ಯಂತ ಸಾಮಾನ್ಯವಾದ ಬಲೆಯಾಗಿದೆ. ಉದಾಹರಣೆಗೆ, ನೀವು ಮೊಬೈಲ್ ಅಪ್ಲಿಕೇಶನ್ನಿಂದ ಬಳಕೆದಾರರನ್ನು ಮಾತ್ರ ಮಾದರಿ ಮಾಡಿದರೆ, ನೀವು ವೆಬ್ ಬಳಕೆದಾರರನ್ನು ನೋಡುವುದಿಲ್ಲ ಮತ್ತು ನಿಮ್ಮ ಫಲಿತಾಂಶಗಳು ತಪ್ಪುದಾರಿಗೆಳೆಯುತ್ತವೆ. ಯಾದೃಚ್ಛಿಕ ಮಾದರಿ (ಪ್ರತಿ ದಾಖಲೆಯು ಆಯ್ಕೆಯಾಗುವ ಸಮಾನ ಅವಕಾಶವನ್ನು ಹೊಂದಿದೆ) ಹೆಚ್ಚಿನ ಸಂದರ್ಭಗಳಲ್ಲಿ ಸುರಕ್ಷಿತವಾಗಿದೆ; ಆದರೆ ಸಮಯ ಸರಣಿಯ ಡೇಟಾದಲ್ಲಿ, ವಿಭಜನೆಯನ್ನು ಯಾದೃಚ್ಛಿಕವಾಗಿ ಮಾಡದೆ ಕಾಲಾನುಕ್ರಮದಲ್ಲಿ ಮಾಡಲಾಗುತ್ತದೆ (ನಾವು ಇದನ್ನು ಘಟಕಗಳು 7 ಮತ್ತು 10 ರಲ್ಲಿ ನೋಡುತ್ತೇವೆ).
ಮೊದಲ ದಿನದಿಂದ ಸೋರಿಕೆ ಜಾಗೃತಿ
ಡೇಟಾ ಸೋರಿಕೆಯು ಹೆಚ್ಚಿನ ವಿಪತ್ತುಗಳ ಮೂಲವಾಗಿದೆ ಮತ್ತು ಸಾಮಾನ್ಯವಾಗಿ ಡೇಟಾ ಸಂಗ್ರಹಣೆ ಹಂತದಲ್ಲಿ ಉದ್ಭವಿಸುತ್ತದೆ. ಉದಾಹರಣೆ: "ಅದನ್ನು ರದ್ದುಗೊಳಿಸಲಾಗಿದೆಯೇ" ಎಂದು ಊಹಿಸುವಾಗ, ನೀವು ಡೇಟಾಗೆ "ರದ್ದತಿ ದಿನಾಂಕ" ಕಾಲಮ್ ಅನ್ನು ಸೇರಿಸಿದರೆ, ಮಾದರಿಯು ಭವಿಷ್ಯವನ್ನು ನೋಡುತ್ತದೆ. ಸಂಗ್ರಹಣೆಯ ಹಂತದಲ್ಲಿ, ಪ್ರತಿ ಕಾಲಮ್ಗೆ ಒಂದು ಪ್ರಶ್ನೆಯನ್ನು ಕೇಳಿ: "ನಾನು ಭವಿಷ್ಯ ನುಡಿಯುವ ಸಮಯದಲ್ಲಿ ಈ ಮಾಹಿತಿಯನ್ನು ನಾನು ಹೊಂದಿದ್ದೇನೆಯೇ?" ಇಲ್ಲ ಎಂಬ ಉತ್ತರ ಬಂದರೆ ಆ ಕಾಲಂ ಸೋರಿಕೆಯಾಗುತ್ತಿದೆ. ನಾವು ಘಟಕ 10 ರಲ್ಲಿ ಈ ವಿಷಯವನ್ನು ಆಳವಾಗಿ ಕವರ್ ಮಾಡುತ್ತೇವೆ; ಆದರೆ ಅರಿವು ಮೊದಲ ದಿನದಿಂದಲೇ ಆರಂಭವಾಗಬೇಕು.
ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು
ಪ್ರಕರಣ 1 - ಪ್ರಾತಿನಿಧ್ಯದ ಸಮಸ್ಯೆ. ಒಂದು ಬ್ಯಾಂಕ್ ತನ್ನ ಕ್ರೆಡಿಟ್ ರಿಸ್ಕ್ ಮಾದರಿಗಾಗಿ (18,500 ದಾಖಲೆಗಳು) ಅನುಮೋದಿತ ಸಾಲಗಳ ಡೇಟಾವನ್ನು ಮಾತ್ರ ಸಂಗ್ರಹಿಸಿದೆ. ನಿರಾಕರಣೆಗಳು ಡೇಟಾದಲ್ಲಿ ಇರಲಿಲ್ಲ. ನೈಜ ಜಗತ್ತಿನಲ್ಲಿ ಮಾದರಿಯು ತಪ್ಪಾಗಿದೆ ಏಕೆಂದರೆ ತಿರಸ್ಕರಿಸುವವರು ಹೇಗೆ ವರ್ತಿಸುತ್ತಾರೆ ಎಂಬುದನ್ನು ಅದು ಎಂದಿಗೂ ನೋಡಲಿಲ್ಲ. ಪಾಠ: ಮಾದರಿಯು ನಿಮ್ಮ ನಿರ್ಧಾರವನ್ನು ತೆಗೆದುಕೊಳ್ಳುವ ಸಂಪೂರ್ಣ ಜನಸಂಖ್ಯೆಯ ಪ್ರತಿನಿಧಿಯಾಗಿರಬೇಕು.
ಪ್ರಕರಣ 2 - ಮೌನ ರೂಪ ಬದಲಾವಣೆ. ಒಂದು ತಂಡವು ಪ್ರತಿದಿನ API ನಿಂದ ಬೆಲೆ ಡೇಟಾವನ್ನು ಎಳೆಯುತ್ತಿದೆ. ಒಂದು ದಿನ, API ಪೂರೈಕೆದಾರರು ಕರೆನ್ಸಿಯನ್ನು USD ನಿಂದ EUR ಗೆ ಬದಲಾಯಿಸಿದರು, ಆದರೆ ಡೊಮೇನ್ ಹೆಸರು ಒಂದೇ ಆಗಿರುತ್ತದೆ. 12 ದಿನಗಳವರೆಗೆ ತಪ್ಪು ಘಟಕದಲ್ಲಿ ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸಲಾಗಿದೆ; 3,200 ಲೈನ್ಗಳು ದೋಷಪೂರಿತವಾಗಿವೆ. ಪಾಠ: API ಡೇಟಾದಲ್ಲಿ ವಾಲ್ಯೂಮ್ ಮತ್ತು ಫಾರ್ಮ್ಯಾಟ್ ಸ್ಥಿರತೆಯನ್ನು ನಿಯಮಿತವಾಗಿ ಪರಿಶೀಲಿಸಿ.
ಪ್ರಕರಣ 3 - ಆರಂಭಿಕ ಸೋರಿಕೆ. "ಚರ್ನ್" ಅಂದಾಜಿಗಾಗಿ ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸುವಾಗ ವಿಶ್ಲೇಷಕರು "ಖಾತೆ ಮುಚ್ಚುವಿಕೆಗೆ ಕಾರಣ" ಕಾಲಮ್ ಅನ್ನು ಸೇರಿಸಿದ್ದಾರೆ. ಗ್ರಾಹಕರು ಹೋದ ನಂತರವೇ ಈ ಅಂಕಣವನ್ನು ಭರ್ತಿ ಮಾಡಲಾಗಿದೆ. ಮಾದರಿಯು ಪರೀಕ್ಷಾ ಸೆಟ್ನಲ್ಲಿ 97% ನಿಖರತೆಯನ್ನು ನೀಡಿತು; ಮುನ್ಸೂಚನೆಯ ಸಮಯದಲ್ಲಿ ಆ ಕಾಲಮ್ ಖಾಲಿಯಾಗಿದ್ದರಿಂದ ಅದು ಉತ್ಪಾದನೆಯಲ್ಲಿ ಕೆಲಸ ಮಾಡಲಿಲ್ಲ. ಪಾಠ: ಪ್ರತಿ ಕಾಲಮ್ಗೆ "ಭವಿಷ್ಯದ ಸಮಯದಲ್ಲಿ ನಾನು ಅದನ್ನು ಹೊಂದಿದ್ದೇನೆಯೇ?" ಎಂಬ ಪ್ರಶ್ನೆಯನ್ನು ಕೇಳಿ
ನಾಲ್ಕು ನಕಲಿಸಬಹುದಾದ ಟೆಂಪ್ಲೇಟ್ಗಳು
1) ಡೇಟಾ ನಿಘಂಟು ಹೊರತೆಗೆಯುವಿಕೆ:
ನಿಮ್ಮ ಪಾತ್ರ: ಡೇಟಾ ವಿಜ್ಞಾನಿ ಸಹಾಯಕ. ಕೋಷ್ಟಕದ ಕಾಲಮ್ ಹೆಸರುಗಳು ಮತ್ತು ಮಾದರಿ (ಅನಾಮಧೇಯ) ಮೌಲ್ಯಗಳನ್ನು ಕೆಳಗೆ ನೀಡಲಾಗಿದೆ. ಪ್ರತಿ ಕಾಲಮ್ಗೆ, ಅದರ ಅಂದಾಜು ಅರ್ಥ, ಡೇಟಾಟೈಪ್ ಮತ್ತು ಸಂಭಾವ್ಯ ಗುಣಮಟ್ಟದ ಅಪಾಯಗಳನ್ನು ಕೋಷ್ಟಕದಲ್ಲಿ ಪಟ್ಟಿ ಮಾಡಿ. ನೀವು ಖಚಿತವಾಗಿರದ ಕಾಲಮ್ಗಳನ್ನು "ದೃಢೀಕರಣದ ಅಗತ್ಯವಿದೆ" ಎಂದು ಗುರುತಿಸಿ; ಮೇಕಿಂಗ್ ಅರ್ಥ. ಕಾಲಮ್ಗಳು: [ಇಲ್ಲಿ ಅಂಟಿಸಿ]
2) ಮಾದರಿ ಕೋಡ್ (ಯಾದೃಚ್ಛಿಕ, ಪುನರಾವರ್ತಿಸಬಹುದಾದ):
ನನ್ನ ಬಳಿ ಪಾಂಡಾಗಳು ಡಿಎಫ್ ಇದೆ. 200,000 ಸಾಲುಗಳಿಂದ ಪ್ರತಿನಿಧಿ 5% ಯಾದೃಚ್ಛಿಕ ಮಾದರಿಯನ್ನು ಹೊರತೆಗೆಯುವ ಕೋಡ್ ಬರೆಯಿರಿ. random_state=42 ಬಳಸಿ (ಪುನರುತ್ಪಾದನೆಗಾಗಿ). ಮಾದರಿಯ ವರ್ಗ ವಿತರಣೆಯು ಜನಸಂಖ್ಯೆಗೆ ಹೋಲುತ್ತದೆ ಎಂದು ಪರಿಶೀಲಿಸಲು ಕೋಡ್ ಸೇರಿಸಿ.
3) ಲೀಕ್ ಸ್ಕ್ಯಾನಿಂಗ್ ಪ್ರಶ್ನೆ:
ನಾನು ನಿಮಗೆ ಈ ಕಾಲಮ್ಗಳ ಪಟ್ಟಿಯನ್ನು ನೀಡುತ್ತೇನೆ. "ಇದು ರದ್ದುಗೊಂಡಿದೆಯೇ" (0/1) ಊಹಿಸುವುದು ನನ್ನ ಗುರಿಯಾಗಿದೆ. ಪ್ರತಿ ಕಾಲಮ್ಗೆ, ಭವಿಷ್ಯವಾಣಿಯ ಸಮಯದಲ್ಲಿ ನಾನು ಅದನ್ನು ನಿಜವಾಗಿಯೂ ಹೊಂದಿದ್ದೇನೆಯೇ ಎಂದು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿ ಮತ್ತು ಅದನ್ನು "ಸುರಕ್ಷಿತ / ಅನುಮಾನಾಸ್ಪದ / ಸೋರಿಕೆ" ಎಂದು ಗುರುತಿಸಿ. ನಿಮ್ಮ ತಾರ್ಕಿಕತೆಯನ್ನು ಒಂದೇ ವಾಕ್ಯದಲ್ಲಿ ಬರೆಯಿರಿ. ಕಾಲಮ್ಗಳು: [ಪಟ್ಟಿ]
4) SQL ಪುಲ್ ಕ್ವೆರಿ ಡ್ರಾಫ್ಟ್:
ನಾನು PostgreSQL ನಲ್ಲಿ "ಆರ್ಡರ್ಗಳು" ಮತ್ತು "ಗ್ರಾಹಕರು" ಕೋಷ್ಟಕಗಳನ್ನು ಹೊಂದಿದ್ದೇನೆ. ಗ್ರಾಹಕ ನಗರದೊಂದಿಗೆ ಕಳೆದ 90 ದಿನಗಳ ಆರ್ಡರ್ಗಳನ್ನು ಸಂಯೋಜಿಸುವ ಮತ್ತು ಪ್ರತಿ ನಗರಕ್ಕೆ ಒಟ್ಟು ಮೊತ್ತ ಮತ್ತು ಆರ್ಡರ್ಗಳ ಸಂಖ್ಯೆಯನ್ನು ಹಿಂದಿರುಗಿಸುವ JOIN ಪ್ರಶ್ನೆಯನ್ನು ಬರೆಯಿರಿ. ದಿನಾಂಕ ಫಿಲ್ಟರ್ ಮತ್ತು NULL ನಗರಗಳನ್ನು ಹೇಗೆ ನಿರ್ವಹಿಸಲಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ವಿವರಿಸಿ. ನಾನು ಪ್ರಶ್ನೆಯನ್ನು ರನ್ ಮಾಡುತ್ತೇನೆ ಮತ್ತು ಅದನ್ನು ಪರಿಶೀಲಿಸುತ್ತೇನೆ.
ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್ / ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್
ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್:
ಈ ಡೇಟಾಬೇಸ್ನಿಂದ ನನಗೆ ಉತ್ತಮ ಮಾದರಿ ಡೇಟಾವನ್ನು ಎಳೆಯಿರಿ.
"ಒಳ್ಳೆಯದು" ಅಸ್ಪಷ್ಟವಾಗಿದೆ; ಯಾವ ಚಿತ್ರಕಲೆ, ಯಾವ ಅವಧಿ, ಯಾವ ಗಾತ್ರ, ಯಾವ ಉದ್ದೇಶವು ಸ್ಪಷ್ಟವಾಗಿಲ್ಲ. AI ಸಾಮಾನ್ಯ, ಪ್ರಾಯಶಃ ತಪ್ಪು ಪ್ರಶ್ನೆಯನ್ನು ಮಾತ್ರ ಉತ್ಪಾದಿಸುತ್ತದೆ.
ಶಕ್ತಿಯುತ ಪ್ರಾಂಪ್ಟ್:
ನಿಮ್ಮ ಪಾತ್ರ: SQL ಸಹಾಯಕ. ನನ್ನ ಬಳಿ "ವಹಿವಾಟು" ಟೇಬಲ್ ಇದೆ: ಕಾಲಮ್ಗಳ ಐಡಿ, ಗ್ರಾಹಕ_ಐಡಿ, ದಿನಾಂಕ (ಟೈಮ್ಸ್ಟ್ಯಾಂಪ್), ಮೊತ್ತ (ಸಂಖ್ಯೆ), ಚಾನಲ್ (ಪಠ್ಯ: 'ವೆಬ್'/'ಮೊಬೈಲ್'). ಕಾರ್ಯ: 2024 ವರ್ಷಕ್ಕೆ ಪ್ರತಿ ಚಾನಲ್ನಿಂದ 10,000 ಪ್ರತಿನಿಧಿ ಸಾಲುಗಳನ್ನು ಹಿಂತಿರುಗಿಸುವ ಪುನರಾವರ್ತನೀಯ (ಆರ್ಡರ್ ಮೂಲಕ ನಿರ್ಣಾಯಕ) ಪ್ರಶ್ನೆಯನ್ನು ಬರೆಯಿರಿ. ಉದ್ದೇಶ: ಚಾನಲ್ ತುಲನಾತ್ಮಕ ವಿಶ್ಲೇಷಣೆ. ನಿಮ್ಮ ಪ್ರಶ್ನೆಯ ಊಹೆಗಳನ್ನು ಪಟ್ಟಿ ಮಾಡಿ.
ಇಲ್ಲಿ ಟೇಬಲ್, ಉದ್ದೇಶ, ಗಾತ್ರ ಮತ್ತು ಪುನರಾವರ್ತನೆಯು ಸ್ಪಷ್ಟವಾಗಿದೆ.
ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು
- ಮಾದರಿಯ ಪ್ರಾತಿನಿಧ್ಯವನ್ನು ಪ್ರಶ್ನಿಸುತ್ತಿಲ್ಲ. ಸುಲಭವಾಗಿ ಪ್ರವೇಶಿಸಬಹುದಾದ ಡೇಟಾ ನಿಖರವಾದ ಡೇಟಾವಲ್ಲ; ಆಯ್ಕೆ ಪಕ್ಷಪಾತವು ಫಲಿತಾಂಶವನ್ನು ವಿರೂಪಗೊಳಿಸುತ್ತದೆ.
- ಕಾಲಮ್ ಅರ್ಥಗಳನ್ನು AI ಗೆ ಅಳವಡಿಸಿಕೊಳ್ಳುವುದು. ಮೂಲ ತಂಡವು ಅರ್ಥವನ್ನು ತಿಳಿದಿದೆ; AI ಮುನ್ಸೂಚನೆಯನ್ನು ದೃಢೀಕರಿಸದೆ ಬಳಸಬೇಡಿ.
- API ಫಾರ್ಮ್ಯಾಟ್/ಯೂನಿಟ್ ಬದಲಾವಣೆಯನ್ನು ಟ್ರ್ಯಾಕ್ ಮಾಡುತ್ತಿಲ್ಲ. ಮೂಕ ಬದಲಾವಣೆಯು ದಿನಗಳವರೆಗೆ ಭ್ರಷ್ಟ ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸುತ್ತದೆ.
- ಸಂಗ್ರಹ ಹಂತದಲ್ಲಿ ಸೋರಿಕೆಯನ್ನು ನಿರ್ಲಕ್ಷಿಸಲಾಗುತ್ತಿದೆ. "ಭವಿಷ್ಯದ ಸಮಯದಲ್ಲಿ ನಾನು ಅದನ್ನು ಹೊಂದಿದ್ದೇನೆ" ಎಂಬ ಪ್ರಶ್ನೆಯನ್ನು ಮೊದಲೇ ಕೇಳದಿದ್ದರೆ, ಮಾದರಿಯು ತಪ್ಪು ಯಶಸ್ಸನ್ನು ನೀಡುತ್ತದೆ.
- ಅನಧಿಕೃತ ಅಥವಾ ಅಕ್ರಮ ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸುವುದು. robots.txt, ಬಳಕೆಯ ನಿಯಮಗಳು ಮತ್ತು KVKK ಉಲ್ಲಂಘನೆಯು ಗಂಭೀರ ಅಪಾಯವಾಗಿದೆ.
ಸಲಹೆ: ಪ್ರತಿ ಹೊಸ ಡೇಟಾ ಮೂಲಕ್ಕಾಗಿ ಒಂದು ಪುಟದ "ಡೇಟಾ ಕಾರ್ಡ್" ಅನ್ನು ಇರಿಸಿ: ಮೂಲ, ಪುಲ್ ದಿನಾಂಕ, ಸಾಲುಗಳ ಸಂಖ್ಯೆ, ತಿಳಿದಿರುವ ಗಡಿಗಳು ಮತ್ತು ಕಾಲಮ್ಗಳು ಸೋರಿಕೆಯ ಅಪಾಯದಲ್ಲಿದೆ. ಈ ಕಾರ್ಡ್ ತಿಂಗಳ ನಂತರ "ಈ ಡೇಟಾ ಏನಾಗಿತ್ತು" ಪ್ರಶ್ನೆ ಮತ್ತು ಪುನರುತ್ಪಾದನೆಯನ್ನು ಉಳಿಸುತ್ತದೆ.
ಸಾರಾಂಶದಲ್ಲಿ
ವಿಶ್ಲೇಷಣೆಯ ಗುಣಮಟ್ಟವು ಸಂಗ್ರಹಿಸಿದ ಡೇಟಾದ ಗುಣಮಟ್ಟದಿಂದ ಸೀಮಿತವಾಗಿದೆ. ಮೂಲ (ಡೇಟಾಬೇಸ್, API, ಫೈಲ್, ಸ್ಕ್ರ್ಯಾಪ್) ಮತ್ತು ಸ್ಕೀಮಾವನ್ನು ಚೆನ್ನಾಗಿ ತಿಳಿಯಿರಿ; ಮಾದರಿಯು ಜನಸಂಖ್ಯೆಯ ಪ್ರತಿನಿಧಿಯಾಗಿದೆ ಎಂದು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಿ; "ಮುನ್ಸೂಚನೆಯ ಸಮಯದಲ್ಲಿ ನಾನು ಅದನ್ನು ಹೊಂದಿದ್ದೇನೆಯೇ?" ಎಂದು ಪ್ರತಿ ಕಾಲಮ್ ಅನ್ನು ಕೇಳುವ ಮೂಲಕ ಮೊದಲ ದಿನದಿಂದ ಸೋರಿಕೆಯನ್ನು ನಿವಾರಿಸಿ. AI ಪ್ರಶ್ನೆ ಮತ್ತು ಡಾಕ್ಯುಮೆಂಟ್ ಕೆಲಸಕ್ಕಾಗಿ ಉತ್ತಮ ವೇಗವರ್ಧಕವಾಗಿದೆ, ಆದರೆ ಯಾವ ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸಬೇಕು ಮತ್ತು ಅದರ ಪ್ರಾತಿನಿಧ್ಯವನ್ನು ಮಾನವರು ನಿರ್ಧರಿಸುತ್ತಾರೆ. ಅಧಿಕಾರ, ಕಾನೂನು ಮತ್ತು ಗೌಪ್ಯತೆಯ ಮಿತಿಗಳು ಯಾವಾಗಲೂ ಮೊದಲು ಬರುತ್ತವೆ.
ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ
ಡೇಟಾ ಮೂಲವನ್ನು ಆರಿಸಿ (ನಿಮ್ಮ ಸ್ವಂತ ವ್ಯವಹಾರದಿಂದ ಅಥವಾ ಕಾಲ್ಪನಿಕದಿಂದ). ಮೇಲಿನ "ಡೇಟಾ ನಿಘಂಟು ಹೊರತೆಗೆಯುವಿಕೆ" ಟೆಂಪ್ಲೇಟ್ನೊಂದಿಗೆ AI ನಿಂದ ಡೇಟಾ ನಿಘಂಟಿನ ಕರಡು ಪಡೆಯಿರಿ; ನಂತರ ಅದು ಸೋರಿಕೆಯಾಗಿದೆಯೇ ಎಂದು ನೋಡಲು ಪ್ರತಿ ಕಾಲಮ್ ಅನ್ನು ಹಸ್ತಚಾಲಿತವಾಗಿ ಮೌಲ್ಯಮಾಪನ ಮಾಡಿ. ಕನಿಷ್ಠ ಒಂದು ಅನುಮಾನಾಸ್ಪದ/ಸೋರಿಕೆ ಕಾಲಮ್ ಅನ್ನು ಹುಡುಕಲು ಪ್ರಯತ್ನಿಸಿ ಮತ್ತು ಅದು ಏಕೆ ಅಪಾಯಕಾರಿ ಎಂದು ಒಂದೇ ವಾಕ್ಯದಲ್ಲಿ ಬರೆಯಿರಿ.
ಪರಿಶೀಲನಾಪಟ್ಟಿ
- [ ] ನಾನು ಮೂಲ ತಂಡದೊಂದಿಗೆ ಡೇಟಾ ಮೂಲ ಮತ್ತು ಸ್ಕೀಮಾವನ್ನು ದೃಢೀಕರಿಸಿದ್ದೇನೆಯೇ?
- [ ] ಮಾದರಿಯು ಜನಸಂಖ್ಯೆಯ ಪ್ರತಿನಿಧಿಯಾಗಿದೆಯೇ ಎಂದು ನಾನು ಪರಿಶೀಲಿಸಿದ್ದೇನೆಯೇ?
- [ ] ನಾನು ಪ್ರತಿ ಕಾಲಮ್ಗೆ "ಅಂದಾಜು ಮಾಡುವ ಸಮಯದಲ್ಲಿ ನಾನು ಅದನ್ನು ಹೊಂದುತ್ತೇನೆಯೇ?" ಎಂಬ ಪ್ರಶ್ನೆಯನ್ನು ಕೇಳಿದ್ದೇನೆ.
- [ ] ನಾನು ಮಾದರಿಯನ್ನು ಪುನರಾವರ್ತಿಸಬಹುದಾದ (ಸ್ಥಿರ ಬೀಜ) ಮಾಡಿದ್ದೇನೆಯೇ?
- [ ] ನಾನು ಸಂಗ್ರಹಣೆಯ ಕಾನೂನು/ನೈತಿಕ (ಅಧಿಕಾರ, robots.txt, KVKK) ಮಿತಿಗಳನ್ನು ಪರಿಶೀಲಿಸಿದ್ದೇನೆಯೇ?