ಘಟಕಗಳು
1. ಡೇಟಾ ಸೈನ್ಸ್ ಮತ್ತು ಅನಾಲಿಟಿಕ್ಸ್‌ನಲ್ಲಿ ಆರ್ಟಿಫಿಶಿಯಲ್ ಇಂಟೆಲಿಜೆನ್ಸ್ ಪರಿಚಯ: ವರ್ಕ್‌ಫ್ಲೋ, ಪಾತ್ರಗಳು, ಬೌಂಡರೀಸ್, ವ್ಯಾಲಿಡೇಶನ್ ಮತ್ತು ಎಥಿಕ್ಸ್ 2. ಡೇಟಾ ಸಂಗ್ರಹಣೆ ಮತ್ತು ಮೂಲ ತಿಳುವಳಿಕೆ: ಸ್ಕೀಮಾ, ಮಾದರಿ, ಗುಣಮಟ್ಟ ಮತ್ತು ಸೋರಿಕೆ ಜಾಗೃತಿ 3. ಡೇಟಾ ಕ್ಲೀನಿಂಗ್ ಮತ್ತು ಪ್ರಿಪ್ರೊಸೆಸಿಂಗ್: ಕಾಣೆಯಾದ ಮೌಲ್ಯ, ಔಟ್‌ಲೈಯರ್ ಮತ್ತು ಪ್ರಕಾರದ ಪರಿವರ್ತನೆ 4. ಎಕ್ಸ್‌ಪ್ಲೋರೇಟರಿ ಡೇಟಾ ಅನಾಲಿಸಿಸ್ (EDA): ವಿತರಣೆಗಳು, ಸಂಬಂಧಗಳು ಮತ್ತು ಆರಂಭಿಕ ಒಳನೋಟಗಳು 5. ವೈಶಿಷ್ಟ್ಯ ಎಂಜಿನಿಯರಿಂಗ್: ರೂಪಾಂತರಗಳನ್ನು ರಚಿಸುವುದು, ಕೋಡಿಂಗ್, ಸ್ಕೇಲಿಂಗ್ ಮತ್ತು ಸೋರಿಕೆಯನ್ನು ತಪ್ಪಿಸುವುದು 6. ಮಾದರಿ ಕಟ್ಟಡ: ಸಮಸ್ಯೆಯ ವ್ಯಾಖ್ಯಾನ, ಅಲ್ಗಾರಿದಮ್ ಆಯ್ಕೆ ಮತ್ತು ತರಬೇತಿ/ಪರೀಕ್ಷೆ ವಿಭಜನೆ 7. ಮಾದರಿ ಮೌಲ್ಯಮಾಪನ: ಮೆಟ್ರಿಕ್ಸ್, ಕ್ರಾಸ್-ಮೌಲ್ಯಮಾಪನ, ಮತ್ತು ಎಕ್ಸ್ಟ್ರೀಮ್ ಕಲಿಕೆ 8. ದೃಶ್ಯೀಕರಣ ಮತ್ತು ಕಥೆ ಹೇಳುವಿಕೆ: ನಿಖರವಾದ ಗ್ರಾಫಿಕ್ಸ್, ಪ್ರಾಮಾಣಿಕ ಗ್ರಾಫಿಕ್ಸ್ 9. ಕೋಡ್ ಜನರೇಷನ್: ಪೈಥಾನ್ (ಪಾಂಡಾಗಳು) ಮತ್ತು SQL ಜೊತೆ AI-ಸಹಾಯದ ವಿಶ್ಲೇಷಣೆ 10. ಡೇಟಾ ಸೋರಿಕೆ ಮತ್ತು ಪುನರುತ್ಪಾದನೆ: ಮೌನ ವಿಪತ್ತುಗಳು ಮತ್ತು ಶಿಸ್ತು 11. MLOps ಫೌಂಡೇಶನ್, ನೀತಿಶಾಸ್ತ್ರ, ಗೌಪ್ಯತೆ ಮತ್ತು ಜವಾಬ್ದಾರಿಯುತ ವಿಶ್ಲೇಷಣೆ
ಘಟಕ 2 / 11

ಡೇಟಾ ಸಂಗ್ರಹಣೆ ಮತ್ತು ಮೂಲ ತಿಳುವಳಿಕೆ: ಸ್ಕೀಮಾ, ಮಾದರಿ, ಗುಣಮಟ್ಟ ಮತ್ತು ಸೋರಿಕೆ ಜಾಗೃತಿ

ಲಾಭಗಳು:

  • ವಿಭಿನ್ನ ಡೇಟಾ ಮೂಲಗಳನ್ನು (ಡೇಟಾಬೇಸ್, API, ಫೈಲ್, ವೆಬ್ ಸ್ಕ್ರ್ಯಾಪಿಂಗ್) ಮತ್ತು ಪ್ರತಿಯೊಂದರ ಮೋಸಗಳನ್ನು ಗುರುತಿಸುವ ಮತ್ತು ಸ್ಕೀಮಾವನ್ನು ಸರಿಯಾಗಿ ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಸಾಮರ್ಥ್ಯ
  • ಮಾದರಿಯು ಜನಸಂಖ್ಯೆ ಮತ್ತು ಆಯ್ಕೆಯ ಪಕ್ಷಪಾತವನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆಯೇ ಎಂಬುದನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವ ಮೂಲಕ ಪುನರಾವರ್ತಿತ ಮಾದರಿಯನ್ನು ನಿರ್ವಹಿಸುವ ಸಾಮರ್ಥ್ಯ
  • ಸಂಗ್ರಹದ ಹಂತದಲ್ಲಿ ಡೇಟಾ ಸೋರಿಕೆಯನ್ನು ತೊಡೆದುಹಾಕಲು ಮತ್ತು ಪ್ರತಿ ಕಾಲಮ್‌ನಲ್ಲಿ 'ಮುನ್ಸೂಚನೆಯ ಸಮಯದಲ್ಲಿ ನಾನು ಅದನ್ನು ಹೊಂದಬಹುದೇ' ಎಂಬ ಪ್ರಶ್ನೆಯನ್ನು ಕೇಳುವ ಮೂಲಕ ಕಾನೂನು/ನೈತಿಕ ಗಡಿಗಳನ್ನು ವೀಕ್ಷಿಸುವ ಸಾಮರ್ಥ್ಯ?

ಪ್ರತಿ ವಿಶ್ಲೇಷಣೆಯು ನೀವು ಸಂಗ್ರಹಿಸುವ ಡೇಟಾದ ಗುಣಮಟ್ಟದಂತೆ ಉತ್ತಮವಾಗಿದೆ. ವಿಶ್ವದ ಅತ್ಯಂತ ಮುಂದುವರಿದ ಮಾದರಿಯು ಸಹ ತಪ್ಪಾಗಿ ಸಂಗ್ರಹಿಸಿದ ಡೇಟಾದೊಂದಿಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸಿದರೆ, ಪೂರ್ವಾಗ್ರಹ ಪೀಡಿತವಾಗಿ ಅಥವಾ ಭವಿಷ್ಯದ ಬಗ್ಗೆ ಮಾಹಿತಿಯನ್ನು ಒಳಗೊಂಡಿದ್ದರೆ ಅದು ವಿಶ್ವಾಸಾರ್ಹವಲ್ಲದ ಫಲಿತಾಂಶಗಳನ್ನು ನೀಡುತ್ತದೆ. ಕಂಪ್ಯೂಟರ್ ವಿಜ್ಞಾನದಲ್ಲಿ, ಈ ತತ್ವವನ್ನು "ಗಾರ್ಬೇಜ್ ಇನ್, ಗಾರ್ಬೇಜ್ ಔಟ್" (ಗಾರ್ಬೇಜ್ ಇನ್, ಗಾರ್ಬೇಜ್ ಔಟ್) ಎಂದು ಸಂಕ್ಷೇಪಿಸಲಾಗಿದೆ. ಈ ಘಟಕದಲ್ಲಿ, ನಾವು ಡೇಟಾ ಸಂಗ್ರಹಣಾ ಹಂತವನ್ನು ಒಳಗೊಳ್ಳುತ್ತೇವೆ: ಮೂಲವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು, ಮಾದರಿ ಮಾಡುವುದು, ಗುಣಮಟ್ಟದ ಪ್ರಶ್ನೆಗಳನ್ನು ಕೇಳುವುದು ಮತ್ತು ಮೊದಲ ದಿನದಿಂದ ಡೇಟಾ ಸೋರಿಕೆಯ ಅಪಾಯದ ಬಗ್ಗೆ ಎಚ್ಚರವಾಗಿರುವುದು. ಈ ಹಂತದಲ್ಲಿ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯು ಪ್ರಬಲವಾದ ಸಹಾಯವಾಗಿದೆ; SQL ಪ್ರಶ್ನೆಯನ್ನು ಬರೆಯುತ್ತದೆ, API ಡಾಕ್ಯುಮೆಂಟ್ ಅನ್ನು ಸಾರಾಂಶಗೊಳಿಸುತ್ತದೆ, ಡೇಟಾ ಒಪ್ಪಂದವನ್ನು ಕರಡು ಮಾಡುತ್ತದೆ. ಆದರೆ ನೀವು ಯಾವ ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸುತ್ತೀರಿ ಮತ್ತು ಆ ಡೇಟಾ ನಿಮ್ಮನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆಯೇ ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸುವವನು ಮಾನವ.

ಡೇಟಾ ಮೂಲಗಳನ್ನು ತಿಳಿದುಕೊಳ್ಳುವುದು

ಡೇಟಾವು ವಿವಿಧ ಸ್ಥಳಗಳಿಂದ ಬರುತ್ತದೆ ಮತ್ತು ಪ್ರತಿ ಮೂಲವು ತನ್ನದೇ ಆದ ಅಪಾಯಗಳನ್ನು ಹೊಂದಿದೆ. ಡೇಟಾಬೇಸ್ (ಕೋಷ್ಟಕಗಳಲ್ಲಿ ಸಂಗ್ರಹಿಸಲಾದ ರಚನಾತ್ಮಕ ಡೇಟಾ, ಸಾಮಾನ್ಯವಾಗಿ SQL ನೊಂದಿಗೆ ಪ್ರಶ್ನಿಸಲಾಗುತ್ತದೆ) ಅತ್ಯಂತ ಸಾಮಾನ್ಯ ಮೂಲವಾಗಿದೆ; ಇದು ವಿಶ್ವಾಸಾರ್ಹವಾಗಿದೆ, ಆದರೆ ಅದರ ಯೋಜನೆಯನ್ನು ಚೆನ್ನಾಗಿ ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು ಅವಶ್ಯಕ. API (ಅಪ್ಲಿಕೇಶನ್ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಇಂಟರ್ಫೇಸ್) ಲೈವ್ ಡೇಟಾವನ್ನು ಒದಗಿಸುತ್ತದೆ ಆದರೆ ವೇಗ ಮಿತಿಗಳು ಮತ್ತು ಸ್ವರೂಪ ಬದಲಾವಣೆಗಳ ಅಪಾಯವನ್ನು ಹೊಂದಿರುತ್ತದೆ. ಫೈಲ್‌ಗಳು (CSV, Excel, JSON) ಹೊಂದಿಕೊಳ್ಳುವ ಆದರೆ ಫಾರ್ಮ್ಯಾಟ್ ಅಸಂಗತತೆಗೆ ಒಳಗಾಗುತ್ತವೆ. ವೆಬ್ ಸ್ಕ್ರ್ಯಾಪಿಂಗ್ ಶಕ್ತಿಯುತವಾಗಿದೆ, ಆದರೆ ಇದು ಕಾನೂನು ಮತ್ತು ನೈತಿಕ ಮಿತಿಗಳನ್ನು ಹೊಂದಿದೆ; ಪ್ರತಿಯೊಂದು ಸೈಟ್ ಅನ್ನು ಸ್ಕ್ರ್ಯಾಪ್ ಮಾಡಲಾಗುವುದಿಲ್ಲ.

ಗಮನ: ವೆಬ್ ಸ್ಕ್ರ್ಯಾಪಿಂಗ್ ಮತ್ತು ಸ್ವಯಂಚಾಲಿತ ಡೇಟಾ ಸಂಗ್ರಹಣೆಗಾಗಿ, ಸೈಟ್‌ನ ಬಳಕೆಯ ನಿಯಮಗಳು, robots.txt ಫೈಲ್ ಮತ್ತು KVKK/GDPR ಅನ್ನು ಅನುಸರಿಸಿ. ಅನಧಿಕೃತ ಡೇಟಾ ಸಂಗ್ರಹಣೆಯು ಕಾನೂನು ಹೊಣೆಗಾರಿಕೆಯನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ. ಮಾಹಿತಿ ಭದ್ರತೆಯ ಸಂದರ್ಭದಲ್ಲಿ, ನೀವು ಅಧಿಕೃತವಾಗಿರುವ ವ್ಯವಸ್ಥೆಗಳಲ್ಲಿ ಮತ್ತು ರಕ್ಷಣಾ/ವಿಶ್ಲೇಷಣೆ ಉದ್ದೇಶಗಳಿಗಾಗಿ ಮಾತ್ರ ಡೇಟಾ ಸಂಗ್ರಹಣೆ ಪರಿಕರಗಳನ್ನು ಬಳಸಿ; ಅನಧಿಕೃತ ಪ್ರವೇಶ ಅಥವಾ ಸ್ಕ್ರ್ಯಾಪಿಂಗ್ ಅನ್ನು ನಿಷೇಧಿಸಲಾಗಿದೆ.

ಸ್ಕೀಮಾವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು: ಡೇಟಾದೊಂದಿಗೆ ಪರಿಚಯ ಮಾಡಿಕೊಳ್ಳುವುದು

ಡೇಟಾ ಸೆಟ್ ಅನ್ನು ಸಂಗ್ರಹಿಸುವ ಮೊದಲು, ನೀವು ಅದರ ಸ್ಕೀಮಾವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಬೇಕು (ಕಾಲಮ್‌ಗಳ ಹೆಸರುಗಳು, ಅವುಗಳ ಡೇಟಾ ಪ್ರಕಾರಗಳು, ಅವುಗಳ ಅರ್ಥಗಳು ಮತ್ತು ಪರಸ್ಪರ ಸಂಬಂಧಗಳು). AI ಇಲ್ಲಿ "ಡೇಟಾ ಡಿಕ್ಷನರಿ" ಅನ್ನು ರಚಿಸಲು ತುಂಬಾ ಉಪಯುಕ್ತವಾಗಿದೆ - ಪ್ರತಿ ಕಾಲಮ್ ಎಂದರೆ ಏನು ಎಂದು ವಿವರಿಸುವ ಟೇಬಲ್. ಆದರೆ AI ಉತ್ಪಾದಿಸುವ ವಿವರಣೆಗಳು ಮುನ್ನೋಟಗಳಾಗಿವೆ; ಡೇಟಾವನ್ನು ತಯಾರಿಸಿದ ತಂಡದೊಂದಿಗೆ ಪ್ರತಿ ಕಾಲಮ್‌ನ ನಿಜವಾದ ಅರ್ಥವನ್ನು ದೃಢೀಕರಿಸಿ. ಉದಾಹರಣೆಗೆ, "ಸ್ಥಿತಿ" ಹೆಸರಿನ ಕಾಲಮ್ 0/1/2 ಅನ್ನು ಹೊಂದಿರಬಹುದು; ಇವುಗಳು "ಬಾಕಿ ಉಳಿದಿವೆ/ಅನುಮೋದಿಸಲಾಗಿದೆ/ರದ್ದು ಮಾಡಲಾಗಿದೆ" ಅಥವಾ ಇನ್ನೇನಾದರೂ ಎಂಬುದನ್ನು ಮೂಲ ತಂಡಕ್ಕೆ ಮಾತ್ರ ತಿಳಿದಿದೆ.

ಕೆಳಗಿನ ಕೋಷ್ಟಕವು ಮೂಲ ಸಂಪನ್ಮೂಲ ಪ್ರಕಾರಗಳು ಮತ್ತು ಎಚ್ಚರಿಕೆಗಳನ್ನು ಸಂಕ್ಷಿಪ್ತಗೊಳಿಸುತ್ತದೆ:

ಮೂಲ

ಬಲವಾದ ಬಿಂದು

ಬಲೆ

AI ಹೇಗೆ ಸಹಾಯ ಮಾಡುತ್ತದೆ

SQL ಡೇಟಾಬೇಸ್

ರಚನಾತ್ಮಕ, ವಿಶ್ವಾಸಾರ್ಹ

ಸಂಕೀರ್ಣ ಸೇರ್ಪಡೆಗಳು

ಪ್ರಶ್ನೆ ಕರಡು ಬರೆಯುತ್ತಾರೆ

API

ಲೈವ್ ಡೇಟಾ

ವೇಗದ ಮಿತಿ, ಆಕಾರ ಬದಲಾವಣೆ

ಡಾಕ್ಯುಮೆಂಟ್ ಸಾರಾಂಶಗಳು, ಪುಲ್ ಕೋಡ್

CSV/ಎಕ್ಸೆಲ್

ಹೊಂದಿಕೊಳ್ಳುವ, ವೇಗದ

ಸ್ವರೂಪದ ಅಸಂಗತತೆ

ಕೋಡ್ ಓದಿ/ಪಾರ್ಸ್ ಮಾಡಿ

ವೆಬ್ ಸ್ಕ್ರ್ಯಾಪಿಂಗ್

ವ್ಯಾಪಕ ವ್ಯಾಪ್ತಿ

ಕಾನೂನು/ನೈತಿಕ ಮಿತಿ

ಪಾರ್ಸಿಂಗ್ ಡ್ರಾಫ್ಟ್ (ಅಧಿಕಾರದೊಳಗೆ)

ಲಾಗ್/ಈವೆಂಟ್ ಡೇಟಾ

ವಿವರವಾದ

ಬೃಹತ್ ಪರಿಮಾಣ

ಫಿಲ್ಟರಿಂಗ್ ಪ್ರಶ್ನೆ

ವಿವರಣೆ: ಭಾಗವು ಸಂಪೂರ್ಣ ಪ್ರತಿನಿಧಿಸುತ್ತದೆಯೇ?

ಹೆಚ್ಚಿನ ಸಮಯ, ನೀವು ಸಂಪೂರ್ಣ ಡೇಟಾಕ್ಕಿಂತ ಹೆಚ್ಚಾಗಿ ಮಾದರಿಯೊಂದಿಗೆ (ಜನಸಂಖ್ಯೆಯಿಂದ ಆಯ್ಕೆಮಾಡಲಾದ ಉಪವಿಭಾಗ) ಕೆಲಸ ಮಾಡುತ್ತೀರಿ. ನಿರ್ಣಾಯಕ ಪ್ರಶ್ನೆಯೆಂದರೆ: ಈ ಮಾದರಿಯು ಜನಸಂಖ್ಯೆಯನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆಯೇ? ಆಯ್ಕೆ ಪಕ್ಷಪಾತವು ಅತ್ಯಂತ ಸಾಮಾನ್ಯವಾದ ಬಲೆಯಾಗಿದೆ. ಉದಾಹರಣೆಗೆ, ನೀವು ಮೊಬೈಲ್ ಅಪ್ಲಿಕೇಶನ್‌ನಿಂದ ಬಳಕೆದಾರರನ್ನು ಮಾತ್ರ ಮಾದರಿ ಮಾಡಿದರೆ, ನೀವು ವೆಬ್ ಬಳಕೆದಾರರನ್ನು ನೋಡುವುದಿಲ್ಲ ಮತ್ತು ನಿಮ್ಮ ಫಲಿತಾಂಶಗಳು ತಪ್ಪುದಾರಿಗೆಳೆಯುತ್ತವೆ. ಯಾದೃಚ್ಛಿಕ ಮಾದರಿ (ಪ್ರತಿ ದಾಖಲೆಯು ಆಯ್ಕೆಯಾಗುವ ಸಮಾನ ಅವಕಾಶವನ್ನು ಹೊಂದಿದೆ) ಹೆಚ್ಚಿನ ಸಂದರ್ಭಗಳಲ್ಲಿ ಸುರಕ್ಷಿತವಾಗಿದೆ; ಆದರೆ ಸಮಯ ಸರಣಿಯ ಡೇಟಾದಲ್ಲಿ, ವಿಭಜನೆಯನ್ನು ಯಾದೃಚ್ಛಿಕವಾಗಿ ಮಾಡದೆ ಕಾಲಾನುಕ್ರಮದಲ್ಲಿ ಮಾಡಲಾಗುತ್ತದೆ (ನಾವು ಇದನ್ನು ಘಟಕಗಳು 7 ಮತ್ತು 10 ರಲ್ಲಿ ನೋಡುತ್ತೇವೆ).

ಮೊದಲ ದಿನದಿಂದ ಸೋರಿಕೆ ಜಾಗೃತಿ

ಡೇಟಾ ಸೋರಿಕೆಯು ಹೆಚ್ಚಿನ ವಿಪತ್ತುಗಳ ಮೂಲವಾಗಿದೆ ಮತ್ತು ಸಾಮಾನ್ಯವಾಗಿ ಡೇಟಾ ಸಂಗ್ರಹಣೆ ಹಂತದಲ್ಲಿ ಉದ್ಭವಿಸುತ್ತದೆ. ಉದಾಹರಣೆ: "ಅದನ್ನು ರದ್ದುಗೊಳಿಸಲಾಗಿದೆಯೇ" ಎಂದು ಊಹಿಸುವಾಗ, ನೀವು ಡೇಟಾಗೆ "ರದ್ದತಿ ದಿನಾಂಕ" ಕಾಲಮ್ ಅನ್ನು ಸೇರಿಸಿದರೆ, ಮಾದರಿಯು ಭವಿಷ್ಯವನ್ನು ನೋಡುತ್ತದೆ. ಸಂಗ್ರಹಣೆಯ ಹಂತದಲ್ಲಿ, ಪ್ರತಿ ಕಾಲಮ್‌ಗೆ ಒಂದು ಪ್ರಶ್ನೆಯನ್ನು ಕೇಳಿ: "ನಾನು ಭವಿಷ್ಯ ನುಡಿಯುವ ಸಮಯದಲ್ಲಿ ಈ ಮಾಹಿತಿಯನ್ನು ನಾನು ಹೊಂದಿದ್ದೇನೆಯೇ?" ಇಲ್ಲ ಎಂಬ ಉತ್ತರ ಬಂದರೆ ಆ ಕಾಲಂ ಸೋರಿಕೆಯಾಗುತ್ತಿದೆ. ನಾವು ಘಟಕ 10 ರಲ್ಲಿ ಈ ವಿಷಯವನ್ನು ಆಳವಾಗಿ ಕವರ್ ಮಾಡುತ್ತೇವೆ; ಆದರೆ ಅರಿವು ಮೊದಲ ದಿನದಿಂದಲೇ ಆರಂಭವಾಗಬೇಕು.

ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು

ಪ್ರಕರಣ 1 - ಪ್ರಾತಿನಿಧ್ಯದ ಸಮಸ್ಯೆ. ಒಂದು ಬ್ಯಾಂಕ್ ತನ್ನ ಕ್ರೆಡಿಟ್ ರಿಸ್ಕ್ ಮಾದರಿಗಾಗಿ (18,500 ದಾಖಲೆಗಳು) ಅನುಮೋದಿತ ಸಾಲಗಳ ಡೇಟಾವನ್ನು ಮಾತ್ರ ಸಂಗ್ರಹಿಸಿದೆ. ನಿರಾಕರಣೆಗಳು ಡೇಟಾದಲ್ಲಿ ಇರಲಿಲ್ಲ. ನೈಜ ಜಗತ್ತಿನಲ್ಲಿ ಮಾದರಿಯು ತಪ್ಪಾಗಿದೆ ಏಕೆಂದರೆ ತಿರಸ್ಕರಿಸುವವರು ಹೇಗೆ ವರ್ತಿಸುತ್ತಾರೆ ಎಂಬುದನ್ನು ಅದು ಎಂದಿಗೂ ನೋಡಲಿಲ್ಲ. ಪಾಠ: ಮಾದರಿಯು ನಿಮ್ಮ ನಿರ್ಧಾರವನ್ನು ತೆಗೆದುಕೊಳ್ಳುವ ಸಂಪೂರ್ಣ ಜನಸಂಖ್ಯೆಯ ಪ್ರತಿನಿಧಿಯಾಗಿರಬೇಕು.

ಪ್ರಕರಣ 2 - ಮೌನ ರೂಪ ಬದಲಾವಣೆ. ಒಂದು ತಂಡವು ಪ್ರತಿದಿನ API ನಿಂದ ಬೆಲೆ ಡೇಟಾವನ್ನು ಎಳೆಯುತ್ತಿದೆ. ಒಂದು ದಿನ, API ಪೂರೈಕೆದಾರರು ಕರೆನ್ಸಿಯನ್ನು USD ನಿಂದ EUR ಗೆ ಬದಲಾಯಿಸಿದರು, ಆದರೆ ಡೊಮೇನ್ ಹೆಸರು ಒಂದೇ ಆಗಿರುತ್ತದೆ. 12 ದಿನಗಳವರೆಗೆ ತಪ್ಪು ಘಟಕದಲ್ಲಿ ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸಲಾಗಿದೆ; 3,200 ಲೈನ್‌ಗಳು ದೋಷಪೂರಿತವಾಗಿವೆ. ಪಾಠ: API ಡೇಟಾದಲ್ಲಿ ವಾಲ್ಯೂಮ್ ಮತ್ತು ಫಾರ್ಮ್ಯಾಟ್ ಸ್ಥಿರತೆಯನ್ನು ನಿಯಮಿತವಾಗಿ ಪರಿಶೀಲಿಸಿ.

ಪ್ರಕರಣ 3 - ಆರಂಭಿಕ ಸೋರಿಕೆ. "ಚರ್ನ್" ಅಂದಾಜಿಗಾಗಿ ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸುವಾಗ ವಿಶ್ಲೇಷಕರು "ಖಾತೆ ಮುಚ್ಚುವಿಕೆಗೆ ಕಾರಣ" ಕಾಲಮ್ ಅನ್ನು ಸೇರಿಸಿದ್ದಾರೆ. ಗ್ರಾಹಕರು ಹೋದ ನಂತರವೇ ಈ ಅಂಕಣವನ್ನು ಭರ್ತಿ ಮಾಡಲಾಗಿದೆ. ಮಾದರಿಯು ಪರೀಕ್ಷಾ ಸೆಟ್‌ನಲ್ಲಿ 97% ನಿಖರತೆಯನ್ನು ನೀಡಿತು; ಮುನ್ಸೂಚನೆಯ ಸಮಯದಲ್ಲಿ ಆ ಕಾಲಮ್ ಖಾಲಿಯಾಗಿದ್ದರಿಂದ ಅದು ಉತ್ಪಾದನೆಯಲ್ಲಿ ಕೆಲಸ ಮಾಡಲಿಲ್ಲ. ಪಾಠ: ಪ್ರತಿ ಕಾಲಮ್‌ಗೆ "ಭವಿಷ್ಯದ ಸಮಯದಲ್ಲಿ ನಾನು ಅದನ್ನು ಹೊಂದಿದ್ದೇನೆಯೇ?" ಎಂಬ ಪ್ರಶ್ನೆಯನ್ನು ಕೇಳಿ

ನಾಲ್ಕು ನಕಲಿಸಬಹುದಾದ ಟೆಂಪ್ಲೇಟ್‌ಗಳು

1) ಡೇಟಾ ನಿಘಂಟು ಹೊರತೆಗೆಯುವಿಕೆ:

ನಿಮ್ಮ ಪಾತ್ರ: ಡೇಟಾ ವಿಜ್ಞಾನಿ ಸಹಾಯಕ. ಕೋಷ್ಟಕದ ಕಾಲಮ್ ಹೆಸರುಗಳು ಮತ್ತು ಮಾದರಿ (ಅನಾಮಧೇಯ) ಮೌಲ್ಯಗಳನ್ನು ಕೆಳಗೆ ನೀಡಲಾಗಿದೆ. ಪ್ರತಿ ಕಾಲಮ್‌ಗೆ, ಅದರ ಅಂದಾಜು ಅರ್ಥ, ಡೇಟಾಟೈಪ್ ಮತ್ತು ಸಂಭಾವ್ಯ ಗುಣಮಟ್ಟದ ಅಪಾಯಗಳನ್ನು ಕೋಷ್ಟಕದಲ್ಲಿ ಪಟ್ಟಿ ಮಾಡಿ. ನೀವು ಖಚಿತವಾಗಿರದ ಕಾಲಮ್‌ಗಳನ್ನು "ದೃಢೀಕರಣದ ಅಗತ್ಯವಿದೆ" ಎಂದು ಗುರುತಿಸಿ; ಮೇಕಿಂಗ್ ಅರ್ಥ. ಕಾಲಮ್‌ಗಳು: [ಇಲ್ಲಿ ಅಂಟಿಸಿ]

2) ಮಾದರಿ ಕೋಡ್ (ಯಾದೃಚ್ಛಿಕ, ಪುನರಾವರ್ತಿಸಬಹುದಾದ):

ನನ್ನ ಬಳಿ ಪಾಂಡಾಗಳು ಡಿಎಫ್ ಇದೆ. 200,000 ಸಾಲುಗಳಿಂದ ಪ್ರತಿನಿಧಿ 5% ಯಾದೃಚ್ಛಿಕ ಮಾದರಿಯನ್ನು ಹೊರತೆಗೆಯುವ ಕೋಡ್ ಬರೆಯಿರಿ. random_state=42 ಬಳಸಿ (ಪುನರುತ್ಪಾದನೆಗಾಗಿ). ಮಾದರಿಯ ವರ್ಗ ವಿತರಣೆಯು ಜನಸಂಖ್ಯೆಗೆ ಹೋಲುತ್ತದೆ ಎಂದು ಪರಿಶೀಲಿಸಲು ಕೋಡ್ ಸೇರಿಸಿ.

3) ಲೀಕ್ ಸ್ಕ್ಯಾನಿಂಗ್ ಪ್ರಶ್ನೆ:

ನಾನು ನಿಮಗೆ ಈ ಕಾಲಮ್‌ಗಳ ಪಟ್ಟಿಯನ್ನು ನೀಡುತ್ತೇನೆ. "ಇದು ರದ್ದುಗೊಂಡಿದೆಯೇ" (0/1) ಊಹಿಸುವುದು ನನ್ನ ಗುರಿಯಾಗಿದೆ. ಪ್ರತಿ ಕಾಲಮ್‌ಗೆ, ಭವಿಷ್ಯವಾಣಿಯ ಸಮಯದಲ್ಲಿ ನಾನು ಅದನ್ನು ನಿಜವಾಗಿಯೂ ಹೊಂದಿದ್ದೇನೆಯೇ ಎಂದು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿ ಮತ್ತು ಅದನ್ನು "ಸುರಕ್ಷಿತ / ಅನುಮಾನಾಸ್ಪದ / ಸೋರಿಕೆ" ಎಂದು ಗುರುತಿಸಿ. ನಿಮ್ಮ ತಾರ್ಕಿಕತೆಯನ್ನು ಒಂದೇ ವಾಕ್ಯದಲ್ಲಿ ಬರೆಯಿರಿ. ಕಾಲಮ್‌ಗಳು: [ಪಟ್ಟಿ]

4) SQL ಪುಲ್ ಕ್ವೆರಿ ಡ್ರಾಫ್ಟ್:

ನಾನು PostgreSQL ನಲ್ಲಿ "ಆರ್ಡರ್‌ಗಳು" ಮತ್ತು "ಗ್ರಾಹಕರು" ಕೋಷ್ಟಕಗಳನ್ನು ಹೊಂದಿದ್ದೇನೆ. ಗ್ರಾಹಕ ನಗರದೊಂದಿಗೆ ಕಳೆದ 90 ದಿನಗಳ ಆರ್ಡರ್‌ಗಳನ್ನು ಸಂಯೋಜಿಸುವ ಮತ್ತು ಪ್ರತಿ ನಗರಕ್ಕೆ ಒಟ್ಟು ಮೊತ್ತ ಮತ್ತು ಆರ್ಡರ್‌ಗಳ ಸಂಖ್ಯೆಯನ್ನು ಹಿಂದಿರುಗಿಸುವ JOIN ಪ್ರಶ್ನೆಯನ್ನು ಬರೆಯಿರಿ. ದಿನಾಂಕ ಫಿಲ್ಟರ್ ಮತ್ತು NULL ನಗರಗಳನ್ನು ಹೇಗೆ ನಿರ್ವಹಿಸಲಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ವಿವರಿಸಿ. ನಾನು ಪ್ರಶ್ನೆಯನ್ನು ರನ್ ಮಾಡುತ್ತೇನೆ ಮತ್ತು ಅದನ್ನು ಪರಿಶೀಲಿಸುತ್ತೇನೆ.

ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್ / ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್

ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್:

ಈ ಡೇಟಾಬೇಸ್‌ನಿಂದ ನನಗೆ ಉತ್ತಮ ಮಾದರಿ ಡೇಟಾವನ್ನು ಎಳೆಯಿರಿ.

"ಒಳ್ಳೆಯದು" ಅಸ್ಪಷ್ಟವಾಗಿದೆ; ಯಾವ ಚಿತ್ರಕಲೆ, ಯಾವ ಅವಧಿ, ಯಾವ ಗಾತ್ರ, ಯಾವ ಉದ್ದೇಶವು ಸ್ಪಷ್ಟವಾಗಿಲ್ಲ. AI ಸಾಮಾನ್ಯ, ಪ್ರಾಯಶಃ ತಪ್ಪು ಪ್ರಶ್ನೆಯನ್ನು ಮಾತ್ರ ಉತ್ಪಾದಿಸುತ್ತದೆ.

ಶಕ್ತಿಯುತ ಪ್ರಾಂಪ್ಟ್:

ನಿಮ್ಮ ಪಾತ್ರ: SQL ಸಹಾಯಕ. ನನ್ನ ಬಳಿ "ವಹಿವಾಟು" ಟೇಬಲ್ ಇದೆ: ಕಾಲಮ್‌ಗಳ ಐಡಿ, ಗ್ರಾಹಕ_ಐಡಿ, ದಿನಾಂಕ (ಟೈಮ್‌ಸ್ಟ್ಯಾಂಪ್), ಮೊತ್ತ (ಸಂಖ್ಯೆ), ಚಾನಲ್ (ಪಠ್ಯ: 'ವೆಬ್'/'ಮೊಬೈಲ್'). ಕಾರ್ಯ: 2024 ವರ್ಷಕ್ಕೆ ಪ್ರತಿ ಚಾನಲ್‌ನಿಂದ 10,000 ಪ್ರತಿನಿಧಿ ಸಾಲುಗಳನ್ನು ಹಿಂತಿರುಗಿಸುವ ಪುನರಾವರ್ತನೀಯ (ಆರ್ಡರ್ ಮೂಲಕ ನಿರ್ಣಾಯಕ) ಪ್ರಶ್ನೆಯನ್ನು ಬರೆಯಿರಿ. ಉದ್ದೇಶ: ಚಾನಲ್ ತುಲನಾತ್ಮಕ ವಿಶ್ಲೇಷಣೆ. ನಿಮ್ಮ ಪ್ರಶ್ನೆಯ ಊಹೆಗಳನ್ನು ಪಟ್ಟಿ ಮಾಡಿ.

ಇಲ್ಲಿ ಟೇಬಲ್, ಉದ್ದೇಶ, ಗಾತ್ರ ಮತ್ತು ಪುನರಾವರ್ತನೆಯು ಸ್ಪಷ್ಟವಾಗಿದೆ.

ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು

  • ಮಾದರಿಯ ಪ್ರಾತಿನಿಧ್ಯವನ್ನು ಪ್ರಶ್ನಿಸುತ್ತಿಲ್ಲ. ಸುಲಭವಾಗಿ ಪ್ರವೇಶಿಸಬಹುದಾದ ಡೇಟಾ ನಿಖರವಾದ ಡೇಟಾವಲ್ಲ; ಆಯ್ಕೆ ಪಕ್ಷಪಾತವು ಫಲಿತಾಂಶವನ್ನು ವಿರೂಪಗೊಳಿಸುತ್ತದೆ.
  • ಕಾಲಮ್ ಅರ್ಥಗಳನ್ನು AI ಗೆ ಅಳವಡಿಸಿಕೊಳ್ಳುವುದು. ಮೂಲ ತಂಡವು ಅರ್ಥವನ್ನು ತಿಳಿದಿದೆ; AI ಮುನ್ಸೂಚನೆಯನ್ನು ದೃಢೀಕರಿಸದೆ ಬಳಸಬೇಡಿ.
  • API ಫಾರ್ಮ್ಯಾಟ್/ಯೂನಿಟ್ ಬದಲಾವಣೆಯನ್ನು ಟ್ರ್ಯಾಕ್ ಮಾಡುತ್ತಿಲ್ಲ. ಮೂಕ ಬದಲಾವಣೆಯು ದಿನಗಳವರೆಗೆ ಭ್ರಷ್ಟ ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸುತ್ತದೆ.
  • ಸಂಗ್ರಹ ಹಂತದಲ್ಲಿ ಸೋರಿಕೆಯನ್ನು ನಿರ್ಲಕ್ಷಿಸಲಾಗುತ್ತಿದೆ. "ಭವಿಷ್ಯದ ಸಮಯದಲ್ಲಿ ನಾನು ಅದನ್ನು ಹೊಂದಿದ್ದೇನೆ" ಎಂಬ ಪ್ರಶ್ನೆಯನ್ನು ಮೊದಲೇ ಕೇಳದಿದ್ದರೆ, ಮಾದರಿಯು ತಪ್ಪು ಯಶಸ್ಸನ್ನು ನೀಡುತ್ತದೆ.
  • ಅನಧಿಕೃತ ಅಥವಾ ಅಕ್ರಮ ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸುವುದು. robots.txt, ಬಳಕೆಯ ನಿಯಮಗಳು ಮತ್ತು KVKK ಉಲ್ಲಂಘನೆಯು ಗಂಭೀರ ಅಪಾಯವಾಗಿದೆ.
ಸಲಹೆ: ಪ್ರತಿ ಹೊಸ ಡೇಟಾ ಮೂಲಕ್ಕಾಗಿ ಒಂದು ಪುಟದ "ಡೇಟಾ ಕಾರ್ಡ್" ಅನ್ನು ಇರಿಸಿ: ಮೂಲ, ಪುಲ್ ದಿನಾಂಕ, ಸಾಲುಗಳ ಸಂಖ್ಯೆ, ತಿಳಿದಿರುವ ಗಡಿಗಳು ಮತ್ತು ಕಾಲಮ್‌ಗಳು ಸೋರಿಕೆಯ ಅಪಾಯದಲ್ಲಿದೆ. ಈ ಕಾರ್ಡ್ ತಿಂಗಳ ನಂತರ "ಈ ಡೇಟಾ ಏನಾಗಿತ್ತು" ಪ್ರಶ್ನೆ ಮತ್ತು ಪುನರುತ್ಪಾದನೆಯನ್ನು ಉಳಿಸುತ್ತದೆ.

ಸಾರಾಂಶದಲ್ಲಿ

ವಿಶ್ಲೇಷಣೆಯ ಗುಣಮಟ್ಟವು ಸಂಗ್ರಹಿಸಿದ ಡೇಟಾದ ಗುಣಮಟ್ಟದಿಂದ ಸೀಮಿತವಾಗಿದೆ. ಮೂಲ (ಡೇಟಾಬೇಸ್, API, ಫೈಲ್, ಸ್ಕ್ರ್ಯಾಪ್) ಮತ್ತು ಸ್ಕೀಮಾವನ್ನು ಚೆನ್ನಾಗಿ ತಿಳಿಯಿರಿ; ಮಾದರಿಯು ಜನಸಂಖ್ಯೆಯ ಪ್ರತಿನಿಧಿಯಾಗಿದೆ ಎಂದು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಿ; "ಮುನ್ಸೂಚನೆಯ ಸಮಯದಲ್ಲಿ ನಾನು ಅದನ್ನು ಹೊಂದಿದ್ದೇನೆಯೇ?" ಎಂದು ಪ್ರತಿ ಕಾಲಮ್ ಅನ್ನು ಕೇಳುವ ಮೂಲಕ ಮೊದಲ ದಿನದಿಂದ ಸೋರಿಕೆಯನ್ನು ನಿವಾರಿಸಿ. AI ಪ್ರಶ್ನೆ ಮತ್ತು ಡಾಕ್ಯುಮೆಂಟ್ ಕೆಲಸಕ್ಕಾಗಿ ಉತ್ತಮ ವೇಗವರ್ಧಕವಾಗಿದೆ, ಆದರೆ ಯಾವ ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸಬೇಕು ಮತ್ತು ಅದರ ಪ್ರಾತಿನಿಧ್ಯವನ್ನು ಮಾನವರು ನಿರ್ಧರಿಸುತ್ತಾರೆ. ಅಧಿಕಾರ, ಕಾನೂನು ಮತ್ತು ಗೌಪ್ಯತೆಯ ಮಿತಿಗಳು ಯಾವಾಗಲೂ ಮೊದಲು ಬರುತ್ತವೆ.

ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ

ಡೇಟಾ ಮೂಲವನ್ನು ಆರಿಸಿ (ನಿಮ್ಮ ಸ್ವಂತ ವ್ಯವಹಾರದಿಂದ ಅಥವಾ ಕಾಲ್ಪನಿಕದಿಂದ). ಮೇಲಿನ "ಡೇಟಾ ನಿಘಂಟು ಹೊರತೆಗೆಯುವಿಕೆ" ಟೆಂಪ್ಲೇಟ್‌ನೊಂದಿಗೆ AI ನಿಂದ ಡೇಟಾ ನಿಘಂಟಿನ ಕರಡು ಪಡೆಯಿರಿ; ನಂತರ ಅದು ಸೋರಿಕೆಯಾಗಿದೆಯೇ ಎಂದು ನೋಡಲು ಪ್ರತಿ ಕಾಲಮ್ ಅನ್ನು ಹಸ್ತಚಾಲಿತವಾಗಿ ಮೌಲ್ಯಮಾಪನ ಮಾಡಿ. ಕನಿಷ್ಠ ಒಂದು ಅನುಮಾನಾಸ್ಪದ/ಸೋರಿಕೆ ಕಾಲಮ್ ಅನ್ನು ಹುಡುಕಲು ಪ್ರಯತ್ನಿಸಿ ಮತ್ತು ಅದು ಏಕೆ ಅಪಾಯಕಾರಿ ಎಂದು ಒಂದೇ ವಾಕ್ಯದಲ್ಲಿ ಬರೆಯಿರಿ.

ಪರಿಶೀಲನಾಪಟ್ಟಿ

  • [ ] ನಾನು ಮೂಲ ತಂಡದೊಂದಿಗೆ ಡೇಟಾ ಮೂಲ ಮತ್ತು ಸ್ಕೀಮಾವನ್ನು ದೃಢೀಕರಿಸಿದ್ದೇನೆಯೇ?
  • [ ] ಮಾದರಿಯು ಜನಸಂಖ್ಯೆಯ ಪ್ರತಿನಿಧಿಯಾಗಿದೆಯೇ ಎಂದು ನಾನು ಪರಿಶೀಲಿಸಿದ್ದೇನೆಯೇ?
  • [ ] ನಾನು ಪ್ರತಿ ಕಾಲಮ್‌ಗೆ "ಅಂದಾಜು ಮಾಡುವ ಸಮಯದಲ್ಲಿ ನಾನು ಅದನ್ನು ಹೊಂದುತ್ತೇನೆಯೇ?" ಎಂಬ ಪ್ರಶ್ನೆಯನ್ನು ಕೇಳಿದ್ದೇನೆ.
  • [ ] ನಾನು ಮಾದರಿಯನ್ನು ಪುನರಾವರ್ತಿಸಬಹುದಾದ (ಸ್ಥಿರ ಬೀಜ) ಮಾಡಿದ್ದೇನೆಯೇ?
  • [ ] ನಾನು ಸಂಗ್ರಹಣೆಯ ಕಾನೂನು/ನೈತಿಕ (ಅಧಿಕಾರ, robots.txt, KVKK) ಮಿತಿಗಳನ್ನು ಪರಿಶೀಲಿಸಿದ್ದೇನೆಯೇ?