ಘಟಕಗಳು
1. ಡೇಟಾ ಸೈನ್ಸ್ ಮತ್ತು ಅನಾಲಿಟಿಕ್ಸ್‌ನಲ್ಲಿ ಆರ್ಟಿಫಿಶಿಯಲ್ ಇಂಟೆಲಿಜೆನ್ಸ್ ಪರಿಚಯ: ವರ್ಕ್‌ಫ್ಲೋ, ಪಾತ್ರಗಳು, ಬೌಂಡರೀಸ್, ವ್ಯಾಲಿಡೇಶನ್ ಮತ್ತು ಎಥಿಕ್ಸ್ 2. ಡೇಟಾ ಸಂಗ್ರಹಣೆ ಮತ್ತು ಮೂಲ ತಿಳುವಳಿಕೆ: ಸ್ಕೀಮಾ, ಮಾದರಿ, ಗುಣಮಟ್ಟ ಮತ್ತು ಸೋರಿಕೆ ಜಾಗೃತಿ 3. ಡೇಟಾ ಕ್ಲೀನಿಂಗ್ ಮತ್ತು ಪ್ರಿಪ್ರೊಸೆಸಿಂಗ್: ಕಾಣೆಯಾದ ಮೌಲ್ಯ, ಔಟ್‌ಲೈಯರ್ ಮತ್ತು ಪ್ರಕಾರದ ಪರಿವರ್ತನೆ 4. ಎಕ್ಸ್‌ಪ್ಲೋರೇಟರಿ ಡೇಟಾ ಅನಾಲಿಸಿಸ್ (EDA): ವಿತರಣೆಗಳು, ಸಂಬಂಧಗಳು ಮತ್ತು ಆರಂಭಿಕ ಒಳನೋಟಗಳು 5. ವೈಶಿಷ್ಟ್ಯ ಎಂಜಿನಿಯರಿಂಗ್: ರೂಪಾಂತರಗಳನ್ನು ರಚಿಸುವುದು, ಕೋಡಿಂಗ್, ಸ್ಕೇಲಿಂಗ್ ಮತ್ತು ಸೋರಿಕೆಯನ್ನು ತಪ್ಪಿಸುವುದು 6. ಮಾದರಿ ಕಟ್ಟಡ: ಸಮಸ್ಯೆಯ ವ್ಯಾಖ್ಯಾನ, ಅಲ್ಗಾರಿದಮ್ ಆಯ್ಕೆ ಮತ್ತು ತರಬೇತಿ/ಪರೀಕ್ಷೆ ವಿಭಜನೆ 7. ಮಾದರಿ ಮೌಲ್ಯಮಾಪನ: ಮೆಟ್ರಿಕ್ಸ್, ಕ್ರಾಸ್-ಮೌಲ್ಯಮಾಪನ, ಮತ್ತು ಎಕ್ಸ್ಟ್ರೀಮ್ ಕಲಿಕೆ 8. ದೃಶ್ಯೀಕರಣ ಮತ್ತು ಕಥೆ ಹೇಳುವಿಕೆ: ನಿಖರವಾದ ಗ್ರಾಫಿಕ್ಸ್, ಪ್ರಾಮಾಣಿಕ ಗ್ರಾಫಿಕ್ಸ್ 9. ಕೋಡ್ ಜನರೇಷನ್: ಪೈಥಾನ್ (ಪಾಂಡಾಗಳು) ಮತ್ತು SQL ಜೊತೆ AI-ಸಹಾಯದ ವಿಶ್ಲೇಷಣೆ 10. ಡೇಟಾ ಸೋರಿಕೆ ಮತ್ತು ಪುನರುತ್ಪಾದನೆ: ಮೌನ ವಿಪತ್ತುಗಳು ಮತ್ತು ಶಿಸ್ತು 11. MLOps ಫೌಂಡೇಶನ್, ನೀತಿಶಾಸ್ತ್ರ, ಗೌಪ್ಯತೆ ಮತ್ತು ಜವಾಬ್ದಾರಿಯುತ ವಿಶ್ಲೇಷಣೆ
ಘಟಕ 4 / 11

ಎಕ್ಸ್‌ಪ್ಲೋರೇಟರಿ ಡೇಟಾ ಅನಾಲಿಸಿಸ್ (EDA): ವಿತರಣೆಗಳು, ಸಂಬಂಧಗಳು ಮತ್ತು ಆರಂಭಿಕ ಒಳನೋಟಗಳು

ಲಾಭಗಳು:

  • ಸೂಕ್ತವಾದ ಗ್ರಾಫ್‌ಗಳೊಂದಿಗೆ (ಹಿಸ್ಟೋಗ್ರಾಮ್, ಬಾಕ್ಸ್ ಪ್ಲಾಟ್, ಸ್ಕ್ಯಾಟರ್ ಪ್ಲಾಟ್) ವೇರಿಯಬಲ್‌ಗಳ ವಿತರಣೆ, ಕೇಂದ್ರ, ಹರಡುವಿಕೆ ಮತ್ತು ವೈಪರೀತ್ಯಗಳನ್ನು ಅನ್ವೇಷಿಸುವ ಸಾಮರ್ಥ್ಯ.
  • ಪರಸ್ಪರ ಸಂಬಂಧವನ್ನು ಸರಿಯಾಗಿ ಅರ್ಥೈಸುವ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ಅದನ್ನು ಕಾರಣದಿಂದ ಗೊಂದಲಗೊಳಿಸದೆ ಸ್ಕ್ಯಾಟರ್ ಕಥಾವಸ್ತುವಿನ ಜೊತೆಗೆ ಓದುವುದು
  • ಸಾರಾಂಶದ ಅಂಕಿಅಂಶಗಳು ತಪ್ಪುದಾರಿಗೆಳೆಯಬಲ್ಲವು ಎಂದು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಸಾಮರ್ಥ್ಯ (ಆನ್ಸ್‌ಕಾಂಬ್ ಪಾಠ) ಮತ್ತು ಮಾಡೆಲಿಂಗ್‌ನ ದಿಕ್ಕನ್ನು ನಿರ್ಧರಿಸುವ ಊಹೆಗಳನ್ನು ಅಭಿವೃದ್ಧಿಪಡಿಸುವುದು.

ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸುವ ಮೊದಲು, ಡೇಟಾವನ್ನು ತಿಳಿದುಕೊಳ್ಳುವುದು ಅವಶ್ಯಕ. ರೋಗಿಯನ್ನು ಪರೀಕ್ಷಿಸದೆ ವೈದ್ಯರು ಔಷಧಿಗಳನ್ನು ಶಿಫಾರಸು ಮಾಡುವುದಿಲ್ಲ, ಡೇಟಾ ವಿಜ್ಞಾನಿಗಳು ಡೇಟಾವನ್ನು "ಪರೀಕ್ಷಿಸದೆ" ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸುವುದಿಲ್ಲ. ಈ ಪರೀಕ್ಷೆಯನ್ನು ಪರಿಶೋಧನಾ ದತ್ತಾಂಶ ವಿಶ್ಲೇಷಣೆ ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ (ಸಂಕ್ಷಿಪ್ತವಾಗಿ EDA): ಇದು ದೃಷ್ಟಿಗೋಚರವಾಗಿ ಮತ್ತು ಸಚಿತ್ರವಾಗಿ ಡೇಟಾದ ವಿತರಣೆ, ಸಂಬಂಧಗಳು, ಆಶ್ಚರ್ಯಗಳು ಮತ್ತು ಬಲೆಗಳನ್ನು ಕಂಡುಹಿಡಿಯುವ ಹಂತವಾಗಿದೆ. EDA ಯ ಉದ್ದೇಶವು ಊಹೆಗಳನ್ನು ಸೃಷ್ಟಿಸುವುದು, ದೋಷಗಳನ್ನು ಹಿಡಿಯುವುದು ಮತ್ತು ಮಾಡೆಲಿಂಗ್ ದಿಕ್ಕನ್ನು ನಿರ್ಧರಿಸುವುದು. ಈ ಹಂತದಲ್ಲಿ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯು ಅತ್ಯಂತ ಶಕ್ತಿಯುತ ಸಹಾಯಕವಾಗಿದೆ: ಇದು ಯಾವ ಚಾರ್ಟ್ ಸೂಕ್ತವಾಗಿದೆ ಎಂಬುದನ್ನು ಸೂಚಿಸುತ್ತದೆ, ಅದರ ಕೋಡ್ ಅನ್ನು ಬರೆಯುತ್ತದೆ, ವಿತರಣೆಯನ್ನು ಅರ್ಥೈಸುತ್ತದೆ. ಆದರೆ ಒಬ್ಬ ವ್ಯಕ್ತಿಯು ಅವನ/ಅವಳ ಕ್ಷೇತ್ರದ ಜ್ಞಾನದಿಂದ ಅವನು ನೋಡುವ ಮಾದರಿಯು ನಿಜವೇ ಅಥವಾ ಕಾಕತಾಳೀಯವೇ ಎಂದು ನಿರ್ಧರಿಸುತ್ತಾನೆ.

EDA ಏನು ಹುಡುಕುತ್ತದೆ?

EDA ನಾಲ್ಕು ಪ್ರಶ್ನೆಗಳಿಗೆ ಉತ್ತರಗಳನ್ನು ಹುಡುಕುತ್ತದೆ. ವಿತರಣೆ: ಪ್ರತಿ ವೇರಿಯೇಬಲ್ ಅನ್ನು ಹೇಗೆ ವಿತರಿಸಲಾಗುತ್ತದೆ - ಇದು ಸಮ್ಮಿತೀಯ, ಓರೆಯಾದ ಅಥವಾ ಎರಡು-ಶಿಖರವಾಗಿದೆಯೇ? ಕೇಂದ್ರ ಪ್ರವೃತ್ತಿ ಮತ್ತು ಹರಡುವಿಕೆ: ಸರಾಸರಿ, ಸರಾಸರಿ, ಪ್ರಮಾಣಿತ ವಿಚಲನ ಎಂದರೇನು? ಸಂಬಂಧಗಳು: ಅಸ್ಥಿರಗಳು ಪರಸ್ಪರ ಹೇಗೆ ಸಂಬಂಧಿಸಿವೆ? ವೈಪರೀತ್ಯಗಳು: ಅನಿರೀಕ್ಷಿತ ಮೌಲ್ಯಗಳು, ಅಂತರಗಳು, ಗುಂಪುಗಳು ಇವೆಯೇ? ಈ ನಾಲ್ಕು ಪ್ರಶ್ನೆಗಳು ಯಾವ ವೈಶಿಷ್ಟ್ಯವು ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ ಮತ್ತು ಯಾವ ಮಾದರಿ ಸೂಕ್ತವಾಗಿದೆ ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ.

ಕೆಲವು ಮೂಲಭೂತ ಪರಿಕಲ್ಪನೆಗಳನ್ನು ವ್ಯಾಖ್ಯಾನಿಸೋಣ. ಹಿಸ್ಟೋಗ್ರಾಮ್ ಎನ್ನುವುದು ಸಂಖ್ಯಾತ್ಮಕ ವೇರಿಯಬಲ್‌ನ ಮೌಲ್ಯಗಳನ್ನು ಮಧ್ಯಂತರಗಳಾಗಿ ವಿಭಜಿಸುವ ಒಂದು ಗ್ರಾಫ್ ಮತ್ತು ಪ್ರತಿ ಮಧ್ಯಂತರದಲ್ಲಿ ಎಷ್ಟು ಅವಲೋಕನಗಳಿವೆ ಎಂಬುದನ್ನು ತೋರಿಸುತ್ತದೆ; ವಿತರಣೆಯನ್ನು ನೋಡಲು ಇದು ಅತ್ಯಂತ ವೇಗವಾದ ಮಾರ್ಗವಾಗಿದೆ. ಓರೆಯು ಒಂದು ದಿಕ್ಕಿನಲ್ಲಿ ವಿತರಣೆಯ ಬದಲಾವಣೆಯಾಗಿದೆ; ಆದಾಯದಂತಹ ವೇರಿಯೇಬಲ್‌ಗಳು ಬಲಕ್ಕೆ ಓರೆಯಾಗಿರುತ್ತವೆ (ಬಹುತೇಕ ಕಡಿಮೆ, ಕೆಲವು ಅತಿ ಹೆಚ್ಚು). ಒಂದು ಬಾಕ್ಸ್ ಕಥಾವಸ್ತುವು ಸರಾಸರಿ, ಕ್ವಾರ್ಟೈಲ್ಸ್ ಮತ್ತು ಔಟ್ಲೈಯರ್ಗಳನ್ನು ಒಂದು ನೋಟದಲ್ಲಿ ತೋರಿಸುತ್ತದೆ. ಒಂದು ಸ್ಕ್ಯಾಟರ್ ಕಥಾವಸ್ತುವು ಬಿಂದುಗಳ ಮೋಡದೊಂದಿಗೆ ಎರಡು ಸಂಖ್ಯಾತ್ಮಕ ಅಸ್ಥಿರಗಳ ಸಂಬಂಧವನ್ನು ತೋರಿಸುತ್ತದೆ.

ಪರಸ್ಪರ ಸಂಬಂಧ: ಸಂಬಂಧವಿದೆ ಆದರೆ ಜಾಗರೂಕರಾಗಿರಿ

ಪರಸ್ಪರ ಸಂಬಂಧ - ಎರಡು ಅಸ್ಥಿರಗಳು ಹೇಗೆ ಒಟ್ಟಿಗೆ ಚಲಿಸುತ್ತವೆ ಎಂಬುದರ ಅಳತೆ; -1 ಮತ್ತು +1 ನಡುವಿನ ಸಂಖ್ಯೆ - EDA ಯ ಹೆಚ್ಚು ಬಳಸಿದ ಮತ್ತು ಹೆಚ್ಚು ತಪ್ಪಾಗಿ ಅರ್ಥೈಸಿಕೊಳ್ಳುವ ಸಾಧನವಾಗಿದೆ. +1 ಎಂದರೆ ಪರಿಪೂರ್ಣ ಸಹ-ಹೆಚ್ಚಳ, -1 ಎಂದರೆ ಪರಿಪೂರ್ಣ ವಿಲೋಮ ಸಂಬಂಧ, 0 ಎಂದರೆ ರೇಖಾತ್ಮಕ ಸಂಬಂಧವಿಲ್ಲ. ಎರಡು ದೊಡ್ಡ ಬಲೆಗಳಿವೆ. ಮೊದಲನೆಯದಾಗಿ, ಪ್ರಸಿದ್ಧ ನಿಯಮ: ಪರಸ್ಪರ ಸಂಬಂಧವು ಕಾರಣವಲ್ಲ. ಐಸ್ ಕ್ರೀಮ್ ಮಾರಾಟದೊಂದಿಗೆ ಉಸಿರುಗಟ್ಟಿಸುವ ಪ್ರಕರಣಗಳು ಹೆಚ್ಚಾಗುತ್ತವೆ; ಒಂದು ಇನ್ನೊಂದಕ್ಕೆ ಕಾರಣವಾಗುವುದರಿಂದ ಅಲ್ಲ, ಆದರೆ ಬೇಸಿಗೆ (ಗುಪ್ತ ಮೂರನೇ ವೇರಿಯಬಲ್) ಎರಡನ್ನೂ ಪ್ರಚೋದಿಸುತ್ತದೆ. ಎರಡನೆಯದಾಗಿ, ಪರಸ್ಪರ ಸಂಬಂಧವು ರೇಖೀಯ ಸಂಬಂಧವನ್ನು ಮಾತ್ರ ಅಳೆಯುತ್ತದೆ; ಇದು 0 ಗೆ ಹತ್ತಿರವಿರುವ ಬಲವಾದ ಆದರೆ ವಕ್ರರೇಖೆಯ ಸಂಬಂಧವನ್ನು ಸೂಚಿಸುತ್ತದೆ. ಆದ್ದರಿಂದ ಪರಸ್ಪರ ಸಂಬಂಧವನ್ನು ನೋಡುವಾಗ, ಸ್ಕ್ಯಾಟರ್ ಪ್ಲಾಟ್ ಅನ್ನು ನೋಡಲು ಮರೆಯದಿರಿ.

ಎಚ್ಚರಿಕೆ: AI ಪರಸ್ಪರ ಸಂಬಂಧದ ಸಂಖ್ಯೆಯನ್ನು ನೀಡಿದಾಗ, ಅದು "A ಹೆಚ್ಚಿಸುತ್ತದೆ B" ನಂತಹ ಸಾಂದರ್ಭಿಕ ಭಾಷೆಗೆ ಜಾರಿಕೊಳ್ಳಬಹುದು. ಇದು ಅಪಾಯಕಾರಿ. ಪರಸ್ಪರ ಸಂಬಂಧವು ಒಟ್ಟಿಗೆ ಚಲನೆಯನ್ನು ಮಾತ್ರ ಸೂಚಿಸುತ್ತದೆ; ಅನುಭವ, ಡೊಮೇನ್ ಜ್ಞಾನ ಮತ್ತು ಎಚ್ಚರಿಕೆಯ ನಿರ್ಣಯ ಮಾತ್ರ ಕಾರಣವನ್ನು ಸ್ಥಾಪಿಸುತ್ತದೆ.

Anscombe ಕ್ವಾರ್ಟೆಟ್: ಏಕೆ ಕೇವಲ ಸಂಖ್ಯೆಯನ್ನು ನೋಡಬಾರದು

ಅಂಕಿಅಂಶಗಳಲ್ಲಿ ಒಂದು ಪ್ರಸಿದ್ಧ ಉದಾಹರಣೆ ಇದೆ: ಆನ್ಸ್ಕೊಂಬೆ ಕ್ವಾರ್ಟೆಟ್. ನಾಲ್ಕು ವಿಭಿನ್ನ ಡೇಟಾ ಸೆಟ್‌ಗಳು ಬಹುತೇಕ ಒಂದೇ ಸರಾಸರಿ, ಒಂದೇ ವ್ಯತ್ಯಾಸ ಮತ್ತು ಒಂದೇ ಪರಸ್ಪರ ಸಂಬಂಧವನ್ನು ಹೊಂದಿವೆ (0.82); ಆದರೆ ಗ್ರಾಫ್ ಮಾಡಿದಾಗ, ಅವು ಸಂಪೂರ್ಣವಾಗಿ ವಿಭಿನ್ನವಾಗಿ ಕಾಣುತ್ತವೆ - ಒಂದು ನೇರ ರೇಖೆ, ಒಂದು ಬಾಗಿದ, ಒಂದು ಮೋಡವನ್ನು ಒಂದೇ ಹೊರಗಿನಿಂದ ಎಳೆಯಲಾಗುತ್ತದೆ. ಪಾಠವು ಸ್ಪಷ್ಟವಾಗಿದೆ: ಸಾರಾಂಶ ಅಂಕಿಅಂಶಗಳು ತಪ್ಪುದಾರಿಗೆಳೆಯುತ್ತಿವೆ, ಗ್ರಾಫ್ ಅನ್ನು ನೋಡುವುದು ಅತ್ಯಗತ್ಯ. AI ನಿಮಗೆ ಸರಾಸರಿ ಮತ್ತು ಪರಸ್ಪರ ಸಂಬಂಧಗಳನ್ನು ನೀಡಬಹುದು, ಆದರೆ ಗ್ರಾಫ್ ಅನ್ನು ನೋಡದೆಯೇ ಆ ಸಂಖ್ಯೆಗಳನ್ನು ನಂಬುವುದು ಆನ್ಸ್‌ಕಾಂಬ್ ಬಲೆಗೆ ಬೀಳುತ್ತಿದೆ.

ಕೆಳಗಿನ ಕೋಷ್ಟಕವು ಯಾವ ಚಾರ್ಟ್ ಯಾವ ಪ್ರಶ್ನೆಗೆ ಸರಿಹೊಂದುತ್ತದೆ ಎಂಬುದನ್ನು ಸಾರಾಂಶಗೊಳಿಸುತ್ತದೆ:

ಪ್ರಶ್ನೆ

ಸೂಕ್ತವಾದ ಗ್ರಾಫಿಕ್

ಏನು ತೋರಿಸುತ್ತದೆ

ಒಂದೇ ವೇರಿಯೇಬಲ್ನ ವಿತರಣೆ

ಹಿಸ್ಟೋಗ್ರಾಮ್ / ಕೆಡಿಇ

ಆಕಾರ, ಓರೆ, ಶೃಂಗಗಳ ಸಂಖ್ಯೆ

ಕೇಂದ್ರ ಮತ್ತು ಹೊರಗಿನವರು

ಬಾಕ್ಸ್ ಕಥಾವಸ್ತು

ಮಧ್ಯಮ, ಕ್ವಾರ್ಟೈಲ್ಸ್, ಔಟ್ಲೈಯರ್ಗಳು

ಎರಡು ಸಂಖ್ಯೆಗಳ ಸಂಬಂಧ

ಸ್ಕ್ಯಾಟರ್ ಚಾರ್ಟ್

ದಿಕ್ಕು, ಶಕ್ತಿ, ವಕ್ರತೆ

ವರ್ಗ ಹೋಲಿಕೆ

ಬಾರ್ ಚಾರ್ಟ್

ಗುಂಪುಗಳ ನಡುವಿನ ವ್ಯತ್ಯಾಸ

ಕಾಲಕ್ಕೆ ತಕ್ಕಂತೆ ಬದಲಾವಣೆ

ಸಾಲಿನ ಚಾರ್ಟ್

ಪ್ರವೃತ್ತಿ, ಋತುಮಾನ

ಮಲ್ಟಿವೇರಿಯೇಟ್ ಸಂಬಂಧ

ಪರಸ್ಪರ ಸಂಬಂಧ ಶಾಖ ನಕ್ಷೆ

ಸಾಮಾನ್ಯ ಸಂಬಂಧದ ಮ್ಯಾಟ್ರಿಕ್ಸ್

ಸಿಂಪ್ಸನ್ ವಿರೋಧಾಭಾಸ: ಒಟ್ಟುಗೂಡಿದ ಡೇಟಾ ಸುಳ್ಳು ಮಾಡಬಹುದು

EDA ಯಲ್ಲಿನ ಒಂದು ಸ್ನೀಕಿ ಬಲೆಯು ಸಿಂಪ್ಸನ್‌ರ ವಿರೋಧಾಭಾಸವಾಗಿದೆ: ಎಲ್ಲಾ ಡೇಟಾವನ್ನು ಒಟ್ಟಿಗೆ ಪರಿಶೀಲಿಸಿದಾಗ ಒಂದು ಮಾದರಿಯು ಒಂದು ದಿಕ್ಕನ್ನು ತೋರಿಸುತ್ತದೆ, ಆದರೆ ಡೇಟಾವನ್ನು ಅರ್ಥಪೂರ್ಣ ಉಪಗುಂಪುಗಳಾಗಿ ವಿಂಗಡಿಸಿದಾಗ ಹಿಂತಿರುಗಿಸುತ್ತದೆ. ಕ್ಲಾಸಿಕ್ ಉದಾಹರಣೆ: ವಿಶ್ವವಿದ್ಯಾನಿಲಯದಲ್ಲಿ ಮಹಿಳಾ ಅರ್ಜಿದಾರರಿಗೆ ಒಟ್ಟಾರೆ ಸ್ವೀಕಾರ ದರವು ಪುರುಷರಿಗಿಂತ ಕಡಿಮೆಯಾಗಿದೆ; ಆದರೆ ಇಲಾಖಾವಾರು ವಿಭಾಗವನ್ನು ನೋಡಿದಾಗ ಹೆಚ್ಚಿನ ಇಲಾಖೆಗಳಲ್ಲಿ ಪುರುಷರಿಗಿಂತ ಮಹಿಳೆಯರ ಸ್ವೀಕಾರ ಪ್ರಮಾಣ ಹೆಚ್ಚಿದೆ. ಎಲ್ಲಿಂದ? ಮಹಿಳೆಯರು ಹೆಚ್ಚು ಸ್ಪರ್ಧಾತ್ಮಕ (ಕಡಿಮೆ ಸ್ವೀಕಾರ ದರಗಳು) ಇಲಾಖೆಗಳಿಗೆ ಅರ್ಜಿ ಸಲ್ಲಿಸಿದ್ದಾರೆ; ಸಂಯೋಜಿತ ಸಂಖ್ಯೆಯು ಈ ಗುಪ್ತ ವೇರಿಯಬಲ್ ಅನ್ನು ಸಂಗ್ರಹಿಸುತ್ತದೆ. ಪಾಠವು ಸ್ಪಷ್ಟವಾಗಿದೆ: ಒಟ್ಟು ಅಥವಾ ಸರಾಸರಿಯನ್ನು ನೋಡುವಾಗ, ಅರ್ಥಪೂರ್ಣ ಉಪಗುಂಪುಗಳಾಗಿ (ವಿಭಾಗ, ಅವಧಿ, ಚಾನಲ್) ವಿಭಜಿಸಿದಾಗ ಆ ಸಂಖ್ಯೆಯು ಅದೇ ಕಥೆಯನ್ನು ಹೇಳುತ್ತದೆಯೇ ಎಂದು ಪರೀಕ್ಷಿಸಲು ಮರೆಯದಿರಿ. AI ನಿಮಗೆ ಸಂಯೋಜಿತ ದರವನ್ನು ನೀಡಿದಾಗ, "ನೀವು ಅದನ್ನು ವಿಭಾಗಿಸಿದಾಗ ಅದು ಇನ್ನೂ ಮಾನ್ಯವಾಗಿದೆಯೇ" ಎಂದು ಕೇಳುವುದು ಹೆಚ್ಚು ತಪ್ಪುದಾರಿಗೆಳೆಯುವ ಫಲಿತಾಂಶಗಳನ್ನು ಆರಂಭಿಕ ಹಂತಗಳಲ್ಲಿ ಪಡೆಯುತ್ತದೆ.

ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು

ಪ್ರಕರಣ 1 - ಎರಡು ಗುಪ್ತ ಬೆಟ್ಟಗಳು. ಒಬ್ಬ ವಿಶ್ಲೇಷಕರು ಸರಾಸರಿ ಗ್ರಾಹಕರ ವಯಸ್ಸು 41 ಎಂದು ಕಂಡುಹಿಡಿದರು ಮತ್ತು ಅದನ್ನು "ಮಧ್ಯವಯಸ್ಸಿನ ಗುಂಪು" ಎಂದು ವರದಿ ಮಾಡಿದ್ದಾರೆ. ಆದರೆ ಹಿಸ್ಟೋಗ್ರಾಮ್ ಎರಡು ಶಿಖರಗಳನ್ನು ತೋರಿಸಿದೆ: 22-28 ಮತ್ತು 55-62 ವಯಸ್ಸಿನ ಗುಂಪುಗಳು. ಸರಾಸರಿ 41 ವಾಸ್ತವವಾಗಿ ಯಾರನ್ನೂ ಪ್ರತಿನಿಧಿಸಲಿಲ್ಲ. ಪಾಠ: ಸರಾಸರಿಯನ್ನು ನಂಬುವ ಮೊದಲು ವಿತರಣೆಯನ್ನು ಯೋಜಿಸಿ.

ಪ್ರಕರಣ 2 - ನಕಲಿ ಪರಸ್ಪರ ಸಂಬಂಧ. ಒಂದು ತಂಡವು "ಜಾಹೀರಾತು ಖರ್ಚು" ಮತ್ತು "ಮಾರಾಟ" ನಡುವೆ 0.78 ಪರಸ್ಪರ ಸಂಬಂಧವನ್ನು ಕಂಡುಹಿಡಿದಿದೆ ಮತ್ತು ಬಜೆಟ್ ಅನ್ನು ದ್ವಿಗುಣಗೊಳಿಸಿದೆ. ಆದಾಗ್ಯೂ, ಎರಡನ್ನೂ ಪ್ರಚೋದಿಸಿದ್ದು ಕಾಲೋಚಿತ ಪ್ರಚಾರಗಳು; ಪ್ರಚಾರದ ಅವಧಿಯಲ್ಲಿ, ಸಂಬಂಧವು 0.10 ಕ್ಕೆ ಇಳಿಯಿತು. 340 ಸಾವಿರ TL ಹೆಚ್ಚುವರಿ ಜಾಹೀರಾತು ನಿರೀಕ್ಷಿತ ಆದಾಯವನ್ನು ನೀಡಲಿಲ್ಲ. ಪಾಠ: ಕಾರಣಕ್ಕಾಗಿ ತಪ್ಪಾದ ಪರಸ್ಪರ ಸಂಬಂಧವು ದುಬಾರಿಯಾಗಿದೆ.

ಕೇಸ್ 3 - ಏಕಾಂಗಿ ವಿರೋಧಾಭಾಸದಿಂದ ಎಳೆಯಲ್ಪಟ್ಟ ರೇಖೆ. ರಿಯಲ್ ಎಸ್ಟೇಟ್ ವಿಶ್ಲೇಷಣೆಯು ಚದರ ಫೂಟೇಜ್ ಮತ್ತು ಬೆಲೆ (r=0.80) ನಡುವಿನ ಬಲವಾದ ಸಂಬಂಧವನ್ನು ತೋರಿಸಿದೆ. ಸ್ಕ್ಯಾಟರ್ ಕಥಾವಸ್ತುವನ್ನು ಚಿತ್ರಿಸಿದಾಗ, ಬಹುತೇಕ ಸಂಪೂರ್ಣ ಸಂಬಂಧವನ್ನು ಒಂದೇ 12 ಮಿಲಿಯನ್ ಟಿಎಲ್ ಐಷಾರಾಮಿ ವಿಲ್ಲಾದಿಂದ ರಚಿಸಲಾಗಿದೆ; ಆ ಬಿಂದುವನ್ನು ತೆಗೆದುಹಾಕಿದಾಗ, ಪರಸ್ಪರ ಸಂಬಂಧವು 0.31 ಕ್ಕೆ ಇಳಿಯಿತು. ಪಾಠ: ಯಾವಾಗಲೂ ಸ್ಕ್ಯಾಟರ್ ಪ್ಲಾಟ್ ಜೊತೆಗೆ ಪರಸ್ಪರ ಸಂಬಂಧವನ್ನು ಓದಿ.

ನಾಲ್ಕು ನಕಲಿಸಬಹುದಾದ ಟೆಂಪ್ಲೇಟ್‌ಗಳು

1) ಸ್ವಯಂಚಾಲಿತ EDA ಸಾರಾಂಶ:

ನನ್ನ ಬಳಿ ಪಾಂಡಾಗಳು ಡಿಎಫ್ ಇದೆ. ಉತ್ಪಾದಿಸುವ ಕೋಡ್ ಅನ್ನು ಬರೆಯಿರಿ: (1) df.info() ಮತ್ತು df.describe(), (2) ಪ್ರತಿ ಸಂಖ್ಯಾ ಕಾಲಮ್‌ಗೆ ಹಿಸ್ಟೋಗ್ರಾಮ್, (3) ಪ್ರತಿ ವರ್ಗೀಯ ಕಾಲಮ್‌ಗೆ ಎಣಿಕೆ. ಕಾಮೆಂಟ್ ಮಾಡಬೇಡಿ, ಡಿಸ್ಕವರಿ ಕೋಡ್ ಅನ್ನು ರಚಿಸಿ; ನಾನು ಮಾದರಿಗಳನ್ನು ಅರ್ಥೈಸುತ್ತೇನೆ.

2) ಪರಸ್ಪರ ಸಂಬಂಧ + ದೃಶ್ಯ (ಕಾರಣತ್ವದ ಎಚ್ಚರಿಕೆಯೊಂದಿಗೆ):

ಸಂಖ್ಯಾತ್ಮಕ ಕಾಲಮ್‌ಗಳಿಗಾಗಿ ಪರಸ್ಪರ ಸಂಬಂಧದ ಮ್ಯಾಟ್ರಿಕ್ಸ್ ಮತ್ತು ಹೀಟ್ ಮ್ಯಾಪ್ ಅನ್ನು ಸೆಳೆಯುವ ಕೋಡ್ ಅನ್ನು ಬರೆಯಿರಿ. 3 ಅತಿ ಹೆಚ್ಚು ಪರಸ್ಪರ ಸಂಬಂಧ ಹೊಂದಿರುವ ಜೋಡಿಗಳ ಸ್ಕ್ಯಾಟರ್ ಪ್ಲಾಟ್ ಅನ್ನು ಸಹ ಸೆಳೆಯಿರಿ. ಪರಸ್ಪರ ಸಂಬಂಧವು ಕಾರಣವನ್ನು ಸೂಚಿಸುವುದಿಲ್ಲ ಎಂದು ನಿಮಗೆ ನೆನಪಿಸುವ ಔಟ್‌ಪುಟ್‌ಗೆ ಕಾಮೆಂಟ್ ಲೈನ್ ಅನ್ನು ಸೇರಿಸಿ. ಸಾಂದರ್ಭಿಕ ಹಕ್ಕುಗಳನ್ನು ಮಾಡಬೇಡಿ.

3) ವಿತರಣೆ ರೋಗನಿರ್ಣಯ:

"income_tl" ಕಾಲಮ್‌ಗಾಗಿ: ಹಿಸ್ಟೋಗ್ರಾಮ್, ಬಾಕ್ಸ್ ಪ್ಲಾಟ್, ಓರೆ ಮೌಲ್ಯ ಮತ್ತು ಸರಾಸರಿ/ಸರಾಸರಿ ಹೋಲಿಕೆಯನ್ನು ಉತ್ಪಾದಿಸುವ ಕೋಡ್ ಬರೆಯಿರಿ. ವಿತರಣೆಯು ಓರೆಯಾಗಿದೆಯೇ ಅಥವಾ ಇಲ್ಲವೇ ಎಂಬುದನ್ನು ನಾನು ಅರ್ಥೈಸುತ್ತೇನೆ; ಕೇವಲ ಕೋಡ್ ನೀಡಿ.

4) ವಿಭಾಗ ಹೋಲಿಕೆ:

"ಚಾನೆಲ್" (ವೆಬ್/ಮೊಬೈಲ್) ಮೂಲಕ ಗ್ರಾಹಕರನ್ನು ಹೋಲಿಕೆ ಮಾಡಿ: ಪ್ರತಿ ಚಾನಲ್‌ಗೆ ಸರಾಸರಿ ಮೊತ್ತ, ಸರಾಸರಿ ಮೊತ್ತ, ಆರ್ಡರ್‌ಗಳ ಸಂಖ್ಯೆ ಮತ್ತು ಮೊತ್ತದ ವಿತರಣೆಯ ಬಾಕ್ಸ್‌ಪ್ಲಾಟ್ ಅನ್ನು ಉತ್ಪಾದಿಸುವ ಕೋಡ್ ಬರೆಯಿರಿ. ಎರಡು ಚಾನಲ್‌ಗಳ ನಡುವಿನ ವ್ಯತ್ಯಾಸದ ಅಂಕಿಅಂಶಗಳ ಮಹತ್ವಕ್ಕಾಗಿ ಯಾವ ಪರೀಕ್ಷೆಯು ಸೂಕ್ತವಾಗಿದೆ ಎಂಬುದನ್ನು ಸೂಚಿಸಿ, ಆದರೆ ನಿರ್ಧಾರವು ನನಗೆ ಬಿಟ್ಟದ್ದು.

ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್ / ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್

ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್:

ಈ ಡೇಟಾದಲ್ಲಿ ಆಸಕ್ತಿದಾಯಕವಾದದ್ದನ್ನು ಹುಡುಕಿ.

"ಆಸಕ್ತಿದಾಯಕ" ವ್ಯಾಖ್ಯಾನಿಸಲಾಗಿಲ್ಲ; AI ಡೇಟಾವನ್ನು ನೋಡುವುದಿಲ್ಲ, ಆದ್ದರಿಂದ ಅದು ಅದನ್ನು ರೂಪಿಸುತ್ತದೆ ಅಥವಾ ಸಾಮಾನ್ಯ ಹೇಳಿಕೆಗಳನ್ನು ಮಾಡುತ್ತದೆ. ಯಾವುದೇ ನಿರ್ದೇಶನವಿಲ್ಲ, ಅಸ್ಥಿರಗಳಿಲ್ಲ, ಉದ್ದೇಶವಿಲ್ಲ.

ಶಕ್ತಿಯುತ ಪ್ರಾಂಪ್ಟ್:

ನಿಮ್ಮ ಪಾತ್ರ: EDA ಸಹಾಯಕ. df ಕಾಲಮ್‌ಗಳು: ವಯಸ್ಸು (int), income_tl (ಫ್ಲೋಟ್), ನಗರ (ವರ್ಗ), ಚಾನಲ್ (ವೆಬ್/ಮೊಬೈಲ್), ಮೊತ್ತ (ಫ್ಲೋಟ್). ಉದ್ದೇಶ: "ಮೊತ್ತ" ಮೇಲೆ ಪರಿಣಾಮ ಬೀರುವ ಅಂಶಗಳನ್ನು ಕಂಡುಹಿಡಿಯುವುದು. ಕಾರ್ಯ: (1) ಮೊತ್ತದ ವಿತರಣೆಯನ್ನು ರೂಪಿಸುವ ಕೋಡ್, (2) ಮೊತ್ತ ಮತ್ತು ವಯಸ್ಸು ಮತ್ತು ಆದಾಯ_tl ನಡುವಿನ ವಿತರಣಾ ಗ್ರಾಫ್‌ಗಳು, (3) ಚಾನಲ್ ಸ್ಥಗಿತದಲ್ಲಿ ಮೊತ್ತದ ಬಾಕ್ಸ್ ಪ್ಲಾಟ್. ಸಾಂದರ್ಭಿಕ ಹಕ್ಕನ್ನು ಸ್ಥಾಪಿಸುವುದು; ಡಿಸ್ಕವರಿ ಕೋಡ್ ಅನ್ನು ರಚಿಸಿ ಮತ್ತು ನಾನು ಮಾದರಿಯನ್ನು ಅರ್ಥೈಸುತ್ತೇನೆ.

ಇಲ್ಲಿ, ಉದ್ದೇಶ, ಅಸ್ಥಿರ ಮತ್ತು "ಕಾರಣವನ್ನು ಹೇಳಿಕೊಳ್ಳುವ" ಮಿತಿ ಸ್ಪಷ್ಟವಾಗಿದೆ.

ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು

  • ಸಾರಾಂಶ ಅಂಕಿಅಂಶಗಳ ಮೇಲೆ ಮಾತ್ರ ಅವಲಂಬಿತವಾಗಿದೆ. Anscombe ಕ್ವಾರ್ಟೆಟ್ ತೋರಿಸಿದಂತೆ, ಅದೇ ಸರಾಸರಿ ವಿಭಿನ್ನ ವಿತರಣೆಗಳನ್ನು ಮರೆಮಾಡುತ್ತದೆ; ಚಾರ್ಟ್ ನೋಡಿ.
  • ಕಾರಣಕ್ಕಾಗಿ ತಪ್ಪಾದ ಪರಸ್ಪರ ಸಂಬಂಧ. ಸಹ-ಕ್ರಿಯೆಯು ಒಂದು ಇನ್ನೊಂದಕ್ಕೆ ಕಾರಣವಾಗುತ್ತದೆ ಎಂದು ಸೂಚಿಸುವುದಿಲ್ಲ; ಗುಪ್ತ ಅಸ್ಥಿರಗಳ ಬಗ್ಗೆ ಎಚ್ಚರದಿಂದಿರಿ.
  • ಚೆದುರಿದ ಕಥಾವಸ್ತುವಿಲ್ಲದೆ ಪರಸ್ಪರ ಸಂಬಂಧವನ್ನು ನೋಡುವುದು. ಒಂದೇ ಹೊರಗಿರುವ ಅಥವಾ ವಕ್ರರೇಖೆಯು ಸಂಖ್ಯೆಯನ್ನು ದಾರಿತಪ್ಪಿಸುತ್ತದೆ.
  • ಸರಾಸರಿಯೊಂದಿಗೆ ಎರಡು-ಶಿಖರ/ಓರೆಯಾದ ವಿತರಣೆಯನ್ನು ಸಂಕ್ಷಿಪ್ತಗೊಳಿಸುವುದು. ಸರಾಸರಿಯು ಯಾರನ್ನೂ ಪ್ರತಿನಿಧಿಸದೇ ಇರಬಹುದು.
  • EDA ಅನ್ನು ಬಿಟ್ಟು ನೇರವಾಗಿ ಮಾದರಿಗೆ ಹೋಗುವುದು. ಗುರುತಿಸದ ಡೇಟಾ ಎಂದರೆ ಕುರುಡು ಮಾದರಿ.
ಸಲಹೆ: ಪ್ರತಿ ಹೊಸ ಡೇಟಾ ಸೆಟ್‌ನೊಂದಿಗೆ, ಮೊದಲ 30 ನಿಮಿಷಗಳನ್ನು ಗ್ರಾಫ್‌ಗಳನ್ನು ಚಿತ್ರಿಸಲು ಕಳೆಯಿರಿ: ಪ್ರತಿ ಸಂಖ್ಯಾಶಾಸ್ತ್ರದ ಹಿಸ್ಟೋಗ್ರಾಮ್, ಗಮನಾರ್ಹ ಜೋಡಿಗಳ ಸ್ಕ್ಯಾಟರ್ ಪ್ಲಾಟ್, ವರ್ಗಗಳ ಬಾರ್ ಚಾರ್ಟ್. ಈ 30 ನಿಮಿಷಗಳು ಮುಂಬರುವ ದಿನಗಳಲ್ಲಿ ಭವಿಷ್ಯದ ಮಾಡೆಲಿಂಗ್ ದೋಷಗಳನ್ನು ತಡೆಯುತ್ತದೆ.

ಸಾರಾಂಶದಲ್ಲಿ

EDA ಒಂದು ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸುವ ಮೊದಲು ಡೇಟಾವನ್ನು ತಿಳಿದುಕೊಳ್ಳುವ ಹಂತವಾಗಿದೆ ಮತ್ತು ನಾಲ್ಕು ಪ್ರಶ್ನೆಗಳಿಗೆ ಉತ್ತರಗಳನ್ನು ಹುಡುಕುತ್ತದೆ: ವಿತರಣೆ, ಕೇಂದ್ರ-ಹರಡುವಿಕೆ, ಸಂಬಂಧಗಳು ಮತ್ತು ವೈಪರೀತ್ಯಗಳು. ಸಾರಾಂಶ ಅಂಕಿಅಂಶಗಳು ತಪ್ಪುದಾರಿಗೆಳೆಯಬಹುದು; ಗ್ರಾಫ್ ಅನ್ನು ನೋಡುವುದು ಅತ್ಯಗತ್ಯವಾಗಿರುತ್ತದೆ (ಅನ್ಸ್‌ಕಾಂಬೆ ಉಪನ್ಯಾಸ). ಪರಸ್ಪರ ಸಂಬಂಧವು ಶಕ್ತಿಯುತ ಸಾಧನವಾಗಿದೆ, ಆದರೆ ಕಾರಣವಲ್ಲ ಮತ್ತು ಖಂಡಿತವಾಗಿಯೂ ಸ್ಕ್ಯಾಟರ್ ಕಥಾವಸ್ತುವಿನ ಜೊತೆಯಲ್ಲಿ ಓದಬೇಕು. ಗ್ರಾಫಿಕ್ಸ್ ಮತ್ತು ಬರವಣಿಗೆ ಕೋಡ್ ಅನ್ನು ಸೂಚಿಸಲು AI ಉತ್ತಮ ವೇಗವರ್ಧಕವಾಗಿದೆ; ಆದರೆ ಜನರು ತಾವು ನೋಡುವ ಮಾದರಿಯು ನಿಜವೋ ಅಥವಾ ಕಾಕತಾಳೀಯವೋ ಎಂದು ತಮ್ಮ ಕ್ಷೇತ್ರ ಜ್ಞಾನದಿಂದ ವ್ಯಾಖ್ಯಾನಿಸುತ್ತಾರೆ.

ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ

ಡೇಟಾಸೆಟ್ ಅನ್ನು ಆಯ್ಕೆ ಮಾಡಿ ಮತ್ತು ಕೇವಲ EDA ಮಾಡಿ: ಕನಿಷ್ಠ ಮೂರು ಸಂಖ್ಯಾತ್ಮಕ ವೇರಿಯಬಲ್‌ಗಳ ಹಿಸ್ಟೋಗ್ರಾಮ್ ಅನ್ನು ಹೊರತೆಗೆಯಿರಿ, ಎರಡು ಜೋಡಿ ವೇರಿಯಬಲ್‌ಗಳ ಸ್ಕ್ಯಾಟರ್ ಪ್ಲಾಟ್ ಮತ್ತು ಪರಸ್ಪರ ಸಂಬಂಧದ ಶಾಖ ನಕ್ಷೆ. ಕನಿಷ್ಠ ಒಂದು "ಆಶ್ಚರ್ಯ" ಅನ್ನು ಹುಡುಕಿ (ಉದಾಹರಣೆಗೆ ಎರಡು ಶಿಖರಗಳೊಂದಿಗಿನ ವಿತರಣೆ, ನಕಲಿ ಪರಸ್ಪರ ಸಂಬಂಧದ ಅಭ್ಯರ್ಥಿ, ಏಕೈಕ ಹೊರವಲಯದಿಂದ ಆಕರ್ಷಿತವಾದ ಸಂಬಂಧ) ಮತ್ತು ಅದನ್ನು ಒಂದೇ ವಾಕ್ಯದಲ್ಲಿ ವಿವರಿಸಿ. ಯಾವುದೇ ಸಾಂದರ್ಭಿಕ ಹಕ್ಕುಗಳನ್ನು ಮಾಡದೆಯೇ ಬರೆಯಿರಿ.

ಪರಿಶೀಲನಾಪಟ್ಟಿ

  • [ ] ನಾನು ಪ್ರತಿ ಸಂಖ್ಯಾತ್ಮಕ ವೇರಿಯಬಲ್‌ನ ವಿತರಣೆಯನ್ನು ಗ್ರಾಫ್ ಮಾಡಿದ್ದೇನೆಯೇ?
  • [ ] ನಾನು ಸ್ಕ್ಯಾಟರ್‌ಪ್ಲಾಟ್‌ನೊಂದಿಗೆ ಪರಸ್ಪರ ಸಂಬಂಧಗಳನ್ನು ನೋಡಿದ್ದೇನೆಯೇ?
  • [ ] ನಾನು ಕಾರಣ ಮತ್ತು ಪರಸ್ಪರ ಸಂಬಂಧವನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ಇಟ್ಟುಕೊಂಡಿದ್ದೇನೆಯೇ?
  • [ ] ನಾನು ಓರೆಯಾದ ಅಥವಾ ಎರಡು-ಶಿಖರದ ವಿತರಣೆಗಳನ್ನು ಗಮನಿಸಲಿಲ್ಲ ಮತ್ತು ಸರಾಸರಿಯನ್ನು ಕುರುಡಾಗಿ ನಂಬಲಿಲ್ಲವೇ?
  • [ ] ನನ್ನ EDA ಸಂಶೋಧನೆಗಳಿಂದ ನಾನು ಕನಿಷ್ಟ ಒಂದು ಮಾಡೆಲಿಂಗ್ ಅಂಶ/ಊಹೆಯನ್ನು ಪಡೆದಿದ್ದೇನೆಯೇ?