ಲಾಭಗಳು:
- ದತ್ತಾಂಶ ವಿಜ್ಞಾನದ ಆರು-ಹಂತದ ಕೆಲಸದ ಹರಿವನ್ನು (ಸಮಸ್ಯೆ ವ್ಯಾಖ್ಯಾನ, ಸಂಗ್ರಹಣೆ, ಶುಚಿಗೊಳಿಸುವಿಕೆ, ಅನ್ವೇಷಣೆ, ಮಾಡೆಲಿಂಗ್, ಸಂವಹನ) ಮತ್ತು ಕಾರ್ಯ ಅಪಾಯದ ಮಟ್ಟಕ್ಕೆ ಅನುಗುಣವಾಗಿ ಪ್ರತಿ ಹಂತದಲ್ಲಿ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಅಧಿಕಾರವನ್ನು ಪ್ರತ್ಯೇಕಿಸುವ ಸಾಮರ್ಥ್ಯ
- ಪ್ರತಿ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯ ಔಟ್ಪುಟ್ ಅನ್ನು ಮೂಲಕ್ಕೆ ಸಂಪರ್ಕಿಸುವ ಮೂಲಕ ಅದನ್ನು ಪರಿಶೀಲಿಸುವ ಶಿಸ್ತನ್ನು ಅನ್ವಯಿಸುವ ಸಾಮರ್ಥ್ಯ, ಅದನ್ನು ಚಾಲನೆ ಮಾಡುವುದು ಮತ್ತು ಹೋಲಿಸುವುದು ಮತ್ತು ಪರಿಣಿತ ಫಿಲ್ಟರಿಂಗ್ ಮೂಲಕ ಹಾದುಹೋಗುವುದು.
- ಪುನರುತ್ಪಾದನೆ ಮತ್ತು ಗೌಪ್ಯತೆ ತತ್ವಗಳನ್ನು (ಕೋಡ್ ಆಗಿ ಬರೆಯುವುದು, ಅನಾಮಧೇಯಗೊಳಿಸುವಿಕೆ) ಮೊದಲ ದಿನದಿಂದ ವಿಶ್ಲೇಷಣೆ ಅಭ್ಯಾಸಗಳಾಗಿ ಪರಿವರ್ತಿಸುವ ಸಾಮರ್ಥ್ಯ
ಕಚ್ಚಾ, ಗೊಂದಲಮಯ ಮತ್ತು ಸಾಮಾನ್ಯವಾಗಿ "ಸುಳ್ಳು" ಡೇಟಾವು ಪ್ರತಿದಿನ ಡೇಟಾ ವಿಜ್ಞಾನಿಗಳ ಮೇಜಿನ ಮೇಲೆ ಇಳಿಯುತ್ತದೆ. ಮಾರಾಟ ಕೋಷ್ಟಕದಲ್ಲಿ, ದಿನಾಂಕ ಕಾಲಮ್ ಅನ್ನು ಮೂರು ವಿಭಿನ್ನ ಸ್ವರೂಪಗಳಲ್ಲಿ ಬರೆಯಲಾಗಿದೆ; ಕೆಲವು ಸಾಲುಗಳಲ್ಲಿ ಗ್ರಾಹಕರ ಸಂಖ್ಯೆಗಳು ಖಾಲಿಯಾಗಿರುತ್ತವೆ; ಕಾಲಮ್ನ ಹೆಸರು "ಆದಾಯ", ಆದರೆ ಇದು TL ಮತ್ತು USD ಮೌಲ್ಯಗಳನ್ನು ಒಳಗೊಂಡಿದೆ. ದತ್ತಾಂಶ ವಿಜ್ಞಾನದ ಕೆಲಸವು ಈ ಅವ್ಯವಸ್ಥೆಯಿಂದ ವಿಶ್ವಾಸಾರ್ಹ ನಿರ್ಧಾರವನ್ನು ತೆಗೆದುಕೊಳ್ಳುವುದು: ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸಿ, ಅದನ್ನು ಸ್ವಚ್ಛಗೊಳಿಸಿ, ಅದನ್ನು ಅನ್ವೇಷಿಸಿ, ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸಿ, ಫಲಿತಾಂಶವನ್ನು ಮೌಲ್ಯೀಕರಿಸಿ ಮತ್ತು ಅದನ್ನು ಕಥೆಯಾಗಿ ಪರಿವರ್ತಿಸಿ. ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ (AI, ಅಥವಾ AI, ಕಿರು-ಕಂಪ್ಯೂಟರ್ ಸಿಸ್ಟಮ್ಗಳಿಗೆ ಪಠ್ಯ ಮತ್ತು ಕೋಡ್ ಅನ್ನು ರಚಿಸಬಹುದು, ಮಾದರಿಗಳನ್ನು ಗುರುತಿಸಬಹುದು, ಸಾರಾಂಶಗೊಳಿಸಬಹುದು ಮತ್ತು ಭವಿಷ್ಯವನ್ನು ಮಾಡಬಹುದು) ಈ ಸರಪಳಿಯ ಪ್ರತಿಯೊಂದು ಲಿಂಕ್ ಅನ್ನು ಸ್ಪರ್ಶಿಸಬಹುದು: ನಿಮಿಷಗಳಲ್ಲಿ ಕ್ಲೀನಪ್ ಕೋಡ್ ಬರೆಯುವುದು, ಪರಿಶೋಧನಾ ವಿಶ್ಲೇಷಣೆಗಾಗಿ ಗ್ರಾಫ್ಗಳನ್ನು ಶಿಫಾರಸು ಮಾಡುವುದು, ಮಾದರಿಯ ಮೆಟ್ರಿಕ್ ಅನ್ನು ಅರ್ಥೈಸುವುದು, SQL ಪ್ರಶ್ನೆಯನ್ನು ಸರಿಪಡಿಸುವುದು. ಆದರೆ ಅದೇ AI ನಿಮಗೆ ಇದುವರೆಗೆ ನೋಡದ ಡೇಟಾಕ್ಕಾಗಿ "ಸಹಸಂಬಂಧ 0.72" ನಂತಹ ವಿಶ್ವಾಸಾರ್ಹ ಫ್ಯಾಬ್ರಿಕೇಶನ್ ಅನ್ನು ಸಹ ನೀಡುತ್ತದೆ.
ಈ ಮೊದಲ ಘಟಕವು ಗ್ರಂಥಾಲಯದ ಪರಿಚಯವಲ್ಲ. ಡೇಟಾ ಸೈನ್ಸ್ ವರ್ಕ್ಫ್ಲೋನಲ್ಲಿ AI ಅನ್ನು ಎಲ್ಲಿ ಹಾಕಬೇಕು ಮತ್ತು ಎಲ್ಲಿ ಹಾಕಬಾರದು ಎಂಬುದನ್ನು ಸ್ಪಷ್ಟಪಡಿಸುವುದು ಇದರ ಉದ್ದೇಶವಾಗಿದೆ. ಮೊದಲಿನಿಂದಲೂ ಮೂಲ ತತ್ವವನ್ನು ರೂಪಿಸೋಣ: AI ಸಹಾಯಕ, ಡೇಟಾ ವಿಜ್ಞಾನಿ ಅಲ್ಲ. ಯಾವ ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸಬೇಕು, ಯಾವ ಮೆಟ್ರಿಕ್ ಅನ್ನು ನಿರ್ಧರಿಸಬೇಕು, ಉತ್ಪಾದನೆಗೆ ಮಾದರಿಯನ್ನು ಹಾಕಬೇಕೆ ಮತ್ತು ನೈತಿಕ ಗಡಿಗಳನ್ನು ಎಲ್ಲಿ ಸೆಳೆಯಬೇಕು ಎಂಬ ನಿರ್ಧಾರವು ಸಮರ್ಥ ತಜ್ಞರ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ. ಸಹಿ ಮಾಡದ ವಿಶ್ಲೇಷಣಾ ವರದಿಯಂತೆ ಪರಿಶೀಲಿಸದ AI ಔಟ್ಪುಟ್ ಅಪಾಯಕಾರಿ.
ಡೇಟಾ ಸೈನ್ಸ್ ವರ್ಕ್ಫ್ಲೋ: ಎಂಡ್-ಟು-ಎಂಡ್ ಮ್ಯಾಪ್
ಡೇಟಾ ಯೋಜನೆಯನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು, ಅದನ್ನು ಆರು ಹಂತಗಳಾಗಿ ವಿಭಜಿಸಲು ಸಹಾಯಕವಾಗಿದೆ. ಈ ಸಂಪೂರ್ಣ ಮಾಡ್ಯೂಲ್ ಈ ನಕ್ಷೆಯನ್ನು ಅನುಸರಿಸುತ್ತದೆ.
1. ಸಮಸ್ಯೆಯ ವ್ಯಾಖ್ಯಾನ: ಯಾವ ನಿರ್ಧಾರವನ್ನು ಬೆಂಬಲಿಸಲು ನಾವು ಏನು ಅಳೆಯುತ್ತೇವೆ, ಏಕೆ? ಈ ಹಂತವನ್ನು AI ಗೆ ನಿಯೋಜಿಸಲಾಗಿಲ್ಲ; ಇದು ಕೆಲಸವನ್ನು ವ್ಯಾಖ್ಯಾನಿಸುವ ವ್ಯಕ್ತಿ.
2. ಡೇಟಾ ಸಂಗ್ರಹಣೆ: ಮೂಲಗಳನ್ನು ಗುರುತಿಸುವುದು, ಡೇಟಾವನ್ನು ಹೊರತೆಗೆಯುವುದು, ಮಾದರಿ. (ಘಟಕ 2)
3. ಡೇಟಾ ಕ್ಲೀನಿಂಗ್ ಮತ್ತು ಪ್ರಿಪ್ರೊಸೆಸಿಂಗ್: ಕಾಣೆಯಾದ ಮೌಲ್ಯ, ಔಟ್ಲೈಯರ್, ಪ್ರಕಾರದ ಪರಿವರ್ತನೆ. (ಘಟಕ 3)
4. ಎಕ್ಸ್ಪ್ಲೋರೇಟರಿ ಡೇಟಾ ವಿಶ್ಲೇಷಣೆ (EDA - ಎಕ್ಸ್ಪ್ಲೋರೇಟರಿ ಡೇಟಾ ಅನಾಲಿಸಿಸ್, "ಕಣ್ಣಿನಿಂದ" ಡೇಟಾದ ವಿತರಣೆ ಮತ್ತು ಸಂಬಂಧಗಳನ್ನು ಗುರುತಿಸುವ ಹಂತ): (ಘಟಕ 4)
5. ಫೀಚರ್ ಎಂಜಿನಿಯರಿಂಗ್ ಮತ್ತು ಮಾಡೆಲಿಂಗ್: ವೇರಿಯಬಲ್ ಜನರೇಷನ್, ಅಲ್ಗಾರಿದಮ್ ಆಯ್ಕೆ, ತರಬೇತಿ, ಮೌಲ್ಯಮಾಪನ. (ಘಟಕ 5, 6, 7)
6. ಸಂವಹನ ಮತ್ತು ಉತ್ಪಾದನೆ: ದೃಶ್ಯೀಕರಣ, ಕಥೆ, MLOps (ಮಾದರಿಯನ್ನು ಲೈವ್ ಆಗಿ ತೆಗೆದುಕೊಳ್ಳುವ ಮತ್ತು ಅದನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡುವ ಶಿಸ್ತು). (ಘಟಕ 8, 11)
ಈ ಆರು ಹಂತಗಳಲ್ಲಿ ಪ್ರತಿಯೊಂದರಲ್ಲೂ AI ವಿಭಿನ್ನ ಅಧಿಕಾರದೊಂದಿಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ. ಕೆಳಗಿನ ಕೋಷ್ಟಕವು ಈ ಅಧಿಕಾರದ ವಿತರಣೆಯನ್ನು ಸಾರಾಂಶಗೊಳಿಸುತ್ತದೆ; ಇದು ಮಾಡ್ಯೂಲ್ನ ಏಕೈಕ ಪ್ರಮುಖ ಕೋಷ್ಟಕವಾಗಿದೆ.
ಹಂತ
AI ನ ಪಾತ್ರ
ಅಪಾಯದ ಮಟ್ಟ
ಯಾರು ಅನುಮೋದಿಸುತ್ತಾರೆ
ಸಮಸ್ಯೆಯ ವ್ಯಾಖ್ಯಾನ
ಮಿದುಳುದಾಳಿ ಪಾಲುದಾರ
ಕಡಿಮೆ
ಡೇಟಾ ವಿಜ್ಞಾನಿ + ಮಧ್ಯಸ್ಥಗಾರ
ಸ್ವಚ್ಛಗೊಳಿಸುವ ಕೋಡ್ ಅನ್ನು ಬರೆಯಿರಿ
ಕೋಡ್ ಸ್ಕೆಚ್ ಜನರೇಟರ್
ಮಧ್ಯಮ
ಡೇಟಾ ವಿಜ್ಞಾನಿ (ಕೋಡ್ ಓದುತ್ತದೆ)
EDA ಕಾಮೆಂಟ್
ಮಾದರಿ ಸಲಹೆಗಾರ
ಮಧ್ಯಮ
ಡೇಟಾ ವಿಜ್ಞಾನಿ
ವೈಶಿಷ್ಟ್ಯದ ಉತ್ಪಾದನೆ
ಐಡಿಯಾ ಮತ್ತು ಕೋಡ್ ಜನರೇಟರ್
ಮಧ್ಯಮ-ಎತ್ತರದ
ಸೋರಿಕೆ ನಿಯಂತ್ರಣ ಅತ್ಯಗತ್ಯ
ಮಾದರಿ ಆಯ್ಕೆ/ಮೆಟ್ರಿಕ್
ಸಲಹೆಗಾರ
ಹೆಚ್ಚು
ಡೇಟಾ ವಿಜ್ಞಾನಿ
ಉತ್ಪಾದನೆಯಲ್ಲಿ ತೊಡಗಿಸಿಕೊಳ್ಳಲು ನಿರ್ಧಾರ
ಸಹಾಯಕ ಇನ್ಪುಟ್
ತುಂಬಾ ಹೆಚ್ಚು
ತಂಡ + ವ್ಯಾಪಾರ ಮಾಲೀಕರು
ನೈತಿಕತೆ/ಗೌಪ್ಯತೆ ಅನುಮೋದನೆ
ಉತ್ತೇಜಕ
ತುಂಬಾ ಹೆಚ್ಚು
ಮಾನವ, ಯಾವಾಗಲೂ
ಈ ಚಾರ್ಟ್ನ ಒಂದು ವಾಕ್ಯವನ್ನು ನೆನಪಿನಲ್ಲಿಡಿ: ಷೇರುಗಳು ಹೆಚ್ಚಾದಂತೆ, AI ನ ಪಾತ್ರವು ಕುಗ್ಗುತ್ತದೆ ಮತ್ತು ಮಾನವ ಅನುಮೋದನೆಯು ಬೆಳೆಯುತ್ತದೆ.
ಏಕೆ ಪರಿಶೀಲನೆಯು ಈ ವ್ಯವಹಾರದ ಹೃದಯವಾಗಿದೆ
AI ಭಾಷಾ ಮಾದರಿಗಳು ಖಚಿತವಾಗಿ ಕಾಣುತ್ತವೆ, ಆದರೆ ಅವುಗಳು ಖಚಿತವಾಗಿರದೇ ಇರಬಹುದು. ತಾಂತ್ರಿಕ ಭಾಷೆಯಲ್ಲಿ, ಇದನ್ನು ಭ್ರಮೆ ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ: ಇದು ಅಸ್ತಿತ್ವದಲ್ಲಿಲ್ಲದ ಮಾಹಿತಿಯನ್ನು ಒಂದು ನಿರರ್ಗಳ ವಾಕ್ಯದಲ್ಲಿ ನಿಜವೆಂದು ತೋರುವ ಮಾದರಿಯ ಫ್ಯಾಬ್ರಿಕೇಶನ್ ಆಗಿದೆ. ಡೇಟಾ ವಿಜ್ಞಾನದಲ್ಲಿ, ಇದು ಮೂರು ರೂಪಗಳಲ್ಲಿ ಬರುತ್ತದೆ. ಮೊದಲನೆಯದು ನಕಲಿ ಸಂಖ್ಯೆ: ನೀವು ಯಾವುದೇ ಡೇಟಾವನ್ನು ನೀಡದೆ "ಸರಾಸರಿ ಆರ್ಡರ್ ಮೊತ್ತ ಎಷ್ಟು" ಎಂದು ಮಾಡೆಲ್ ಅನ್ನು ಕೇಳಿದರೆ, ಅದು ನಿಮ್ಮ ಡೇಟಾವನ್ನು ಎಂದಿಗೂ ನೋಡದಿದ್ದರೂ ಸಹ, ಆತ್ಮವಿಶ್ವಾಸದಿಂದ ನಿಮಗೆ ಸಂಖ್ಯೆಯನ್ನು ಹೇಳುತ್ತದೆ. ಎರಡನೆಯದು ಅಸ್ತಿತ್ವದಲ್ಲಿಲ್ಲದ ಕಾರ್ಯವಾಗಿದೆ: ಮಾದರಿಯು ಅಸ್ತಿತ್ವದಲ್ಲಿಲ್ಲದ ಕಾರ್ಯವನ್ನು ಸೂಚಿಸಬಹುದು, ಉದಾಹರಣೆಗೆ pandas.read_excel_fast(). ಮೂರನೆಯದಾಗಿ, ತಪ್ಪಾದ ಅಂಕಿಅಂಶಗಳ ವ್ಯಾಖ್ಯಾನ: "p-ಮೌಲ್ಯವು 0.04 ಆಗಿದೆ, ಆದ್ದರಿಂದ ಊಹೆಯು 96% ಸರಿಯಾಗಿದೆ" ಎಂಬಂತಹ ಕ್ಲಾಸಿಕ್ ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ದೋಷವನ್ನು ಮಾದರಿಯು ಸರಾಗವಾಗಿ ಪುನರಾವರ್ತಿಸಬಹುದು.
ಪರಿಶೀಲನಾ ಶಿಸ್ತು ಮೂರು ಹಂತಗಳನ್ನು ಒಳಗೊಂಡಿದೆ:
- ಮೂಲಕ್ಕೆ ಲಿಂಕ್: ಪ್ರತಿ ಸಂಖ್ಯೆ, ದರ ಮತ್ತು ಪ್ರವೃತ್ತಿಯು ನಿಮ್ಮ ಡೇಟಾದಿಂದ ಬರಬೇಕು, AI ನ ಮೆಮೊರಿಯಿಂದಲ್ಲ. ಡೇಟಾದಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಕೋಡ್ಗಾಗಿ AI ಅನ್ನು ಬಳಸಿ, ಡೇಟಾವನ್ನು ನೆನಪಿಟ್ಟುಕೊಳ್ಳಲು ಅಲ್ಲ.
- ರನ್ ಮಾಡಿ ಮತ್ತು ಹೋಲಿಕೆ ಮಾಡಿ: AI ನೀಡಿದ ಪ್ರತಿಯೊಂದು ಕೋಡ್ ಅನ್ನು ನೀವೇ ಚಲಾಯಿಸಿ; ಅದು ಉತ್ಪಾದಿಸುವ ಪ್ರತಿಯೊಂದು ಮೆಟ್ರಿಕ್ ಅನ್ನು ಸ್ವತಂತ್ರ ಬೇಸ್ಲೈನ್ಗೆ ಹೋಲಿಸಿ.
- ತಜ್ಞರ ಫಿಲ್ಟರ್: ಔಟ್ಪುಟ್ ಅಂಕಿಅಂಶಗಳು ಮತ್ತು ಡೊಮೇನ್ ಜ್ಞಾನಕ್ಕೆ ವಿರುದ್ಧವಾಗಿದೆಯೇ ಎಂದು ನೀವೇ ಪರೀಕ್ಷಿಸಿ.
ಎಚ್ಚರಿಕೆ: AI ಬರೆದ ವಿಶ್ಲೇಷಣೆಯನ್ನು ಚಾಲನೆ ಮಾಡದೆ ಪ್ರಸ್ತುತಿಯಲ್ಲಿ ಹಾಕುವುದು ಮತ್ತು ಅದನ್ನು ಓದುವುದು ಸಹಿ ಮಾಡದ ವರದಿಯನ್ನು ಪ್ರಸ್ತುತಪಡಿಸಿದಂತೆ. ಕೋಡ್ ಕೆಲಸ ಮಾಡುವುದರಿಂದ ಅದು ಸರಿಯಾಗಿದೆ ಎಂದು ಅರ್ಥವಲ್ಲ; ತಪ್ಪು ಕಾಲಮ್ ಅನ್ನು ಒಟ್ಟುಗೂಡಿಸುವ ಕೋಡ್ ದೋಷಗಳಿಲ್ಲದೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ.
ಪುನರುತ್ಪಾದನೆ: ಒಂದೇ ಫಲಿತಾಂಶವನ್ನು ಎರಡು ಬಾರಿ ಉತ್ಪಾದಿಸಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ
ಡೇಟಾ ಸೈನ್ಸ್ನ ಮೂಕ ಆದರೆ ನಿರ್ಣಾಯಕ ತತ್ವವೆಂದರೆ ಪುನರುತ್ಪಾದನೆ: ನೀವು ಆರು ತಿಂಗಳ ನಂತರ ಅಥವಾ ಬೇರೆ ಕಂಪ್ಯೂಟರ್ನಲ್ಲಿ ಮತ್ತೊಮ್ಮೆ ವಿಶ್ಲೇಷಣೆಯನ್ನು ನಡೆಸಿದಾಗ, ನೀವು ಅದೇ ಫಲಿತಾಂಶವನ್ನು ಪಡೆಯುತ್ತೀರಿ. AI ನೊಂದಿಗೆ ಕೆಲಸ ಮಾಡುವಾಗ ಈ ಅಪಾಯವು ಹೆಚ್ಚಾಗುತ್ತದೆ, ಏಕೆಂದರೆ ನೀವು AI ಗೆ "ಈ ಗ್ರಾಫ್ ಮಾಡಿ" ಮತ್ತು ಅದನ್ನು ಹಸ್ತಚಾಲಿತವಾಗಿ ಪ್ಲೇ ಮಾಡಲು ಹೇಳಿದಾಗ, ಹಂತಗಳು ಕಣ್ಮರೆಯಾಗುತ್ತವೆ. ನಿಯಮ: ಪ್ರತಿ ಹಂತವನ್ನು ಕೋಡ್ ಮತ್ತು ಆವೃತ್ತಿ ನಿಯಂತ್ರಣದಲ್ಲಿ ನೋಂದಾಯಿಸಬೇಕು (Git ನಂತಹ); ಯಾದೃಚ್ಛಿಕತೆಯನ್ನು ಒಳಗೊಂಡಿರುವ ಹಂತಗಳಲ್ಲಿ, ಯಾದೃಚ್ಛಿಕ ಬೀಜವನ್ನು (ಯಾದೃಚ್ಛಿಕ ಸಂಖ್ಯೆ ಜನರೇಟರ್ನ ಆರಂಭಿಕ ಮೌಲ್ಯ; ಸ್ಥಿರಗೊಳಿಸಿದರೆ, ಫಲಿತಾಂಶವು ಪುನರಾವರ್ತನೀಯವಾಗಿರುತ್ತದೆ) ಸ್ಥಿರವಾಗಿರಬೇಕು. ನಾವು ಘಟಕ 10 ರಲ್ಲಿ ಈ ವಿಷಯವನ್ನು ಆಳವಾಗಿ ಮಾಡುತ್ತೇವೆ; ಸದ್ಯಕ್ಕೆ, ಈ ಅಭ್ಯಾಸವನ್ನು ಪಡೆಯಿರಿ: "ಕೈಯಿಂದ ಕ್ಲಿಕ್ ಮಾಡಬೇಡಿ, ಕೋಡ್ನಲ್ಲಿ ಬರೆಯಿರಿ."
ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು
ಪ್ರಕರಣ 1 - ಸುರಕ್ಷಿತ ವೇಗವರ್ಧನೆ. ಇ-ಕಾಮರ್ಸ್ ವಿಶ್ಲೇಷಕರು ಸಾಮಾನ್ಯವಾಗಿ 240 ಸಾವಿರ ಸಾಲುಗಳ ಆರ್ಡರ್ ಟೇಬಲ್ ಅನ್ನು ತೆರವುಗೊಳಿಸಲು ಅರ್ಧ ದಿನವನ್ನು ಕಳೆಯುತ್ತಾರೆ. ಅವರು ಕಾಲಮ್ ಹೆಸರುಗಳು ಮತ್ತು ಮೊದಲ 5 ಸಾಲುಗಳನ್ನು (ವೈಯಕ್ತಿಕ ಡೇಟಾ ಇಲ್ಲದೆ) AI ಗೆ ನೀಡಿದರು ಮತ್ತು ಪಾಂಡಾಗಳನ್ನು ಸ್ವಚ್ಛಗೊಳಿಸುವ ಕೋಡ್ ಅನ್ನು ಕೇಳಿದರು. AI 8 ಸೆಕೆಂಡುಗಳಲ್ಲಿ ಡ್ರಾಫ್ಟ್ ಅನ್ನು ತಯಾರಿಸಿತು; ವಿಶ್ಲೇಷಕರು ಕೋಡ್ ಲೈನ್ ಅನ್ನು ಸಾಲಿನ ಮೂಲಕ ಓದಿದರು, ದಿನಾಂಕ ಪಾರ್ಸಿಂಗ್ನಲ್ಲಿ ದೋಷವನ್ನು ಸರಿಪಡಿಸಿದರು ಮತ್ತು ಅದನ್ನು ಚಲಾಯಿಸಿದರು. ಅವಧಿ: 4 ಗಂಟೆಗಳ ಬದಲಿಗೆ 35 ನಿಮಿಷಗಳು. AI ಕೋಡ್ ಅನ್ನು ಒದಗಿಸಿದೆ, ಪರಿಶೀಲನೆಯು ಮಾನವನೊಂದಿಗೆ ಉಳಿದಿದೆ.
ಪ್ರಕರಣ 2 - ನಿರ್ಮಿತ ಮೆಟ್ರಿಕ್ ಟ್ರ್ಯಾಪ್. ಒಬ್ಬ ಇಂಟರ್ನ್ AI ಅನ್ನು ಕೇಳಿದರು, "ಈ ಡೇಟಾದಲ್ಲಿ ಯಾದೃಚ್ಛಿಕ ಅರಣ್ಯವು ಎಷ್ಟು ನಿಖರವಾಗಿದೆ?" ಮಾದರಿಯನ್ನು ತರಬೇತಿ ಮಾಡದೆಯೇ. "ಸುಮಾರು 89%," AI ಹೇಳಿದರು. ಇಂಟರ್ನ್ ಇದನ್ನು ಪ್ರಸ್ತುತಿಯಲ್ಲಿ ಇರಿಸಿದರು; ನಿಜವಾದ ಮಾದರಿಯನ್ನು ತರಬೇತಿ ಮಾಡಿದಾಗ, ನಿಖರತೆ 71% ಆಗಿತ್ತು. ತಪ್ಪು: AI ಗೆ ಡೇಟಾ ಮತ್ತು ಮಾದರಿಗಳನ್ನು ನೀಡದೆ ಮೆಟ್ರಿಕ್ಗಳಿಗಾಗಿ ಕಾಯಲಾಗುತ್ತಿದೆ.
ಪ್ರಕರಣ 3 - ಸೈಲೆಂಟ್ ಸೋರಿಕೆ. ಒಂದು ತಂಡವು ಅದನ್ನು ಪ್ರಶ್ನಿಸದೆಯೇ "ಟಾರ್ಗೆಟ್ ವೇರಿಯಬಲ್ನ ಸರಾಸರಿಯನ್ನು ವೈಶಿಷ್ಟ್ಯವಾಗಿ ಸೇರಿಸಿ" ಎಂಬ AI- ಸೂಚಿಸಿದ ಕಲ್ಪನೆಯನ್ನು ಕಾರ್ಯಗತಗೊಳಿಸಿದೆ. ಮಾದರಿಯು ಪರೀಕ್ಷಾ ಸೆಟ್ನಲ್ಲಿ 98% ರಷ್ಟು ಪ್ರದರ್ಶನ ನೀಡಿತು ಆದರೆ ಈ ವೈಶಿಷ್ಟ್ಯವು ಭವಿಷ್ಯದ ಮಾಹಿತಿಯನ್ನು ಸೋರಿಕೆ ಮಾಡುವ ಕಾರಣ ಉತ್ಪಾದನೆಯಲ್ಲಿ ಕ್ರ್ಯಾಶ್ ಆಗಿದೆ (ಡೇಟಾ ಸೋರಿಕೆ, ಘಟಕ 10). ತಪ್ಪು: AI ಶಿಫಾರಸುಗಳನ್ನು ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯವಾಗಿ ಫಿಲ್ಟರ್ ಮಾಡುತ್ತಿಲ್ಲ.
ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್ / ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್
ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್:
ಈ ಮಾರಾಟದ ಡೇಟಾವನ್ನು ವಿಶ್ಲೇಷಿಸಿ ಮತ್ತು ಸರಾಸರಿ ಆದಾಯವನ್ನು ನನಗೆ ತಿಳಿಸಿ.
ಈ ಹಕ್ಕು ದೋಷಪೂರಿತವಾಗಿದೆ: AI ಗೆ ಡೇಟಾವನ್ನು ನೀಡಲಾಗಿಲ್ಲ, ಆದ್ದರಿಂದ "ಸರಾಸರಿ ಆದಾಯ" ಮಾತ್ರ ಮಾಡಬಹುದಾಗಿದೆ. ಕಾಲಮ್ಗಳು, ಅವಧಿ ಅಥವಾ ಕರೆನ್ಸಿ ಸ್ಪಷ್ಟವಾಗಿಲ್ಲ.
ಶಕ್ತಿಯುತ ಪ್ರಾಂಪ್ಟ್:
ನಿಮ್ಮ ಪಾತ್ರ: ಡೇಟಾ ವಿಜ್ಞಾನಿಗೆ ಸಹಾಯ ಮಾಡುವ ಸಹಾಯಕ. ನನ್ನ ಬಳಿ ಪಾಂಡಾಗಳ ಡೇಟಾಫ್ರೇಮ್ ಇದೆ: df. ಕಾಲಮ್ಗಳು:- order_date (ಪಠ್ಯ, ಫಾರ್ಮ್ಯಾಟ್ "2024-03-01")- amount_tl (ದಶಮಾಂಶ, ಕೆಲವು ಸಾಲುಗಳಲ್ಲಿ NaN)- customer_id (ಪೂರ್ಣಾಂಕ)ಕಾರ್ಯ: (1) ಸರಾಸರಿ ಮೊತ್ತವನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡುವ ಪಾಂಡಾಸ್ ಕೋಡ್ ಅನ್ನು ಬರೆಯಿರಿ, (2) NaN ಮೌಲ್ಯಗಳನ್ನು ಹೇಗೆ ನಿರ್ವಹಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ವಿವರಿಸಿ, (3) ಕೋಡ್ ಊಹೆಯನ್ನು ಪಟ್ಟಿ ಮಾಡುತ್ತದೆ. ಡೇಟಾ ವಿಷಯವನ್ನು ರಚಿಸಬೇಡಿ; ಕೋಡ್ ಅನ್ನು ರಚಿಸಿ ಮತ್ತು ನಾನು ಫಲಿತಾಂಶವನ್ನು ರನ್ ಮಾಡಿ ಮತ್ತು ಪರಿಶೀಲಿಸುತ್ತೇನೆ.
ಈ ವಿನಂತಿಯಲ್ಲಿ, ಯೋಜನೆ, ನಿರೀಕ್ಷೆ ಮತ್ತು "ಕೃಷಿಯ ನಿಷೇಧ" ಸ್ಪಷ್ಟವಾಗಿದೆ. ನೀವು ಇನ್ನೂ ರನ್ ಮಾಡಿ ಮತ್ತು ಔಟ್ಪುಟ್ ಅನ್ನು ನೀವೇ ಪರಿಶೀಲಿಸಿ.
ನೈತಿಕತೆ ಮತ್ತು ಗೌಪ್ಯತೆಯ ಆರಂಭ
ಡೇಟಾ ಸೈನ್ಸ್ ಸಾಮಾನ್ಯವಾಗಿ ವೈಯಕ್ತಿಕ ಡೇಟಾದೊಂದಿಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ: ಗ್ರಾಹಕ, ರೋಗಿಯ, ಉದ್ಯೋಗಿ ದಾಖಲೆಗಳು. Türkiye ನಲ್ಲಿ KVKK (ವೈಯಕ್ತಿಕ ಡೇಟಾ ಸಂರಕ್ಷಣಾ ಕಾನೂನು) ಮತ್ತು ಯುರೋಪ್ನಲ್ಲಿ GDPR ಈ ಡೇಟಾವನ್ನು ರಕ್ಷಿಸುತ್ತದೆ. ನಿಮ್ಮ ನಿಜವಾದ ಹೆಸರು, ಐಡಿ, ಇಮೇಲ್ ಅಥವಾ ವಿಳಾಸವನ್ನು ಸಾರ್ವಜನಿಕ AI ಪರಿಕರದಲ್ಲಿ ಅಂಟಿಸುವುದು ಉಲ್ಲಂಘನೆಯಾಗಿದೆ. ನಿಯಮ: ಹಂಚಿಕೊಳ್ಳುವ ಮೊದಲು ಡೇಟಾವನ್ನು ಅನಾಮಧೇಯಗೊಳಿಸಿ, ಅಗತ್ಯವಿದ್ದರೆ ಮಾತ್ರ ಸ್ಕೀಮಾ (ಕಾಲಮ್ ಹೆಸರುಗಳು, ಪ್ರಕಾರಗಳು) ಮತ್ತು ನಕಲಿ ಉದಾಹರಣೆ ಸಾಲನ್ನು ಒದಗಿಸಿ. ನಾವು ಯುನಿಟ್ 11 ರಲ್ಲಿ ನೈತಿಕತೆಯ ವಿಷಯವನ್ನು ಆಳಗೊಳಿಸುತ್ತೇವೆ; ಮೊದಲಿನಿಂದಲೂ ತತ್ವವನ್ನು ಹಾಕೋಣ: ಡೇಟಾವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು, ಅದರ ರಚನೆಯನ್ನು ಹಂಚಿಕೊಳ್ಳುವುದು, ಅದರ ವಿಷಯವಲ್ಲ, ಆಗಾಗ್ಗೆ ಸಾಕು.
ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು
- AI ಗೆ ಡೇಟಾವನ್ನು ನೀಡದೆ ಸಂಖ್ಯೆಗಳು/ಮೆಟ್ರಿಕ್ಗಳಿಗಾಗಿ ಕಾಯಲಾಗುತ್ತಿದೆ. ಮಾದರಿಯು ಡೇಟಾವನ್ನು ಪ್ರವೇಶಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ; ಆತ ಕೊಡುವ ನಂಬರ್ ನಕಲಿ. ಯಾವಾಗಲೂ ಫಲಿತಾಂಶವನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡಿ ಮತ್ತು ರನ್ ಮಾಡಿ.
- ಕೆಲಸದ ಕೋಡ್ ಸರಿಯಾಗಿದೆ ಎಂದು ಯೋಚಿಸುವುದು. ತಪ್ಪು ಕಾಲಮ್ ಅನ್ನು ಕುಶಲತೆಯಿಂದ ನಿರ್ವಹಿಸುವ ಕೋಡ್ ಸಹ ದೋಷಗಳಿಲ್ಲದೆ ಚಲಿಸುತ್ತದೆ; ತರ್ಕವನ್ನು ಓದದೆ ನಂಬಬೇಡಿ.
- ತೆರೆದ ಪರಿಕರದಲ್ಲಿ ನೈಜ ವೈಯಕ್ತಿಕ ಡೇಟಾವನ್ನು ಅಂಟಿಸುವುದು. ಹೆಸರು, ಐಡಿ ಸಂಖ್ಯೆ, ಇ-ಮೇಲ್ ಅನ್ನು ಎಂದಿಗೂ ಹಂಚಿಕೊಳ್ಳಲಾಗುವುದಿಲ್ಲ; ರೇಖಾಚಿತ್ರವು ಸಾಕು.
- ಹಂತಗಳನ್ನು ಹಸ್ತಚಾಲಿತವಾಗಿ ಮಾಡುವುದು ಮತ್ತು ಅವುಗಳನ್ನು ಕೋಡ್ಗೆ ಬರೆಯುವುದಿಲ್ಲ. ಪುನರುತ್ಪಾದಿಸಲಾಗದ ವಿಶ್ಲೇಷಣೆ ವಿಶ್ವಾಸಾರ್ಹವಲ್ಲ.
- ಅಂಕಿಅಂಶಗಳ AI ನ ವ್ಯಾಖ್ಯಾನವನ್ನು ಪ್ರಶ್ನೆಯಿಲ್ಲದೆ ಸ್ವೀಕರಿಸುವುದು. p-ಮೌಲ್ಯ ಮತ್ತು ಪರಸ್ಪರ ಸಂಬಂಧದಂತಹ ಪರಿಕಲ್ಪನೆಗಳಲ್ಲಿ AI ಕ್ಲಾಸಿಕ್ ತಪ್ಪುಗಳನ್ನು ಪುನರಾವರ್ತಿಸಬಹುದು.
ಸಲಹೆ: ನಿಮ್ಮ ಪ್ರತಿಯೊಂದು AI ಸೆಷನ್ಗಳಲ್ಲಿ ಚಿಕ್ಕ "ನಿಯಮ ಲೈನ್" ಅನ್ನು ಸೇರಿಸಿ: "ಡೇಟಾ ವಿಷಯವನ್ನು ರೂಪಿಸಬೇಡಿ; ಕೇವಲ ಕೋಡ್/ವಿಶ್ಲೇಷಣೆಯನ್ನು ರಚಿಸಿ ಮತ್ತು ನಾನು ಫಲಿತಾಂಶವನ್ನು ರನ್ ಮಾಡಿ ಮತ್ತು ಪರಿಶೀಲಿಸುತ್ತೇನೆ; ನೀವು ಖಚಿತವಾಗಿಲ್ಲದಿರುವಲ್ಲಿ 'ಖಾತ್ರಿಯಿಲ್ಲ' ಎಂದು ಸೂಚಿಸಿ." ಈ ಒಂದೇ ವಾಕ್ಯವು ಭ್ರಮೆಗಳ ಅಪಾಯವನ್ನು ಗಮನಾರ್ಹವಾಗಿ ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.
ಸಾರಾಂಶದಲ್ಲಿ
AI ಡೇಟಾ ವಿಜ್ಞಾನದಲ್ಲಿ ಪ್ರಬಲ ಸಹಾಯಕವಾಗಿದೆ: ಇದು ಶುಚಿಗೊಳಿಸುವ ಕೋಡ್, EDA ವ್ಯಾಖ್ಯಾನ, ಮಾದರಿ ಶಿಫಾರಸು ಮತ್ತು ದೃಶ್ಯೀಕರಣವನ್ನು ವೇಗಗೊಳಿಸುತ್ತದೆ. ಆದರೆ ಸಮಸ್ಯೆಯ ವ್ಯಾಖ್ಯಾನ, ಮೆಟ್ರಿಕ್ ಆಯ್ಕೆ, ಉತ್ಪಾದನಾ ನಿರ್ಧಾರ ಮತ್ತು ನೈತಿಕ ಗಡಿಗಳು ಮನುಷ್ಯರಿಗೆ ಸೇರಿವೆ. ಕೆಲಸದ ಹರಿವು ಆರು ಹಂತಗಳನ್ನು ಹೊಂದಿದೆ ಮತ್ತು ಅಪಾಯವು ಹೆಚ್ಚಾದಂತೆ AI ನ ಪಾತ್ರವು ಚಿಕ್ಕದಾಗುತ್ತದೆ. ಮೂರು ಅಭ್ಯಾಸಗಳು ಎಲ್ಲದರ ಅಡಿಪಾಯವಾಗಿದೆ: ಮೂಲ ಲಿಂಕ್ (ಮೌಲ್ಯಮಾಪನ), ಪುನರುತ್ಪಾದನೆ (ಕೋಡಿಂಗ್), ಮತ್ತು ಅನಾಮಧೇಯತೆ (ಗೌಪ್ಯತೆ). ಒಮ್ಮೆ ನೀವು ಈ ಮೂರನ್ನು ಆಂತರಿಕಗೊಳಿಸಿದರೆ, ಉಳಿದ ಮಾಡ್ಯೂಲ್ನಲ್ಲಿರುವ ಪ್ರತಿಯೊಂದು ಉಪಕರಣವು ನಿಮಗೆ ಸುರಕ್ಷಿತ ವೇಗವರ್ಧಕವಾಗುತ್ತದೆ.
ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ
ನೀವು ಹೊಂದಿರುವ ಸಣ್ಣ ಕೋಷ್ಟಕದ ಸ್ಕೀಮಾವನ್ನು ಮಾಡಿ (ಅಥವಾ ಕಾಲ್ಪನಿಕವಾದದ್ದು): ಕಾಲಮ್ ಹೆಸರುಗಳು, ಪ್ರಕಾರಗಳು ಮತ್ತು 2-3 ನಕಲಿ ಉದಾಹರಣೆ ಸಾಲುಗಳು (ನೈಜ ವೈಯಕ್ತಿಕ ಡೇಟಾ ಇಲ್ಲದೆ). ಮೇಲಿನ "ಪವರ್ಫುಲ್ ಪ್ರಾಂಪ್ಟ್" ಟೆಂಪ್ಲೇಟ್ ಅನ್ನು ಬಳಸಿಕೊಂಡು ಸಾರಾಂಶ ಅಂಕಿಅಂಶಗಳ ಕೋಡ್ಗಾಗಿ AI ಅನ್ನು ಕೇಳಿ. ಕೋಡ್ ಅನ್ನು ರನ್ ಮಾಡಿ, ಔಟ್ಪುಟ್ ಅನ್ನು ಹಸ್ತಚಾಲಿತ ಮೌಲ್ಯಕ್ಕೆ ಹೋಲಿಸಿ, ಯಾವುದೇ ನಕಲಿ ಊಹೆಗಳನ್ನು ಪರಿಶೀಲಿಸಿ ಮತ್ತು ನಿಮ್ಮ ಸಂಶೋಧನೆಗಳನ್ನು 5 ಬುಲೆಟ್ ಪಾಯಿಂಟ್ಗಳಲ್ಲಿ ಗಮನಿಸಿ.
ಪರಿಶೀಲನಾಪಟ್ಟಿ
- [] ನಾನು ನೈಜ ವೈಯಕ್ತಿಕ ಡೇಟಾದ ಬದಲಿಗೆ AI ಗೆ ಸ್ಕೀಮಾ ಮತ್ತು ನಕಲಿ ಮಾದರಿಯನ್ನು ನೀಡಿದ್ದೇನೆಯೇ?
- [ ] ಅದು ಉತ್ಪಾದಿಸಿದ ಕೋಡ್ ಅನ್ನು ನಾನು ಸಾಲು ಸಾಲಾಗಿ ಓದಿದ್ದೇನೆ ಮತ್ತು ರನ್ ಮಾಡಿದ್ದೇನೆಯೇ?
- [ ] ನಾನು ಔಟ್ಪುಟ್ನಲ್ಲಿ ಪ್ರತಿ ಸಂಖ್ಯೆಯನ್ನು ಸ್ವತಂತ್ರವಾಗಿ ಪರಿಶೀಲಿಸಿದ್ದೇನೆಯೇ?
- [ ] ನಾನು ವಿಶ್ಲೇಷಣೆಯ ಪ್ರತಿ ಹಂತವನ್ನು ಕೋಡ್ನಲ್ಲಿ ಬರೆದಿದ್ದೇನೆ ಮತ್ತು ಅದನ್ನು ಪುನರಾವರ್ತಿಸುವಂತೆ ಮಾಡಿದ್ದೇನೆಯೇ?
- [ ] ನಾನು ಕಾರ್ಯಾಚರಣೆಯ ಅಪಾಯದ ಮಟ್ಟವನ್ನು ನಿರ್ಧರಿಸಿದ್ದೇನೆ ಮತ್ತು ಅಂತಿಮ ನಿರ್ಧಾರವನ್ನು ಮನುಷ್ಯನಿಗೆ ನಿಯೋಜಿಸಿದ್ದೇನೆಯೇ?