ಲಾಭಗಳು:
- ಕೆಲಸದ ನೈಜ ವೆಚ್ಚದ ಪ್ರಕಾರ ಸಮಸ್ಯೆಯ ಪ್ರಕಾರವನ್ನು (ವರ್ಗೀಕರಣ, ಹಿಂಜರಿತ, ಕ್ಲಸ್ಟರಿಂಗ್) ಮತ್ತು ಯಶಸ್ಸಿನ ಮಾನದಂಡಗಳನ್ನು ವ್ಯಾಖ್ಯಾನಿಸುವ ಸಾಮರ್ಥ್ಯ
- ಡೇಟಾವನ್ನು ಪ್ರಾಮಾಣಿಕವಾಗಿ ವಿಭಜಿಸುವ ಸಾಮರ್ಥ್ಯ (ಪರೀಕ್ಷಾ ಸೆಟ್ ಅನ್ನು ಮುಟ್ಟದೆ; ಕಾಲಾನುಕ್ರಮದಲ್ಲಿ ಸಮಯ ಸರಣಿಯಲ್ಲಿ) ಮತ್ತು ಸೋರಿಕೆ-ಮುಕ್ತ ಮೌಲ್ಯಮಾಪನ ಆಧಾರವನ್ನು ಸ್ಥಾಪಿಸುವುದು
- ಸರಳವಾದ ಬೇಸ್ಲೈನ್ನಿಂದ ಪ್ರಾರಂಭಿಸಿ ಮತ್ತು ಸಂಕೀರ್ಣತೆಯನ್ನು ಅದಕ್ಕೆ ಅರ್ಹವಾದಾಗ ಮಾತ್ರ ಸೇರಿಸುವ ಮೂಲಕ ವ್ಯಾಖ್ಯಾನಿಸಬಹುದಾದ ಮಾದರಿಯನ್ನು ಆಯ್ಕೆ ಮಾಡುವ ಸಾಮರ್ಥ್ಯ.
ಇಲ್ಲಿಯವರೆಗೆ ನಾವು ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸಿದ್ದೇವೆ, ಅದನ್ನು ಸ್ವಚ್ಛಗೊಳಿಸಿದ್ದೇವೆ, ಅದನ್ನು ಅನ್ವೇಷಿಸಿದ್ದೇವೆ ಮತ್ತು ವೈಶಿಷ್ಟ್ಯಗಳನ್ನು ತಯಾರಿಸಿದ್ದೇವೆ. ಈಗ ನಾವು ನಿಜವಾದ ಕೆಲಸಕ್ಕೆ ಬರುತ್ತೇವೆ, ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸುತ್ತೇವೆ. ಮಾದರಿಯು ಗಣಿತದ ರಚನೆಯಾಗಿದ್ದು ಅದು ಡೇಟಾದಿಂದ ಮಾದರಿಯನ್ನು ಕಲಿಯುತ್ತದೆ ಮತ್ತು ಹೊಸ ಸನ್ನಿವೇಶಗಳಿಗೆ ಭವಿಷ್ಯವನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ. ಆದರೆ ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸುವ ಅತ್ಯಂತ ನಿರ್ಣಾಯಕ ಭಾಗವು ಕೋಡ್ ಸ್ವತಃ ಅಲ್ಲ, ಆದರೆ ಅದರ ಹಿಂದಿನ ಎರಡು ನಿರ್ಧಾರಗಳು: ಸರಿಯಾದ ಸಮಸ್ಯೆಯನ್ನು ವ್ಯಾಖ್ಯಾನಿಸುವುದು ಮತ್ತು ಡೇಟಾವನ್ನು ಸರಿಯಾಗಿ ವಿಭಜಿಸುವುದು. AI ಅಲ್ಗಾರಿದಮ್ ಆಯ್ಕೆ, ಕೋಡ್ ಬರವಣಿಗೆ ಮತ್ತು ಪ್ಯಾರಾಮೀಟರ್ ಟ್ಯೂನಿಂಗ್ನಲ್ಲಿ ಪ್ರಬಲ ಸಲಹೆಗಾರ; ಆದರೆ ಏನನ್ನು ಊಹಿಸಬೇಕು ಮತ್ತು ಯಶಸ್ಸು ಎಂದರೆ ಏನೆಂದು ನಿರ್ಧರಿಸುವುದು ಒಬ್ಬರಿಗೆ ಬಿಟ್ಟದ್ದು. ಸರಿಯಾಗಿ ವ್ಯಾಖ್ಯಾನಿಸದ ಸಮಸ್ಯೆಯು ಸಂಪೂರ್ಣವಾಗಿ ಬರೆದ ಮಾದರಿಯೊಂದಿಗೆ ಸಹ ಕಾರ್ಯನಿರ್ವಹಿಸುವುದಿಲ್ಲ.
ಮೊದಲು ಸಮಸ್ಯೆಯ ವ್ಯಾಖ್ಯಾನ: ನಾವು ಏನನ್ನು ಊಹಿಸುತ್ತೇವೆ
ಪ್ರತಿ ಮಾಡೆಲಿಂಗ್ ಕೆಲಸವು ಪ್ರಶ್ನೆಯೊಂದಿಗೆ ಪ್ರಾರಂಭವಾಗುತ್ತದೆ ಮತ್ತು ಈ ಪ್ರಶ್ನೆಯು ಮಾದರಿಯ ಪ್ರಕಾರವನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ. ವರ್ಗೀಕರಣ — ಔಟ್ಪುಟ್ ಒಂದು ವರ್ಗವಾಗಿದೆ: "ಈ ಗ್ರಾಹಕರು ಬಿಡುತ್ತಾರೆಯೇ ಅಥವಾ ಉಳಿಯುತ್ತಾರೆಯೇ?", "ಈ ವಹಿವಾಟು ನಕಲಿಯೇ?". ರಿಗ್ರೆಶನ್ (ಇಂಗ್ಲಿಷ್ ರಿಗ್ರೆಶನ್ನಲ್ಲಿ - ಔಟ್ಪುಟ್ ಒಂದು ಸಂಖ್ಯೆ): "ಈ ಮನೆಯ ಮೌಲ್ಯ ಎಷ್ಟು?", "ಮುಂದಿನ ತಿಂಗಳು ಎಷ್ಟು ಆರ್ಡರ್ಗಳು ಬರುತ್ತವೆ?". ಕ್ಲಸ್ಟರಿಂಗ್ (ಲೇಬಲ್ ಮಾಡದ ಡೇಟಾವನ್ನು ನೈಸರ್ಗಿಕ ಗುಂಪುಗಳಾಗಿ ವಿಭಜಿಸುವುದು): "ನನ್ನ ಗ್ರಾಹಕರನ್ನು ಎಷ್ಟು ನೈಸರ್ಗಿಕ ವಿಭಾಗಗಳಾಗಿ ವಿಂಗಡಿಸಲಾಗಿದೆ?".
ಸಮಸ್ಯೆಯ ಹೇಳಿಕೆಯ ಎರಡನೇ ಭಾಗವು ಯಶಸ್ಸಿನ ಮಾನದಂಡವಾಗಿದೆ: ಈ ಮಾದರಿಯು "ಒಳ್ಳೆಯದು" ಎಂಬುದರ ಅರ್ಥವೇನು? ವಂಚನೆಯ ಮಾದರಿಯಲ್ಲಿ, ಪ್ರಾಮಾಣಿಕ ಗ್ರಾಹಕರನ್ನು ಆಕಸ್ಮಿಕವಾಗಿ ನಿರ್ಬಂಧಿಸುವುದಕ್ಕಿಂತ ವಂಚಕನನ್ನು ಕಳೆದುಕೊಳ್ಳುವುದು ಹೆಚ್ಚು ದುಬಾರಿಯಾಗಿದೆ; ಆದ್ದರಿಂದ, "ಸಾಮಾನ್ಯ ನಿಖರತೆ" ಅಲ್ಲ ಆದರೆ "ವಂಚಕರನ್ನು ಹಿಡಿಯುವ ದರ" ಮುಂಚೂಣಿಗೆ ಬರುತ್ತದೆ. ನೀವು ಈ ಮಾನದಂಡವನ್ನು ಮೊದಲಿನಿಂದಲೂ ವ್ಯಾಖ್ಯಾನಿಸದಿದ್ದರೆ, ವ್ಯಾಪಾರದ ಮಾಲೀಕರೊಂದಿಗೆ, ನೀವು ಕೆಲಸ ಮಾಡದ "ಹೆಚ್ಚು ನಿಖರವಾದ" ಮಾದರಿಯೊಂದಿಗೆ ಕೊನೆಗೊಳ್ಳುವಿರಿ (ನಾವು ಘಟಕ 7 ರಲ್ಲಿ ಮೆಟ್ರಿಕ್ಗಳಿಗೆ ಆಳವಾಗಿ ಹೋಗುತ್ತೇವೆ).
ಎಚ್ಚರಿಕೆ: "ನಿಖರತೆ" ತಪ್ಪುದಾರಿಗೆಳೆಯಬಹುದು. 1000 ವ್ಯವಹಾರಗಳಲ್ಲಿ 10 ವಂಚನೆಯಾಗಿದ್ದರೆ, "ಯಾವುದೂ ಮೋಸವಲ್ಲ" ಎಂದು ಹೇಳುವ ಮೂರ್ಖ ಮಾದರಿಯು 99% ನಿಖರತೆಯನ್ನು ನೀಡುತ್ತದೆ ಆದರೆ ಒಬ್ಬ ವಂಚಕನನ್ನು ಹಿಡಿಯುವುದಿಲ್ಲ. ಸಮಸ್ಯೆಯ ನೈಜ ವೆಚ್ಚದ ಆಧಾರದ ಮೇಲೆ ಯಶಸ್ಸಿನ ಮಾನದಂಡವನ್ನು ಆಯ್ಕೆಮಾಡಿ.
ತರಬೇತಿ/ಪರೀಕ್ಷೆ ವಿಭಜನೆ: ಮಾದರಿಯ ಪ್ರಾಮಾಣಿಕ ಪರೀಕ್ಷೆ
ತಾನು ಕಲಿತ ದತ್ತಾಂಶದೊಂದಿಗೆ ಮಾದರಿಯನ್ನು ಪರೀಕ್ಷಿಸುವುದು ವಿದ್ಯಾರ್ಥಿಗೆ ಅವನು/ಅವಳು ಪರೀಕ್ಷೆಯಲ್ಲಿ ಅಧ್ಯಯನ ಮಾಡಿದ ಪ್ರಶ್ನೆಗಳನ್ನೇ ಕೇಳುವಂತೆ; ಅವನು ಹೆಚ್ಚು ಅಂಕಗಳನ್ನು ಪಡೆಯುತ್ತಾನೆ ಆದರೆ ಅವನು ನಿಜವಾಗಿಯೂ ತಿಳಿದಿರುವದನ್ನು ತೋರಿಸುವುದಿಲ್ಲ. ಆದ್ದರಿಂದ ನಾವು ಡೇಟಾವನ್ನು ಎರಡು (ಸಾಮಾನ್ಯವಾಗಿ ಮೂರು):
- ತರಬೇತಿ ಸೆಟ್ (ಇಂಗ್ಲಿಷ್ನಲ್ಲಿ ತರಬೇತಿ ಸೆಟ್, ಸಾಮಾನ್ಯವಾಗಿ 70-80%): ಮಾದರಿಯು ಇದನ್ನು ಕಲಿಯುತ್ತದೆ.
- ಪರೀಕ್ಷಾ ಸೆಟ್ (ಪರೀಕ್ಷಾ ಸೆಟ್, ಸಾಮಾನ್ಯವಾಗಿ 20-30%): ಮಾದರಿಯು ಇದನ್ನು ನೋಡುವುದಿಲ್ಲ; ನೈಜ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಇಲ್ಲಿ ಅಳೆಯಲಾಗುತ್ತದೆ.
- ಮೌಲ್ಯೀಕರಣ ಸೆಟ್: ಮಾದರಿ ಸೆಟ್ಟಿಂಗ್ಗಾಗಿ ಬಳಸಲಾಗುವ ಮಧ್ಯಂತರ ಸೆಟ್ (ಯಾವ ಪ್ಯಾರಾಮೀಟರ್ ಉತ್ತಮವಾಗಿದೆ); ಪರೀಕ್ಷಾ ಸೆಟ್ ಅನ್ನು "ಸ್ವಚ್ಛ"ವಾಗಿರಿಸಲು.
ಅತ್ಯಂತ ಮೂಲಭೂತ ನಿಯಮ: ತರಬೇತಿ ಸಮಯದಲ್ಲಿ ಪರೀಕ್ಷಾ ಸೆಟ್ ಅನ್ನು ಎಂದಿಗೂ ಮುಟ್ಟಲಾಗುವುದಿಲ್ಲ. ಸ್ಕೇಲಿಂಗ್, ಕೋಡಿಂಗ್, ವೈಶಿಷ್ಟ್ಯದ ಆಯ್ಕೆ - ಎಲ್ಲವನ್ನೂ ತರಬೇತಿ ಸೆಟ್ನಿಂದ ಸರಳವಾಗಿ ಕಲಿಯಲಾಗುತ್ತದೆ, ನಂತರ ಪರೀಕ್ಷೆಗೆ ಅನ್ವಯಿಸಲಾಗುತ್ತದೆ (ಘಟಕ 5 ರಿಂದ ಸೋರಿಕೆ ತತ್ವ). ಪರೀಕ್ಷಾ ಸೆಟ್ ಮೊದಲ ಬಾರಿಗೆ ಮಾದರಿಯು ನೈಜ ಪ್ರಪಂಚವನ್ನು ನೋಡುತ್ತದೆ; ನೀವು ಅದನ್ನು ತುಂಬಾ ಮುಂಚೆಯೇ ಆನ್ ಮಾಡಿದರೆ ನಿಜವಾದ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ನೀವು ಎಂದಿಗೂ ತಿಳಿಯುವುದಿಲ್ಲ.
ಸಮಯ ಸರಣಿ ವಿನಾಯಿತಿ: ನಿಮ್ಮ ಡೇಟಾ ಸಮಯ ಅವಲಂಬಿತವಾಗಿದ್ದರೆ (ಮಾರಾಟ, ಷೇರು ಮಾರುಕಟ್ಟೆ, ಬೇಡಿಕೆ), ಯಾದೃಚ್ಛಿಕ ವಿಭಜನೆಯನ್ನು ಮಾಡಲಾಗುವುದಿಲ್ಲ. ಏಕೆಂದರೆ ಯಾದೃಚ್ಛಿಕ ವಿಭಜನೆಯು ಮಾದರಿಯು ಭವಿಷ್ಯವನ್ನು ನೋಡಲು ಮತ್ತು ಹಿಂದಿನದನ್ನು ಊಹಿಸಲು ಕಾರಣವಾಗುತ್ತದೆ - ಇದು ಸೋರಿಕೆಯಾಗಿದೆ. ಬದಲಾಗಿ, ಕಾಲಾನುಕ್ರಮದಲ್ಲಿ ಭಾಗಿಸಿ: ಹಳೆಯ ಅವಧಿಯೊಂದಿಗೆ ತರಬೇತಿ ನೀಡಿ, ಹೊಸ ಅವಧಿಯೊಂದಿಗೆ ಪರೀಕ್ಷಿಸಿ.
ಅಲ್ಗಾರಿದಮ್ ಆಯ್ಕೆ: ಸರಳದಿಂದ ಸಂಕೀರ್ಣಕ್ಕೆ
ಅತ್ಯಂತ ಸಂಕೀರ್ಣ ಮಾದರಿಯೊಂದಿಗೆ ಪ್ರಾರಂಭಿಸುವುದು ಆರಂಭಿಕರ ಸಾಮಾನ್ಯ ತಪ್ಪು. ಸರಿಯಾದ ವಿಧಾನವು ವಿರುದ್ಧವಾಗಿದೆ: ಮೊದಲು ಸರಳ ಬೇಸ್ಲೈನ್ ಅನ್ನು ಸ್ಥಾಪಿಸಿ. ವರ್ಗೀಕರಣದಲ್ಲಿ "ಯಾವಾಗಲೂ ಬಹುಸಂಖ್ಯಾತ ವರ್ಗವನ್ನು ಊಹಿಸಿ"; ಹಿಂಜರಿತದಲ್ಲಿ "ಯಾವಾಗಲೂ ಸರಾಸರಿ ಅಂದಾಜು". ಈ ಸ್ಟುಪಿಡ್ ಮಾದರಿಯು ಬೇಸ್ಲೈನ್ ನೀಡುತ್ತದೆ; ನಿಮ್ಮ ನಿಜವಾದ ಮಾದರಿಯು ಇದನ್ನು ರವಾನಿಸಲು ಸಾಧ್ಯವಾಗದಿದ್ದರೆ, ಸಮಸ್ಯೆ ಇದೆ. ನಂತರ ಸರಳ ಮತ್ತು ಅರ್ಥೈಸಬಹುದಾದ ಮಾದರಿಗಳಿಗೆ ತೆರಳಿ.
ಮಾದರಿ
ಸಮಸ್ಯೆಯ ಪ್ರಕಾರ
ಬಲವಾದ ಬಿಂದು
ದೌರ್ಬಲ್ಯ
ಬೇಸ್ಲೈನ್ (ಬಹುಮತ/ಸರಾಸರಿ)
ಎರಡೂ
ಮಾನದಂಡವನ್ನು ನೀಡುತ್ತದೆ
ಕಲಿಯುವುದಿಲ್ಲ
ಲಾಜಿಸ್ಟಿಕ್ ರಿಗ್ರೆಷನ್
ವರ್ಗೀಕರಣ
ಸರಳ, ಅರ್ಥೈಸಬಹುದಾದ
ರೇಖೀಯ ಸಂಬಂಧ ಮಾತ್ರ
ಲೀನಿಯರ್ ರಿಗ್ರೆಶನ್
ಹಿನ್ನಡೆ
ಸರಳ, ವೇಗ
ರೇಖೀಯ ಊಹೆ
ನಿರ್ಧಾರ ಮರ
ಎರಡೂ
ಅರ್ಥೈಸಬಲ್ಲ
ಸುಲಭ ಕಂಠಪಾಠಗಳು
ಯಾದೃಚ್ಛಿಕ ಅರಣ್ಯ
ಎರಡೂ
ಬಲವಾದ, ಬಾಳಿಕೆ ಬರುವ
ಕಡಿಮೆ ಅರ್ಥೈಸಬಲ್ಲದು
ಗ್ರೇಡಿಯಂಟ್ ಬೂಸ್ಟಿಂಗ್ (XGBoost ಇತ್ಯಾದಿ)
ಎರಡೂ
ಬಹಳ ಬಲವಾದ
ಸರಿಹೊಂದಿಸಲು ಕಷ್ಟ, ಕಂಠಪಾಠದ ಅಪಾಯ
ನಿಯಮ: ಸರಳವಾದ "ಸಾಕಷ್ಟು ಒಳ್ಳೆಯದು" ಮಾದರಿಯನ್ನು ಆರಿಸಿ. ಹೆಚ್ಚಿನ ವ್ಯಾಪಾರದ ಸಂದರ್ಭಗಳಲ್ಲಿ ಶಕ್ತಿಗಿಂತ ವ್ಯಾಖ್ಯಾನವು ಹೆಚ್ಚು ಮೌಲ್ಯಯುತವಾಗಿದೆ; "ಕಪ್ಪು ಪೆಟ್ಟಿಗೆಯು ಹಾಗೆ ಹೇಳಿದೆ" ಎನ್ನುವುದಕ್ಕಿಂತ "ನಿಮ್ಮ ಸಾಲದಿಂದ ಆದಾಯದ ಅನುಪಾತವು ಹೆಚ್ಚಿರುವುದರಿಂದ" ಸಾಲದ ನಿರಾಕರಣೆಯನ್ನು ವಿವರಿಸುವುದು ಉತ್ತಮವಾಗಿದೆ.
ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು
ಪ್ರಕರಣ 1 - ತಪ್ಪಾದ ಸಮಸ್ಯೆ ವ್ಯಾಖ್ಯಾನ. "ಗ್ರಾಹಕರು ತೃಪ್ತರಾಗಿದ್ದಾರೆ" ಎಂಬ ಆಧಾರದ ಮೇಲೆ ತಂಡವು ವರ್ಗೀಕರಣ ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸಿದೆ ಆದರೆ "ನಿಖರತೆ"ಯನ್ನು ಯಶಸ್ಸಿನ ಮಾನದಂಡವಾಗಿ ಆಯ್ಕೆ ಮಾಡಿದೆ. ಡೇಟಾದಲ್ಲಿ, 88% ಗ್ರಾಹಕರು ತೃಪ್ತರಾಗಿದ್ದಾರೆ; ಪ್ರತಿಯೊಬ್ಬರನ್ನು "ತೃಪ್ತಿ" ಎಂದು ಕರೆಯುವ ಮೂಲಕ ಮಾದರಿಯು 88% ನಿಖರತೆಯನ್ನು ಪಡೆದುಕೊಂಡಿದೆ ಮತ್ತು ಅತೃಪ್ತ ಜನರನ್ನು ಎಂದಿಗೂ ಹಿಡಿಯಲಿಲ್ಲ - ಅವರನ್ನು ಹುಡುಕುವುದು ನಿಜವಾದ ಗುರಿಯಾಗಿದ್ದರೂ ಸಹ. ಪಾಠ: ನೈಜ ಉದ್ದೇಶದ ಆಧಾರದ ಮೇಲೆ ಯಶಸ್ಸಿನ ಮಾನದಂಡಗಳನ್ನು ಆರಿಸಿ.
ಪ್ರಕರಣ 2 - ಕಂಪಾರ್ಟ್ಮೆಂಟ್ನಲ್ಲಿ ಸಮಯ ಸೋರಿಕೆ. ಬೇಡಿಕೆಯ ಮುನ್ಸೂಚನೆಯ ಯೋಜನೆಯಲ್ಲಿ, ಡೇಟಾವನ್ನು ಯಾದೃಚ್ಛಿಕವಾಗಿ ವಿಭಜಿಸಲಾಗಿದೆ. ಮಾದರಿಯು 93% ನಿಖರತೆಯನ್ನು ನೀಡಿತು ಆದರೆ ಉತ್ಪಾದನೆಯಲ್ಲಿ ಕ್ರ್ಯಾಶ್ ಮಾಡಿತು ಏಕೆಂದರೆ ತರಬೇತಿಯಲ್ಲಿ ಅದು ಡಿಸೆಂಬರ್ ಡೇಟಾದೊಂದಿಗೆ ಜನವರಿ, ನಂತರ ನವೆಂಬರ್ ಅನ್ನು ಊಹಿಸಿತ್ತು - ಇದು ಭವಿಷ್ಯವನ್ನು ನೋಡಿದೆ. ನಾವು ಕಾಲಾನುಕ್ರಮದ ವಿಭಾಗಕ್ಕೆ ಬದಲಾಯಿಸಿದಾಗ, ನಿಜವಾದ ಕಾರ್ಯಕ್ಷಮತೆಯು 74% ಕ್ಕೆ ಏರಿತು. ಪಾಠ: ಸಮಯ ಸರಣಿಯಲ್ಲಿ ಕಾಲಾನುಕ್ರಮ ವಿಭಾಗ.
ಪ್ರಕರಣ 3 - ಅನಗತ್ಯ ಸಂಕೀರ್ಣತೆ. ಒಬ್ಬ ವಿಶ್ಲೇಷಕನು ಆಳವಾದ ನರಮಂಡಲದೊಂದಿಗೆ ನೇರವಾಗಿ ಪ್ರಾರಂಭಿಸಿ, ವಾರಗಳವರೆಗೆ ಅದನ್ನು ಟ್ಯೂನ್ ಮಾಡಿದನು ಮತ್ತು 81% ನಿಖರತೆಯನ್ನು ಪಡೆದುಕೊಂಡನು. ನಂತರ ಸಹೋದ್ಯೋಗಿಯು 20 ಲೈನ್ಗಳ ಲಾಜಿಸ್ಟಿಕ್ ರಿಗ್ರೆಶನ್ನೊಂದಿಗೆ 80% ಪಡೆದರು - ಹೆಚ್ಚು ವೇಗವಾಗಿ, ವ್ಯಾಖ್ಯಾನಿಸಬಹುದಾದ ಮತ್ತು ನಿರ್ವಹಿಸಲು ಸುಲಭ. ಪಾಠ: ಬೇಸ್ಲೈನ್ ಮತ್ತು ಸರಳ ಮಾದರಿಯೊಂದಿಗೆ ಪ್ರಾರಂಭಿಸಿ, ಅದು ಅರ್ಹವಾದಾಗ ಸಂಕೀರ್ಣತೆಯನ್ನು ಸೇರಿಸಿ.
ನಾಲ್ಕು ನಕಲಿಸಬಹುದಾದ ಟೆಂಪ್ಲೇಟ್ಗಳು
1) ಸಮಸ್ಯೆಯ ವ್ಯಾಖ್ಯಾನವನ್ನು ಸ್ಪಷ್ಟಪಡಿಸುವುದು:
ನಿಮ್ಮ ಪಾತ್ರ: ಮಾಡೆಲಿಂಗ್ ಸಲಹೆಗಾರ. ಈ ಕೆಲಸವನ್ನು ವ್ಯಾಖ್ಯಾನಿಸಲು ನನಗೆ ಸಹಾಯ ಮಾಡಿ: "ನಾನು ಗ್ರಾಹಕರ ಮಂಥನವನ್ನು ಕಡಿಮೆ ಮಾಡಲು ಬಯಸುತ್ತೇನೆ." ನನ್ನನ್ನು ಕೇಳಿ ಮತ್ತು ಸ್ಪಷ್ಟಪಡಿಸಿ: (1) ಇದು ವರ್ಗೀಕರಣ ಅಥವಾ ಹಿಂಜರಿಕೆಯೇ, (2) ಗುರಿ ವೇರಿಯೇಬಲ್ ನಿಖರವಾಗಿ ಏನು ಮತ್ತು ಅದನ್ನು ಹೇಗೆ ವ್ಯಾಖ್ಯಾನಿಸಬೇಕು, (3) ಯಶಸ್ಸಿನ ಮಾನದಂಡ ಯಾವುದು ಮತ್ತು ಏಕೆ. ನಿರ್ಧಾರ ನನ್ನದು; ನೀವು ಪ್ರಶ್ನೆಗಳು ಮತ್ತು ಆಯ್ಕೆಗಳನ್ನು ಪ್ರಸ್ತುತಪಡಿಸುತ್ತೀರಿ.
2) ಸುರಕ್ಷಿತ ತರಬೇತಿ/ಪರೀಕ್ಷಾ ವಿಭಾಗ:
ನನ್ನ ಡಿಎಫ್ ಅನ್ನು ತರಬೇತಿ/ಪರೀಕ್ಷೆ 80%/20% ಎಂದು ವಿಭಜಿಸಿ. ವರ್ಗ ವಿತರಣೆಯನ್ನು ನಿರ್ವಹಿಸಿ (ಸ್ತರೀಕರಿಸಿ).random_state=42. ಇದು ಸಮಯ ಸರಣಿಯಲ್ಲ (ಸ್ವತಂತ್ರ ಅವಲೋಕನಗಳು). ವಿಭಾಗದ ನಂತರ ಪ್ರತಿ ಸೆಟ್ನ ವರ್ಗ ಅನುಪಾತವನ್ನು ಮುದ್ರಿಸಿ. ಯಾವುದೇ ರೂಪಾಂತರವನ್ನು ಅನ್ವಯಿಸದೆ ಪರೀಕ್ಷಾ ಸೆಟ್ಗೆ ವಿಭಜಿಸುವ ಕೋಡ್ ಅನ್ನು ನೀಡಿ.
3) ಸಮಯ ಸರಣಿಯ ಕಾಲಾನುಕ್ರಮ ವಿಭಾಗ:
ಡೇಟಾ ಸಮಯ ಅವಲಂಬಿತವಾಗಿದೆ (ದಿನಾಂಕ ಕಾಲಮ್: order_date). ಯಾದೃಚ್ಛಿಕವಲ್ಲ, ಕಾಲಾನುಕ್ರಮದಲ್ಲಿ ಭಾಗಿಸಿ: ಹಳೆಯ 80% ತರಬೇತಿ, ಹೊಸ 20% ಪರೀಕ್ಷೆ. ತರಬೇತಿ ಮತ್ತು ಪರೀಕ್ಷೆಯ ದಿನಾಂಕ ಶ್ರೇಣಿಗಳನ್ನು ಮುದ್ರಿಸಿ ಇದರಿಂದ ಭವಿಷ್ಯವು ಸೋರಿಕೆಯಾಗಿಲ್ಲ ಎಂದು ನಾನು ಪರಿಶೀಲಿಸಬಹುದು.
4) ಬೇಸ್ಲೈನ್ ಅನ್ನು ಹೊಂದಿಸುವುದು:
ನನಗೆ ವರ್ಗೀಕರಣ ಸಮಸ್ಯೆ ಇದೆ (ಗುರಿ: ಮಂಥನ 0/1). ಮೊದಲು ಬೇಸ್ಲೈನ್ ಅನ್ನು ಸ್ಥಾಪಿಸಿ: ಡಮ್ಮಿಕ್ಲಾಸಿಫೈಯರ್ನೊಂದಿಗೆ ತರಬೇತಿ/ಪರೀಕ್ಷೆಯ ನಿಖರತೆಯನ್ನು ಅಳೆಯಿರಿ, ಇದು ಯಾವಾಗಲೂ ಬಹುಪಾಲು ವರ್ಗವನ್ನು ಊಹಿಸುತ್ತದೆ. ನಂತರ ಸರಳವಾದ ಲಾಜಿಸ್ಟಿಕ್ ರಿಗ್ರೆಶನ್ ಅನ್ನು ತರಬೇತಿ ಮಾಡಿ ಮತ್ತು ಅದು ಬೇಸ್ಲೈನ್ ಅನ್ನು ಸೋಲಿಸುತ್ತದೆಯೇ ಎಂದು ಹೋಲಿಕೆ ಮಾಡಿ. ಅಕ್ಕಪಕ್ಕದಲ್ಲಿ ಎರಡರ ಮೆಟ್ರಿಕ್ಗಳನ್ನು ತೋರಿಸಿ.
ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್ / ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್
ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್:
ಈ ಡೇಟಾದೊಂದಿಗೆ ಉತ್ತಮ ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸಿ.
"ಅತ್ಯುತ್ತಮ" ಎಂದು ವ್ಯಾಖ್ಯಾನಿಸಲಾಗಿಲ್ಲ; ಯಾವುದೇ ಸಮಸ್ಯೆಯ ಪ್ರಕಾರವಿಲ್ಲ, ಯಾವುದೇ ಗುರಿಯಿಲ್ಲ, ಯಾವುದೇ ಯಶಸ್ಸಿನ ಮಾನದಂಡವಿಲ್ಲ ಮತ್ತು ವಿಭಾಗ ತಂತ್ರವಿಲ್ಲ. AI ಯಾದೃಚ್ಛಿಕ ಮಾದರಿಯನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ, ಬಹುಶಃ ಸೋರಿಕೆಯಾಗುತ್ತದೆ.
ಶಕ್ತಿಯುತ ಪ್ರಾಂಪ್ಟ್:
ನಿಮ್ಮ ಪಾತ್ರ: ಮಾಡೆಲಿಂಗ್ ಸಹಾಯಕ. ಸಮಸ್ಯೆ: ವರ್ಗೀಕರಣ, ಗುರಿ "ಮಂಥನ" (0/1), ವರ್ಗ ಅಸಮತೋಲನವಿದೆ (~12% ಮಂಥನ). ಯಶಸ್ಸಿನ ಮಾನದಂಡ: ಮಂಥನ ಮಾಡುವವರನ್ನು ನೆನಪಿಸಿಕೊಳ್ಳುವುದು ಆದ್ಯತೆಯಾಗಿದೆ. ಡೇಟಾ ಸ್ವತಂತ್ರ ವೀಕ್ಷಣೆ (ಸಮಯ ಸರಣಿಯಲ್ಲ). ಕಾರ್ಯ: (1) 80/20% ಶ್ರೇಣೀಕೃತ ವಿಭಜನೆ, (2) ಡಮ್ಮಿಕ್ಲಾಸಿಫೈಯರ್ ಬೇಸ್ಲೈನ್, (3) ಲಾಜಿಸ್ಟಿಕ್ ರಿಗ್ರೆಷನ್, ಪೈಪ್ಲೈನ್ನಲ್ಲಿನ ಎಲ್ಲಾ ರೂಪಾಂತರಗಳು ಮತ್ತು ತರಬೇತಿಯಿಂದ ಮಾತ್ರ ಕಲಿತವು. ವಿಭಜಿಸುವ ಮೊದಲು ಪರೀಕ್ಷಾ ಸೆಟ್ ಅನ್ನು ಮುಟ್ಟಬೇಡಿ.
ಇಲ್ಲಿ ಸಮಸ್ಯೆಯ ಪ್ರಕಾರ, ಅಸಮತೋಲನ, ಮಾನದಂಡ ಮತ್ತು ಸೋರಿಕೆಯ ಅಳತೆ ಸ್ಪಷ್ಟವಾಗಿದೆ.
ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು
- ನಿಜವಾದ ಉದ್ದೇಶಕ್ಕೆ ಅನುಗುಣವಾಗಿ ಯಶಸ್ಸಿನ ಮಾನದಂಡಗಳನ್ನು ಆಯ್ಕೆ ಮಾಡುತ್ತಿಲ್ಲ. ಅಸಮತೋಲಿತ ಡೇಟಾದಲ್ಲಿನ "ನಿಖರತೆ" ತಪ್ಪುದಾರಿಗೆಳೆಯುವಂತಿದೆ; ನೀವು ಅಲ್ಪಸಂಖ್ಯಾತ ವರ್ಗವನ್ನು ಹಿಡಿಯಲು ಬಯಸಿದರೆ, ಮರುಪಡೆಯುವಿಕೆ ಮುಂಚೂಣಿಗೆ ಬರುತ್ತದೆ.
- ತರಬೇತಿಯ ಸಮಯದಲ್ಲಿ ಪರೀಕ್ಷಾ ಸೆಟ್ ಅನ್ನು ಸ್ಪರ್ಶಿಸುವುದು. ವಿಭಜಿಸುವ ಮೊದಲು ಸ್ಕೇಲಿಂಗ್/ಎನ್ಕೋಡಿಂಗ್ ಮಾಡುವುದು ಸೋರಿಕೆಯಾಗುತ್ತದೆ ಮತ್ತು ನೈಜ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಮರೆಮಾಡುತ್ತದೆ.
- ಸಮಯ ಸರಣಿಯಲ್ಲಿ ಯಾದೃಚ್ಛಿಕ ವಿಭಜನೆ. ಮಾದರಿಯು ಭವಿಷ್ಯವನ್ನು ನೋಡುತ್ತದೆ, ಉತ್ಪಾದನೆಯಲ್ಲಿ ಕುಸಿಯುತ್ತದೆ; ಕಾಲಾನುಕ್ರಮ ವಿಭಜನೆ ಅತ್ಯಗತ್ಯ.
- ಬೇಸ್ಲೈನ್ ಅನ್ನು ಸ್ಥಾಪಿಸದೆ ಸಂಕೀರ್ಣ ಮಾದರಿಗೆ ಹಾರಿ. ಮಾನದಂಡಗಳಿಲ್ಲದೆಯೇ ಮಾದರಿಯು ನಿಜವಾಗಿಯೂ ಉತ್ತಮವಾಗಿದೆಯೇ ಅಥವಾ ಇಲ್ಲವೇ ಎಂದು ನಿಮಗೆ ತಿಳಿದಿರುವುದಿಲ್ಲ.
- ವ್ಯಾಖ್ಯಾನವನ್ನು ನಿರ್ಲಕ್ಷಿಸುವುದು. ವ್ಯವಹಾರ ನಿರ್ಧಾರಗಳಲ್ಲಿ, ಸರಳವಾದ ವಿವರಿಸಬಹುದಾದ ಮಾದರಿಯು ಕಪ್ಪು ಪೆಟ್ಟಿಗೆಗಿಂತ ಹೆಚ್ಚು ಮೌಲ್ಯಯುತವಾಗಿದೆ.
ಸಲಹೆ: ನೀವು ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸಲು ಪ್ರಾರಂಭಿಸುವ ಮೊದಲು, ಒಂದು ವಾಕ್ಯವನ್ನು ಬರೆಯಿರಿ: "ಈ ಮಾದರಿಯು _____ ಅನ್ನು ಊಹಿಸುತ್ತದೆ, ಅದರ ಯಶಸ್ಸನ್ನು ಮೆಟ್ರಿಕ್ _____ ನಿಂದ ಅಳೆಯಲಾಗುತ್ತದೆ, ಏಕೆಂದರೆ ಕೆಲಸದ ನಿಜವಾದ ವೆಚ್ಚವು _____ ಆಗಿದೆ." ನೀವು ಈ ವಾಕ್ಯವನ್ನು ಭರ್ತಿ ಮಾಡಲು ಸಾಧ್ಯವಾಗದಿದ್ದರೆ, ನೀವು ಇನ್ನೂ ಕೋಡ್ ಬರೆಯಲು ಸಿದ್ಧರಿಲ್ಲ.
ಸಾರಾಂಶದಲ್ಲಿ
ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸುವ ಅತ್ಯಂತ ನಿರ್ಣಾಯಕ ಭಾಗವು ಕೋಡ್ ಅಲ್ಲ, ಆದರೆ ಅದರ ಹಿಂದಿನ ನಿರ್ಧಾರಗಳು: ಸರಿಯಾದ ಸಮಸ್ಯೆಯನ್ನು ವ್ಯಾಖ್ಯಾನಿಸುವುದು (ವರ್ಗೀಕರಣ ಅಥವಾ ಹಿಂಜರಿತ, ಗುರಿ ಏನು, ಯಶಸ್ಸಿನ ಮಾನದಂಡ ಯಾವುದು) ಮತ್ತು ಡೇಟಾವನ್ನು ನ್ಯಾಯಯುತವಾಗಿ ವಿಭಜಿಸುವುದು (ಪರೀಕ್ಷಾ ಸೆಟ್ ಅನ್ನು ಮುಟ್ಟದೆ; ಕಾಲಾನುಕ್ರಮದಲ್ಲಿ). ಯಾವಾಗಲೂ ಸರಳ ಬೇಸ್ಲೈನ್ನೊಂದಿಗೆ ಪ್ರಾರಂಭಿಸಿ ಮತ್ತು ಅದು ಅರ್ಹವಾದಾಗ ಮಾತ್ರ ಸಂಕೀರ್ಣತೆಯನ್ನು ಸೇರಿಸಿ; ಹೆಚ್ಚಿನ ವ್ಯವಹಾರ ಸಂದರ್ಭಗಳಲ್ಲಿ ಅಧಿಕಾರದ ಮೇಲೆ ವ್ಯಾಖ್ಯಾನವನ್ನು ಮೌಲ್ಯೀಕರಿಸಲಾಗುತ್ತದೆ. AI ಅಲ್ಗಾರಿದಮ್ ಆಯ್ಕೆ ಮತ್ತು ಕೋಡ್ನಲ್ಲಿ ಪ್ರಬಲ ಸಲಹೆಗಾರ, ಆದರೆ ನೀವು ಏನನ್ನು ಊಹಿಸುತ್ತೀರಿ ಮತ್ತು ಏಕೆ ಎಂದು ಮಾನವನು ನಿರ್ಧರಿಸುತ್ತಾನೆ.
ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ
ಮುನ್ಸೂಚನೆಯ ಸಮಸ್ಯೆಯನ್ನು ವಿವರಿಸಿ ಮತ್ತು ಈ ಕೆಳಗಿನ ವಾಕ್ಯವನ್ನು ಬರವಣಿಗೆಯಲ್ಲಿ ಪೂರ್ಣಗೊಳಿಸಿ: "ಈ ಮಾದರಿಯು ___ (ವರ್ಗೀಕರಣ / ಹಿಂಜರಿತ) ಊಹಿಸುತ್ತದೆ, ಗುರಿ ___ ಆಗಿದೆ, ಯಶಸ್ಸಿನ ಮಾನದಂಡವು ___ ಆಗಿದೆ ಏಕೆಂದರೆ ___." ನಂತರ ಸರಿಯಾದ ತಂತ್ರದೊಂದಿಗೆ ಡೇಟಾವನ್ನು ವಿಭಜಿಸಿ (ಅದು ಸಮಯ ಸರಣಿಯಾಗಿದ್ದರೆ ಕಾಲಾನುಕ್ರಮ), ಬೇಸ್ಲೈನ್ ಅನ್ನು ಸ್ಥಾಪಿಸಿ ಮತ್ತು ಸರಳ ಮಾದರಿಯು ಆ ಬೇಸ್ಲೈನ್ ಅನ್ನು ಮುರಿಯುತ್ತದೆಯೇ ಎಂದು ಅಳೆಯಿರಿ.
ಪರಿಶೀಲನಾಪಟ್ಟಿ
- [ ] ನಾನು ಸಮಸ್ಯೆಯ ಪ್ರಕಾರವನ್ನು (ವರ್ಗೀಕರಣ/ಹಿಮ್ಮೆಟ್ಟುವಿಕೆ) ಮತ್ತು ಗುರಿಯನ್ನು ಸ್ಪಷ್ಟವಾಗಿ ವ್ಯಾಖ್ಯಾನಿಸಿದ್ದೇನೆಯೇ?
- [ ] ಕೆಲಸದ ನಿಜವಾದ ವೆಚ್ಚದ ಆಧಾರದ ಮೇಲೆ ನಾನು ಯಶಸ್ಸಿನ ಮಾನದಂಡವನ್ನು ಆರಿಸಿಕೊಂಡಿದ್ದೇನೆಯೇ?
- [ ] ನಾನು ತರಬೇತಿಯ ಸಮಯದಲ್ಲಿ ಪರೀಕ್ಷಾ ಸೆಟ್ ಅನ್ನು ಮುಟ್ಟದೆ ಬಿಟ್ಟಿದ್ದೇನೆಯೇ?
- [ ] ಇದು ಸಮಯ ಸರಣಿಯಾಗಿದ್ದರೆ, ನಾನು ಅದನ್ನು ಕಾಲಾನುಕ್ರಮವಾಗಿ ಭಾಗಿಸಿದ್ದೇನೆಯೇ?
- [ ] ಸಂಕೀರ್ಣ ಮಾದರಿಗೆ ಹೋಗುವ ಮೊದಲು ನಾನು ಬೇಸ್ಲೈನ್ ಅನ್ನು ಸ್ಥಾಪಿಸಿದ್ದೇನೆಯೇ?