ಘಟಕಗಳು
1. ಎಂಎಲ್ ಎಂಜಿನಿಯರಿಂಗ್‌ನಲ್ಲಿ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ: ಪಾತ್ರ, ಗಡಿಗಳು, ಮೌಲ್ಯೀಕರಣ ಮತ್ತು ಜವಾಬ್ದಾರಿ 2. ಡೇಟಾ ಪೈಪ್‌ಲೈನ್: ಸಂಗ್ರಹಣೆ, ಶುದ್ಧೀಕರಣ, ಟ್ಯಾಗಿಂಗ್ ಮತ್ತು ಆವೃತ್ತಿ 3. ಮಾದರಿ ತರಬೇತಿ ಮತ್ತು ಮೌಲ್ಯಮಾಪನ: ನಿಖರವಾದ ಮೆಟ್ರಿಕ್ಸ್, ಪ್ರಾಮಾಣಿಕ ಬೆಂಚ್ಮಾರ್ಕಿಂಗ್ 4. LLM ಅಪ್ಲಿಕೇಶನ್: RAG ನೊಂದಿಗೆ ನಿಮ್ಮ ಸ್ವಂತ ಡೇಟಾವನ್ನು ಆಧರಿಸಿ ಉತ್ತರಗಳು 5. LLM ಅಪ್ಲಿಕೇಶನ್: ಏಜೆಂಟ್, ಟೂಲಿಂಗ್ ಮತ್ತು ಸೆಕ್ಯೂರ್ ಆಟೊಮೇಷನ್ 6. ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಆಧಾರ: ಯಾವಾಗ, ಹೇಗೆ ಮತ್ತು ಯಾವ ಅಪಾಯದೊಂದಿಗೆ 7. MLOps ಮತ್ತು ನಿಯೋಜನೆ: ಮಾದರಿಯನ್ನು ಲ್ಯಾಬ್‌ನಿಂದ ಉತ್ಪಾದನೆಗೆ ಸ್ಥಳಾಂತರಿಸುವುದು 8. ಇವಾಲ್ ಮತ್ತು ಮಾನಿಟರಿಂಗ್: ಉತ್ಪಾದನೆಯಲ್ಲಿ ಮಾದರಿಯು ನಿಜವಾಗಿಯೂ ಏನು ಮಾಡುತ್ತದೆ ಎಂಬುದನ್ನು ತಿಳಿದುಕೊಳ್ಳುವುದು 9. ಭದ್ರತೆ ಮತ್ತು ಗೌಪ್ಯತೆ: AI ವ್ಯವಸ್ಥೆಗಳನ್ನು ರಕ್ಷಿಸುವುದು 10. ಪಕ್ಷಪಾತ, ನೈತಿಕತೆ ಮತ್ತು ವೆಚ್ಚ: ಜವಾಬ್ದಾರಿಯುತ ಮತ್ತು ಸುಸ್ಥಿರ AI ಎಂಜಿನಿಯರಿಂಗ್ 11. ಪುನರುತ್ಪಾದನೆ ಮತ್ತು ಅಂತ್ಯದಿಂದ ಅಂತ್ಯದ ಯೋಜನೆ: ಎಲ್ಲವನ್ನೂ ಸಂಯೋಜಿಸುವುದು
ಘಟಕ 3 / 11

ಮಾದರಿ ತರಬೇತಿ ಮತ್ತು ಮೌಲ್ಯಮಾಪನ: ನಿಖರವಾದ ಮೆಟ್ರಿಕ್ಸ್, ಪ್ರಾಮಾಣಿಕ ಬೆಂಚ್ಮಾರ್ಕಿಂಗ್

ಲಾಭಗಳು:

  • ಸಮಸ್ಯೆಯ ಪ್ರಕಾರ ಮತ್ತು ವ್ಯವಹಾರ ಸಂದರ್ಭಕ್ಕೆ ಸೂಕ್ತವಾದ ಮೆಟ್ರಿಕ್ ಅನ್ನು ಆಯ್ಕೆ ಮಾಡುವ ಸಾಮರ್ಥ್ಯ (PR-AUC/ಅಸಮತೋಲಿತ ಡೇಟಾದಲ್ಲಿ ಮರುಪಡೆಯುವಿಕೆ, MAE/RMSE ಹಿಂಜರಿತದಲ್ಲಿ) ಮತ್ತು ಕಲಿಕೆಯ ಮೇಲೆ/ಅಡಿಯಲ್ಲಿ ಗುರುತಿಸುವ ಸಾಮರ್ಥ್ಯ
  • ಪ್ರತಿ ಮೆಟ್ರಿಕ್ ಅನ್ನು ಬೇಸ್‌ಲೈನ್‌ಗೆ ವಿರುದ್ಧವಾಗಿ ಅರ್ಥೈಸುವ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ವಿಚಲನವನ್ನು ಅಳೆಯುವ ಮತ್ತು ಅಡ್ಡ-ಮೌಲ್ಯಮಾಪನದೊಂದಿಗೆ ಪ್ರಗತಿಯಿಂದ ಶಬ್ದವನ್ನು ಪ್ರತ್ಯೇಕಿಸುವ ಸಾಮರ್ಥ್ಯ
  • ಊರ್ಜಿತಗೊಳಿಸುವಿಕೆಯ ಸೆಟ್‌ನೊಂದಿಗೆ ಹೈಪರ್‌ಪ್ಯಾರಾಮೀಟರ್‌ಗಳನ್ನು ಟ್ಯೂನ್ ಮಾಡುವ ಮೂಲಕ ಮತ್ತು ಪರೀಕ್ಷಾ ಸೆಟ್ ಅನ್ನು ಕೊನೆಯಲ್ಲಿ ಮಾತ್ರ ಬಳಸುವ ಮೂಲಕ ಆಶಾವಾದಿ ಫಲಿತಾಂಶಗಳನ್ನು ವರದಿ ಮಾಡುವ ಸಾಮರ್ಥ್ಯ

ಮಾದರಿ ತರಬೇತಿ (ತರಬೇತಿ: ಡೇಟಾದಿಂದ ಮಾದರಿಗಳನ್ನು ಕಲಿಯುವ ಪ್ರಕ್ರಿಯೆ) ML ಎಂಜಿನಿಯರಿಂಗ್‌ನ ಅತ್ಯಂತ ಗೋಚರಿಸುವ ಆದರೆ ಅತ್ಯಂತ ತಪ್ಪುದಾರಿಗೆಳೆಯುವ ಹಂತವಾಗಿದೆ. ಇದು "ನಿಖರತೆ 95%" ನಂತಹ ತೃಪ್ತಿಕರ ಸಂಖ್ಯೆಯನ್ನು ಉತ್ಪಾದಿಸುವ ಕಾರಣ ಕಾಣಿಸಿಕೊಳ್ಳುತ್ತದೆ. ದಾರಿತಪ್ಪಿಸುವುದು ಏಕೆಂದರೆ ಆ ಸಂಖ್ಯೆಯು ಸಾಮಾನ್ಯವಾಗಿ ತಪ್ಪು ಪ್ರಶ್ನೆಗೆ ಸರಿಯಾದ ಉತ್ತರವಾಗಿದೆ. ಈ ಘಟಕದಲ್ಲಿ, ಶಿಕ್ಷಣ ಮತ್ತು ಮೌಲ್ಯಮಾಪನವನ್ನು ಎಂಜಿನಿಯರಿಂಗ್ ವಿಭಾಗದೊಂದಿಗೆ ಚರ್ಚಿಸಲಾಗಿದೆ; ನಾವು ಪ್ರಾಯೋಗಿಕ ವಿನ್ಯಾಸದಲ್ಲಿ ಪಾಲುದಾರರಾಗಿ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯನ್ನು ಬಳಸುತ್ತೇವೆ ಮತ್ತು ಮಾಪನದ ನಿರ್ಧಾರವನ್ನು ಆಧರಿಸಿರುತ್ತೇವೆ.

ತರಬೇತಿ ಚಕ್ರದ ತರ್ಕ

ಒಂದು ಮಾದರಿಯು ನಷ್ಟದ ಕಾರ್ಯವನ್ನು ಕಡಿಮೆ ಮಾಡುವ ಮೂಲಕ ಡೇಟಾದಲ್ಲಿನ ಮಾದರಿಯನ್ನು ಕಲಿಯುತ್ತದೆ: ಮಾದರಿಯ ದೋಷವನ್ನು ಸಂಖ್ಯಾತ್ಮಕವಾಗಿ ಅಳೆಯುವ ಕಾರ್ಯ. ಆಪ್ಟಿಮೈಸೇಶನ್ ಅಲ್ಗಾರಿದಮ್ (ಉದಾ. ಗ್ರೇಡಿಯಂಟ್ ಡಿಸೆಂಟ್) ಪ್ಯಾರಾಮೀಟರ್‌ಗಳನ್ನು ಹಂತ ಹಂತವಾಗಿ ಹೊಂದಿಸುವ ಮೂಲಕ ನಷ್ಟವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ. ತರಬೇತಿ ಡೇಟಾವನ್ನು ನೆನಪಿಟ್ಟುಕೊಳ್ಳುವುದು ಗುರಿಯಲ್ಲ, ಆದರೆ ಅದನ್ನು ಅಭೂತಪೂರ್ವ ಡೇಟಾಗೆ ಸಾಮಾನ್ಯೀಕರಿಸುವುದು.

ಎರಡು ಮುಖ್ಯ ಅಪಾಯಗಳು:

  • ಓವರ್ ಫಿಟ್ಟಿಂಗ್: ಮಾದರಿಯು ತರಬೇತಿ ಡೇಟಾವನ್ನು ನೆನಪಿಟ್ಟುಕೊಳ್ಳುತ್ತದೆ ಮತ್ತು ಹೊಸ ಡೇಟಾದಲ್ಲಿ ವಿಫಲಗೊಳ್ಳುತ್ತದೆ. ತರಬೇತಿ ಯಶಸ್ಸು ಹೆಚ್ಚು, ಪರಿಶೀಲನೆ ಯಶಸ್ಸು ಕಡಿಮೆ.
  • ಅಂಡರ್ಫಿಟಿಂಗ್: ಮಾದರಿಯು ಮಾದರಿಯನ್ನು ಸೆರೆಹಿಡಿಯಲು ಸಾಧ್ಯವಿಲ್ಲ; ತರಬೇತಿ ಮತ್ತು ಮೌಲ್ಯಾಂಕನದ ಯಶಸ್ಸು ಎರಡೂ ಕಡಿಮೆ.

ಸಮತೋಲನವನ್ನು ಕಂಡುಕೊಳ್ಳುವುದು ಶಿಕ್ಷಣದ ಕಲೆ. ಈ ಸಮತೋಲನವನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡಲು ಊರ್ಜಿತಗೊಳಿಸುವಿಕೆಯ ಸೆಟ್ ಇದೆ: ತರಬೇತಿಯ ಯಶಸ್ಸು ಹೆಚ್ಚುತ್ತಿರುವಾಗ ಊರ್ಜಿತಗೊಳಿಸುವಿಕೆಯ ಯಶಸ್ಸು ಕಡಿಮೆಯಾಗಲು ಪ್ರಾರಂಭಿಸಿದರೆ, ಓವರ್‌ಲರ್ನಿಂಗ್ ಪ್ರಾರಂಭವಾಗಿದೆ.

ಸಲಹೆ: ಪ್ರತಿ ಹಂತದಲ್ಲೂ ತರಬೇತಿ ಮತ್ತು ಊರ್ಜಿತಗೊಳಿಸುವಿಕೆಯ ನಷ್ಟವನ್ನು ಒಟ್ಟಾಗಿ ರೂಪಿಸಿ. ಎರಡು ವಕ್ರರೇಖೆಗಳು ಬೇರೆಯಾಗಲು ಪ್ರಾರಂಭವಾಗುವ ಹಂತವು ಅತಿಕ್ರಮಣವು ಪ್ರಾರಂಭವಾಗುತ್ತದೆ ಮತ್ತು "ಬೇಗ ನಿಲ್ಲಿಸಲು" ಸರಿಯಾದ ಕ್ಷಣವಾಗಿದೆ.

ಮೆಟ್ರಿಕ್ ಆಯ್ಕೆ: ಅತ್ಯಂತ ನಿರ್ಣಾಯಕ ನಿರ್ಧಾರ

ತಪ್ಪು ಮೆಟ್ರಿಕ್ ಉತ್ತಮ ಮಾದರಿಯನ್ನು ಕೆಟ್ಟದಾಗಿ ಮತ್ತು ಕೆಟ್ಟ ಮಾದರಿಯನ್ನು ಉತ್ತಮವಾಗಿ ಕಾಣುವಂತೆ ಮಾಡುತ್ತದೆ. ಸಮಸ್ಯೆಯು ಮೆಟ್ರಿಕ್ ಅನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ:

  • ಅಸಮತೋಲಿತ ವರ್ಗೀಕರಣ (ಒಂದು ವರ್ಗವು ಬಹಳ ಅಪರೂಪ, ಉದಾ. ವಂಚನೆ): ನಿಖರತೆಯು ದಾರಿತಪ್ಪಿಸುತ್ತದೆ. "ಎಲ್ಲವನ್ನೂ ಸಾಮಾನ್ಯ ಎಂದು ಕರೆಯಿರಿ" ಎಂದು ಹೇಳುವ ಮಾದರಿಯು 99% ನಿಖರತೆಯನ್ನು ಪಡೆಯುತ್ತದೆ ಆದರೆ ಒಂದೇ ಒಂದು ವಂಚನೆಯನ್ನು ಹಿಡಿಯುವುದಿಲ್ಲ. ಬದಲಿಗೆ, ನಿಖರತೆ (ನಾನು ಹಿಡಿದಿದ್ದರಲ್ಲಿ ಎಷ್ಟು ನಿಜವಾಗಿ ಧನಾತ್ಮಕವಾಗಿದೆ), ಮರುಪಡೆಯುವಿಕೆ (ನಾನು ಹಿಡಿದಿದ್ದರಲ್ಲಿ ಎಷ್ಟು ನಿಜ ಧನಾತ್ಮಕವಾಗಿದೆ) ಮತ್ತು ಅವುಗಳ ಸಮತೋಲನ F1 ಅಥವಾ PR-AUC ಅನ್ನು ಬಳಸಲಾಗುತ್ತದೆ.
  • ಸಮತೋಲಿತ ವರ್ಗೀಕರಣ: ನಿಖರತೆ ಮತ್ತು ROC-AUC ಸೂಕ್ತವಾಗಿರಬಹುದು.
  • ಹಿಂಜರಿತ (ಸಂಖ್ಯೆಯ ಅಂದಾಜು): MAE (ಅಂದರೆ ಸಂಪೂರ್ಣ ದೋಷ), RMSE (ದೊಡ್ಡ ದೋಷಗಳನ್ನು ದಂಡಿಸುತ್ತದೆ), MAPE (ಶೇಕಡಾವಾರು ದೋಷ).
  • ಶ್ರೇಯಾಂಕ/ಶಿಫಾರಸು: NDCG, MRR, Recall@K.

ನಿಖರತೆ ಅಥವಾ ಮರುಸ್ಥಾಪನೆ ಮುಖ್ಯವೇ ಎಂಬುದು ವ್ಯವಹಾರದ ಸಂದರ್ಭವನ್ನು ಅವಲಂಬಿಸಿರುತ್ತದೆ. ಕ್ಯಾನ್ಸರ್ ಸ್ಕ್ರೀನಿಂಗ್‌ನಲ್ಲಿ ಮರುಸ್ಥಾಪನೆ (ಯಾವುದೇ ರೋಗಿಗಳನ್ನು ಕಳೆದುಕೊಳ್ಳುವುದಿಲ್ಲ) ಆದ್ಯತೆಯಾಗಿದೆ; ಸ್ಪ್ಯಾಮ್ ಫಿಲ್ಟರ್‌ನಲ್ಲಿನ ನಿಖರತೆ (ಸ್ಪ್ಯಾಮ್‌ಗೆ ಪ್ರಮುಖ ಇಮೇಲ್‌ಗಳನ್ನು ಕಳುಹಿಸದಿರುವುದು) ಮುಖ್ಯವಾಗಿದೆ. ಇದು ವ್ಯಾಪಾರದ ನಿರ್ಧಾರವಾಗಿದೆ, ತಾಂತ್ರಿಕ ನಿರ್ಧಾರವಲ್ಲ ಮತ್ತು ಎಂಜಿನಿಯರ್ ಮತ್ತು ಮಾಲೀಕರು ಒಟ್ಟಾಗಿ ತೆಗೆದುಕೊಳ್ಳುತ್ತಾರೆ.

ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್ / ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್

ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್: "ನನ್ನ ಮಾದರಿಯ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿ, ನಿಖರತೆ 0.97."

ಪ್ರಬಲ ಪ್ರಾಂಪ್ಟ್: "ನನ್ನ ಬಳಿ ವಂಚನೆ ಪತ್ತೆ ಮಾದರಿ ಇದೆ; ಧನಾತ್ಮಕ ವರ್ಗ ದರ 1.5%. ನಿಖರತೆಯನ್ನು 0.97 ಎಂದು ವರದಿ ಮಾಡಲಾಗಿದೆ. ಈ ಮೆಟ್ರಿಕ್ ಏಕೆ ತಪ್ಪುದಾರಿಗೆಳೆಯಬಹುದು ಎಂಬುದನ್ನು ವಿವರಿಸಿ, ನಾನು ಯಾವ ಮೆಟ್ರಿಕ್‌ಗಳಿಗೆ (ನಿಖರತೆ, ಮರುಸ್ಥಾಪನೆ, PR-AUC) ಆದ್ಯತೆ ನೀಡಬೇಕು ಮತ್ತು ಏಕೆ ಎಂದು ನನಗೆ ತಿಳಿಸಿ. ಈ ಡೇಟಾ ಸೇರಿಸಲಾದ ನೈಜ ಮೌಲ್ಯವು ಎಷ್ಟು ನಿಖರವಾಗಿದೆ ಎಂಬುದನ್ನು ಲೆಕ್ಕಹಾಕಿ.

ವ್ಯತ್ಯಾಸ: ಶಕ್ತಿಯುತ ಪ್ರಾಂಪ್ಟ್ ವರ್ಗ ಅನುಪಾತ ಮತ್ತು ವ್ಯಾಪಾರ ಸಂದರ್ಭವನ್ನು ನೀಡುತ್ತದೆ; ಇದು ಬೇಸ್‌ಲೈನ್ ಮಾದರಿಯ ಹೋಲಿಕೆಯನ್ನು ಸಹ ಕೇಳುತ್ತದೆ - ಮೆಟ್ರಿಕ್ ಅರ್ಥಪೂರ್ಣವಾಗಿದೆಯೇ ಎಂಬುದಕ್ಕೆ ಇದು ಪ್ರಮುಖ ಆಧಾರವಾಗಿದೆ.

ಬೇಸ್ಲೈನ್: ಹೋಲಿಕೆಯಿಲ್ಲದ ಮೆಟ್ರಿಕ್ ಅರ್ಥಹೀನವಾಗಿದೆ

ಮೆಟ್ರಿಕ್ ಸ್ವತಃ ಒಳ್ಳೆಯದು ಅಥವಾ ಕೆಟ್ಟದ್ದಲ್ಲ; ಮೂಲಭೂತ ಮಾದರಿಯ ಪ್ರಕಾರ ಇದು ಒಳ್ಳೆಯದು ಅಥವಾ ಕೆಟ್ಟದು. ಮೂಲ ಮಾದರಿಯು ಮನಸ್ಸಿಗೆ ಬರುವ ಸರಳ ಪರಿಹಾರವಾಗಿದೆ: "ಯಾವಾಗಲೂ ಬಹುಸಂಖ್ಯಾತ ವರ್ಗಕ್ಕೆ ಹೇಳಿ", "ಕಳೆದ ವಾರದ ಮೌಲ್ಯವನ್ನು ಪುನರಾವರ್ತಿಸಿ", "ಸರಾಸರಿಯನ್ನು ಊಹಿಸಿ". ನಿಮ್ಮ ಮಾದರಿಯು ಈ ಸರಳ ಪರಿಹಾರವನ್ನು ಸ್ಪಷ್ಟವಾಗಿ ರವಾನಿಸಲು ಸಾಧ್ಯವಾಗದಿದ್ದರೆ, ಎಲ್ಲಾ ಸಂಕೀರ್ಣತೆಯು ಏನೂ ಅಲ್ಲ.

ಎಚ್ಚರಿಕೆ: "ನನ್ನ ಮಾದರಿ 85% ನಿಖರವಾಗಿದೆ" ಎಂಬ ವಾಕ್ಯವು ಏನನ್ನೂ ಹೇಳುವುದಿಲ್ಲ. ಮೂಲ ಮಾದರಿಯು ಈಗಾಗಲೇ 84% ಅನ್ನು ಪಡೆದರೆ, ನಿಮ್ಮ ಮಾದರಿಯು ಬಹುತೇಕ ನಿಷ್ಪ್ರಯೋಜಕವಾಗಿದೆ; ಮೂಲ ಮಾದರಿಯು 50% ಅನ್ನು ಪಡೆದರೆ, ನಿಮ್ಮ ಮಾದರಿಯು ಪರಿಪೂರ್ಣವಾಗಿದೆ. ಯಾವಾಗಲೂ ಮೂಲ ಮಾದರಿಯ ವಿಷಯದಲ್ಲಿ ಮಾತನಾಡಿ.

ಅಡ್ಡ-ಮೌಲ್ಯಮಾಪನ ಮತ್ತು ನಂಬಿಕೆ

ಒಂದೇ ತರಬೇತಿ/ಪರೀಕ್ಷೆಯ ವಿಭಜನೆಯು ಅವಕಾಶದ ಕಾರಣದಿಂದಾಗಿರಬಹುದು. ಕ್ರಾಸ್ ಮೌಲ್ಯೀಕರಣ: ಡೇಟಾವನ್ನು ಕೆ ಭಾಗಗಳಾಗಿ ವಿಭಜಿಸುವುದು ಮತ್ತು ಪ್ರತಿ ಭಾಗವನ್ನು ಅನುಕ್ರಮವಾಗಿ ಪರೀಕ್ಷಿಸುವುದು ಕಾರ್ಯಕ್ಷಮತೆ ಎಷ್ಟು ಸ್ಥಿರವಾಗಿದೆ ಎಂಬುದನ್ನು ತೋರಿಸುತ್ತದೆ. 5-ಪಟ್ಟು ಅಡ್ಡ ಮೌಲ್ಯೀಕರಣದಲ್ಲಿ ನೀವು ಐದು ವಿಭಿನ್ನ ಅಂಕಗಳನ್ನು ಪಡೆಯುತ್ತೀರಿ; ಅವುಗಳ ಸರಾಸರಿ ಮತ್ತು ಪ್ರಮಾಣಿತ ವಿಚಲನವು ಮುಖ್ಯವಾಗಿದೆ. ಸರಾಸರಿ 80% ಆದರೆ ವಿಚಲನವು ± 12% ಆಗಿದ್ದರೆ, ನಿಮ್ಮ ಮಾದರಿಯು ಅಸ್ಥಿರವಾಗಿರುತ್ತದೆ - ಇದು ಮುಂದಿನ ಬ್ಯಾಚ್ ಡೇಟಾದಲ್ಲಿ ವಿಭಿನ್ನವಾಗಿ ವರ್ತಿಸಬಹುದು.

ಇದು "ಎರಡು ಮಾದರಿಯ ಹೋಲಿಕೆ"ಗೆ ಸಹ ನಿರ್ಣಾಯಕವಾಗಿದೆ. ಮಾಡೆಲ್ ಎ 81% ಮತ್ತು ಮಾಡೆಲ್ ಬಿ 82% ಪಡೆದರೆ, ಬಿ ನಿಜವಾಗಿಯೂ ಉತ್ತಮವೇ? ವಿಚಲನವು ± 3% ಆಗಿದ್ದರೆ, ಈ ವ್ಯತ್ಯಾಸವು ಶಬ್ದವಾಗಿರಬಹುದು. ನಿರ್ಧರಿಸುವ ಮೊದಲು ವ್ಯತ್ಯಾಸವು ಗಮನಾರ್ಹವಾಗಿದೆಯೇ ಎಂದು ಪರಿಗಣಿಸಿ.

ಹೈಪರ್‌ಪ್ಯಾರಾಮೀಟರ್ ಟ್ಯೂನಿಂಗ್: ಊರ್ಜಿತಗೊಳಿಸುವಿಕೆಯೊಂದಿಗೆ, ಪರೀಕ್ಷೆಯಲ್ಲ

ಹೈಪರ್‌ಪ್ಯಾರಾಮೀಟರ್‌ಗಳು (ತರಬೇತಿ-ಕಲಿಕೆ ದರ, ಮರದ ಆಳ, ಇತ್ಯಾದಿಗಳ ಮೊದಲು ಕೈಯಾರೆ ನಿರ್ಧರಿಸುವ ಸೆಟ್ಟಿಂಗ್‌ಗಳು) ಮೌಲ್ಯೀಕರಣ ಸೆಟ್‌ನೊಂದಿಗೆ ಹೊಂದಿಸಲಾಗಿದೆ. ಪರೀಕ್ಷಾ ಸೆಟ್ ಅನ್ನು ಒಮ್ಮೆ ಮಾತ್ರ ಕೊನೆಯಲ್ಲಿ ಬಳಸಲಾಗುತ್ತದೆ. ಪರೀಕ್ಷಾ ಸೆಟ್ ಅನ್ನು ನೋಡುವ ಮೂಲಕ ನೀವು ಹೈಪರ್‌ಪ್ಯಾರಾಮೀಟರ್‌ಗಳನ್ನು ಆಯ್ಕೆ ಮಾಡಿದರೆ, ಪರೀಕ್ಷಾ ಸೆಟ್ ಕಲುಷಿತಗೊಳ್ಳುತ್ತದೆ ಮತ್ತು ನೀವು ವರದಿ ಮಾಡುವ ಕಾರ್ಯಕ್ಷಮತೆಯು ಆಶಾದಾಯಕವಾಗಿರುತ್ತದೆ ಅದು ವಾಸ್ತವದಲ್ಲಿ ಅಲ್ಲ.

ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯು ಹೈಪರ್‌ಪ್ಯಾರಾಮೀಟರ್ ಹುಡುಕಾಟ ಸ್ಥಳವನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಲು ಮತ್ತು ಹುಡುಕಾಟ ಕೋಡ್ ಅನ್ನು ಬರೆಯಲು ಉತ್ತಮ ಸಹಾಯಕವಾಗಿದೆ (ಗ್ರಿಡ್ ಹುಡುಕಾಟ, ಯಾದೃಚ್ಛಿಕ ಹುಡುಕಾಟ, ಬೇಸಿಯನ್ ಆಪ್ಟಿಮೈಸೇಶನ್). ಆದರೆ ನೀವು ಇನ್ನೂ "ನಾವು ಯಾವ ಮೆಟ್ರಿಕ್ ಅನ್ನು ಆಪ್ಟಿಮೈಜ್ ಮಾಡುತ್ತೇವೆ?"

ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು

ಪ್ರಕರಣ 1 - ನಿಖರತೆಯ ಬಲೆ. ಅಪರೂಪದ ರೋಗವನ್ನು ಪತ್ತೆಹಚ್ಚಿದ ಮಾದರಿಯ ಬಗ್ಗೆ ವೈದ್ಯಕೀಯ ತಂಡವು ಹೆಮ್ಮೆಪಡುತ್ತದೆ: 98% ನಿಖರತೆ. ಮೂಲ ಮಾದರಿಯ ಹೋಲಿಕೆಯನ್ನು ಮಾಡಿದಾಗ, ಸತ್ಯವು ಹೊರಹೊಮ್ಮಿತು: ರೋಗದ ಪ್ರಮಾಣವು 2% ಆಗಿರುವುದರಿಂದ, "ಎಲ್ಲರನ್ನು ಆರೋಗ್ಯಕರವಾಗಿ ಕರೆಯಿರಿ" ಎಂದು ಹೇಳಿದ ಮಾದರಿಯು 98% ಅನ್ನು ಸಹ ಪಡೆಯಿತು. ಮಾದರಿಯ ಮರುಪಡೆಯುವಿಕೆ ಕೇವಲ 11% ಆಗಿತ್ತು - ಹೆಚ್ಚಿನ ರೋಗಿಗಳು ಕಾಣೆಯಾಗಿದ್ದಾರೆ. ಮೆಟ್ರಿಕ್ ಅನ್ನು PR-AUC ಗೆ ಪರಿವರ್ತಿಸಿದ ನಂತರ, ನಿಜವಾದ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಅಳೆಯಲಾಗುತ್ತದೆ ಮತ್ತು ಮಾದರಿಯನ್ನು ಮರುವಿನ್ಯಾಸಗೊಳಿಸಲಾಯಿತು.

ಪ್ರಕರಣ 2 - ಪ್ರಗತಿಗಾಗಿ ತಪ್ಪಾದ ಶಬ್ದ. ಒಂದು ತಂಡವು ಮಾದರಿಯನ್ನು 86.2% ರಿಂದ 86.9% ಕ್ಕೆ ಸುಧಾರಿಸಲು ತಿಂಗಳುಗಳನ್ನು ಕಳೆದಿದೆ. ಅಡ್ಡ-ಮೌಲ್ಯಮಾಪನವು ಪಕ್ಷಪಾತವು ± 1.4% ಎಂದು ತೋರಿಸಿದೆ - ಆದ್ದರಿಂದ 0.7 ಪಾಯಿಂಟ್ "ಸುಧಾರಣೆ" ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ಶಬ್ದವಾಗಿದೆ. ತಂಡವು ಅವಾಸ್ತವಿಕ ಗಳಿಕೆಗಾಗಿ ಮೂರು ವಾರಗಳನ್ನು ವ್ಯರ್ಥ ಮಾಡಿದೆ. ಪಾಠ: ವಿಚಲನಕ್ಕಿಂತ ಸುಧಾರಣೆ ಹೆಚ್ಚಿದೆ ಎಂದು ಪರಿಶೀಲಿಸದೆ ವಿಜಯವನ್ನು ಘೋಷಿಸಬೇಡಿ.

ಪ್ರಕರಣ 3 - ಪರೀಕ್ಷಾ ಸೆಟ್ನ ಮಾಲಿನ್ಯ. ಅತ್ಯುತ್ತಮ ಹೈಪರ್‌ಪ್ಯಾರಾಮೀಟರ್‌ಗಳನ್ನು ಆಯ್ಕೆ ಮಾಡಲು ಇಂಜಿನಿಯರ್ ಪದೇ ಪದೇ ಪರೀಕ್ಷಾ ಸೆಟ್ ಅನ್ನು ನೋಡುತ್ತಾರೆ. ಅದು ವರದಿ ಮಾಡಿದ 91% ಉತ್ಪಾದನೆಯಲ್ಲಿ 83% ಕ್ಕೆ ಇಳಿಯಿತು. ಏಕೆ: ಅವನು ಪರೀಕ್ಷೆಯ ಸೆಟ್ ಅನ್ನು ಮತ್ತೆ ಮತ್ತೆ ನೋಡುವ ಮೂಲಕ (ಪರೀಕ್ಷಾ ಸೆಟ್‌ನಲ್ಲಿ ಅತಿಯಾಗಿ ಕಲಿಯುವ) ಅದಕ್ಕೆ ತಕ್ಕಂತೆ ಮಾದರಿಯನ್ನು ಆಯ್ಕೆ ಮಾಡಿದ್ದಾನೆ. ಪ್ರತ್ಯೇಕ ಮೌಲ್ಯೀಕರಣ ಸೆಟ್ ಅನ್ನು ಬಳಸಿದಾಗ ವರದಿ ಮಾಡಲಾದ ಮತ್ತು ನೈಜ ಕಾರ್ಯಕ್ಷಮತೆ ಅತಿಕ್ರಮಿಸುತ್ತದೆ.

ನಕಲು ಮಾಡಬಹುದಾದ ಟೆಂಪ್ಲೇಟ್‌ಗಳು

ಈ ವರ್ಗೀಕರಣ ಸಮಸ್ಯೆಗೆ ಸರಿಯಾದ ಮೆಟ್ರಿಕ್ ಅನ್ನು ಆಯ್ಕೆ ಮಾಡಲು ನನಗೆ ಸಹಾಯ ಮಾಡಿ. ಸಮಸ್ಯೆ: [ಏನು ಊಹಿಸಲಾಗಿದೆ] ವರ್ಗ ವಿತರಣೆ: [ಧನಾತ್ಮಕ ದರ

ಕೆಳಗಿನ ಎರಡು ಮಾದರಿಗಳ ಹೋಲಿಕೆಯನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿ.ಮಾದರಿ ಎ ಅಡ್ಡ-ಮೌಲ್ಯಮಾಪನ: [ಸ್ಕೋರ್‌ಗಳ ಪಟ್ಟಿ]ಮಾದರಿ B ಅಡ್ಡ-ಮೌಲ್ಯಮಾಪನ: [ಸ್ಕೋರ್‌ಗಳ ಪಟ್ಟಿ] ಸರಾಸರಿ ಮತ್ತು ಪ್ರಮಾಣಿತ ವಿಚಲನವನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡಿ. ವ್ಯತ್ಯಾಸವು ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯವಾಗಿ ಮಹತ್ವದ್ದಾಗಿದೆಯೇ ಅಥವಾ ವಿಚಲನದಲ್ಲಿ ಕೇವಲ ಶಬ್ದವೇ? ನಾನು ಯಾವುದನ್ನು ಆಯ್ಕೆ ಮಾಡಬೇಕೆಂದು ನೀವು ಶಿಫಾರಸು ಮಾಡುತ್ತೀರಿ ಮತ್ತು ಏಕೆ?

ಕೆಳಗಿನವುಗಳಿಗಾಗಿ ಈ ತರಬೇತಿ ಕೋಡ್ ಅನ್ನು ಪರಿಶೀಲಿಸಿ:1) ಪರೀಕ್ಷಾ ಸೆಟ್ ಅಥವಾ ಮೌಲ್ಯೀಕರಣದ ಸೆಟ್‌ನೊಂದಿಗೆ ಹೈಪರ್‌ಪ್ಯಾರಾಮೀಟರ್‌ಗಳನ್ನು ಆಯ್ಕೆ ಮಾಡಲಾಗಿದೆಯೇ? 2) ಸರಿಯಾದ ಸೆಟ್‌ನೊಂದಿಗೆ ಆರಂಭಿಕ ನಿಲುಗಡೆಯನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡಲಾಗುತ್ತದೆಯೇ? 3) ಓವರ್‌ಲರ್ನಿಂಗ್‌ನ ಯಾವುದೇ ಚಿಹ್ನೆಗಳು (ತರಬೇತಿ/ಮೌಲ್ಯಮಾಪನ ನಷ್ಟ ವ್ಯತ್ಯಾಸ) ಇದೆಯೇ? ಕೋಡ್: [ಕೋಡ್]

MAE, RMSE, ಮತ್ತು MAPE ಗಳಲ್ಲಿ ಯಾವುದನ್ನು ನಾನು ಈ ರಿಗ್ರೆಶನ್ ಸಮಸ್ಯೆಗೆ ವರದಿ ಮಾಡಬೇಕು? ಗುರಿ ವೇರಿಯಬಲ್‌ನ ಸ್ಕೇಲ್: [ಶ್ರೇಣಿ] ದೊಡ್ಡ ದೋಷಗಳು ಅಸಮಾನವಾಗಿ ಕೆಟ್ಟದ್ದೇ (RMSE), ಅಥವಾ ಅವೆಲ್ಲವೂ ಸಮಾನವಾಗಿದೆಯೇ (MAE)? ಶೂನ್ಯಕ್ಕೆ ಹತ್ತಿರವಿರುವ ಮೌಲ್ಯಗಳು (ಅವು MAPE ಅನ್ನು ವಿರೂಪಗೊಳಿಸುತ್ತವೆಯೇ)? ಸಂಕ್ಷಿಪ್ತ ಸಮರ್ಥನೆಯೊಂದಿಗೆ ಸೂಚಿಸಿ.

ಮೆಟ್ರಿಕ್ ಆಯ್ಕೆ ಕೋಷ್ಟಕ

ಸಮಸ್ಯೆಯ ಪ್ರಕಾರ

ಸೂಕ್ತವಾದ ಮೆಟ್ರಿಕ್

ತಪ್ಪಿಸಬೇಕು

ಏಕೆ

ಅಸಮತೋಲಿತ ವರ್ಗೀಕರಣ

PR-AUC, F1, ಮರುಪಡೆಯಿರಿ

ನಿಖರತೆ

ಬಹುಪಾಲು ವರ್ಗವು ಮೆಟ್ರಿಕ್ ಅನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ

ಸಮತೋಲಿತ ವರ್ಗೀಕರಣ

ನಿಖರತೆ, ROC-AUC

-

ಸಮತೋಲಿತ ಡೇಟಾದಲ್ಲಿ ವಿಶ್ವಾಸಾರ್ಹ

ಹಿಂಜರಿತ (ಗಮನಾರ್ಹ ಹೊರಗಿದೆ)

RMSE

MAPE (ಶೂನ್ಯವಾಗಿದ್ದರೆ)

ಪ್ರಮುಖ ತಪ್ಪುಗಳನ್ನು ಶಿಕ್ಷಿಸುತ್ತದೆ

ಹಿಂಜರಿತ (ಸಮಾನ ತೂಕ)

MAE

-

ಅರ್ಥೈಸಲು ಸುಲಭ

ಶ್ರೇಯಾಂಕ/ಶಿಫಾರಸು

NDCG, ರೀಕಾಲ್@ಕೆ

ನಿಖರತೆ

ಆದೇಶವು ಮುಖ್ಯವಾಗಿದೆ

ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು

  • ಅಸಮತೋಲಿತ ಡೇಟಾದಲ್ಲಿ ನಿಖರತೆಯನ್ನು ಬಳಸುವುದು. ಅತ್ಯಂತ ಸಾಮಾನ್ಯವಾದ ಮೆಟ್ರಿಕ್ ದೋಷ.
  • ಬೇಸ್ ಮಾಡೆಲ್ ಹೋಲಿಕೆಗಳನ್ನು ಮಾಡುತ್ತಿಲ್ಲ. ಇದು ಮೆಟ್ರಿಕ್ ತನ್ನ ಅರ್ಥವನ್ನು ಕಳೆದುಕೊಳ್ಳುವಂತೆ ಮಾಡುತ್ತದೆ.
  • ಹೈಪರ್‌ಪ್ಯಾರಾಮೀಟರ್‌ಗಳಿಗಾಗಿ ಪರೀಕ್ಷಾ ಸೆಟ್ ಅನ್ನು ನೋಡಲಾಗುತ್ತಿದೆ. ಆಶಾವಾದಿ, ಅವಾಸ್ತವಿಕ ಫಲಿತಾಂಶ.
  • ಒಂದೇ ಕಂಪಾರ್ಟ್ಮೆಂಟ್ ಅನ್ನು ಅವಲಂಬಿಸಿದೆ. ಅಡ್ಡ-ಮೌಲ್ಯಮಾಪನವಿಲ್ಲದೆ ನೀವು ಪಕ್ಷಪಾತವನ್ನು ನೋಡುವುದಿಲ್ಲ.
  • ಪ್ರಗತಿಗಾಗಿ ಶಬ್ದವನ್ನು ತಪ್ಪಾಗಿ ಗ್ರಹಿಸುವುದು. ವಿಚಲನದಿಂದ ಸಣ್ಣ "ಸುಧಾರಣೆಗಳು" ಹೆಚ್ಚಾಗಿ ಅದೃಷ್ಟ.
  • ವ್ಯಾಪಾರ ಸಂದರ್ಭವನ್ನು ನಿರ್ಲಕ್ಷಿಸುವುದು. ನಿಖರ/ಮರುಸ್ಥಾಪನೆ ಸಮತೋಲನವು ವ್ಯವಹಾರ ನಿರ್ಧಾರವಾಗಿದೆ.

ಸಾರಾಂಶದಲ್ಲಿ

ಮಾದರಿ ತರಬೇತಿಯಲ್ಲಿ ನಿಜವಾದ ಕೌಶಲ್ಯವು ಹೆಚ್ಚಿನ ಸಂಖ್ಯೆಯನ್ನು ಉತ್ಪಾದಿಸುವುದು ಅಲ್ಲ, ಆದರೆ ಆ ಸಂಖ್ಯೆಯ ಅರ್ಥವನ್ನು ತಿಳಿದುಕೊಳ್ಳುವುದು. ಸಮಸ್ಯೆ ಮತ್ತು ವ್ಯವಹಾರ ಸಂದರ್ಭವು ಸರಿಯಾದ ಮೆಟ್ರಿಕ್ ಅನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ; ಪ್ರತಿ ಮೆಟ್ರಿಕ್ ಅನ್ನು ಬೇಸ್‌ಲೈನ್ ಮಾದರಿಯ ಪ್ರಕಾರ ಅರ್ಥೈಸಿಕೊಳ್ಳಿ; ಅಡ್ಡ-ಮೌಲ್ಯಮಾಪನದೊಂದಿಗೆ ಪಕ್ಷಪಾತವನ್ನು ಅಳೆಯಿರಿ ಮತ್ತು ಪ್ರಗತಿಗಾಗಿ ಶಬ್ದವನ್ನು ತಪ್ಪಾಗಿ ಗ್ರಹಿಸಬೇಡಿ; ಪರೀಕ್ಷಾ ಸೆಟ್ ಅನ್ನು ಕೊನೆಯಲ್ಲಿ, ಒಂದು ಬಾರಿ ಮಾತ್ರ ಬಳಸಿ. ಪ್ರಯೋಗ ವಿನ್ಯಾಸದಲ್ಲಿ AI ನಿಮ್ಮ ಪಾಲುದಾರ, ಆದರೆ "ಸಾಕಷ್ಟು ಒಳ್ಳೆಯದು" ಎಂಬ ನಿರ್ಧಾರವು ನಿಮಗೆ ಮತ್ತು ನಿಮ್ಮದಾಗಿದೆ.

ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ

ವರ್ಗೀಕರಣ ಮಾದರಿಗಾಗಿ: (1) ವರ್ಗ ವಿತರಣೆಯನ್ನು ಬರೆಯಿರಿ, (2) ಸೂಕ್ತವಾದ ಮೂಲ ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸಿ ಮತ್ತು ಅದರ ಸ್ಕೋರ್ ಅನ್ನು ಅಳೆಯಿರಿ, (3) ನಿಮ್ಮ ಮಾದರಿಯನ್ನು 5-ಪಟ್ಟು ಅಡ್ಡ ಮೌಲ್ಯೀಕರಣದೊಂದಿಗೆ ಮೌಲ್ಯಮಾಪನ ಮಾಡಿ ಮತ್ತು ಸರಾಸರಿ ಮತ್ತು ಪ್ರಮಾಣಿತ ವಿಚಲನವನ್ನು ವರದಿ ಮಾಡಿ, (4) ನಿಖರತೆಯ ಬದಲಿಗೆ ಸಮಸ್ಯೆಗೆ ಸೂಕ್ತವಾದ ಮೆಟ್ರಿಕ್ ಅನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡಿ (ಉದಾ. PR-AUC). ನಿಮ್ಮ ಮಾದರಿಯು ಬೇಸ್‌ಲೈನ್ ಮಾದರಿಯನ್ನು ಪಕ್ಷಪಾತವಿಲ್ಲದೆ ದೊಡ್ಡ ಅಂತರದಿಂದ ಸೋಲಿಸುತ್ತದೆಯೇ ಎಂದು ಬರೆಯಿರಿ.

ಪರಿಶೀಲನಾಪಟ್ಟಿ

  • [ ] ನಾನು ಸಮಸ್ಯೆಯ ಪ್ರಕಾರ ಮತ್ತು ವ್ಯವಹಾರದ ಸಂದರ್ಭವನ್ನು ಆಧರಿಸಿ ಮೆಟ್ರಿಕ್ ಅನ್ನು ಆಯ್ಕೆ ಮಾಡಿದ್ದೇನೆ.
  • [ ] ನಾನು ಮೂಲ ಮಾದರಿಯನ್ನು ನಿರ್ಮಿಸಿದೆ ಮತ್ತು ಅದರ ವಿರುದ್ಧ ಹೋಲಿಸಿದೆ.
  • [ ] ನಾನು ಸರಾಸರಿ ಮತ್ತು ವಿಚಲನವನ್ನು ಅಡ್ಡ-ಮೌಲ್ಯಮಾಪನದೊಂದಿಗೆ ವರದಿ ಮಾಡಿದ್ದೇನೆ.
  • [ ] ವಿಚಲನಕ್ಕಿಂತ ಸುಧಾರಣೆ ಹೆಚ್ಚಿದೆ ಎಂದು ನಾನು ದೃಢಪಡಿಸಿದ್ದೇನೆ.
  • [ ] ನಾನು ಮೌಲ್ಯೀಕರಣ ಸೆಟ್‌ನೊಂದಿಗೆ ಹೈಪರ್‌ಪ್ಯಾರಾಮೀಟರ್‌ಗಳನ್ನು ಆಯ್ಕೆ ಮಾಡಿದ್ದೇನೆ.
  • [ ] ನಾನು ಪರೀಕ್ಷಾ ಸೆಟ್ ಅನ್ನು ಒಮ್ಮೆ ಮಾತ್ರ ಬಳಸಿದ್ದೇನೆ, ಕೊನೆಯಲ್ಲಿ.