ಘಟಕಗಳು
1. ಡೇಟಾ ಸೈನ್ಸ್ ಮತ್ತು ಅನಾಲಿಟಿಕ್ಸ್‌ನಲ್ಲಿ ಆರ್ಟಿಫಿಶಿಯಲ್ ಇಂಟೆಲಿಜೆನ್ಸ್ ಪರಿಚಯ: ವರ್ಕ್‌ಫ್ಲೋ, ಪಾತ್ರಗಳು, ಬೌಂಡರೀಸ್, ವ್ಯಾಲಿಡೇಶನ್ ಮತ್ತು ಎಥಿಕ್ಸ್ 2. ಡೇಟಾ ಸಂಗ್ರಹಣೆ ಮತ್ತು ಮೂಲ ತಿಳುವಳಿಕೆ: ಸ್ಕೀಮಾ, ಮಾದರಿ, ಗುಣಮಟ್ಟ ಮತ್ತು ಸೋರಿಕೆ ಜಾಗೃತಿ 3. ಡೇಟಾ ಕ್ಲೀನಿಂಗ್ ಮತ್ತು ಪ್ರಿಪ್ರೊಸೆಸಿಂಗ್: ಕಾಣೆಯಾದ ಮೌಲ್ಯ, ಔಟ್‌ಲೈಯರ್ ಮತ್ತು ಪ್ರಕಾರದ ಪರಿವರ್ತನೆ 4. ಎಕ್ಸ್‌ಪ್ಲೋರೇಟರಿ ಡೇಟಾ ಅನಾಲಿಸಿಸ್ (EDA): ವಿತರಣೆಗಳು, ಸಂಬಂಧಗಳು ಮತ್ತು ಆರಂಭಿಕ ಒಳನೋಟಗಳು 5. ವೈಶಿಷ್ಟ್ಯ ಎಂಜಿನಿಯರಿಂಗ್: ರೂಪಾಂತರಗಳನ್ನು ರಚಿಸುವುದು, ಕೋಡಿಂಗ್, ಸ್ಕೇಲಿಂಗ್ ಮತ್ತು ಸೋರಿಕೆಯನ್ನು ತಪ್ಪಿಸುವುದು 6. ಮಾದರಿ ಕಟ್ಟಡ: ಸಮಸ್ಯೆಯ ವ್ಯಾಖ್ಯಾನ, ಅಲ್ಗಾರಿದಮ್ ಆಯ್ಕೆ ಮತ್ತು ತರಬೇತಿ/ಪರೀಕ್ಷೆ ವಿಭಜನೆ 7. ಮಾದರಿ ಮೌಲ್ಯಮಾಪನ: ಮೆಟ್ರಿಕ್ಸ್, ಕ್ರಾಸ್-ಮೌಲ್ಯಮಾಪನ, ಮತ್ತು ಎಕ್ಸ್ಟ್ರೀಮ್ ಕಲಿಕೆ 8. ದೃಶ್ಯೀಕರಣ ಮತ್ತು ಕಥೆ ಹೇಳುವಿಕೆ: ನಿಖರವಾದ ಗ್ರಾಫಿಕ್ಸ್, ಪ್ರಾಮಾಣಿಕ ಗ್ರಾಫಿಕ್ಸ್ 9. ಕೋಡ್ ಜನರೇಷನ್: ಪೈಥಾನ್ (ಪಾಂಡಾಗಳು) ಮತ್ತು SQL ಜೊತೆ AI-ಸಹಾಯದ ವಿಶ್ಲೇಷಣೆ 10. ಡೇಟಾ ಸೋರಿಕೆ ಮತ್ತು ಪುನರುತ್ಪಾದನೆ: ಮೌನ ವಿಪತ್ತುಗಳು ಮತ್ತು ಶಿಸ್ತು 11. MLOps ಫೌಂಡೇಶನ್, ನೀತಿಶಾಸ್ತ್ರ, ಗೌಪ್ಯತೆ ಮತ್ತು ಜವಾಬ್ದಾರಿಯುತ ವಿಶ್ಲೇಷಣೆ
ಘಟಕ 5 / 11

ವೈಶಿಷ್ಟ್ಯ ಎಂಜಿನಿಯರಿಂಗ್: ರೂಪಾಂತರಗಳನ್ನು ರಚಿಸುವುದು, ಕೋಡಿಂಗ್, ಸ್ಕೇಲಿಂಗ್ ಮತ್ತು ಸೋರಿಕೆಯನ್ನು ತಪ್ಪಿಸುವುದು

ಲಾಭಗಳು:

  • ಡೊಮೇನ್ ಜ್ಞಾನದೊಂದಿಗೆ ಅರ್ಥಪೂರ್ಣ ವ್ಯುತ್ಪನ್ನ ವೈಶಿಷ್ಟ್ಯಗಳನ್ನು ಉತ್ಪಾದಿಸುವ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ಸೂಕ್ತವಾದ ವಿಧಾನಗಳೊಂದಿಗೆ ವರ್ಗೀಯ ವರ್ಗಗಳನ್ನು ಎನ್ಕೋಡ್ ಮಾಡುವ ಸಾಮರ್ಥ್ಯ (ಒಂದು-ಬಿಸಿ, ಲೇಬಲ್, ಗುರಿ)
  • ಮಾದರಿ ಪ್ರಕಾರದ ಪ್ರಕಾರ ಸಂಖ್ಯಾತ್ಮಕ ಅಸ್ಥಿರಗಳನ್ನು ಅಳೆಯುವ ಸಾಮರ್ಥ್ಯ (ಪ್ರಮಾಣೀಕರಣ, ಸಾಮಾನ್ಯೀಕರಣ) ಮತ್ತು ಅನಗತ್ಯ ಅಥವಾ ಅಪೂರ್ಣ ಸ್ಕೇಲಿಂಗ್ ಅನ್ನು ತಪ್ಪಿಸಿ
  • ತರಬೇತಿ/ಪರೀಕ್ಷೆ ವಿಭಜನೆಯ ನಂತರ ಮತ್ತು ತರಬೇತಿಯಿಂದ ಮಾತ್ರ ಎಲ್ಲಾ ರೂಪಾಂತರಗಳನ್ನು ಕಲಿಯುವ ಮೂಲಕ ವೈಶಿಷ್ಟ್ಯದ ಸೋರಿಕೆಯನ್ನು ತಪ್ಪಿಸುವ ಸಾಮರ್ಥ್ಯ

ಯಂತ್ರ ಕಲಿಕೆಯಲ್ಲಿ ಒಂದು ಹಳೆಯ ಮಾತಿದೆ: "ಅನ್ವಯಿಕ ಯಂತ್ರ ಕಲಿಕೆ ಮೂಲಭೂತವಾಗಿ ವೈಶಿಷ್ಟ್ಯ ಎಂಜಿನಿಯರಿಂಗ್ ಆಗಿದೆ." ಏಕೆಂದರೆ ನೀವು ಯಾವ ಅಲ್ಗಾರಿದಮ್ ಅನ್ನು ಆಯ್ಕೆ ಮಾಡುತ್ತೀರಿ ಎನ್ನುವುದಕ್ಕಿಂತ ಹೆಚ್ಚಾಗಿ ನೀವು ಮಾದರಿಗೆ ಯಾವ ಇನ್‌ಪುಟ್‌ಗಳನ್ನು ನೀಡುತ್ತೀರಿ ಎಂಬುದರ ಮೂಲಕ ಮಾದರಿಯ ಯಶಸ್ಸು ಹೆಚ್ಚಾಗಿ ಬರುತ್ತದೆ. ಫೀಚರ್ ಎಂಜಿನಿಯರಿಂಗ್ ಎನ್ನುವುದು ಮಾದರಿಯು ಕಲಿಯಬಹುದಾದ ಕಚ್ಚಾ ಡೇಟಾದಿಂದ ಅರ್ಥಪೂರ್ಣ ಸಂಕೇತಗಳನ್ನು ಉತ್ಪಾದಿಸುವ ಕಲೆಯಾಗಿದೆ. ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯು ಈ ಹಂತದಲ್ಲಿ ಕಲ್ಪನೆಗಳ ಶ್ರೀಮಂತ ಮೂಲವಾಗಿದೆ: "ಈ ಡೇಟಾದಿಂದ ಯಾವ ವೈಶಿಷ್ಟ್ಯಗಳನ್ನು ಉತ್ಪಾದಿಸಬಹುದು" ಎಂದು ನೀವು ಕೇಳಿದಾಗ, ಇದು ಡಜನ್ಗಟ್ಟಲೆ ಸಲಹೆಗಳನ್ನು ಪಟ್ಟಿ ಮಾಡುತ್ತದೆ. ಆದರೆ ಈ ಸಲಹೆಗಳಲ್ಲಿ ಕೆಲವು ಮೌಲ್ಯಯುತವಾಗಬಹುದು, ಕೆಲವು ನಿಷ್ಪ್ರಯೋಜಕವಾಗಬಹುದು ಮತ್ತು ಕೆಲವು ಅಪಾಯಕಾರಿ (ಸೋರಿಕೆ) ಆಗಿರಬಹುದು. ಅದನ್ನು ಬಗೆಹರಿಸುವುದು ನಿಮ್ಮ ಕೆಲಸ.

ಏಕೆ ವೈಶಿಷ್ಟ್ಯ ಎಂಜಿನಿಯರಿಂಗ್

ಕಚ್ಚಾ ಡೇಟಾವು ಅದರ ಅತ್ಯುತ್ತಮ ರೂಪದಲ್ಲಿ ಮಾದರಿಗೆ ಅಪರೂಪವಾಗಿ ಬರುತ್ತದೆ. "ಹುಟ್ಟಿನ ದಿನಾಂಕ" ಕಾಲಮ್ ಮಾತ್ರ ಅರ್ಥಹೀನವಾಗಿದ್ದರೂ, ಅದರಿಂದ ಉತ್ಪತ್ತಿಯಾಗುವ "ವಯಸ್ಸು" ಮೌಲ್ಯವು ಬಲವಾದ ಸಂಕೇತವಾಗಿದೆ. "ಆರ್ಡರ್ ಟೈಮ್‌ಸ್ಟ್ಯಾಂಪ್" ನಿಂದ "ವಾರದ ದಿನ", "ಹಗಲು/ರಾತ್ರಿ", "ಇದು ರಜಾದಿನವೇ" ಮುಂತಾದ ಗುಣಲಕ್ಷಣಗಳನ್ನು ನೀವು ಹೊರತೆಗೆಯಬಹುದು. ಅನುಪಾತವನ್ನು ("ಸಾಲ/ಆದಾಯ ಅನುಪಾತ") ಉತ್ಪಾದಿಸಲು ನೀವು ಎರಡು ಕಾಲಮ್‌ಗಳನ್ನು ಸಂಯೋಜಿಸಬಹುದು. ಇಲ್ಲಿ, ವೈಶಿಷ್ಟ್ಯ ಎಂಜಿನಿಯರಿಂಗ್ ಡೊಮೇನ್ ಜ್ಞಾನವನ್ನು ಗಣಿತದ ಸಂಕೇತವಾಗಿ ಭಾಷಾಂತರಿಸುತ್ತಿದೆ; ಮತ್ತು ಅದಕ್ಕಾಗಿಯೇ ಇದು ಅತ್ಯಂತ ಮಾನವ ಬುದ್ಧಿವಂತಿಕೆಯ ಅಗತ್ಯವಿರುವ ಹಂತವಾಗಿದೆ.

ವರ್ಗೀಯ ಅಸ್ಥಿರಗಳನ್ನು ಸಂಖ್ಯೆಗಳಿಗೆ ಪರಿವರ್ತಿಸುವುದು: ಕೋಡಿಂಗ್

ಮಾದರಿಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಸಂಖ್ಯೆಗಳೊಂದಿಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ, ಪಠ್ಯವಲ್ಲ. ವರ್ಗೀಯ ಅಸ್ಥಿರಗಳನ್ನು (ನಗರ, ಬಣ್ಣ, ಉತ್ಪನ್ನದ ಪ್ರಕಾರ) ಸಂಖ್ಯೆಗಳಾಗಿ ಪರಿವರ್ತಿಸುವುದನ್ನು ಎನ್ಕೋಡಿಂಗ್ ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ. ಮೂರು ಸಾಮಾನ್ಯ ವಿಧಾನಗಳು:

ಒನ್-ಹಾಟ್ ಎನ್‌ಕೋಡಿಂಗ್: ಪ್ರತಿ ವರ್ಗಕ್ಕೆ 0/1 ಮೌಲ್ಯದೊಂದಿಗೆ ಪ್ರತ್ಯೇಕ ಕಾಲಮ್ ತೆರೆಯುತ್ತದೆ. "ನಗರ" ಗಾಗಿ, ಇಸ್ತಾನ್ಬುಲ್, ಅಂಕಾರಾ, ಇಜ್ಮಿರ್ ಕಾಲಮ್ಗಳನ್ನು ರಚಿಸಲಾಗಿದೆ; ಗ್ರಾಹಕರು ಇಸ್ತಾನ್‌ಬುಲ್‌ನಿಂದ ಬಂದಿದ್ದರೆ, ಆ ಕಾಲಮ್ ಮಾತ್ರ 1 ಆಗಿರುತ್ತದೆ. ವಿಭಾಗಗಳ ಸಂಖ್ಯೆ ಚಿಕ್ಕದಾಗಿದ್ದರೆ ಸೂಕ್ತವಾಗಿದೆ; ಹಲವಾರು ವರ್ಗಗಳಿದ್ದರೆ ಅದು ನೂರಾರು ಕಾಲಮ್‌ಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ (ಇದನ್ನು "ಗಾತ್ರ ಸ್ಫೋಟ" ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ).

ಲೇಬಲ್ ಎನ್‌ಕೋಡಿಂಗ್: ಪ್ರತಿ ವರ್ಗಕ್ಕೂ ಒಂದು ಸಂಖ್ಯೆಯನ್ನು ನೀಡುತ್ತದೆ (ಇಸ್ತಾನ್‌ಬುಲ್=0, ಅಂಕಾರಾ=1). ಇದು ಸರಳವಾಗಿದೆ, ಆದರೆ ಇದು ಆಕಸ್ಮಿಕವಾಗಿ ಮಾದರಿಗೆ ಅನುಕ್ರಮವನ್ನು ಕಲಿಸಬಹುದು (ಅಂಕಾರ > ಇಸ್ತಾಂಬುಲ್ ನಂತಹ); ಆದ್ದರಿಂದ ಇದನ್ನು ಕ್ರಮವಿಲ್ಲದ ವರ್ಗಗಳಲ್ಲಿ ಎಚ್ಚರಿಕೆಯಿಂದ ಬಳಸಲಾಗುತ್ತದೆ.

ಟಾರ್ಗೆಟ್ ಎನ್‌ಕೋಡಿಂಗ್: ಪ್ರತಿ ವರ್ಗವನ್ನು ಆ ವರ್ಗದಲ್ಲಿರುವ ಟಾರ್ಗೆಟ್ ವೇರಿಯಬಲ್‌ನ ಸರಾಸರಿಯೊಂದಿಗೆ ಬದಲಾಯಿಸುತ್ತದೆ. ಇದು ತುಂಬಾ ಶಕ್ತಿಯುತವಾಗಿದೆ, ಆದರೆ ಸೋರಿಕೆಯ ಅತ್ಯಂತ ಅಪಾಯಕಾರಿ ಮೂಲವಾಗಿದೆ: ನೀವು ಪರೀಕ್ಷಾ ಡೇಟಾದ ಗುರಿಯನ್ನು ಗಣನೆಗೆ ತೆಗೆದುಕೊಂಡರೆ, ಮಾದರಿಯು ಭವಿಷ್ಯವನ್ನು ನೋಡುತ್ತದೆ. ಇದನ್ನು ತರಬೇತಿ ಡೇಟಾದಿಂದ ಮತ್ತು ಎಚ್ಚರಿಕೆಯಿಂದ (ಕ್ರಾಸ್-ಮೌಲ್ಯಮಾಪನದೊಳಗೆ) ಮಾತ್ರ ಲೆಕ್ಕ ಹಾಕಬೇಕು.

ಸ್ಕೇಲಿಂಗ್: ದೊಡ್ಡ ಸಂಖ್ಯೆಗಳು ಮಾದರಿಯನ್ನು ಅತಿಕ್ರಮಿಸುವುದಿಲ್ಲ

ಕೆಲವು ಮಾದರಿಗಳು (ದೂರ-ಆಧಾರಿತವಾದವುಗಳು, ರೇಖೀಯ ಮಾದರಿಗಳು, ನರ ಜಾಲಗಳು) ಅಸ್ಥಿರಗಳ ಪ್ರಮಾಣಕ್ಕೆ ಸೂಕ್ಷ್ಮವಾಗಿರುತ್ತವೆ. "ಆದಾಯ" (0-500,000) ಮತ್ತು "ವಯಸ್ಸು" (0-100) ಒಂದೇ ಮಾದರಿಯಲ್ಲಿ ಬಂದರೆ, ಆದಾಯವು ದೊಡ್ಡದಾಗಿರುವ ಕಾರಣ ಪ್ರಾಬಲ್ಯ ಸಾಧಿಸಬಹುದು. ಸ್ಕೇಲಿಂಗ್ ಇದನ್ನು ಸರಿಪಡಿಸುತ್ತದೆ. ಎರಡು ಸಾಮಾನ್ಯ ವಿಧಾನಗಳು: ಪ್ರಮಾಣೀಕರಣ (ಪ್ರತಿ ಮೌಲ್ಯವನ್ನು "ಸರಾಸರಿಯಿಂದ ಎಷ್ಟು ಪ್ರಮಾಣಿತ ವಿಚಲನಗಳಿಗೆ" ಪರಿವರ್ತಿಸುತ್ತದೆ) ಮತ್ತು ಸಾಮಾನ್ಯೀಕರಣ (ಮಿನಿ-ಗರಿಷ್ಠ ಸಾಮಾನ್ಯೀಕರಣ - ಮೌಲ್ಯಗಳನ್ನು 0-1 ಶ್ರೇಣಿಗೆ ಸಂಕುಚಿತಗೊಳಿಸುತ್ತದೆ). ಮರ-ಆಧಾರಿತ ಮಾದರಿಗಳು (ನಿರ್ಣಯ ಮರಗಳು, ಯಾದೃಚ್ಛಿಕ ಅರಣ್ಯ) ಪ್ರಮಾಣದ ಸಂವೇದನಾಶೀಲವಲ್ಲ, ಅವುಗಳಿಗೆ ಸ್ಕೇಲಿಂಗ್ ಅಗತ್ಯವಿಲ್ಲ.

ಎಚ್ಚರಿಕೆ: ಸ್ಕೇಲಿಂಗ್ ಮತ್ತು ಕೋಡಿಂಗ್ ಪ್ಯಾರಾಮೀಟರ್‌ಗಳನ್ನು (ಸರಾಸರಿ, ಪ್ರಮಾಣಿತ ವಿಚಲನ, ವರ್ಗ-ಸರಾಸರಿ ಮ್ಯಾಪಿಂಗ್) ತರಬೇತಿ ಡೇಟಾದಿಂದ ಮಾತ್ರ ಲೆಕ್ಕ ಹಾಕಬೇಕು, ನಂತರ ಅದನ್ನು ಪರೀಕ್ಷಾ ಡೇಟಾಗೆ ಅನ್ವಯಿಸಬೇಕು. ಪರೀಕ್ಷಾ ಡೇಟಾವನ್ನು ಒಳಗೊಂಡಂತೆ ಸೋರಿಕೆಯಾಗಿದೆ ಮತ್ತು ನಿಮ್ಮ ಮಾದರಿಯು ನಿಜವಾಗಿರುವುದಕ್ಕಿಂತ ಉತ್ತಮವಾಗಿ ಕಾಣುವಂತೆ ಮಾಡುತ್ತದೆ.

ವೈಶಿಷ್ಟ್ಯ ಎಂಜಿನಿಯರಿಂಗ್‌ನಲ್ಲಿ ಸೋರಿಕೆಯ ಹೃದಯ

ಫೀಚರ್ ಜನರೇಷನ್ ಎಂದರೆ ಡೇಟಾ ಸೋರಿಕೆ ಹೆಚ್ಚಾಗಿ ಹುಟ್ಟಿಕೊಳ್ಳುತ್ತದೆ. ಎರಡು ವಿಶಿಷ್ಟ ತಪ್ಪುಗಳು: ಸಮಯದ ಸೋರಿಕೆ - ಭವಿಷ್ಯದ ಮಾಹಿತಿಯನ್ನು ಒಳಗೊಂಡಿರುವ ವೈಶಿಷ್ಟ್ಯವನ್ನು ಉತ್ಪಾದಿಸುವುದು ("ಕಳೆದ 30 ದಿನದ ಸರಾಸರಿ" ಅನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡುವಾಗ ಮುನ್ಸೂಚನೆಯ ದಿನದ ನಂತರದ ದಿನಗಳು ಸೇರಿದಂತೆ). ಅಂಕಿಅಂಶಗಳ ಸೋರಿಕೆ - ತರಬೇತಿ/ಪರೀಕ್ಷೆಯ ವಿಭಜನೆಯ ಮೊದಲು ಎಲ್ಲಾ ಡೇಟಾದಿಂದ ವೈಶಿಷ್ಟ್ಯವನ್ನು (ಸ್ಕೇಲಿಂಗ್ ಸರಾಸರಿ, ಗುರಿ ಎನ್ಕೋಡಿಂಗ್ ಮೌಲ್ಯ) ಲೆಕ್ಕಾಚಾರ ಮಾಡುವುದು. ನಿಯಮ: ಟ್ರೈನ್/ಟೆಸ್ಟ್ ಸ್ಪ್ಲಿಟ್ ಮಾಡಿದ ನಂತರ ಪ್ರತಿ ರೂಪಾಂತರವನ್ನು ಕಲಿಯಿರಿ ಮತ್ತು ತರಬೇತಿ ಡೇಟಾದಿಂದ ಮಾತ್ರ. ಇದನ್ನು ನಿಯಮಿತವಾಗಿ ಮಾಡಲು ಸುರಕ್ಷಿತ ಮಾರ್ಗವೆಂದರೆ ಪೈಪ್‌ಲೈನ್ ಅನ್ನು ಬಳಸುವುದು - ಒಂದು ರಚನೆಯು ಒಂದೇ ಸರಪಳಿಯಲ್ಲಿ ಎಲ್ಲಾ ರೂಪಾಂತರಗಳನ್ನು ಸಂಗ್ರಹಿಸುತ್ತದೆ ಮತ್ತು ವಿಭಜನೆಯ ನಂತರ ಅವುಗಳನ್ನು ಅನ್ವಯಿಸುತ್ತದೆ.

ವಿಧಾನ

ಯಾವುದಕ್ಕಾಗಿ

ಸೋರಿಕೆಯ ಅಪಾಯ

ಗಮನಿಸಿ

ಒಂದು-ಬಿಸಿ ಎನ್ಕೋಡಿಂಗ್

ಕೆಲವು ವರ್ಗಗಳೊಂದಿಗೆ ವೇರಿಯಬಲ್

ಕಡಿಮೆ

ಬಹು ವಿಭಾಗಗಳಲ್ಲಿ ಗಾತ್ರವನ್ನು ಸ್ಫೋಟಿಸುತ್ತದೆ

ಲೇಬಲ್ ಕೋಡಿಂಗ್

ವಿಂಗಡಿಸಲಾದ ವರ್ಗ

ಕಡಿಮೆ

ಔಟ್ ಆಫ್ ಆರ್ಡರ್ ತಪ್ಪು ಕ್ರಮವನ್ನು ಕಲಿಸುತ್ತದೆ

ಗುರಿ ಎನ್ಕೋಡಿಂಗ್

ಬಹು-ವರ್ಗ, ಬಲವಾದ ಸಂಕೇತ

ತುಂಬಾ ಹೆಚ್ಚು

ಕೇವಲ ಶಿಕ್ಷಣದಿಂದ, ಸಿವಿಯಲ್ಲಿ

ಪ್ರಮಾಣೀಕರಣ

ರೇಖೀಯ/ದೂರ ಮಾದರಿಗಳು

ಮಧ್ಯಮ

ನಿಯತಾಂಕವು ಶಿಕ್ಷಣದ ಮೇಲೆ ಮಾತ್ರ ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ

ಸಮಯ ವಿಂಡೋ ವೈಶಿಷ್ಟ್ಯ

ಸಮಯದ ಸರಣಿ

ಹೆಚ್ಚು

ಭವಿಷ್ಯವನ್ನು ಸೇರಿಸಿ

ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು

ಪ್ರಕರಣ 1 - ಮೌಲ್ಯಯುತ ಆಸ್ತಿ. ಕ್ರೆಡಿಟ್ ತಂಡವು ಕಚ್ಚಾ "ಮಾಸಿಕ ಆದಾಯ" ಮತ್ತು "ಮಾಸಿಕ ಸಾಲ ಪಾವತಿ" ಕಾಲಮ್‌ಗಳಿಂದ "ಸಾಲದಿಂದ ಆದಾಯದ ಅನುಪಾತ" ವೈಶಿಷ್ಟ್ಯವನ್ನು ರಚಿಸಿದೆ. ಈ ಏಕ ಪಡೆದ ವೈಶಿಷ್ಟ್ಯವು ಮಾದರಿಯ ನಿಖರತೆಯನ್ನು 71% ರಿಂದ 79% ಕ್ಕೆ ಹೆಚ್ಚಿಸಿತು; ಏಕೆಂದರೆ ಇದು ದರವೇ ಹೊರತು ಸಂಪೂರ್ಣ ಆದಾಯವಲ್ಲ, ನಿಜವಾಗಿಯೂ ಅಪಾಯವನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ. ಪಾಠ: ಡೊಮೇನ್ ಜ್ಞಾನದಿಂದ ಉತ್ಪತ್ತಿಯಾಗುವ ಅನುಪಾತಗಳು ಬಲವಾದ ಸಂಕೇತಗಳಾಗಿವೆ.

ಪ್ರಕರಣ 2 - ಟಾರ್ಗೆಟ್ ಎನ್ಕೋಡಿಂಗ್ ಸೋರಿಕೆ. ಒಂದು ತಂಡವು "ಜಿಪ್ ಕೋಡ್" ಅನ್ನು ಟಾರ್ಗೆಟ್ ಎನ್‌ಕೋಡಿಂಗ್‌ನೊಂದಿಗೆ (ಆ ಪ್ರದೇಶದಲ್ಲಿ ಸರಾಸರಿ ಮಂಥನ ದರ) ಸಂಖ್ಯೆಗೆ ಪರಿವರ್ತಿಸಿತು, ಆದರೆ ವಿಭಜಿಸುವ ಮೊದಲು ಎಲ್ಲಾ ಡೇಟಾದಿಂದ ಹಾಗೆ ಮಾಡಿದೆ. ಮಾದರಿಯು ಪರೀಕ್ಷಾ ಸೆಟ್ನಲ್ಲಿ 94% ಅನ್ನು ನೀಡಿತು, ಉತ್ಪಾದನೆಯಲ್ಲಿ 68% ಕ್ಕೆ ಇಳಿಯಿತು. 6 ವಾರಗಳ ಶ್ರಮ ವ್ಯರ್ಥವಾಯಿತು. ಪಾಠ: ಗುರಿ ಕೋಡಿಂಗ್ ಅನ್ನು ಎಚ್ಚರಿಕೆಯಿಂದ ಮಾಡಲಾಗುತ್ತದೆ, ತರಬೇತಿಯೊಳಗೆ ಮಾತ್ರ.

ಪ್ರಕರಣ 3 - ಸ್ಕೇಲಿಂಗ್ ಮರೆಯುವಿಕೆ. ಒಬ್ಬ ವಿಶ್ಲೇಷಕ ಆದಾಯ (0-400,000) ಮತ್ತು ಗ್ರಾಹಕರ ವಯಸ್ಸು (18-75) ಅನ್ನು ಸ್ಕೇಲಿಂಗ್ ಮಾಡದೆಯೇ ದೂರ-ಆಧಾರಿತ ಮಾದರಿಗೆ ನೀಡಿತು. ಮಾದರಿಯು ಬಹುತೇಕ ಆದಾಯವನ್ನು ನೋಡಿದೆ, ವಯಸ್ಸಿನ ಪರಿಣಾಮವನ್ನು ಪುಡಿಮಾಡುತ್ತದೆ. ಸ್ಕೇಲಿಂಗ್ ಅನ್ನು ಸೇರಿಸಿದಾಗ, ವಿಭಜನೆಯು ಅರ್ಥಪೂರ್ಣವಾಯಿತು. ಪಾಠ: ದೂರ/ರೇಖೀಯ ಮಾದರಿಗಳಲ್ಲಿ ಸ್ಕೇಲಿಂಗ್ ಅನ್ನು ನಿರ್ಲಕ್ಷಿಸಲಾಗುವುದಿಲ್ಲ.

ನಾಲ್ಕು ನಕಲಿಸಬಹುದಾದ ಟೆಂಪ್ಲೇಟ್‌ಗಳು

1) ಫೀಚರ್ ಐಡಿಯಾ ಉತ್ಪಾದನೆ (ಎಲಿಮಿನೇಷನ್ ನಿಮಗೆ ಬಿಟ್ಟದ್ದು):

ನಿಮ್ಮ ಪಾತ್ರ: ವೈಶಿಷ್ಟ್ಯ ಎಂಜಿನಿಯರಿಂಗ್ ಸಹಾಯಕ. ನನ್ನ ಡಿಎಫ್ ಕಾಲಮ್‌ಗಳು: ಜನ್ಮ_ದಿನಾಂಕ, ಆದೇಶ_ಸಮಯ (ಟೈಮ್‌ಸ್ಟ್ಯಾಂಪ್), ಆದಾಯ_ಟಿಎಲ್, ಸಾಲ_ಟಿಎಲ್, ನಗರ, ಉತ್ಪನ್ನ_ವರ್ಗ. ಗುರಿ: "ಸಾಲವನ್ನು ಮರುಪಾವತಿ ಮಾಡಲಾಗುವುದು" (0/1). ಈ ಕಾಲಮ್‌ಗಳಿಂದ ರಚಿಸಬಹುದಾದ 15 ವೈಶಿಷ್ಟ್ಯಗಳನ್ನು ಸೂಚಿಸಿ; ಪ್ರತಿಯೊಂದಕ್ಕೂ ಸೋರಿಕೆಯ ಅಪಾಯವನ್ನು (ಕಡಿಮೆ/ಮಧ್ಯಮ/ಹೆಚ್ಚು) ಸೂಚಿಸಿ. ಭವಿಷ್ಯದ ಮಾಹಿತಿಯನ್ನು ಹೊಂದಿರುವುದನ್ನು ಸ್ಪಷ್ಟವಾಗಿ ಗುರುತಿಸಿ.

2) ಸುರಕ್ಷಿತ ಕೋಡಿಂಗ್ (ವಿಭಜನೆಯ ನಂತರ):

"ನಗರ" ಮತ್ತು "product_category" ಅನ್ನು ಒಂದು-ಹಾಟ್ ಎನ್ಕೋಡ್ ಮಾಡುವ ಕೋಡ್ ಬರೆಯಿರಿ. ಪ್ರಮುಖ: ಎನ್‌ಕೋಡಿಂಗ್ ಅನ್ನು ತರಬೇತಿ ಡೇಟಾಗೆ ಮಾತ್ರ ಹೊಂದಿಸಿ, ನಂತರ ಪರೀಕ್ಷಾ ಡೇಟಾವನ್ನು ಪರಿವರ್ತಿಸಿ (sklearn OneHotEncoder ಜೊತೆಗೆ). ಶಿಕ್ಷಣದಲ್ಲಿ ನೀವು ಕಾಣದ ವರ್ಗವನ್ನು (ಹ್ಯಾಂಡಲ್_ಅಜ್ಞಾತ) ಹೇಗೆ ನಿರ್ವಹಿಸುತ್ತೀರಿ ಎಂಬುದನ್ನು ವಿವರಿಸಿ.

3) ಪೈಪ್‌ಲೈನ್‌ನೊಂದಿಗೆ ಸೋರಿಕೆ-ಮುಕ್ತ ಪರಿವರ್ತನೆ:

ಸ್ಕ್ಲೀರ್ನ್ ಪೈಪ್‌ಲೈನ್ ಅನ್ನು ಹೊಂದಿಸಿ: ಸಂಖ್ಯಾ ಕಾಲಮ್‌ಗಳಿಗೆ StandardScaler ಅನ್ನು ಅನ್ವಯಿಸಿ, ವರ್ಗೀಯ ಕಾಲಮ್‌ಗಳಿಗೆ OneHotEncoder ಅನ್ನು ಅನ್ವಯಿಸಿ, ಕೊನೆಯಲ್ಲಿ ವರ್ಗೀಕರಣವನ್ನು ಸೇರಿಸಿ. ರೈಲು/ಪರೀಕ್ಷೆ ವಿಭಜನೆಯ ನಂತರ ಮತ್ತು ತರಬೇತಿಯಿಂದ ಮಾತ್ರ ಎಲ್ಲಾ ರೂಪಾಂತರಗಳನ್ನು ಕಲಿಯಲಾಗುತ್ತದೆ ಎಂದು ಖಾತರಿಪಡಿಸಿಕೊಳ್ಳಿ. ಕೋಡ್ ಅನ್ನು ವಿವರಿಸಿ ಮತ್ತು ಅದು ಏಕೆ ಸೋರಿಕೆ ಮುಕ್ತವಾಗಿದೆ.

4) ಟೈಮ್ ವಿಂಡೋ ವೈಶಿಷ್ಟ್ಯ (ಸೋರಿಕೆ ನಿಯಂತ್ರಣ):

ಪ್ರತಿ ಗ್ರಾಹಕರಿಗಾಗಿ "ಕಳೆದ 30 ದಿನಗಳಲ್ಲಿ ಆರ್ಡರ್‌ಗಳ ಸಂಖ್ಯೆ" ಗುಣಲಕ್ಷಣವನ್ನು ರಚಿಸಿ, ಆದರೆ ಮುನ್ಸೂಚನೆಯ ದಿನದ ನಂತರ ಡೇಟಾವನ್ನು ಎಂದಿಗೂ ಸೇರಿಸಬೇಡಿ. ಕೋಡ್ ಭವಿಷ್ಯವನ್ನು ನೋಡುವುದಿಲ್ಲ ಎಂದು ಸಾಲಿನ ಮೂಲಕ ವಿವರಿಸಿ. ನಾನು ಉಲ್ಲೇಖ ದಿನಾಂಕದ ಕಾಲಮ್ ಅನ್ನು ಒದಗಿಸುತ್ತೇನೆ.

ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್ / ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್

ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್:

ಈ ಡೇಟಾಗೆ ಉತ್ತಮ ಗುಣಲಕ್ಷಣಗಳನ್ನು ಸೇರಿಸಿ.

"ಒಳ್ಳೆಯದು" ಎಂದು ವ್ಯಾಖ್ಯಾನಿಸಲಾಗಿಲ್ಲ, ಗುರಿ ಅಸ್ಪಷ್ಟವಾಗಿದೆ, ಸೋರಿಕೆ ನಿಯಂತ್ರಣವಿಲ್ಲ. AI ಯಾದೃಚ್ಛಿಕ, ಬಹುಶಃ ಸೋರಿಕೆ, ವೈಶಿಷ್ಟ್ಯಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ.

ಶಕ್ತಿಯುತ ಪ್ರಾಂಪ್ಟ್:

ನಿಮ್ಮ ಪಾತ್ರ: ವೈಶಿಷ್ಟ್ಯ ಎಂಜಿನಿಯರ್. ಗುರಿ: "30 ದಿನಗಳಲ್ಲಿ ಮಂಥನ" (0/1), ಅಂದಾಜು ಉಲ್ಲೇಖ ದಿನಾಂಕ: save_date. df.Task ನಲ್ಲಿ ವಹಿವಾಟಿನ ಇತಿಹಾಸವಿದೆ: 8 ವೈಶಿಷ್ಟ್ಯಗಳನ್ನು ರಚಿಸಿ, ಪ್ರತಿಯೊಂದಕ್ಕೂ "ಭವಿಷ್ಯದ ಸಮಯದಲ್ಲಿ ನಾನು ಈ ಮಾಹಿತಿಯನ್ನು ಹೊಂದಿದ್ದೇನೆ" ಎಂಬ ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸಿ. ಸಮಯ ವಿಂಡೋ ವೈಶಿಷ್ಟ್ಯಗಳಲ್ಲಿ ಉಲ್ಲೇಖ ದಿನಾಂಕದ ನಂತರ ದಿನಾಂಕವನ್ನು ಸೇರಿಸುವುದು. ರೈಲು/ಪರೀಕ್ಷಾ ವಿಭಾಗದ ನಂತರ ಕಾರ್ಯಗತಗೊಳಿಸಲು ಪೈಪ್‌ಲೈನ್-ಹೊಂದಾಣಿಕೆಯ ರೀತಿಯಲ್ಲಿ ಕೋಡ್ ಅನ್ನು ಬರೆಯಿರಿ.

ಇಲ್ಲಿ, ಗುರಿ, ಉಲ್ಲೇಖ ಸಮಯ ಮತ್ತು ಸೋರಿಕೆ ನಿಯಂತ್ರಣವನ್ನು ಮೊದಲಿನಿಂದಲೂ ವ್ಯಾಖ್ಯಾನಿಸಲಾಗಿದೆ.

ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು

  • ವಿಭಜನೆಯ ಮೊದಲು ಎಲ್ಲಾ ಡೇಟಾದಿಂದ ರೂಪಾಂತರವನ್ನು ಕಲಿಯುವುದು. ಸ್ಕೇಲಿಂಗ್/ಎನ್‌ಕೋಡಿಂಗ್ ಪ್ಯಾರಾಮೀಟರ್ ಪರೀಕ್ಷಾ ಡೇಟಾವನ್ನು ನೋಡಿದರೆ, ಸೋರಿಕೆ ಸಂಭವಿಸುತ್ತದೆ.
  • ಗುರಿ ಕೋಡಿಂಗ್ನ ಅಸಡ್ಡೆ ಬಳಕೆ. ಇದು ಅತ್ಯಂತ ಶಕ್ತಿಶಾಲಿ ಆದರೆ ಅತ್ಯಂತ ಸೋರುವ ವಿಧಾನವಾಗಿದೆ; ಕೇವಲ ತರಬೇತಿಯಿಂದ, ಅಡ್ಡ ಮೌಲ್ಯೀಕರಣದಲ್ಲಿ.
  • ಸಮಯ ವಿಂಡೋ ವೈಶಿಷ್ಟ್ಯದೊಂದಿಗೆ ಭವಿಷ್ಯವನ್ನು ಸೇರಿಸಲಾಗುತ್ತಿದೆ. ಮುನ್ಸೂಚನೆಯ ದಿನದ ನಂತರ "ಕಳೆದ 30 ದಿನಗಳು" ಲೆಕ್ಕಾಚಾರವನ್ನು ನಮೂದಿಸಿದರೆ, ಮಾದರಿಯು ಭವಿಷ್ಯವನ್ನು ನೋಡುತ್ತದೆ.
  • ಮರದ ಮಾದರಿಯಲ್ಲಿ ಅನಗತ್ಯ ಸ್ಕೇಲಿಂಗ್ ಮತ್ತು ರೇಖೀಯ ಮಾದರಿಯಲ್ಲಿ ಅಪೂರ್ಣ ಸ್ಕೇಲಿಂಗ್. ಮಾದರಿ ಪ್ರಕಾರದ ಪ್ರಕಾರ ಸ್ಕೇಲಿಂಗ್ ನಿರ್ಧಾರಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳಲಾಗುತ್ತದೆ.
  • ಪ್ರಶ್ನೆಯಿಲ್ಲದೆ AI ನ ಪ್ರತಿಯೊಂದು ವೈಶಿಷ್ಟ್ಯದ ಸಲಹೆಯನ್ನು ಸೇರಿಸಲಾಗುತ್ತಿದೆ. ಸಲಹೆಗಳು ಅನುಪಯುಕ್ತ ಮತ್ತು ಸೋರುವ ವೈಶಿಷ್ಟ್ಯಗಳನ್ನು ಒಳಗೊಂಡಿರಬಹುದು.
ಸಲಹೆ: ನೀವು ರಚಿಸುವ ಪ್ರತಿಯೊಂದು ವೈಶಿಷ್ಟ್ಯಕ್ಕೂ ಒಂದೇ ಪ್ರಶ್ನೆಯನ್ನು ಬರೆಯಿರಿ: "ನಾನು ಭವಿಷ್ಯ ನುಡಿಯುವ ಸಮಯದಲ್ಲಿ ನಾನು ಹೊಂದಿರುವ ಮಾಹಿತಿಯೊಂದಿಗೆ ಈ ಮೌಲ್ಯವನ್ನು ಲೆಕ್ಕ ಹಾಕಬಹುದೇ?" ಉತ್ತರವು ಸ್ಪಷ್ಟವಾಗಿಲ್ಲದಿದ್ದರೆ "ಹೌದು", ವೈಶಿಷ್ಟ್ಯವನ್ನು ಬಳಸಬೇಡಿ. ಈ ಏಕೈಕ ಶಿಸ್ತು ಹೆಚ್ಚಿನ ವೈಶಿಷ್ಟ್ಯ-ಸಂಬಂಧಿತ ಸೋರಿಕೆಗಳನ್ನು ನಿವಾರಿಸುತ್ತದೆ.

ಸಾರಾಂಶದಲ್ಲಿ

ವೈಶಿಷ್ಟ್ಯ ಎಂಜಿನಿಯರಿಂಗ್ ಎನ್ನುವುದು ಕಚ್ಚಾ ಡೇಟಾದಿಂದ ಅರ್ಥಪೂರ್ಣ ಸಂಕೇತಗಳನ್ನು ಉತ್ಪಾದಿಸುವ ಕಲೆಯಾಗಿದೆ ಮತ್ತು ಅಲ್ಗಾರಿದಮ್‌ಗಿಂತ ಹೆಚ್ಚಾಗಿ ಮಾದರಿಯ ಯಶಸ್ಸನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ. ಎನ್‌ಕೋಡಿಂಗ್ ವರ್ಗೀಕರಣಗಳು (ಒಂದು-ಬಿಸಿ, ಲೇಬಲ್, ಗುರಿ), ಸ್ಕೇಲಿಂಗ್ ಸಂಖ್ಯಾಶಾಸ್ತ್ರ (ಪ್ರಮಾಣೀಕರಣ, ಸಾಮಾನ್ಯೀಕರಣ) ಮತ್ತು ಡೊಮೇನ್ ಜ್ಞಾನದೊಂದಿಗೆ ವ್ಯುತ್ಪನ್ನ ವೈಶಿಷ್ಟ್ಯಗಳನ್ನು ಉತ್ಪಾದಿಸುವುದು ಮೂಲ ಸಾಧನಗಳಾಗಿವೆ. ಆದರೆ ಈ ಹಂತವು ಸೋರಿಕೆಯ ಹೃದಯವೂ ಆಗಿದೆ: ಎಲ್ಲಾ ರೂಪಾಂತರಗಳನ್ನು ತರಬೇತಿ / ಪರೀಕ್ಷೆಯ ವಿಭಜನೆಯ ನಂತರ ಮತ್ತು ತರಬೇತಿ ಡೇಟಾದಿಂದ ಮಾತ್ರ ಕಲಿಯಬೇಕು. AI ಸಾಕಷ್ಟು ವಿಚಾರಗಳನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ; ಮೌಲ್ಯಯುತವಾದದ್ದನ್ನು ಅಪಾಯಕಾರಿಯಿಂದ ಪ್ರತ್ಯೇಕಿಸುವ ಮಾನವ ತೀರ್ಪು.

ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ

ಟಾರ್ಗೆಟ್ ವೇರಿಯೇಬಲ್ ಅನ್ನು ಆಯ್ಕೆಮಾಡಿ ಮತ್ತು ನೀವು ಹೊಂದಿರುವ ಕಾಲಮ್‌ಗಳಿಂದ ಕನಿಷ್ಠ ಐದು ಉತ್ಪನ್ನ ವೈಶಿಷ್ಟ್ಯಗಳನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಿ. ಅವುಗಳಲ್ಲಿ ಪ್ರತಿಯೊಂದಕ್ಕೂ, "ಮುನ್ಸೂಚನೆಯ ಸಮಯದಲ್ಲಿ ನಾನು ಲಭ್ಯವಿದ್ದೇನೆ" ಎಂಬ ಪ್ರಶ್ನೆಗೆ ಬರವಣಿಗೆಯಲ್ಲಿ ಉತ್ತರಿಸಿ ಮತ್ತು ಕನಿಷ್ಠ ಒಂದನ್ನು "ಸೋರಿಕೆಯ ಹೆಚ್ಚಿನ ಅಪಾಯ" ಎಂದು ನಿವಾರಿಸಿ. ನಂತರ ವಿಭಜನೆಯ ನಂತರ ಅಳವಡಿಸಲು ಪೈಪ್‌ಲೈನ್‌ನಲ್ಲಿ ಸುರಕ್ಷಿತ ವೈಶಿಷ್ಟ್ಯಗಳನ್ನು ಕೋಡ್ ಮಾಡಿ.

ಪರಿಶೀಲನಾಪಟ್ಟಿ

  • [ ] ರೈಲು/ಪರೀಕ್ಷೆ ವಿಭಜನೆಯ ನಂತರ ನಾನು ಎಲ್ಲಾ ರೂಪಾಂತರಗಳನ್ನು ಅನ್ವಯಿಸಿದ್ದೇನೆಯೇ?
  • [ ] ನಾನು ತರಬೇತಿಯಿಂದ ಸ್ಕೇಲಿಂಗ್/ಎನ್‌ಕೋಡಿಂಗ್ ಪ್ಯಾರಾಮೀಟರ್‌ಗಳನ್ನು ಮಾತ್ರ ಕಲಿತಿದ್ದೇನೆಯೇ?
  • [ ] ಪ್ರತಿ ವೈಶಿಷ್ಟ್ಯಕ್ಕಾಗಿ "ಭವಿಷ್ಯದ ಸಮಯದಲ್ಲಿ ನಾನು ಅದನ್ನು ಹೊಂದಿದ್ದೇನೆ" ಎಂಬ ಪ್ರಶ್ನೆಗೆ ನಾನು ಉತ್ತರಿಸಿದ್ದೇನೆಯೇ?
  • ಟಾರ್ಗೆಟ್ ಕೋಡಿಂಗ್‌ನಂತಹ ಹೆಚ್ಚಿನ ಅಪಾಯದ ವಿಧಾನಗಳೊಂದಿಗೆ ನಾನು ಹೆಚ್ಚಿನ ಕಾಳಜಿಯನ್ನು ತೆಗೆದುಕೊಂಡಿದ್ದೇನೆಯೇ?
  • [ ] ಮಾದರಿ ಪ್ರಕಾರಕ್ಕೆ (ಮರ/ರೇಖೀಯ) ಸೂಕ್ತವಾಗಿ ಅಳೆಯಲು ನಾನು ನಿರ್ಧರಿಸಿದ್ದೇನೆಯೇ?