ಘಟಕಗಳು
1. ಎಂಎಲ್ ಎಂಜಿನಿಯರಿಂಗ್‌ನಲ್ಲಿ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ: ಪಾತ್ರ, ಗಡಿಗಳು, ಮೌಲ್ಯೀಕರಣ ಮತ್ತು ಜವಾಬ್ದಾರಿ 2. ಡೇಟಾ ಪೈಪ್‌ಲೈನ್: ಸಂಗ್ರಹಣೆ, ಶುದ್ಧೀಕರಣ, ಟ್ಯಾಗಿಂಗ್ ಮತ್ತು ಆವೃತ್ತಿ 3. ಮಾದರಿ ತರಬೇತಿ ಮತ್ತು ಮೌಲ್ಯಮಾಪನ: ನಿಖರವಾದ ಮೆಟ್ರಿಕ್ಸ್, ಪ್ರಾಮಾಣಿಕ ಬೆಂಚ್ಮಾರ್ಕಿಂಗ್ 4. LLM ಅಪ್ಲಿಕೇಶನ್: RAG ನೊಂದಿಗೆ ನಿಮ್ಮ ಸ್ವಂತ ಡೇಟಾವನ್ನು ಆಧರಿಸಿ ಉತ್ತರಗಳು 5. LLM ಅಪ್ಲಿಕೇಶನ್: ಏಜೆಂಟ್, ಟೂಲಿಂಗ್ ಮತ್ತು ಸೆಕ್ಯೂರ್ ಆಟೊಮೇಷನ್ 6. ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಆಧಾರ: ಯಾವಾಗ, ಹೇಗೆ ಮತ್ತು ಯಾವ ಅಪಾಯದೊಂದಿಗೆ 7. MLOps ಮತ್ತು ನಿಯೋಜನೆ: ಮಾದರಿಯನ್ನು ಲ್ಯಾಬ್‌ನಿಂದ ಉತ್ಪಾದನೆಗೆ ಸ್ಥಳಾಂತರಿಸುವುದು 8. ಇವಾಲ್ ಮತ್ತು ಮಾನಿಟರಿಂಗ್: ಉತ್ಪಾದನೆಯಲ್ಲಿ ಮಾದರಿಯು ನಿಜವಾಗಿಯೂ ಏನು ಮಾಡುತ್ತದೆ ಎಂಬುದನ್ನು ತಿಳಿದುಕೊಳ್ಳುವುದು 9. ಭದ್ರತೆ ಮತ್ತು ಗೌಪ್ಯತೆ: AI ವ್ಯವಸ್ಥೆಗಳನ್ನು ರಕ್ಷಿಸುವುದು 10. ಪಕ್ಷಪಾತ, ನೈತಿಕತೆ ಮತ್ತು ವೆಚ್ಚ: ಜವಾಬ್ದಾರಿಯುತ ಮತ್ತು ಸುಸ್ಥಿರ AI ಎಂಜಿನಿಯರಿಂಗ್ 11. ಪುನರುತ್ಪಾದನೆ ಮತ್ತು ಅಂತ್ಯದಿಂದ ಅಂತ್ಯದ ಯೋಜನೆ: ಎಲ್ಲವನ್ನೂ ಸಂಯೋಜಿಸುವುದು
ಘಟಕ 2 / 11

ಡೇಟಾ ಪೈಪ್‌ಲೈನ್: ಸಂಗ್ರಹಣೆ, ಶುದ್ಧೀಕರಣ, ಟ್ಯಾಗಿಂಗ್ ಮತ್ತು ಆವೃತ್ತಿ

ಲಾಭಗಳು:

  • ಡೇಟಾ ಪೈಪ್‌ಲೈನ್ ಅನ್ನು ಹೊಂದಿಸುವ ಸಾಮರ್ಥ್ಯ (ಸಂಗ್ರಹಣೆ, ಮೌಲ್ಯೀಕರಣ, ಶುದ್ಧೀಕರಣ, ರೂಪಾಂತರ, ವಿಭಜನೆ, ಆವೃತ್ತಿ) ಮತ್ತು ಪೈಪ್‌ಲೈನ್‌ನ ಪ್ರಾರಂಭದಲ್ಲಿ ಸ್ಕೀಮಾ ಮೌಲ್ಯೀಕರಣವನ್ನು ಇರಿಸುವುದು
  • ಡೇಟಾ ಸೋರಿಕೆಯನ್ನು ತಡೆಯಲು (ಗುಂಪು ಮತ್ತು ತಾತ್ಕಾಲಿಕ) ಕ್ಷೇತ್ರದ ಅರ್ಥ ಮತ್ತು ವಿಭಜನೆಯ ಆಧಾರದ ಮೇಲೆ ಕಾಣೆಯಾದ ಮೌಲ್ಯ ಮತ್ತು ಲೇಬಲ್ ನಿರ್ಧಾರಗಳನ್ನು ಮಾಡುವ ಸಾಮರ್ಥ್ಯ
  • ಡೇಟಾ ಆವೃತ್ತಿ ಮತ್ತು ಯಾದೃಚ್ಛಿಕತೆಯ ಬೀಜವನ್ನು ಸರಿಪಡಿಸುವ ಮೂಲಕ ಪುನರುತ್ಪಾದಿಸಬಹುದಾದ ಡೇಟಾ ಬೇಸ್ ಅನ್ನು ರಚಿಸುವ ಸಾಮರ್ಥ್ಯ

ಪ್ರತಿಯೊಂದು ಯಂತ್ರ ಕಲಿಕೆ ವ್ಯವಸ್ಥೆಯ ನಿಜವಾದ ಶಕ್ತಿಯು ಡೇಟಾದಲ್ಲಿದೆ, ಮಾದರಿಯಲ್ಲ. ಅನುಭವಿ ಇಂಜಿನಿಯರ್‌ಗಳಿಗೆ ತಿಳಿದಿದೆ: “ಕಸ ಇನ್, ಕಸದ ಹೊರಗಿದೆ” — ಅತ್ಯಾಧುನಿಕ ಮಾದರಿಯ ಕೆಟ್ಟ ಡೇಟಾ ಕೂಡ ಕೆಟ್ಟ ಫಲಿತಾಂಶಗಳನ್ನು ನೀಡುತ್ತದೆ. ಈ ಘಟಕದಲ್ಲಿ, ನಾವು ಡೇಟಾ ಪೈಪ್‌ಲೈನ್ ಅನ್ನು ಸ್ಥಾಪಿಸುತ್ತೇವೆ (ಡೇಟಾ ಪೈಪ್‌ಲೈನ್: ಮಾದರಿ ತರಬೇತಿಗಾಗಿ ಕಚ್ಚಾ ಡೇಟಾವನ್ನು ಸಿದ್ಧಪಡಿಸುವ ಹಂತಗಳ ಸರಪಳಿ) ಅಂತ್ಯದಿಂದ ಕೊನೆಯವರೆಗೆ ಮತ್ತು ಈ ಸಾಲಿನ ಯಾವ ಹಂತದಲ್ಲಿ ನಾವು ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯನ್ನು ಸುರಕ್ಷಿತವಾಗಿ ಬಳಸಬಹುದು ಎಂಬುದನ್ನು ಕಲಿಯುತ್ತೇವೆ.

ಡೇಟಾ ಸಾಲಿನ ಹಂತಗಳು

ಡೇಟಾ ಲೈನ್ ಸಾಮಾನ್ಯವಾಗಿ ಈ ನಿಲ್ದಾಣಗಳ ಮೂಲಕ ಹಾದುಹೋಗುತ್ತದೆ:

  1. ಸಂಗ್ರಹಣೆ (ಇಂಗುವಿಕೆ): ಮೂಲಗಳಿಂದ ಡೇಟಾವನ್ನು ಎಳೆಯುವುದು (ಡೇಟಾಬೇಸ್, API, ಲಾಗ್ ಫೈಲ್‌ಗಳು, ಈವೆಂಟ್ ಸ್ಟ್ರೀಮ್‌ಗಳು).
  2. ಮೌಲ್ಯೀಕರಣ: ಡೇಟಾವು ನಿರೀಕ್ಷಿತ ಸ್ಕೀಮಾ, ಪ್ರಕಾರಗಳು ಮತ್ತು ಶ್ರೇಣಿಗಳಿಗೆ ಅನುಗುಣವಾಗಿದೆಯೇ ಎಂದು ಪರಿಶೀಲಿಸಲಾಗುತ್ತಿದೆ.
  3. ಶುಚಿಗೊಳಿಸುವಿಕೆ: ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳು, ನಕಲಿ ದಾಖಲೆಗಳು, ಔಟ್‌ಲೈಯರ್‌ಗಳು ಮತ್ತು ಅಸಂಗತತೆಗಳನ್ನು ನಿರ್ವಹಿಸುವುದು.
  4. ರೂಪಾಂತರ: ಕಚ್ಚಾ ಡೇಟಾವನ್ನು ಗುಣಲಕ್ಷಣಗಳಾಗಿ ಪರಿವರ್ತಿಸುವುದು - ಉದಾಹರಣೆಗೆ ವರ್ಗೀಯ ವೇರಿಯಬಲ್ ಅನ್ನು ಸಂಖ್ಯೆಗೆ ಪರಿವರ್ತಿಸುವುದು, ದಿನಾಂಕದಿಂದ "ವಾರದ ದಿನ" ಅನ್ನು ಉತ್ಪಾದಿಸುವುದು.
  5. ವಿಭಜನೆ: ತರಬೇತಿ, ಮೌಲ್ಯೀಕರಣ ಮತ್ತು ಪರೀಕ್ಷಾ ಸೆಟ್‌ಗಳಾಗಿ ಬೇರ್ಪಡಿಸುವುದು.
  6. ಆವೃತ್ತಿ: ಯಾವ ಮಾದರಿಗೆ ಯಾವ ಡೇಟಾದೊಂದಿಗೆ ತರಬೇತಿ ನೀಡಲಾಗಿದೆ ಎಂಬುದನ್ನು ರೆಕಾರ್ಡ್ ಮಾಡುವುದು.

ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯು ಕೋಡ್ ಡ್ರಾಫ್ಟ್‌ಗಳು ಮತ್ತು ಆಲೋಚನೆಗಳನ್ನು ರಚಿಸುವ ಮೂಲಕ ಸಮಯವನ್ನು ಉಳಿಸುತ್ತದೆ, ವಿಶೇಷವಾಗಿ ಹಂತಗಳು 2, 3 ಮತ್ತು 4. ಆದರೆ ಯಾವ ದಾಖಲೆಯನ್ನು ತ್ಯಜಿಸಬೇಕು, ಯಾವ ಮೌಲ್ಯವನ್ನು ತುಂಬಬೇಕು ಮತ್ತು ಹೇಗೆ ಎಂದು ನಿರ್ಧಾರಗಳು ಡೇಟಾವನ್ನು ತಿಳಿದಿರುವ ಎಂಜಿನಿಯರ್‌ಗೆ ಸೇರಿರುತ್ತವೆ; ಏಕೆಂದರೆ ಅಸಮರ್ಪಕ ಶುಚಿಗೊಳಿಸುವಿಕೆಯು ಮಾದರಿಗೆ ಗುಪ್ತ ಪಕ್ಷಪಾತವನ್ನು ಚುಚ್ಚಬಹುದು.

ಡೇಟಾ ಪರಿಶೀಲನೆ: ಸಾಲಿನ ಆರಂಭಿಕ ರಕ್ಷಣೆ

ಅತ್ಯಂತ ದುಬಾರಿ ದೋಷಗಳು ಉತ್ಪಾದನೆಯಲ್ಲಿ ಪ್ರಾರಂಭವಾಗುವುದಿಲ್ಲ, ಆದರೆ ಪರಿಶೀಲನೆ ಹಂತವನ್ನು ಬಿಟ್ಟುಬಿಡಲಾಗುತ್ತದೆ. ಪ್ರತಿ ಒಳಬರುವ ಬ್ಯಾಚ್ ಡೇಟಾ ನಿರೀಕ್ಷಿತ ರಚನೆಗೆ ಅನುಗುಣವಾಗಿದೆಯೇ ಎಂಬುದನ್ನು ಸ್ಕೀಮಾ ಮೌಲ್ಯಮಾಪನವು ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಪರಿಶೀಲಿಸುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, 0-120 ನಡುವಿನ ವಯಸ್ಸಿನ ಕಾಲಮ್ ಆಗಿದೆಯೇ, ಇಮೇಲ್ ಕ್ಷೇತ್ರವು ಖಾಲಿಯಾಗಿದೆಯೇ, ಕಾಲಮ್‌ಗಳ ಸಂಖ್ಯೆ ಬದಲಾಗಿದೆಯೇ?

ಸಲಹೆ: ರೇಖೆಯ ಆರಂಭದಲ್ಲಿ ಪರಿಶೀಲನೆಯನ್ನು ಹಾಕಿ. ಭ್ರಷ್ಟ ದತ್ತಾಂಶವನ್ನು ಎಷ್ಟು ಬೇಗ ಹಿಡಿಯಲಾಗುತ್ತದೆಯೋ, ಅದನ್ನು ಸರಿಪಡಿಸಲು ಅಗ್ಗವಾಗಿದೆ. ಉತ್ಪಾದನೆಯಲ್ಲಿ ಸಿಕ್ಕಿಬಿದ್ದ ಸ್ಕೀಮಾ ದೋಷವು ತರಬೇತಿ ಹಂತದಲ್ಲಿ ಸಿಕ್ಕಿಹಾಕಿಕೊಂಡ ಒಂದಕ್ಕಿಂತ ಹಲವು ಪಟ್ಟು ಹೆಚ್ಚು ದುಬಾರಿಯಾಗಿದೆ.

ಕೆಳಗಿನ ಡೇಟಾ ಸ್ಕೀಮಾಗಾಗಿ ಪಂಡೇರಾ (ಅಥವಾ ಗ್ರೇಟ್ ಎಕ್ಸ್‌ಪೆಕ್ಟೇಷನ್ಸ್) ಜೊತೆಗೆ ಮೌಲ್ಯೀಕರಣ ಯೋಜನೆಯನ್ನು ಬರೆಯಿರಿ. ಕಾಲಮ್‌ಗಳು ಮತ್ತು ನಿಯಮಗಳು:- user_id: ಪೂರ್ಣಾಂಕ, ಶೂನ್ಯವಾಗಿರಬಾರದು, ಅನನ್ಯ- ವಯಸ್ಸು: ಪೂರ್ಣಾಂಕ, 0-120 ರಿಂದ ಇರುವಂತಿಲ್ಲ- ಸೈನ್‌ಅಪ್_ದಿನಾಂಕ: ದಿನಾಂಕ, ಭವಿಷ್ಯದಲ್ಲಿ ಇರುವಂತಿಲ್ಲ- ದೇಶ: ವರ್ಗೀಯ, ಸೆಟ್‌ನಿಂದ {TR, DE, US, UK}- ಸಮತೋಲನ: ದಶಮಾಂಶ, ಋಣಾತ್ಮಕವಾಗಿರಬಾರದು ಪ್ರತಿ ನಿಯಮ ಉಲ್ಲಂಘನೆಗೆ ಅರ್ಥಪೂರ್ಣ ದೋಷ ಸಂದೇಶವನ್ನು ರಚಿಸಿ. ಕೋಡ್‌ನ ಕೊನೆಯಲ್ಲಿ ಮುರಿದ ರೇಖೆಯ ಉದಾಹರಣೆಯೊಂದಿಗೆ ಪರೀಕ್ಷೆಯನ್ನು ತೋರಿಸಿ.

ಶುಚಿಗೊಳಿಸುವಿಕೆ: ಇದನ್ನು ನಿರ್ಧರಿಸುವವನು ಮಾನವ

ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳು ಪ್ರತಿ ಡೇಟಾ ಸೆಟ್‌ನ ವಾಸ್ತವವಾಗಿದೆ. ನಿರ್ವಹಿಸುವ ಮಾರ್ಗಗಳು:

  • ಅಳಿಸುವಿಕೆ: ಅತಿ ಹೆಚ್ಚು ಕಾಣೆಯಾದ ದರದೊಂದಿಗೆ ಸಾಲು/ಕಾಲಮ್ ಅನ್ನು ತ್ಯಜಿಸುವುದು. ಆದರೆ ಮಾಹಿತಿ ನಷ್ಟ ಮತ್ತು ಪಕ್ಷಪಾತದ ಅಪಾಯವಿದೆ.
  • ಇಂಪ್ಯುಟೇಶನ್: ಸರಾಸರಿ, ಮಧ್ಯಮ, ಹೆಚ್ಚು ಆಗಾಗ್ಗೆ ಮೌಲ್ಯ ಅಥವಾ ಮಾದರಿ ಆಧಾರಿತ ಭವಿಷ್ಯದೊಂದಿಗೆ ಆರೋಪ.
  • ಫ್ಲ್ಯಾಗ್: ಪ್ರತ್ಯೇಕ ಫ್ಲ್ಯಾಗ್ ಕಾಲಮ್‌ನಲ್ಲಿ "ಕಾಣೆಯಾಗಿದೆ" ಮಾಹಿತಿಯನ್ನು ಸಂಗ್ರಹಿಸುವುದು - ಕೆಲವೊಮ್ಮೆ ಕಾಣೆಯಾದ ಸಂಕೇತವಾಗಿದೆ.

ಯಾವುದು ಸರಿ ಎಂಬುದು ಸಮಸ್ಯೆಯ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ. ವೈದ್ಯಕೀಯ ಡೇಟಾ ಸೆಟ್‌ನಲ್ಲಿ, "ರಕ್ತದ ಮೌಲ್ಯವನ್ನು ಅಳೆಯಲಾಗಿಲ್ಲ" ಮಾಹಿತಿಯನ್ನು ಅಳಿಸುವ ಬದಲು ಸಂರಕ್ಷಿಸಬೇಕು; ಏಕೆಂದರೆ ಅಳತೆಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳಲು ವೈದ್ಯರ ನಿರಾಕರಣೆ ಸಹ ಸಂಕೇತವಾಗಿದೆ. AI ನಿಮಗೆ ಆಯ್ಕೆಗಳು ಮತ್ತು ಕೋಡ್ ನೀಡಬಹುದು; ಕ್ಷೇತ್ರದ ವಾಸ್ತವಕ್ಕೆ ಯಾವುದು ಹೊಂದುತ್ತದೆ ಎಂಬುದನ್ನು ನೀವು ಆರಿಸಿಕೊಳ್ಳಿ.

ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್ / ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್

ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್: "ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳನ್ನು ಭರ್ತಿ ಮಾಡಿ."

ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್: "ಕೆಳಗಿನ ಕಾಲಮ್‌ಗಳಲ್ಲಿ ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳಿವೆ: ಆದಾಯ (12% ಕಾಣೆಯಾಗಿದೆ, ಬಲಕ್ಕೆ ಓರೆಯಾದ ವಿತರಣೆ), ಕೊನೆಯ_ಲಾಗಿನ್ (30% ಕಾಣೆಯಾಗಿದೆ). ಆದಾಯವನ್ನು ಸರಾಸರಿಯೊಂದಿಗೆ ಭರ್ತಿ ಮಾಡಲು ಸಲಹೆ ನೀಡಿ, ಆದರೆ ಮಧ್ಯದ ಮತ್ತು ಅರ್ಥವಲ್ಲ ಎಂಬುದನ್ನು ವಿವರಿಸಿ. ಕೊನೆಯ_ಲಾಗಿನ್‌ಗಾಗಿ, ಕಾಣೆಯಾದ ಮೌಲ್ಯವು ಮಹತ್ವದ್ದಾಗಿರಬಹುದು ಎಂದು ಊಹಿಸಿ (ಬಳಕೆದಾರರು ಎಂದಿಗೂ ಲಾಗ್ ಇನ್ ಆಗಿಲ್ಲ. ಪಕ್ಷಪಾತವು ಮಾದರಿಗೆ ಸೇರಿಸುತ್ತದೆ."

ವ್ಯತ್ಯಾಸ: ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್ ವಿತರಣಾ ಮಾಹಿತಿ ಮತ್ತು ಪ್ರದೇಶದ ಅರ್ಥವನ್ನು ನೀಡುತ್ತದೆ; ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯು ಯಾಂತ್ರಿಕ ಭರ್ತಿಗೆ ಬದಲಾಗಿ ನಿರ್ಧಾರ ಬೆಂಬಲವನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ.

ಲೇಬಲಿಂಗ್: ಗುಣಮಟ್ಟವನ್ನು ಅಳೆಯಲಾಗುತ್ತದೆ

ಮೇಲ್ವಿಚಾರಣೆಯ ಕಲಿಕೆಯಲ್ಲಿ (ಸರಿಯಾದ ಉತ್ತರಗಳೊಂದಿಗೆ ಉದಾಹರಣೆಗಳನ್ನು ನೀಡಲಾದ ಕಲಿಕೆ), ಮಾದರಿಯು ಕಲಿಯುವುದು ಲೇಬಲ್‌ಗಳು (ಲೇಬಲ್‌ಗಳು: ಪ್ರತಿ ಉದಾಹರಣೆಗೆ ಸರಿಯಾದ ಉತ್ತರ). ಲೇಬಲ್ ಗುಣಮಟ್ಟವು ಸೀಲಿಂಗ್ ಅನ್ನು ಹೊಂದಿಸುತ್ತದೆ - ಜನರು ಅಸಮಂಜಸವಾಗಿ ಲೇಬಲ್ ಮಾಡಿದರೆ, ಮಾದರಿಯು ಅಸಮಂಜಸವಾಗಿ ಕಲಿಯುತ್ತದೆ.

ಅಂತರ-ವಿವರಣೆಯ ಒಪ್ಪಂದವು ವಿಭಿನ್ನ ಜನರು ಒಂದೇ ಮಾದರಿಗೆ ಒಂದೇ ಲೇಬಲ್ ಅನ್ನು ನೀಡುವ ದರವನ್ನು ಅಳೆಯುತ್ತದೆ; ಇದು ಕೋಹೆನ್ಸ್ ಕಪ್ಪಾ ನಂತಹ ಗುಣಾಂಕದಿಂದ ವ್ಯಕ್ತವಾಗುತ್ತದೆ. ಕಡಿಮೆ ಅನುಸರಣೆಯು ಕಾರ್ಯವು ಅಸ್ಪಷ್ಟವಾಗಿದೆ ಅಥವಾ ಸೂಚನೆಯು ದುರ್ಬಲವಾಗಿದೆ ಎಂದು ಸೂಚಿಸುತ್ತದೆ.

ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯು ಎರಡು ರೀತಿಯಲ್ಲಿ ಲೇಬಲ್ ಮಾಡಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ: (1) ಟಿಪ್ಪಣಿ ಮಾರ್ಗಸೂಚಿಯನ್ನು ರಚಿಸುವುದು, (2) ಪೂರ್ವ ಲೇಬಲ್ ಮಾಡುವುದು ಮತ್ತು ಮಾನವನು ಅದನ್ನು ಸರಿಪಡಿಸುವುದು. ಆದರೆ LLM ನೊಂದಿಗೆ ಪೂರ್ವ ಲೇಬಲ್ ಮಾಡುವಿಕೆಯು ಅಪಾಯವನ್ನು ಹೊಂದಿದೆ: ಮಾದರಿಯ ವ್ಯವಸ್ಥಿತ ದೋಷವು ಸಂಪೂರ್ಣ ಲೇಬಲ್ ಸೆಟ್ನಲ್ಲಿ ಸೋರಿಕೆಯಾಗಬಹುದು. ಅದಕ್ಕಾಗಿಯೇ ಮಾನವರು ಯಾವಾಗಲೂ ಕೆಲವು LLM ಲೇಬಲ್‌ಗಳನ್ನು ಪರಿಶೀಲಿಸುತ್ತಾರೆ.

ಗಮನ: LLM ನಿಂದ ತಯಾರಿಸಲ್ಪಟ್ಟ ಲೇಬಲ್‌ಗಳನ್ನು "ಗ್ರೌಂಡ್ ಟ್ರೂಟ್" ಎಂದು ಪರಿಗಣಿಸಬೇಡಿ. ಮಾನವನೊಂದಿಗೆ ಮಾದರಿಯನ್ನು ಪರಿಶೀಲಿಸಿ ಮತ್ತು LLM-ಮಾನವ ಫಿಟ್ ಅನ್ನು ಅಳೆಯಿರಿ. ಅನುಸರಣೆ ಕಡಿಮೆಯಿದ್ದರೆ, ಪೂರ್ವ ಲೇಬಲ್ ಮಾಡುವುದು ಒಳ್ಳೆಯದಕ್ಕಿಂತ ಹೆಚ್ಚು ಹಾನಿ ಮಾಡುತ್ತದೆ.

ಡೇಟಾ ವಿಭಜನೆ: ಸೋರಿಕೆಯನ್ನು ತಡೆಯಿರಿ

ದತ್ತಾಂಶವನ್ನು ತರಬೇತಿ/ಮೌಲ್ಯಮಾಪನ/ಪರೀಕ್ಷೆಯಾಗಿ ವಿಭಜಿಸುವಾಗ ಅತ್ಯಂತ ಅಪಾಯಕಾರಿ ತಪ್ಪು ಎಂದರೆ ಡೇಟಾ ಸೋರಿಕೆ: ಪರೀಕ್ಷಾ ಮಾಹಿತಿಯನ್ನು ತರಬೇತಿಯಲ್ಲಿ ಮಿಶ್ರಣ ಮಾಡುವುದು. ಉದಾಹರಣೆಗಳು:

  • ಅದೇ ಬಳಕೆದಾರರ ದಾಖಲೆಗಳು ತರಬೇತಿ ಮತ್ತು ಪರೀಕ್ಷೆ (ಗುಂಪು ಸೋರಿಕೆ) ಎರಡಕ್ಕೂ ಸೇರುತ್ತವೆ.
  • ತರಬೇತಿಯಲ್ಲಿ ಭವಿಷ್ಯವನ್ನು ಮತ್ತು ಸಮಯ ಸರಣಿಯಲ್ಲಿ ಪರೀಕ್ಷೆಯಲ್ಲಿ ಹಿಂದಿನದನ್ನು ಬಳಸುವುದು (ತಾತ್ಕಾಲಿಕ ಸೋರಿಕೆ).
  • ಎಲ್ಲಾ ಡೇಟಾದಿಂದ ಸ್ಕೇಲಿಂಗ್ (ಸಾಮಾನ್ಯೀಕರಣ) ನಿಯತಾಂಕಗಳನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡುವುದು ಮತ್ತು ನಂತರ ಭಾಗಿಸುವುದು.

ಸಮಯವನ್ನು ಒಳಗೊಂಡಿರುವ ಸಮಸ್ಯೆಗಳಿಗೆ ತಾತ್ಕಾಲಿಕ ವಿಭಜನೆ ಅತ್ಯಗತ್ಯ: ಭೂತಕಾಲದೊಂದಿಗೆ ತರಬೇತಿ ನೀಡಿ, ಭವಿಷ್ಯದಲ್ಲಿ ಪರೀಕ್ಷೆ. ಯಾದೃಚ್ಛಿಕ ವಿಭಜನೆಯು ಉತ್ಪಾದನೆಯಲ್ಲಿ ಎಂದಿಗೂ ಸಂಭವಿಸದ "ಭವಿಷ್ಯದ" ಪ್ರಯೋಜನವನ್ನು ನೀಡುತ್ತದೆ ಮತ್ತು ಮೆಟ್ರಿಕ್‌ಗಳನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ.

ಡೇಟಾ ಆವೃತ್ತಿ ಮತ್ತು ಪುನರುತ್ಪಾದನೆ

"ನಾವು ಈ ಮಾದರಿಯನ್ನು ಯಾವ ಡೇಟಾದೊಂದಿಗೆ ತರಬೇತಿ ನೀಡಿದ್ದೇವೆ?" ತಿಂಗಳ ನಂತರ ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸಲು ಸಾಧ್ಯವಾಗುವುದು ಗಂಭೀರ ಎಂಎಲ್ ಎಂಜಿನಿಯರಿಂಗ್‌ನ ವಿಶಿಷ್ಟ ಲಕ್ಷಣವಾಗಿದೆ. ಡೇಟಾ ಆವೃತ್ತಿಯು ಪ್ರತಿ ಡೇಟಾ ಸ್ನ್ಯಾಪ್‌ಶಾಟ್ ಅನ್ನು ID (ಹ್ಯಾಶ್ ಅಥವಾ ಆವೃತ್ತಿ ಟ್ಯಾಗ್) ನೊಂದಿಗೆ ಸಂಗ್ರಹಿಸುತ್ತದೆ. ಕೋಡ್‌ನಂತಹ DVC (ಡೇಟಾ ಆವೃತ್ತಿ ನಿಯಂತ್ರಣ) ಆವೃತ್ತಿ ಡೇಟಾದಂತಹ ಪರಿಕರಗಳು.

ಮಾದರಿಯ ಫಲಿತಾಂಶವನ್ನು ಪುನರುತ್ಪಾದಿಸಲು, ಮೂರು ವಿಷಯಗಳನ್ನು ಸರಿಪಡಿಸಬೇಕು: ಡೇಟಾ ಆವೃತ್ತಿ, ಕೋಡ್ ಆವೃತ್ತಿ ಮತ್ತು ಯಾದೃಚ್ಛಿಕ ಬೀಜ. ಈ ಮೂವರಿಲ್ಲದೆ "ನನಗೆ ಅದೇ ಫಲಿತಾಂಶ ಬಂದಿದೆ" ಎಂದು ಹೇಳಲು ಸಾಧ್ಯವಿಲ್ಲ. ನಾವು ಘಟಕ 11 ರಲ್ಲಿ ಪುನರುತ್ಪಾದನೆಯನ್ನು ಆಳಗೊಳಿಸುತ್ತೇವೆ; ಆದರೆ ಡೇಟಾ ಪೈಪ್‌ಲೈನ್‌ನಲ್ಲಿ ಬೀಜವನ್ನು ಸರಿಪಡಿಸುವುದು ಇಲ್ಲಿಂದ ಪ್ರಾರಂಭವಾಗುತ್ತದೆ.

ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು

ಪ್ರಕರಣ 1 - ದಿನದ ಸ್ಕೀಮಾ ಮೌಲ್ಯೀಕರಣವನ್ನು ಉಳಿಸಲಾಗಿದೆ. ತಂಡವೊಂದು ಅಪ್‌ಸ್ಟ್ರೀಮ್ ಸಿಸ್ಟಮ್ ಬೆಲೆ ಕ್ಷೇತ್ರವನ್ನು ಪೆನ್ನಿಗಳಿಂದ ಲಿರಾಸ್‌ಗೆ ಪರಿವರ್ತಿಸಿದಾಗ, ಎಲ್ಲಾ ಬೆಲೆಗಳು 100 ಬಾರಿ ಕುಸಿದವು. ಸ್ಕೀಮಾ ಮೌಲ್ಯೀಕರಣವು ಬ್ಯಾಚ್ ಅನ್ನು "ಶ್ರೇಣಿಯಿಂದ ಹೊರಗಿದೆ" ಎಂದು ತಿರಸ್ಕರಿಸಿತು ಮತ್ತು ಮಾದರಿಯು ದೋಷಪೂರಿತ ಡೇಟಾದೊಂದಿಗೆ ತರಬೇತಿ ಪಡೆದಿಲ್ಲ. ಪರಿಶೀಲನೆಯಿಲ್ಲದೆ, ತಪ್ಪಾದ ಮುನ್ಸೂಚನೆಗಳೊಂದಿಗೆ ಉತ್ಪಾದನೆಯಲ್ಲಿ ದೋಷವನ್ನು ಮಾತ್ರ ಗಮನಿಸಬಹುದು.

ಪ್ರಕರಣ 2 - ತಪ್ಪಾದ ಭರ್ತಿಯ ಪಕ್ಷಪಾತ. ಕ್ರೆಡಿಟ್ ಮಾದರಿಯಲ್ಲಿ, ಕಾಣೆಯಾದ ಆದಾಯದ ಮೌಲ್ಯಗಳನ್ನು ಸರಾಸರಿಯಿಂದ ತುಂಬಿಸಲಾಗುತ್ತದೆ. ಆದರೆ ಕಾಣೆಯಾದ ಆದಾಯಗಳು ಪ್ರಧಾನವಾಗಿ ಕಡಿಮೆ-ಆದಾಯದ ಗುಂಪಿನಲ್ಲಿದ್ದವು; ಈ ಗುಂಪನ್ನು ಕೃತಕವಾಗಿ "ಪುಷ್ಟೀಕರಿಸಿದ" ಸರಾಸರಿ, ಮತ್ತು ಮಾದರಿಯು ಅವರಿಗೆ ಅನ್ಯಾಯವಾಗಿ ಹೆಚ್ಚಿನ ಮಿತಿಯನ್ನು ನೀಡಿತು. ಮಧ್ಯದ + ಕಾಣೆಯಾದ ಫ್ಲ್ಯಾಗ್‌ನೊಂದಿಗೆ ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸಲಾಗಿದೆ.

ಪ್ರಕರಣ 3 - ತಾತ್ಕಾಲಿಕ ಸೋರಿಕೆ. ಬೇಡಿಕೆಯ ಮುನ್ಸೂಚನೆಯ ಮಾದರಿಯು ಪರೀಕ್ಷಾ ಸೆಟ್‌ನಲ್ಲಿ ಉತ್ತಮವಾಗಿ ಕಾಣುತ್ತದೆ (95% ನಿಖರತೆ) ಆದರೆ ಉತ್ಪಾದನೆಯಲ್ಲಿ ಕ್ರ್ಯಾಶ್ ಆಗಿದೆ. ಏಕೆ: ಯಾದೃಚ್ಛಿಕ ವಿಭಜನೆಯಿಂದಾಗಿ, ಮಾದರಿಯು ಭವಿಷ್ಯವನ್ನು ನೋಡಿದೆ. ತಾತ್ಕಾಲಿಕ ಬಿನ್ನಿಂಗ್‌ಗೆ ಬದಲಾಯಿಸುವುದರಿಂದ ಪರೀಕ್ಷಾ ನಿಖರತೆಯನ್ನು 78% ಗೆ ಇಳಿಸಲಾಯಿತು - ಆದರೆ ಅದು ನಿಜವಾದ ಕಾರ್ಯಕ್ಷಮತೆ ಮತ್ತು ಅದನ್ನು ಉತ್ಪಾದನೆಯಲ್ಲಿ ಇರಿಸಿತು.

ನಕಲು ಮಾಡಬಹುದಾದ ಟೆಂಪ್ಲೇಟ್‌ಗಳು

ಕೆಳಗಿನ ಡೇಟಾಸೆಟ್ ಅನ್ನು ಮೂರು ಸೆಟ್‌ಗಳಾಗಿ ವಿಭಜಿಸಿ: ತರಬೇತಿ/ಮೌಲ್ಯಮಾಪನ/ಪರೀಕ್ಷೆ. ನಿರ್ಬಂಧ: ಇದು ಸಮಯ ಸರಣಿಯಾಗಿದೆ; ತಾತ್ಕಾಲಿಕ ವಿಭಜನೆಯನ್ನು ಬಳಸಿ (ಹಿಂದೆ ರೈಲು, ಭವಿಷ್ಯದಲ್ಲಿ ಪರೀಕ್ಷೆ). ಬ್ಯಾಚ್ ಸೋರಿಕೆಯನ್ನು ತಡೆಯಿರಿ: ಒಂದೇ ಕ್ಲಸ್ಟರ್‌ನಲ್ಲಿ ಮಾತ್ರ ಅದೇ `ಗ್ರಾಹಕ_ಐಡಿ` ಅನ್ನು ಹೊಂದಿರಿ. ತರಬೇತಿ ಸೆಟ್‌ನಿಂದ ಮಾತ್ರ ಸ್ಕೇಲಿಂಗ್ ನಿಯತಾಂಕಗಳನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡಿ, ನಂತರ ಎಲ್ಲರಿಗೂ ಅನ್ವಯಿಸಿ. ಪ್ರತಿ ಹಂತದಲ್ಲಿ ಕೋಡ್‌ನಲ್ಲಿ ಎಷ್ಟು ಸಾಲುಗಳು ಉಳಿದಿವೆ ಎಂಬುದನ್ನು ಮುದ್ರಿಸಿ ಮತ್ತು ಯಾವುದೇ ಸೋರಿಕೆಯನ್ನು ಪರಿಶೀಲಿಸುವ ಪ್ರತಿಪಾದನೆಯನ್ನು ಸೇರಿಸಿ.

ಈ ಲೇಬಲಿಂಗ್ ಕಾರ್ಯಕ್ಕಾಗಿ ಕರಡು ಟಿಪ್ಪಣಿ ಮಾರ್ಗಸೂಚಿಯನ್ನು ಬರೆಯಿರಿ. ಕಾರ್ಯ: [ಉದಾ. ಗ್ರಾಹಕರ ವಿಮರ್ಶೆ ಧನಾತ್ಮಕ/ಋಣಾತ್ಮಕ/ತಟಸ್ಥ ಎಂದು ಲೇಬಲ್ ಮಾಡಿ]ಬಾರ್ಡರ್‌ಲೈನ್ ಪ್ರಕರಣಗಳನ್ನು ಸ್ಪಷ್ಟಪಡಿಸಿ: ವ್ಯಂಗ್ಯ, ಮಿಶ್ರ ಭಾವನೆ, ಉತ್ಪನ್ನಕ್ಕೆ ಸಂಬಂಧಿಸದ ವಿಮರ್ಶೆಯನ್ನು ಲೇಬಲ್ ಮಾಡುವುದು ಹೇಗೆ? ಟ್ಯಾಗರ್‌ಗಳಾದ್ಯಂತ ಸ್ಥಿರತೆಯನ್ನು ಹೆಚ್ಚಿಸುವ 5 ಉದಾಹರಣೆಗಳು ಮತ್ತು 3 ಕಷ್ಟಕರವಾದ ಪ್ರಕರಣಗಳನ್ನು ನೀಡಿ.

ಈ ಡೇಟಾ ಪೈಪ್‌ಲೈನ್‌ಗಾಗಿ ಪುನರುತ್ಪಾದನೆ ಪರಿಶೀಲನಾ ಪಟ್ಟಿಯನ್ನು ತಯಾರಿಸಿ:- ಡೇಟಾ ಆವೃತ್ತಿಯನ್ನು ಹೇಗೆ ಸರಿಪಡಿಸಬೇಕು?- ಯಾವ ಯಾದೃಚ್ಛಿಕ ಬೀಜಗಳನ್ನು ಎಲ್ಲಿ ಹೊಂದಿಸಬೇಕು?- ಯಾವ ಮೆಟಾಡೇಟಾ (ಡೇಟಾ ಹ್ಯಾಶ್, ಸಾಲು ಎಣಿಕೆ, ದಿನಾಂಕ) ಲಾಗ್ ಮಾಡಬೇಕು? ನನ್ನ ಕೋಡ್‌ಬೇಸ್: [ಭಾಷೆ/ಲೈಬ್ರರಿ]

ಡೇಟಾ ಸೋರಿಕೆಗಾಗಿ ಈ ಕ್ಲೀನಪ್ ಕೋಡ್ ಅನ್ನು ಪರಿಶೀಲಿಸಿ. ನಿರ್ದಿಷ್ಟವಾಗಿ ಇದನ್ನು ನೋಡಿ: ಸ್ಕೇಲಿಂಗ್/ಎನ್‌ಕೋಡಿಂಗ್ ಪ್ಯಾರಾಮೀಟರ್‌ಗಳನ್ನು ವಿಭಜಿಸುವ ಮೊದಲು ಲೆಕ್ಕ ಹಾಕಲಾಗಿದೆಯೇ? ಎಲ್ಲಾ ಡೇಟಾ ಅಥವಾ ಕೇವಲ ತರಬೇತಿಯಿಂದ ಯಾವುದೇ ಅಂಕಿಅಂಶಗಳನ್ನು ಲೆಕ್ಕಹಾಕಲಾಗಿದೆಯೇ? ಕೋಡ್: [ಕೋಡ್]

ನಿರ್ಧಾರ ಕೋಷ್ಟಕ: ಕಾಣೆಯಾದ ಮೌಲ್ಯ ತಂತ್ರ

ಸ್ಥಿತಿ

ಶಿಫಾರಸು ವಿಧಾನ

ಏಕೆ

ಸಂಖ್ಯಾತ್ಮಕ, ಓರೆಯಾದ ವಿತರಣೆ

ಮಧ್ಯಮದಿಂದ ತುಂಬಿಸಿ

ಸರಾಸರಿಯು ಹೊರಗಿನವರಿಂದ ಪ್ರಭಾವಿತವಾಗಿರುತ್ತದೆ

ಸಂಖ್ಯಾತ್ಮಕ, ಸಮ್ಮಿತೀಯ

ಸರಾಸರಿ ತುಂಬಿಸಿ

ಮಾಹಿತಿಯನ್ನು ರಕ್ಷಿಸುತ್ತದೆ

ಕೊರತೆಯು ಗಮನಾರ್ಹವಾಗಿರಬಹುದು

ಫ್ಲ್ಯಾಗ್ ಕಾಲಮ್ + ಭರ್ತಿ ಮಾಡಿ

ಕೊರತೆ ಒಂದು ಸಂಕೇತವಾಗಿದೆ

ಕಾಣೆಯಾದ ದರ > 60%

ಕಾಲಮ್ ಅನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿ/ ತಿರಸ್ಕರಿಸಿ

ಸದ್ದು ತುಂಬಾ ಇದೆ

ವರ್ಗೀಯ

"ಅಜ್ಞಾತ" ವರ್ಗ

ಕೃತಕ ಬಹುಮತವನ್ನು ಸೃಷ್ಟಿಸುವುದಿಲ್ಲ

ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು

  • ಪರಿಶೀಲನೆಯನ್ನು ಬಿಟ್ಟುಬಿಡಲಾಗುತ್ತಿದೆ. ಸ್ಕೀಮಾ ನಿಯಂತ್ರಣವಿಲ್ಲದೆ, ಭ್ರಷ್ಟ ಡೇಟಾ ಮೌನವಾಗಿ ನುಸುಳುತ್ತದೆ.
  • ವಿಭಜಿಸುವ ಮೊದಲು ಸ್ಕೇಲಿಂಗ್. ಇದು ಶಿಕ್ಷಣಕ್ಕೆ ಪರೀಕ್ಷಾ ಅಂಕಿಅಂಶಗಳನ್ನು ಸೋರಿಕೆ ಮಾಡುತ್ತದೆ.
  • ಸಮಯ ಸರಣಿಯಲ್ಲಿ ಯಾದೃಚ್ಛಿಕ ವಿಭಜನೆಯನ್ನು ಬಳಸುವುದು. ಇದು ನಕಲಿ ಹೆಚ್ಚಿನ ಮೆಟ್ರಿಕ್‌ಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ.
  • LLM ಲೇಬಲ್‌ಗಳನ್ನು ಕುರುಡಾಗಿ ನಂಬುವುದು. ವ್ಯವಸ್ಥಿತ ದೋಷವು ಡೇಟಾದಾದ್ಯಂತ ಹರಡುತ್ತದೆ.
  • ಡೇಟಾ ಆವೃತ್ತಿಯನ್ನು ಉಳಿಸುತ್ತಿಲ್ಲ. ನೀವು ಫಲಿತಾಂಶವನ್ನು ಪುನರುತ್ಪಾದಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ.
  • ಸರಾಸರಿಯೊಂದಿಗೆ ಯಾಂತ್ರಿಕ ಭರ್ತಿ. ಇದು ಕ್ಷೇತ್ರದ ಅರ್ಥವನ್ನು ನಿರ್ಲಕ್ಷಿಸುತ್ತದೆ, ಪಕ್ಷಪಾತವನ್ನು ಸೇರಿಸುತ್ತದೆ.

ಸಾರಾಂಶದಲ್ಲಿ

ಡೇಟಾ ಪೈಪ್ಲೈನ್ ​​ಎಂಎಲ್ ಸಿಸ್ಟಮ್ನ ಅಡಿಪಾಯವಾಗಿದೆ ಮತ್ತು ಮಾದರಿಗಿಂತ ಹೆಚ್ಚಿನ ಪ್ರಯತ್ನಕ್ಕೆ ಅರ್ಹವಾಗಿದೆ. ಮೇಲ್ಭಾಗದಲ್ಲಿ ಪರಿಶೀಲನೆಯನ್ನು ಇರಿಸಿ; ಡೊಮೇನ್ ಜ್ಞಾನದೊಂದಿಗೆ ಸ್ವಚ್ಛಗೊಳಿಸುವ ಮತ್ತು ಲೇಬಲ್ ಮಾಡುವ ನಿರ್ಧಾರಗಳನ್ನು ಮಾಡಿ; ವಿಭಾಗದಲ್ಲಿ ಸೋರಿಕೆ (ಗುಂಪು ಮತ್ತು ತಾತ್ಕಾಲಿಕ) ತಡೆಯಿರಿ; ಡೇಟಾ ಆವೃತ್ತಿ ಮತ್ತು ಬೀಜವನ್ನು ಸರಿಪಡಿಸಿ. AI ಈ ಸಾಲಿನಲ್ಲಿ ಕೋಡ್ ಮತ್ತು ಕಲ್ಪನೆಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ, ಆದರೆ ಯಾವ ಡೇಟಾವನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಬೇಕು ಮತ್ತು ಹೇಗೆ ಎಂದು ನಿರ್ಧರಿಸುವುದು ನಿಮಗೆ ಬಿಟ್ಟದ್ದು - ಏಕೆಂದರೆ ಇಲ್ಲಿ ಪ್ರತಿಯೊಂದು ತಪ್ಪು ನಿರ್ಧಾರವು ಒಂದು ಗುಪ್ತ ದೋಷವಾಗಿ ಮಾದರಿಗೆ ಹಾದುಹೋಗುತ್ತದೆ.

ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ

ನಿಮ್ಮ ಸ್ವಂತ ಡೇಟಾಸೆಟ್‌ನಲ್ಲಿ ಊರ್ಜಿತಗೊಳಿಸುವಿಕೆಯ ಯೋಜನೆಯನ್ನು (ಪಂಡೇರಾ/ಗ್ರೇಟ್ ಎಕ್ಸ್‌ಪೆಕ್ಟೇಶನ್ಸ್) ಬರೆಯಿರಿ ಮತ್ತು ಉದ್ದೇಶಪೂರ್ವಕವಾಗಿ ಕೆಟ್ಟ ಸಾಲನ್ನು ಸೇರಿಸಿ ಮತ್ತು ಅದು ಸಿಕ್ಕಿಬಿದ್ದಿದೆ ಎಂದು ತೋರಿಸಿ. ನಂತರ ಡೇಟಾವನ್ನು ತಾತ್ಕಾಲಿಕವಾಗಿ ಅಥವಾ ಬ್ಯಾಚ್‌ವೈಸ್‌ನಲ್ಲಿ ವಿಭಜಿಸಿ, ತರಬೇತಿಯಿಂದ ಮಾತ್ರ ಸ್ಕೇಲಿಂಗ್ ನಿಯತಾಂಕಗಳನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡಿ ಮತ್ತು ಪ್ರತಿಪಾದನೆಯೊಂದಿಗೆ ಯಾವುದೇ ಸೋರಿಕೆ ಇಲ್ಲ ಎಂದು ಪರಿಶೀಲಿಸಿ. ಡೇಟಾ ಆವೃತ್ತಿ ಮತ್ತು ಸಾಲು ಎಣಿಕೆಯನ್ನು ಮೆಟಾಡೇಟಾ ಫೈಲ್‌ಗೆ ಬರೆಯಿರಿ.

ಪರಿಶೀಲನಾಪಟ್ಟಿ

  • ಸ್ಕೀಮಾ ಮೌಲ್ಯೀಕರಣವು ಸಾಲಿನ ಮೇಲ್ಭಾಗದಲ್ಲಿ ಸಾಗುತ್ತದೆ.
  • [ ] ನಾನು ಕ್ಷೇತ್ರದ ಅರ್ಥವನ್ನು ಆಧರಿಸಿ ಕಾಣೆಯಾದ ಮೌಲ್ಯ ತಂತ್ರವನ್ನು ಆಯ್ಕೆ ಮಾಡಿದ್ದೇನೆ, ನಾನು ಅದನ್ನು ಯಾಂತ್ರಿಕವಾಗಿ ತುಂಬಲಿಲ್ಲ.
  • [ ] ನಾನು ಲೇಬಲ್ ಗುಣಮಟ್ಟವನ್ನು (ಅನುಸರಣೆ) ಅಳತೆ ಮಾಡಿದ್ದೇನೆ; ನಾನು LLM ಟ್ಯಾಗ್‌ಗಳನ್ನು ಮಾನವ-ಪರಿಶೀಲಿಸಿದ್ದೇನೆ.
  • [ ] ನಾನು ಫಲಕದಲ್ಲಿ ಗುಂಪು ಮತ್ತು ತಾತ್ಕಾಲಿಕ ಸೋರಿಕೆಯನ್ನು ತಡೆಗಟ್ಟಿದೆ.
  • [ ] ಸ್ಕೇಲಿಂಗ್/ಎನ್‌ಕೋಡಿಂಗ್ ಅನ್ನು ತರಬೇತಿ ಸೆಟ್‌ನಿಂದ ಮಾತ್ರ ಲೆಕ್ಕಹಾಕಲಾಗುತ್ತದೆ.
  • [ ] ಡೇಟಾ ಆವೃತ್ತಿ, ಸಾಲುಗಳ ಸಂಖ್ಯೆ ಮತ್ತು ಬೀಜವನ್ನು ದಾಖಲಿಸಲಾಗಿದೆ.