ಘಟಕಗಳು
1. ಎಂಎಲ್ ಎಂಜಿನಿಯರಿಂಗ್‌ನಲ್ಲಿ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆ: ಪಾತ್ರ, ಗಡಿಗಳು, ಮೌಲ್ಯೀಕರಣ ಮತ್ತು ಜವಾಬ್ದಾರಿ 2. ಡೇಟಾ ಪೈಪ್‌ಲೈನ್: ಸಂಗ್ರಹಣೆ, ಶುದ್ಧೀಕರಣ, ಟ್ಯಾಗಿಂಗ್ ಮತ್ತು ಆವೃತ್ತಿ 3. ಮಾದರಿ ತರಬೇತಿ ಮತ್ತು ಮೌಲ್ಯಮಾಪನ: ನಿಖರವಾದ ಮೆಟ್ರಿಕ್ಸ್, ಪ್ರಾಮಾಣಿಕ ಬೆಂಚ್ಮಾರ್ಕಿಂಗ್ 4. LLM ಅಪ್ಲಿಕೇಶನ್: RAG ನೊಂದಿಗೆ ನಿಮ್ಮ ಸ್ವಂತ ಡೇಟಾವನ್ನು ಆಧರಿಸಿ ಉತ್ತರಗಳು 5. LLM ಅಪ್ಲಿಕೇಶನ್: ಏಜೆಂಟ್, ಟೂಲಿಂಗ್ ಮತ್ತು ಸೆಕ್ಯೂರ್ ಆಟೊಮೇಷನ್ 6. ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಆಧಾರ: ಯಾವಾಗ, ಹೇಗೆ ಮತ್ತು ಯಾವ ಅಪಾಯದೊಂದಿಗೆ 7. MLOps ಮತ್ತು ನಿಯೋಜನೆ: ಮಾದರಿಯನ್ನು ಲ್ಯಾಬ್‌ನಿಂದ ಉತ್ಪಾದನೆಗೆ ಸ್ಥಳಾಂತರಿಸುವುದು 8. ಇವಾಲ್ ಮತ್ತು ಮಾನಿಟರಿಂಗ್: ಉತ್ಪಾದನೆಯಲ್ಲಿ ಮಾದರಿಯು ನಿಜವಾಗಿಯೂ ಏನು ಮಾಡುತ್ತದೆ ಎಂಬುದನ್ನು ತಿಳಿದುಕೊಳ್ಳುವುದು 9. ಭದ್ರತೆ ಮತ್ತು ಗೌಪ್ಯತೆ: AI ವ್ಯವಸ್ಥೆಗಳನ್ನು ರಕ್ಷಿಸುವುದು 10. ಪಕ್ಷಪಾತ, ನೈತಿಕತೆ ಮತ್ತು ವೆಚ್ಚ: ಜವಾಬ್ದಾರಿಯುತ ಮತ್ತು ಸುಸ್ಥಿರ AI ಎಂಜಿನಿಯರಿಂಗ್ 11. ಪುನರುತ್ಪಾದನೆ ಮತ್ತು ಅಂತ್ಯದಿಂದ ಅಂತ್ಯದ ಯೋಜನೆ: ಎಲ್ಲವನ್ನೂ ಸಂಯೋಜಿಸುವುದು
ಘಟಕ 8 / 11

ಇವಾಲ್ ಮತ್ತು ಮಾನಿಟರಿಂಗ್: ಉತ್ಪಾದನೆಯಲ್ಲಿ ಮಾದರಿಯು ನಿಜವಾಗಿಯೂ ಏನು ಮಾಡುತ್ತದೆ ಎಂಬುದನ್ನು ತಿಳಿದುಕೊಳ್ಳುವುದು

ಲಾಭಗಳು:

  • ಮಾದರಿಯ ಅವನತಿಗೆ ಮೂಕ ಕಾರಣಗಳನ್ನು ಗುರುತಿಸುವ ಸಾಮರ್ಥ್ಯ (ಡೇಟಾ ಡ್ರಿಫ್ಟ್, ಕಾನ್ಸೆಪ್ಟ್ ಡ್ರಿಫ್ಟ್, ಅಪ್‌ಸ್ಟ್ರೀಮ್ ದೋಷ) ಮತ್ತು ಮೂರು-ಪದರದ (ಕಾರ್ಯಾಚರಣೆ, ಇನ್‌ಪುಟ್, ಔಟ್‌ಪುಟ್) ಮೇಲ್ವಿಚಾರಣೆಯನ್ನು ಸ್ಥಾಪಿಸುವುದು
  • ನಿಯಮ ಪರಿಶೀಲನೆಗಳು, LLM-ರೆಫರಿ ಮತ್ತು ಮಾನವ ಮೌಲ್ಯಮಾಪನದೊಂದಿಗೆ ಬಹು ಪದರಗಳಲ್ಲಿ LLM ಸಿಸ್ಟಮ್‌ಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವ ಸಾಮರ್ಥ್ಯ ಮತ್ತು LLM-ರೆಫರಿ ಹ್ಯೂಮನ್ ಆಂಕರ್‌ನೊಂದಿಗೆ ಮಾಪನಾಂಕ ನಿರ್ಣಯಿಸುವ ಸಾಮರ್ಥ್ಯ
  • ಎಡ್ಜ್ ಮತ್ತು ಸೆಕ್ಯುರಿಟಿ ಕೇಸ್‌ಗಳನ್ನು ಹೊಂದಿರುವ ಇವಾಲ್ ಸೆಟ್ ಅನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸುವ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ಪ್ರತಿ ಕ್ಯಾಚ್ ದೋಷವನ್ನು ಶಾಶ್ವತ ಪರೀಕ್ಷಾ ಪ್ರಕರಣವಾಗಿ ಪರಿವರ್ತಿಸುವ ಸಾಮರ್ಥ್ಯ

ಒಂದು ಮಾದರಿಯು ಉತ್ಪಾದನೆಗೆ ಹೋದ ನಂತರ, ನಿಮ್ಮ ಕೆಲಸವು ಮುಗಿದಿಲ್ಲ; ನಿಜವಾದ ಜವಾಬ್ದಾರಿ ಪ್ರಾರಂಭವಾಗುತ್ತದೆ. ಏಕೆಂದರೆ ಯಾರೂ ನೋಡದಿದ್ದಾಗ ಮಾದರಿಯು ಮೌನವಾಗಿ ಮುರಿಯಬಹುದು. ಈ ಘಟಕದಲ್ಲಿ, ನಾವು ಎರಡು ಪೂರಕ ವಿಭಾಗಗಳನ್ನು ಒಳಗೊಳ್ಳುತ್ತೇವೆ: ಮೌಲ್ಯಮಾಪನ (ಮಾದರಿಯ ಗುಣಮಟ್ಟವನ್ನು ವ್ಯವಸ್ಥಿತವಾಗಿ ಅಳೆಯುವುದು) ಮತ್ತು ಮೇಲ್ವಿಚಾರಣೆ (ಉತ್ಪಾದನೆಯಲ್ಲಿ ಮಾದರಿಯ ನಿರಂತರ ಮೇಲ್ವಿಚಾರಣೆ). ವಿಶೇಷವಾಗಿ LLM ವ್ಯವಸ್ಥೆಗಳಲ್ಲಿ, eval ಹೆಚ್ಚು ಕಷ್ಟಕರವಾಗಿದೆ ಮತ್ತು ಶಾಸ್ತ್ರೀಯ ML ಗಿಂತ ಹೆಚ್ಚಿನ ಕಾಳಜಿಯ ಅಗತ್ಯವಿರುತ್ತದೆ.

ಉತ್ಪಾದನಾ ಮಾದರಿ ಏಕೆ ಸದ್ದಿಲ್ಲದೆ ಒಡೆಯುತ್ತಿದೆ

ಬಗ್ ಕ್ರ್ಯಾಶ್ ಆಗುತ್ತದೆ, ಲಾಗ್ ಪ್ರಿಂಟ್ ಆಗುತ್ತದೆ, ಅಲಾರಾಂ ಆಫ್ ಆಗುತ್ತದೆ. ಮತ್ತೊಂದೆಡೆ, ML ಮಾದರಿಯು ದೋಷಗಳನ್ನು ಉಂಟುಮಾಡದೆ ತಪ್ಪಾಗಿರಬಹುದು. ಅವನತಿಗೆ ಮೂರು ಮುಖ್ಯ ಕಾರಣಗಳು:

  • ಡೇಟಾ ಡ್ರಿಫ್ಟ್: ಇನ್‌ಪುಟ್ ಡೇಟಾದ ವಿತರಣೆಯು ಕಾಲಾನಂತರದಲ್ಲಿ ಬದಲಾಗುತ್ತದೆ (ಹೊಸ ಉತ್ಪನ್ನಗಳು, ಬದಲಾಗುತ್ತಿರುವ ಬಳಕೆದಾರರ ನಡವಳಿಕೆ, ಕಾಲೋಚಿತತೆ). ಮಾದರಿಯು ಒಂದೇ ಆಗಿರುತ್ತದೆ ಆದರೆ ಪ್ರಪಂಚವು ಬದಲಾಗುತ್ತದೆ.
  • ಕಾನ್ಸೆಪ್ಟ್ ಡ್ರಿಫ್ಟ್: ಇನ್‌ಪುಟ್-ಔಟ್‌ಪುಟ್ ಸಂಬಂಧ ಬದಲಾಗುತ್ತದೆ. ವಂಚನೆ ತಂತ್ರಗಳು ಮತ್ತು ಸ್ಪ್ಯಾಮ್ ಮಾದರಿಗಳು ವಿಕಸನಗೊಳ್ಳುತ್ತವೆ; ನಿನ್ನೆ ಸರಿ ಇದ್ದದ್ದು ಇಂದು ತಪ್ಪಾಗುತ್ತದೆ.
  • ಅಪ್‌ಸ್ಟ್ರೀಮ್ ಭ್ರಷ್ಟಾಚಾರ: ಡೇಟಾ ಮೂಲವು ಸ್ವರೂಪವನ್ನು ಬದಲಾಯಿಸುತ್ತದೆ, ಪ್ರದೇಶವು ಮುಕ್ತವಾಗುತ್ತದೆ; ದೋಷಪೂರಿತ ಇನ್‌ಪುಟ್‌ನೊಂದಿಗೆ ಮಾಡೆಲ್ ಮೌನವಾಗಿ ಜೊಲ್ಲು ಸುರಿಸುತ್ತದೆ.

ಟ್ರೇಸಿಂಗ್ ಈ ಮೂಕ ವಿರೂಪಗಳನ್ನು ಕೇಳುವಂತೆ ಮಾಡುತ್ತಿದೆ.

ಏನು ವೀಕ್ಷಿಸಲು: ಮೂರು ಪದರಗಳು

ಉತ್ತಮ ಮೇಲ್ವಿಚಾರಣೆ ಮೂರು ಪದರಗಳನ್ನು ಒಳಗೊಂಡಿದೆ:

  1. ಕಾರ್ಯಾಚರಣೆಯ ಮೆಟ್ರಿಕ್‌ಗಳು: ಸುಪ್ತತೆ, ದೋಷ ದರ, ವಿನಂತಿಯ ಪರಿಮಾಣ, ಸಂಪನ್ಮೂಲ ಬಳಕೆ. "ವ್ಯವಸ್ಥೆಯು ನಿಂತಿದೆಯೇ?"
  2. ಡೇಟಾ/ಇನ್‌ಪುಟ್ ಮೆಟ್ರಿಕ್‌ಗಳು: ಇನ್‌ಪುಟ್ ವಿತರಣೆಯು ತರಬೇತಿಯಲ್ಲಿರುವಂತೆಯೇ ಇದೆಯೇ? ಕಾಣೆಯಾದ ಮೌಲ್ಯದ ದರ ಹೆಚ್ಚಾಗಿದೆಯೇ? ಹೊಸ ವಿಭಾಗಗಳು ಬಂದಿವೆಯೇ? "ಮಾಡೆಲ್ ಪರಿಚಿತ ಡೇಟಾವನ್ನು ನೋಡುತ್ತಿದೆಯೇ?"
  3. ಮಾದರಿ/ಔಟ್‌ಪುಟ್ ಮೆಟ್ರಿಕ್‌ಗಳು: ಮುನ್ಸೂಚನೆ ವಿತರಣೆ ಲಾಗ್? ಆತ್ಮವಿಶ್ವಾಸದ ಅಂಕಗಳು ಕುಸಿದಿವೆಯೇ? ಮತ್ತು ಸಾಧ್ಯವಾದರೆ, ನೆಲದ ಸತ್ಯಕ್ಕೆ ಹೋಲಿಸಿದರೆ ನಿಖರತೆ ಏನು? "ಮಾದರಿ ಇನ್ನೂ ನಿಖರವಾಗಿದೆಯೇ?"

ಮೂರನೆಯ ಪದರವು ಅತ್ಯಂತ ಮೌಲ್ಯಯುತವಾಗಿದೆ ಆದರೆ ಅತ್ಯಂತ ಕಷ್ಟಕರವಾಗಿದೆ; ಏಕೆಂದರೆ ನೈಜ ಫಲಿತಾಂಶವು ಸಾಮಾನ್ಯವಾಗಿ ವಿಳಂಬದೊಂದಿಗೆ ಬರುತ್ತದೆ (ಸಾಲವನ್ನು ಮರುಪಾವತಿಸಲಾಗುತ್ತದೆಯೇ ಅಥವಾ ಇಲ್ಲವೇ ಎಂಬುದು ತಿಂಗಳ ನಂತರ ಸ್ಪಷ್ಟವಾಗುತ್ತದೆ).

ಸಲಹೆ: ನಿಜವಾದ ಫಲಿತಾಂಶವು ವಿಳಂಬವಾಗಿದ್ದರೆ, ಮೊದಲು ಇನ್‌ಪುಟ್ ಮತ್ತು ಮುನ್ಸೂಚನೆಯ ವಿತರಣೆಯನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡಿ. ಇನ್‌ಪುಟ್ ವಿತರಣೆಯ ಶಿಫ್ಟ್ ನಿಖರತೆಯ ಅವನತಿಯ ಆರಂಭಿಕ ಸಂಕೇತವಾಗಿದೆ ಮತ್ತು ನಿಜವಾದ ಫಲಿತಾಂಶಕ್ಕಾಗಿ ಕಾಯದೆ ಎಚ್ಚರಿಕೆಯನ್ನು ಮೂಡಿಸಬಹುದು.

LLM ವ್ಯವಸ್ಥೆಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವುದು: ವಿಶೇಷ ಸವಾಲು

ಶಾಸ್ತ್ರೀಯ ML ನಲ್ಲಿ, "ಸರಿಯಾದ ಉತ್ತರ" ಸ್ಪಷ್ಟವಾಗಿದೆ (ವರ್ಗ 0 ಅಥವಾ 1). ಮತ್ತೊಂದೆಡೆ, LLM ಫಲಿತಾಂಶವು ಮುಕ್ತವಾಗಿದೆ: ಒಂದೇ ಪ್ರಶ್ನೆಗೆ ಅನೇಕ ಸರಿಯಾದ ಉತ್ತರಗಳು ಇರಬಹುದು, "ಸರಿಯಾದತೆ" ಒಂದೇ ಸಂಖ್ಯೆಗೆ ಹೊಂದಿಕೆಯಾಗುವುದಿಲ್ಲ. LLM eval ವಿಧಾನಗಳು:

  • ಉಲ್ಲೇಖಿತ ಮೆಟ್ರಿಕ್‌ಗಳು: ಔಟ್‌ಪುಟ್ ಅನ್ನು ಆದರ್ಶ ಉತ್ತರಕ್ಕೆ ಹೋಲಿಸುವುದು. ಸೀಮಿತ; ಏಕೆಂದರೆ ಅದು ವಿಭಿನ್ನವಾಗಿ ವ್ಯಕ್ತಪಡಿಸಿದ ಸರಿಯಾದ ಉತ್ತರವನ್ನು "ತಪ್ಪು" ಎಂದು ಪರಿಗಣಿಸಬಹುದು.
  • ನಿಯಮಾಧಾರಿತ ಪರಿಶೀಲನೆಗಳು: ಔಟ್‌ಪುಟ್ ಮಾನ್ಯ JSON ಆಗಿದೆಯೇ? ಯಾವುದೇ ನಿಷೇಧಿತ ಪದಗಳಿವೆಯೇ? ಇದು ಬಯಸಿದ ಕ್ಷೇತ್ರಗಳನ್ನು ಹೊಂದಿದೆಯೇ? ಅಗ್ಗದ, ವಿಶ್ವಾಸಾರ್ಹ, ಬಿಗಿಯಾದ.
  • LLM-ನ್ಯಾಯಾಧೀಶರು (LLM-ನ್ಯಾಯಾಧೀಶರು): "ಈ ಮಾನದಂಡದ ಪ್ರಕಾರ ಈ ಉತ್ತರವು ಉತ್ತಮವಾಗಿದೆಯೇ?" ಎಂದು ಮಾದರಿ ಕೇಳುವಂತೆ ಮಾಡಬೇಡಿ. ಇದು ಮಾಪಕಗಳು, ಆದರೆ ರೆಫರಿ ಸ್ವತಃ ಪರಿಶೀಲಿಸಬೇಕು.
  • ಮಾನವ ವಿಮರ್ಶೆ: ಚಿನ್ನದ ಗುಣಮಟ್ಟ ಆದರೆ ದುಬಾರಿ ಮತ್ತು ನಿಧಾನ. ಇದನ್ನು ಮಾದರಿಯಲ್ಲಿ ಬಳಸಲಾಗುತ್ತದೆ.

ಆಚರಣೆಯಲ್ಲಿ ಇವುಗಳನ್ನು ಒಟ್ಟಿಗೆ ಬಳಸಲಾಗುತ್ತದೆ: ಪ್ರತಿ ಔಟ್‌ಪುಟ್‌ನಲ್ಲಿ ಅಗ್ಗದ ನಿಯಮ ಪರಿಶೀಲನೆಗಳು, ದೊಡ್ಡ ಮಾದರಿಯಲ್ಲಿ LLM-ನ್ಯಾಯಾಧೀಶರು, ಸಣ್ಣ ಆದರೆ ಕಠಿಣ ಮಾದರಿಯಲ್ಲಿ ಮಾನವ ಮೌಲ್ಯಮಾಪನ.

ದುರ್ಬಲ ವಿಧಾನ / ಬಲವಾದ ವಿಧಾನ

ದುರ್ಬಲ: "LLM-ನಾನು ರೆಫರಿಯನ್ನು ಕೇಳಿದೆ, ನಮ್ಮ 92% ಉತ್ತರಗಳು ಉತ್ತಮವಾಗಿವೆ. ಸಿಸ್ಟಮ್ ಅದ್ಭುತವಾಗಿದೆ."

Güçlü: "ನಾವು ಮೊದಲು 100 ಪ್ರಿಂಟ್‌ಔಟ್‌ಗಳನ್ನು ಮಾನವ-ಲೇಬಲ್ ಮಾಡಿದ್ದೇವೆ. ನಾವು ಅದೇ 100 ಪ್ರಿಂಟ್‌ಔಟ್‌ಗಳ ಮೇಲೆ LLM-ನ್ಯಾಯಾಧೀಶರನ್ನು ಓಡಿಸಿದ್ದೇವೆ ಮತ್ತು ಮಾನವ-ನ್ಯಾಯಾಧೀಶರ ಒಪ್ಪಂದವನ್ನು ಅಳತೆ ಮಾಡಿದ್ದೇವೆ - 85% ಒಪ್ಪಂದ, ಸ್ವೀಕಾರಾರ್ಹ. ನ್ಯಾಯಾಧೀಶರು ವ್ಯವಸ್ಥಿತವಾಗಿ ಎಲ್ಲಿ ತಪ್ಪಾಗಿದೆ ಎಂಬುದನ್ನು ನಾವು ದಾಖಲಿಸಿದ್ದೇವೆ (ದೀರ್ಘ ಉತ್ತರಗಳನ್ನು ಅನ್ಯಾಯವಾಗಿ ಹುಡುಕುವ ಪ್ರವೃತ್ತಿ) ಮತ್ತು ನ್ಯಾಯಾಧೀಶರು ಅವರ ಸ್ಕೋರ್ ಅನ್ನು ನಂಬಿದ್ದೇವೆ."

ವ್ಯತ್ಯಾಸ: ಬಲವಾದ ವಿಧಾನವು ರೆಫರಿಯನ್ನು ಮಾನವ ಆಂಕರ್‌ನೊಂದಿಗೆ ಪರಿಶೀಲಿಸುತ್ತದೆ, ಕುರುಡಾಗಿ ಅಲ್ಲ. ಪರಿಶೀಲಿಸದ LLM-ರೆಫರಿಯು ಸುಂದರವಾಗಿ ಕಾಣುವ ಆದರೆ ತಪ್ಪು ವಿಶ್ವಾಸವನ್ನು ನೀಡುತ್ತದೆ.

ಗಮನ: LLM- ರೆಫರಿ ಕೂಡ ಒಂದು ಮಾದರಿ; ಭ್ರಾಮಕ, ಪಕ್ಷಪಾತ (ದೀರ್ಘ/ಆತ್ಮವಿಶ್ವಾಸದ ಉತ್ತರಗಳನ್ನು ಬೆಂಬಲಿಸುತ್ತದೆ), ಅಸಮಂಜಸವಾಗಿರಬಹುದು. ಉತ್ಪಾದನಾ ನಿರ್ಧಾರಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳುವ ಮೊದಲು ಮಾನವ ಟ್ಯಾಗ್‌ಗಳೊಂದಿಗೆ ರೆಫರಿ ಸ್ಕೋರ್‌ಗಳನ್ನು ಮಾಪನಾಂಕ ಮಾಡಿ.

ಮೌಲ್ಯಮಾಪನ ಸೆಟ್: ಎಚ್ಚರಿಕೆಯಿಂದ ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿದೆ

ಉತ್ತಮ ಇವಾಲ್ ಸೆಟ್ ವಿವಿಧ ನೈಜ ಬಳಕೆ ಮತ್ತು ಕಷ್ಟಕರ ಸಂದರ್ಭಗಳನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆ. ಕೇವಲ ಸುಲಭವಾದ ಉದಾಹರಣೆಗಳಿಂದ ತುಂಬಿದ ಎವಾಲ್ ನಿಮ್ಮನ್ನು ತಪ್ಪು ವಿಶ್ವಾಸದಲ್ಲಿ ಬಿಡುತ್ತದೆ. ಇವಾಲ್ ಕ್ಲಸ್ಟರ್‌ನಲ್ಲಿ ಹಾಕಲು ಮರೆಯದಿರಿ:

  • ಎಡ್ಜ್ ಪ್ರಕರಣಗಳು: ಖಾಲಿ ಇನ್‌ಪುಟ್, ಬಹಳ ದೀರ್ಘವಾದ ಇನ್‌ಪುಟ್, ಅಸಾಮಾನ್ಯ ಸ್ವರೂಪ.
  • ತಿಳಿದಿರುವ ಕಠಿಣ ಪ್ರಕರಣಗಳು: ಮಾದರಿಯು ಹಿಂದೆ ತಪ್ಪುಗಳನ್ನು ಮಾಡಿದ ಉದಾಹರಣೆಗಳು (ನಿವರ್ತನ ಪರೀಕ್ಷೆಯಾಗಿ).
  • ಭದ್ರತಾ ಘಟನೆಗಳು: ಪ್ರಾಂಪ್ಟ್ ಇಂಜೆಕ್ಷನ್ ಪ್ರಯತ್ನಗಳು, ದುರುದ್ದೇಶಪೂರಿತ ವಿನಂತಿಗಳು, ಗೌಪ್ಯತೆ ಉಲ್ಲಂಘನೆ ಬಲೆಗಳು.

ಇವಾಲ್ ಕ್ಲಸ್ಟರ್ ಕಾಲಾನಂತರದಲ್ಲಿ ಬೆಳೆಯುತ್ತದೆ: ಉತ್ಪಾದನೆಯಲ್ಲಿ ನೀವು ಹಿಡಿಯುವ ಪ್ರತಿಯೊಂದು ಹೊಸ ದೋಷವು ಮುಂದಿನ ಮೌಲ್ಯಮಾಪನಕ್ಕೆ ಪರೀಕ್ಷಾ ಪ್ರಕರಣವಾಗುತ್ತದೆ.

ಎಚ್ಚರಿಕೆ ಮತ್ತು ಹಸ್ತಕ್ಷೇಪ

ಅಲಾರಾಂ ಇಲ್ಲದೆ ಮಾನಿಟರಿಂಗ್ ಅಪೂರ್ಣವಾಗಿರುತ್ತದೆ. ಪ್ರತಿ ಪ್ರಮುಖ ಮೆಟ್ರಿಕ್‌ಗೆ ಮಿತಿ ಮತ್ತು ಪ್ರತಿಕ್ರಿಯೆ ಯೋಜನೆ ಇರಬೇಕು: "ಇನ್‌ಪುಟ್ ಡ್ರಿಫ್ಟ್ X ಅನ್ನು ಮೀರಿದರೆ ಇಂಜಿನಿಯರ್‌ಗೆ ಸೂಚಿಸಿ", "ದೋಷ ದರ Y ಅನ್ನು ಮೀರಿದರೆ ಸ್ವಯಂ ರೋಲ್ ಬ್ಯಾಕ್". ಅಲಾರಮ್‌ಗಳನ್ನು ಅರ್ಥಪೂರ್ಣವಾಗಿರಿಸಿಕೊಳ್ಳಿ - ಹಲವಾರು ತಪ್ಪು ಅಲಾರಮ್‌ಗಳು ತಂಡವನ್ನು ಸಂವೇದನಾಶೀಲಗೊಳಿಸುತ್ತವೆ ಮತ್ತು ನಿಜವಾದ ಎಚ್ಚರಿಕೆಯನ್ನು ಕಳೆದುಕೊಳ್ಳುವಂತೆ ಮಾಡುತ್ತದೆ.

ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು

ಪ್ರಕರಣ 1 - ಆರಂಭಿಕ ಎಚ್ಚರಿಕೆ. ಬೇಡಿಕೆಯ ಮುನ್ಸೂಚನೆಯ ಮಾದರಿಯ ನಿಜವಾದ ನಿಖರತೆಯು ವಾರದ ಕೊನೆಯಲ್ಲಿ ಮಾತ್ರ ಸ್ಪಷ್ಟವಾಯಿತು. ತಂಡವು ಇನ್‌ಪುಟ್ ವಿತರಣೆಯನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡುತ್ತಿದೆ ಮತ್ತು ಮಂಗಳವಾರದಂದು ಹೊಸ ಉತ್ಪನ್ನ ವರ್ಗದ ಹಠಾತ್ ಏರಿಕೆಯನ್ನು ಕಂಡಿತು - ಇದು ಮಾದರಿಯು ಎಂದಿಗೂ ನೋಡಿಲ್ಲ. ಅವರು ನಿಖರತೆಯ ಕುಸಿತಕ್ಕಾಗಿ ಕಾಯದೆ ಮಾದರಿಯನ್ನು ನವೀಕರಿಸಿದರು. ಇನ್‌ಪುಟ್ ಮಾನಿಟರಿಂಗ್ ಉಳಿಸಿದ ದಿನಗಳು.

ಪ್ರಕರಣ 2 - ಪರಿಶೀಲಿಸದ ರೆಫರಿ. LLM-ವಿಮರ್ಶಕನ ಆಧಾರದ ಮೇಲೆ "ನಮ್ಮ ಗುಣಮಟ್ಟ ಅತ್ಯುತ್ತಮವಾಗಿದೆ" ಎಂದು ಒಂದು ತಂಡ ವರದಿ ಮಾಡಿದೆ. ಗ್ರಾಹಕರ ದೂರುಗಳು ಹೆಚ್ಚಾದಾಗ, ಮಾನವ ಮೇಲ್ವಿಚಾರಣೆಯನ್ನು ಪರಿಚಯಿಸಲಾಯಿತು: ರೆಫರಿಯು ಆತ್ಮವಿಶ್ವಾಸ ಆದರೆ ತಪ್ಪಾದ ಉತ್ತರಗಳನ್ನು "ಒಳ್ಳೆಯದು" ಎಂದು ಎಣಿಸಿದರು. ರೆಫರಿಯನ್ನು ಮಾನವ ಟ್ಯಾಗ್‌ಗಳೊಂದಿಗೆ ಮಾಪನಾಂಕ ನಿರ್ಣಯಿಸಿದ ನಂತರ, ನಿಜವಾದ ಗುಣಮಟ್ಟವನ್ನು ಬಹಿರಂಗಪಡಿಸಲಾಯಿತು ಮತ್ತು ಅದು ತುಂಬಾ ಕಡಿಮೆಯಾಗಿದೆ. ಪಾಠ: ರೆಫರಿಯನ್ನು ಪರಿಶೀಲಿಸದೆ ನಂಬಬೇಡಿ.

ಪ್ರಕರಣ 3 - ಹಿಂಜರಿತ ಪರೀಕ್ಷೆ. ಪ್ರಾಂಪ್ಟ್ ಬದಲಾವಣೆಯು ಒಂದು ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸುತ್ತದೆ ಮತ್ತು ಮೌನವಾಗಿ ಇನ್ನೊಂದನ್ನು ಒಡೆಯುತ್ತದೆ. ಆದರೆ ತಂಡವು ಹಿಂದಿನ ದೋಷಗಳನ್ನು ಇವಾಲ್ ಬಕೆಟ್‌ನಲ್ಲಿ ಇರಿಸಿದೆ; ಈ ಕ್ಲಸ್ಟರ್‌ನಲ್ಲಿ ಹೊಸ ಬದಲಾವಣೆಯನ್ನು ಪರೀಕ್ಷಿಸಿದಾಗ, ಮುರಿದ ಪ್ರಕರಣವನ್ನು ತಕ್ಷಣವೇ ಹಿಡಿಯಲಾಯಿತು ಮತ್ತು ಬದಲಾವಣೆಯನ್ನು ಸರಿಪಡಿಸಲಾಯಿತು. ಪಾಠ: ಪ್ರತಿ ಸ್ಥಿರ ದೋಷವು ಶಾಶ್ವತ ಪರೀಕ್ಷಾ ಪ್ರಕರಣವಾಗಬೇಕು.

ನಕಲು ಮಾಡಬಹುದಾದ ಟೆಂಪ್ಲೇಟ್‌ಗಳು

ಈ ಉತ್ಪಾದನಾ ಮಾದರಿಗಾಗಿ ಟ್ರ್ಯಾಕಿಂಗ್ ಯೋಜನೆಯನ್ನು ತಯಾರಿಸಿ. ಮೂರು ಲೇಯರ್‌ಗಳನ್ನು ಕವರ್ ಮಾಡಿ:1) ಆಪರೇಷನಲ್ (ಲೇಟೆನ್ಸಿ, ಎರರ್ ರೇಟ್, ವಾಲ್ಯೂಮ್)2) ಇನ್‌ಪುಟ್/ಡೇಟಾ (ವಿತರಣೆ ಶಿಫ್ಟ್, ಕಾಣೆಯಾದ ಮೌಲ್ಯ, ಹೊಸ ವರ್ಗ)3) ಮಾದರಿ/ಔಟ್‌ಪುಟ್ (ಮುನ್ಸೂಚನೆ ವಿತರಣೆ, ವಿಶ್ವಾಸ, ಸಾಧ್ಯವಾದರೆ ನಿಖರತೆ)ಮಾದರಿ: [ವಿವರಣೆ]. ನಿಜವಾದ ಫಲಿತಾಂಶ ಬರಲು ಎಷ್ಟು ಸಮಯ ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ: [ಅವಧಿ] ಪ್ರತಿ ಮೆಟ್ರಿಕ್‌ಗೆ ಮಿತಿ ಮತ್ತು ಹಸ್ತಕ್ಷೇಪ ಶಿಫಾರಸು ಸೇರಿಸಿ.

ಈ LLM ವ್ಯವಸ್ಥೆಗೆ ಮೌಲ್ಯಮಾಪನ (eval) ಕಾರ್ಯತಂತ್ರವನ್ನು ಪ್ರಸ್ತಾಪಿಸಿ. ಕಾರ್ಯ: [ವಿವರಣೆ]ಪದರಗಳನ್ನು ನಿರ್ಧರಿಸಿ:- ಪ್ರತಿ ಔಟ್‌ಪುಟ್‌ನಲ್ಲಿ ಯಾವ ನಿಯಮ-ಆಧಾರಿತ ಚೆಕ್‌ಗಳು ರನ್ ಆಗಬೇಕು?- LLM-ಆರ್ಬಿಟ್ರೇಟರ್ ಯಾವ ಮಾನದಂಡವನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಬೇಕು ಮತ್ತು ಅವುಗಳನ್ನು ಹೇಗೆ ಮೌಲ್ಯೀಕರಿಸಬೇಕು (ಮಾನವ ಆಂಕರ್)?- ಯಾವ ಮಾದರಿಯಲ್ಲಿ ಮಾನವ ಮೌಲ್ಯಮಾಪನವನ್ನು ಹೊಂದಿಸಬೇಕು.

ಈ LLM-ರೆಫರಿ ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ಪರಿಶೀಲಿಸಿ:- ಮೌಲ್ಯಮಾಪನ ಮಾನದಂಡವು ಸ್ಪಷ್ಟವಾಗಿದೆಯೇ ಅಥವಾ ವ್ಯಕ್ತಿನಿಷ್ಠವಾಗಿದೆಯೇ?- ಇದು ಉದ್ದ/ವಿಶ್ವಾಸ ಪಕ್ಷಪಾತಕ್ಕೆ ಗುರಿಯಾಗಿದೆಯೇ?- ಮಾನವ ಟ್ಯಾಗ್‌ಗಳೊಂದಿಗೆ ನಾನು ರೆಫರಿಯನ್ನು ಮಾಪನಾಂಕ ಮಾಡುವುದು ಹೇಗೆ? ರೆಫರಿ ಪ್ರಾಂಪ್ಟ್: [ಪ್ರಾಂಪ್ಟ್]

ಈ ಮಾನಿಟರಿಂಗ್ ಅಲಾರಾಂಗಾಗಿ ಪ್ರತಿಕ್ರಿಯೆ ರನ್‌ಬುಕ್ ಅನ್ನು ಬರೆಯಿರಿ. ಅಲಾರ್ಮ್: [ಉದಾ. ಇನ್‌ಪುಟ್ ಡ್ರಿಫ್ಟ್ ಮಿತಿ ಮೀರಿದೆ] ಒಳಗೊಂಡಿರಬೇಕು: ಆರಂಭಿಕ ನಿಯಂತ್ರಣ ಹಂತಗಳು, ಸಂಭವನೀಯ ಕಾರಣಗಳು, ರೋಲ್‌ಬ್ಯಾಕ್ ಮಾನದಂಡಗಳು, ಯಾರಿಗೆ ತಿಳಿಸಬೇಕು.

ಕ್ಷೀಣತೆ ಕಾರಣ ಕೋಷ್ಟಕ

ಅಸ್ಪಷ್ಟತೆ

ಲಕ್ಷಣ

ಆರಂಭಿಕ ಪತ್ತೆಗೆ ಮಾರ್ಗ

ಡೇಟಾ ಡ್ರಿಫ್ಟ್

ಇನ್ಪುಟ್ ವಿತರಣೆ ಬದಲಾವಣೆಗಳು

ಇನ್ಪುಟ್ ವಿತರಣೆ ಮೇಲ್ವಿಚಾರಣೆ

ಪರಿಕಲ್ಪನೆಯ ಬದಲಾವಣೆ

ಸದಾಚಾರ ಮೌನವಾಗಿ ಬೀಳುತ್ತದೆ

ಭವಿಷ್ಯ + ನಿಜವಾದ ಹೋಲಿಕೆ

ಅಪ್ಸ್ಟ್ರೀಮ್ ದೋಷ

ಕ್ಷೇತ್ರಗಳು ಖಾಲಿಯಾಗುತ್ತವೆ/ಫಾರ್ಮ್ಯಾಟ್ ಬದಲಾವಣೆಗಳು

ಸ್ಕೀಮಾ ಮೌಲ್ಯೀಕರಣ + ಕಾಣೆಯಾದ ದರ

ಮಾದರಿ ಅಸಂಗತತೆ

ಔಟ್ಪುಟ್ ವಿತರಣೆಯ ಬದಲಾವಣೆಗಳು

ಔಟ್ಪುಟ್ ವಿತರಣೆಯ ಮೇಲ್ವಿಚಾರಣೆ

ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು

  • ಮೇಲ್ವಿಚಾರಣೆಯನ್ನು ಸ್ಥಾಪಿಸುತ್ತಿಲ್ಲ. ಮಾದರಿಯು ಮೌನವಾಗಿ ಒಡೆಯುತ್ತದೆ, ಯಾರೂ ಅದನ್ನು ನೋಡುವುದಿಲ್ಲ.
  • ಕಾರ್ಯಾಚರಣೆಯ ಮೆಟ್ರಿಕ್‌ಗಳನ್ನು ಮಾತ್ರ ಟ್ರ್ಯಾಕ್ ಮಾಡಿ. ಸಿಸ್ಟಮ್ ಅಪ್ ಆಗಿದೆ, ಆದರೆ ಭವಿಷ್ಯವಾಣಿಗಳು ತಪ್ಪಾಗಬಹುದು.
  • ರೆಫರಿಯನ್ನು ಪರಿಶೀಲಿಸದೆ LLM ಅನ್ನು ಬಳಸುವುದು. ಇದು ಸುಳ್ಳು ವಿಶ್ವಾಸವನ್ನು ನೀಡುತ್ತದೆ.
  • ಸುಲಭ ಉದಾಹರಣೆಗಳೊಂದಿಗೆ Eval. ಇದು ನಿಜವಾದ ತೊಂದರೆಯನ್ನು ಸೂಚಿಸುವುದಿಲ್ಲ.
  • eval ನಲ್ಲಿ ಹಿಂದಿನ ದೋಷಗಳನ್ನು ಒಳಗೊಂಡಿಲ್ಲ. ಅದೇ ದೋಷವು ಮತ್ತೆ ಮರಳುತ್ತದೆ.
  • ಜೋರಾದ ಎಚ್ಚರಿಕೆಗಳು. ತಂಡವು ಸಂವೇದನಾಶೀಲವಾಗುತ್ತದೆ, ನಿಜವಾದ ಎಚ್ಚರಿಕೆಯನ್ನು ಕಳೆದುಕೊಳ್ಳುತ್ತದೆ.

ಸಾರಾಂಶದಲ್ಲಿ

ಉತ್ಪಾದನೆಯಲ್ಲಿ ದೋಷಗಳನ್ನು ಉಂಟುಮಾಡದೆಯೇ ಮಾದರಿಯು ತಪ್ಪಾಗಿರಬಹುದು; ಆದ್ದರಿಂದ eval ಮತ್ತು ಮೇಲ್ವಿಚಾರಣೆ ಅಭಿವೃದ್ಧಿಯಷ್ಟೇ ಮುಖ್ಯ. ಮೂರು ಪದರಗಳಲ್ಲಿ ಮೇಲ್ವಿಚಾರಣೆಯನ್ನು ಸ್ಥಾಪಿಸಿ (ಕಾರ್ಯಾಚರಣೆ, ಇನ್ಪುಟ್, ಔಟ್ಪುಟ್); ನಿಜವಾದ ಫಲಿತಾಂಶವು ವಿಳಂಬವಾದರೆ ಮುಂಚಿನ ಎಚ್ಚರಿಕೆಯಾಗಿ ಇನ್‌ಪುಟ್ ಡ್ರಿಫ್ಟ್ ಅನ್ನು ಬಳಸಿ. LLM ವ್ಯವಸ್ಥೆಗಳಲ್ಲಿ, eval ಮುಕ್ತ-ಮುಕ್ತವಾಗಿದೆ; ನಿಯಮ ಪರಿಶೀಲನೆಗಳು, LLM-ರೆಫರಿ ಮತ್ತು ಮಾನವ ಮೌಲ್ಯಮಾಪನವನ್ನು ಒಟ್ಟಿಗೆ ಬಳಸಿ - ಆದರೆ LLM-ರೆಫರಿಯನ್ನು ಮಾನವ ಆಂಕರ್‌ನೊಂದಿಗೆ ಮೌಲ್ಯೀಕರಿಸಲು ಮರೆಯದಿರಿ. ನಿಮ್ಮ Eval ಕ್ಲಸ್ಟರ್ ಅನ್ನು ಎಡ್ಜ್ ಮತ್ತು ಸೆಕ್ಯುರಿಟಿ ಕೇಸ್‌ಗಳೊಂದಿಗೆ ಉತ್ಕೃಷ್ಟಗೊಳಿಸಿ ಮತ್ತು ಹಿಡಿದ ಪ್ರತಿ ದೋಷವನ್ನು ಶಾಶ್ವತ ಪರೀಕ್ಷಾ ಪ್ರಕರಣವಾಗಿ ಪರಿವರ್ತಿಸಿ.

ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ

ಉತ್ಪಾದನೆಯ (ಅಥವಾ ಉತ್ಪಾದನೆಯ ಸಮೀಪ) ಮಾದರಿಗಾಗಿ ಮೂರು-ಪದರದ ಮೇಲ್ವಿಚಾರಣಾ ಯೋಜನೆಯನ್ನು ಬರೆಯಿರಿ ಮತ್ತು ಕನಿಷ್ಠ ಒಂದು ಇನ್‌ಪುಟ್-ವಿತರಣಾ ಮೆಟ್ರಿಕ್‌ಗಾಗಿ ಮಿತಿ + ಎಚ್ಚರಿಕೆಯನ್ನು ವ್ಯಾಖ್ಯಾನಿಸಿ. ನೀವು LLM ವ್ಯವಸ್ಥೆಯನ್ನು ಹೊಂದಿದ್ದರೆ: ಮನುಷ್ಯರೊಂದಿಗೆ 30 ಔಟ್‌ಪುಟ್‌ಗಳನ್ನು ಟ್ಯಾಗ್ ಮಾಡಿ, ಅದೇ ಔಟ್‌ಪುಟ್‌ಗಳಲ್ಲಿ LLM-ರೆಫರಿಯನ್ನು ರನ್ ಮಾಡಿ ಮತ್ತು ಮಾನವ-ರೆಫರಿ ಒಪ್ಪಂದವನ್ನು ಅಳೆಯಿರಿ; ರೆಫರಿಯ ವ್ಯವಸ್ಥಿತ ಪಕ್ಷಪಾತವನ್ನು ಗಮನಿಸಿ. ನಿಮ್ಮ ಇವಾಲ್ ಕ್ಲಸ್ಟರ್‌ಗೆ ಕನಿಷ್ಠ 3 ಅಂಚುಗಳು ಮತ್ತು 2 ಭದ್ರತಾ ಪ್ರಕರಣಗಳನ್ನು ಸೇರಿಸಿ.

ಪರಿಶೀಲನಾಪಟ್ಟಿ

  • [ ] ಮಾನಿಟರಿಂಗ್ ಎಲ್ಲಾ ಮೂರು ಪದರಗಳನ್ನು ಒಳಗೊಂಡಿದೆ (ಕಾರ್ಯಾಚರಣೆ, ಇನ್ಪುಟ್, ಔಟ್ಪುಟ್).
  • [ ] ನಿಜವಾದ ಫಲಿತಾಂಶವು ವಿಳಂಬವಾದರೆ ನಾನು ಇನ್‌ಪುಟ್ ಡ್ರಿಫ್ಟ್ ಅನ್ನು ಮುಂಚಿನ ಎಚ್ಚರಿಕೆಯಾಗಿ ಬಳಸುತ್ತೇನೆ.
  • [ ] ನಾನು ಮಾನವ ಲೇಬಲ್‌ಗಳೊಂದಿಗೆ LLM-ಆರ್ಬಿಟ್ರೇಟರ್ ಅನ್ನು ಮಾಪನಾಂಕ ಮಾಡಿದ್ದೇನೆ.
  • [ ] Eval ಕ್ಲಸ್ಟರ್ ಅಂಚಿನ ಮತ್ತು ಭದ್ರತಾ ಪ್ರಕರಣಗಳನ್ನು ಒಳಗೊಂಡಿದೆ.
  • [ ] ನಾನು ಹಿಡಿದ ಪ್ರತಿ ದೋಷವನ್ನು ಶಾಶ್ವತ ಪರೀಕ್ಷಾ ಪ್ರಕರಣವಾಗಿ ಪರಿವರ್ತಿಸಿದೆ.
  • [ ] ಪ್ರತಿ ಪ್ರಮುಖ ಮೆಟ್ರಿಕ್ ಮಿತಿ ಮತ್ತು ಪ್ರತಿಕ್ರಿಯೆ ಯೋಜನೆಯನ್ನು ಹೊಂದಿದೆ.