ಘಟಕ 8 / 11

RAG ಮೌಲ್ಯಮಾಪನ ಮತ್ತು ಮಾನಿಟರಿಂಗ್

ಲಾಭಗಳು:

  • ಧಾರಣ ಮತ್ತು ಉತ್ಪಾದನೆಯ ಗುಣಮಟ್ಟವನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ಅಳೆಯುವ ಮೆಟ್ರಿಕ್‌ಗಳನ್ನು ವ್ಯಾಖ್ಯಾನಿಸುವುದು
  • ಚಿನ್ನದ ಪ್ರಶ್ನೆ ಸೆಟ್ ಅನ್ನು ಹೊಂದಿಸಿ ಮತ್ತು LLM-ಆಸ್-ಜಡ್ಜ್‌ನೊಂದಿಗೆ ಸ್ವಯಂಚಾಲಿತ ಮೌಲ್ಯಮಾಪನವನ್ನು ರನ್ ಮಾಡಿ
  • ಉತ್ಪಾದನೆಯಲ್ಲಿ ಪ್ರತಿಕ್ರಿಯೆ, ಮೇಲ್ವಿಚಾರಣೆ ಮತ್ತು ಹಿಂಜರಿತ ಪರೀಕ್ಷೆಯ ಮೂಲಕ ಗುಣಮಟ್ಟವನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳುವುದು

"ನಾನು ಸಹಾಯಕವನ್ನು ಸ್ಥಾಪಿಸಿದ್ದೇನೆ, ಅದು ಉತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿದೆ ಎಂದು ತೋರುತ್ತಿದೆ" ಎಂಬ ವಾಕ್ಯವು ಎಂಜಿನಿಯರಿಂಗ್ ಹೇಳಿಕೆಯಲ್ಲ. RAG ವ್ಯವಸ್ಥೆಗಳು ಮೌನವಾಗಿ ಒಡೆಯುತ್ತವೆ: ಹೊಸ ದಾಖಲೆ ಪ್ರಕಾರವು ಮರುಪಡೆಯುವಿಕೆಯನ್ನು ಮರುಳು ಮಾಡುತ್ತದೆ, ಪ್ರಾಂಪ್ಟ್ ಬದಲಾವಣೆಯು ನಿಖರತೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ಸೂಚ್ಯಂಕವು ಹಳೆಯದಾಗುತ್ತದೆ. ಇದನ್ನು ಅರಿತುಕೊಳ್ಳುವ ಏಕೈಕ ಮಾರ್ಗವೆಂದರೆ ಅಳತೆ ಮಾಡುವುದು. ಈ ಘಟಕದಲ್ಲಿ, RAG ಗುಣಮಟ್ಟವನ್ನು ಹೇಗೆ ಅಳೆಯುವುದು (ಮರುಪಡೆಯುವಿಕೆ ಮತ್ತು ಪ್ರತ್ಯೇಕವಾಗಿ ಉತ್ಪಾದನೆ), ಸ್ವಯಂಚಾಲಿತ ಮೌಲ್ಯಮಾಪನ (LLM-ನ್ಯಾಯಾಧೀಶರು) ಮತ್ತು ಉತ್ಪಾದನೆಯಲ್ಲಿ ಗುಣಮಟ್ಟವನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳುವುದು (ಮೇಲ್ವಿಚಾರಣೆ, ಹಿಂಜರಿತ). "ನೀವು ಅಳತೆ ಮಾಡದಿರುವುದನ್ನು ನೀವು ಸುಧಾರಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ" ಎಂಬುದು ಈ ಘಟಕದ ಧ್ಯೇಯವಾಕ್ಯವಾಗಿದೆ.

ಎರಡು ಪ್ರತ್ಯೇಕ ವಿಷಯಗಳನ್ನು ಅಳೆಯಿರಿ

RAG ಎರಡು ಕಾಲುಗಳನ್ನು ಹೊಂದಿದೆ ಮತ್ತು ಅವುಗಳನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ಅಳೆಯಬೇಕು ಏಕೆಂದರೆ ಸಮಸ್ಯೆ ಅವುಗಳಲ್ಲಿ ಒಂದರಲ್ಲಿರಬಹುದು:

  1. ಮರುಪಡೆಯುವಿಕೆ ಗುಣಮಟ್ಟ: ಸರಿಯಾದ ಭಾಗ ಬಂದಿದೆಯೇ?
  2. ಪೀಳಿಗೆಯ ಗುಣಮಟ್ಟ: ಒಳಬರುವ ತುಣುಕಿನಿಂದ ಸರಿಯಾದ ಉತ್ತರವನ್ನು ಉತ್ಪಾದಿಸಲಾಗಿದೆಯೇ?

ಉತ್ತರ ಕೆಟ್ಟದಾಗಿದ್ದರೆ, ಯಾವ ಕಾಲು ಕೆಟ್ಟದಾಗಿದೆ ಎಂದು ನೀವು ಮೊದಲು ತಿಳಿದುಕೊಳ್ಳಬೇಕು. ಸರಿಯಾದ ಭಾಗವು ಎಂದಿಗೂ ಬರದಿದ್ದರೆ, ಉತ್ತಮ ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ಸಹ ಉಳಿಸಲಾಗುವುದಿಲ್ಲ (ಮರುಪಡೆಯುವಿಕೆ ಸಮಸ್ಯೆ). ಸರಿಯಾದ ಭಾಗವು ಬಂದರೂ ಮಾದರಿಯು ಅದನ್ನು ತಪ್ಪಾಗಿ ಓದಿದರೆ, ಮರುಪಡೆಯುವಿಕೆಯನ್ನು ಸುಧಾರಿಸುವುದು ನಿರರ್ಥಕವಾಗಿದೆ (ಪೀಳಿಗೆಯ ಸಮಸ್ಯೆ).

ಮರುಪಡೆಯುವಿಕೆ ಮೆಟ್ರಿಕ್ಸ್

ಮರುಪಡೆಯುವಿಕೆ ಒಂದು ವಿಂಗಡಣೆ/ಪ್ರವೇಶ ಸಮಸ್ಯೆಯಾಗಿದೆ; ಶಾಸ್ತ್ರೀಯ ಮಾಹಿತಿ ಮರುಪಡೆಯುವಿಕೆ ಮೆಟ್ರಿಕ್‌ಗಳಿಂದ ಅಳೆಯಲಾಗುತ್ತದೆ. ಇದಕ್ಕಾಗಿ ನೀವು ಗೋಲ್ಡನ್ ಕ್ಲಸ್ಟರ್ ಅನ್ನು ಹೊಂದಿರಬೇಕು: ಪ್ರತಿ ಪ್ರಶ್ನೆಗೆ ಯಾವ ತುಣುಕು "ಸರಿಯಾಗಿದೆ" ಎಂಬ ಜ್ಞಾನ.

ಮೆಟ್ರಿಕ್

ಯಾವ ಕ್ರಮಗಳು

ಸರಳ ವ್ಯಾಖ್ಯಾನ

ರೀಕಾಲ್@ಕೆ

ಮೇಲಿನ k ನಲ್ಲಿ ಸರಿಯಾದ ತುಣುಕು ಇದೆಯೇ?

ಸರಿಯಾದ ಭಾಗ ಕ್ಯಾಪ್ಚರ್ ದರ

ನಿಖರ @ ಕೆ

ಹಿಂತಿರುಗಿಸಿದ ಕೆ ತುಣುಕುಗಳಲ್ಲಿ ಎಷ್ಟು ಸಂಬಂಧಿತವಾಗಿವೆ?

ತಂದದ್ದನ್ನು ಶುಚಿಗೊಳಿಸುವುದು

MRR (ಸರಾಸರಿ ಪರಸ್ಪರ ಶ್ರೇಣಿ)

ಸರಿಯಾದ ತುಣುಕು ಯಾವ ಕ್ರಮದಲ್ಲಿದೆ?

ಬಹುಮಾನಗಳು ಉನ್ನತ ಶ್ರೇಣಿಯಲ್ಲಿರುತ್ತವೆ

ಹಿಟ್ ದರ

ಕನಿಷ್ಠ ಒಂದು ಸರಿಯಾದ ತುಣುಕು ಬಂದಿದೆಯೇ?

ಯಶಸ್ಸಿನ ಮೂಲಭೂತ ಅಳತೆ

ಪ್ರಾಯೋಗಿಕ ಕಾಮೆಂಟ್: Recall@k ಕಡಿಮೆಯಿದ್ದರೆ, ಚಂಕಿಂಗ್ ಅಥವಾ ಹುಡುಕಾಟ ತಂತ್ರ (ಹೈಬ್ರಿಡ್, ಕೆ, ಮರು-ಶ್ರೇಯಾಂಕ) ಅನ್ನು ಪುನಃ ಕೆಲಸ ಮಾಡಬೇಕು. ನಿಖರತೆ ಕಡಿಮೆಯಿದ್ದರೂ ಮರುಸ್ಥಾಪನೆ ಅಧಿಕವಾಗಿದ್ದರೆ, ಮರು-ಶ್ರೇಯಾಂಕವನ್ನು ಸೇರಿಸುವುದು ಉತ್ತಮ ಕ್ರಮವಾಗಿದೆ.

ಜನರೇಷನ್ ಮೆಟ್ರಿಕ್ಸ್

ಸರಿಯಾದ ಭಾಗ ಬಂದಾಗ, ಮಾದರಿಯಿಂದ ಉತ್ಪತ್ತಿಯಾಗುವ ಪ್ರತಿಕ್ರಿಯೆಯ ಗುಣಮಟ್ಟವನ್ನು ನಾವು ಅಳೆಯುತ್ತೇವೆ. ಮೂರು ಮೂಲ ಆಯಾಮಗಳು:

  • ನಿಷ್ಠೆ: ಉತ್ತರದಲ್ಲಿನ ಪ್ರತಿ ಹಕ್ಕು ಸಂದರ್ಭದಿಂದ ಬೆಂಬಲಿತವಾಗಿದೆಯೇ? ಯಾವುದೇ ಫಿಟ್ಟಿಂಗ್ ಇದೆಯೇ? ಇದು ಭ್ರಮೆಯ ನೇರ ಅಳತೆಯಾಗಿದೆ.
  • ಉತ್ತರ ಪ್ರಸ್ತುತತೆ: ಉತ್ತರವು ನಿಜವಾಗಿಯೂ ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸುತ್ತದೆಯೇ ಅಥವಾ ಅದು ವಿಷಯವಲ್ಲವೇ?
  • ಸಂಪೂರ್ಣತೆ: ಸಂದರ್ಭದಲ್ಲಿ ಎಲ್ಲಾ ಸಂಬಂಧಿತ ಮಾಹಿತಿಯನ್ನು ಬಳಸಲಾಗಿದೆಯೇ ಅಥವಾ ಅದು ಕಾಣೆಯಾಗಿದೆಯೇ?

ಇವುಗಳನ್ನು "ಸತ್ಯ/ಸುಳ್ಳು" ನಂತಹ ಬೈನರಿಗಿಂತ ಹೆಚ್ಚಾಗಿ ಶ್ರೇಣೀಕೃತ ಆಧಾರದ ಮೇಲೆ (ಉದಾ. 1-5) ಸ್ಕೋರ್ ಮಾಡಲಾಗುತ್ತದೆ.

ಸಲಹೆ: ನಿಷ್ಠೆಯನ್ನು ಪ್ರತ್ಯೇಕ ಮೆಟ್ರಿಕ್ ಆಗಿ ಟ್ರ್ಯಾಕ್ ಮಾಡಿ. ನಿಖರತೆ ಕಡಿಮೆಯಾದಂತೆ ನಿಷ್ಠೆಯು ಕಡಿಮೆಯಾದರೆ, ಸಮಸ್ಯೆಯು ಪೀಳಿಗೆಯಾಗಿದೆ; ನಿಷ್ಠೆ ಹೆಚ್ಚಿದ್ದರೂ ಉತ್ತರ ತಪ್ಪಾಗಿದ್ದರೆ, ಸಮಸ್ಯೆ ತಪ್ಪಾದ ತುಣುಕು (ಮರುಪಡೆಯುವಿಕೆ). ಒಟ್ಟಾಗಿ, ಈ ಎರಡು ಮೆಟ್ರಿಕ್‌ಗಳು ದೋಷದ ಸ್ಥಳವನ್ನು ತೋರಿಸುವ ದಿಕ್ಸೂಚಿಯಾಗಿದೆ.

ಗೋಲ್ಡನ್ ಪ್ರಶ್ನೆ ಸೆಟ್ ಅನ್ನು ಸ್ಥಾಪಿಸುವುದು

ಪ್ರತಿ ಅಳತೆಗೆ ಗೋಲ್ಡನ್ ಸೆಟ್ / ಮೌಲ್ಯಮಾಪನ ಡೇಟಾಸೆಟ್ ಅಗತ್ಯವಿದೆ: ವಾಸ್ತವಿಕ ಪ್ರಶ್ನೆಗಳು + ನಿರೀಕ್ಷಿತ ಸರಿಯಾದ ಉತ್ತರಗಳು + ಸರಿಯಾದ ಮೂಲ ತುಣುಕುಗಳು. 500 ಯಾದೃಚ್ಛಿಕ ಪ್ರಶ್ನೆಗಳಿಗಿಂತ 30-50 ಚೆನ್ನಾಗಿ ಆಯ್ಕೆಮಾಡಿದ ಪ್ರಶ್ನೆಗಳೊಂದಿಗೆ ಪ್ರಾರಂಭಿಸುವುದು ಉತ್ತಮವಾಗಿದೆ. ಸೆಟ್‌ನಲ್ಲಿ ಈ ಕೆಳಗಿನವುಗಳನ್ನು ಸೇರಿಸಿ: ಪದೇ ಪದೇ ಕೇಳಲಾಗುವ ನೈಜ ಪ್ರಶ್ನೆಗಳು, ತಿಳಿದಿರುವ ಕಷ್ಟಕರ ಪ್ರಶ್ನೆಗಳು, ಯಾವುದೇ ಉತ್ತರಗಳಿಲ್ಲದ ಟ್ರ್ಯಾಪ್ ಪ್ರಶ್ನೆಗಳು ("ನನಗೆ ಗೊತ್ತಿಲ್ಲ" ಎಂದು ಒಬ್ಬರು ಹೇಳಬೇಕು), ವಿರೋಧಾತ್ಮಕ ಮೂಲಗಳೊಂದಿಗೆ ಪ್ರಶ್ನೆಗಳು.

# ಗೋಲ್ಡನ್ ಕ್ಲಸ್ಟರ್ ಉದಾಹರಣೆ (ಪರಿಕಲ್ಪನಾ)[ {"ಪ್ರಶ್ನೆ": "ವಾರ್ಷಿಕ ರಜೆ ಎಷ್ಟು ದಿನಗಳು?", "ನಿರೀಕ್ಷಿತ_ಉತ್ತರ": "1-5 ವರ್ಷಗಳ ಹಿರಿತನಕ್ಕೆ 14 ದಿನಗಳು", "ಸರಿಯಾದ_ಭಾಗ_ಐಡಿ": "ಎರಡು-ಭಾಗ-3", "ವರ್ಗ": "ಬಿಡುಗಡೆ"}, {"ಕಚೇರಿಯನ್ನು ಪ್ರಶ್ನಿಸಲಾಗಿದೆ:", "ಯಾವುದು_" "NO_INFORMATION", # ಬಲೆ: ನನಗೆ "ಸರಿಯಾದ_ಭಾಗ_ಐಡಿ" ಗೊತ್ತಿಲ್ಲ: ಶೂನ್ಯ, "ವರ್ಗ": "ಟ್ರ್ಯಾಪ್"}]

LLM-ನ್ಯಾಯಾಧೀಶ: ಸ್ವಯಂಚಾಲಿತ ಮೌಲ್ಯಮಾಪನ

ನೂರಾರು ಉತ್ತರಗಳನ್ನು ಕೈಯಿಂದ ಸ್ಕೋರ್ ಮಾಡುವುದು ಆಯಾಸವಾಗಿದೆ. LLM-ಆಸ್-ಜಡ್ಜ್ ಮಾದರಿಯು ಒಂದು ಮಾದರಿಯು ಕೆಲವು ಮಾನದಂಡಗಳ ಆಧಾರದ ಮೇಲೆ ಮತ್ತೊಂದು ಮಾದರಿಯ ಉತ್ತರವನ್ನು ಸ್ಕೋರ್ ಮಾಡುತ್ತದೆ ಮತ್ತು ಸಮರ್ಥಿಸುತ್ತದೆ. ಉತ್ತಮ ನ್ಯಾಯಾಧೀಶರು ಮಾನದಂಡಗಳನ್ನು ಸ್ಪಷ್ಟವಾಗಿ ವ್ಯಾಖ್ಯಾನಿಸುತ್ತಾರೆ, ಉದಾಹರಣೆಗಳನ್ನು ನೀಡುತ್ತಾರೆ ಮತ್ತು ಸಮರ್ಥನೆಯನ್ನು ಕೇಳುತ್ತಾರೆ.

# LLM-ನ್ಯಾಯಾಧೀಶರ ಪ್ರಾಂಪ್ಟ್ (ಪರಿಕಲ್ಪನಾ) ನೀವು ನಿಷ್ಪಕ್ಷಪಾತ ಮೌಲ್ಯಮಾಪಕರು. ನೀಡಿರುವ ಸನ್ನಿವೇಶ ಮತ್ತು ನಿರೀಕ್ಷಿತ ಉತ್ತರದ ಪ್ರಕಾರ ಕೆಳಗಿನ ಉತ್ತರವನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿ. ಸ್ಕೋರ್ (1-5) ಮತ್ತು ಸಮರ್ಥಿಸಿಕೊಳ್ಳಿ:- ನಿಷ್ಠೆ: ಉತ್ತರದಲ್ಲಿನ ಪ್ರತಿ ಕ್ಲೈಮ್ ಅನ್ನು ಸನ್ನಿವೇಶದಲ್ಲಿ ಬೆಂಬಲಿಸಲಾಗುತ್ತದೆಯೇ?- ನಿಖರತೆ: ಉತ್ತರವು ನಿರೀಕ್ಷಿತ ಉತ್ತರಕ್ಕೆ ಹೊಂದಿಕೆಯಾಗುತ್ತದೆಯೇ?- ಸಂಪೂರ್ಣತೆ: ಸಂಬಂಧಿತ ಮಾಹಿತಿಯು ಪೂರ್ಣಗೊಂಡಿದೆಯೇ? ನಿರ್ದಿಷ್ಟವಾಗಿ: ಉತ್ತರವು ಸನ್ನಿವೇಶದಲ್ಲಿಲ್ಲದ ಮಾಹಿತಿಯನ್ನು ಹೊಂದಿದ್ದರೆ, ನಿಷ್ಠೆ1 ನೀಡಿ ಮತ್ತು ಯಾವ ಕ್ಲೈಮ್ ಅನ್ನು ನಿರ್ಮಿಸಲಾಗಿದೆ ಎಂಬುದನ್ನು ಸೂಚಿಸಿ

ಎಚ್ಚರಿಕೆ: LLM-ನ್ಯಾಯಾಧೀಶರು ಪರಿಪೂರ್ಣರಲ್ಲ; ಅವರು ತಮ್ಮದೇ ಆದ ಪಕ್ಷಪಾತವನ್ನು ಹೊಂದಿರಬಹುದು (ದೀರ್ಘ ಉತ್ತರ, ತಮ್ಮದೇ ಆದ ಶೈಲಿಯನ್ನು ಆದ್ಯತೆ). ನ್ಯಾಯಾಧೀಶರನ್ನು ಸಹ ಪರಿಶೀಲಿಸಿ: ನ್ಯಾಯಾಧೀಶರು ಮತ್ತು ಮಾನವರಿಂದ ಕೆಲವು ಉತ್ತರಗಳನ್ನು ಸ್ಕೋರ್ ಮಾಡಿ ಮತ್ತು ಅವರ ನಡುವಿನ ಒಪ್ಪಂದವನ್ನು ಅಳೆಯಿರಿ. ನ್ಯಾಯಾಧೀಶರು ಮಾನವ ಅಂಕಗಳೊಂದಿಗೆ ಸ್ಥಿರವಾಗಿದ್ದರೆ, ನೀವು ಅವರನ್ನು ನಂಬಬಹುದು.

ದುರ್ಬಲ/ಬಲವಾದ ರೇಟಿಂಗ್

ದುರ್ಬಲ ("ಇದು ನನಗೆ ಒಳ್ಳೆಯದು"):

ನಾನು ಕೆಲವು ಪ್ರಶ್ನೆಗಳನ್ನು ಕೇಳಿದೆ ಮತ್ತು ಉತ್ತರಗಳು ಚೆನ್ನಾಗಿವೆ. ನಾನು ಅದನ್ನು ಲೈವ್ ಮಾಡಿದ್ದೇನೆ.# ಸಮಸ್ಯೆ: ಯಾವುದೇ ಅಳತೆಗಳಿಲ್ಲ, ಹಿಂಜರಿತ ಅಗ್ರಾಹ್ಯ, ಸುಧಾರಣೆ ಕುರುಡು.

ಶಕ್ತಿಯುತ (ಗೋಲ್ಡ್ ಕ್ಲಸ್ಟರ್ + ಡಿಸ್ಕ್ರೀಟ್ ಮೆಟ್ರಿಕ್ಸ್ + ಸ್ವಯಂಚಾಲಿತ ತೀರ್ಪು + ರಿಗ್ರೆಷನ್):

40 ಪ್ರಶ್ನೆಗಳ ಗೋಲ್ಡನ್ ಕ್ಲಸ್ಟರ್. ಪ್ರತಿ ಬದಲಾವಣೆಯೊಂದಿಗೆ, ಮರುಸ್ಥಾಪನೆ@5, ನಿಷ್ಠೆ ಮತ್ತು ನಿಖರತೆಯನ್ನು ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಅಳೆಯಲಾಗುತ್ತದೆ. ಸ್ಕೋರ್ ಕಡಿಮೆಯಾದರೆ, ಬದಲಾವಣೆಯನ್ನು ಹಿಂತಿರುಗಿಸಲಾಗುತ್ತದೆ. ಉತ್ಪಾದನೆಯಲ್ಲಿ, ಬಳಕೆದಾರರ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಸಂಗ್ರಹಿಸಲಾಗುತ್ತದೆ ಮತ್ತು ಸೆಟ್‌ಗೆ ಸೇರಿಸಲಾಗುತ್ತದೆ.

ಉತ್ಪಾದನೆಯಲ್ಲಿ ಮಾನಿಟರಿಂಗ್ ಮತ್ತು ಹಿಂಜರಿತ

ಮೌಲ್ಯಮಾಪನವನ್ನು ಒಮ್ಮೆ ಮಾಡಿ ಮುಗಿಸುವುದಿಲ್ಲ. ಮೂರು ನಿರಂತರ ಅಭ್ಯಾಸಗಳು:

  • ರಿಗ್ರೆಶನ್ ಪರೀಕ್ಷೆ: ಪ್ರತಿ ಪ್ರಾಂಪ್ಟ್/ಮರುಪಡೆಯುವಿಕೆ/ಮಾದರಿ ಬದಲಾವಣೆಯಲ್ಲಿ ಸ್ವಯಂ-ರನ್ ಗೋಲ್ಡನ್ ಕ್ಲಸ್ಟರ್. ಸ್ಕೋರ್ ಕಡಿಮೆಯಾದರೆ, ಬದಲಾವಣೆಯು ವ್ಯತಿರಿಕ್ತವಾಗಿದೆ. ಇದು "ಅದನ್ನು ಉತ್ತಮಗೊಳಿಸಲು ಪ್ರಯತ್ನಿಸುವಾಗ ಅದನ್ನು ಮುರಿಯುವುದನ್ನು" ತಡೆಯುತ್ತದೆ.
  • ಉತ್ಪಾದನಾ ಮೇಲ್ವಿಚಾರಣೆ: ನೈಜ ಪ್ರಶ್ನೆಗಳಲ್ಲಿ "ನನಗೆ ಮಾಹಿತಿ ಸಿಗಲಿಲ್ಲ" ದರ, ಸರಾಸರಿ ವಿಳಂಬ, ವೆಚ್ಚ, ಬಳಕೆದಾರರ ಪ್ರತಿಕ್ರಿಯೆ (👍/👎) ಅನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡಲಾಗುತ್ತದೆ. "ನನಗೆ ಗೊತ್ತಿಲ್ಲ" ನಲ್ಲಿ ಹಠಾತ್ ಹೆಚ್ಚಳವು ಸಾಮಾನ್ಯವಾಗಿ ಸೂಚ್ಯಂಕ ಅಥವಾ ಮರುಪಡೆಯುವಿಕೆ ಅಸಮರ್ಪಕ ಕ್ರಿಯೆಯ ಮೊದಲ ಚಿಹ್ನೆಯಾಗಿದೆ.
  • ಪ್ರತಿಕ್ರಿಯೆ ಲೂಪ್: ಬಳಕೆದಾರರು 👎 ಒದಗಿಸಿದ ನೈಜ ಪ್ರಶ್ನೆಗಳನ್ನು ಪರಿಶೀಲಿಸಲಾಗುತ್ತದೆ ಮತ್ತು ಗೋಲ್ಡನ್ ಪೈಲ್‌ಗೆ ಸೇರಿಸಲಾಗುತ್ತದೆ; ಹೀಗಾಗಿ, ಸೆಟ್ ಕಾಲಾನಂತರದಲ್ಲಿ ಉತ್ಕೃಷ್ಟವಾಗುತ್ತದೆ ಮತ್ತು ವ್ಯವಸ್ಥೆಯ ಕುರುಡು ತಾಣಗಳನ್ನು ಮುಚ್ಚಲಾಗುತ್ತದೆ.

ಮೂರು ಮಿನಿ ಪ್ರಕರಣಗಳು

ಪ್ರಕರಣ 1 - ಸೈಲೆಂಟ್ ರಿಗ್ರೆಷನ್. ಒಂದು ತಂಡವು ಅದನ್ನು "ಸುಧಾರಿಸಲು" ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ಮಾರ್ಪಡಿಸಿತು; ಸಾಮಾನ್ಯ ನಿಖರತೆ ಹೆಚ್ಚಾಯಿತು, ಆದರೆ ಬಲೆಯ ಪ್ರಶ್ನೆಗಳಲ್ಲಿ ನಿಷ್ಠೆಯು 30% ರಷ್ಟು ಕಡಿಮೆಯಾಯಿತು (ಮಾದರಿಯು ಹೆಚ್ಚು ಹೊಂದಿಕೊಳ್ಳಲು ಪ್ರಾರಂಭಿಸಿತು). ಗೋಲ್ಡನ್ ಕ್ಲಸ್ಟರ್‌ನಲ್ಲಿ ಟ್ರ್ಯಾಪ್ ಪ್ರಶ್ನೆಗಳು ಇಲ್ಲದಿದ್ದರೆ ಇದು ಗಮನಕ್ಕೆ ಬರುತ್ತಿರಲಿಲ್ಲ; ರಿಗ್ರೆಶನ್ ಪರೀಕ್ಷೆಯು ಬದಲಾವಣೆಯನ್ನು ಹಿಂತಿರುಗಿಸಿದೆ.

ಪ್ರಕರಣ 2 - ತಪ್ಪು ಲೆಗ್ ಅನ್ನು ನೇರಗೊಳಿಸುವುದು. ಒಬ್ಬ ಸಹಾಯಕನಲ್ಲಿ ಉತ್ತರಗಳು ಕೆಟ್ಟದ್ದಾಗಿದ್ದವು; ತಂಡವು ವಾರಗಟ್ಟಲೆ ಪ್ರಾಂಪ್ಟ್‌ನಲ್ಲಿ ಕೆಲಸ ಮಾಡಿದೆ. ನಾವು ಮರುಪಡೆಯುವಿಕೆ ಮೆಟ್ರಿಕ್‌ಗಳನ್ನು ಅಳತೆ ಮಾಡಿದಾಗ, ಮರುಪಡೆಯುವಿಕೆ@5 ಕೇವಲ 48% ಆಗಿತ್ತು - ಸಮಸ್ಯೆಯು ಮರುಪಡೆಯುವಿಕೆಯಲ್ಲಿದೆ, ಪೀಳಿಗೆಯಲ್ಲ. ಹೈಬ್ರಿಡ್ + ಮರು-ಶ್ರೇಯಾಂಕವನ್ನು ಸೇರಿಸಿದಾಗ, ಮರುಪಡೆಯುವಿಕೆ 89% ಕ್ಕೆ ಏರಿತು ಮತ್ತು ನಿಖರತೆಯೂ ಹೆಚ್ಚಾಯಿತು.

ಪ್ರಕರಣ 3 - ಉತ್ಪಾದನಾ ಎಚ್ಚರಿಕೆ. ಒಂದು ದಿನ, ಬೆಂಬಲ ಸಹಾಯಕರ "ನನಗೆ ಮಾಹಿತಿ ಸಿಗಲಿಲ್ಲ" ದರವು 6% ರಿಂದ 34% ಕ್ಕೆ ಏರಿತು. ಟ್ರ್ಯಾಕ್ಪ್ಯಾಡ್ ಎಚ್ಚರಿಸಿದೆ; ಕಾರಣ ರಾತ್ರಿಯಲ್ಲಿ ನಡೆಯುವ ಇಂಡೆಕ್ಸಿಂಗ್ ಕೆಲಸವು ಮೌನವಾಗಿ ವಿಫಲವಾಗಿದೆ ಮತ್ತು ಹೊಸ ಲೇಖನಗಳನ್ನು ಅಪ್‌ಲೋಡ್ ಮಾಡಲಾಗಿಲ್ಲ. ಮೇಲ್ವಿಚಾರಣೆ ಇಲ್ಲದೆ, ತಪ್ಪಾದ "ನನಗೆ ಗೊತ್ತಿಲ್ಲ" ಹೇಳಿಕೆಗಳು ದಿನಗಳವರೆಗೆ ಮುಂದುವರೆಯುತ್ತವೆ.

ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು

  • "ಇದು ನನಗೆ ಚೆನ್ನಾಗಿ ಕೆಲಸ ಮಾಡಿದೆ" ಎಂದು ತೃಪ್ತರಾಗಿರುವುದು: ಮಾಪನವಿಲ್ಲದೆ, ಹಿಂಜರಿತವು ಗಮನಿಸುವುದಿಲ್ಲ.
  • ಮರುಪಡೆಯುವಿಕೆ ಮತ್ತು ಪೀಳಿಗೆಯನ್ನು ಪ್ರತ್ಯೇಕಿಸುವುದಿಲ್ಲ: ನೀವು ತಪ್ಪಾದ ಲೆಗ್ ಅನ್ನು ಸರಿಪಡಿಸುತ್ತೀರಿ ಮತ್ತು ಸಮಯವನ್ನು ವ್ಯರ್ಥ ಮಾಡುತ್ತೀರಿ.
  • ಟ್ರ್ಯಾಪ್ ಪ್ರಶ್ನೆಗಳನ್ನು ಕೇಳುವುದಿಲ್ಲ: ವಸ್ತುಗಳನ್ನು ತಯಾರಿಸುವ ಪ್ರವೃತ್ತಿಯು ಸುವರ್ಣ ಕ್ಲಸ್ಟರ್‌ನಲ್ಲಿ ಕಂಡುಬರುವುದಿಲ್ಲ.
  • ನ್ಯಾಯಾಧೀಶರನ್ನು ಪರಿಶೀಲಿಸುತ್ತಿಲ್ಲ: ಪಕ್ಷಪಾತದ ತೀರ್ಪುಗಾರರು ಸುಳ್ಳು ವಿಶ್ವಾಸವನ್ನು ನೀಡುತ್ತದೆ.
  • ಉತ್ಪಾದನೆಯ ಮೇಲೆ ನಿಗಾ ಇಡುತ್ತಿಲ್ಲ: ಸೂಚ್ಯಂಕ ವೈಫಲ್ಯ, ವೆಚ್ಚದ ಸ್ಫೋಟ ಸದ್ದಿಲ್ಲದೆ ಮುಂದುವರಿದಿದೆ.

ಸಾರಾಂಶದಲ್ಲಿ

  • RAG ನಲ್ಲಿ, ಮರುಪಡೆಯುವಿಕೆ ಮತ್ತು ಉತ್ಪಾದನೆಯ ಗುಣಮಟ್ಟವನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ಅಳೆಯಲಾಗುತ್ತದೆ; ಯಾವ ಕಾಲಿಗೆ ಹಾನಿಯಾಗಿದೆ ಎಂಬುದನ್ನು ಮೊದಲು ನಿರ್ಧರಿಸಬೇಕು.
  • recall@k, precision@k, ಮರುಪಡೆಯುವಿಕೆಗಾಗಿ MRR; ನಿಷ್ಠೆ, ಸೂಕ್ತತೆ, ಸಂಪೂರ್ಣತೆಯನ್ನು ಪೀಳಿಗೆಗೆ ಬಳಸಲಾಗುತ್ತದೆ.
  • ಪ್ರತಿ ಅಳತೆಗೆ ಚಿನ್ನದ ಕ್ಲಸ್ಟರ್ ಅಗತ್ಯವಿದೆ; ಅದರಲ್ಲಿ ನಿಜವಾದ, ಕಷ್ಟಕರ, ಬಲೆ ಮತ್ತು ವಿರೋಧಾತ್ಮಕ ಪ್ರಶ್ನೆಗಳನ್ನು ಹಾಕಿ.
  • LLM-ಆಸ್-ಜಡ್ಜ್ ದೊಡ್ಡ ಸೆಟ್‌ಗಳು ಸ್ವಯಂ-ಸ್ಕೋರ್‌ಗಳು; ಆದರೆ ನ್ಯಾಯಾಧೀಶರು ಸ್ವತಃ ಮನುಷ್ಯನ ವಿರುದ್ಧ ಸಮರ್ಥಿಸಬೇಕು.
  • ರಿಗ್ರೆಶನ್ ಪರೀಕ್ಷೆ, ಉತ್ಪಾದನಾ ಮೇಲ್ವಿಚಾರಣೆ ಮತ್ತು ಪ್ರತಿಕ್ರಿಯೆ ಲೂಪ್ ಕಾಲಾನಂತರದಲ್ಲಿ ಗುಣಮಟ್ಟವನ್ನು ಕಾಯ್ದುಕೊಳ್ಳುತ್ತವೆ.

ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ

(1) ನಿಮ್ಮ ಸ್ವಂತ ಸಹಾಯಕರಿಗಾಗಿ ಕನಿಷ್ಠ 15 ಪ್ರಶ್ನೆಗಳ ಗೋಲ್ಡನ್ ಸೆಟ್ ಅನ್ನು ರಚಿಸಿ: ಕನಿಷ್ಠ 3 ಬಲೆಗಳನ್ನು (ಉತ್ತರಗಳಿಲ್ಲ), 3 ಕಷ್ಟಕರವಾದ, 2 ವಿರೋಧಾತ್ಮಕ ಮೂಲ ಪ್ರಶ್ನೆಗಳನ್ನು ಸೇರಿಸಿ. ಪ್ರತಿ ಪ್ರಶ್ನೆಗೆ ನಿರೀಕ್ಷಿತ ಉತ್ತರ ಮತ್ತು ಸರಿಯಾದ ಭಾಗವನ್ನು ಬರೆಯಿರಿ. (2) ಈ ಸೆಟ್‌ನೊಂದಿಗೆ ಎರಡು ವಿಭಿನ್ನ ಪ್ರಾಂಪ್ಟ್ ಆವೃತ್ತಿಗಳನ್ನು ಹಸ್ತಚಾಲಿತವಾಗಿ ಹೋಲಿಕೆ ಮಾಡಿ; ನಿಷ್ಠೆ ಮತ್ತು ನಿಖರತೆಗಾಗಿ ಪ್ರತಿ ಉತ್ತರಕ್ಕೂ 1-5 ಅಂಕಗಳನ್ನು ನೀಡಿ. (3) ಮೇಲಿನ LLM-ಆಸ್-ಜಡ್ಜ್ ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ನಿಮ್ಮ ಸ್ವಂತ ಮಾನದಂಡಕ್ಕೆ ಅಳವಡಿಸಿಕೊಳ್ಳಿ. (4) ಉತ್ಪಾದನೆಯಲ್ಲಿ ನೀವು ಟ್ರ್ಯಾಕ್ ಮಾಡುವ 3 ಮೆಟ್ರಿಕ್‌ಗಳನ್ನು ಗುರುತಿಸಿ ಮತ್ತು ಪ್ರತಿಯೊಂದಕ್ಕೂ "ನಾನು ಯಾವ ಮಿತಿಯಲ್ಲಿ ಎಚ್ಚರಿಕೆ ನೀಡುತ್ತೇನೆ?" ಮೌಲ್ಯವನ್ನು ಬರೆಯಿರಿ.

ಪರಿಶೀಲನಾಪಟ್ಟಿ

  • [ ] ನಾನು ಪ್ರತ್ಯೇಕ ಮೆಟ್ರಿಕ್‌ಗಳೊಂದಿಗೆ ಧಾರಣ ಮತ್ತು ಉತ್ಪಾದನೆಯ ಗುಣಮಟ್ಟವನ್ನು ಅಳೆಯಬಹುದು.
  • [ ] recall@k, ನಿಷ್ಠೆಯಂತಹ ಮೆಟ್ರಿಕ್‌ಗಳ ಅರ್ಥವೇನೆಂದು ನನಗೆ ತಿಳಿದಿದೆ.
  • [ ] ನಾನು ನಿಜವಾದ, ಕಷ್ಟಕರ, ಬಲೆ ಮತ್ತು ವಿರೋಧಾತ್ಮಕ ಪ್ರಶ್ನೆಗಳನ್ನು ಒಳಗೊಂಡಿರುವ ಗೋಲ್ಡನ್ ಕ್ಲಸ್ಟರ್ ಅನ್ನು ನಿರ್ಮಿಸಬಹುದು.
  • [ ] ನಾನು ಸ್ವಯಂಚಾಲಿತ ಮೌಲ್ಯಮಾಪನವನ್ನು ಹೊಂದಿಸಬಹುದು ಮತ್ತು ನ್ಯಾಯಾಧೀಶರನ್ನು LLM-ನಂತೆ-ನ್ಯಾಯಾಧೀಶರೊಂದಿಗೆ ಪರಿಶೀಲಿಸಬಹುದು.
  • [ ] ನಾನು ರಿಗ್ರೆಷನ್ ಟೆಸ್ಟಿಂಗ್, ಪ್ರೊಡಕ್ಷನ್ ಮಾನಿಟರಿಂಗ್ ಮತ್ತು ಫೀಡ್‌ಬ್ಯಾಕ್ ಲೂಪ್ ಅನ್ನು ನಿರ್ವಹಿಸಬಲ್ಲೆ.