ಘಟಕ 3 / 11

ಚಂಕಿಂಗ್ ಮತ್ತು ಡಾಕ್ಯುಮೆಂಟ್ ತಯಾರಿ

ಲಾಭಗಳು:

  • ಸಂಖ್ಯಾತ್ಮಕವಾಗಿ ಚಂಕ್ ಗಾತ್ರ, ಅತಿಕ್ರಮಣ ಮತ್ತು ಶಬ್ದಾರ್ಥದ ಚಂಕಿಂಗ್ ವಹಿವಾಟುಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿ
  • ವಿವಿಧ ಡಾಕ್ಯುಮೆಂಟ್ ಪ್ರಕಾರಗಳಿಗೆ (PDF, ಟೇಬಲ್, ಕೋಡ್, ಚಾಟ್ ಲಾಗ್) ಸೂಕ್ತವಾದ ಚಂಕಿಂಗ್ ತಂತ್ರವನ್ನು ಆರಿಸುವುದು
  • ಪ್ರತಿ ಭಾಗಕ್ಕೆ ಮೆಟಾಡೇಟಾವನ್ನು ಸೇರಿಸುವ ಮೂಲಕ ಮರುಪಡೆಯುವಿಕೆ ಗುಣಮಟ್ಟ ಮತ್ತು ಫಿಲ್ಟರಿಂಗ್ ಅನ್ನು ಬಲಪಡಿಸಿ

RAG ನಲ್ಲಿ ಇದು ಅತ್ಯಂತ ಕಡೆಗಣಿಸದ ಆದರೆ ಅತ್ಯಂತ ನಿರ್ಣಾಯಕ ಹಂತವಾಗಿದೆ: ನೀವು ಡಾಕ್ಯುಮೆಂಟ್ ಅನ್ನು ಹೇಗೆ ಒಡೆಯುತ್ತೀರಿ. ಇದನ್ನು ಚಂಕಿಂಗ್ ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ. ನೀವು ಅದೇ ಮಾದರಿಗೆ ಅದೇ ಡಾಕ್ಯುಮೆಂಟ್ ಅನ್ನು ನೀಡಿದ್ದರೂ ಸಹ, ಕೆಟ್ಟ ಚಂಕ್ ಮಾಡುವಿಕೆಯಿಂದಾಗಿ ಮರುಪಡೆಯುವಿಕೆ ತಪ್ಪಾದ ಭಾಗವನ್ನು ಹಿಂದಿರುಗಿಸುತ್ತದೆ ಮತ್ತು ಮಾದರಿಯು ಎಂದಿಗೂ ಉತ್ತಮ ಉತ್ತರವನ್ನು ನೀಡುವುದಿಲ್ಲ. ಈ ಘಟಕದಲ್ಲಿ, ವಿಘಟನೆಯ ತಂತ್ರಗಳು, ಡಾಕ್ಯುಮೆಂಟ್ ಪ್ರಕಾರಕ್ಕೆ ಅನುಗುಣವಾಗಿ ಅವುಗಳನ್ನು ಹೇಗೆ ಅಳವಡಿಸಿಕೊಳ್ಳುವುದು ಮತ್ತು ಪ್ರತಿ ತುಣುಕಿಗೆ ಅರ್ಥಪೂರ್ಣ ಮೆಟಾಡೇಟಾವನ್ನು ಹೇಗೆ ಸೇರಿಸುವುದು ಎಂಬುದನ್ನು ನಾವು ಒಳಗೊಳ್ಳುತ್ತೇವೆ.

ನಾವು ಏಕೆ ಚೂರುಚೂರು ಮಾಡುತ್ತೇವೆ?

ಮೂರು ಕಾರಣಗಳಿವೆ. ಮೊದಲನೆಯದಾಗಿ, ಎಂಬೆಡಿಂಗ್ ಮಾಡೆಲ್‌ಗಳು ಪಠ್ಯವನ್ನು ನಿರ್ದಿಷ್ಟ ಉದ್ದದವರೆಗಿನ ಅರ್ಥಪೂರ್ಣ ವೆಕ್ಟರ್ ಆಗಿ ಪರಿವರ್ತಿಸುತ್ತವೆ; ಸಂಪೂರ್ಣ 40-ಪುಟಗಳ ಅಧ್ಯಾಯವನ್ನು ಒಂದೇ ವೆಕ್ಟರ್‌ನಲ್ಲಿ ತುಂಬಿದರೆ, ಅರ್ಥವು "ಅಸ್ಪಷ್ಟ" ಆಗುತ್ತದೆ. ಎರಡನೆಯದಾಗಿ, ನಾವು ಸಂದರ್ಭಕ್ಕೆ ಅಗತ್ಯವಿರುವ ಭಾಗವನ್ನು ಮಾತ್ರ ಮಾದರಿಗೆ ನೀಡಲು ಬಯಸುತ್ತೇವೆ; ಸಂಪೂರ್ಣ ಡಾಕ್ಯುಮೆಂಟ್ ಅನ್ನು ಹಸ್ತಾಂತರಿಸುವುದು ದುಬಾರಿ ಮತ್ತು ಗಮನವನ್ನು ಸೆಳೆಯುತ್ತದೆ. ಮೂರನೆಯದಾಗಿ, ಮರುಪಡೆಯುವಿಕೆ ನಿಖರವಾಗಿರಲು, ಹುಡುಕಾಟ ಘಟಕವು ಚಿಕ್ಕದಾಗಿರಬೇಕು ಮತ್ತು ಕೇಂದ್ರೀಕೃತವಾಗಿರಬೇಕು.

ಆದ್ದರಿಂದ ಚಂಕ್ ಹಿಂಪಡೆಯುವಿಕೆಯ ಚಿಕ್ಕ ಘಟಕವಾಗಿದೆ. ಇದು ತುಂಬಾ ದೊಡ್ಡದಾಗಿರಬಾರದು ಅಥವಾ ತುಂಬಾ ಚಿಕ್ಕದಾಗಿರಬಾರದು - ಸರಿ.

ಚಂಕ್ ಗಾತ್ರ ಮತ್ತು ಅತಿಕ್ರಮಿಸುವ ಸಮತೋಲನ

ಎರಡು ಪ್ರಮುಖ ಸೆಟ್ಟಿಂಗ್‌ಗಳಿವೆ: ಚಂಕ್ ಗಾತ್ರ (ಒಂದು ಚಂಕ್‌ನಲ್ಲಿ ಎಷ್ಟು ಟೋಕನ್‌ಗಳು/ಪದಗಳು ಇರುತ್ತವೆ) ಮತ್ತು ಅತಿಕ್ರಮಣ (ನೆರೆಯ ಭಾಗಗಳಿಂದ ಹಂಚಲಾದ ಭಾಗ).

ಅತ್ಯಂತ ಚಿಕ್ಕ ಭಾಗಗಳು (ಉದಾ. 100 ಟೋಕನ್‌ಗಳು): ಕೇಂದ್ರೀಕೃತ ಆದರೆ ಸಂದರ್ಭದಿಂದ ಸಂಪರ್ಕ ಕಡಿತಗೊಂಡಿದೆ. ಅವರು "14 ದಿನಗಳವರೆಗೆ" ಹೇಳುತ್ತಾರೆ, ಆದರೆ 14 ದಿನಗಳು ಹಿಂದಿನ ವಾಕ್ಯದಲ್ಲಿ ಉಳಿದಿವೆ. ತುಂಬಾ ದೊಡ್ಡ ತುಂಡುಗಳು (ಉದಾ. 2000 ಟೋಕನ್‌ಗಳು): ಸಂದರ್ಭವನ್ನು ಸಂರಕ್ಷಿಸುತ್ತದೆ ಆದರೆ ಅನೇಕ ಎಳೆಗಳನ್ನು ಬೆರೆಸಲಾಗುತ್ತದೆ; ಎಂಬೆಡಿಂಗ್ ಗೊಂದಲಕ್ಕೊಳಗಾಗುತ್ತದೆ ಮತ್ತು ಅಪ್ರಸ್ತುತ ವಿಷಯಗಳು ಒಟ್ಟಿಗೆ ಬರುತ್ತವೆ.

ಅತಿಕ್ರಮಣವು ಗಡಿ ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸುತ್ತದೆ. ಒಂದು ವಾಕ್ಯವು ಎರಡು ಭಾಗಗಳ ಗಡಿಯಲ್ಲಿ ನಿಖರವಾಗಿ ಬಿದ್ದರೆ, ಅದನ್ನು ಅತಿಕ್ರಮಿಸದೆ ಎರಡು ಭಾಗಗಳಾಗಿ ವಿಂಗಡಿಸಲಾಗಿದೆ ಮತ್ತು ಅದರ ಅರ್ಥವು ಕಳೆದುಹೋಗುತ್ತದೆ. 50-100 ಟೋಕನ್‌ಗಳ ಅತಿಕ್ರಮಣವು ಮಿತಿಯೊಳಗೆ ಬೀಳುವ ಮಾಹಿತಿಯು ಕನಿಷ್ಠ ಒಂದು ಭಾಗದಲ್ಲಿ ಹಾಗೇ ಉಳಿಯುತ್ತದೆ ಎಂದು ಖಚಿತಪಡಿಸುತ್ತದೆ.

ಚಂಕ್ ಗಾತ್ರ

ಅನುಕೂಲ

ಅನನುಕೂಲತೆ

ಸೂಕ್ತವಾದ ವಿಷಯ

ಚಿಕ್ಕದು (100-250 ಟೋಕನ್‌ಗಳು)

ಹೆಚ್ಚಿನ ಸಂವೇದನೆ, ಕೇಂದ್ರೀಕೃತ

ಸಂದರ್ಭವು ಮುರಿಯಬಹುದು

FAQ, ಸಣ್ಣ ಲೇಖನಗಳು, ವ್ಯಾಖ್ಯಾನಗಳು

ಮಧ್ಯಮ (300-600 ಟೋಕನ್‌ಗಳು)

ಸಮತೋಲನ; ಹೆಚ್ಚಿನ ಸನ್ನಿವೇಶಗಳು

-

ಕಾರ್ಯವಿಧಾನಗಳು, ನೀತಿ ಪಠ್ಯಗಳು

ದೊಡ್ಡದು (800-1500 ಟೋಕನ್‌ಗಳು)

ಸಂದರ್ಭ ಸಮಗ್ರತೆ

ಅಸ್ಪಷ್ಟ ಎಂಬೆಡಿಂಗ್

ನಿರೂಪಣೆ, ದೀರ್ಘ ವಿವರಣೆಗಳು

ಸಲಹೆ: ಎಲ್ಲಿ ಪ್ರಾರಂಭಿಸಬೇಕು ಎಂದು ನಿಮಗೆ ತಿಳಿದಿಲ್ಲದಿದ್ದರೆ, 400-500 ಟೋಕನ್ ಚಂಕ್ ಮತ್ತು 50-80 ಟೋಕನ್ ಅತಿಕ್ರಮಣದೊಂದಿಗೆ ಪ್ರಾರಂಭಿಸಿ; ನಂತರ ನಿಮ್ಮ ಸ್ವಂತ ಡೇಟಾದೊಂದಿಗೆ ಅಳೆಯಿರಿ ಮತ್ತು ಹೊಂದಿಸಿ. "ಬಲ" ಗಾತ್ರವು ಸಾರ್ವತ್ರಿಕವಲ್ಲ, ಇದು ಸಂದರ್ಭವನ್ನು ಅವಲಂಬಿಸಿರುತ್ತದೆ.

ಚಂಕಿಂಗ್ ತಂತ್ರಗಳು

ಸ್ಥಿರ-ಗಾತ್ರ: ಪ್ರತಿ N ಟೋಕನ್‌ಗಳಲ್ಲಿ ಪಠ್ಯವನ್ನು ಟ್ರಿಮ್ ಮಾಡುತ್ತದೆ. ಇದು ಸರಳ ಮತ್ತು ವೇಗವಾಗಿದೆ, ಆದರೆ ಮಧ್ಯ ವಾಕ್ಯವನ್ನು ಅಡ್ಡಿಪಡಿಸಬಹುದು.

ವಿಭಜಕ-ಆಧಾರಿತ (ಪುನರಾವರ್ತಿತ/ವಿಭಜಕ): ಪ್ಯಾರಾಗ್ರಾಫ್ ಮತ್ತು ನಂತರ ವಾಕ್ಯದ ಗಡಿಗಳ ಪ್ರಕಾರ ವಿಭಜಿಸುತ್ತದೆ; ಇದು ಅರ್ಥದ ಸಮಗ್ರತೆಯನ್ನು ಉತ್ತಮವಾಗಿ ಸಂರಕ್ಷಿಸುತ್ತದೆ. ಹೆಚ್ಚಿನ ಉತ್ಪಾದನಾ ವ್ಯವಸ್ಥೆಗಳು ಇದರೊಂದಿಗೆ ಪ್ರಾರಂಭವಾಗುತ್ತವೆ.

ಲಾಕ್ಷಣಿಕ ಚಂಕಿಂಗ್: ಇದು ವಾಕ್ಯಗಳ ಎಂಬೆಡಿಂಗ್‌ಗಳನ್ನು ನೋಡುತ್ತದೆ ಮತ್ತು ವಿಷಯ ಬದಲಾವಣೆಯು ಸಂಭವಿಸುವ ಸ್ಥಳದಲ್ಲಿ ಅವುಗಳನ್ನು ವಿಭಜಿಸುತ್ತದೆ. ಇದು ಅತ್ಯುನ್ನತ ಗುಣಮಟ್ಟದ ಆದರೆ ಅತ್ಯಂತ ದುಬಾರಿ ವಿಧಾನವಾಗಿದೆ; ದೊಡ್ಡ ಪ್ರಮಾಣದಲ್ಲಿ, ವಹಿವಾಟು ವೆಚ್ಚಗಳು ಹೆಚ್ಚಾಗುತ್ತವೆ.

ರಚನೆ-ಅರಿವು: ಶೀರ್ಷಿಕೆಗಳು, ವಿಭಾಗಗಳು, ಕೋಷ್ಟಕಗಳಂತಹ ಡಾಕ್ಯುಮೆಂಟ್ ರಚನೆಯನ್ನು ಬಳಸುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಶೀರ್ಷಿಕೆಗಳ ಮೂಲಕ ಮಾರ್ಕ್‌ಡೌನ್ ಡಾಕ್ಯುಮೆಂಟ್ ಅನ್ನು ವಿಭಜಿಸುವುದು ಪ್ರತಿಯೊಂದು ಭಾಗವು ತನ್ನದೇ ಆದ ಶಿರೋನಾಮೆಯನ್ನು ಹೊಂದಿದೆ ಎಂದು ಖಚಿತಪಡಿಸುತ್ತದೆ.

ಡಾಕ್ಯುಮೆಂಟ್ ಪ್ರಕಾರದ ಅಳವಡಿಕೆ

ಪ್ರತಿಯೊಂದು ಡಾಕ್ಯುಮೆಂಟ್ ಒಂದೇ ಆಗಿರುವುದಿಲ್ಲ. ತಂತ್ರವು ಪ್ರಕಾರದಿಂದ ಬದಲಾಗುತ್ತದೆ:

  • PDF/ನೀತಿ ಪಠ್ಯ: ಬುಕ್‌ಮಾರ್ಕ್ ಆಧಾರಿತ, ಮಧ್ಯಮ ಗಾತ್ರ. ಪುಟದ ಮೇಲ್ಭಾಗ/ಕೆಳಗಿನ ಪುನರಾವರ್ತನೆಗಳನ್ನು ತೆರವುಗೊಳಿಸಿ (ಹೆಡರ್/ಫೂಟರ್).
  • ಕೋಷ್ಟಕಗಳು: ಸಂದರ್ಭದಿಂದ ರೇಖೆಯನ್ನು ತೆಗೆದುಕೊಳ್ಳಬೇಡಿ; ಹೆಡರ್ ಮಾಹಿತಿಯೊಂದಿಗೆ ಪ್ರತಿ ಸಾಲನ್ನು ಇರಿಸಿಕೊಳ್ಳಿ ("ಐಟಂ: X, ಬೆಲೆ: Y, ಸ್ಟಾಕ್: Z"). ಕಚ್ಚಾ ಟೇಬಲ್ ಅನ್ನು ಸರಳ ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸುವುದು ಸಾಮಾನ್ಯವಾಗಿ ಅತ್ಯಗತ್ಯ.
  • ಕೋಡ್: ಕಾರ್ಯ/ವರ್ಗದ ಗಡಿಗಳ ಮೂಲಕ ವಿಭಜನೆ; ಒಂದು ಕಾರ್ಯವನ್ನು ದಾರಿಯಿಂದ ಕಡಿತಗೊಳಿಸಬೇಡಿ.
  • ಚಾಟ್/ಟಿಕೆಟ್ ರೆಕಾರ್ಡಿಂಗ್: ಸಂದೇಶ ಅಥವಾ ಸಂಭಾಷಣೆಯ ಸುತ್ತಿನ ಮೂಲಕ ವಿಭಜನೆ; ಯಾರು ಏನು ಹೇಳಿದರು ಎಂಬ ಜ್ಞಾನವನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳಿ.

# ಬ್ರಾಕೆಟ್-ಆಧಾರಿತ ಚಂಕಿಂಗ್ (ಪರಿಕಲ್ಪನಾ) ಭಾಗಗಳು = bol(ಪಠ್ಯ, ಗುರಿ_ಗಾತ್ರ=450, # ಟೋಕನ್ ಅತಿಕ್ರಮಣ=70, # ಟೋಕನ್ ಬ್ರಾಕೆಟ್‌ಗಳು=["\n\n", "\n", ". ", " "] # ಪ್ಯಾರಾಗ್ರಾಫ್ ಮೊದಲ, ಕೊನೆಯ ಪದ)

ಪ್ರತಿ ಟ್ರ್ಯಾಕ್‌ಗೆ ಮೆಟಾಡೇಟಾ ಸೇರಿಸಿ

ಚಂಕಿಂಗ್ ಕೇವಲ "ವಿಭಜನೆ" ಅಲ್ಲ; ಪ್ರತಿ ತುಂಡನ್ನು ಉತ್ಕೃಷ್ಟಗೊಳಿಸುವುದು. ನೀವು ಟ್ರ್ಯಾಕ್‌ಗೆ ಲಗತ್ತಿಸುವ ಪ್ರತಿಯೊಂದು ಟ್ಯಾಗ್ ಭವಿಷ್ಯದ ಫಿಲ್ಟರಿಂಗ್ ಮತ್ತು ಮೂಲ ಉಲ್ಲೇಖಕ್ಕಾಗಿ ಅದರ ತೂಕವನ್ನು ಚಿನ್ನದ ಮೌಲ್ಯದ್ದಾಗಿದೆ.

# ಪುಷ್ಟೀಕರಿಸಿದ ಭಾಗ (ಪರಿಕಲ್ಪನಾ){ "ಪಠ್ಯ": "1-5 ವರ್ಷಗಳ ಸೇವೆಯೊಂದಿಗೆ ವಾರ್ಷಿಕ ಪಾವತಿಸಿದ ರಜೆ 14 ದಿನಗಳು...", "ಮೆಟಾಡೇಟಾ": { "ಮೂಲ": "ik_el_kitabi_v7.pdf", "ವಿಭಾಗ": "5.2 ವಾರ್ಷಿಕ ರಜೆ", "ಪುಟ": 23, "25-0 ನೇ ಭಾಗ": "23, "25-0 ನೇ ಭಾಗ"" "ಗೌಪ್ಯತೆ": "ಆಂತರಿಕ" }}

ಮತ್ತೊಂದು ಶಕ್ತಿಯುತ ತಂತ್ರವೆಂದರೆ ಸಂದರ್ಭೋಚಿತ ಶಿರೋಲೇಖವನ್ನು ಸೇರಿಸುವುದು: ಪ್ರತಿ ತುಣುಕಿನ ಆರಂಭದಲ್ಲಿ ಅದು ಸೇರಿರುವ ಅಧ್ಯಾಯದ ಶೀರ್ಷಿಕೆಯನ್ನು ಬರೆಯುವುದು. ಹೀಗಾಗಿ, "14 ದಿನಗಳವರೆಗೆ" ನಂತಹ ವಿಚ್ಛೇದಿತ ತುಣುಕು ಕೂಡ "ವಾರ್ಷಿಕ ರಜೆ - 14 ದಿನಗಳು" ಎಂದು ಉತ್ತಮವಾಗಿ ಹುದುಗಿದೆ ಮತ್ತು ಹೆಚ್ಚು ಅರ್ಥಪೂರ್ಣವಾಗಿದೆ.

ದುರ್ಬಲ ಚಂಕಿಂಗ್ / ಬಲವಾದ ಚಂಕಿಂಗ್

ದುರ್ಬಲ (ಬ್ಲೈಂಡ್ ಹಾರ್ಡ್‌ಕಟ್, ಮೆಟಾಡೇಟಾ ಇಲ್ಲ):

ಪ್ರತಿ 1000 ಅಕ್ಷರಗಳಿಗೆ ಪಠ್ಯವನ್ನು ಮೊಟಕುಗೊಳಿಸಿ. ಪಠ್ಯವನ್ನು ಮಾತ್ರ ಇರಿಸಿ

ಶಕ್ತಿಯುತ (ರಚನೆ-ಅರಿವು + ಹೆಡರ್ + ಮೆಟಾಡೇಟಾ):

ಡಾಕ್ಯುಮೆಂಟ್ ಅನ್ನು ಶೀರ್ಷಿಕೆಗಳಿಂದ ಭಾಗಿಸಿ; ಪ್ರತಿ ಭಾಗಕ್ಕೆ ವಿಭಾಗದ ಶೀರ್ಷಿಕೆಯನ್ನು ಸೇರಿಸಿ; ಮೂಲ, ಪುಟ, ದಿನಾಂಕ ಮತ್ತು ಗೌಪ್ಯತೆ ಮೆಟಾಡೇಟಾವನ್ನು ಲಗತ್ತಿಸಿ; ಟೇಬಲ್ರೋಗಳನ್ನು ಅವುಗಳ ಹೆಡರ್ಗಳೊಂದಿಗೆ ಸರಳ ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸಿ.# ಫಲಿತಾಂಶ: ಕೇಂದ್ರೀಕೃತ, ಸಂದರ್ಭೋಚಿತ, ಫಿಲ್ಟರ್ ಮಾಡಬಹುದಾದ, ಮೂಲ.

ಮೂರು ಮಿನಿ ಪ್ರಕರಣಗಳು

ಪ್ರಕರಣ 1 - ಚಿತ್ರಕಲೆ ದುರಂತ. ಒಂದು ಹಣಕಾಸು ತಂಡವು 200-ಪುಟಗಳ ಬೆಲೆ ಪಟ್ಟಿಯನ್ನು ಬ್ಲೈಂಡ್ ಹಾರ್ಡ್ ಕಟಿಂಗ್‌ನೊಂದಿಗೆ ವಿಂಗಡಿಸಿದೆ; ಟೇಬಲ್ ಸಾಲುಗಳನ್ನು ಯಾದೃಚ್ಛಿಕವಾಗಿ ವಿಭಜಿಸಲಾಯಿತು. "X ಉತ್ಪನ್ನದ ಬೆಲೆ ಏನು?" ಮಾದರಿಯು ತಪ್ಪು ರೇಖೆಯನ್ನು ಓದಿದೆ ಮತ್ತು ತಪ್ಪಾದ ಬೆಲೆಯನ್ನು ನೀಡಿದೆ (12 ಪ್ರಕರಣಗಳಲ್ಲಿ 9 ತಪ್ಪಾಗಿದೆ). ನಾನು ಟೇಬಲ್ ಸಾಲುಗಳನ್ನು "ಉತ್ಪನ್ನ: … | ಬೆಲೆ: … | ಘಟಕ: ..." ಫಾರ್ಮ್ಯಾಟ್‌ನಲ್ಲಿ ಸರಳ ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸಿದಾಗ ದೋಷವು 12 ರಲ್ಲಿ 0 ಕ್ಕೆ ಕಡಿಮೆಯಾಗಿದೆ.

ಪ್ರಕರಣ 2 - ಅತ್ಯಂತ ದೊಡ್ಡ ಭಾಗ. ವಿಕಿಯಲ್ಲಿ, ಪ್ರತಿ ಪುಟವು ಒಂದೇ ಭಾಗದಿಂದ ಮಾಡಲ್ಪಟ್ಟಿದೆ (ಕೆಲವರು 3,000 ಟೋಕನ್‌ಗಳು ಎಂದು ಹೇಳುತ್ತಾರೆ). ಒಂದು ಪುಟದಲ್ಲಿ "ರಜಾ", "ಅಧಿಕ ಸಮಯ" ಮತ್ತು "ವೇತನ ಪಟ್ಟಿ" ಇರುವುದರಿಂದ ಎಂಬೆಡಿಂಗ್ ಅನ್ನು ಮಸುಕುಗೊಳಿಸಲಾಗಿದೆ; ರಜೆಯ ಪ್ರಶ್ನೆಗೆ ಸಂಬಂಧಿಸಿದಂತೆ ಕೆಲಸದ ಸಮಯದ ವಿಭಾಗವೂ ಕಾರ್ಯರೂಪಕ್ಕೆ ಬಂದಿತು. ಶೀರ್ಷಿಕೆಯ ಮೂಲಕ ಪುಟಗಳನ್ನು ಮಧ್ಯಮ ಗಾತ್ರಕ್ಕೆ ವಿಂಗಡಿಸಿದಾಗ, ಮರುಪಡೆಯುವಿಕೆ@5 64% ರಿಂದ 91% ಕ್ಕೆ ಏರಿತು.

ಪ್ರಕರಣ 3 - ಅತಿಕ್ರಮಿಸದೆ ಮೊಟಕುಗೊಳಿಸಿದ ವಾಕ್ಯ. ಕಾನೂನು ತಂಡಕ್ಕೆ 250 ಟೋಕನ್ ನಿಗದಿತ ಕಟ್, ಅತಿಕ್ರಮಣವಿಲ್ಲ. ಒಂದು ನಿರ್ಣಾಯಕ ವ್ಯಾಖ್ಯಾನವು ಎರಡು ಭಾಗಗಳ ಗಡಿಯಲ್ಲಿ ಬಲಕ್ಕೆ ಬಿದ್ದಿತು ಮತ್ತು ಎರಡು ಭಾಗಗಳಾಗಿ ವಿಭಜನೆಯಾಯಿತು; ಒಂದು ಅಥವಾ ಇನ್ನೊಂದು ಸಂಪೂರ್ಣ ಉತ್ತರವನ್ನು ಹೊಂದಿರುವುದಿಲ್ಲ. 60 ಟೋಕನ್ ಅತಿಕ್ರಮಣವನ್ನು ಸೇರಿಸಿದಾಗ, ಅದೇ ವ್ಯಾಖ್ಯಾನವು ಒಂದು ತುಣುಕಿನಲ್ಲಿ ಹಾಗೆಯೇ ಉಳಿಯಿತು ಮತ್ತು ಸರಿಯಾದ ಉತ್ತರವನ್ನು ಹಿಂತಿರುಗಿಸಲಾಯಿತು.

ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು

  • ಬ್ಲೈಂಡ್ ಸ್ಥಿರ ಕಟ್: ಮಧ್ಯದಲ್ಲಿ ವಾಕ್ಯಗಳನ್ನು ಮತ್ತು ಕೋಷ್ಟಕಗಳನ್ನು ವಿಭಜಿಸುತ್ತದೆ; ಅರ್ಥ ಕಳೆದುಹೋಗಿದೆ.
  • ಅತಿಕ್ರಮಣವನ್ನು ಶೂನ್ಯದಲ್ಲಿ ಬಿಡುವುದು: ಗಡಿಯ ಮೇಲೆ ಬೀಳುವ ಮಾಹಿತಿಯನ್ನು ವಿಂಗಡಿಸಲಾಗಿದೆ ಮತ್ತು ಕಳೆದುಹೋಗುತ್ತದೆ.
  • ಮೆಟಾಡೇಟಾವನ್ನು ಸೇರಿಸುತ್ತಿಲ್ಲ: ಫಿಲ್ಟರಿಂಗ್ ಮತ್ತು ಮೂಲ ಪ್ರದರ್ಶನವು ಅಸಾಧ್ಯವಾಗುತ್ತದೆ.
  • ಕೋಷ್ಟಕಗಳನ್ನು ಕಚ್ಚಾ ಬಿಡುವುದು: ಮಾದರಿಯು ಮೇಜಿನ ರಚನೆಯನ್ನು ಪರಿಹರಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ; ಸಾಲುಗಳನ್ನು ಸರಳ ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸಿ.
  • ಒಂದು ತಂತ್ರವನ್ನು ಹೇರುವುದು: PDF, ಕೋಡ್ ಮತ್ತು ಟೇಬಲ್ ಅನ್ನು ಒಂದೇ ವಿಧಾನದಿಂದ ವಿಭಜಿಸಲಾಗುವುದಿಲ್ಲ; ಪ್ರಕಾರಕ್ಕೆ ಹೊಂದಿಕೊಳ್ಳಿ.
ಎಚ್ಚರಿಕೆ: ಒಮ್ಮೆ ಚುಂಕಿಂಗ್ ಅನ್ನು ಹೊಂದಿಸಬೇಡಿ ಮತ್ತು ಅದನ್ನು ಮರೆತುಬಿಡಿ. ಹೊಸ ಡಾಕ್ಯುಮೆಂಟ್ ಪ್ರಕಾರಗಳು (ಹೊಸ ಸಿಸ್ಟಂನಿಂದ ಟಿಕೆಟ್‌ಗಳು, ಸ್ಕ್ಯಾನ್ ಮಾಡಿದ PDF ಗಳು) ಬಂದಂತೆ ಮರು-ಅಳತೆ ಮರುಪಡೆಯುವಿಕೆ ಗುಣಮಟ್ಟ. ಕೆಟ್ಟ ಇನ್‌ಪುಟ್ ಡೇಟಾ ಎಂದರೆ ಕೆಟ್ಟ ಪ್ರತಿಕ್ರಿಯೆ ("ಗಾರ್ಬೇಜ್ ಇನ್, ಗಾರ್ಬೇಜ್ ಔಟ್").

ಸಾರಾಂಶದಲ್ಲಿ

  • ಚಂಕ್ ಹಿಂಪಡೆಯುವಿಕೆಯ ಚಿಕ್ಕ ಘಟಕವಾಗಿದೆ; ತುಂಬಾ ದೊಡ್ಡದು ಅಥವಾ ತುಂಬಾ ಚಿಕ್ಕದು - ಇದು ವಿಷಯದ ಪ್ರಕಾರ ಸಮತೋಲನದಲ್ಲಿರಬೇಕು.
  • ಚಂಕ್ ಗಾತ್ರವು ಗಮನ-ಸಂದರ್ಭ ಸಮತೋಲನವನ್ನು ಸೂಚಿಸುತ್ತದೆ; ಅತಿಕ್ರಮಣವು ಗಡಿ ನಷ್ಟವನ್ನು ನಿರ್ವಹಿಸುತ್ತದೆ.
  • ಬ್ರಾಕೆಟ್-ಆಧಾರಿತ ಮತ್ತು ರಚನೆ-ಅರಿವು ಚಂಕಿಂಗ್ ಹೆಚ್ಚಿನ ಪೀಳಿಗೆಯ ವ್ಯವಸ್ಥೆಗಳ ಆರಂಭಿಕ ಹಂತವಾಗಿದೆ; ಲಾಕ್ಷಣಿಕ ಚಂಕಿಂಗ್ ಉತ್ತಮ ಗುಣಮಟ್ಟದ ಆದರೆ ದುಬಾರಿಯಾಗಿದೆ.
  • ಟೇಬಲ್, ಸ್ಕ್ರಿಪ್ಟ್ ಮತ್ತು ಚಾಟ್‌ನಂತಹ ಪ್ರಕಾರಗಳಿಗೆ ತಮ್ಮದೇ ಆದ ತಂತ್ರಗಳು ಬೇಕಾಗುತ್ತವೆ; ಕೋಷ್ಟಕಗಳನ್ನು ಸರಳ ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸಿ.
  • ಪ್ರತಿ ಟ್ರ್ಯಾಕ್‌ಗೆ ಮೂಲ/ದಿನಾಂಕ/ಅಧ್ಯಾಯ/ಗೌಪ್ಯತೆ ಮೆಟಾಡೇಟಾ ಮತ್ತು ವಿಭಾಗದ ಶೀರ್ಷಿಕೆಯನ್ನು ಸೇರಿಸಿ; ಇದು ಫಿಲ್ಟರಿಂಗ್ ಮತ್ತು ಉಲ್ಲೇಖದ ಆಧಾರವಾಗಿದೆ.

ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ

ನೀವು ಆಯ್ಕೆ ಮಾಡಿದ ಡಾಕ್ಯುಮೆಂಟ್‌ನ ಒಂದು ವಿಭಾಗವನ್ನು ಮೂರು ವಿಭಿನ್ನ ರೀತಿಯಲ್ಲಿ ಒಡೆಯಿರಿ: (1) 200 ಟೋಕನ್‌ಗಳ ಸಣ್ಣ ತುಣುಕುಗಳು, (2) 500 ಟೋಕನ್‌ಗಳ ಮಧ್ಯಮ ತುಣುಕುಗಳು (70 ಟೋಕನ್ ಅತಿಕ್ರಮಣ), (3) ಒಂದೇ ದೊಡ್ಡ ತುಣುಕುಗಳು. ಪ್ರತಿ ತಂತ್ರಕ್ಕೆ ಅದೇ 3 ಪ್ರಶ್ನೆಗಳನ್ನು ಕೇಳಿ, ಯಾವ ತುಣುಕನ್ನು ತರಬೇಕು ಎಂಬುದನ್ನು ಹಸ್ತಚಾಲಿತವಾಗಿ ಗುರುತಿಸಿ ಮತ್ತು ಆ ಡಾಕ್ಯುಮೆಂಟ್‌ಗೆ ಯಾವ ತಂತ್ರವು ಉತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ ಎಂಬುದರ ತಾರ್ಕಿಕತೆಯನ್ನು ಬರೆಯಿರಿ. ನಂತರ ಪ್ರತಿ ಟ್ರ್ಯಾಕ್‌ಗೆ ಕನಿಷ್ಠ ನಾಲ್ಕು ಮೆಟಾಡೇಟಾ ಕ್ಷೇತ್ರಗಳನ್ನು ಮತ್ತು “ಅಧ್ಯಾಯ ಶೀರ್ಷಿಕೆ” ಸೇರಿಸಿ. ಡಾಕ್ಯುಮೆಂಟ್ ಟೇಬಲ್ ಹೊಂದಿದ್ದರೆ, ಟೇಬಲ್ ಸಾಲನ್ನು "ಫೀಲ್ಡ್:ಮೌಲ್ಯ" ಫಾರ್ಮ್ಯಾಟ್‌ನಲ್ಲಿ ಸರಳ ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸಿ.

ಪರಿಶೀಲನಾಪಟ್ಟಿ

  • [ ] ಚಂಕ್ ಹಿಂಪಡೆಯುವಿಕೆಯ ಚಿಕ್ಕ ಘಟಕವಾಗಿದೆ ಮತ್ತು ಗಾತ್ರವು ಗಮನ-ಸಂದರ್ಭ ಸಮತೋಲನವಾಗಿದೆ ಎಂದು ನಾನು ಹೇಳಬಲ್ಲೆ.
  • [ ] ಅತಿಕ್ರಮಣವು ಗಡಿ ನಷ್ಟವನ್ನು ಏಕೆ ತಡೆಯುತ್ತದೆ ಎಂದು ನನಗೆ ತಿಳಿದಿದೆ.
  • [ ] ನಾನು ಬ್ರಾಕೆಟ್-ಆಧಾರಿತ, ಲಾಕ್ಷಣಿಕ ಮತ್ತು ರಚನೆ-ಅರಿವಿನ ಚಂಕಿಂಗ್ ನಡುವೆ ವ್ಯತ್ಯಾಸವನ್ನು ಗುರುತಿಸಬಲ್ಲೆ.
  • [ ] ನಾನು ಟೇಬಲ್, ಕೋಡ್ ಮತ್ತು ಚಾಟ್‌ಗಾಗಿ ತಂತ್ರವನ್ನು ಅಳವಡಿಸಿಕೊಳ್ಳಬಹುದು.
  • [ ] ನಾನು ಪ್ರತಿ ಟ್ರ್ಯಾಕ್‌ಗೆ ಮೆಟಾಡೇಟಾ ಮತ್ತು ಅಧ್ಯಾಯ ಶೀರ್ಷಿಕೆಯನ್ನು ಸೇರಿಸುವ ಮೂಲಕ ಮರುಪಡೆಯುವಿಕೆಯನ್ನು ಬಲಪಡಿಸುತ್ತೇನೆ.