ಘಟಕಗಳು
1. ಇತಿಹಾಸ ಮತ್ತು ಆರ್ಕೈವಿಂಗ್‌ನಲ್ಲಿ ಕೃತಕ ಬುದ್ಧಿಮತ್ತೆಯ ಪರಿಚಯ: ಪಾತ್ರಗಳು, ಗಡಿಗಳು, ಮೌಲ್ಯೀಕರಣ ಮತ್ತು ನೀತಿಶಾಸ್ತ್ರ 2. ಡಾಕ್ಯುಮೆಂಟ್ ಡಿಜಿಟೈಸೇಶನ್ ಮತ್ತು OCR: ಮುದ್ರಿತ ಪಠ್ಯವನ್ನು ಯಂತ್ರ ಪಠ್ಯಕ್ಕೆ ಪರಿವರ್ತಿಸುವುದು 3. ಪ್ರತಿಲೇಖನ: ಒಟ್ಟೋಮನ್ ಟರ್ಕಿಶ್ ಮತ್ತು ಹಸ್ತಪ್ರತಿಗಳು 4. ಮೆಟಾಡೇಟಾ, ಕ್ಯಾಟಲಾಗ್ ಮತ್ತು ವರ್ಗೀಕರಣ 5. ಮೂಲ ಸ್ಕ್ಯಾನಿಂಗ್, ಡಿಸ್ಕವರಿ ಮತ್ತು ಸಾರಾಂಶ 6. ಐತಿಹಾಸಿಕ ಅನುವಾದ ಮತ್ತು ಸರಳೀಕರಣ 7. ಮೂಲ ಪರಿಶೀಲನೆ, ಅನಾಕ್ರೊನಿಸಂ ಮತ್ತು ಭ್ರಮೆ 8. ವಿಷಯ ವಿಶ್ಲೇಷಣೆ ಮತ್ತು ಪ್ಯಾಟರ್ನ್ ಡಿಸ್ಕವರಿ 9. ಆರ್ಕೈವ್ ಪ್ರವೇಶ, ವಿವರಣೆ ಮತ್ತು ಬಳಕೆದಾರ ಸೇವೆಗಳು 10. ಸಂರಕ್ಷಣೆ, ಮರುಸ್ಥಾಪನೆ ಮತ್ತು ಡಿಜಿಟಲ್ ಸಂರಕ್ಷಣೆ 11. ನೀತಿಶಾಸ್ತ್ರ, ಹಕ್ಕುಸ್ವಾಮ್ಯ, ಗೌಪ್ಯತೆ ಮತ್ತು ಸಾಂಸ್ಕೃತಿಕ ಸೂಕ್ಷ್ಮತೆ 12. ಎಂಡ್-ಟು-ಎಂಡ್ ಪ್ರಾಜೆಕ್ಟ್: ಆರ್ಟಿಫಿಶಿಯಲ್ ಇಂಟೆಲಿಜೆನ್ಸ್‌ನೊಂದಿಗೆ ಆರ್ಕೈವ್ ಸಂಗ್ರಹವನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವುದು
ಘಟಕ 8 / 12

ವಿಷಯ ವಿಶ್ಲೇಷಣೆ ಮತ್ತು ಪ್ಯಾಟರ್ನ್ ಡಿಸ್ಕವರಿ

ಲಾಭಗಳು:

  • NER, ಸಂಬಂಧ ಹೊರತೆಗೆಯುವಿಕೆ, ಟೈಮ್‌ಲೈನ್ ಮತ್ತು ನೆಟ್‌ವರ್ಕ್ ವಿಶ್ಲೇಷಣೆಯಂತಹ ತಂತ್ರಗಳನ್ನು ಬಳಸಿಕೊಂಡು ದೊಡ್ಡ ಪಠ್ಯದ ಸೆಟ್‌ಗಳಿಂದ ಮಾದರಿಗಳನ್ನು ಹೊರತೆಗೆಯುವ ಸಾಮರ್ಥ್ಯ
  • ಮಾದರಿಯನ್ನು ಪುರಾವೆಗಿಂತ ಹೆಚ್ಚಾಗಿ ಊಹೆಯಾಗಿ ನೋಡಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ, ಮೂಲಕ್ಕೆ ಘಟಕಗಳನ್ನು ಲಿಂಕ್ ಮಾಡುವುದು ಮತ್ತು ಮಾನವ ಅನುಮೋದನೆಯೊಂದಿಗೆ ಅವುಗಳನ್ನು ಸಾಮಾನ್ಯಗೊಳಿಸುವುದು
  • ಕಾಣೆಯಾದ ಡೇಟಾ ಮತ್ತು ಮಾದರಿ ಪಕ್ಷಪಾತದಿಂದಾಗಿ ಸಂಖ್ಯೆಗಳು ಹೇಗೆ ತಪ್ಪುದಾರಿಗೆಳೆಯಬಹುದು ಎಂಬುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ಯೋಜಿತ ಸಂಬಂಧಗಳು ಮತ್ತು ಕಾಲಾನುಕ್ರಮಗಳನ್ನು ತಪ್ಪಿಸುವುದು.

ಐತಿಹಾಸಿಕ ಸಂಶೋಧನೆಯು ಕೇವಲ ವೈಯಕ್ತಿಕ ದಾಖಲೆಗಳನ್ನು ಓದುವುದಲ್ಲ; ಸಾಮಾನ್ಯವಾಗಿ ದಾಖಲೆಗಳ ದೊಡ್ಡ ಸೆಟ್‌ಗಳಲ್ಲಿ ಮಾದರಿಗಳನ್ನು ಹುಡುಕುತ್ತಿದೆ. ವರ್ಷಗಳಲ್ಲಿ ನಿರ್ದಿಷ್ಟ ಹೆಸರು ಯಾವ ಸಂದರ್ಭಗಳಲ್ಲಿ ಕಾಣಿಸಿಕೊಳ್ಳುತ್ತದೆ? ಯಾವ ಜನರು ವಸಾಹತುಗಳೊಂದಿಗೆ ಸಂಬಂಧ ಹೊಂದಿದ್ದಾರೆ? ಕಾಲಾನಂತರದಲ್ಲಿ ವಿಷಯವು ಹೇಗೆ ಬದಲಾಗುತ್ತದೆ? ಯಾರು ಯಾರೊಂದಿಗೆ ಪತ್ರ ವ್ಯವಹಾರ ನಡೆಸುತ್ತಿದ್ದಾರೆ? ಅಂತಹ ಪ್ರಶ್ನೆಗಳಿಗೆ ಒಂದೇ ಒಂದು ದಾಖಲೆಯನ್ನು ನೋಡದೆ, ನೂರಾರು ದಾಖಲೆಗಳನ್ನು ಒಟ್ಟಾಗಿ ನೋಡಬೇಕಾಗುತ್ತದೆ. ಇದನ್ನು ಸಾಮಾನ್ಯವಾಗಿ ಡಿಜಿಟಲ್ ಹ್ಯುಮಾನಿಟೀಸ್ ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ-ಇತಿಹಾಸ ಮತ್ತು ಸಾಹಿತ್ಯದಂತಹ ಕ್ಷೇತ್ರಗಳಿಗೆ ಕಂಪ್ಯೂಟೇಶನಲ್ ವಿಧಾನಗಳ ಅನ್ವಯ.

ದೊಡ್ಡ ಪಠ್ಯದ ಸೆಟ್‌ಗಳಿಂದ ರಚನಾತ್ಮಕ ಮಾಹಿತಿಯನ್ನು ಹೊರತೆಗೆಯುವಲ್ಲಿ AI ಶಕ್ತಿಯುತವಾಗಿದೆ. ಈ ಘಟಕದಲ್ಲಿ, ನೀವು NER (ಹೆಸರಿನ ಅಸ್ತಿತ್ವದ ಗುರುತಿಸುವಿಕೆ), ಮಾದರಿ ಮತ್ತು ಸಂಬಂಧದ ಹೊರತೆಗೆಯುವಿಕೆ, ವಿಷಯ ಮಾಡೆಲಿಂಗ್ ತರ್ಕ ಮತ್ತು ಟೈಮ್‌ಲೈನ್ ರಚನೆಯನ್ನು ಕಲಿಯುವಿರಿ; ಆದರೆ ನಾವು ಈ ತಂತ್ರಗಳ ಅತ್ಯಂತ ಅಪಾಯಕಾರಿ ಮೋಸವನ್ನು ಸಹ ಚರ್ಚಿಸುತ್ತೇವೆ - AI ಅಸ್ತಿತ್ವದಲ್ಲಿಲ್ಲದ ಮಾದರಿಯನ್ನು "ಕಂಡುಕೊಂಡಿದೆ" ಎಂದು ಸ್ವತಃ ಪ್ರಸ್ತುತಪಡಿಸುತ್ತದೆ.

ಮೂಲ ತಂತ್ರಗಳು

  • NER (ಹೆಸರಿನ ಅಸ್ತಿತ್ವದ ಗುರುತಿಸುವಿಕೆ): ಪಠ್ಯದಿಂದ ವ್ಯಕ್ತಿ, ಸ್ಥಳ, ಸಂಸ್ಥೆ, ದಿನಾಂಕದಂತಹ ಘಟಕಗಳ ಸ್ವಯಂಚಾಲಿತ ಹೊರತೆಗೆಯುವಿಕೆ. ಇದು ನಿಮಿಷಗಳಲ್ಲಿ "ಈ 500 ದಾಖಲೆಗಳಲ್ಲಿ ನಮೂದಿಸಲಾದ ಎಲ್ಲಾ ಸ್ಥಳದ ಹೆಸರುಗಳು" ನಂತಹ ಪಟ್ಟಿಯನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ.
  • ಸಂಬಂಧದ ತೀರ್ಮಾನ: ಘಟಕಗಳ ನಡುವಿನ ಸಂಬಂಧಗಳನ್ನು ಗುರುತಿಸುವುದು ("ವೈ ಸ್ಥಳದಲ್ಲಿ ವ್ಯಕ್ತಿ", "ಎ ಬಿ ಯೊಂದಿಗೆ ಅನುರೂಪವಾಗಿದೆ").
  • ವಿಷಯ ಮಾಡೆಲಿಂಗ್: ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯವಾಗಿ ಪಠ್ಯದ ದೊಡ್ಡ ಗುಂಪಿನಲ್ಲಿ ಪುನರಾವರ್ತಿತ ವಿಷಯಗಳ ಸಮೂಹಗಳನ್ನು ಕಂಡುಹಿಡಿಯುವುದು. ಯಾವ ಅವಧಿಯಲ್ಲಿ ಯಾವ ವಿಷಯಗಳು ಕೇಂದ್ರೀಕೃತವಾಗಿವೆ ಎಂಬುದನ್ನು ಇದು ತೋರಿಸುತ್ತದೆ.
  • ಟೈಮ್‌ಲೈನ್ ತೀರ್ಮಾನ: ದಾಖಲೆಗಳಲ್ಲಿ ದಿನಾಂಕದ ಘಟನೆಗಳನ್ನು ಕಾಲಾನುಕ್ರಮದಲ್ಲಿ ಜೋಡಿಸುವುದು.
  • ನೆಟ್‌ವರ್ಕ್ ವಿಶ್ಲೇಷಣೆ: ಅಂತರ-ವ್ಯಕ್ತಿ/ಸಾಂಸ್ಥಿಕ ಸಂಬಂಧಗಳನ್ನು ನೆಟ್‌ವರ್ಕ್‌ನಂತೆ ದೃಶ್ಯೀಕರಿಸುವುದು (ಯಾರು ಕೇಂದ್ರ, ಯಾರು ಸಂಪರ್ಕ ಬಿಂದು).

ಇವೆಲ್ಲವುಗಳ ಸಾಮಾನ್ಯ ಗುರಿಯು ಒಂದೇ ದಾಖಲೆಯಲ್ಲಿ ಕಂಡುಬರದ ಆದರೆ ಸಂಗ್ರಹದ ಉದ್ದಕ್ಕೂ ಗೋಚರಿಸುವ ರಚನೆಗಳನ್ನು ಬಹಿರಂಗಪಡಿಸುವುದು. ಈ ತಂತ್ರಗಳು ಗೋಚರ ಮಾದರಿಗಳನ್ನು ಮಾಡುತ್ತವೆ, ಅದು ಓದುವ ಮೂಲಕ ಮಾತ್ರ ಗೋಚರಿಸುವುದಿಲ್ಲ. ಆದರೆ ಅವುಗಳಲ್ಲಿ ಪ್ರತಿಯೊಂದೂ "ಚಿಹ್ನೆ", "ಸಾಕ್ಷ್ಯ" ಅಲ್ಲ; ಮೂಲ ದಾಖಲೆಯಲ್ಲಿ ಏನಿದೆ ಎಂಬುದನ್ನು ಪರಿಶೀಲಿಸುವುದು ಅತ್ಯಗತ್ಯ.

ಈ ಕ್ಷೇತ್ರದಲ್ಲಿ ಆಗಾಗ್ಗೆ ಬಳಸಲಾಗುವ ಪರಿಕಲ್ಪನೆಯು ನಿಕಟ ಓದುವಿಕೆ (ಒಂದು ಪಠ್ಯವನ್ನು ಆಳವಾಗಿ ಓದುವುದು, ಸಾಲಿನಿಂದ ಸಾಲನ್ನು ಓದುವುದು) ಮತ್ತು ದೂರದ ಓದುವಿಕೆ (ಸಂಖ್ಯೆಯ ನೂರಾರು/ಸಾವಿರಾರು ಪಠ್ಯಗಳನ್ನು ಒಟ್ಟಾರೆಯಾಗಿ, ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯವಾಗಿ ನೋಡುವುದು) ನಡುವಿನ ವ್ಯತ್ಯಾಸವಾಗಿದೆ. AI ರಿಮೋಟ್ ಆಗಿ ಓದುವುದನ್ನು ಸಾಧ್ಯವಾಗಿಸುತ್ತದೆ: ಒಂದೇ ಮಾನವ ಜೀವಿತಾವಧಿಯಲ್ಲಿ ಉಳಿಯುವಷ್ಟು ದೊಡ್ಡದಾದ ಕಾರ್ಪಸ್‌ನಲ್ಲಿ ನೀವು ಮಾದರಿಗಳನ್ನು ನೋಡುತ್ತೀರಿ. ಆದರೆ ದೂರದ ಓದುವಿಕೆ ಒಂದು ಮಾದರಿಯನ್ನು ಸೂಚಿಸಿದಾಗ, ಅದನ್ನು ಅರ್ಥ ಮಾಡಿಕೊಳ್ಳಲು ನಿಕಟ ಓದುವಿಕೆಗೆ, ಅಂದರೆ ಮೂಲ ದಾಖಲೆಗೆ ಹಿಂತಿರುಗುವುದು ಅವಶ್ಯಕ. ಎರಡು ವಿಧಾನಗಳು ಪರಸ್ಪರ ಬದಲಾಯಿಸಲಾಗುವುದಿಲ್ಲ; ಒಂದು ಮಾದರಿಯನ್ನು ತೋರಿಸುತ್ತದೆ, ಇನ್ನೊಂದು ಅದರ ಅರ್ಥವನ್ನು ನೀಡುತ್ತದೆ. ಅತ್ಯಂತ ದೃಢವಾದ ಸಂಶೋಧನೆಯು ಎರಡನ್ನೂ ಒಟ್ಟಿಗೆ ಬಳಸುತ್ತದೆ.

ಸಲಹೆ: ಮಾದರಿ ವಿಶ್ಲೇಷಣೆಯನ್ನು ಊಹೆ ಜನರೇಟರ್ ಆಗಿ ಬಳಸಿ: "AI ಇಲ್ಲಿ ಒಂದು ಮಾದರಿಯನ್ನು ಗುರುತಿಸಿದೆ, ಇದು ನಿಜವೇ?" ನಂತರ ಆ ಮಾದರಿಯನ್ನು ದಾಖಲೆಗಳಲ್ಲಿ ಒಂದೊಂದಾಗಿ ಪರಿಶೀಲಿಸಿ. ಮಾದರಿಯು ನಿಮ್ಮ ಸಂಶೋಧನೆಯ ಆರಂಭಿಕ ಹಂತವಾಗಿದೆ, ಫಲಿತಾಂಶವಲ್ಲ.

ಕೆಲಸದ ಹರಿವು: ಹಂತ ಹಂತವಾಗಿ

1. ಪ್ರಶ್ನೆಯನ್ನು ಸ್ಪಷ್ಟಪಡಿಸಿ. "ಈ ಸಂಗ್ರಹಣೆಯಲ್ಲಿ ಯಾವ ಜನರು ಹೆಚ್ಚಾಗಿ ಒಟ್ಟಿಗೆ ಕಾಣಿಸಿಕೊಳ್ಳುತ್ತಾರೆ?" ಎಂಬಂತಹ ಸ್ಪಷ್ಟ ಮಾದರಿಯ ಪ್ರಶ್ನೆ.

2. ಡೇಟಾವನ್ನು ತಯಾರಿಸಿ ಮತ್ತು ಲೇಬಲ್ ಮಾಡಿ. ಮೂಲ ಉಲ್ಲೇಖಗಳೊಂದಿಗೆ ಪಠ್ಯವನ್ನು ಆಯೋಜಿಸಿ ಇದರಿಂದ ಕಂಡುಬರುವ ಯಾವುದೇ ಸ್ವತ್ತುಗಳನ್ನು ಡಾಕ್ಯುಮೆಂಟ್‌ಗೆ ಮತ್ತೆ ಲಿಂಕ್ ಮಾಡಬಹುದು.

3. ಘಟಕ/ಮಾದರಿಯು ಕಾಣಿಸಿಕೊಳ್ಳುತ್ತದೆ. AI ಜೊತೆಗೆ NER, ಸಂಬಂಧ ಅಥವಾ ಟೈಮ್‌ಲೈನ್ ಔಟ್‌ಲೈನ್ ಅನ್ನು ರಚಿಸಿ.

4. ಸಾಧಾರಣಗೊಳಿಸಿ. ಒಂದೇ ವ್ಯಕ್ತಿ/ಸ್ಥಳದ ವಿಭಿನ್ನ ಕಾಗುಣಿತಗಳನ್ನು ಸಂಯೋಜಿಸಿ ("ಇಸ್ತಾನ್‌ಬುಲ್ / ಇಸ್ತಾನ್‌ಬುಲ್ / ಕೊಸ್ಟಾಂಟಿನಿಯೆ" ಅದೇ ಸ್ಥಳ?). ಈ ಹಂತವು ನಿರ್ಣಾಯಕವಾಗಿದೆ; ಅದನ್ನು ಬಿಟ್ಟುಬಿಟ್ಟರೆ, ಮಾದರಿಯು ಕುಸಿಯುತ್ತದೆ.

5. ದಾಖಲೆಯಲ್ಲಿ ಪರಿಶೀಲಿಸಿ. ಫ್ಲ್ಯಾಗ್ ಮಾಡಲಾದ ಯಾವುದೇ ಗಮನಾರ್ಹ ಮಾದರಿಗಳಿಗಾಗಿ ನಿಜವಾದ ದಾಖಲೆಗಳನ್ನು ಪರಿಶೀಲಿಸಿ. AI ಮೇಡ್-ಅಪ್ ಲಿಂಕ್ ಅನ್ನು ಸೇರಿಸುವುದಿಲ್ಲ ಎಂದು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಿ.

6. ಕಾಮೆಂಟ್. ಮಾದರಿ ಎಂದರೆ ಇತಿಹಾಸಕಾರನ ತೀರ್ಪು; AI ಕೇವಲ ಮಾದರಿಯನ್ನು ಗುರುತಿಸುತ್ತದೆ.

ಸಂಖ್ಯೆ ಮತ್ತು ಅಂಕಿಅಂಶಗಳ ಬಲೆ

ಪ್ಯಾಟರ್ನ್ ವಿಶ್ಲೇಷಣೆ ಸಾಮಾನ್ಯವಾಗಿ ಸಂಖ್ಯೆಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ: "ಹೆಸರು X 47 ಬಾರಿ ಸಂಭವಿಸುತ್ತದೆ", "ಈ ಥೀಮ್ 30% ದಾಖಲೆಗಳಲ್ಲಿ ಇರುತ್ತದೆ". ಈ ಸಂಖ್ಯೆಗಳು ವಸ್ತುನಿಷ್ಠವಾಗಿ ತೋರುತ್ತದೆ ಆದರೆ ತಪ್ಪುದಾರಿಗೆಳೆಯಬಹುದು:

  • ಕಾಣೆಯಾದ ಡೇಟಾ: ಸಂಗ್ರಹಣೆಯು ಈಗಾಗಲೇ ಅಪೂರ್ಣವಾಗಿದ್ದರೆ (ದಾಖಲೆಗಳು ಕಳೆದುಹೋಗಿವೆ, ಒಂದು ಗುಂಪನ್ನು ಎಂದಿಗೂ ದಾಖಲಿಸಲಾಗಿಲ್ಲ), ಸಂಖ್ಯೆಯು ಉಳಿದಿರುವ ದಾಖಲೆಗಳನ್ನು ಪ್ರತಿಬಿಂಬಿಸುತ್ತದೆ, ವಾಸ್ತವವಲ್ಲ.
  • ಸಾಮಾನ್ಯೀಕರಣ ದೋಷ: ಒಂದೇ ವ್ಯಕ್ತಿಯನ್ನು ವಿಭಿನ್ನವಾಗಿ ಉಚ್ಚರಿಸಿದರೆ ಮತ್ತು ಪ್ರತ್ಯೇಕವಾಗಿ ಎಣಿಸಿದರೆ, ಸಂಖ್ಯೆಯು ತಪ್ಪಾಗಿರುತ್ತದೆ.
  • ಸಂದರ್ಭದ ನಷ್ಟ: "47 ಬಾರಿ ಸಂಭವಿಸುತ್ತದೆ" ಏನನ್ನೂ ಹೇಳುವುದಿಲ್ಲ; ಅದನ್ನು ಹೇಗೆ ರವಾನಿಸಲಾಗಿದೆ (ಧನಾತ್ಮಕ/ಋಣಾತ್ಮಕ, ವಿಷಯ/ವಸ್ತು) ಎಂಬುದು ಮುಖ್ಯ.

ಮಾದರಿಯ ಔಟ್ಪುಟ್

ಸ್ಪಷ್ಟ ಅರ್ಥ

ನಿಜವಾದ ಅಪಾಯ

"X 47 ಬಾರಿ ಸಂಭವಿಸುತ್ತದೆ"

ಪ್ರಮುಖ ವ್ಯಕ್ತಿ

ಅಪೂರ್ಣ ಸಂಗ್ರಹ, ಕಾಗುಣಿತ ವ್ಯತ್ಯಾಸ

"ಥೀಮ್ 30%"

ಪ್ರಬಲ ವಿಷಯ

ಮಾದರಿ ಪಕ್ಷಪಾತ

"ಎ-ಬಿ ಆಗಾಗ್ಗೆ ಒಟ್ಟಿಗೆ"

ನಿಕಟ ಸಂಬಂಧ

ಕಾಕತಾಳೀಯ, ಕಾಣೆಯಾದ ಸಂದರ್ಭ

"ಟೈಮ್ಲೈನ್"

ನಿಖರವಾದ ಕಾಲಗಣನೆ

ದಿನಾಂಕವಿಲ್ಲದ ದಾಖಲೆಗಳು, ಫ್ಯಾಬ್ರಿಕೇಟೆಡ್ ಆರ್ಡರ್

ಮೂರು ಸಣ್ಣ ಪ್ರಕರಣಗಳು

ಪ್ರಕರಣ 1 - ನೆಟ್‌ವರ್ಕ್ ವಿಶ್ಲೇಷಣೆಯು ಗುಪ್ತ ಮಧ್ಯವರ್ತಿಯನ್ನು ಬಹಿರಂಗಪಡಿಸಿದೆ. ಒಬ್ಬ ಸಂಶೋಧಕರು 800 ಪತ್ರಗಳ ಪತ್ರವ್ಯವಹಾರ ಸಂಗ್ರಹವನ್ನು ಪರಿಶೀಲಿಸಿದರು. AI ಯೊಂದಿಗೆ, ಯಾರಿಗೆ ಬರೆದರು ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸಲಾಯಿತು ಮತ್ತು ನೆಟ್‌ವರ್ಕ್ ರಚಿಸಲಾಗಿದೆ. ಮೊದಲ ನೋಟದಲ್ಲಿ ತೋರಿಕೆಯಲ್ಲಿ ಅತ್ಯಲ್ಪ ವ್ಯಕ್ತಿ ವಾಸ್ತವವಾಗಿ ಎರಡು ಗುಂಪುಗಳ ನಡುವಿನ ಸಂಪರ್ಕದ ಪ್ರಮುಖ ಅಂಶವಾಗಿದೆ ಎಂದು ನೆಟ್ವರ್ಕ್ ತೋರಿಸಿದೆ. ಸಂಶೋಧಕರು ಈ ವ್ಯಕ್ತಿಯ ಪತ್ರಗಳ ಮೇಲೆ ಕೇಂದ್ರೀಕರಿಸಿದರು ಮತ್ತು ಹೊಸ ಸಂಶೋಧನೆಯನ್ನು ತಲುಪಿದರು. ಆದರೆ ಮೊದಲು ದಾಖಲೆಗಳಲ್ಲಿರುವ ಎಲ್ಲಾ ಲಿಂಕ್‌ಗಳನ್ನು ಪರಿಶೀಲಿಸಿದೆ.

ಪ್ರಕರಣ 2 - ಸಾಮಾನ್ಯೀಕರಣ ದೋಷವು ಸಂಖ್ಯೆಯನ್ನು ಭ್ರಷ್ಟಗೊಳಿಸಿದೆ. ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳಲ್ಲಿ ಒಂದು ಸ್ಥಳವು ಎಷ್ಟು ಬಾರಿ ಕಾಣಿಸಿಕೊಂಡಿದೆ ಎಂಬುದನ್ನು ವಿದ್ಯಾರ್ಥಿಯೊಬ್ಬನು ಎಣಿಸುವಂತೆ ಮಾಡಿದ್ದಾನೆ. AI ಒಂದೇ ಸ್ಥಳದ ಮೂರು ವಿಭಿನ್ನ ಕಾಗುಣಿತಗಳನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ಎಣಿಸಿದ ಕಾರಣ, ಸಂಖ್ಯೆಯು ನೈಜ ಸಂಖ್ಯೆಯ ಮೂರನೇ ಒಂದು ಭಾಗವಾಗಿದೆ. ಕಾಗುಣಿತಗಳನ್ನು ಒಟ್ಟುಗೂಡಿಸಿದಾಗ, ಸ್ಥಳವು ಹೆಚ್ಚಾಗಿ ಸಂಭವಿಸುವ ಮೂರನೇ ಸ್ಥಾನದಲ್ಲಿತ್ತು. ಪಾಠ: ಸಾಮಾನ್ಯೀಕರಣವಿಲ್ಲದೆ ಸಂಖ್ಯೆಯನ್ನು ನಂಬಲಾಗುವುದಿಲ್ಲ.

ಪ್ರಕರಣ 3 - ಮೇಡ್-ಅಪ್ ಟೈಮ್‌ಲೈನ್. ಸಂಶೋಧಕರು ದಿನಾಂಕವಿಲ್ಲದ ದಾಖಲೆಗಳಿಂದ ಟೈಮ್‌ಲೈನ್ ಅನ್ನು ರಚಿಸಿದ್ದಾರೆ. AI ಅಜ್ಞಾತ ಘಟನೆಗಳನ್ನು "ತಾರ್ಕಿಕ" ಕ್ರಮದಲ್ಲಿ ಜೋಡಿಸಿತು ಮತ್ತು ನಿಖರವಾದ ಕಾಲಗಣನೆಯನ್ನು ಪ್ರಸ್ತುತಪಡಿಸಿತು. ಆದಾಗ್ಯೂ, ಈ ಅನುಕ್ರಮವು ದಾಖಲೆಗಳಲ್ಲಿ ಇರಲಿಲ್ಲ, AI ಅದನ್ನು ರಚಿಸಿದೆ. ಪಾಠ: ಡಾಕ್ಯುಮೆಂಟ್‌ನಲ್ಲಿ ದಿನಾಂಕವನ್ನು ಹೊಂದಿರುವ ಈವೆಂಟ್‌ಗಳಿಂದ ಮಾತ್ರ ಟೈಮ್‌ಲೈನ್ ಅನ್ನು ನಿರ್ಮಿಸಲಾಗಿದೆ; ಉಳಿದವು "ದಿನಾಂಕರಹಿತ"ವಾಗಿ ಉಳಿದಿವೆ.

ನಾಲ್ಕು ನಕಲಿಸಬಹುದಾದ ಟೆಂಪ್ಲೇಟ್‌ಗಳು

1) NER (ಅಸ್ಥಿ ನಿರ್ಣಯ):

ಕೆಳಗಿನ ದಾಖಲೆಗಳಲ್ಲಿ ನಮೂದಿಸಲಾದ ವ್ಯಕ್ತಿಗಳು, ಸ್ಥಳಗಳು, ಸಂಸ್ಥೆಗಳು ಮತ್ತು ದಿನಾಂಕಗಳು ಪ್ರತ್ಯೇಕ ಪಟ್ಟಿಗಳಾಗಿ ಕಂಡುಬರುತ್ತವೆ. ಪ್ರತಿ ಘಟಕವನ್ನು ಯಾವ ದಾಖಲೆಯಲ್ಲಿ (ಉಲ್ಲೇಖ) ಉಲ್ಲೇಖಿಸಲಾಗಿದೆ ಎಂಬುದನ್ನು ಸೂಚಿಸಿ. ಪಠ್ಯದಲ್ಲಿ ಸ್ಪಷ್ಟವಾಗಿ ಹೇಳಿರುವುದನ್ನು ಮಾತ್ರ ತೆಗೆದುಕೊಳ್ಳಿ; ಊಹೆ ಮೂಲಕ ಸೇರಿಸಿ. ಉಚ್ಚಾರಣೆಯ ಬಗ್ಗೆ ನಿಮಗೆ ಖಚಿತವಿಲ್ಲದಿದ್ದರೆ [?] ಗುರುತಿಸಿ. ದಾಖಲೆಗಳು: [ಇಲ್ಲಿ]

2) ಘಟಕದ ಸಾಮಾನ್ಯೀಕರಣ:

ಕೆಳಗಿನ ಘಟಕದ ಪಟ್ಟಿಯಲ್ಲಿ, ಒಂದೇ ವ್ಯಕ್ತಿ/ಸ್ಥಳವಾಗಿರಬಹುದಾದ ವಿಭಿನ್ನ ಕಾಗುಣಿತಗಳನ್ನು ಗುಂಪು ಮಾಡಿ (ಉದಾ. "ಇಸ್ತಾನ್‌ಬುಲ್ / ಕೊಸ್ಟಾಂಟಿನಿಯೆ"). ಪ್ರತಿ ಗುಂಪಿಗೆ ಸಂಭವನೀಯ ಸಾಮಾನ್ಯ ಸ್ವರೂಪವನ್ನು ಸೂಚಿಸಿ ಆದರೆ ನಿಖರವಾದ ಸಂಯೋಜನೆಯನ್ನು ವಿಧಿಸಬೇಡಿ; "ಬಹುಶಃ ಅದೇ ಇರಬಹುದು, ಜನರು ಪರಿಶೀಲಿಸಲಿ" ಎಂಬ ಟಿಪ್ಪಣಿಯನ್ನು ಸೇರಿಸಿ. ನಿಮಗೆ ಖಚಿತವಿಲ್ಲದಿದ್ದರೆ ಅದನ್ನು ಬಿಟ್ಟುಬಿಡಿ. ಪಟ್ಟಿ: [ಇಲ್ಲಿ]

3) ಸಂಬಂಧ/ನೆಟ್‌ವರ್ಕ್ ಔಟ್‌ಲೈನ್:

ಈ ಕೆಳಗಿನ ಪತ್ರವ್ಯವಹಾರ/ದಾಖಲೆಗಳಿಂದ "ಯಾರಿಗೆ ಸಂಬಂಧಿಸಿದವರು" ಲಿಂಕ್‌ಗಳನ್ನು ಹೊರತೆಗೆಯಿರಿ. ಪ್ರತಿ ಲಿಂಕ್‌ಗೆ, ಇದು ಯಾವ ಡಾಕ್ಯುಮೆಂಟ್ (ಉಲ್ಲೇಖ) ಆಧರಿಸಿದೆ ಎಂಬುದನ್ನು ಸೂಚಿಸಿ. ಡಾಕ್ಯುಮೆಂಟ್‌ನಲ್ಲಿ ಸ್ಪಷ್ಟವಾಗಿಲ್ಲದ ಸಂಬಂಧವನ್ನು ರಚಿಸಲಾಗಿದೆ. ಅಸ್ಪಷ್ಟ ಲಿಂಕ್‌ಗಳನ್ನು ಗುರುತಿಸಿ [ಅಸ್ಪಷ್ಟ]. ದಾಖಲೆ: [ಇಲ್ಲಿ]

4) ದಿನಾಂಕದ ಟೈಮ್‌ಲೈನ್:

ಈ ಕೆಳಗಿನ ದಾಖಲೆಗಳಲ್ಲಿ ಸ್ಪಷ್ಟವಾಗಿ ಹೇಳಲಾದ ಘಟನೆಗಳನ್ನು ಮಾತ್ರ ಕಾಲಾನುಕ್ರಮದಲ್ಲಿ ಪಟ್ಟಿ ಮಾಡಿ; ಪ್ರತಿಯೊಂದು ಈವೆಂಟ್ ಅನ್ನು ಅದರ ಮೂಲಕ್ಕೆ ಲಿಂಕ್ ಮಾಡಿ. ಅನಿಶ್ಚಿತ ದಿನಾಂಕಗಳೊಂದಿಗೆ ಈವೆಂಟ್‌ಗಳನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ "ದಿನಾಂಕಿತ" ಶೀರ್ಷಿಕೆಯಡಿಯಲ್ಲಿ ಪಟ್ಟಿ ಮಾಡಿ, ಅವುಗಳನ್ನು ಕ್ರಮವಾಗಿ ಇರಿಸಬೇಡಿ. ಅಂದಾಜು ದಿನಾಂಕವನ್ನು ಮಾಡಬೇಡಿ. ದಾಖಲೆ: [ಇಲ್ಲಿ]

ದುರ್ಬಲ ಪ್ರಾಂಪ್ಟ್ / ಬಲವಾದ ಪ್ರಾಂಪ್ಟ್

ದುರ್ಬಲ:

ಈ ದಾಖಲೆಗಳನ್ನು ವಿಶ್ಲೇಷಿಸಿ ಮತ್ತು ಪ್ರಮುಖ ಮಾದರಿಗಳು, ಸಂಬಂಧಗಳು ಮತ್ತು ಟೈಮ್‌ಲೈನ್‌ಗಳನ್ನು ಹೊರತೆಗೆಯಿರಿ.

"ಪ್ರಮುಖ ಮಾದರಿಗಳನ್ನು ಹೊರತೆಗೆಯಿರಿ" ಅಸ್ತಿತ್ವದಲ್ಲಿಲ್ಲದ ಸಂಪರ್ಕಗಳು ಮತ್ತು ನಿಖರವಾದ ಕಾಲಾನುಕ್ರಮಗಳನ್ನು ಆವಿಷ್ಕರಿಸಲು AI ಅನ್ನು ತಳ್ಳುತ್ತದೆ, ಸಾಮಾನ್ಯೀಕರಣವಿಲ್ಲದೆ ಸಂಖ್ಯೆಗಳನ್ನು ಪ್ರಸ್ತುತಪಡಿಸುತ್ತದೆ.

ಪ್ರಬಲ:

ಪ್ರತಿಯೊಂದನ್ನೂ ಡಾಕ್ಯುಮೆಂಟ್ ಉಲ್ಲೇಖಕ್ಕೆ ಸಂಪರ್ಕಿಸುವ ಮೂಲಕ ಈ ಕೆಳಗಿನ ದಾಖಲೆಗಳಿಂದ ವ್ಯಕ್ತಿ/ಸ್ಥಳ/ಸಂಸ್ಥೆಯ ಘಟಕಗಳನ್ನು ಹೊರತೆಗೆಯುತ್ತದೆ. "ವಿಲೀನಗೊಳ್ಳಬಹುದು" ಎಂದು ಒಂದೇ ಆಗಿರುವ ವಿಭಿನ್ನ ಕಾಗುಣಿತಗಳನ್ನು ಗುರುತಿಸಿ, ಆದರೆ ವಿಲೀನಗೊಳಿಸಬೇಡಿ. ಡಾಕ್ಯುಮೆಂಟ್‌ನಲ್ಲಿ ಸ್ಪಷ್ಟವಾಗಿ ಹೇಳದಿರುವ ಸಂಬಂಧಗಳು ಮತ್ತು ಅನಿಶ್ಚಿತ ದಿನಾಂಕಗಳೊಂದಿಗೆ ಘಟನೆಗಳು ನಕಲಿಯಾಗುವುದಿಲ್ಲ; ದಿನಾಂಕಗಳಿಲ್ಲದವರನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ಇರಿಸಿ. ದಾಖಲೆ: [ಇಲ್ಲಿ]

ವ್ಯತ್ಯಾಸ: ಮೂಲಕ್ಕೆ ಆಟ್ರಿಬ್ಯೂಷನ್, ಮನುಷ್ಯರಿಗೆ ಸಾಮಾನ್ಯೀಕರಣವನ್ನು ಬಿಟ್ಟುಬಿಡುವುದು, ಕಾಲ್ಪನಿಕ ಸಂಬಂಧಗಳು/ಇತಿಹಾಸವನ್ನು ನಿಷೇಧಿಸುವುದು ಮತ್ತು ದಿನಾಂಕವಿಲ್ಲದ ಘಟನೆಗಳ ಪ್ರತ್ಯೇಕತೆಯು ಮಾದರಿಯನ್ನು ಸಮರ್ಥಿಸುತ್ತದೆ.

ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು

  • ಸಾಕ್ಷ್ಯಕ್ಕಾಗಿ ಮಾದರಿಯನ್ನು ತಪ್ಪಾಗಿ ಗ್ರಹಿಸುವುದು. ಮಾದರಿಯು ಊಹೆಯಾಗಿದೆ; ಡಾಕ್ಯುಮೆಂಟ್‌ನಲ್ಲಿ ಪರಿಶೀಲಿಸಲಾಗಿದೆ.
  • ಸಾಮಾನ್ಯೀಕರಣವನ್ನು ಬಿಟ್ಟುಬಿಡುವುದು. ಒಂದೇ ಘಟಕದ ವಿಭಿನ್ನ ಕಾಗುಣಿತಗಳು ಸಂಖ್ಯೆ ಮತ್ತು ನೆಟ್‌ವರ್ಕ್ ಅನ್ನು ವಿರೂಪಗೊಳಿಸುತ್ತವೆ.
  • ಸಂಖ್ಯೆಯಲ್ಲಿ ಕುರುಡು ನಂಬಿಕೆ. ಅಪೂರ್ಣ ಸಂಗ್ರಹಣೆ ಮತ್ತು ಮಾದರಿ ಪಕ್ಷಪಾತವು ಸಂಖ್ಯೆಯನ್ನು ತಪ್ಪುದಾರಿಗೆಳೆಯುವಂತೆ ಮಾಡುತ್ತದೆ.
  • ಸಿದ್ಧಪಡಿಸಿದ ಟೈಮ್‌ಲೈನ್. ದಿನಾಂಕವಿಲ್ಲದ ಘಟನೆಗಳನ್ನು ಕಾಲಗಣನೆಯಲ್ಲಿ ಸೇರಿಸಲಾಗಿಲ್ಲ.
  • ಸಂದರ್ಭವನ್ನು ನಿರ್ಲಕ್ಷಿಸಲಾಗುತ್ತಿದೆ. "ಎಷ್ಟು ಬಾರಿ ಪಾಸಾಯಿತು" ಎಂಬುದಲ್ಲ, "ಹೇಗೆ ಪಾಸಾಯಿತು" ಎಂಬುದು ಮುಖ್ಯ.

ಸಾರಾಂಶದಲ್ಲಿ

ವಿಷಯ ವಿಶ್ಲೇಷಣೆ ಮತ್ತು ಮಾದರಿ ಅನ್ವೇಷಣೆಯು ಪ್ರಬಲವಾದ ಕ್ಷೇತ್ರವಾಗಿದ್ದು, AI ಕೇವಲ ಓದುವ ಮೂಲಕ ಗೋಚರಿಸದ ರಚನೆಗಳನ್ನು ಮಾಡುತ್ತದೆ: ಘಟಕದ ಹೊರತೆಗೆಯುವಿಕೆ, ಸಂಬಂಧ ನೆಟ್‌ವರ್ಕ್‌ಗಳು, ವಿಷಯ ಕ್ಲಸ್ಟರ್‌ಗಳು, ಟೈಮ್‌ಲೈನ್‌ಗಳು. ಆದರೆ ಪ್ರತಿ ಮಾದರಿಯು ಒಂದು ಊಹೆಯಾಗಿದೆ, ಪುರಾವೆಯಲ್ಲ. ಸ್ವತ್ತುಗಳನ್ನು ಮೂಲಕ್ಕೆ ಲಿಂಕ್ ಮಾಡಿ, ಎಚ್ಚರಿಕೆಯಿಂದ ಮತ್ತು ಮಾನವ ಊರ್ಜಿತಗೊಳಿಸುವಿಕೆಯೊಂದಿಗೆ ಸಾಮಾನ್ಯಗೊಳಿಸಿ, ಕಾಣೆಯಾದ ಡೇಟಾ ಮತ್ತು ಪಕ್ಷಪಾತಕ್ಕಾಗಿ ಪ್ರಶ್ನೆ ಸಂಖ್ಯೆಗಳು, ಯೋಜಿತ ಸಂಬಂಧಗಳು ಮತ್ತು ಕಾಲಾನುಕ್ರಮಗಳನ್ನು ತಪ್ಪಿಸಿ. AI ಮಾದರಿಯನ್ನು ಗುರುತಿಸುತ್ತದೆ; ಇದರ ಅರ್ಥವೇನು ಮತ್ತು ಅದು ನಿಜವೇ ಎಂಬುದು ಇತಿಹಾಸಕಾರರ ತೀರ್ಪು.

ಅಪ್ಲಿಕೇಶನ್ ಕಾರ್ಯ

ಕನಿಷ್ಠ 15 ದಾಖಲೆಗಳ ತುಣುಕುಗಳನ್ನು ಸಂಗ್ರಹಿಸಿ (ಉಲ್ಲೇಖಗಳೊಂದಿಗೆ). "NER" ಟೆಂಪ್ಲೇಟ್‌ನೊಂದಿಗೆ ವ್ಯಕ್ತಿ ಮತ್ತು ಸ್ಥಳ ಘಟಕಗಳನ್ನು ಹೊರತೆಗೆಯಿರಿ. ನಂತರ ವಿವಿಧ ಕಾಗುಣಿತಗಳನ್ನು "ಎಂಟಿಟಿ ಸಾಮಾನ್ಯೀಕರಣ" ದೊಂದಿಗೆ ಗುಂಪು ಮಾಡಿ ಮತ್ತು ಗುಂಪುಗಳನ್ನು ನೀವೇ ಪರಿಶೀಲಿಸಿ. ಅಂತಿಮವಾಗಿ, "ದಿನಾಂಕದ ಟೈಮ್‌ಲೈನ್" ಟೆಂಪ್ಲೇಟ್ ಅನ್ನು ರನ್ ಮಾಡಿ ಮತ್ತು ಎಷ್ಟು ಈವೆಂಟ್‌ಗಳು "ದಿನಾಂಕವಿಲ್ಲ" ಎಂದು ನೋಡಿ. ಕಳಪೆ ಪ್ರಾಂಪ್ಟಿಂಗ್‌ನೊಂದಿಗೆ AI ಎಷ್ಟು ಸಂಯೋಜಿತ ಲಿಂಕ್‌ಗಳು ಅಥವಾ ಕಾಲಾನುಕ್ರಮಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ಹೋಲಿಕೆ ಮಾಡಿ.

ಪರಿಶೀಲನಾಪಟ್ಟಿ

  • [ ] ನನ್ನ ಮಾದರಿಯ ಪ್ರಶ್ನೆಯನ್ನು ನಾನು ಸ್ಪಷ್ಟವಾಗಿ ವ್ಯಾಖ್ಯಾನಿಸಿದ್ದೇನೆ.
  • [ ] ನಾನು ಪ್ರತಿ ಘಟಕವನ್ನು ಡಾಕ್ಯುಮೆಂಟ್ ಉಲ್ಲೇಖಕ್ಕೆ ಲಿಂಕ್ ಮಾಡಿದ್ದೇನೆ.
  • [ ] ನಾನು ಅಸ್ತಿತ್ವದ ಟೈಪಿಂಗ್ ಅನ್ನು ಸಾಮಾನ್ಯಗೊಳಿಸಿದೆ ಮತ್ತು ಅದನ್ನು ಮಾನವ ಅನುಮೋದನೆಯೊಂದಿಗೆ ಸಂಯೋಜಿಸಿದೆ.
  • [ ] ಕಾಣೆಯಾದ ಡೇಟಾ ಮತ್ತು ಪಕ್ಷಪಾತಕ್ಕಾಗಿ ನಾನು ಸಂಖ್ಯೆಗಳನ್ನು ಪ್ರಶ್ನಿಸಿದೆ.
  • [ ] ನಾನು ದಿನಾಂಕವಿಲ್ಲದ ಘಟನೆಗಳನ್ನು ಕಾಲಾನುಕ್ರಮದಲ್ಲಿ ಇರಿಸಲಿಲ್ಲ, ನಾನು ಅವುಗಳನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ಇರಿಸಿದೆ.