യൂണിറ്റുകൾ
1. ചരിത്രത്തിലും ആർക്കൈവിംഗിലും ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിൻ്റെ ആമുഖം: റോളുകൾ, അതിരുകൾ, മൂല്യനിർണ്ണയം, ധാർമ്മികത 2. ഡോക്യുമെൻ്റ് ഡിജിറ്റൈസേഷനും OCR: അച്ചടിച്ച ടെക്‌സ്‌റ്റിനെ മെഷീൻ ടെക്‌സ്‌റ്റാക്കി മാറ്റുന്നു 3. ട്രാൻസ്ക്രിപ്ഷൻ: ഓട്ടോമൻ ടർക്കിഷ്, കയ്യെഴുത്തുപ്രതികൾ 4. മെറ്റാഡാറ്റ, കാറ്റലോഗിംഗ്, വർഗ്ഗീകരണം 5. ഉറവിട സ്കാനിംഗ്, കണ്ടെത്തൽ, സംഗ്രഹം 6. ചരിത്രപരമായ വിവർത്തനവും ലളിതവൽക്കരണവും 7. ഉറവിട പരിശോധന, അനാക്രോണിസം, ഹാലുസിനേഷൻ 8. ഉള്ളടക്ക വിശകലനവും പാറ്റേൺ കണ്ടെത്തലും 9. ആർക്കൈവ് ആക്സസ്, വിവരണം, ഉപയോക്തൃ സേവനങ്ങൾ 10. സംരക്ഷണം, പുനഃസ്ഥാപനം, ഡിജിറ്റൽ സംരക്ഷണം 11. ധാർമ്മികത, പകർപ്പവകാശം, സ്വകാര്യത, സാംസ്കാരിക സംവേദനക്ഷമത 12. എൻഡ്-ടു-എൻഡ് പ്രോജക്റ്റ്: ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഉപയോഗിച്ച് ഒരു ആർക്കൈവ് ശേഖരം പ്രോസസ്സ് ചെയ്യുന്നു
യൂണിറ്റ് 8 / 12

ഉള്ളടക്ക വിശകലനവും പാറ്റേൺ കണ്ടെത്തലും

നേട്ടങ്ങൾ:

  • NER, റിലേഷൻഷിപ്പ് എക്‌സ്‌ട്രാക്‌ഷൻ, ടൈംലൈൻ, നെറ്റ്‌വർക്ക് വിശകലനം എന്നിവ പോലുള്ള ടെക്‌നിക്കുകൾ ഉപയോഗിച്ച് വലിയ സെറ്റ് ടെക്‌സ്‌റ്റിൽ നിന്ന് പാറ്റേണുകൾ എക്‌സ്‌ട്രാക്റ്റുചെയ്യാനുള്ള കഴിവ്
  • പാറ്റേണിനെ തെളിവുകളേക്കാൾ ഒരു സിദ്ധാന്തമായി കാണാൻ കഴിയും, എൻ്റിറ്റികളെ ഉറവിടവുമായി ബന്ധിപ്പിക്കുകയും മനുഷ്യ അംഗീകാരത്തോടെ അവയെ സാധാരണമാക്കുകയും ചെയ്യുന്നു
  • നഷ്‌ടമായ ഡാറ്റയും സാമ്പിൾ പക്ഷപാതവും കാരണം സംഖ്യകൾ എങ്ങനെ തെറ്റിദ്ധരിപ്പിക്കപ്പെടുന്നുവെന്ന് മനസിലാക്കാനും ആസൂത്രിതമായ ബന്ധങ്ങളും കാലഗണനകളും ഒഴിവാക്കാനുമുള്ള കഴിവ്.

ചരിത്രാന്വേഷണം എന്നത് കേവലം വ്യക്തിഗത രേഖകളുടെ വായന മാത്രമല്ല; പലപ്പോഴും പ്രമാണങ്ങളുടെ വലിയ സെറ്റുകളിൽ പാറ്റേണുകൾ തിരയുന്നു. വർഷങ്ങളായി ഏത് സന്ദർഭങ്ങളിലാണ് ഒരു പ്രത്യേക പേര് പ്രത്യക്ഷപ്പെടുന്നത്? ഏത് ആളുകളാണ് സെറ്റിൽമെൻ്റുമായി ബന്ധപ്പെട്ടിരിക്കുന്നത്? കാലത്തിനനുസരിച്ച് ഒരു വിഷയം എങ്ങനെ മാറുന്നു? ആരാണ് ആരുമായാണ് ആശയവിനിമയം നടത്തുന്നത്? അത്തരം ചോദ്യങ്ങൾക്ക് ഒരു രേഖയിലല്ല, നൂറുകണക്കിന് രേഖകൾ ഒന്നിച്ച് നോക്കേണ്ടതുണ്ട്. ഇതിനെ പലപ്പോഴും ഡിജിറ്റൽ ഹ്യുമാനിറ്റീസ് എന്ന് വിളിക്കുന്നു-ചരിത്രം, സാഹിത്യം തുടങ്ങിയ മേഖലകളിൽ കമ്പ്യൂട്ടേഷണൽ രീതികളുടെ പ്രയോഗം.

വലിയ ടെക്‌സ്‌റ്റുകളിൽ നിന്ന് ഘടനാപരമായ വിവരങ്ങൾ എക്‌സ്‌ട്രാക്റ്റുചെയ്യുന്നതിൽ AI ശക്തമാണ്. ഈ യൂണിറ്റിൽ, നിങ്ങൾ NER (എൻ്റിറ്റി തിരിച്ചറിയൽ) പാറ്റേണും ബന്ധവും വേർതിരിച്ചെടുക്കൽ, വിഷയ മോഡലിംഗ് ലോജിക്, ടൈംലൈൻ സൃഷ്ടിക്കൽ എന്നിവ പഠിക്കും; എന്നാൽ ഈ സാങ്കേതിക വിദ്യകളുടെ ഏറ്റവും അപകടകരമായ കെണിയെ കുറിച്ചും ഞങ്ങൾ ചർച്ച ചെയ്യും - നിലവിലില്ലാത്ത ഒരു പാറ്റേൺ "കണ്ടെത്തിയതായി" സ്വയം അവതരിപ്പിക്കുന്ന AI.

അടിസ്ഥാന സാങ്കേതിക വിദ്യകൾ

  • NER (പേരുള്ള എൻ്റിറ്റി റെക്കഗ്നിഷൻ): വ്യക്തി, സ്ഥലം, സ്ഥാപനം, വാചകത്തിൽ നിന്നുള്ള തീയതി തുടങ്ങിയ എൻ്റിറ്റികളുടെ സ്വയമേവ വേർതിരിച്ചെടുക്കൽ. ഇത് മിനിറ്റുകൾക്കുള്ളിൽ "ഈ 500 പ്രമാണങ്ങളിൽ സൂചിപ്പിച്ചിരിക്കുന്ന എല്ലാ സ്ഥലപ്പേരുകളും" പോലെയുള്ള ഒരു ലിസ്റ്റ് നിർമ്മിക്കുന്നു.
  • റിലേഷൻഷിപ്പ് അനുമാനം: എൻ്റിറ്റികൾ തമ്മിലുള്ള ബന്ധങ്ങൾ അടയാളപ്പെടുത്തുന്നു ("X എന്ന സ്ഥലത്ത് Y", "A എന്നത് B യുമായി പൊരുത്തപ്പെടുന്നു").
  • വിഷയ മോഡലിംഗ്: ഒരു വലിയ കൂട്ടം ടെക്‌സ്‌റ്റിൽ ആവർത്തിച്ചുള്ള വിഷയങ്ങളുടെ ക്ലസ്റ്ററുകൾ സ്ഥിതിവിവരക്കണക്കനുസരിച്ച് കണ്ടെത്തുന്നു. ഏത് കാലഘട്ടത്തിലാണ് ഏത് തീമുകൾ കേന്ദ്രീകരിച്ചിരിക്കുന്നതെന്ന് ഇത് കാണിക്കുന്നു.
  • ടൈംലൈൻ അനുമാനം: ഡോക്യുമെൻ്റുകളിൽ തീയതിയുള്ള ഇവൻ്റുകൾ ഒരു കാലക്രമത്തിൽ ക്രമീകരിക്കുന്നു.
  • നെറ്റ്‌വർക്ക് വിശകലനം: വ്യക്തി-വ്യക്തി/സ്ഥാപന ബന്ധങ്ങളെ ഒരു നെറ്റ്‌വർക്കായി ദൃശ്യവൽക്കരിക്കുന്നു (ആരാണ് കേന്ദ്രം, ആരാണ് കണക്ഷൻ പോയിൻ്റ്).

ഇവയുടെയെല്ലാം പൊതുവായ ലക്ഷ്യം ഒരൊറ്റ പ്രമാണത്തിൽ പ്രത്യക്ഷപ്പെടാത്തതും ശേഖരത്തിലുടനീളം ദൃശ്യമാകുന്നതുമായ ഘടനകൾ വെളിപ്പെടുത്തുക എന്നതാണ്. ഈ വിദ്യകൾ വായനയിലൂടെ മാത്രം ദൃശ്യമാകുന്ന പാറ്റേണുകൾ ഉണ്ടാക്കുന്നു. എന്നാൽ അവ ഓരോന്നും ഒരു "അടയാളം" ആണ്, ഒരു "തെളിവ്" അല്ല; ഒറിജിനൽ ഡോക്യുമെൻ്റിൽ എന്താണുള്ളത് എന്ന് പരിശോധിക്കേണ്ടത് അത്യാവശ്യമാണ്.

ഈ ഫീൽഡിൽ പതിവായി ഉപയോഗിക്കുന്ന ഒരു ആശയമാണ് അടുത്ത വായനയും (ഒരു വാചകം ആഴത്തിൽ, വരി വരിയായി വായിക്കുന്നത്) വിദൂര വായനയും (സംഖ്യാശാസ്ത്രപരമായി നൂറുകണക്കിന്/ആയിരക്കണക്കിന് ഗ്രന്ഥങ്ങളെ മൊത്തത്തിൽ നോക്കുന്നത്) തമ്മിലുള്ള വ്യത്യാസമാണ്. AI വിദൂരമായി വായിക്കുന്നത് സാധ്യമാക്കുന്നു: ഒരു മനുഷ്യായുസ്സ് മുഴുവൻ നിലനിൽക്കാൻ തക്ക വലിപ്പമുള്ള പാറ്റേണുകൾ ഒരു കോർപ്പസിൽ നിങ്ങൾ കാണുന്നു. എന്നാൽ ദൂരെയുള്ള വായന ഒരു പാറ്റേണിലേക്ക് വിരൽ ചൂണ്ടുമ്പോൾ, അടുത്ത വായനയിലേക്ക് മടങ്ങേണ്ടത് ആവശ്യമാണ്, അതായത് യഥാർത്ഥ പ്രമാണത്തിലേക്ക്, അത് മനസ്സിലാക്കാൻ. രണ്ട് രീതികളും പരസ്പരം മാറ്റാവുന്നതല്ല; ഒന്ന് പാറ്റേൺ കാണിക്കുന്നു, മറ്റൊന്ന് അതിൻ്റെ അർത്ഥം നൽകുന്നു. ഏറ്റവും ശക്തമായ ഗവേഷണം രണ്ടും ഒരുമിച്ച് ഉപയോഗിക്കുന്നു.

നുറുങ്ങ്: ഒരു സിദ്ധാന്തം ജനറേറ്ററായി പാറ്റേൺ വിശകലനം ഉപയോഗിക്കുക: "AI ഇവിടെ ഒരു പാറ്റേൺ കണ്ടെത്തി, അത് യഥാർത്ഥമാണോ?" തുടർന്ന് ഡോക്യുമെൻ്റുകളിൽ ഓരോന്നായി ആ പാറ്റേൺ പരിശോധിക്കുക. പാറ്റേൺ നിങ്ങളുടെ ഗവേഷണത്തിൻ്റെ ആരംഭ പോയിൻ്റാണ്, ഫലമല്ല.

വർക്ക്ഫ്ലോ: ഘട്ടം ഘട്ടമായി

1. ചോദ്യം വ്യക്തമാക്കുക. "ഈ ശേഖരത്തിൽ ഏറ്റവും കൂടുതൽ തവണ ഒരുമിച്ച് പ്രത്യക്ഷപ്പെടുന്ന ആളുകൾ ഏതാണ്?" പോലുള്ള വ്യക്തമായ പാറ്റേൺ ചോദ്യം.

2. ഡാറ്റ തയ്യാറാക്കി ലേബൽ ചെയ്യുക. ഉറവിട റഫറൻസുകൾ ഉപയോഗിച്ച് ടെക്‌സ്‌റ്റ് ഓർഗനൈസുചെയ്യുക, അതുവഴി കണ്ടെത്തിയ ഏതൊരു അസറ്റും പ്രമാണത്തിലേക്ക് തിരികെ ലിങ്കുചെയ്യാനാകും.

3. എൻ്റിറ്റി/പാറ്റേൺ ദൃശ്യമാകുന്നു. AI-യുമായി NER, ബന്ധം അല്ലെങ്കിൽ ടൈംലൈൻ രൂപരേഖ സൃഷ്ടിക്കുക.

4. നോർമലൈസ് ചെയ്യുക. ഒരേ വ്യക്തിയുടെ/സ്ഥലത്തിൻ്റെ (“ഇസ്താംബുൾ / ഇസ്താംബുൾ / കോസ്റ്റാൻ്റിനിയേ” ഒരേ സ്ഥലത്തിൻ്റെ) വ്യത്യസ്‌ത അക്ഷരവിന്യാസങ്ങൾ സംയോജിപ്പിക്കുക. ഈ ഘട്ടം നിർണായകമാണ്; അത് ഒഴിവാക്കിയാൽ, പാറ്റേൺ തകരും.

5. പ്രമാണത്തിൽ പരിശോധിക്കുക. ഫ്ലാഗുചെയ്‌ത പ്രധാനപ്പെട്ട പാറ്റേണുകൾക്കായി യഥാർത്ഥ പ്രമാണങ്ങൾ പരിശോധിക്കുക. AI ഒരു നിർമ്മിത ലിങ്ക് ചേർക്കുന്നില്ലെന്ന് ഉറപ്പാക്കുക.

6. അഭിപ്രായം. പാറ്റേൺ അർത്ഥമാക്കുന്നത് ചരിത്രകാരൻ്റെ വിധിയാണ്; AI പാറ്റേൺ അടയാളപ്പെടുത്തുന്നു.

നമ്പറും സ്ഥിതിവിവരക്കണക്കുകളും

പാറ്റേൺ വിശകലനം പലപ്പോഴും സംഖ്യകൾ നിർമ്മിക്കുന്നു: "നാമം X 47 തവണ സംഭവിക്കുന്നു", "ഈ തീം 30% പ്രമാണങ്ങളിൽ ഉണ്ട്". ഈ സംഖ്യകൾ വസ്തുനിഷ്ഠമായി തോന്നുമെങ്കിലും തെറ്റിദ്ധരിപ്പിക്കുന്നതാണ്:

  • നഷ്‌ടമായ ഡാറ്റ: ശേഖരം ഇതിനകം അപൂർണ്ണമാണെങ്കിൽ (രേഖകൾ നഷ്‌ടപ്പെട്ടു, ഒരു ഗ്രൂപ്പ് റെക്കോർഡ് ചെയ്‌തിട്ടില്ല), സംഖ്യ നിലനിൽക്കുന്ന പ്രമാണങ്ങളെയാണ് പ്രതിഫലിപ്പിക്കുന്നത്, യാഥാർത്ഥ്യമല്ല.
  • നോർമലൈസേഷൻ പിശക്: ഒരേ വ്യക്തിയെ വ്യത്യസ്തമായി എഴുതുകയും പ്രത്യേകം എണ്ണുകയും ചെയ്താൽ, നമ്പർ തെറ്റായിരിക്കും.
  • സന്ദർഭത്തിൻ്റെ നഷ്ടം: "47 തവണ സംഭവിക്കുന്നു" ഒന്നും പറയുന്നില്ല; അത് എങ്ങനെ കടന്നുപോകുന്നു (പോസിറ്റീവ്/നെഗറ്റീവ്, വിഷയം/വസ്തു) എന്നത് പ്രധാനമാണ്.

പാറ്റേൺ ഔട്ട്പുട്ട്

പ്രത്യക്ഷമായ അർത്ഥം

യഥാർത്ഥ റിസ്ക്

"എക്സ് 47 തവണ സംഭവിക്കുന്നു"

പ്രധാനപ്പെട്ട വ്യക്തി

അപൂർണ്ണമായ ശേഖരം, അക്ഷരവിന്യാസം

"തീം 30%"

പ്രബലമായ വിഷയം

മാതൃകാ പക്ഷപാതം

"എ-ബി പലപ്പോഴും ഒരുമിച്ച്"

അടുപ്പമുള്ള ബന്ധം

യാദൃശ്ചികത, കാണാത്ത സന്ദർഭം

"ടൈംലൈൻ"

കൃത്യമായ കാലഗണന

തീയതിയില്ലാത്ത രേഖകൾ, കെട്ടിച്ചമച്ച ഓർഡർ

മൂന്ന് മിനി കേസുകൾ

കേസ് 1 - നെറ്റ്‌വർക്ക് വിശകലനം ഒരു മറഞ്ഞിരിക്കുന്ന ഇടനിലക്കാരനെ വെളിപ്പെടുത്തി. ഒരു ഗവേഷകൻ 800 അക്ഷരങ്ങളുടെ കത്തിടപാടുകൾ പരിശോധിച്ചു. AI ഉപയോഗിച്ച്, ആർക്കാണ് എഴുതിയതെന്ന് നിർണ്ണയിക്കുകയും ഒരു നെറ്റ്‌വർക്ക് സൃഷ്ടിക്കുകയും ചെയ്തു. ഒറ്റനോട്ടത്തിൽ നിസ്സാരനെന്ന് തോന്നുന്ന ഒരു വ്യക്തി യഥാർത്ഥത്തിൽ രണ്ട് ഗ്രൂപ്പുകൾ തമ്മിലുള്ള ബന്ധത്തിൻ്റെ പ്രധാന പോയിൻ്റാണെന്ന് നെറ്റ്‌വർക്ക് കാണിച്ചു. ഗവേഷകൻ ഈ വ്യക്തിയുടെ കത്തുകളിൽ ശ്രദ്ധ കേന്ദ്രീകരിച്ച് ഒരു പുതിയ കണ്ടെത്തലിൽ എത്തി. എന്നാൽ ആദ്യം രേഖകളിലെ എല്ലാ ലിങ്കുകളും പരിശോധിച്ചു.

കേസ് 2 - നോർമലൈസേഷൻ പിശക് നമ്പർ കേടാക്കി. ഡോക്യുമെൻ്റുകളിൽ ഒരു സ്ഥലം എത്ര തവണ പ്രത്യക്ഷപ്പെട്ടുവെന്ന് ഒരു വിദ്യാർത്ഥി അവരെ എണ്ണി. AI ഒരേ സ്ഥലത്തെ മൂന്ന് വ്യത്യസ്ത അക്ഷരവിന്യാസങ്ങൾ വെവ്വേറെ കണക്കാക്കിയതിനാൽ, ഈ സംഖ്യ യഥാർത്ഥ സംഖ്യയുടെ മൂന്നിലൊന്നായി മാറി. അക്ഷരവിന്യാസങ്ങൾ സംയോജിപ്പിച്ചപ്പോൾ, സ്ഥലം യഥാർത്ഥത്തിൽ പതിവായി സംഭവിക്കുന്ന മൂന്നാമത്തെ സ്ഥാനത്തായിരുന്നു. പാഠം: നോർമലൈസേഷൻ കൂടാതെ നമ്പർ വിശ്വസിക്കാൻ കഴിയില്ല.

കേസ് 3 - തയ്യാറാക്കിയ ടൈംലൈൻ. തീയതിയില്ലാത്ത രേഖകളിൽ നിന്ന് ഒരു ഗവേഷകൻ ഒരു ടൈംലൈൻ സൃഷ്ടിച്ചു. AI അജ്ഞാത സംഭവങ്ങളെ "ലോജിക്കൽ" ക്രമത്തിൽ ക്രമീകരിക്കുകയും കൃത്യമായ കാലഗണന അവതരിപ്പിക്കുകയും ചെയ്തു. എന്നിരുന്നാലും, ഈ ക്രമം രേഖകളിൽ ഉണ്ടായിരുന്നില്ല, AI അത് ഉണ്ടാക്കി. പാഠം: ഡോക്യുമെൻ്റിൽ ഒരു തീയതി ഉള്ള ഇവൻ്റുകളിൽ നിന്ന് മാത്രമാണ് ടൈംലൈൻ നിർമ്മിച്ചിരിക്കുന്നത്; ബാക്കിയുള്ളവ "കാലാതീതമായി" തുടരുന്നു.

പകർത്താവുന്ന നാല് ടെംപ്ലേറ്റുകൾ

1) NER (എൻ്റ്റിറ്റി അനുമാനം):

ചുവടെയുള്ള രേഖകളിൽ സൂചിപ്പിച്ചിരിക്കുന്ന വ്യക്തികൾ, സ്ഥലങ്ങൾ, സ്ഥാപനങ്ങൾ, തീയതികൾ എന്നിവ പ്രത്യേക ലിസ്റ്റുകളായി ദൃശ്യമാകും. ഏത് പ്രമാണത്തിലാണ് (റഫറൻസ്) ഓരോ എൻ്റിറ്റിയും പരാമർശിച്ചിരിക്കുന്നതെന്ന് സൂചിപ്പിക്കുക. വാചകത്തിൽ വ്യക്തമായി പറഞ്ഞിരിക്കുന്നത് മാത്രം എടുക്കുക; ഊഹത്തിലൂടെ ചേർക്കുക. ഉച്ചാരണത്തെക്കുറിച്ച് നിങ്ങൾക്ക് ഉറപ്പില്ലെങ്കിൽ [?] അടയാളപ്പെടുത്തുക. പ്രമാണങ്ങൾ: [ഇവിടെ]

2) എൻ്റിറ്റി നോർമലൈസേഷൻ:

താഴെയുള്ള എൻ്റിറ്റി ലിസ്റ്റിൽ, ഒരേ വ്യക്തി/സ്ഥലം (ഉദാ: "ഇസ്താംബുൾ / കോസ്റ്റാൻ്റിനിയേ") ആയിരിക്കാവുന്ന വ്യത്യസ്ത അക്ഷരവിന്യാസങ്ങൾ ഗ്രൂപ്പുചെയ്യുക. ഓരോ ഗ്രൂപ്പിനും സാധ്യമായ പൊതുവായ ഫോർമാറ്റ് നിർദ്ദേശിക്കുക എന്നാൽ കൃത്യമായ കോമ്പിനേഷൻ അടിച്ചേൽപ്പിക്കരുത്; "ഇതുതന്നെ ആയിരിക്കാം, ആളുകളെ പരിശോധിക്കാൻ അനുവദിക്കുക" എന്ന കുറിപ്പ് ചേർക്കുക. നിങ്ങൾക്ക് ഉറപ്പില്ലെങ്കിൽ വെറുതെ വിടുക. പട്ടിക: [ഇവിടെ]

3) ബന്ധം/നെറ്റ്‌വർക്ക് ഔട്ട്‌ലൈൻ:

ഇനിപ്പറയുന്ന കത്തിടപാടുകൾ/രേഖകൾ എന്നിവയിൽ നിന്ന് "ആരുമായി ബന്ധപ്പെട്ടിരിക്കുന്നു" എന്ന ലിങ്കുകൾ എക്‌സ്‌ട്രാക്‌റ്റ് ചെയ്യുക. ഓരോ ലിങ്കിനും, ഏത് പ്രമാണത്തെ (റഫറൻസ്) അടിസ്ഥാനമാക്കിയുള്ളതാണെന്ന് സൂചിപ്പിക്കുക. ഡോക്യുമെൻ്റിൽ വ്യക്തമല്ലാത്ത ഒരു ബന്ധം ഉണ്ടാക്കി. അവ്യക്തമായ ലിങ്കുകൾ [വ്യക്തമല്ലാത്ത] അടയാളപ്പെടുത്തുക. ഡോക്യുമെൻ്റേഷൻ: [ഇവിടെ]

4) തീയതിയുള്ള ടൈംലൈൻ:

ഇനിപ്പറയുന്ന രേഖകളിൽ വ്യക്തമായി പറഞ്ഞിരിക്കുന്ന സംഭവങ്ങൾ മാത്രം കാലക്രമത്തിൽ പട്ടികപ്പെടുത്തുക; ഓരോ ഇവൻ്റിനെയും അതിൻ്റെ ഉറവിടത്തിലേക്ക് ലിങ്ക് ചെയ്യുക. അനിശ്ചിതത്വമുള്ള തീയതികളുള്ള ഇവൻ്റുകൾ "കാലാവധി" എന്ന ശീർഷകത്തിന് കീഴിൽ വെവ്വേറെ പട്ടികപ്പെടുത്തുക, അവ ക്രമപ്പെടുത്തരുത്. കണക്കാക്കിയ തീയതി ഉണ്ടാക്കരുത്. ഡോക്യുമെൻ്റേഷൻ: [ഇവിടെ]

ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്

ദുർബല:

ഈ ഡോക്യുമെൻ്റുകൾ വിശകലനം ചെയ്ത് പ്രധാനപ്പെട്ട പാറ്റേണുകൾ, ബന്ധങ്ങൾ, ടൈംലൈനുകൾ എന്നിവ എക്‌സ്‌ട്രാക്റ്റുചെയ്യുക.

"പ്രധാനമായ പാറ്റേണുകൾ എക്‌സ്‌ട്രാക്‌റ്റ് ചെയ്യുക", നിലവിലില്ലാത്ത കണക്ഷനുകളും കൃത്യമായ കാലഗണനകളും കണ്ടുപിടിക്കാൻ AI-യെ പ്രേരിപ്പിക്കുന്നു, നോർമലൈസേഷൻ കൂടാതെ നമ്പറുകൾ അവതരിപ്പിക്കുന്നു.

ശക്തമായ:

ഡോക്യുമെൻ്റ് റഫറൻസിലേക്ക് ഓരോന്നും ബന്ധിപ്പിച്ച് ഇനിപ്പറയുന്ന ഡോക്യുമെൻ്റുകളിൽ നിന്ന് വ്യക്തി/സ്ഥലം/സ്ഥാപന സ്ഥാപനങ്ങൾ എന്നിവ വേർതിരിച്ചെടുക്കുന്നു. "ലയിപ്പിച്ചേക്കാം" എന്നതിന് സമാനമായ വ്യത്യസ്ത അക്ഷരവിന്യാസങ്ങൾ അടയാളപ്പെടുത്തുക, എന്നാൽ ലയിപ്പിക്കരുത്. പ്രമാണത്തിലും അനിശ്ചിത തീയതികളുള്ള ഇവൻ്റുകളിലും വ്യക്തമായി പ്രസ്താവിച്ചിട്ടില്ലാത്ത ബന്ധങ്ങൾ വ്യാജമാകരുത്; തീയതികളില്ലാത്തവ പ്രത്യേകം സൂക്ഷിക്കുക. ഡോക്യുമെൻ്റേഷൻ: [ഇവിടെ]

വ്യത്യാസം: ഉറവിടത്തിലേക്കുള്ള ആട്രിബ്യൂഷൻ, സാധാരണവൽക്കരണം മനുഷ്യർക്ക് വിട്ടുകൊടുക്കൽ, സാങ്കൽപ്പിക ബന്ധങ്ങൾ/ചരിത്രം എന്നിവയ്ക്ക് നിരോധനം, തീയതിയില്ലാത്ത സംഭവങ്ങളുടെ വേർതിരിവ് എന്നിവ പാറ്റേണിനെ പ്രതിരോധത്തിലാക്കുന്നു.

സാധാരണ തെറ്റുകൾ

  • തെളിവിനായി പാറ്റേൺ തെറ്റിദ്ധരിക്കുന്നു. പാറ്റേൺ അനുമാനമാണ്; പ്രമാണത്തിൽ പരിശോധിച്ചുറപ്പിച്ചിരിക്കുന്നു.
  • നോർമലൈസേഷൻ ഒഴിവാക്കുന്നു. ഒരേ എൻ്റിറ്റിയുടെ വ്യത്യസ്‌ത അക്ഷരവിന്യാസങ്ങൾ നമ്പറിനെയും നെറ്റ്‌വർക്കിനെയും വികലമാക്കുന്നു.
  • സംഖ്യകളിൽ അന്ധമായ വിശ്വാസം. അപൂർണ്ണമായ ശേഖരണവും സാമ്പിൾ ബയസും സംഖ്യയെ തെറ്റിദ്ധരിപ്പിക്കുന്നതാണ്.
  • തയ്യാറാക്കിയ ടൈംലൈൻ. തീയതിയില്ലാത്ത ഇവൻ്റുകൾ കാലഗണനയിൽ ഉൾപ്പെടുത്തിയിട്ടില്ല.
  • സന്ദർഭം അവഗണിക്കുന്നു. "എത്ര പ്രാവശ്യം പാസ്സായി" എന്നല്ല, "എങ്ങനെ പാസ്സായി" എന്നതാണ് പ്രധാനം.

ചുരുക്കത്തിൽ

ഉള്ളടക്ക വിശകലനവും പാറ്റേൺ കണ്ടെത്തലും ശക്തമായ ഒരു മേഖലയാണ്, അവിടെ വായനയിലൂടെ മാത്രം ദൃശ്യമാകാത്ത ഘടനകൾ AI ഉണ്ടാക്കുന്നു: എൻ്റിറ്റി എക്സ്ട്രാക്ഷൻ, റിലേഷൻഷിപ്പ് നെറ്റ്‌വർക്കുകൾ, വിഷയ ക്ലസ്റ്ററുകൾ, ടൈംലൈനുകൾ. എന്നാൽ ഓരോ പാറ്റേണും ഒരു സിദ്ധാന്തമാണ്, തെളിവുകളല്ല. ഉറവിടത്തിലേക്ക് അസറ്റുകൾ ലിങ്ക് ചെയ്യുക, ശ്രദ്ധയോടെയും മാനുഷിക മൂല്യനിർണ്ണയത്തോടെയും നോർമലൈസ് ചെയ്യുക, നഷ്‌ടമായ ഡാറ്റയ്ക്കും പക്ഷപാതത്തിനും നമ്പറുകൾ അന്വേഷിക്കുക, കൃത്രിമ ബന്ധങ്ങളും കാലഗണനകളും ഒഴിവാക്കുക. AI പാറ്റേൺ അടയാളപ്പെടുത്തുന്നു; അതിൻ്റെ അർത്ഥവും സത്യമാണോ എന്നതും ചരിത്രകാരൻ്റെ വിധിയാണ്.

ആപ്ലിക്കേഷൻ ടാസ്ക്

കുറഞ്ഞത് 15 ഡോക്യുമെൻ്റേഷനുകളെങ്കിലും ശേഖരിക്കുക (റഫറൻസുകൾക്കൊപ്പം). "NER" ടെംപ്ലേറ്റ് ഉപയോഗിച്ച് വ്യക്തിയെയും സ്ഥല സ്ഥാപനങ്ങളെയും വേർതിരിച്ചെടുക്കുക. തുടർന്ന് "എൻ്റിറ്റി നോർമലൈസേഷൻ" ഉപയോഗിച്ച് വ്യത്യസ്ത അക്ഷരവിന്യാസങ്ങൾ ഗ്രൂപ്പുചെയ്യുക, ഗ്രൂപ്പുകൾ സ്വയം പരിശോധിക്കുക. അവസാനമായി, "ഡേറ്റഡ് ടൈംലൈൻ" ടെംപ്ലേറ്റ് റൺ ചെയ്ത് എത്ര ഇവൻ്റുകൾ "അന്തരീക്ഷത്തിൽ" അവശേഷിക്കുന്നുവെന്ന് കാണുക. മോശമായ പ്രോംപ്റ്റിംഗുമായി AI എത്ര രൂപപ്പെടുത്തിയ ലിങ്കുകളോ കാലക്രമങ്ങളോ താരതമ്യം ചെയ്യുക.

ചെക്ക്ലിസ്റ്റ്

  • [ ] എൻ്റെ പാറ്റേൺ ചോദ്യം ഞാൻ വ്യക്തമായി നിർവചിച്ചിട്ടുണ്ട്.
  • [ ] എനിക്ക് ഓരോ എൻ്റിറ്റിയും ഡോക്യുമെൻ്റ് റഫറൻസുമായി ലിങ്ക് ചെയ്തിട്ടുണ്ട്.
  • [ ] ഞാൻ എൻ്റിറ്റി ടൈപ്പിംഗ് നോർമലൈസ് ചെയ്യുകയും അത് മനുഷ്യ അംഗീകാരവുമായി സംയോജിപ്പിക്കുകയും ചെയ്തു.
  • [ ] നഷ്‌ടമായ ഡാറ്റയുടെയും പക്ഷപാതത്തിൻ്റെയും നമ്പറുകൾ ഞാൻ ചോദ്യം ചെയ്തു.
  • [ ] ഞാൻ തീയതിയില്ലാത്ത ഇവൻ്റുകൾ കാലഗണനയിൽ ഉൾപ്പെടുത്തിയില്ല, ഞാൻ അവ പ്രത്യേകം സൂക്ഷിച്ചു.