നേട്ടങ്ങൾ:
- OCR, HTR എന്നിവ ഉപയോഗിച്ച് ടെക്സ്റ്റിലേക്ക് പരിവർത്തനം ചെയ്ത് യഥാർത്ഥ ചിത്രവുമായി ഔട്ട്പുട്ട് താരതമ്യം ചെയ്ത് സ്കാൻ ചെയ്ത പ്രമാണങ്ങൾ ശരിയാക്കാനുള്ള കഴിവ്
- ആർക്കൈവ് ഡോക്യുമെൻ്റിൻ്റെ മൗലികതയും സമഗ്രതയും സംരക്ഷിക്കാനും ഉള്ളടക്കം മാറ്റുന്നതിൽ നിന്നും കെട്ടിച്ചമച്ച പുനഃസ്ഥാപനത്തിൽ നിന്നും AI-യെ തടയാനുമുള്ള കഴിവ്
- പ്രൊവെനൻസ് വിവരങ്ങളും ഡ്യൂറബിൾ ഫോർമാറ്റുകളും ഉപയോഗിച്ച് ദീർഘകാല ഡിജിറ്റൽ സംരക്ഷണം ആസൂത്രണം ചെയ്യാനുള്ള കഴിവ്
അമ്പത് വർഷം പഴക്കമുള്ള പത്ര വാല്യങ്ങൾ, കൈയെഴുത്ത് കത്തുകൾ, അല്ലെങ്കിൽ പഴയ ഫോട്ടോഗ്രാഫുകൾ എന്നിവ ഭാവിയിലേക്ക് കൊണ്ടുപോകാൻ ഒരു ആർക്കൈവിസ്റ്റിൻ്റെ ചുമതലയുണ്ട്. ഈ രേഖകൾ കാലക്രമേണ ക്ഷയിച്ചുപോകുന്നു; അവ സംരക്ഷിക്കുന്നതിനും ആക്സസ് ചെയ്യുന്നതിനും, ഡിജിറ്റൈസേഷൻ നടത്തുന്നു: ഒരു ഫിസിക്കൽ ഡോക്യുമെൻ്റ് സ്കാൻ ചെയ്ത് ഒരു ഡിജിറ്റൽ പകർപ്പാക്കി മാറ്റുന്ന പ്രവർത്തനം. എന്നാൽ സ്ക്രീനിംഗ് മാത്രം പോരാ; ഡിജിറ്റൽ ഒബ്ജക്റ്റ് കണ്ടെത്താവുന്നതും വായിക്കാവുന്നതും ദീർഘകാലത്തേക്ക് പരിപാലിക്കാവുന്നതുമായിരിക്കണം. ഈ യൂണിറ്റിൽ, ഡിജിറ്റൈസേഷൻ, ട്രാൻസ്ക്രിപ്ഷൻ, ഡിജിറ്റൽ പ്രിസർവേഷൻ വർക്ക്ഫ്ലോ എന്നിവയിൽ കൃത്രിമബുദ്ധി എങ്ങനെ ഉപയോഗിക്കാമെന്ന് നിങ്ങൾ പഠിക്കും; എന്നാൽ മൗലികതയുടെയും കൃത്യതയുടെയും ഉത്തരവാദിത്തം നിങ്ങൾ വഹിക്കുന്നത് എന്തുകൊണ്ടാണെന്ന് നിങ്ങൾ മനസ്സിലാക്കും.
കുറച്ച് ആശയങ്ങൾ. OCR (Optical Character Recognition) എന്നത് ഒരു ഡോക്യുമെൻ്റിൻ്റെ ഇമേജിലെ ടെക്സ്റ്റിനെ മെഷീൻ എഡിറ്റ് ചെയ്യാവുന്ന ടെക്സ്റ്റാക്കി മാറ്റുന്ന ഒരു സാങ്കേതികവിദ്യയാണ്. HTR (കൈയെഴുത്ത് വാചകം തിരിച്ചറിയൽ) കൈയക്ഷര രേഖകളുടെ അതേ ജോലി ചെയ്യുന്നു, ഇത് കൂടുതൽ ബുദ്ധിമുട്ടാണ്. ഫയൽ ഫോർമാറ്റുകൾ കാലഹരണപ്പെടുമ്പോഴും സോഫ്റ്റ്വെയർ മാറുമ്പോഴും ഡിജിറ്റൽ ഒബ്ജക്റ്റുകൾ പതിറ്റാണ്ടുകളായി വായിക്കാൻ കഴിയുന്നുണ്ടെന്ന് ഉറപ്പാക്കാനുള്ള ആസൂത്രിത ശ്രമമാണ് ഡിജിറ്റൽ സംരക്ഷണം. AI മൂന്ന് മേഖലകളിലും ശക്തവും എന്നാൽ പിഴവുള്ളതുമായ സഹായിയാണ്.
ഘട്ടം ഘട്ടമായി: ഡിജിറ്റൈസേഷൻ മുതൽ സംരക്ഷണം വരെ
1. മുൻഗണന നൽകുക. നിങ്ങൾക്ക് എല്ലാം ഒറ്റയടിക്ക് ഡിജിറ്റൈസ് ചെയ്യാൻ കഴിയില്ല. ഏറ്റവും ദുർബലവും ഏറ്റവും അഭ്യർത്ഥിച്ചതും ഏറ്റവും അദ്വിതീയവുമായ ഡോക്യുമെൻ്റുകൾ ആദ്യം ഇടുന്നു. ഇതൊരു ജുഡീഷ്യൽ തീരുമാനമാണ്; ലിസ്റ്റ് എഡിറ്റിംഗിൽ AI സഹായിക്കുന്നു, എന്നാൽ സ്ഥാപനമാണ് മുൻഗണന നിശ്ചയിക്കുന്നത്.
2. OCR/HTR സ്കാൻ ചെയ്ത് പ്രയോഗിക്കുക. ഉയർന്ന റെസല്യൂഷനിൽ പ്രമാണം സ്കാൻ ചെയ്യുക, തുടർന്ന് ടെക്സ്റ്റ് എക്സ്ട്രാക്റ്റുചെയ്യാൻ OCR അല്ലെങ്കിൽ HTR ഉപയോഗിക്കുക. പഴയതും ബുദ്ധിമുട്ടുള്ളതുമായ ടെക്സ്റ്റുകളിൽ പോലും AI-അധിഷ്ഠിത ടൂളുകൾ ഇവിടെ മെച്ചപ്പെടുകയും മെച്ചപ്പെടുകയും ചെയ്യുന്നു.
3. വാചകം ശരിയാക്കുകയും പരിശോധിക്കുകയും ചെയ്യുക. OCR/HTR ഔട്ട്പുട്ട് ഒരിക്കലും തികഞ്ഞതല്ല. പിശകുകൾ സാധാരണമാണ്, പ്രത്യേകിച്ചും പഴയ എഴുത്തുകളോ, കറപുരണ്ട പേജുകളോ, കൈയെഴുത്തുപ്രതിയോ ഉണ്ടെങ്കിൽ. ഔട്ട്പുട്ട് യഥാർത്ഥ ചിത്രവുമായി താരതമ്യം ചെയ്ത് അത് ശരിയാക്കേണ്ടത് അത്യാവശ്യമാണ്.
4. മെറ്റാഡാറ്റയും സംരക്ഷണ വിവരങ്ങളും ചേർക്കുക. ഡിജിറ്റൽ ഒബ്ജക്റ്റിലേക്ക് അതിൻ്റെ ആവിർഭാവം, സ്കാനിംഗ് അവസ്ഥകൾ, ഫോർമാറ്റ് വിവരങ്ങൾ, തെളിവ് എന്നിവ ചേർക്കുക - ഡോക്യുമെൻ്റ് എവിടെ നിന്നാണ് വന്നത്, എങ്ങനെ പ്രോസസ്സ് ചെയ്തു. ഭാവിയിലെ സ്ഥിരീകരണത്തിനും സംരക്ഷണത്തിനും ഈ വിവരങ്ങൾ നിർണായകമാണ്.
5. ദീർഘകാല സംരക്ഷണത്തിനായി ആസൂത്രണം ചെയ്യുക. തുറന്നതും പൊതുവായതും മോടിയുള്ളതുമായ ഫയൽ ഫോർമാറ്റുകൾ തിരഞ്ഞെടുക്കുക; ബാക്കപ്പ്; ഫോർമാറ്റുകൾ കാലഹരണപ്പെട്ടാൽ ഒരു മൈഗ്രേഷൻ പ്ലാൻ ഉണ്ടാക്കുക.
നുറുങ്ങ്: OCR ഔട്ട്പുട്ട് "ക്ലിയർ ടെക്സ്റ്റ്" ആയി സ്വീകരിക്കരുത്. ഈ വാചകത്തിലൂടെ ഒരു തിരയൽ സംവിധാനം പ്രവർത്തിക്കുകയാണെങ്കിൽ, തെറ്റായി തിരിച്ചറിഞ്ഞ വാക്കുകൾ ഉറവിടം കണ്ടെത്താതിരിക്കാൻ ഇടയാക്കും. നിർണായക ശേഖരങ്ങൾക്കായി, മനുഷ്യൻ്റെ കണ്ണിലേക്ക് OCR ഔട്ട്പുട്ട് ശരിയാക്കുന്നത് തുടർന്നുള്ള എല്ലാ ആക്സസ്സിൻ്റെയും ഗുണനിലവാരം നിർണ്ണയിക്കുന്നു.
ഡിജിറ്റൽ വസ്തുവിൻ്റെ ആധികാരികതയും സമഗ്രതയും
ആർക്കൈവൽ വർക്കിൻ്റെ കാതൽ ആധികാരികതയും സമഗ്രതയുമാണ്: ഒരു പ്രമാണം യഥാർത്ഥത്തിൽ ക്ലെയിം ചെയ്ത ഉറവിടത്തിൽ നിന്നാണ് വരുന്നതെന്നും അതിലെ ഉള്ളടക്കങ്ങളിൽ മാറ്റം വരുത്തിയിട്ടില്ലെന്നും ഉറപ്പ്. ഈ ഘട്ടത്തിൽ, AI ഒരു ദ്വിമുഖ ഭീഷണി സൃഷ്ടിക്കുന്നു. ആദ്യം, OCR/HTR തിരുത്തൽ അല്ലെങ്കിൽ "മെച്ചപ്പെടുത്തൽ" സമയത്ത്, AI-ക്ക് വാചകം നിശബ്ദമായി പരിഷ്കരിക്കാനാകും; "തിരുത്തൽ" എന്ന പേരിൽ നിലവിലില്ലാത്ത ഒരു വാക്ക് ചേർക്കാൻ കഴിയും. രണ്ടാമതായി, AI ഉപയോഗിച്ച് ഇമേജ് "റിപ്പയർ" അല്ലെങ്കിൽ "റിസ്റ്റോറേഷൻ" നടത്തുകയാണെങ്കിൽ, യഥാർത്ഥമല്ലാത്ത വിശദാംശങ്ങൾ നിർമ്മിക്കപ്പെടാം.
ആർക്കൈവിസ്റ്റിൻ്റെ നിയമം വ്യക്തമാണ്: ഡിജിറ്റൽ സംരക്ഷണ പകർപ്പ് ഒറിജിനലിനോട് വിശ്വസ്തമായിരിക്കണം. AI ഉപയോഗിച്ചുള്ള എല്ലാ മെച്ചപ്പെടുത്തലുകളും രേഖപ്പെടുത്തുകയും യഥാർത്ഥ (റോ) സ്കാൻ എപ്പോഴും സംരക്ഷിക്കുകയും വേണം. ഒരു പ്രമാണത്തെ "മനോഹരമാക്കുന്നത്" അതിൻ്റെ ചരിത്രപരമായ തെളിവുകളുടെ മൂല്യത്തെ നശിപ്പിക്കും.
മുന്നറിയിപ്പ്: AI ഉപയോഗിച്ച് ഒരു പഴയ ഫോട്ടോയോ ഡോക്യുമെൻ്റോ "മെച്ചപ്പെടുത്താൻ" ഇത് പ്രലോഭിപ്പിച്ചേക്കാം; എന്നാൽ നഷ്ടപ്പെട്ട ഭാഗങ്ങൾ ഉണ്ടാക്കി AI പൂരിപ്പിക്കുന്നു. ഒരു ആർക്കൈവൽ ഡോക്യുമെൻ്റിൽ, തെറ്റായ ചരിത്ര തെളിവുകൾ സൃഷ്ടിക്കുക എന്നാണ് ഇതിനർത്ഥം. പുനഃസ്ഥാപിക്കൽ ഔട്ട്പുട്ട് ഒരിക്കലും യഥാർത്ഥ ഉറവിടത്തെ മാറ്റിസ്ഥാപിക്കുന്നില്ല; ഒരു പ്രത്യേക, വ്യക്തമായി ലേബൽ ചെയ്ത വേരിയൻ്റായി സംഭരിച്ചിരിക്കുന്നു.
മൂന്ന് മിനി കേസുകൾ
കേസ് 1 - ന്യൂസ്പേപ്പർ ആർക്കൈവുകൾ തിരയാൻ കഴിയും. 30 വർഷം പഴക്കമുള്ള പ്രാദേശിക പത്രങ്ങളുടെ ശേഖരം ഒരു ലൈബ്രറി ഡിജിറ്റൈസ് ചെയ്തു. OCR ഉപയോഗിച്ച്, 90,000 പേജുകൾ ട്രാൻസ്ക്രൈബ് ചെയ്യുകയും തിരയാൻ സാധിക്കുകയും ചെയ്തു; മുമ്പ് ദിവസങ്ങളെടുത്ത ഒരു വിഷയ തിരയൽ ഇപ്പോൾ സെക്കൻഡിലേക്ക് ചുരുക്കിയിരിക്കുന്നു. എന്നിരുന്നാലും, പഴയതും കറപിടിച്ചതുമായ പേജുകളിൽ OCR കൃത്യത 80% ആയി കുറയുകയും മനുഷ്യൻ്റെ കണ്ണ് ഉപയോഗിച്ച് മികച്ച വർഷങ്ങൾ ശരിയാക്കുന്നതിന് മുൻഗണന നൽകുകയും ചെയ്തുവെന്ന് ടീം ശ്രദ്ധിച്ചു.
കേസ് 2 - HTR കൈയെഴുത്തുപ്രതി തുറന്നു. 19-ാം നൂറ്റാണ്ടിലെ വായിക്കാൻ ബുദ്ധിമുട്ടുള്ള അക്ഷരങ്ങളുടെ ഒരു ശേഖരത്തിൽ ഒരു ആർക്കൈവ് HTR പ്രയോഗിച്ചു. വിദഗ്ധരുടെ മാസങ്ങൾ വായിച്ചതനുസരിച്ച് സിസ്റ്റം വലിയ വേഗത നേടി; എന്നാൽ ആളുകളുടെയും സ്ഥലങ്ങളുടെയും പേരുകളിൽ പിശകുകൾ ഉള്ളതിനാൽ, പ്രിൻ്റൗട്ടിൻ്റെ ഓരോ പേജും ഒറിജിനലുമായി ഒരു വിദഗ്ധ പാലിയോഗ്രാഫർ (പുരാതന രചനകളിൽ വിദഗ്ധൻ) താരതമ്യം ചെയ്തു.
കേസ് 3 - വ്യാജ "പുനഃസ്ഥാപിക്കൽ" നിരസിച്ചു. AI ഉപയോഗിച്ച് കീറിപ്പോയ ഒരു ചരിത്ര ഫോട്ടോ "നന്നാക്കാൻ" ഒരു ടീം ആലോചിച്ചു. നഷ്ടപ്പെട്ട മുഖഭാഗങ്ങൾ ഘടിപ്പിച്ച് AI പൂർത്തിയാക്കി. ഈ കെട്ടിച്ചമച്ച വിശദാംശങ്ങൾ ചരിത്രപരമായ തെളിവുകളെ വളച്ചൊടിക്കുമെന്ന് ആർക്കൈവിസ്റ്റ് മനസ്സിലാക്കി; അറ്റകുറ്റപ്പണി ചെയ്ത ചിത്രം യഥാർത്ഥ ചിത്രത്തിനൊപ്പം വെവ്വേറെ സംഭരിച്ചു, "AI ഡെറിവേറ്റീവ്" എന്ന് വ്യക്തമായി ലേബൽ ചെയ്തിരിക്കുന്നു.
ആക്സസ് കോപ്പി, പ്രിസർവേഷൻ കോപ്പി, ഫോർമാറ്റ് തീരുമാനം
ഒരേ വസ്തുവിൻ്റെ പകർപ്പുകൾ വ്യത്യസ്ത ആവശ്യങ്ങൾക്കായി വേർതിരിക്കുക എന്നതാണ് ഡിജിറ്റൈസേഷനിലെ ഒരു നല്ല രീതി. ഒരു പ്രിസർവേഷൻ മാസ്റ്റർ എന്നത് ഭാവിയിലേക്ക് കൊണ്ടുപോകേണ്ട യഥാർത്ഥ ഡിജിറ്റൽ ഒബ്ജക്റ്റാണ്, അത് ഉയർന്ന റെസല്യൂഷനിൽ, കംപ്രസ് ചെയ്യാത്തതോ നഷ്ടരഹിതമായതോ ആയ ഫോർമാറ്റിൽ സൂക്ഷിക്കുന്നു; അത് അപൂർവ്വമായി സ്പർശിക്കുന്നു. ആക്സസ് കോപ്പി എന്നത് ഉപയോക്താവിന് അവതരിപ്പിക്കുന്ന ചെറുതും എളുപ്പത്തിൽ തുറക്കുന്നതുമായ ഒരു വേരിയൻ്റാണ്. ഈ വ്യത്യാസം പ്രധാനമാണ്, കാരണം ഉപയോഗത്തിന് പ്രായോഗികമായ ഫോർമാറ്റ് (ചെറിയ, കംപ്രസ് ചെയ്ത) ദീർഘകാല സംരക്ഷണത്തിന് അനുയോജ്യമല്ലായിരിക്കാം; സംരക്ഷണത്തിനുള്ള അനുയോജ്യമായ ഫോർമാറ്റ് (വലുത്, നഷ്ടമില്ലാത്തത്) ദൈനംദിന ഉപയോഗത്തിന് ബുദ്ധിമുട്ടാണ്. ഈ വർക്ക്ഫ്ലോയിൽ, ഫയലുകൾ ഇൻവെൻ്ററി ചെയ്യുന്നതിനും കാണാതായ വേരിയൻ്റുകൾ കണ്ടെത്തുന്നതിനും രണ്ട് പകർപ്പുകൾക്കിടയിൽ മെറ്റാഡാറ്റ സ്ഥിരത നിലനിർത്തുന്നതിനും AI-ക്ക് കഴിയും. എന്നിരുന്നാലും, ഫോർമാറ്റ് തിരഞ്ഞെടുക്കുന്നത് ഒരു സംരക്ഷണ തീരുമാനമാണ്: തുറന്നതും വ്യാപകമായി രേഖപ്പെടുത്തപ്പെട്ടതും മോടിയുള്ളതുമായ ഫോർമാറ്റുകൾക്ക് മുൻഗണന നൽകണം (പ്രൊപ്രൈറ്ററി, ക്ലോസ്ഡ് ഫോർമാറ്റുകൾക്ക് പകരം), കൂടാതെ ഫോർമാറ്റുകൾ കാലക്രമേണ കാലഹരണപ്പെട്ടാൽ ഒരു മൈഗ്രേഷൻ പ്ലാൻ തയ്യാറാക്കി സൂക്ഷിക്കണം. AI ഒരു ഫോർമാറ്റ് നിർദ്ദേശിച്ചാലും, സ്ഥാപനത്തിൻ്റെ ദീർഘകാല സംരക്ഷണ നയത്തിനാണ് അന്തിമ തീരുമാനം.
നുറുങ്ങ്: ഓരോ ഡിജിറ്റൽ ഒബ്ജക്റ്റിനും, "ഒറിജിനൽ ഉറവിടം എവിടെയാണ്, ഏത് ഫോർമാറ്റിലാണ് പ്രിസർവേഷൻ കോപ്പി, ഏത് ഫോർമാറ്റിലാണ് ആക്സസ് കോപ്പി, ഉപയോക്താവിന് ലഭ്യമാക്കിയിരിക്കുന്നത്?" എന്നീ ചോദ്യങ്ങൾക്ക് ഉത്തരം നൽകുന്ന ഒരു ഹ്രസ്വ റെക്കോർഡ് സൂക്ഷിക്കുക. ഈ മൂന്ന് ലെയറുകളും മിക്സ് ചെയ്യുന്നത് ഏത് ഫയലാണ് വിശ്വസനീയ മാസ്റ്റർ മുന്നോട്ട് പോകുന്നതെന്ന് വ്യക്തമല്ല.
പകർത്താവുന്ന നാല് ടെംപ്ലേറ്റുകൾ
1) OCR ഔട്ട്പുട്ട് തിരുത്തൽ സഹായം:
യഥാർത്ഥ പേജിൻ്റെ OCR വാചകവും വിവരണവും ചുവടെയുണ്ട്. openOCR പിശകുകൾ മാത്രം പരിഹരിക്കുക (മോശമായ പ്രതീകങ്ങൾ, സംയുക്തം/വിഭജന വാക്കുകൾ). ഉള്ളടക്കം മാറ്റുകയോ വാക്കുകൾ ചേർക്കുകയോ നീക്കം ചെയ്യുകയോ ചെയ്യരുത്. നിങ്ങൾക്ക് ഉറപ്പില്ലെങ്കിൽ, "[?]" ഉപയോഗിച്ച് അടയാളപ്പെടുത്തുക. OCR ടെക്സ്റ്റ്: [ഇവിടെ]
2) ടെക്സ്റ്റ് ഇമേജ് സ്ഥിരത പരിശോധന:
ഒറിജിനൽ ഡോക്യുമെൻ്റിൽ (ഉണ്ടാക്കിയതാകാം) പ്രതീക്ഷിക്കാത്ത എന്തെങ്കിലും കൂട്ടിച്ചേർക്കലുകൾ ചുവടെയുള്ള തിരുത്തിയ വാചകത്തിൽ ഉണ്ടോ? സംശയാസ്പദമായ ഓരോ ഭാഗവും അടയാളപ്പെടുത്തി അത് സംശയാസ്പദമായിരിക്കുന്നത് എന്തുകൊണ്ടെന്ന് എഴുതുക. വാചകം: [ഇവിടെ]
3) സംരക്ഷണ മെറ്റാഡാറ്റ ഡ്രാഫ്റ്റ്:
ഇനിപ്പറയുന്ന ഡിജിറ്റൈസ്ഡ് ഒബ്ജക്റ്റിനായി പ്രിസർവേഷൻ മെറ്റാഡാറ്റ ഔട്ട്ലൈൻ സൃഷ്ടിക്കുക: ഉറവിടം, ഉറവിടം, സ്കാൻ തീയതി/റെസല്യൂഷൻ, ഫയൽ ഫോർമാറ്റ്, ഇടപാട് ചരിത്രം. ഞാൻ നൽകിയ വിവരങ്ങൾ മാത്രം ഉപയോഗിക്കുക, വിട്ടുപോയ ഫീൽഡ് ശൂന്യമായി വിടുക. വിവരങ്ങൾ: [ഇവിടെ]
4) മുൻഗണനാ സഹായം:
ഡിജിറ്റലൈസേഷനായി കാത്തിരിക്കുന്ന ശേഖരങ്ങളുടെ ലിസ്റ്റ് ചുവടെയുണ്ട്; ദുർബലത, ആവശ്യം, അതുല്യത എന്നിവയെ അടിസ്ഥാനമാക്കി മുൻഗണന നൽകുന്നതിൽ സഹായിക്കുക. ഓരോ ഉറവിടത്തിനും ഹ്രസ്വമായ ന്യായീകരണം നൽകുക; അന്തിമ തീരുമാനം എനിക്ക് വിടൂ. ലിസ്റ്റ്: [ഇവിടെ]
ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്
ദുർബലമായ പ്രോംപ്റ്റ്:
സ്കാൻ ചെയ്ത ഈ വാചകം ശരിയാക്കി മനോഹരമാക്കുക.
"ബ്യൂട്ടിഫൈ" ഉള്ളടക്കം മാറ്റാനും ഒഴിവാക്കലുകൾ നികത്താനും AI-യെ ക്ഷണിക്കുന്നു; ആർക്കൈവ് ഡോക്യുമെൻ്റിൻ്റെ ഒറിജിനാലിറ്റി കേടായി.
ശക്തമായ നിർദ്ദേശം:
നിങ്ങളുടെ റോൾ: ഡിജിറ്റൈസേഷൻ എഡിറ്റർ അസിസ്റ്റൻ്റ്. ഇനിപ്പറയുന്ന OCR ടെക്സ്റ്റിൽ, വ്യക്തമായ തിരിച്ചറിയൽ പിശകുകൾ മാത്രം പരിഹരിക്കുക (മോശം സ്വഭാവം, തെറ്റായി വിഭജിച്ച വാക്ക്). വാക്കുകളൊന്നും ചേർക്കുകയോ നീക്കം ചെയ്യുകയോ മാറ്റുകയോ ചെയ്യരുത്. നിങ്ങൾക്ക് ഉറപ്പില്ലാത്തിടത്ത് "[?]" വിടുക. നിങ്ങൾ വരുത്തിയ ഓരോ തിരുത്തലും ഒരു പ്രത്യേക പട്ടികയിൽ കാണിക്കുക. വാചകം: [ഇവിടെ]
ശക്തമായ പ്രോംപ്റ്റ് AI-യെ പിശകുകൾ തിരിച്ചറിയാൻ മാത്രം പരിമിതപ്പെടുത്തുന്നു, ഉള്ളടക്കം സ്പർശിക്കുന്നതിൽ നിന്ന് അതിനെ തടയുന്നു, കൂടാതെ തിരുത്തലുകൾ കണ്ടെത്താൻ കഴിയുന്നതാക്കുന്നു.
വർക്ക്ഫ്ലോയും റിസ്ക് ടേബിളും
സ്റ്റേജ്
AI യുടെ സംഭാവന
പ്രധാന അപകടസാധ്യത
സംരക്ഷണ അളവ്
സ്കാൻ ചെയ്യുക
—
മോശം നിലവാരം
ഉയർന്ന റെസല്യൂഷൻ
OCR/HTR
വാചകത്തിലേക്ക് പരിവർത്തനം ചെയ്യുക
തിരിച്ചറിയൽ പിശകുകൾ
മനുഷ്യ തിരുത്തൽ
തിരുത്തൽ
പിശക് നിർദ്ദേശം
ഉള്ളടക്കം മാറ്റുന്നു
യഥാർത്ഥവുമായുള്ള താരതമ്യം
പുനഃസ്ഥാപിക്കൽ
ഇമേജ് ഡെറിവേറ്റീവ്
ഉചിതമായ വിശദാംശങ്ങൾ
അസംസ്കൃതമായത് സൂക്ഷിക്കുക, ലേബൽ ചെയ്യുക
സംരക്ഷണം
മെറ്റാഡാറ്റ ഡ്രാഫ്റ്റ്
ഉത്ഭവ നഷ്ടം
പ്രൊവെനൻസ് റെക്കോർഡ്
സാധാരണ തെറ്റുകൾ
- തിരുത്തലില്ലാതെ OCR ഔട്ട്പുട്ട് സ്വീകരിക്കുന്നു. പിശകുകൾ തിരയലും ആക്സസും തടസ്സപ്പെടുത്തുന്നു.
- AI-യെ "മനോഹരമാക്കുക" എന്ന് വിളിക്കുന്നു. ഇത് ഉള്ളടക്കത്തെ മാറ്റുകയും ഒറിജിനാലിറ്റി നശിപ്പിക്കുകയും ചെയ്യുന്നു.
- യഥാർത്ഥ തെളിവുകൾക്കായി AI പുനഃസ്ഥാപിക്കൽ മാറ്റിസ്ഥാപിക്കുന്നു. കെട്ടിച്ചമച്ച വിശദാംശങ്ങൾ തെറ്റായ ചരിത്രം സൃഷ്ടിക്കുന്നു.
- റോ സ്കാൻ സംഭരിക്കുന്നില്ല. ഒറിജിനൽ ഇല്ലാതെ ഒരു തിരുത്തലും പരിശോധിക്കാൻ കഴിയില്ല.
- ഉത്ഭവ വിവരങ്ങൾ ഒഴിവാക്കുന്നു. പ്രമാണത്തിൻ്റെ വിശ്വാസ്യത കണ്ടെത്താൻ കഴിയില്ല.
ചുരുക്കത്തിൽ
ഡിജിറ്റൽ ആർക്കൈവുകളിലും ഡിജിറ്റൈസേഷനിലും AI; OCR/HTR ട്രാൻസ്ക്രിപ്ഷൻ, മെറ്റാഡാറ്റ ഡ്രാഫ്റ്റിംഗ്, മുൻഗണന എന്നിവ വേഗത്തിലാക്കുന്ന വിലപ്പെട്ട സഹായമാണിത്. എന്നാൽ ആർക്കൈവൽ ജോലിയുടെ സാരാംശം ആധികാരികതയും സമഗ്രതയും ആണ്: OCR ഔട്ട്പുട്ട് മനുഷ്യൻ്റെ കണ്ണുകൊണ്ട് ശരിയാക്കണം, AI ഒരിക്കലും ഉള്ളടക്കത്തെ നിശബ്ദമായി മാറ്റിസ്ഥാപിക്കരുത്, പുനരുദ്ധാരണ ഡെറിവേറ്റീവുകൾ യഥാർത്ഥ തെളിവുകളെ മാറ്റിസ്ഥാപിക്കരുത്, കൂടാതെ അസംസ്കൃത സ്കാനിംഗും ഉറവിട വിവരങ്ങളും എല്ലായ്പ്പോഴും സംരക്ഷിക്കപ്പെടണം. ഡോക്യുമെൻ്റിനെ "മെച്ചപ്പെടുത്താത്ത" ഒരു ടൂളായി AI ഉപയോഗിക്കുക, പകരം അതിനോട് വിശ്വസ്തത പുലർത്തുമ്പോൾ തന്നെ അത് ആക്സസ് ചെയ്യാൻ കഴിയും.
ആപ്ലിക്കേഷൻ ടാസ്ക്
OCR ഔട്ട്പുട്ടിൻ്റെ ഒരു ചെറിയ സാമ്പിൾ നേടുക (ഒന്നുകിൽ നിങ്ങളുടെ സ്വന്തം പ്രൊഡക്ഷൻ അല്ലെങ്കിൽ ഒരു യഥാർത്ഥ സ്കാനിൽ നിന്ന്). "OCR ഔട്ട്പുട്ട് തിരുത്തൽ സഹായം" ടെംപ്ലേറ്റ് ഉപയോഗിച്ച് തിരിച്ചറിയൽ പിശകുകൾ മാത്രം ശരിയാക്കുക, തുടർന്ന് "ടെക്സ്റ്റ്-ഇമേജ് സ്ഥിരത പരിശോധന" ടെംപ്ലേറ്റിനൊപ്പം AI ഉള്ളടക്കം ചേർത്തിട്ടുണ്ടോയെന്ന് പരിശോധിക്കുക. തുടർന്ന് "പ്രിസർവേഷൻ മെറ്റാഡാറ്റ ഡ്രാഫ്റ്റ്" ടെംപ്ലേറ്റ് ഉപയോഗിച്ച് ഒബ്ജക്റ്റിനായി പ്രോവിൻസ്, ഫോർമാറ്റ് വിവരങ്ങൾ എന്നിവ ഉപയോഗിച്ച് ഒരു റെക്കോർഡ് സൃഷ്ടിക്കുക.
ചെക്ക്ലിസ്റ്റ്
- [ ] ഞാൻ OCR/HTR ഔട്ട്പുട്ട് യഥാർത്ഥ ചിത്രവുമായി താരതമ്യം ചെയ്യുകയും അത് ശരിയാക്കുകയും ചെയ്തു.
- [ ] AI ഉള്ളടക്കം ചേർക്കുകയോ മാറ്റുകയോ ചെയ്യുന്നില്ലെന്ന് ഞാൻ പരിശോധിച്ചു.
- [ ] ഞാൻ റോ (മാസ്റ്റർ) സ്കാൻ പ്രത്യേകം മാറ്റമില്ലാതെ സൂക്ഷിച്ചു.
- [ ] ഞാൻ മെറ്റാഡാറ്റയിൽ പ്രൊവെനൻസ്, ഫോർമാറ്റ് വിവരങ്ങൾ ചേർത്തു.
- [ ] ഞാൻ "AI ഡെറിവേറ്റീവ്" എന്ന് പുനഃസ്ഥാപിക്കൽ വേരിയൻ്റുകളെ വ്യക്തമായി ലേബൽ ചെയ്തിട്ടുണ്ട്.