அலகுகள்
1. வரலாறு மற்றும் காப்பகத்தில் செயற்கை நுண்ணறிவு அறிமுகம்: பாத்திரங்கள், எல்லைகள், சரிபார்ப்பு மற்றும் நெறிமுறைகள் 2. ஆவண டிஜிட்டல்மயமாக்கல் மற்றும் OCR: அச்சிடப்பட்ட உரையை இயந்திர உரையாக மாற்றுதல் 3. டிரான்ஸ்கிரிப்ஷன்: ஒட்டோமான் துருக்கிய மற்றும் கையெழுத்துப் பிரதிகள் 4. மெட்டாடேட்டா, பட்டியல் மற்றும் வகைப்படுத்தல் 5. மூல ஸ்கேனிங், கண்டுபிடிப்பு மற்றும் சுருக்கம் 6. வரலாற்று மொழிபெயர்ப்பு மற்றும் எளிமைப்படுத்தல் 7. மூல சரிபார்ப்பு, அனாக்ரோனிசம் மற்றும் மாயத்தோற்றம் 8. உள்ளடக்க பகுப்பாய்வு மற்றும் வடிவ கண்டுபிடிப்பு 9. காப்பக அணுகல், விளக்கம் மற்றும் பயனர் சேவைகள் 10. பாதுகாப்பு, மறுசீரமைப்பு மற்றும் டிஜிட்டல் பாதுகாப்பு 11. நெறிமுறைகள், பதிப்புரிமை, தனியுரிமை மற்றும் கலாச்சார உணர்திறன் 12. எண்ட்-டு-எண்ட் திட்டம்: செயற்கை நுண்ணறிவுடன் ஒரு காப்பக சேகரிப்பை செயலாக்குதல்
அலகு 4 / 12

மெட்டாடேட்டா, பட்டியல் மற்றும் வகைப்படுத்தல்

ஆதாயங்கள்:

  • செயற்கை நுண்ணறிவுடன் கூடிய ISAD(G) அல்லது Dublin Core போன்ற தரநிலைகளுக்கு ஏற்ப மெட்டாடேட்டா வரைவுகளை உருவாக்கும் திறன்
  • மாயத்தோற்றத்தைத் தடுக்கும் திறன் மற்றும் லீவ்-வெற்று அனுமதியுடன் கட்டுப்படுத்தப்பட்ட சொற்களஞ்சியத்திற்கு உட்பட்ட விதிமுறைகளை வரைபடமாக்குதல்
  • தேதி, நபர் பெயர் மற்றும் குறிப்புக் குறியீடு போன்ற எந்தெந்த துறைகளுக்கு மனித ஒப்புதல் தேவை மற்றும் நிறுவனத்தால் மட்டுமே ஒதுக்கப்பட வேண்டும் என்பதை வேறுபடுத்தி அறியும் திறன்

ஒரு காப்பகம் அல்லது நூலகம், அது எவ்வளவு வளமானதாக இருந்தாலும், அது நன்கு வரையறுக்கப்பட்டாலன்றி கண்டுபிடிக்க முடியாது. ஒரு ஆவணத்தை "கண்டுபிடிக்கக்கூடியதாக" ஆக்குவது அதைப் பற்றிய விளக்கமான தகவலாகும்: யார், எப்போது, ​​எங்கு, அதன் பொருள் என்ன, அது எந்த தொகுப்பைச் சேர்ந்தது. இந்தத் தகவல் மெட்டாடேட்டா என்று அழைக்கப்படுகிறது (மெட்டாடேட்டா - ஒரு ஆவணத்தைப் பற்றிய விளக்கமான தரவு; "தரவு பற்றிய தரவு"). அட்டவணைப்படுத்தல் என்பது இந்த மெட்டாடேட்டாவுடன் ஆவணங்களை அடையாளம் கண்டு அவற்றை தேடக்கூடிய அமைப்பில் சேமிப்பதாகும். வகைப்பாடு என்பது பொருள், வகை அல்லது தோற்றம் போன்ற அளவுகோல்களின்படி ஆவணங்களை ஒழுங்கமைப்பதாகும்.

மெட்டாடேட்டாவை உருவாக்குவது மிகவும் நேரத்தை எடுத்துக்கொள்ளும்; பெரிய சேகரிப்புகளில் ஆயிரக்கணக்கான ஆவணங்களுக்குத் தனித்தனியாக தேதி, பொருள், நபர் மற்றும் இடத் தகவல்களை உள்ளிடுவதற்கு பல ஆண்டுகள் ஆகலாம். இந்த வணிகத்தில் AI ஒரு வலுவான வரைவு ஜெனரேட்டராகும். இந்த யூனிட்டில், AI உடன் மெட்டாடேட்டாவை எவ்வாறு உருவாக்குவது, தரநிலைகள் (ISAD(G), Dublin Core) ஆகியவற்றின் படி அட்டவணைப்படுத்துவது மற்றும் தானியங்கு வகைப்பாட்டின் சக்தி மற்றும் ஆபத்துகள் இரண்டையும் காண்போம்.

காப்பக தரநிலைகள்: அவை ஏன் தேவைப்படுகின்றன

மெட்டாடேட்டா தற்செயலாக உள்ளிடப்படவில்லை; பல்வேறு நிறுவனங்களின் பதிவுகள் ஒருவருக்கொருவர் பேசுவதற்கு சர்வதேச தரநிலைகள் உள்ளன:

  • ISAD(G) (பொது சர்வதேச தரக் காப்பக விளக்கம்): காப்பகப் பொருட்களை படிநிலையாக (நிதி, தொடர், கோப்பு, ஆவணம் மட்டத்தில்) விவரிப்பதற்கான விதிகள். இது குறிப்புக் குறியீடு, தலைப்பு, தேதி, நோக்கம், உருவாக்கியவர் போன்ற புலங்களைக் கொண்டுள்ளது.
  • டப்ளின் கோர்: டிஜிட்டல் ஆதாரங்களை (தலைப்பு, உருவாக்கியவர், பொருள், தேதி, வகை, வடிவம், மூல, மொழி, முதலியன) விவரிப்பதற்கான 15 முக்கிய துறைகளைக் கொண்ட ஒரு பொதுவான தரநிலை.
  • பாண்டுகள்: ஒரு தனி நபர், குடும்பம் அல்லது நிறுவனத்தின் செயல்பாடுகளின் விளைவாக இயற்கையாக உருவாக்கப்பட்ட பதிவுகளின் தொகுப்பு. இது காப்பகத்தின் அடிப்படை அமைப்பு அலகு ஆகும்.
  • ஆதாரம் (தோற்றம்): ஒரு ஆவணம் யாரிடமிருந்து வருகிறது, அது எந்தக் கையால் சென்றது என்பது பற்றிய தகவல். காப்பகத்தில், ஆவணங்கள் அவற்றின் தோற்றத்திற்கு ஏற்ப ஒன்றாக வைக்கப்படுகின்றன.

AI மெட்டாடேட்டாவை உருவாக்கும் போது இலக்கு தரநிலையை வெளிப்படையாகக் குறிப்பிடுவது, வெளியீடு நேரடியாக நிறுவனத்தில் உள்ளிடப்படுவதை உறுதி செய்கிறது.

மற்றொரு முக்கிய கருத்து அதிகார பதிவு - ஒரு நபர், இடம் அல்லது நிறுவனத்தின் பெயரின் ஒற்றை, நிலையான, அங்கீகரிக்கப்பட்ட வடிவத்தை வரையறுக்கும் பதிவு. வரலாற்று ஆவணங்களில், ஒரே நபர் அல்லது இடம் வெவ்வேறு எழுத்துப்பிழைகளுடன் தோன்றலாம்; அதிகாரப் பதிவு அவை அனைத்தையும் ஒரே அங்கீகரிக்கப்பட்ட வடிவமைப்பில் இணைக்கிறது, அதனால் அவை தேடலில் சிதறாது. AI ஒரு ஆவணத்திலிருந்து பெயர்களை பரிந்துரைக்கிறது; ஆனால் இந்த பெயரை அதிகாரப் பதிவில் நிலையான படிவத்திற்கு மாற்றுவது மனித வேலை. நிறுவனத்தின் அதிகாரப் பதிவில் "அஹ்மத்" என்று AI கூறுவதை "அஹ்மத் பே (1840-1912)" உடன் இணைப்பது பட்டியலின் நிலைத்தன்மையைப் பாதுகாக்கிறது.

பணிப்பாய்வு: படிப்படியாக

1. மூலத்தைத் தயாரிக்கவும். ஆவணத்தின் டிரான்ஸ்கிரிப்ட் அல்லது படம் மற்றும் ஏதேனும் சூழல் தகவலைச் சேகரிக்கவும்.

2. தரநிலை மற்றும் பகுதிகளை அடையாளம் காணவும். எந்தத் தரநிலை (ISAD(G), Dublin Core) மற்றும் எந்தெந்தப் புலங்களின்படி அது வெளியீட்டை உருவாக்கும் என்பதை AIக்குக் கூறுங்கள்.

3. வரைவு மெட்டாடேட்டாவை உருவாக்கவும். ஆவணத்திலிருந்து பிரித்தெடுக்கக்கூடிய புலங்களை AI நிரப்புகிறது (தேதி, நபர், இடம், பொருள், மொழி, வகை); அது அகற்ற முடியாத பகுதிகளை காலியாக வைக்கிறது.

4. கட்டுப்படுத்தப்பட்ட சொற்களஞ்சியத்திற்கான வரைபடம். பெரும்பாலான நிறுவனங்களில் பொருள் மற்றும் இடப் பெயர்கள் இலவசம் அல்ல, ஆனால் அவை முன் வரையறுக்கப்பட்ட பட்டியலுடன் இணைக்கப்பட்டுள்ளன (கட்டுப்படுத்தப்பட்ட சொற்களஞ்சியம் / சொற்களஞ்சியம்). இந்தப் பட்டியலில் AI ஆல் பரிந்துரைக்கப்பட்ட பொருள் விதிமுறைகளை வரைபடமாக்குங்கள்.

5. சரிபார்த்து உறுதிப்படுத்தவும். ஒவ்வொரு துறையும், குறிப்பாக தேதி, பெயர் மற்றும் பொருள், ஆவணங்கள் மற்றும் அதிகாரப் பதிவுகளுடன் மனிதர்களால் ஒப்பிடப்படுகிறது.

உதவிக்குறிப்பு: "வெறுமையாக விட" AIக்கு வெளிப்படையாக அனுமதி வழங்கவும். இல்லையெனில், அது ஆவணத்தில் இல்லாத தேதி அல்லது படைப்பாளியை "யூகித்து" உங்கள் பட்டியலில் போலியான மெட்டாடேட்டாவைச் செருகும். "இந்தப் புலம் ஆவணத்தில் இல்லை என்றால் காலியாக விடவும்" என்ற அறிவுறுத்தல் மாயத்தோற்றத்திற்கு எதிரான வலுவான கவசம் ஆகும்.

அட்டவணையில் புலங்கள் மற்றும் நம்பிக்கை நிலை

மெட்டாடேட்டா புலம்

AI எவ்வளவு நம்பகமானது?

சரிபார்ப்பு

மொழி

உயர்

மாதிரி

ஆவண வகை

நடுத்தர உயர்

கட்டுப்பாடு

நபர்/இடப் பெயர்கள்

நடுத்தர (வாசிப்பு பிழை)

கட்டாயம்

தேதி

குறைந்த-நடுத்தர (புனையப்படுவதற்கான ஆபத்து)

கட்டாயம்

பொருள் விதிமுறைகள்

நடுத்தர (இலவச உருவாக்கம்)

சரிபார்ப்புப் பட்டியலில் வரைபடம்

நோக்கம்/சுருக்கம்

நடுத்தர உயர்

மூலத்துடன் ஒப்பிடுக

குறிப்பு குறியீடு

எதுவும் இல்லை (நிறுவனம் கொடுக்கிறது)

மனித வீசுதல்கள்

சுருக்கம்: மொழி மற்றும் வகை போன்ற பகுதிகளில் AI வேகமானது மற்றும் நம்பகமானது; தேதி, பெயர் மற்றும் பொருள் போன்ற துறைகளில் வரைவுகளை உருவாக்குகிறது, ஆனால் மனித ஒப்புதல் தேவை; குறிப்பு குறியீடு போன்ற நிறுவன துறைகளை AI ஒருபோதும் உருவாக்காது.

மூன்று சிறிய வழக்குகள்

வழக்கு 1 — 8,000 படங்களுக்கான வரைவு மெட்டாடேட்டா. ஒரு நகர காப்பகம் 8,000 வரலாற்று புகைப்படங்களை பட்டியலிட்டது. ஒவ்வொரு புகைப்படத்தின் பின்புறத்திலும் உள்ள குறிப்புகள் படியெடுக்கப்பட்டு AIக்கு வழங்கப்பட்டது; AI உருவாக்கிய தேதி, இடம் மற்றும் தலைப்பு அவுட்லைன். மனித குழு அதை புலம் வாரியாக சரிபார்த்து கட்டுப்படுத்தப்பட்ட பட்டியலில் வரைபடமாக்கியது. மதிப்பிடப்பட்ட 10 மாத வேலை 3 மாதங்களாக குறைக்கப்பட்டது; ஆனால் ஒவ்வொரு தேதி மற்றும் இடத்தின் பெயர் பார்வைக்கு சரிபார்க்கப்பட்டது.

வழக்கு 2 - உருவாக்கப்பட்ட வரலாறு. ஒரு காப்பக நிபுணரிடம் AI அட்டவணை தேதியிடப்படாத கடிதம் இருந்தது. YZ கடிதத்தின் உள்ளடக்கத்தைப் பார்த்து, "1912" தேதியை துல்லியமாக எழுதினார். இருப்பினும், ஆவணத்தில் தேதி இல்லை; AI கணித்துள்ளது. "ஆவணத்தில் இல்லை என்றால் காலியாக விடவும்" என்ற அறிவுறுத்தலை காப்பக நிபுணர் சேர்க்கவில்லை என்றால், அட்டவணையில் தயாரிக்கப்பட்ட தேதி நிரப்பப்பட்டிருக்கும். பாடம்: வெற்று அனுமதி கட்டாயம்.

வழக்கு 3 - இலவச பொருள் விதிமுறைகள் குழப்பத்தை உருவாக்கியது. AI ஒத்த ஆவணங்களுக்கு "குடியேற்றம்", "குடியேற்றம்", "செட்டில்மென்ட்" போன்ற ஒத்த ஆனால் வேறுபட்ட இலவச சொற்களை ஒதுக்கியது. கட்டுப்படுத்தப்பட்ட சொற்களஞ்சியத்தில் வரைபடமாக்கப்படாதபோது, ​​ஒரே தலைப்பு மூன்று வெவ்வேறு சொற்களால் குறிக்கப்பட்டு தேடலில் சிதறடிக்கப்பட்டது. ஒரே அதிகாரப் பட்டியலில் விதிமுறைகளை மேப்பிங் செய்வதன் மூலம் நிலைத்தன்மை அடையப்பட்டது. பாடம்: தலைப்பு விதிமுறைகள் வெளியிடப்படவில்லை, அவை பட்டியலில் இணைக்கப்பட்டுள்ளன.

நகலெடுக்கக்கூடிய நான்கு வார்ப்புருக்கள்

1) டப்ளின் கோர் அவுட்லைன்:

கீழே உள்ள ஆவண டிரான்ஸ்கிரிப்ஷனில் இருந்து டப்ளின் கோர் மெட்டாடேட்டா வரைவை பிரித்தெடுக்கவும். புலங்கள்: தலைப்பு, படைப்பாளர், பொருள், விளக்கம், தேதி, வகை, மொழி, நோக்கம் (இடம்/காலம்). விதிகள்: (1) உரையில் தகவல்களை மட்டும் தெளிவாகப் பயன்படுத்தவும். (2) உரையில் இல்லாத புலத்தை காலியாக விடவும், யூகிக்க வேண்டாம். (3) நீங்கள் உறுதியாக தெரியாத மதிப்பை [?] உடன் குறிக்கவும். டிரான்ஸ்கிரிப்ஷன்: [இங்கே]

2) ISAD(G) வரைவு வரையறை:

ISAD(G) புலங்களில் பின்வரும் ஆவணத்திற்கான வரைவை உருவாக்கவும்: தலைப்பு, தேதி(கள்), விளக்க நிலை (ஆவணம்/கோப்பு), நோக்கம் மற்றும் உள்ளடக்கம் (குறுகிய சுருக்கம்), படைப்பாளர், மொழி. குறிப்புக் குறியீட்டை காலியாக விடவும் (நிறுவனம் அதை வழங்கும்). உரையில் இல்லாத எந்த தகவலையும் சேர்க்க வேண்டாம்; இல்லாத புலத்தை காலியாக விடவும். ஆவணம்: [இங்கே]

3) தலைப்பு கால பரிந்துரை (கட்டுப்படுத்தப்பட்டது):

கீழே உள்ள ஆவணத்திற்கு பொருத்தமான 3-5 தலைப்பு விதிமுறைகளை பரிந்துரைக்கவும். முதலில், ஆவணத்தில் உள்ள உண்மைகளை நம்புங்கள். எங்கள் நிறுவனத்தின் கட்டுப்பாட்டுச் சொற்களின் பட்டியல் கீழே உள்ளது; முதலில், இந்தப் பட்டியலில் இருந்து அதைத் தேர்ந்தெடுக்கவும், அது பட்டியலில் இல்லை என்றால், உங்களின் புதிய காலப் பரிந்துரையைத் தனியாகக் குறிக்கவும். பட்டியல்: [விதிமுறைகள்]. ஆவணம்: [இங்கே]

4) மொத்த நிலைத்தன்மை சோதனை:

அதே சேகரிப்பில் உள்ள ஆவணங்களுக்கான மெட்டாடேட்டா பதிவுகள் கீழே உள்ளன. கொடி முரண்பாடுகள்: ஒரே இடத்தில்/நபரை வித்தியாசமாக உச்சரிக்கும் பதிவுகள், வெவ்வேறு தேதி வடிவங்கள், ஒரே பாடத்திற்கான வெவ்வேறு சொற்கள். திருத்தம் IMPOSITION; மனிதர்கள் மதிப்பாய்வு செய்ய ஏற்ற முரண்பாடுகளின் பட்டியலை உருவாக்கவும். பதிவுகள்: [இங்கே]

பலவீனமான வரியில் / வலுவான வரியில்

பலவீனமான:

இந்த ஆவணத்திற்கான முழுமையான பட்டியல் பதிவை உருவாக்கவும்.

"முழுமையான" அறிவுறுத்தல், ஒவ்வொரு இடத்தையும் நிரப்ப AI ஐத் தள்ளுகிறது, அதாவது வரலாறு மற்றும் இல்லாத படைப்பாளர்களைக் கண்டுபிடிக்க.

வலுவான:

இந்த ஆவணத்திற்காக டப்ளின் கோர் வரைவு செய்யப்பட்டது. டிரான்ஸ்கிரிப்ஷனில் தெளிவாக சேர்க்கப்பட்டுள்ள தகவலை மட்டும் பயன்படுத்தவும்; இல்லாத புலத்தை காலியாக விடவும், யூகிக்க வேண்டாம். இந்த கட்டுப்படுத்தப்பட்ட பட்டியலிலிருந்து தலைப்பு விதிமுறைகளைத் தேர்ந்தெடுக்கவும்: [list]. தேதி மற்றும் நபரின் பெயர்களை [?] உடன் குறிக்கவும், அதனால் நான் அதை ஆவணத்துடன் சரிபார்க்க முடியும். டிரான்ஸ்கிரிப்ஷன்: [இங்கே]

வேறுபாடு: "முழுமையான" பதிப்பிற்குப் பதிலாக "வெறுமையாக விடுங்கள்" அனுமதி, கட்டுப்படுத்தப்பட்ட பட்டியலைப் பின்பற்றுதல் மற்றும் சரிபார்ப்பு மதிப்பெண்கள் ஆகியவை புனையப்படுவதிலிருந்து பட்டியலைப் பாதுகாக்கின்றன.

பொதுவான தவறுகள்

  • இதன் பொருள் "அதை முழுமையாக நிரப்பு". இது இல்லாத புலங்களை பொருத்துவதற்கு வழிவகுக்கிறது; "வெறுமையாக விடுங்கள்" அனுமதி வழங்கப்பட வேண்டும்.
  • பொருள் விதிமுறைகளை வெளியிடுதல். கட்டுப்படுத்தப்பட்ட சொற்களஞ்சியத்துடன் வரைபடமாக்கப்படாத சொற்கள் தேடலைத் திசைதிருப்பும்.
  • AI வரலாற்றைக் கணித்தல். தேதியிடப்படாத ஆவணத்தில் கற்பனையான தேதியை உள்ளிடுவது பட்டியலை மாசுபடுத்துகிறது.
  • AI ஆல் உருவாக்கப்பட்ட குறிப்புக் குறியீட்டைக் கொண்டிருத்தல். இது ஒரு பெருநிறுவன, தனித்துவமான இடம்; மக்கள் வீசுகிறார்கள்.
  • தரநிலையை குறிப்பிடவில்லை. தரநிலை குறிப்பிடப்படவில்லை என்றால், வெளியீடு ஒரு குழப்பமான வரைவாக இருக்கும், அது நிறுவனத்திற்குள் நுழைய முடியாது.

சுருக்கமாக

மெட்டாடேட்டா மற்றும் பட்டியலிடுதல் ஆகியவை கண்ணுக்குத் தெரியாத உள்கட்டமைப்பு ஆகும், இது ஆராய்ச்சியாளருக்கு காப்பகத்தைத் திறக்கிறது, மேலும் அதற்கு நிறைய முயற்சி தேவைப்படுகிறது. டிரான்ஸ்கிரிப்ஷனில் இருந்து, தேதி, நபர், இடம், பொருள் மற்றும் வகை போன்ற துறைகளுக்கான விரைவான அவுட்லைனை AI உருவாக்குகிறது; இது ISAD(G) அல்லது Dublin Core போன்ற தரநிலைகளின்படி செயல்பட முடியும். ஆனால் "முழுமையாக நிரப்ப" அழுத்தம், விஷயங்களை உருவாக்க AI ஐத் தள்ளுகிறது; "வெறுமையாக விடுங்கள்" அனுமதி, கட்டுப்படுத்தப்பட்ட சொல்லகராதிக்கு மேப்பிங் செய்தல் மற்றும் தேதிகள்/பெயர்களின் மனித உறுதிப்படுத்தல் ஆகியவை பட்டியலை நம்பகமானதாக வைத்திருக்கின்றன. AI வரைவைத் தயாரிக்கிறது; பட்டியலின் துல்லியத்திற்கு நீங்கள் பொறுப்பு.

விண்ணப்ப பணி

"டப்ளின் கோர் டிராஃப்ட்" டெம்ப்ளேட்டைக் கொண்டு AI இலிருந்து ஒரு ஆவணப் படியெடுத்தல் மற்றும் மெட்டாடேட்டாவைக் கோரவும்; அது இல்லாத காலி புலங்களை விட்டுச் செல்கிறதா எனச் சரிபார்க்கவும். உங்கள் சொந்த (அல்லது மாதிரி) சரிபார்ப்புப் பட்டியலுடன் "தலைப்பு கால பரிந்துரை" டெம்ப்ளேட்டை இயக்கவும். இறுதியாக, ஒரு சில பதிவுகளை "மொத்த நிலைத்தன்மை சரிபார்ப்பு" மூலம் சோதிக்கவும். AI எத்தனை புலங்களை முன்கணிப்புடன் நிரப்ப முயற்சிக்கிறது மற்றும் பட்டியலில் எத்தனை பொருள் சொற்கள் மேப் செய்யப்பட வேண்டும் என்பதைக் கவனியுங்கள்.

சரிபார்ப்பு பட்டியல்

  • [ ] இலக்கு தரநிலையை (ISAD(G)/டப்ளின் கோர்) தெளிவாகக் கூறியுள்ளேன்.
  • [ ] நான் "வெற்றுப் புலத்தை காலியாக விடு" அனுமதி அளித்தேன்.
  • [ ] கட்டுப்படுத்தப்பட்ட பட்டியலில் தலைப்பு விதிமுறைகளை வரைபடமாக்கினேன்.
  • [ ] ஆவணம்/அதிகாரப் பதிவோடு தேதி மற்றும் நபர் பெயர்களைச் சரிபார்த்தேன்.
  • [ ] நான் குறிப்புக் குறியீட்டை நிறுவனத்திற்கு விட்டுவிட்டேன், AI க்கு அல்ல.