యూనిట్లు
1. చరిత్ర మరియు ఆర్కైవింగ్‌లో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ పరిచయం: పాత్రలు, సరిహద్దులు, ధ్రువీకరణ మరియు నీతి 2. డాక్యుమెంట్ డిజిటలైజేషన్ మరియు OCR: ప్రింటెడ్ టెక్స్ట్‌ను మెషిన్ టెక్స్ట్‌గా మార్చడం 3. లిప్యంతరీకరణ: ఒట్టోమన్ టర్కిష్ మరియు మాన్యుస్క్రిప్ట్స్ 4. మెటాడేటా, కేటలాగింగ్ మరియు వర్గీకరణ 5. సోర్స్ స్కానింగ్, డిస్కవరీ మరియు సారాంశం 6. హిస్టారికల్ ట్రాన్స్లేషన్ అండ్ సింప్లిఫికేషన్ 7. మూల ధృవీకరణ, అనాక్రోనిజం మరియు భ్రాంతి 8. కంటెంట్ విశ్లేషణ మరియు నమూనా ఆవిష్కరణ 9. ఆర్కైవ్ యాక్సెస్, వివరణ మరియు వినియోగదారు సేవలు 10. సంరక్షణ, పునరుద్ధరణ మరియు డిజిటల్ సంరక్షణ 11. నీతి, కాపీరైట్, గోప్యత మరియు సాంస్కృతిక సున్నితత్వం 12. ఎండ్-టు-ఎండ్ ప్రాజెక్ట్: ఆర్టిఫిషియల్ ఇంటెలిజెన్స్‌తో ఆర్కైవ్ కలెక్షన్‌ను ప్రాసెస్ చేయడం
యూనిట్ 4 / 12

మెటాడేటా, కేటలాగింగ్ మరియు వర్గీకరణ

లాభాలు:

  • కృత్రిమ మేధస్సుతో ISAD(G) లేదా డబ్లిన్ కోర్ వంటి ప్రమాణాలకు అనుగుణంగా మెటాడేటా డ్రాఫ్ట్‌లను రూపొందించగల సామర్థ్యం
  • భ్రాంతిని నిరోధించే సామర్థ్యం మరియు లీవ్-ఖాళీ అనుమతితో నియంత్రిత పదజాలానికి సబ్జెక్ట్ నిబంధనలను మ్యాప్ చేయడం
  • తేదీ, వ్యక్తి పేరు మరియు రిఫరెన్స్ కోడ్ వంటి ఏ ఫీల్డ్‌లకు మానవ ఆమోదం అవసరం మరియు వాటిని సంస్థ మాత్రమే కేటాయించాలి అని గుర్తించగల సామర్థ్యం

ఆర్కైవ్ లేదా లైబ్రరీ, అది ఎంత గొప్పదైనా సరే, దానిని బాగా నిర్వచించకపోతే కనుగొనబడదు. పత్రాన్ని "కనుగొనగలిగేది" అంటే దాని గురించిన వివరణాత్మక సమాచారం: ఎవరు వ్రాసారు, ఎప్పుడు, ఎక్కడ, దాని విషయం ఏమిటి, అది ఏ సేకరణకు చెందినది. ఈ సమాచారాన్ని మెటాడేటా అంటారు (మెటాడేటా — పత్రం గురించిన వివరణాత్మక డేటా; “డేటా గురించిన డేటా”). కేటలాగింగ్ అనేది ఈ మెటాడేటాతో డాక్యుమెంట్‌లను గుర్తించడం మరియు వాటిని శోధించదగిన సిస్టమ్‌లో సేవ్ చేయడం. వర్గీకరణ అనేది విషయం, రకం లేదా మూలం వంటి ప్రమాణాల ప్రకారం పత్రాలను నిర్వహించడం.

మెటాడేటాను రూపొందించడం చాలా సమయం తీసుకుంటుంది; పెద్ద సేకరణలలో వేలాది పత్రాల కోసం వ్యక్తిగతంగా తేదీ, విషయం, వ్యక్తి మరియు స్థలం సమాచారాన్ని నమోదు చేయడానికి సంవత్సరాలు పట్టవచ్చు. ఈ వ్యాపారంలో AI బలమైన డ్రాఫ్ట్ జనరేటర్. ఈ యూనిట్‌లో, AIతో మెటాడేటాను ఎలా రూపొందించాలో, ప్రమాణాలకు (ISAD(G), డబ్లిన్ కోర్) అనుగుణంగా జాబితా చేయడం మరియు ఆటోమేటిక్ వర్గీకరణ యొక్క శక్తి మరియు ఆపదలు రెండింటినీ చూస్తాము.

ఆర్కైవల్ ప్రమాణాలు: అవి ఎందుకు అవసరం

మెటాడేటా యాదృచ్ఛికంగా నమోదు చేయబడలేదు; అంతర్జాతీయ ప్రమాణాలు ఉన్నాయి, తద్వారా వివిధ సంస్థల నుండి రికార్డులు పరస్పరం మాట్లాడుకోవచ్చు:

  • ISAD(G) (జనరల్ ఇంటర్నేషనల్ స్టాండర్డ్ ఆర్కైవల్ వివరణ): ఆర్కైవల్ మెటీరియల్‌ను క్రమానుగతంగా (ఫండ్, సిరీస్, ఫైల్, డాక్యుమెంట్ స్థాయిలో) వివరించే నియమాలు. ఇది సూచన కోడ్, శీర్షిక, తేదీ, పరిధి, సృష్టికర్త వంటి ఫీల్డ్‌లను కలిగి ఉంటుంది.
  • డబ్లిన్ కోర్: డిజిటల్ వనరులను (శీర్షిక, సృష్టికర్త, విషయం, తేదీ, శైలి, ఫార్మాట్, మూలం, భాష మొదలైనవి) వివరించడానికి 15 కోర్ ఫీల్డ్‌లను కలిగి ఉన్న ఒక సాధారణ ప్రమాణం.
  • అభిమానాలు: ఒకే వ్యక్తి, కుటుంబం లేదా సంస్థ యొక్క కార్యకలాపాల ఫలితంగా సహజంగా ఏర్పడిన రికార్డుల సమితి. ఇది ఆర్కైవింగ్ యొక్క ప్రాథమిక ఆర్గనైజింగ్ యూనిట్.
  • మూలాధారం (మూలం): ఒక పత్రం ఎవరి నుండి వచ్చింది మరియు అది ఏ చేతి ద్వారా పంపబడింది అనే సమాచారం. ఆర్కైవింగ్‌లో, పత్రాలు వాటి మూలం ప్రకారం కలిసి ఉంచబడతాయి.

AI మెటాడేటాను ఉత్పత్తి చేస్తున్నప్పుడు లక్ష్య ప్రమాణాన్ని స్పష్టంగా పేర్కొనడం వలన అవుట్‌పుట్ నేరుగా ఎంటర్‌ప్రైజ్‌లోకి ఇన్‌పుట్ చేయబడుతుందని నిర్ధారిస్తుంది.

మరొక ముఖ్య భావన అథారిటీ రికార్డ్-ఒక వ్యక్తి, స్థలం లేదా సంస్థ యొక్క పేరు యొక్క ఒకే, ప్రామాణిక, ఆమోదించబడిన రూపాన్ని నిర్వచించే రికార్డు. చారిత్రక పత్రాలలో, ఒకే వ్యక్తి లేదా స్థలం వేర్వేరు స్పెల్లింగ్‌లతో కనిపించవచ్చు; అథారిటీ రికార్డ్ వాటన్నింటినీ ఒకే ఆమోదించబడిన ఫార్మాట్‌లో బంధిస్తుంది కాబట్టి అవి శోధనలో చెల్లాచెదురుగా ఉండవు. AI పత్రం నుండి పేర్లను సూచిస్తుంది; కానీ అధికార రికార్డులో ఈ పేరును ప్రామాణిక రూపానికి మ్యాప్ చేయడం మానవ పని. సంస్థ యొక్క అధికార రికార్డులో AI "అహ్మద్" అని చెప్పిన దానిని "అహ్మద్ బే (1840-1912)"కి లింక్ చేయడం వల్ల కేటలాగ్ యొక్క స్థిరత్వం సంరక్షించబడుతుంది.

వర్క్‌ఫ్లో: స్టెప్ బై స్టెప్

1. మూలాన్ని సిద్ధం చేయండి. పత్రం యొక్క ట్రాన్స్క్రిప్ట్ లేదా ఇమేజ్ మరియు ఏదైనా సందర్భ సమాచారాన్ని సేకరించండి.

2. ప్రమాణం మరియు ప్రాంతాలను గుర్తించండి. ఏ స్టాండర్డ్ (ISAD(G), డబ్లిన్ కోర్) మరియు ఏ ఫీల్డ్‌ల ప్రకారం అవుట్‌పుట్ ఉత్పత్తి చేస్తుందో AIకి చెప్పండి.

3. డ్రాఫ్ట్ మెటాడేటాను రూపొందించండి. పత్రం (తేదీ, వ్యక్తి, స్థలం, విషయం, భాష, శైలి) నుండి సంగ్రహించబడే ఫీల్డ్‌లను AI పూరిస్తుంది; ఇది తొలగించలేని ప్రాంతాలను ఖాళీగా ఉంచుతుంది.

4. నియంత్రిత పదజాలానికి మ్యాప్. చాలా సంస్థలలో విషయం మరియు స్థల పేర్లు ఉచితం కాదు, కానీ ముందే నిర్వచించబడిన జాబితా (నియంత్రిత పదజాలం / థెసారస్)తో ముడిపడి ఉంటాయి. ఈ జాబితాకు AI సూచించిన విషయ నిబంధనలను మ్యాప్ చేయండి.

5. ధృవీకరించండి మరియు నిర్ధారించండి. ప్రతి ఫీల్డ్, ముఖ్యంగా తేదీ, పేరు మరియు విషయం, పత్రాలు మరియు అధికార రికార్డులతో మానవులు పోల్చారు.

చిట్కా: "ఖాళీగా ఉంచడానికి" AIకి స్పష్టంగా అనుమతి ఇవ్వండి. లేకపోతే, ఇది డాక్యుమెంట్‌లో లేని తేదీ లేదా సృష్టికర్తను "ఊహిస్తుంది" మరియు మీ కేటలాగ్‌లో నకిలీ మెటాడేటాను చొప్పిస్తుంది. "ఈ ఫీల్డ్ డాక్యుమెంట్‌లో లేకుంటే ఖాళీగా వదిలేయండి" అనే సూచన భ్రాంతికి వ్యతిరేకంగా బలమైన కవచం.

పట్టికలో ఫీల్డ్‌లు మరియు విశ్వసనీయ స్థాయి

మెటాడేటా ఫీల్డ్

AI ఎంత విశ్వసనీయమైనది?

ధృవీకరణ

భాష

అధిక

నమూనా

పత్రం రకం

మధ్యస్థ-ఎక్కువ

నియంత్రణ

వ్యక్తి/స్థల పేర్లు

మీడియం (పఠన లోపం)

తప్పనిసరి

తేదీ

తక్కువ-మధ్యస్థం (కల్పన ప్రమాదం)

తప్పనిసరి

విషయ నిబంధనలు

మధ్యస్థం (ఉచిత ఉత్పత్తి)

చెక్‌లిస్ట్‌కి మ్యాప్

పరిధి/సారాంశం

మధ్యస్థ-ఎక్కువ

మూలంతో పోల్చండి

సూచన కోడ్

ఏదీ లేదు (సంస్థ ఇస్తుంది)

మానవ విసురుతాడు

సారాంశం: భాష మరియు శైలి వంటి అంశాలలో AI వేగవంతమైనది మరియు నమ్మదగినది; తేదీ, పేరు మరియు విషయం వంటి ఫీల్డ్‌లలో చిత్తుప్రతులను రూపొందిస్తుంది, అయితే మానవ ఆమోదం అవసరం; AI రిఫరెన్స్ కోడ్ వంటి సంస్థాగత ఫీల్డ్‌లను ఎప్పుడూ ఉత్పత్తి చేయదు.

మూడు చిన్న కేసులు

కేసు 1 — 8,000 ఫోటోల కోసం డ్రాఫ్ట్ మెటాడేటా. ఒక సిటీ ఆర్కైవ్ 8,000 చారిత్రక ఛాయాచిత్రాలను జాబితా చేస్తోంది. ప్రతి ఫోటో వెనుక ఉన్న గమనికలు లిప్యంతరీకరించబడ్డాయి మరియు AIకి ఇవ్వబడ్డాయి; AI రూపొందించిన తేదీ, స్థానం మరియు టాపిక్ అవుట్‌లైన్. మానవ బృందం దానిని ఫీల్డ్ వారీగా ధృవీకరించింది మరియు దానిని నియంత్రిత జాబితాకు మ్యాప్ చేసింది. అంచనా వేయబడిన 10-నెలల ఉద్యోగం 3 నెలలకు తగ్గించబడింది; కానీ ప్రతి తేదీ మరియు స్థలం పేరు దృశ్యమానంగా తనిఖీ చేయబడింది.

కేసు 2 — రూపొందించబడిన చరిత్ర. ఆర్కైవిస్ట్ వద్ద AI కేటలాగ్ తేదీ లేని లేఖ ఉంది. YZ లేఖలోని కంటెంట్‌ను చూసి "1912" తేదీని ఖచ్చితంగా రాశారు. అయితే, పత్రంలో తేదీ లేదు; AI అంచనా వేసింది. ఆర్కైవిస్ట్ "పత్రంలో లేకుంటే ఖాళీగా వదిలివేయండి" అనే సూచనను జోడించకపోతే, కేటలాగ్ తయారు చేయబడిన తేదీతో నింపబడి ఉండేది. పాఠం: ఖాళీ అనుమతి తప్పనిసరి.

కేస్ 3 — ఉచిత విషయ నిబంధనలు గందరగోళాన్ని సృష్టించాయి. AI సారూప్య పత్రాలకు "ఇమ్మిగ్రేషన్", "ఇమ్మిగ్రేషన్", "సెటిల్‌మెంట్" వంటి సారూప్యమైన కానీ భిన్నమైన ఉచిత పదాలను కేటాయించింది. ఇది నియంత్రిత పదజాలానికి మ్యాప్ చేయనప్పుడు, ఒకే అంశం మూడు వేర్వేరు పదాలతో ట్యాగ్ చేయబడింది మరియు శోధనలో చెల్లాచెదురుగా ఉంది. నిబంధనలను ఒకే అధికార జాబితాలోకి మ్యాప్ చేయడం ద్వారా స్థిరత్వం సాధించబడింది. పాఠం: టాపిక్ నిబంధనలు విడుదల చేయబడలేదు, అవి జాబితాకు లింక్ చేయబడ్డాయి.

నాలుగు కాపీ చేయగల టెంప్లేట్‌లు

1) డబ్లిన్ కోర్ అవుట్‌లైన్:

దిగువ డాక్యుమెంట్ ట్రాన్స్‌క్రిప్షన్ నుండి డబ్లిన్ కోర్ మెటాడేటా డ్రాఫ్ట్‌ను సంగ్రహించండి. ఫీల్డ్‌లు: శీర్షిక, సృష్టికర్త, విషయం, వివరణ, తేదీ, శైలి, భాష, పరిధి (స్థానం/కాలం). నియమాలు: (1) టెక్స్ట్‌లో సమాచారాన్ని మాత్రమే స్పష్టంగా ఉపయోగించండి. (2) టెక్స్ట్‌లో లేని ఫీల్డ్‌ను ఖాళీగా వదిలేయండి, ఊహించవద్దు. (3) మీకు ఖచ్చితంగా తెలియని విలువను [?]తో గుర్తు పెట్టండి. లిప్యంతరీకరణ: [ఇక్కడ]

2) ISAD(G) డ్రాఫ్ట్ నిర్వచనం:

ISAD(G) ఫీల్డ్‌లలో కింది పత్రం కోసం డ్రాఫ్ట్‌ను రూపొందించండి: శీర్షిక, తేదీ(లు), వివరణ స్థాయి (పత్రం/ఫైల్), స్కోప్ మరియు కంటెంట్ (చిన్న సారాంశం), సృష్టికర్త, భాష. రిఫరెన్స్ కోడ్‌ను ఖాళీగా వదిలివేయండి (సంస్థ దానిని అందిస్తుంది). వచనంలో లేని ఏ సమాచారాన్ని జోడించవద్దు; ఉనికిలో లేని ఫీల్డ్‌ను ఖాళీగా వదిలివేయండి. పత్రం: [ఇక్కడ]

3) టాపిక్ టర్మ్ సూచన (నియంత్రించబడింది):

దిగువ పత్రానికి తగిన 3-5 టాపిక్ నిబంధనలను సూచించండి. ముందుగా, డాక్యుమెంట్‌లోని వాస్తవాలపై ఆధారపడండి. మా సంస్థ యొక్క నియంత్రిత పదజాలం జాబితా క్రింద ఉంది; ముందుగా, ఈ జాబితా నుండి దీన్ని ఎంచుకోండి, ఇది జాబితాలో లేకుంటే, మీ కొత్త పదం సూచనను ప్రత్యేకంగా గుర్తించండి. జాబితా: [నిబంధనలు]. పత్రం: [ఇక్కడ]

4) బల్క్ అనుగుణ్యత తనిఖీ:

అదే సేకరణ నుండి డాక్యుమెంట్‌ల కోసం మెటాడేటా రికార్డ్‌లు క్రింద ఉన్నాయి. ఫ్లాగ్ అసమానతలు: ఒకే స్థలం/వ్యక్తిని వేర్వేరుగా స్పెల్లింగ్ చేసే రికార్డ్‌లు, వేర్వేరు తేదీ ఫార్మాట్‌లు, ఒకే సబ్జెక్ట్‌కు వేర్వేరు నిబంధనలు. దిద్దుబాటు IMPOSITION; మానవుడు సమీక్షించడానికి అసమానతల జాబితాను రూపొందించండి. రికార్డులు: [ఇక్కడ]

బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్

బలహీనం:

ఈ పత్రం కోసం పూర్తి కేటలాగ్ రికార్డ్‌ను సృష్టించండి.

"పూర్తి" సూచన ప్రతి స్థలాన్ని పూరించడానికి AIని నెట్టివేస్తుంది, అనగా చరిత్రను మరియు ఉనికిలో లేని సృష్టికర్తలను కనిపెట్టడానికి.

బలమైన:

డబ్లిన్ కోర్ ఈ పత్రం కోసం రూపొందించబడింది. లిప్యంతరీకరణలో స్పష్టంగా చేర్చబడిన సమాచారాన్ని మాత్రమే ఉపయోగించండి; ఉనికిలో లేని ఫీల్డ్‌ను ఖాళీగా ఉంచండి, ఊహించవద్దు. ఈ నియంత్రిత జాబితా నుండి టాపిక్ నిబంధనలను ఎంచుకోండి: [జాబితా]. తేదీ మరియు వ్యక్తి పేర్లను [?]తో గుర్తించండి, తద్వారా నేను దానిని పత్రంతో ధృవీకరించగలను. లిప్యంతరీకరణ: [ఇక్కడ]

తేడా: "పూర్తి" ఎడిషన్‌కు బదులుగా "ఖాళీగా వదిలివేయండి" అనుమతి, నియంత్రిత జాబితా కట్టుబడి మరియు ధృవీకరణ గుర్తులు కేటలాగ్‌ను కల్పన నుండి రక్షిస్తాయి.

సాధారణ తప్పులు

  • దీని అర్థం "పూర్తిగా పూరించండి". ఇది ఉనికిలో లేని ఫీల్డ్‌లను అమర్చడానికి దారితీస్తుంది; "ఖాళీగా వదిలేయండి" అనుమతి ఇవ్వాలి.
  • విషయ నిబంధనలను విడుదల చేస్తోంది. నియంత్రిత పదజాలానికి మ్యాప్ చేయని నిబంధనలు శోధనను దూరం చేస్తాయి.
  • AI చరిత్రను అంచనా వేయడం. తేదీ లేని పత్రంలో కల్పిత తేదీని నమోదు చేయడం వల్ల కేటలాగ్ కలుషితం అవుతుంది.
  • AI ద్వారా రూపొందించబడిన సూచన కోడ్‌ని కలిగి ఉండటం. ఇది కార్పొరేట్, ప్రత్యేకమైన స్థలం; ప్రజలు విసిరేస్తారు.
  • ప్రమాణాన్ని పేర్కొనడం లేదు. ప్రమాణం పేర్కొనబడకపోతే, అవుట్‌పుట్ గజిబిజి డ్రాఫ్ట్ అవుతుంది, అది ఇన్‌స్టిట్యూషన్‌లోకి ప్రవేశించదు.

సారాంశంలో

మెటాడేటా మరియు కేటలాగింగ్ అనేది పరిశోధకుడికి ఆర్కైవ్‌ను తెరిచే అదృశ్య అవస్థాపన, మరియు దీనికి చాలా కృషి అవసరం. లిప్యంతరీకరణ నుండి, తేదీ, వ్యక్తి, స్థలం, విషయం మరియు శైలి వంటి ఫీల్డ్‌ల కోసం AI వేగవంతమైన రూపురేఖలను ఉత్పత్తి చేస్తుంది; ఇది ISAD(G) లేదా డబ్లిన్ కోర్ వంటి ప్రమాణాల ప్రకారం పని చేయవచ్చు. కానీ "పూర్తిగా పూరించడానికి" ఒత్తిడి విషయాలు తయారు చేయడానికి AIని నెట్టివేస్తుంది; “ఖాళీగా వదిలివేయండి” అనుమతి, నియంత్రిత పదజాలానికి మ్యాపింగ్ చేయడం మరియు తేదీలు/పేర్ల మానవ నిర్ధారణ కేటలాగ్‌ను విశ్వసనీయంగా ఉంచుతుంది. AI డ్రాఫ్ట్‌ను సిద్ధం చేస్తుంది; కేటలాగ్ యొక్క ఖచ్చితత్వానికి మీరు బాధ్యత వహిస్తారు.

అప్లికేషన్ టాస్క్

"డబ్లిన్ కోర్ డ్రాఫ్ట్" టెంప్లేట్‌తో AI నుండి డాక్యుమెంట్ ట్రాన్స్‌క్రిప్షన్ తీసుకొని మెటాడేటాను అభ్యర్థించండి; ఇది ఉనికిలో లేని ఖాళీ ఫీల్డ్‌లను వదిలివేసేలా తనిఖీ చేయండి. ఆపై మీ స్వంత (లేదా నమూనా) చెక్‌లిస్ట్‌తో “టాపిక్ టర్మ్ సూచన” టెంప్లేట్‌ను అమలు చేయండి. చివరగా, "బల్క్ కన్సిస్టెన్సీ చెక్"తో కొన్ని రికార్డులను పరీక్షించండి. AI ఎన్ని ఫీల్డ్‌లను ప్రిడిక్షన్‌తో నింపడానికి ప్రయత్నిస్తుందో మరియు జాబితాకు ఎన్ని సబ్జెక్ట్ నిబంధనలను మ్యాప్ చేయాలి అని గమనించండి.

చెక్లిస్ట్

  • [ ] నేను లక్ష్య ప్రమాణాన్ని (ISAD(G)/డబ్లిన్ కోర్) స్పష్టంగా చెప్పాను.
  • [ ] నేను "ఖాళీ ఫీల్డ్‌ను ఖాళీగా వదిలేయండి" అనుమతిని ఇచ్చాను.
  • [ ] నేను టాపిక్ నిబంధనలను నియంత్రిత జాబితాకు మ్యాప్ చేసాను.
  • [ ] నేను పత్రం/అధికార రికార్డుతో తేదీ మరియు వ్యక్తి పేర్లను ధృవీకరించాను.
  • [ ] నేను రిఫరెన్స్ కోడ్‌ను AIకి కాకుండా సంస్థకు వదిలిపెట్టాను.