లాభాలు:
- కృత్రిమ మేధస్సుతో ISAD(G) లేదా డబ్లిన్ కోర్ వంటి ప్రమాణాలకు అనుగుణంగా మెటాడేటా డ్రాఫ్ట్లను రూపొందించగల సామర్థ్యం
- భ్రాంతిని నిరోధించే సామర్థ్యం మరియు లీవ్-ఖాళీ అనుమతితో నియంత్రిత పదజాలానికి సబ్జెక్ట్ నిబంధనలను మ్యాప్ చేయడం
- తేదీ, వ్యక్తి పేరు మరియు రిఫరెన్స్ కోడ్ వంటి ఏ ఫీల్డ్లకు మానవ ఆమోదం అవసరం మరియు వాటిని సంస్థ మాత్రమే కేటాయించాలి అని గుర్తించగల సామర్థ్యం
ఆర్కైవ్ లేదా లైబ్రరీ, అది ఎంత గొప్పదైనా సరే, దానిని బాగా నిర్వచించకపోతే కనుగొనబడదు. పత్రాన్ని "కనుగొనగలిగేది" అంటే దాని గురించిన వివరణాత్మక సమాచారం: ఎవరు వ్రాసారు, ఎప్పుడు, ఎక్కడ, దాని విషయం ఏమిటి, అది ఏ సేకరణకు చెందినది. ఈ సమాచారాన్ని మెటాడేటా అంటారు (మెటాడేటా — పత్రం గురించిన వివరణాత్మక డేటా; “డేటా గురించిన డేటా”). కేటలాగింగ్ అనేది ఈ మెటాడేటాతో డాక్యుమెంట్లను గుర్తించడం మరియు వాటిని శోధించదగిన సిస్టమ్లో సేవ్ చేయడం. వర్గీకరణ అనేది విషయం, రకం లేదా మూలం వంటి ప్రమాణాల ప్రకారం పత్రాలను నిర్వహించడం.
మెటాడేటాను రూపొందించడం చాలా సమయం తీసుకుంటుంది; పెద్ద సేకరణలలో వేలాది పత్రాల కోసం వ్యక్తిగతంగా తేదీ, విషయం, వ్యక్తి మరియు స్థలం సమాచారాన్ని నమోదు చేయడానికి సంవత్సరాలు పట్టవచ్చు. ఈ వ్యాపారంలో AI బలమైన డ్రాఫ్ట్ జనరేటర్. ఈ యూనిట్లో, AIతో మెటాడేటాను ఎలా రూపొందించాలో, ప్రమాణాలకు (ISAD(G), డబ్లిన్ కోర్) అనుగుణంగా జాబితా చేయడం మరియు ఆటోమేటిక్ వర్గీకరణ యొక్క శక్తి మరియు ఆపదలు రెండింటినీ చూస్తాము.
ఆర్కైవల్ ప్రమాణాలు: అవి ఎందుకు అవసరం
మెటాడేటా యాదృచ్ఛికంగా నమోదు చేయబడలేదు; అంతర్జాతీయ ప్రమాణాలు ఉన్నాయి, తద్వారా వివిధ సంస్థల నుండి రికార్డులు పరస్పరం మాట్లాడుకోవచ్చు:
- ISAD(G) (జనరల్ ఇంటర్నేషనల్ స్టాండర్డ్ ఆర్కైవల్ వివరణ): ఆర్కైవల్ మెటీరియల్ను క్రమానుగతంగా (ఫండ్, సిరీస్, ఫైల్, డాక్యుమెంట్ స్థాయిలో) వివరించే నియమాలు. ఇది సూచన కోడ్, శీర్షిక, తేదీ, పరిధి, సృష్టికర్త వంటి ఫీల్డ్లను కలిగి ఉంటుంది.
- డబ్లిన్ కోర్: డిజిటల్ వనరులను (శీర్షిక, సృష్టికర్త, విషయం, తేదీ, శైలి, ఫార్మాట్, మూలం, భాష మొదలైనవి) వివరించడానికి 15 కోర్ ఫీల్డ్లను కలిగి ఉన్న ఒక సాధారణ ప్రమాణం.
- అభిమానాలు: ఒకే వ్యక్తి, కుటుంబం లేదా సంస్థ యొక్క కార్యకలాపాల ఫలితంగా సహజంగా ఏర్పడిన రికార్డుల సమితి. ఇది ఆర్కైవింగ్ యొక్క ప్రాథమిక ఆర్గనైజింగ్ యూనిట్.
- మూలాధారం (మూలం): ఒక పత్రం ఎవరి నుండి వచ్చింది మరియు అది ఏ చేతి ద్వారా పంపబడింది అనే సమాచారం. ఆర్కైవింగ్లో, పత్రాలు వాటి మూలం ప్రకారం కలిసి ఉంచబడతాయి.
AI మెటాడేటాను ఉత్పత్తి చేస్తున్నప్పుడు లక్ష్య ప్రమాణాన్ని స్పష్టంగా పేర్కొనడం వలన అవుట్పుట్ నేరుగా ఎంటర్ప్రైజ్లోకి ఇన్పుట్ చేయబడుతుందని నిర్ధారిస్తుంది.
మరొక ముఖ్య భావన అథారిటీ రికార్డ్-ఒక వ్యక్తి, స్థలం లేదా సంస్థ యొక్క పేరు యొక్క ఒకే, ప్రామాణిక, ఆమోదించబడిన రూపాన్ని నిర్వచించే రికార్డు. చారిత్రక పత్రాలలో, ఒకే వ్యక్తి లేదా స్థలం వేర్వేరు స్పెల్లింగ్లతో కనిపించవచ్చు; అథారిటీ రికార్డ్ వాటన్నింటినీ ఒకే ఆమోదించబడిన ఫార్మాట్లో బంధిస్తుంది కాబట్టి అవి శోధనలో చెల్లాచెదురుగా ఉండవు. AI పత్రం నుండి పేర్లను సూచిస్తుంది; కానీ అధికార రికార్డులో ఈ పేరును ప్రామాణిక రూపానికి మ్యాప్ చేయడం మానవ పని. సంస్థ యొక్క అధికార రికార్డులో AI "అహ్మద్" అని చెప్పిన దానిని "అహ్మద్ బే (1840-1912)"కి లింక్ చేయడం వల్ల కేటలాగ్ యొక్క స్థిరత్వం సంరక్షించబడుతుంది.
వర్క్ఫ్లో: స్టెప్ బై స్టెప్
1. మూలాన్ని సిద్ధం చేయండి. పత్రం యొక్క ట్రాన్స్క్రిప్ట్ లేదా ఇమేజ్ మరియు ఏదైనా సందర్భ సమాచారాన్ని సేకరించండి.
2. ప్రమాణం మరియు ప్రాంతాలను గుర్తించండి. ఏ స్టాండర్డ్ (ISAD(G), డబ్లిన్ కోర్) మరియు ఏ ఫీల్డ్ల ప్రకారం అవుట్పుట్ ఉత్పత్తి చేస్తుందో AIకి చెప్పండి.
3. డ్రాఫ్ట్ మెటాడేటాను రూపొందించండి. పత్రం (తేదీ, వ్యక్తి, స్థలం, విషయం, భాష, శైలి) నుండి సంగ్రహించబడే ఫీల్డ్లను AI పూరిస్తుంది; ఇది తొలగించలేని ప్రాంతాలను ఖాళీగా ఉంచుతుంది.
4. నియంత్రిత పదజాలానికి మ్యాప్. చాలా సంస్థలలో విషయం మరియు స్థల పేర్లు ఉచితం కాదు, కానీ ముందే నిర్వచించబడిన జాబితా (నియంత్రిత పదజాలం / థెసారస్)తో ముడిపడి ఉంటాయి. ఈ జాబితాకు AI సూచించిన విషయ నిబంధనలను మ్యాప్ చేయండి.
5. ధృవీకరించండి మరియు నిర్ధారించండి. ప్రతి ఫీల్డ్, ముఖ్యంగా తేదీ, పేరు మరియు విషయం, పత్రాలు మరియు అధికార రికార్డులతో మానవులు పోల్చారు.
చిట్కా: "ఖాళీగా ఉంచడానికి" AIకి స్పష్టంగా అనుమతి ఇవ్వండి. లేకపోతే, ఇది డాక్యుమెంట్లో లేని తేదీ లేదా సృష్టికర్తను "ఊహిస్తుంది" మరియు మీ కేటలాగ్లో నకిలీ మెటాడేటాను చొప్పిస్తుంది. "ఈ ఫీల్డ్ డాక్యుమెంట్లో లేకుంటే ఖాళీగా వదిలేయండి" అనే సూచన భ్రాంతికి వ్యతిరేకంగా బలమైన కవచం.
పట్టికలో ఫీల్డ్లు మరియు విశ్వసనీయ స్థాయి
మెటాడేటా ఫీల్డ్
AI ఎంత విశ్వసనీయమైనది?
ధృవీకరణ
భాష
అధిక
నమూనా
పత్రం రకం
మధ్యస్థ-ఎక్కువ
నియంత్రణ
వ్యక్తి/స్థల పేర్లు
మీడియం (పఠన లోపం)
తప్పనిసరి
తేదీ
తక్కువ-మధ్యస్థం (కల్పన ప్రమాదం)
తప్పనిసరి
విషయ నిబంధనలు
మధ్యస్థం (ఉచిత ఉత్పత్తి)
చెక్లిస్ట్కి మ్యాప్
పరిధి/సారాంశం
మధ్యస్థ-ఎక్కువ
మూలంతో పోల్చండి
సూచన కోడ్
ఏదీ లేదు (సంస్థ ఇస్తుంది)
మానవ విసురుతాడు
సారాంశం: భాష మరియు శైలి వంటి అంశాలలో AI వేగవంతమైనది మరియు నమ్మదగినది; తేదీ, పేరు మరియు విషయం వంటి ఫీల్డ్లలో చిత్తుప్రతులను రూపొందిస్తుంది, అయితే మానవ ఆమోదం అవసరం; AI రిఫరెన్స్ కోడ్ వంటి సంస్థాగత ఫీల్డ్లను ఎప్పుడూ ఉత్పత్తి చేయదు.
మూడు చిన్న కేసులు
కేసు 1 — 8,000 ఫోటోల కోసం డ్రాఫ్ట్ మెటాడేటా. ఒక సిటీ ఆర్కైవ్ 8,000 చారిత్రక ఛాయాచిత్రాలను జాబితా చేస్తోంది. ప్రతి ఫోటో వెనుక ఉన్న గమనికలు లిప్యంతరీకరించబడ్డాయి మరియు AIకి ఇవ్వబడ్డాయి; AI రూపొందించిన తేదీ, స్థానం మరియు టాపిక్ అవుట్లైన్. మానవ బృందం దానిని ఫీల్డ్ వారీగా ధృవీకరించింది మరియు దానిని నియంత్రిత జాబితాకు మ్యాప్ చేసింది. అంచనా వేయబడిన 10-నెలల ఉద్యోగం 3 నెలలకు తగ్గించబడింది; కానీ ప్రతి తేదీ మరియు స్థలం పేరు దృశ్యమానంగా తనిఖీ చేయబడింది.
కేసు 2 — రూపొందించబడిన చరిత్ర. ఆర్కైవిస్ట్ వద్ద AI కేటలాగ్ తేదీ లేని లేఖ ఉంది. YZ లేఖలోని కంటెంట్ను చూసి "1912" తేదీని ఖచ్చితంగా రాశారు. అయితే, పత్రంలో తేదీ లేదు; AI అంచనా వేసింది. ఆర్కైవిస్ట్ "పత్రంలో లేకుంటే ఖాళీగా వదిలివేయండి" అనే సూచనను జోడించకపోతే, కేటలాగ్ తయారు చేయబడిన తేదీతో నింపబడి ఉండేది. పాఠం: ఖాళీ అనుమతి తప్పనిసరి.
కేస్ 3 — ఉచిత విషయ నిబంధనలు గందరగోళాన్ని సృష్టించాయి. AI సారూప్య పత్రాలకు "ఇమ్మిగ్రేషన్", "ఇమ్మిగ్రేషన్", "సెటిల్మెంట్" వంటి సారూప్యమైన కానీ భిన్నమైన ఉచిత పదాలను కేటాయించింది. ఇది నియంత్రిత పదజాలానికి మ్యాప్ చేయనప్పుడు, ఒకే అంశం మూడు వేర్వేరు పదాలతో ట్యాగ్ చేయబడింది మరియు శోధనలో చెల్లాచెదురుగా ఉంది. నిబంధనలను ఒకే అధికార జాబితాలోకి మ్యాప్ చేయడం ద్వారా స్థిరత్వం సాధించబడింది. పాఠం: టాపిక్ నిబంధనలు విడుదల చేయబడలేదు, అవి జాబితాకు లింక్ చేయబడ్డాయి.
నాలుగు కాపీ చేయగల టెంప్లేట్లు
1) డబ్లిన్ కోర్ అవుట్లైన్:
దిగువ డాక్యుమెంట్ ట్రాన్స్క్రిప్షన్ నుండి డబ్లిన్ కోర్ మెటాడేటా డ్రాఫ్ట్ను సంగ్రహించండి. ఫీల్డ్లు: శీర్షిక, సృష్టికర్త, విషయం, వివరణ, తేదీ, శైలి, భాష, పరిధి (స్థానం/కాలం). నియమాలు: (1) టెక్స్ట్లో సమాచారాన్ని మాత్రమే స్పష్టంగా ఉపయోగించండి. (2) టెక్స్ట్లో లేని ఫీల్డ్ను ఖాళీగా వదిలేయండి, ఊహించవద్దు. (3) మీకు ఖచ్చితంగా తెలియని విలువను [?]తో గుర్తు పెట్టండి. లిప్యంతరీకరణ: [ఇక్కడ]
2) ISAD(G) డ్రాఫ్ట్ నిర్వచనం:
ISAD(G) ఫీల్డ్లలో కింది పత్రం కోసం డ్రాఫ్ట్ను రూపొందించండి: శీర్షిక, తేదీ(లు), వివరణ స్థాయి (పత్రం/ఫైల్), స్కోప్ మరియు కంటెంట్ (చిన్న సారాంశం), సృష్టికర్త, భాష. రిఫరెన్స్ కోడ్ను ఖాళీగా వదిలివేయండి (సంస్థ దానిని అందిస్తుంది). వచనంలో లేని ఏ సమాచారాన్ని జోడించవద్దు; ఉనికిలో లేని ఫీల్డ్ను ఖాళీగా వదిలివేయండి. పత్రం: [ఇక్కడ]
3) టాపిక్ టర్మ్ సూచన (నియంత్రించబడింది):
దిగువ పత్రానికి తగిన 3-5 టాపిక్ నిబంధనలను సూచించండి. ముందుగా, డాక్యుమెంట్లోని వాస్తవాలపై ఆధారపడండి. మా సంస్థ యొక్క నియంత్రిత పదజాలం జాబితా క్రింద ఉంది; ముందుగా, ఈ జాబితా నుండి దీన్ని ఎంచుకోండి, ఇది జాబితాలో లేకుంటే, మీ కొత్త పదం సూచనను ప్రత్యేకంగా గుర్తించండి. జాబితా: [నిబంధనలు]. పత్రం: [ఇక్కడ]
4) బల్క్ అనుగుణ్యత తనిఖీ:
అదే సేకరణ నుండి డాక్యుమెంట్ల కోసం మెటాడేటా రికార్డ్లు క్రింద ఉన్నాయి. ఫ్లాగ్ అసమానతలు: ఒకే స్థలం/వ్యక్తిని వేర్వేరుగా స్పెల్లింగ్ చేసే రికార్డ్లు, వేర్వేరు తేదీ ఫార్మాట్లు, ఒకే సబ్జెక్ట్కు వేర్వేరు నిబంధనలు. దిద్దుబాటు IMPOSITION; మానవుడు సమీక్షించడానికి అసమానతల జాబితాను రూపొందించండి. రికార్డులు: [ఇక్కడ]
బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్
బలహీనం:
ఈ పత్రం కోసం పూర్తి కేటలాగ్ రికార్డ్ను సృష్టించండి.
"పూర్తి" సూచన ప్రతి స్థలాన్ని పూరించడానికి AIని నెట్టివేస్తుంది, అనగా చరిత్రను మరియు ఉనికిలో లేని సృష్టికర్తలను కనిపెట్టడానికి.
బలమైన:
డబ్లిన్ కోర్ ఈ పత్రం కోసం రూపొందించబడింది. లిప్యంతరీకరణలో స్పష్టంగా చేర్చబడిన సమాచారాన్ని మాత్రమే ఉపయోగించండి; ఉనికిలో లేని ఫీల్డ్ను ఖాళీగా ఉంచండి, ఊహించవద్దు. ఈ నియంత్రిత జాబితా నుండి టాపిక్ నిబంధనలను ఎంచుకోండి: [జాబితా]. తేదీ మరియు వ్యక్తి పేర్లను [?]తో గుర్తించండి, తద్వారా నేను దానిని పత్రంతో ధృవీకరించగలను. లిప్యంతరీకరణ: [ఇక్కడ]
తేడా: "పూర్తి" ఎడిషన్కు బదులుగా "ఖాళీగా వదిలివేయండి" అనుమతి, నియంత్రిత జాబితా కట్టుబడి మరియు ధృవీకరణ గుర్తులు కేటలాగ్ను కల్పన నుండి రక్షిస్తాయి.
సాధారణ తప్పులు
- దీని అర్థం "పూర్తిగా పూరించండి". ఇది ఉనికిలో లేని ఫీల్డ్లను అమర్చడానికి దారితీస్తుంది; "ఖాళీగా వదిలేయండి" అనుమతి ఇవ్వాలి.
- విషయ నిబంధనలను విడుదల చేస్తోంది. నియంత్రిత పదజాలానికి మ్యాప్ చేయని నిబంధనలు శోధనను దూరం చేస్తాయి.
- AI చరిత్రను అంచనా వేయడం. తేదీ లేని పత్రంలో కల్పిత తేదీని నమోదు చేయడం వల్ల కేటలాగ్ కలుషితం అవుతుంది.
- AI ద్వారా రూపొందించబడిన సూచన కోడ్ని కలిగి ఉండటం. ఇది కార్పొరేట్, ప్రత్యేకమైన స్థలం; ప్రజలు విసిరేస్తారు.
- ప్రమాణాన్ని పేర్కొనడం లేదు. ప్రమాణం పేర్కొనబడకపోతే, అవుట్పుట్ గజిబిజి డ్రాఫ్ట్ అవుతుంది, అది ఇన్స్టిట్యూషన్లోకి ప్రవేశించదు.
సారాంశంలో
మెటాడేటా మరియు కేటలాగింగ్ అనేది పరిశోధకుడికి ఆర్కైవ్ను తెరిచే అదృశ్య అవస్థాపన, మరియు దీనికి చాలా కృషి అవసరం. లిప్యంతరీకరణ నుండి, తేదీ, వ్యక్తి, స్థలం, విషయం మరియు శైలి వంటి ఫీల్డ్ల కోసం AI వేగవంతమైన రూపురేఖలను ఉత్పత్తి చేస్తుంది; ఇది ISAD(G) లేదా డబ్లిన్ కోర్ వంటి ప్రమాణాల ప్రకారం పని చేయవచ్చు. కానీ "పూర్తిగా పూరించడానికి" ఒత్తిడి విషయాలు తయారు చేయడానికి AIని నెట్టివేస్తుంది; “ఖాళీగా వదిలివేయండి” అనుమతి, నియంత్రిత పదజాలానికి మ్యాపింగ్ చేయడం మరియు తేదీలు/పేర్ల మానవ నిర్ధారణ కేటలాగ్ను విశ్వసనీయంగా ఉంచుతుంది. AI డ్రాఫ్ట్ను సిద్ధం చేస్తుంది; కేటలాగ్ యొక్క ఖచ్చితత్వానికి మీరు బాధ్యత వహిస్తారు.
అప్లికేషన్ టాస్క్
"డబ్లిన్ కోర్ డ్రాఫ్ట్" టెంప్లేట్తో AI నుండి డాక్యుమెంట్ ట్రాన్స్క్రిప్షన్ తీసుకొని మెటాడేటాను అభ్యర్థించండి; ఇది ఉనికిలో లేని ఖాళీ ఫీల్డ్లను వదిలివేసేలా తనిఖీ చేయండి. ఆపై మీ స్వంత (లేదా నమూనా) చెక్లిస్ట్తో “టాపిక్ టర్మ్ సూచన” టెంప్లేట్ను అమలు చేయండి. చివరగా, "బల్క్ కన్సిస్టెన్సీ చెక్"తో కొన్ని రికార్డులను పరీక్షించండి. AI ఎన్ని ఫీల్డ్లను ప్రిడిక్షన్తో నింపడానికి ప్రయత్నిస్తుందో మరియు జాబితాకు ఎన్ని సబ్జెక్ట్ నిబంధనలను మ్యాప్ చేయాలి అని గమనించండి.
చెక్లిస్ట్
- [ ] నేను లక్ష్య ప్రమాణాన్ని (ISAD(G)/డబ్లిన్ కోర్) స్పష్టంగా చెప్పాను.
- [ ] నేను "ఖాళీ ఫీల్డ్ను ఖాళీగా వదిలేయండి" అనుమతిని ఇచ్చాను.
- [ ] నేను టాపిక్ నిబంధనలను నియంత్రిత జాబితాకు మ్యాప్ చేసాను.
- [ ] నేను పత్రం/అధికార రికార్డుతో తేదీ మరియు వ్యక్తి పేర్లను ధృవీకరించాను.
- [ ] నేను రిఫరెన్స్ కోడ్ను AIకి కాకుండా సంస్థకు వదిలిపెట్టాను.