యూనిట్లు
1. చరిత్ర మరియు ఆర్కైవింగ్‌లో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ పరిచయం: పాత్రలు, సరిహద్దులు, ధ్రువీకరణ మరియు నీతి 2. డాక్యుమెంట్ డిజిటలైజేషన్ మరియు OCR: ప్రింటెడ్ టెక్స్ట్‌ను మెషిన్ టెక్స్ట్‌గా మార్చడం 3. లిప్యంతరీకరణ: ఒట్టోమన్ టర్కిష్ మరియు మాన్యుస్క్రిప్ట్స్ 4. మెటాడేటా, కేటలాగింగ్ మరియు వర్గీకరణ 5. సోర్స్ స్కానింగ్, డిస్కవరీ మరియు సారాంశం 6. హిస్టారికల్ ట్రాన్స్లేషన్ అండ్ సింప్లిఫికేషన్ 7. మూల ధృవీకరణ, అనాక్రోనిజం మరియు భ్రాంతి 8. కంటెంట్ విశ్లేషణ మరియు నమూనా ఆవిష్కరణ 9. ఆర్కైవ్ యాక్సెస్, వివరణ మరియు వినియోగదారు సేవలు 10. సంరక్షణ, పునరుద్ధరణ మరియు డిజిటల్ సంరక్షణ 11. నీతి, కాపీరైట్, గోప్యత మరియు సాంస్కృతిక సున్నితత్వం 12. ఎండ్-టు-ఎండ్ ప్రాజెక్ట్: ఆర్టిఫిషియల్ ఇంటెలిజెన్స్‌తో ఆర్కైవ్ కలెక్షన్‌ను ప్రాసెస్ చేయడం
యూనిట్ 3 / 12

లిప్యంతరీకరణ: ఒట్టోమన్ టర్కిష్ మరియు మాన్యుస్క్రిప్ట్స్

లాభాలు:

  • HTR మరియు లిప్యంతరీకరణ వర్క్‌ఫ్లోను సెటప్ చేయగల సామర్థ్యం మరియు ముడి డ్రాఫ్ట్‌కు లైన్ వారీగా నిపుణుల తనిఖీ ఎందుకు అవసరమో వివరించగల సామర్థ్యం
  • ఒట్టోమన్ టర్కిష్‌లో అచ్చు/అక్షర సందిగ్ధత విషయంలో ఖచ్చితమైన పఠనాన్ని విధించే బదులు ప్రత్యామ్నాయాలను అడగడం ద్వారా చదవలేని ప్రాంతాలను రక్షించగల సామర్థ్యం
  • అసలైన లిప్యంతరీకరణను సరళీకరణ యొక్క ప్రత్యేక పొర నుండి వేరు చేయగల సామర్థ్యం, చివరి శాస్త్రీయ బాధ్యతను పాలియోగ్రాఫర్‌తో ఉంచడం

మాన్యుస్క్రిప్ట్‌లు మరియు పాత వ్రాత పత్రాలను చదవగలిగే వచనంలోకి లిప్యంతరీకరించడం చారిత్రక పరిశోధనలో అత్యంత డిమాండ్ ఉన్న భాగం. ఒక లేఖ, నోట్‌బుక్, కోర్టు రికార్డు లేదా ఒట్టోమన్ పత్రం లిప్యంతరీకరించబడిన తర్వాత మాత్రమే వెతకవచ్చు. లిప్యంతరీకరణ అనేది పత్రంలోని విషయాలను (చాలా తరచుగా చేతితో రాసిన లేదా పురాతన లిపి) వ్రాతపూర్వక, చదవగలిగే వచనంలోకి బదిలీ చేసే చర్య. ఒట్టోమన్ విషయంలో, ఇది తరచుగా లిప్యంతరీకరణతో కూడి ఉంటుంది: అరబిక్ అక్షరాలలోని వచనాన్ని లాటిన్ వర్ణమాలలో దాని అక్షరం-వారీ-అక్షరం సమానమైన వాటితో బదిలీ చేయడం.

మేము ముద్రించిన పాఠాల కోసం OCRని ఉపయోగించాము; చేతివ్రాతకు వేరే సాంకేతికత అవసరం: HTR (చేతితో రాసిన వచన గుర్తింపు). HTR అనేది OCR లాంటి సాంకేతికత కానీ చేతితో వ్రాసిన పత్రాలను మెషిన్ టెక్స్ట్‌గా మార్చడం చాలా సవాలుగా ఉంది. ఈ యూనిట్‌లో మనం ఒట్టోమన్ మరియు మాన్యుస్క్రిప్ట్ ట్రాన్స్‌క్రిప్షన్‌లో HTR మరియు AIని ఎలా ఉపయోగించాలో, ఎర్రర్ యొక్క మార్జిన్‌లు మరియు ధృవీకరణ ఎందుకు మరింత క్లిష్టమైనదో చూద్దాం.

చేతివ్రాత ఎందుకు చాలా కష్టం?

ముద్రించిన వచనం కంటే చేతివ్రాత చాలా వేరియబుల్: ప్రతి రచయితకు ప్రత్యేకమైన చేతి ఉంటుంది, అక్షరాలు ఒకదానితో ఒకటి అనుసంధానించబడి ఉంటాయి, సంక్షిప్తాలు మరియు ప్రత్యేక సంకేతాలు ఉపయోగించబడతాయి, ఇంక్ బ్లీడ్స్, కాగితం అరిగిపోతుంది. ఒట్టోమన్ టర్కిష్‌లో కష్టం గుణించబడుతుంది:

  • సందర్భోచిత అక్షర రూపాలు: ఒకే అక్షరం పదం ప్రారంభంలో, మధ్యలో మరియు చివరిలో వేర్వేరుగా వ్రాయబడుతుంది.
  • అచ్చులు రాయడం లేదు: చిన్న అచ్చులు తరచుగా వ్రాయబడవు; పాఠకుడు సందర్భం నుండి పూర్తి చేస్తాడు. ఇది "అంగీకారం లేదా తిరస్కరణ?" వంటి అస్పష్టతలను సృష్టిస్తుంది.
  • విభిన్న రచనా శైలులు: రికా, దివానీ, తాలిక్ వంటి విభిన్న చేతివ్రాత శైలులు ఉన్నాయి; ప్రతిదానికి భిన్నమైన పఠన నైపుణ్యం అవసరం.
  • ఒట్టోమన్ పదజాలం: నేటి టర్కిష్‌లో లేని అరబిక్ మరియు పర్షియన్ పదాలు.

అందువల్ల, ప్రింట్ OCR కంటే ఒట్టోమన్ టర్కిష్‌లో HTR మరియు AI చాలా ఎక్కువ మార్జిన్ లోపంతో పని చేస్తాయి. నిపుణులైన పాలియోగ్రాఫర్ యొక్క కన్ను (పాలియోగ్రఫీ - పురాతన రచనలను చదివే శాస్త్రం) ఇక్కడ ఒక సాధనం కాదు, కానీ అవసరం.

వర్క్‌ఫ్లో: స్టెప్ బై స్టెప్

1. డాక్యుమెంట్ నాణ్యతను సిద్ధం చేయండి. OCR మాదిరిగా, అధిక రిజల్యూషన్ మరియు మంచి కాంట్రాస్ట్ అవసరం. చేతివ్రాతలో ఇది మరింత క్లిష్టమైనది.

2. HTR మోడల్‌ని ఎంచుకోండి. ఒట్టోమన్, అరబిక్ చేతివ్రాత లేదా నిర్దిష్ట కాలానికి ప్రత్యేకంగా శిక్షణ పొందిన HTR నమూనాలు సాధారణ నమూనాల కంటే చాలా విజయవంతమవుతాయి. కాలానికి మరియు రచనా శైలికి ఏ మోడల్ బాగా పనిచేస్తుందో పరీక్షించండి.

3. ముడి లిప్యంతరీకరణను రూపొందించండి. HTR మోడల్ అవుట్‌లైన్‌ను ఉత్పత్తి చేస్తుంది. ఒట్టోమన్ టర్కిష్‌లో, ఈ డ్రాఫ్ట్ లోపాలతో కూడిన ప్రారంభం, అనుభవజ్ఞులైన కన్ను క్షుణ్ణంగా తనిఖీ చేయాలి.

4. AIతో సందర్భోచిత మెరుగుదల. మీరు AI ఫ్లాగ్ అసమానతలు, సాధ్యమైన రీడింగ్ ప్రత్యామ్నాయాలు మరియు ముడి అవుట్‌పుట్‌లో అనుమానాస్పద స్థానాలను కలిగి ఉండవచ్చు. కానీ AI “దిద్దుబాటు” ఇక్కడ ముఖ్యంగా ప్రమాదకరం: ఇది ఒక కల్పిత పఠనాన్ని సూచించవచ్చు.

5. లిప్యంతరీకరణ మరియు సరళీకరణ (లేయర్డ్). అరబిక్ అక్షరాలలోని టెక్స్ట్ యొక్క లిప్యంతరీకరణ లాటిన్ అక్షరాలలోకి, దాని తర్వాత నేటి టర్కిష్‌లోకి సరళీకృత పఠనం, ప్రత్యేక పొరలుగా ఉత్పత్తి చేయబడింది. అసలు ఎప్పుడూ పగలదు.

6. నిపుణుల ధృవీకరణ. చివరి లిప్యంతరీకరణను డాక్యుమెంట్‌తో పోల్చడం ద్వారా పాలియోగ్రఫీ మరియు పీరియడ్ పరిజ్ఞానం ఉన్న నిపుణుడిచే ఆమోదించబడుతుంది.

శ్రద్ధ: ఒట్టోమన్ టర్కిష్‌లో, సందర్భం నుండి వ్రాయని అచ్చుతో ఒక పదాన్ని "ఊహిస్తున్నప్పుడు", AI పూర్తిగా తప్పు పఠనాన్ని ఉత్పత్తి చేస్తుంది మరియు దానిని నమ్మకంగా భాషలో ప్రదర్శించగలదు. "కాబిల్"కి బదులుగా "కాబూల్" లేదా "అలిమ్"కి బదులుగా "అలెం" వంటి అక్షరాలలో వ్యత్యాసం పూర్తిగా అర్థాన్ని మారుస్తుంది. ప్రతి అనిశ్చిత పఠనాన్ని ప్రత్యామ్నాయాలతో అందించాలి మరియు ఏ ఒక్క ఖచ్చితమైన పఠనాన్ని విధించకూడదు.

పట్టికతో పొరలు మరియు బాధ్యత

పొర

కంటెంట్

AI పాత్ర

నిపుణుడి పాత్ర

చిత్రం

అసలు పత్రం

మూలం

HTR డ్రాఫ్ట్

ముడి యంత్రం పఠనం

ఉత్పత్తి చేస్తుంది

ప్రారంభం నుండి ముగింపు వరకు నియంత్రించండి

లిప్యంతరీకరణ

లాటిన్ అక్షర మార్పిడి

డ్రాఫ్ట్ సూచిస్తుంది

సరిచేస్తుంది, సరిచేస్తుంది

అనిశ్చితి గమనికలు

[?] మరియు ప్రత్యామ్నాయాలు

సంకేతాలు

నిర్ణయిస్తాడు

సరళీకరణ

నేటి టర్కిష్

డ్రాఫ్ట్ సూచిస్తుంది

ఆమోదాలు

శాస్త్రీయ ప్రచురణ

చివరి వచనం + గమనికలు

నిపుణుడు మాత్రమే

మూడు చిన్న కేసులు

కేసు 1 — HTR మొదటి డ్రాఫ్ట్‌ను 5x వేగాన్ని పెంచింది. ఒక డాక్టరల్ విద్యార్థి 200 పేజీల ఒట్టోమన్ నోట్‌బుక్‌ని లిప్యంతరీకరణ చేస్తాడు. పూర్తి మాన్యువల్ ట్రాన్స్‌క్రిప్షన్ 60 పనిదినాలుగా అంచనా వేయబడింది. ఈ కాలానికి శిక్షణ పొందిన HTR మోడల్‌తో, ముడి డ్రాఫ్ట్ కొన్ని గంటల్లో బయటకు వచ్చింది; విద్యార్థి ఈ డ్రాఫ్ట్‌ను సరిదిద్దారు మరియు పనిని 12 పని దినాలకు తగ్గించారు. కానీ అతను ప్రతి పేజీని పత్రంతో, లైన్ వారీగా పోల్చవలసి వచ్చింది; డ్రాఫ్ట్‌లో దాదాపు 30% తప్పుగా ఉంది.

కేసు 2 - ఒక అక్షరం, ఒక అర్థం. ఒక పరిశోధకుడు AI చదివే "గవర్నర్" అనే పదంపై ఆధారపడ్డాడు. నిపుణుల నియంత్రణలో, ఈ పదం వాస్తవానికి "సంరక్షకుడు" (పిల్లలకు/వ్యక్తికి బాధ్యత) అని అర్థం చేసుకోబడింది మరియు అచ్చును గుర్తించబడనందున, AI దానిని తప్పుగా ఊహించింది. పత్రం యొక్క చట్టపరమైన అర్థం పూర్తిగా మారుతోంది. పాఠం: ఒట్టోమన్ టర్కిష్‌లో, ఒకే అక్షరం/అచ్చు వ్యత్యాసం పత్రాన్ని మొదటి నుండి అర్థం చేసుకోవడానికి కారణమవుతుంది; నిపుణుడు అవసరం.

కేసు 3 - కల్పిత పూర్తి. సిరా అయిపోయిన మరియు ఒక పదం చదవలేని ఒక లైన్‌లో, AI "లాజికల్" పదంతో ఖాళీని పూరించింది. ఆ గ్యాప్ నిజానికి ఒక స్థల పేరు అని మరియు AI దానిని తయారు చేసిందని నిపుణుడు గ్రహించాడు. ఖాళీ [అజ్ఞాత] గా మిగిలిపోయింది. పాఠం: చదవలేని స్థలం నింపబడలేదు, అది గుర్తించబడింది.

నాలుగు కాపీ చేయగల టెంప్లేట్‌లు

1) అస్పష్టతను కాపాడే లిప్యంతరీకరణ:

ఒట్టోమన్ డాక్యుమెంట్ యొక్క HTR రా అవుట్‌పుట్/లిప్యంతరీకరణ క్రింద ఉంది. మీ పని వచనాన్ని సమీక్షించడం మరియు సాధ్యమయ్యే పఠన లోపాలను ఫ్లాగ్ చేయడం. నియమాలు: (1) మీకు ఖచ్చితంగా తెలియని ప్రతి పదానికి 2-3 పఠన ప్రత్యామ్నాయాలను ఆఫర్ చేయండి, ఒకటి విధించవద్దు. (2) అస్పష్టమైన ప్రదేశాలలో [అజ్ఞాత] వదిలివేయండి, వాటిని పూరించవద్దు. (3) టెక్స్ట్‌లో లేని పదాలను జోడించడం. (4) అస్పష్టమైన అచ్చులతో పదాలలో ప్రత్యామ్నాయాలను చూపండి. వచనం: [ఇక్కడ]

2) లేయర్డ్ రీడింగ్ (అసలు + సరళీకరణ):

కింది ధృవీకరించబడిన ఒట్టోమన్ లిప్యంతరీకరణ కోసం రెండు నిలువు వరుసలను రూపొందించండి: (1) ఒరిజినల్ లిప్యంతరీకరణ (టచ్), (2) నేటి టర్కిష్‌లోకి సరళీకృత పఠనం. అర్థాన్ని జోడించడం, సరళీకరణలో వివరణను జోడించడం; భాషను నవీకరించండి. అస్పష్టమైన అర్థంతో[అస్పష్టమైన] స్థలాలను గుర్తించండి. లిప్యంతరీకరణ: [ఇక్కడ]

3) పదం మరియు వ్యక్తి వెలికితీత:

దిగువ లిప్యంతరీకరణలో పేర్కొన్న వ్యక్తిగత పేర్లు, స్థలాల పేర్లు, శీర్షికలు మరియు ఆవర్తన నిబంధనలు ప్రత్యేక జాబితాలలో కనిపిస్తాయి. టెక్స్ట్‌లో స్పష్టంగా పేర్కొన్న వాటిని మాత్రమే తీసుకోండి; ఊహించి జోడించవద్దు. మీకు ఉచ్చారణ ఖచ్చితంగా తెలియకపోతే [?]తో గుర్తు పెట్టండి. వచనం: [ఇక్కడ]

4) అనుమానాస్పద రీడ్ కంట్రోల్:

పాత్రలో అనుభవజ్ఞుడైన పాలియోగ్రఫీ కంట్రోలర్. దిగువ లిప్యంతరీకరణలో, అర్థంలో అస్థిరమైన, కాలానికి సరిపోని లేదా సందర్భానికి సరిపోని పదాలను గుర్తించండి మరియు అవి ఎందుకు అనుమానాస్పదంగా ఉన్నాయో రాయండి. ఖచ్చితమైన దిద్దుబాటును విధించడం; మానవ నిపుణుడు డాక్యుమెంట్‌తో పోల్చి చూసే అనుమానాల జాబితాను రూపొందించండి. వచనం: [ఇక్కడ]

బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్

బలహీనం:

ఈ ఒట్టోమన్ వచనాన్ని చదివి దాని అనువాదం నాకు ఇవ్వండి.

ఇది ఒకే, ఖచ్చితమైన పఠనాన్ని, అస్పష్టతలను దాచడానికి మరియు అంతరాలలో అమర్చడానికి AIని నెట్టివేస్తుంది. ఒట్టోమన్ టర్కిష్‌లో, ఇది దాదాపుగా హామీ ఇవ్వబడిన తప్పు.

బలమైన:

దిగువ ఒట్టోమన్ లిప్యంతరీకరణను చూడండి. ఖచ్చితమైన పఠనం: IMPOSITION. ప్రతి అస్పష్టమైన పదానికి సాధ్యమైన ప్రత్యామ్నాయాలను అందించండి, [అజ్ఞాత] భాగాలను వదిలివేయండి, వచనంలో లేని వాటిని జోడించవద్దు. నేటి టర్కిష్‌కు ప్రత్యేక కాలమ్‌లో సరళీకృత పఠనాన్ని ఇవ్వండి, కానీ అసలైనదాన్ని ఉంచండి. నిపుణుడు దానిని డాక్యుమెంట్‌తో పోల్చడానికి వీలుగా మీకు [?] ఖచ్చితంగా తెలియని ఏదైనా గుర్తు పెట్టండి. వచనం: [ఇక్కడ]

తేడా: కఠినమైన రీడ్ నిషేధం, ప్రత్యామ్నాయాలను అభ్యర్థించడం, ఖాళీ స్థలాన్ని సంరక్షించడం మరియు లేయర్డ్ అవుట్‌పుట్ నిపుణుల ధృవీకరణను ప్రారంభించడం.

సాధారణ తప్పులు

  • హెచ్‌టిఆర్ డ్రాఫ్ట్ సరైనదని తప్పుబడుతున్నారు. ఒట్టోమన్ టర్కిష్‌లో, ముడి డ్రాఫ్ట్‌లో ఎక్కువ భాగం తప్పుగా ఉండవచ్చు; లైన్ ద్వారా లైన్ నియంత్రణ తప్పనిసరి.
  • విధించడం మాత్రమే ఖచ్చితమైన పఠనం. అచ్చులు రాయని పదాలలో ప్రత్యామ్నాయాలు దాగి ఉంటే, తప్పు అర్థం నమోదు చేయబడుతుంది.
  • చదవలేని ప్రాంతాన్ని పూరించడం. ఇది వైట్‌స్పేస్ [అజ్ఞాత] ద్వారా రక్షించబడాలి, రూపొందించబడలేదు.
  • సరళీకరణతో అసలైనదాన్ని కలపడం. సరళీకరణ ప్రత్యేక పొరగా ఉండాలి; అసలు లిప్యంతరీకరణను వక్రీకరించకూడదు.
  • నిపుణుడిని నిలిపివేయడం. పాలియోగ్రఫీ మరియు పీరియడ్ గురించి అవగాహన లేకుండా, AI యొక్క పఠనం శాస్త్రీయ విలువ లేని అంచనా.

సారాంశంలో

ఒట్టోమన్ మరియు మాన్యుస్క్రిప్ట్ ట్రాన్స్‌క్రిప్షన్ ముడి డ్రాఫ్ట్ దశలో HTR మరియు AIతో బాగా వేగవంతం చేయబడుతుంది; మీరు పని దినాలను గంటలకి తగ్గించే మొదటి అవుట్‌పుట్‌ను పొందుతారు. కానీ ఈ ప్రాంతంలో ఖచ్చితంగా ఒకే అక్షరం, ఒకే అచ్చు తేడా అర్థాన్ని మారుస్తుంది; AI అనిశ్చితిని దాచడానికి మరియు ఖాళీలను పూరించడానికి ప్రయత్నిస్తుంది. సరైన పద్ధతి పొరలుగా ఉంటుంది: ముడి రూపురేఖలు, అస్పష్టత యొక్క ప్రత్యామ్నాయ గమనికలు, సరళీకరణ యొక్క ప్రత్యేక పొర మరియు, అన్నింటికంటే, పాలియోగ్రఫీతో బాగా తెలిసిన నిపుణుడిచే పత్రం యొక్క లైన్-బై-లైన్ ధృవీకరణ. AI ప్రారంభ పఠనాన్ని వేగవంతం చేస్తుంది; శాస్త్రీయ బాధ్యత నిపుణుడిదే.

అప్లికేషన్ టాస్క్

ఒట్టోమన్ లేదా మాన్యుస్క్రిప్ట్ డాక్యుమెంట్ (మీ స్వంత ఉత్పత్తి లేదా ప్రచురించిన కాపీ) యొక్క లిప్యంతరీకరణను పొందండి. "అస్పష్టత-సంరక్షించే లిప్యంతరీకరణ" టెంప్లేట్‌తో ప్రత్యామ్నాయ పఠనం కోసం AIని అడగండి. ఆపై "లేయర్డ్ రీడింగ్"తో విడిగా సరళీకరణ పొరను రూపొందించండి. అస్పష్టంగా గుర్తించబడిన ప్రతి పదాన్ని నిపుణుల మూలం లేదా నిఘంటువుతో సరిపోల్చండి; AI ఒకే రీడింగ్‌ని విధించినట్లయితే ఎన్ని లోపాలు ఏర్పడతాయో గమనించండి.

చెక్లిస్ట్

  • [ ] నేను కాలం మరియు రచనా శైలికి తగిన HTR/మోడల్‌ని ఉపయోగించాను.
  • [] నేను ఖచ్చితమైన పఠనానికి ప్రత్యామ్నాయాల కోసం AIని అడిగాను.
  • [ ] నేను చదవలేని భాగాలను [చదవలేని]తో రక్షించాను.
  • [ ] నేను అసలు లిప్యంతరీకరణను సరళీకరణ నుండి వేరుగా ఉంచాను.
  • [ ] నేను పాలియోగ్రఫీ తెలిసిన ఒక నిపుణుడు/డాక్యుమెంటరీ ద్వారా తుది వచనాన్ని ధృవీకరించాను.