యూనిట్లు
1. చరిత్ర మరియు ఆర్కైవింగ్‌లో ఆర్టిఫిషియల్ ఇంటెలిజెన్స్ పరిచయం: పాత్రలు, సరిహద్దులు, ధ్రువీకరణ మరియు నీతి 2. డాక్యుమెంట్ డిజిటలైజేషన్ మరియు OCR: ప్రింటెడ్ టెక్స్ట్‌ను మెషిన్ టెక్స్ట్‌గా మార్చడం 3. లిప్యంతరీకరణ: ఒట్టోమన్ టర్కిష్ మరియు మాన్యుస్క్రిప్ట్స్ 4. మెటాడేటా, కేటలాగింగ్ మరియు వర్గీకరణ 5. సోర్స్ స్కానింగ్, డిస్కవరీ మరియు సారాంశం 6. హిస్టారికల్ ట్రాన్స్లేషన్ అండ్ సింప్లిఫికేషన్ 7. మూల ధృవీకరణ, అనాక్రోనిజం మరియు భ్రాంతి 8. కంటెంట్ విశ్లేషణ మరియు నమూనా ఆవిష్కరణ 9. ఆర్కైవ్ యాక్సెస్, వివరణ మరియు వినియోగదారు సేవలు 10. సంరక్షణ, పునరుద్ధరణ మరియు డిజిటల్ సంరక్షణ 11. నీతి, కాపీరైట్, గోప్యత మరియు సాంస్కృతిక సున్నితత్వం 12. ఎండ్-టు-ఎండ్ ప్రాజెక్ట్: ఆర్టిఫిషియల్ ఇంటెలిజెన్స్‌తో ఆర్కైవ్ కలెక్షన్‌ను ప్రాసెస్ చేయడం
యూనిట్ 8 / 12

కంటెంట్ విశ్లేషణ మరియు నమూనా ఆవిష్కరణ

లాభాలు:

  • NER, రిలేషన్ షిప్ ఎక్స్‌ట్రాక్షన్, టైమ్‌లైన్ మరియు నెట్‌వర్క్ విశ్లేషణ వంటి సాంకేతికతలను ఉపయోగించి పెద్ద సెట్ల టెక్స్ట్ నుండి నమూనాలను సంగ్రహించే సామర్థ్యం
  • నమూనాను సాక్ష్యంగా కాకుండా పరికల్పనగా చూడగలగడం, మూలానికి ఎంటిటీలను లింక్ చేయడం మరియు మానవ ఆమోదంతో వాటిని సాధారణీకరించడం
  • తప్పిపోయిన డేటా మరియు నమూనా పక్షపాతం కారణంగా సంఖ్యలు ఎలా తప్పుదారి పట్టించవచ్చో అర్థం చేసుకోగల సామర్థ్యం మరియు కల్పిత సంబంధాలు మరియు కాలక్రమాలను నివారించడం.

చారిత్రక పరిశోధన అనేది వ్యక్తిగత పత్రాలను చదవడం మాత్రమే కాదు; తరచుగా పత్రాల యొక్క పెద్ద సెట్లలో నమూనాల కోసం చూస్తున్నాయి. ఏ సందర్భాలలో నిర్దిష్ట పేరు సంవత్సరాలుగా కనిపిస్తుంది? సెటిల్‌మెంట్‌తో ఏ వ్యక్తులు అనుబంధించబడ్డారు? కాలానుగుణంగా ఒక అంశం ఎలా మారుతుంది? ఎవరు ఎవరితో కలుస్తున్నారు? ఇలాంటి ప్రశ్నలకు ఒక్క డాక్యుమెంట్‌ను కాదు, వందలాది పత్రాలను సమిష్టిగా చూడవలసి ఉంటుంది. దీనిని తరచుగా డిజిటల్ హ్యుమానిటీస్ అని పిలుస్తారు-చరిత్ర మరియు సాహిత్యం వంటి రంగాలకు గణన పద్ధతులను ఉపయోగించడం.

పెద్ద టెక్స్ట్ సెట్ల నుండి నిర్మాణాత్మక సమాచారాన్ని సంగ్రహించడంలో AI శక్తివంతమైనది. ఈ యూనిట్‌లో, మీరు NER (పేరు గల ఎంటిటీ రికగ్నిషన్), నమూనా మరియు సంబంధాల వెలికితీత, టాపిక్ మోడలింగ్ లాజిక్ మరియు టైమ్‌లైన్ సృష్టిని నేర్చుకుంటారు; కానీ మేము ఈ టెక్నిక్‌ల యొక్క అత్యంత ప్రమాదకరమైన ఆపద గురించి కూడా చర్చిస్తాము-AI ఉనికిలో లేని నమూనాను "కనుగొన్నట్లు" ప్రదర్శించడం.

ప్రాథమిక పద్ధతులు

  • NER (పేరు గల ఎంటిటీ గుర్తింపు): వ్యక్తి, స్థలం, సంస్థ, వచనం నుండి తేదీ వంటి ఎంటిటీల స్వయంచాలక వెలికితీత. ఇది నిమిషాల్లో "ఈ 500 డాక్యుమెంట్లలో పేర్కొన్న అన్ని స్థల పేర్లు" వంటి జాబితాను ఉత్పత్తి చేస్తుంది.
  • సంబంధ అనుమితి: ఎంటిటీల మధ్య సంబంధాలను గుర్తించడం ("స్థానం Y వద్ద X", "A అనేది Bకి అనుగుణంగా ఉంటుంది").
  • టాపిక్ మోడలింగ్: టెక్స్ట్ యొక్క పెద్ద సెట్‌లో పునరావృతమయ్యే అంశాల క్లస్టర్‌లను గణాంకపరంగా కనుగొనడం. ఏ కాలంలో ఏ థీమ్స్ కేంద్రీకృతమై ఉన్నాయో ఇది చూపిస్తుంది.
  • కాలక్రమం అనుమితి: పత్రాలలో నాటి సంఘటనలను కాలక్రమానుసారంగా అమర్చడం.
  • నెట్‌వర్క్ విశ్లేషణ: అంతర్-వ్యక్తి/సంస్థాగత సంబంధాలను నెట్‌వర్క్‌గా విజువలైజ్ చేయడం (కేంద్రం ఎవరు, కనెక్షన్ పాయింట్ ఎవరు).

వీటన్నింటికీ ఉమ్మడి లక్ష్యం ఏమిటంటే, ఒకే పత్రంలో కనిపించని, సేకరణ అంతటా కనిపించే నిర్మాణాలను బహిర్గతం చేయడం. ఈ పద్ధతులు కనిపించే నమూనాలను తయారు చేస్తాయి, అవి చదవడం ద్వారా మాత్రమే కనిపించవు. కానీ వాటిలో ప్రతి ఒక్కటి "సంకేతం", "సాక్ష్యం" కాదు; ఒరిజినల్ డాక్యుమెంట్‌లో ఏమి కనుగొనబడిందో ధృవీకరించడం చాలా అవసరం.

ఈ ఫీల్డ్‌లో తరచుగా ఉపయోగించే కాన్సెప్ట్ అనేది క్లోజ్ రీడింగ్ (డెప్త్‌లో టెక్స్ట్‌ను చదవడం, లైన్ ద్వారా లైను) మరియు సుదూర పఠనం (వందలు/వేల పాఠాలను సమిష్టిగా, గణాంకపరంగా చూడటం) మధ్య వ్యత్యాసం. AI రిమోట్‌గా చదవడాన్ని సాధ్యం చేస్తుంది: మీరు కార్పస్‌లో ఒకే మనిషి జీవితకాలం ఉండేంత పెద్ద నమూనాలను చూస్తారు. కానీ సుదూర పఠనం ఒక నమూనాను సూచించినప్పుడు, దానిని అర్థం చేసుకోవడానికి దగ్గరగా చదవడానికి, అంటే అసలు పత్రానికి తిరిగి వెళ్లడం అవసరం. రెండు పద్ధతులు పరస్పరం మార్చుకోలేవు; ఒకటి నమూనాను చూపుతుంది, మరొకటి దాని అర్థాన్ని ఇస్తుంది. అత్యంత బలమైన పరిశోధన రెండింటినీ కలిపి ఉపయోగిస్తుంది.

చిట్కా: నమూనా విశ్లేషణను పరికల్పన జనరేటర్‌గా ఉపయోగించండి: "AI ఇక్కడ ఒక నమూనాను గుర్తించింది, ఇది నిజమేనా?" ఆపై పత్రాలలో ఆ నమూనాను ఒక్కొక్కటిగా తనిఖీ చేయండి. నమూనా మీ పరిశోధన యొక్క ప్రారంభ స్థానం, ఫలితం కాదు.

వర్క్‌ఫ్లో: స్టెప్ బై స్టెప్

1. ప్రశ్నను స్పష్టం చేయండి. "ఈ సేకరణలో ఏ వ్యక్తులు ఎక్కువగా కలిసి కనిపిస్తారు?" వంటి స్పష్టమైన నమూనా ప్రశ్న.

2. డేటాను సిద్ధం చేసి లేబుల్ చేయండి. మూలాధార సూచనలతో వచనాన్ని నిర్వహించండి, తద్వారా కనుగొనబడిన ఏవైనా ఆస్తులు పత్రానికి తిరిగి లింక్ చేయబడతాయి.

3. ఎంటిటీ/నమూనా కనిపిస్తుంది. AIతో NER, సంబంధం లేదా టైమ్‌లైన్ అవుట్‌లైన్‌ని రూపొందించండి.

4. సాధారణీకరించండి. ఒకే వ్యక్తి/స్థలం (“ఇస్తాంబుల్ / ఇస్తాంబుల్ / కోస్టాంటినియే” ఒకే స్థలం?) యొక్క విభిన్న స్పెల్లింగ్‌లను కలపండి. ఈ దశ క్లిష్టమైనది; అది విస్మరించబడితే, నమూనా విడిపోతుంది.

5. పత్రంలో ధృవీకరించండి. ఫ్లాగ్ చేయబడిన ఏవైనా ముఖ్యమైన నమూనాల కోసం వాస్తవ పత్రాలను తనిఖీ చేయండి. AI రూపొందించిన లింక్‌ను జోడించలేదని నిర్ధారించుకోండి.

6. వ్యాఖ్య. నమూనా అంటే చరిత్రకారుని తీర్పు; AI కేవలం నమూనాను సూచిస్తుంది.

సంఖ్య మరియు గణాంకాల ట్రాప్

సరళి విశ్లేషణ తరచుగా సంఖ్యలను ఉత్పత్తి చేస్తుంది: "పేరు X 47 సార్లు వస్తుంది", "ఈ థీమ్ 30% పత్రాలలో ఉంది". ఈ సంఖ్యలు ఆబ్జెక్టివ్‌గా కనిపిస్తున్నాయి కానీ తప్పుదారి పట్టించవచ్చు:

  • తప్పిపోయిన డేటా: సేకరణ ఇప్పటికే అసంపూర్తిగా ఉంటే (పత్రాలు పోయాయి, సమూహం ఎప్పుడూ రికార్డ్ చేయబడదు), సంఖ్య వాస్తవంగా కాకుండా మనుగడలో ఉన్న పత్రాలను ప్రతిబింబిస్తుంది.
  • సాధారణీకరణ లోపం: ఒకే వ్యక్తిని వేర్వేరుగా స్పెల్లింగ్ చేసి, విడిగా లెక్కించినట్లయితే, సంఖ్య తప్పుగా ఉంటుంది.
  • సందర్భం కోల్పోవడం: "47 సార్లు జరుగుతుంది" ఏదైనా చెప్పలేదు; అది ఎలా ఉత్తీర్ణత చెందింది (పాజిటివ్/నెగటివ్, సబ్జెక్ట్/ఆబ్జెక్ట్) అనేది ముఖ్యం.

నమూనా అవుట్పుట్

స్పష్టమైన అర్థం

నిజమైన ప్రమాదం

"X 47 సార్లు వస్తుంది"

ముఖ్యమైన వ్యక్తి

అసంపూర్ణ సేకరణ, స్పెల్లింగ్ వైవిధ్యం

"థీమ్ 30%"

ఆధిపత్య అంశం

నమూనా పక్షపాతం

"A-B తరచుగా కలిసి ఉంటుంది"

సన్నిహిత సంబంధం

యాదృచ్చికం, తప్పిపోయిన సందర్భం

"కాలక్రమం"

ఖచ్చితమైన కాలక్రమం

తేదీ లేని పత్రాలు, కల్పిత ఆర్డర్

మూడు చిన్న కేసులు

కేసు 1 - నెట్‌వర్క్ విశ్లేషణ దాచిన మధ్యవర్తిని వెల్లడించింది. ఒక పరిశోధకుడు 800 అక్షరాల కరస్పాండెన్స్ సేకరణను పరిశీలించాడు. AIతో, ఎవరు ఎవరికి వ్రాసారో నిర్ణయించబడింది మరియు నెట్‌వర్క్ సృష్టించబడింది. నెట్‌వర్క్ మొదటి చూపులో అంతగా కనిపించని వ్యక్తి వాస్తవానికి రెండు సమూహాల మధ్య పరిచయానికి కీలకమైన అంశం అని చూపించింది. పరిశోధకుడు ఈ వ్యక్తి లేఖలపై దృష్టి సారించారు మరియు కొత్త అన్వేషణకు చేరుకున్నారు. కానీ మొదట డాక్యుమెంట్లలోని అన్ని లింక్‌లను ధృవీకరించారు.

కేసు 2 - సాధారణీకరణ లోపం సంఖ్యను పాడైనది. పత్రాలలో ఒక స్థలం ఎన్నిసార్లు కనిపించిందో వాటిని లెక్కించమని ఒక విద్యార్థి చెప్పాడు. AI ఒకే స్థలంలో మూడు వేర్వేరు స్పెల్లింగ్‌లను విడిగా లెక్కించినందున, ఆ సంఖ్య వాస్తవ సంఖ్యలో మూడో వంతుగా మారింది. స్పెల్లింగ్‌లను కలిపినప్పుడు, స్థలం వాస్తవానికి మూడవ అత్యంత తరచుగా సంభవించే స్థానంలో ఉంది. పాఠం: సాధారణీకరణ లేకుండా సంఖ్యను విశ్వసించలేము.

కేసు 3 — రూపొందించబడిన కాలక్రమం. ఒక పరిశోధకుడు తేదీ లేని పత్రాల నుండి కాలక్రమాన్ని సృష్టించాడు. AI తెలియని సంఘటనలను "తార్కిక" క్రమంలో అమర్చింది మరియు ఖచ్చితమైన కాలక్రమాన్ని అందించింది. అయితే, ఈ క్రమం పత్రాల్లో లేదు, AI దానిని రూపొందించింది. పాఠం: పత్రంలో తేదీని కలిగి ఉన్న ఈవెంట్‌ల నుండి మాత్రమే టైమ్‌లైన్ నిర్మించబడింది; మిగిలినవి "తేదీ లేనివి"గా మిగిలి ఉన్నాయి.

నాలుగు కాపీ చేయగల టెంప్లేట్‌లు

1) NER (ఎంటిటీ అనుమితి):

దిగువ డాక్యుమెంట్‌లలో పేర్కొన్న వ్యక్తులు, స్థలాలు, సంస్థలు మరియు తేదీలు ప్రత్యేక జాబితాలుగా కనిపిస్తాయి. ప్రతి ఎంటిటీని ఏ పత్రంలో (సూచన) పేర్కొనబడిందో సూచించండి. టెక్స్ట్‌లో స్పష్టంగా చెప్పబడిన వాటిని మాత్రమే తీసుకోండి; అంచనా ద్వారా జోడించండి. మీకు ఉచ్చారణ ఖచ్చితంగా తెలియకపోతే [?] గుర్తు పెట్టండి. పత్రాలు: [ఇక్కడ]

2) ఎంటిటీ సాధారణీకరణ:

దిగువ ఎంటిటీ జాబితాలో, ఒకే వ్యక్తి/స్థలం (ఉదా. "ఇస్తాంబుల్ / కోస్టాంటినియే") ఉండే విభిన్న స్పెల్లింగ్‌లను సమూహపరచండి. ప్రతి సమూహానికి సాధ్యమయ్యే సాధారణ ఆకృతిని సూచించండి కానీ ఖచ్చితమైన కలయికను విధించవద్దు; "బహుశా అదే కావచ్చు, వ్యక్తులను ధృవీకరించనివ్వండి" అనే గమనికను జోడించండి. మీకు ఖచ్చితంగా తెలియకపోతే ఒంటరిగా వదిలేయండి. జాబితా: [ఇక్కడ]

3) సంబంధం/నెట్‌వర్క్ అవుట్‌లైన్:

కింది కరస్పాండెన్స్/పత్రాల సెట్ నుండి "ఎవరికి సంబంధించినది" లింక్‌లను సంగ్రహించండి. ప్రతి లింక్ కోసం, ఇది ఏ పత్రం (సూచన) ఆధారంగా ఉందో సూచించండి. పత్రంలో స్పష్టంగా లేని సంబంధం ఏర్పడింది. అస్పష్టమైన లింక్‌లను గుర్తు పెట్టండి [అస్పష్టంగా]. డాక్యుమెంటేషన్: [ఇక్కడ]

4) తేదీ కాలక్రమం:

కింది పత్రాలలో స్పష్టంగా పేర్కొన్న సంఘటనలను మాత్రమే కాలక్రమానుసారంగా జాబితా చేయండి; ప్రతి ఈవెంట్‌ను దాని మూలానికి లింక్ చేయండి. అనిశ్చిత తేదీలతో ఈవెంట్‌లను ప్రత్యేకంగా "తేదీ లేని" శీర్షిక కింద జాబితా చేయండి, వాటిని క్రమంలో ఉంచవద్దు. అంచనా వేసిన తేదీని రూపొందించవద్దు. డాక్యుమెంటేషన్: [ఇక్కడ]

బలహీనమైన ప్రాంప్ట్ / బలమైన ప్రాంప్ట్

బలహీనం:

ఈ పత్రాలను విశ్లేషించండి మరియు ముఖ్యమైన నమూనాలు, సంబంధాలు మరియు సమయపాలనలను సంగ్రహించండి.

"ముఖ్యమైన నమూనాలను సంగ్రహించడం" అనేది ఉనికిలో లేని కనెక్షన్‌లను మరియు ఖచ్చితమైన కాలక్రమాలను కనిపెట్టడానికి AIని నెట్టివేస్తుంది, సాధారణీకరణ లేకుండా సంఖ్యలను ప్రదర్శిస్తుంది.

బలమైన:

ప్రతి ఒక్కటి డాక్యుమెంట్ రిఫరెన్స్‌కు కనెక్ట్ చేయడం ద్వారా క్రింది పత్రాల నుండి వ్యక్తి/స్థలం/సంస్థ ఎంటిటీలను సంగ్రహిస్తుంది. విభిన్న స్పెల్లింగ్‌లను "విలీనం చేయబడవచ్చు" అని గుర్తించండి, కానీ విలీనం చేయవద్దు. పత్రంలో స్పష్టంగా పేర్కొనబడని సంబంధాలు మరియు అనిశ్చిత తేదీలతో ఈవెంట్‌లు నకిలీవి కావు; తేదీలు లేని వాటిని వేరుగా ఉంచండి. డాక్యుమెంటేషన్: [ఇక్కడ]

తేడా: మూలానికి ఆపాదింపు, మానవులకు సాధారణీకరణను వదిలివేయడం, కల్పిత సంబంధాలు/చరిత్రపై నిషేధం మరియు తేదీ లేని సంఘటనల విభజన నమూనాను రక్షించడానికి వీలు కల్పిస్తుంది.

సాధారణ తప్పులు

  • సాక్ష్యం కోసం నమూనాను తప్పుబడుతోంది. నమూనా పరికల్పన; పత్రంలో ధృవీకరించబడింది.
  • సాధారణీకరణను దాటవేయడం. ఒకే ఎంటిటీ యొక్క విభిన్న స్పెల్లింగ్‌లు సంఖ్య మరియు నెట్‌వర్క్‌ను వక్రీకరిస్తాయి.
  • సంఖ్యలపై గుడ్డి నమ్మకం. అసంపూర్ణ సేకరణ మరియు నమూనా పక్షపాతం సంఖ్యను తప్పుదారి పట్టించేలా చేస్తాయి.
  • రూపొందించిన కాలక్రమం. తేదీ లేని సంఘటనలు కాలక్రమంలో చేర్చబడలేదు.
  • సందర్భాన్ని విస్మరించడం. "ఎన్ని సార్లు పాస్ అయింది" అనేది కాదు, "ఎలా పాస్ అయింది" అనేది ముఖ్యం.

సారాంశంలో

కంటెంట్ విశ్లేషణ మరియు నమూనా ఆవిష్కరణ అనేది ఒక శక్తివంతమైన ఫీల్డ్, ఇక్కడ AI అనేది కేవలం చదవడం ద్వారా కనిపించని నిర్మాణాలను కనిపించేలా చేస్తుంది: ఎంటిటీ ఎక్స్‌ట్రాక్షన్, రిలేషన్ షిప్ నెట్‌వర్క్‌లు, టాపిక్ క్లస్టర్‌లు, టైమ్‌లైన్‌లు. కానీ ప్రతి నమూనా ఒక పరికల్పన, సాక్ష్యం కాదు. మూలాధారానికి ఆస్తులను లింక్ చేయండి, జాగ్రత్తగా మరియు మానవ ధ్రువీకరణతో సాధారణీకరించండి, డేటా మరియు పక్షపాతం కోసం ప్రశ్న సంఖ్యలు, కల్పిత సంబంధాలు మరియు కాలక్రమాలను నివారించండి. AI నమూనాను సూచిస్తుంది; దాని అర్థం ఏమిటి మరియు అది నిజమా కాదా అనేది చరిత్రకారుల తీర్పు.

అప్లికేషన్ టాస్క్

కనీసం 15 డాక్యుమెంటేషన్ ముక్కలను (సూచనలతో) సేకరించండి. "NER" టెంప్లేట్‌తో వ్యక్తి మరియు స్థానం ఎంటిటీలను సంగ్రహించండి. ఆపై విభిన్న స్పెల్లింగ్‌లను "ఎంటిటీ సాధారణీకరణ"తో సమూహపరచండి మరియు సమూహాలను మీరే ధృవీకరించండి. చివరగా, "డేటెడ్ టైమ్‌లైన్" టెంప్లేట్‌ను అమలు చేయండి మరియు ఎన్ని ఈవెంట్‌లు "తేదీ లేనివి"గా ఉన్నాయో చూడండి. పేలవమైన ప్రాంప్టింగ్‌తో AI ఎన్ని రూపొందించిన లింక్‌లు లేదా కాలక్రమాలను సరిపోల్చండి.

చెక్లిస్ట్

  • [ ] నేను నా నమూనా ప్రశ్నను స్పష్టంగా నిర్వచించాను.
  • [ ] నేను ప్రతి ఎంటిటీని డాక్యుమెంట్ రిఫరెన్స్‌కి లింక్ చేసాను.
  • [ ] నేను ఎంటిటీ టైపింగ్‌ని సాధారణీకరించాను మరియు దానిని మానవ ఆమోదంతో కలిపాను.
  • [ ] తప్పిపోయిన డేటా మరియు పక్షపాతం కోసం నేను సంఖ్యలను ప్రశ్నించాను.
  • [ ] నేను తేదీ లేని సంఘటనలను కాలక్రమంలో పెట్టలేదు, నేను వాటిని విడిగా ఉంచాను.