युनिट्स
1. इतिहास आणि संग्रहणातील कृत्रिम बुद्धिमत्तेचा परिचय: भूमिका, सीमा, प्रमाणीकरण आणि नीतिशास्त्र 2. दस्तऐवज डिजिटायझेशन आणि ओसीआर: मुद्रित मजकूर मशीन टेक्स्टमध्ये रूपांतरित करणे 3. लिप्यंतरण: ऑट्टोमन तुर्की आणि हस्तलिखिते 4. मेटाडेटा, कॅटलॉगिंग आणि वर्गीकरण 5. स्रोत स्कॅनिंग, शोध आणि सारांश 6. ऐतिहासिक भाषांतर आणि सरलीकरण 7. स्त्रोत पडताळणी, अनाक्रोनिझम आणि भ्रम 8. सामग्री विश्लेषण आणि नमुना शोध 9. संग्रहण प्रवेश, वर्णन आणि वापरकर्ता सेवा 10. संरक्षण, जीर्णोद्धार आणि डिजिटल संरक्षण 11. नैतिकता, कॉपीराइट, गोपनीयता आणि सांस्कृतिक संवेदनशीलता 12. एंड-टू-एंड प्रोजेक्ट: आर्टिफिशियल इंटेलिजन्ससह संग्रहण संग्रहावर प्रक्रिया करणे
युनिट 8 / 12

सामग्री विश्लेषण आणि नमुना शोध

नफा:

  • NER, रिलेशनशिप एक्स्ट्रॅक्शन, टाइमलाइन आणि नेटवर्क विश्लेषण यासारख्या तंत्रांचा वापर करून मोठ्या मजकुरातून नमुने काढण्याची क्षमता
  • पुराव्यांऐवजी एक गृहितक म्हणून नमुना पाहण्यास सक्षम असणे, संस्थांना स्त्रोताशी जोडणे आणि त्यांना मानवी मान्यतेने सामान्य करणे
  • गहाळ डेटा आणि सॅम्पलिंग बायसमुळे संख्या कशी दिशाभूल करू शकते हे समजून घेण्याची क्षमता आणि काल्पनिक संबंध आणि कालक्रम टाळण्याची क्षमता.

ऐतिहासिक संशोधन म्हणजे केवळ वैयक्तिक कागदपत्रे वाचणे नव्हे; अनेकदा कागदपत्रांच्या मोठ्या संचामध्ये नमुने शोधतात. एखादे विशिष्ट नाव वर्षानुवर्षे कोणत्या संदर्भात दिसून येते? कोणते लोक वस्तीशी संबंधित आहेत? काळानुसार विषय कसा बदलतो? कोण कोणाशी पत्रव्यवहार करत आहे? अशा प्रश्नांना एकच कागदपत्र नाही तर शेकडो कागदपत्रे एकत्रितपणे पाहावी लागतात. याला बहुधा डिजिटल मानविकी म्हणतात—इतिहास आणि साहित्य यांसारख्या क्षेत्रात संगणकीय पद्धतींचा वापर.

AI मजकूराच्या मोठ्या संचातून संरचित माहिती काढण्यात शक्तिशाली आहे. या युनिटमध्ये, तुम्ही NER (नावाची संस्था ओळख), पॅटर्न आणि रिलेशनशिप एक्सट्रॅक्शन, विषय मॉडेलिंग लॉजिक आणि टाइमलाइन तयार करणे शिकाल; परंतु आम्ही या तंत्रांच्या सर्वात धोकादायक समस्यांबद्दल देखील चर्चा करू - AI स्वतःला अस्तित्वात नसलेला नमुना "सापडला" म्हणून सादर करते.

मूलभूत तंत्रे

  • NER (नावाबद्ध अस्तित्व ओळख): मजकूरातून व्यक्ती, ठिकाण, संस्था, तारीख यासारख्या घटकांचे स्वयंचलित निष्कर्षण. हे काही मिनिटांत "या 500 दस्तऐवजांमध्ये नमूद केलेल्या सर्व ठिकाणांची नावे" सारखी यादी तयार करते.
  • नातेसंबंध निष्कर्ष: संस्थांमधील संबंध चिन्हांकित करणे ("व्यक्ती X ठिकाणी Y", "A B शी संबंधित आहे").
  • विषयाचे मॉडेलिंग: मजकूराच्या मोठ्या संचामध्ये आवर्ती विषयांचे क्लस्टर्स सांख्यिकीयदृष्ट्या शोधणे. हे दर्शवते की कोणत्या थीम कोणत्या कालावधीत केंद्रित आहेत.
  • टाइमलाइन निष्कर्ष: दस्तऐवजांमध्ये कालक्रमानुसार दिनांकित घटनांची व्यवस्था करणे.
  • नेटवर्क विश्लेषण: नेटवर्क म्हणून आंतर-व्यक्ती/संस्थात्मक संबंधांची कल्पना करणे (केंद्र कोण आहे, कनेक्शन बिंदू कोण आहे).

एका दस्तऐवजात न दिसणाऱ्या परंतु संपूर्ण संग्रहात दिसणाऱ्या रचना प्रकट करणे हे या सर्वांचे समान उद्दिष्ट आहे. ही तंत्रे दृश्यमान नमुने बनवतात जी केवळ वाचनाद्वारे कधीही दृश्यमान होणार नाहीत. परंतु त्यातील प्रत्येक एक "चिन्ह" आहे, "पुरावा" नाही; मूळ कागदपत्रात काय आढळते याची पडताळणी करणे आवश्यक आहे.

या क्षेत्रात वारंवार वापरलेली संकल्पना म्हणजे जवळचे वाचन (एक मजकूर खोलवर वाचणे, ओळीने ओळीने वाचणे) आणि दूरचे वाचन (शेकडो/हजारो मजकूर एकत्रितपणे, सांख्यिकीयदृष्ट्या पाहणे) यातील फरक आहे. AI मुळे दूरस्थपणे वाचणे शक्य होते: तुम्हाला एका व्यक्तीचे आयुष्यभर पुरेल इतके मोठे कॉर्पसचे नमुने दिसतात. परंतु जेव्हा दूरस्थ वाचन पॅटर्नकडे निर्देश करते, तेव्हा त्याचा अर्थ काढण्यासाठी जवळच्या वाचनाकडे, म्हणजे मूळ दस्तऐवजाकडे परत जाणे आवश्यक आहे. दोन पद्धती अदलाबदल करण्यायोग्य नाहीत; एक नमुना दर्शवितो, दुसरा त्याचा अर्थ देतो. सर्वात मजबूत संशोधन दोन्ही एकत्र वापरते.

टीप: एक गृहीतक जनरेटर म्हणून नमुना विश्लेषण वापरा: "एआयने येथे एक नमुना पाहिला आहे, तो वास्तविक आहे का?" मग एक एक करून कागदपत्रांमध्ये तो नमुना तपासा. नमुना हा तुमच्या संशोधनाचा प्रारंभिक बिंदू आहे, परिणाम नाही.

कार्यप्रवाह: चरण-दर-चरण

1. प्रश्न स्पष्ट करा. "या संग्रहात कोणते लोक वारंवार एकत्र दिसतात?" सारखा स्पष्ट नमुना प्रश्न.

2. डेटा तयार करा आणि लेबल करा. स्त्रोत संदर्भांसह मजकूर व्यवस्थापित करा जेणेकरून सापडलेल्या कोणत्याही मालमत्तेचा परत दस्तऐवजाशी दुवा साधता येईल.

3. अस्तित्व/पॅटर्न दिसतो. AI सह NER, संबंध किंवा टाइमलाइन बाह्यरेखा व्युत्पन्न करा.

4. सामान्य करा. एकाच व्यक्तीचे/स्थानाचे वेगवेगळे शब्दलेखन एकत्र करा (“इस्तंबूल/इस्तंबूल/कोस्टँटिनिये” समान ठिकाण?). हे पाऊल गंभीर आहे; जर ते वगळले तर, नमुना वेगळा पडेल.

5. दस्तऐवजात पडताळणी करा. ध्वजांकित केलेल्या कोणत्याही महत्त्वपूर्ण नमुन्यांची वास्तविक कागदपत्रे तपासा. AI मेड-अप लिंक जोडत नाही याची खात्री करा.

6. टिप्पणी. पॅटर्नचा अर्थ काय हा इतिहासकाराचा निर्णय आहे; एआय फक्त नमुना चिन्हांकित करते.

संख्या आणि आकडेवारीचा सापळा

नमुन्याचे विश्लेषण अनेकदा संख्या तयार करते: "नाव X 47 वेळा येते", "ही थीम 30% दस्तऐवजांमध्ये उपस्थित आहे". ही संख्या वस्तुनिष्ठ वाटते परंतु दिशाभूल करणारी असू शकते:

  • गहाळ डेटा: जर संग्रह आधीच अपूर्ण असेल (कागदपत्रे गमावली गेली आहेत, गट कधीही रेकॉर्ड केला गेला नाही), संख्या वास्तविकता नव्हे तर हयात असलेले दस्तऐवज प्रतिबिंबित करते.
  • सामान्यीकरण त्रुटी: जर एकाच व्यक्तीचे स्पेलिंग वेगळे असेल आणि स्वतंत्रपणे मोजले गेले असेल, तर संख्या चुकीची असेल.
  • संदर्भ गमावणे: "47 वेळा उद्भवते" काहीही बोलत नाही; ते कसे पास केले जाते (सकारात्मक/नकारात्मक, विषय/वस्तू) हे महत्त्वाचे आहे.

नमुना आउटपुट

उघड अर्थ

वास्तविक धोका

"X 47 वेळा येतो"

महत्वाची व्यक्ती

अपूर्ण संग्रह, शब्दलेखन भिन्नता

"थीम 30%"

प्रबळ विषय

नमुना पूर्वाग्रह

"ए-बी अनेकदा एकत्र"

जिव्हाळ्याचा संबंध

योगायोग, गहाळ संदर्भ

"टाइमलाइन"

अचूक कालगणना

तारीख नसलेली कागदपत्रे, बनावट ऑर्डर

तीन लहान प्रकरणे

केस 1 - नेटवर्क विश्लेषणाने एक लपलेला मध्यस्थ उघड केला. एका संशोधकाने 800 पत्रांचा पत्रव्यवहार संग्रह तपासला. AI सह, कोण कोणाला लिहितो हे निश्चित केले गेले आणि नेटवर्क तयार केले गेले. नेटवर्कने दर्शविले की पहिल्या दृष्टीक्षेपात क्षुल्लक दिसणारी व्यक्ती प्रत्यक्षात दोन गटांमधील संपर्काचा मुख्य मुद्दा होता. संशोधकाने या व्यक्तीच्या पत्रांवर लक्ष केंद्रित केले आणि एक नवीन शोध गाठला. पण आधी कागदपत्रांमधील सर्व लिंक्स तपासल्या.

केस 2 - सामान्यीकरण त्रुटीने क्रमांक खराब केला. एका विद्यार्थ्याने त्यांना कागदपत्रांमध्ये जागा किती वेळा दिसली याची मोजणी करायला लावली. AI ने एकाच ठिकाणचे तीन वेगवेगळे स्पेलिंग स्वतंत्रपणे मोजले असल्याने ही संख्या खऱ्या संख्येच्या एक तृतीयांश असल्याचे दिसून आले. जेव्हा शब्दलेखन एकत्र केले गेले, तेव्हा स्थान वास्तविकपणे तिसऱ्या क्रमांकावर होते. धडा: सामान्यीकरण केल्याशिवाय नंबरवर विश्वास ठेवला जाऊ शकत नाही.

केस 3 - मेड-अप टाइमलाइन. एका संशोधकाने अपरिचित कागदपत्रांमधून एक टाइमलाइन तयार केली. AI ने अज्ञात घटनांची "तार्किक" क्रमाने मांडणी केली आणि एक अचूक कालगणना सादर केली. तथापि, हा क्रम कागदपत्रांमध्ये नव्हता, एआयने ते तयार केले होते. धडा: टाइमलाइन केवळ दस्तऐवजात तारीख असलेल्या घटनांवरून तयार केली जाते; बाकी "अनडेटेड" राहते.

चार कॉपी करण्यायोग्य टेम्पलेट्स

1) NER (संस्था अनुमान):

खालील दस्तऐवजांमध्ये नमूद केलेल्या व्यक्ती, ठिकाणे, संस्था आणि तारखा स्वतंत्र यादी म्हणून दिसतात. प्रत्येक घटकाचा उल्लेख कोणत्या दस्तऐवजात (संदर्भ) आहे ते सूचित करा. मजकूरात जे स्पष्टपणे सांगितले आहे तेच घ्या; अंदाजानुसार जोडा. तुम्हाला उच्चारांची खात्री नसल्यास [?] चिन्हांकित करा. कागदपत्रे: [येथे]

2) अस्तित्व सामान्यीकरण:

खालील घटक सूचीमध्ये, समान व्यक्ती/स्थान असू शकणाऱ्या वेगवेगळ्या स्पेलिंगचे गट करा (उदा. "इस्तंबूल / कोस्टांटिन्ये"). प्रत्येक गटासाठी संभाव्य सामान्य स्वरूप सुचवा परंतु अचूक संयोजन लादू नका; टीप जोडा "कदाचित समान, लोकांना सत्यापित करू द्या". तुम्हाला खात्री नसेल तर सोडा. यादी: [येथे]

३) नाते/नेटवर्क रूपरेषा:

खालील पत्रव्यवहार/कागदपत्रांच्या संचामधून "कोण कोणाशी संबंधित आहे" लिंक्स काढा. प्रत्येक दुव्यासाठी, ते कोणत्या दस्तऐवजावर (संदर्भ) आधारित आहे ते दर्शवा. दस्तऐवजात स्पष्टपणे नसलेले नाते तयार केले. अस्पष्ट दुवे चिन्हांकित करा [अस्पष्ट]. दस्तऐवजीकरण: [येथे]

4) दिनांक टाइमलाइन:

खालील दस्तऐवजांमध्ये स्पष्टपणे नमूद केलेल्या घटनांची केवळ कालक्रमानुसार यादी करा; प्रत्येक इव्हेंटला त्याच्या स्त्रोताशी लिंक करा. अनिश्चित तारखांसह घटनांची स्वतंत्रपणे "अनेटेड" शीर्षकाखाली यादी करा, त्यांना क्रमाने ठेवू नका. अंदाजे तारीख तयार करू नका. दस्तऐवजीकरण: [येथे]

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत:

या दस्तऐवजांचे विश्लेषण करा आणि महत्त्वाचे नमुने, नातेसंबंध आणि टाइमलाइन काढा.

"महत्त्वाचे नमुने काढा" AI ला अस्तित्वात नसलेले कनेक्शन आणि अचूक कालगणना शोधण्यासाठी ढकलते, सामान्यीकरण न करता संख्या सादर करते.

मजबूत:

प्रत्येकाला दस्तऐवज संदर्भाशी जोडून खालील दस्तऐवजांमधून व्यक्ती/स्थान/संस्थेचा निष्कर्ष काढतो. भिन्न शब्दलेखन चिन्हांकित करा जे "विलीन केले जाऊ शकतात" सारखे असू शकतात, परंतु विलीन करू नका. दस्तऐवजात स्पष्टपणे नमूद केलेले नसलेले संबंध आणि अनिश्चित तारखांसह घटना खोट्या नाहीत; तारखा नसलेल्यांना वेगळे ठेवा. दस्तऐवजीकरण: [येथे]

फरक: स्त्रोताचे श्रेय, मानवांसाठी सामान्यीकरण सोडणे, काल्पनिक संबंध/इतिहासावर बंदी, आणि अनपेक्षित घटनांचे विभक्त करणे पॅटर्नला बचाव करण्यायोग्य बनवते.

सामान्य चुका

  • पुराव्यासाठी नमुना चुकणे. नमुना हा गृहितक आहे; दस्तऐवजात सत्यापित आहे.
  • सामान्यीकरण वगळणे. एकाच घटकाचे वेगवेगळे स्पेलिंग नंबर आणि नेटवर्क विकृत करतात.
  • संख्येवर आंधळा विश्वास. अपूर्ण संकलन आणि सॅम्पलिंग बायसमुळे संख्या दिशाभूल होते.
  • मेड-अप टाइमलाइन. कालक्रमानुसार अप्रचलित घटनांचा समावेश केलेला नाही.
  • संदर्भाकडे दुर्लक्ष करणे. "किती वेळा पास झाले" हे नाही तर "कसे पास झाले" हे महत्वाचे आहे.

सारांशात

सामग्रीचे विश्लेषण आणि नमुना शोध हे एक शक्तिशाली क्षेत्र आहे जिथे AI दृश्यमान संरचना बनवते ज्या केवळ वाचनाद्वारे दृश्यमान होणार नाहीत: अस्तित्व एक्सट्रॅक्शन, रिलेशनशिप नेटवर्क, विषय क्लस्टर, टाइमलाइन. परंतु प्रत्येक नमुना हा एक गृहितक आहे, पुरावा नाही. स्त्रोताशी मालमत्तेचा दुवा साधा, काळजीपूर्वक आणि मानवी प्रमाणीकरणासह सामान्यीकरण करा, गहाळ डेटा आणि पूर्वाग्रहासाठी क्वेरी क्रमांक, विवादित संबंध आणि कालक्रम टाळा. एआय नमुना चिन्हांकित करते; त्याचा अर्थ काय आणि तो खरा आहे की नाही हा इतिहासकाराचा निर्णय आहे.

अर्ज कार्य

कागदपत्रांचे किमान 15 तुकडे (संदर्भांसह) गोळा करा. "NER" टेम्पलेटसह व्यक्ती आणि स्थान संस्था काढा. नंतर "एंटिटी नॉर्मलायझेशन" सह भिन्न शब्दलेखन गटबद्ध करा आणि गट स्वतः सत्यापित करा. शेवटी, "तारीखित टाइमलाइन" टेम्प्लेट चालवा आणि किती कार्यक्रम "अनडेटेड" राहतील ते पहा. खराब प्रॉम्प्टिंगसह AI किती बनावट लिंक किंवा कालक्रम तयार करेल याची तुलना करा.

चेकलिस्ट

  • [ ] मी माझा नमुना प्रश्न स्पष्टपणे परिभाषित केला आहे.
  • [ ] माझ्याकडे प्रत्येक घटक दस्तऐवज संदर्भाशी जोडलेला आहे.
  • [ ] मी एंटिटी टायपिंग सामान्य केले आणि ते मानवी मान्यतेसह एकत्र केले.
  • [ ] मी गहाळ डेटा आणि पूर्वाग्रह साठी संख्या प्रश्न विचारले.
  • [ ] मी कालनिर्णय मध्ये न नोंदवलेल्या घटना टाकल्या नाहीत, मी त्या वेगळ्या ठेवल्या.