નફો:
- NER, સંબંધ નિષ્કર્ષણ, સમયરેખા અને નેટવર્ક વિશ્લેષણ જેવી તકનીકોનો ઉપયોગ કરીને ટેક્સ્ટના મોટા સેટમાંથી પેટર્ન કાઢવાની ક્ષમતા
- પેટર્નને પુરાવાને બદલે એક પૂર્વધારણા તરીકે જોવામાં સક્ષમ બનવું, એકમોને સ્ત્રોત સાથે જોડવું અને માનવીય મંજૂરી સાથે તેમને સામાન્ય બનાવવું
- ગુમ થયેલ ડેટા અને નમૂનાના પૂર્વગ્રહને કારણે સંખ્યાઓ કેવી રીતે ભ્રામક બની શકે છે તે સમજવાની ક્ષમતા, અને કાલ્પનિક સંબંધો અને ઘટનાક્રમને ટાળવાની ક્ષમતા.
ઐતિહાસિક સંશોધન માત્ર વ્યક્તિગત દસ્તાવેજો વાંચવા વિશે નથી; મોટાભાગે દસ્તાવેજોના મોટા સેટમાં પેટર્ન શોધે છે. વર્ષોથી ચોક્કસ નામ કયા સંદર્ભોમાં દેખાય છે? કયા લોકો વસાહત સાથે સંકળાયેલા છે? સમય સાથે વિષય કેવી રીતે બદલાય છે? કોણ કોની સાથે પત્રવ્યવહાર કરે છે? આવા પ્રશ્નો એક દસ્તાવેજને નહીં, પરંતુ સેંકડો દસ્તાવેજોને સામૂહિક રીતે જોવાની જરૂર છે. આને ઘણીવાર ડિજિટલ માનવતા કહેવામાં આવે છે - ઇતિહાસ અને સાહિત્ય જેવા ક્ષેત્રોમાં કોમ્પ્યુટેશનલ પદ્ધતિઓનો ઉપયોગ.
AI ટેક્સ્ટના મોટા સેટમાંથી સંરચિત માહિતી કાઢવામાં શક્તિશાળી છે. આ એકમમાં, તમે NER (નામિત એન્ટિટી ઓળખ), પેટર્ન અને સંબંધ નિષ્કર્ષણ, વિષય મોડેલિંગ તર્ક અને સમયરેખા બનાવટ શીખી શકશો; પરંતુ અમે આ તકનીકોની સૌથી ખતરનાક મુશ્કેલી વિશે પણ ચર્ચા કરીશું - એઆઈ પોતાને એક પેટર્ન "મળ્યો" તરીકે રજૂ કરે છે જે અસ્તિત્વમાં નથી.
મૂળભૂત તકનીકો
- NER (નામિત એન્ટિટી રેકગ્નિશન): ટેક્સ્ટમાંથી વ્યક્તિ, સ્થળ, સંસ્થા, તારીખ જેવી સંસ્થાઓનું સ્વચાલિત નિષ્કર્ષણ. તે મિનિટોમાં "આ 500 દસ્તાવેજોમાં ઉલ્લેખિત તમામ સ્થાનોના નામ" જેવી સૂચિ બનાવે છે.
- સંબંધ અનુમાન: સંસ્થાઓ વચ્ચેના સંબંધોને ચિહ્નિત કરવું ("વ્યક્તિ X સ્થાન Y પર", "A B સાથે અનુરૂપ છે").
- વિષયનું મોડેલિંગ: ટેક્સ્ટના મોટા સમૂહમાં આંકડાકીય રીતે પુનરાવર્તિત વિષયોના ક્લસ્ટરો શોધવા. તે બતાવે છે કે કઈ થીમ્સ કયા સમયગાળામાં કેન્દ્રિત છે.
- સમયરેખા અનુમાન: દસ્તાવેજોમાં તારીખની ઘટનાઓને કાલક્રમિક ક્રમમાં ગોઠવવી.
- નેટવર્ક વિશ્લેષણ: નેટવર્ક તરીકે આંતર-વ્યક્તિ/સંસ્થાકીય સંબંધોને વિઝ્યુઅલાઈઝ કરો (કોણ કેન્દ્ર છે, કોણ જોડાણ બિંદુ છે).
આ બધાનો સામાન્ય ધ્યેય એવા બંધારણોને જાહેર કરવાનો છે જે એક દસ્તાવેજમાં દેખાતા નથી પરંતુ સમગ્ર સંગ્રહમાં દેખાય છે. આ તકનીકો દૃશ્યમાન પેટર્ન બનાવે છે જે એકલા વાંચન દ્વારા ક્યારેય દેખાશે નહીં. પરંતુ તે દરેક એક "ચિહ્ન" છે, "પુરાવા" નથી; મૂળ દસ્તાવેજમાં શું જોવા મળે છે તેની ચકાસણી કરવી જરૂરી છે.
આ ક્ષેત્રમાં વારંવાર ઉપયોગમાં લેવાતી વિભાવના એ છે કે નજીકના વાંચન (ટેક્સ્ટને ઊંડાણમાં વાંચવું, લાઇન બાય લાઇન) અને દૂરનું વાંચન (સામૂહિક રીતે, આંકડાકીય રીતે સેંકડો/હજારો પાઠોને જોવું) વચ્ચેનો તફાવત. AI દૂરથી વાંચવાનું શક્ય બનાવે છે: તમે એક માનવ જીવનકાળ સુધી ટકી શકે તેટલા મોટા કોર્પસમાં પેટર્ન જુઓ છો. પરંતુ જ્યારે દૂરનું વાંચન કોઈ પેટર્ન તરફ નિર્દેશ કરે છે, ત્યારે તેને સમજવા માટે બંધ વાંચન પર પાછા ફરવું જરૂરી છે, એટલે કે, મૂળ દસ્તાવેજ પર. બે પદ્ધતિઓ વિનિમયક્ષમ નથી; એક પેટર્ન બતાવે છે, બીજો તેનો અર્થ આપે છે. સૌથી મજબૂત સંશોધન બંનેનો એકસાથે ઉપયોગ કરે છે.
ટીપ: પૂર્વધારણા જનરેટર તરીકે પેટર્ન વિશ્લેષણનો ઉપયોગ કરો: "AI એ અહીં એક પેટર્ન જોયો છે, શું તે વાસ્તવિક છે?" પછી એક પછી એક દસ્તાવેજોમાં તે પેટર્ન તપાસો. પેટર્ન એ તમારા સંશોધનનું પ્રારંભિક બિંદુ છે, પરિણામ નહીં.
વર્કફ્લો: સ્ટેપ બાય સ્ટેપ
1. પ્રશ્ન સ્પષ્ટ કરો. "આ સંગ્રહમાં કયા લોકો એકસાથે સૌથી વધુ વાર દેખાય છે?" જેમ કે સ્પષ્ટ પેટર્ન પ્રશ્ન.
2. ડેટા તૈયાર કરો અને લેબલ કરો. સ્ત્રોત સંદર્ભો સાથે ટેક્સ્ટ ગોઠવો જેથી કોઈપણ સંપત્તિ મળી હોય તેને દસ્તાવેજ સાથે પાછી લિંક કરી શકાય.
3. એન્ટિટી/પેટર્ન દેખાય છે. AI સાથે NER, સંબંધ અથવા સમયરેખા રૂપરેખા જનરેટ કરો.
4. સામાન્ય કરો. એક જ વ્યક્તિ/સ્થળની અલગ-અલગ જોડણીને જોડો (“ઇસ્તાંબુલ/ઇસ્તાંબુલ/કોસ્ટાંટિનીયે” એ જ સ્થાન?). આ પગલું જટિલ છે; જો તે અવગણવામાં આવે છે, તો પેટર્ન અલગ પડી જશે.
5. દસ્તાવેજમાં ચકાસો. ધ્વજાંકિત કોઈપણ નોંધપાત્ર પેટર્ન માટે વાસ્તવિક દસ્તાવેજો તપાસો. ખાતરી કરો કે AI મેડ-અપ લિંક ઉમેરતું નથી.
6. ટિપ્પણી. પેટર્નનો અર્થ શું છે તે ઇતિહાસકારનો ચુકાદો છે; AI માત્ર પેટર્નને ચિહ્નિત કરે છે.
સંખ્યા અને આંકડાની છટકું
પેટર્ન વિશ્લેષણ ઘણીવાર સંખ્યાઓ ઉત્પન્ન કરે છે: "નામ X 47 વખત આવે છે", "આ થીમ 30% દસ્તાવેજોમાં હાજર છે". આ સંખ્યાઓ ઉદ્દેશ્ય લાગે છે પરંતુ ભ્રામક હોઈ શકે છે:
- ખૂટતો ડેટા: જો સંગ્રહ પહેલેથી જ અપૂર્ણ છે (દસ્તાવેજો ખોવાઈ ગયા છે, જૂથ ક્યારેય રેકોર્ડ કરવામાં આવ્યું નથી), તો સંખ્યા હયાત દસ્તાવેજોને પ્રતિબિંબિત કરે છે, વાસ્તવિકતા નહીં.
- નોર્મલાઇઝેશન ભૂલ: જો એક જ વ્યક્તિની જોડણી અલગ રીતે કરવામાં આવે અને અલગથી ગણવામાં આવે, તો સંખ્યા ખોટી હશે.
- સંદર્ભ ગુમાવવો: "47 વખત થાય છે" કંઈપણ કહેતું નથી; તે કેવી રીતે પસાર થાય છે (સકારાત્મક/નકારાત્મક, વિષય/ઑબ્જેક્ટ) તે મહત્વનું છે.
પેટર્ન આઉટપુટ
દેખીતો અર્થ
વાસ્તવિક જોખમ
"X 47 વખત થાય છે"
મહત્વપૂર્ણ વ્યક્તિ
અપૂર્ણ સંગ્રહ, જોડણીની વિવિધતા
"થીમ 30%"
પ્રભાવશાળી વિષય
સેમ્પલિંગ પૂર્વગ્રહ
"A-B ઘણીવાર સાથે"
ઘનિષ્ઠ સંબંધ
સંયોગ, ગુમ થયેલ સંદર્ભ
"સમયરેખા"
ચોક્કસ ઘટનાક્રમ
તારીખ વગરના દસ્તાવેજો, બનાવટી ઓર્ડર
ત્રણ નાના કેસો
કેસ 1 - નેટવર્ક વિશ્લેષણે છુપાયેલ મધ્યસ્થી જાહેર કર્યું. એક સંશોધકે 800 પત્રોના પત્રવ્યવહાર સંગ્રહની તપાસ કરી. AI સાથે, કોણ કોને લખે છે તે નક્કી કરવામાં આવ્યું હતું અને નેટવર્ક બનાવવામાં આવ્યું હતું. નેટવર્ક બતાવે છે કે પ્રથમ નજરમાં દેખીતી રીતે નજીવી વ્યક્તિ વાસ્તવમાં બે જૂથો વચ્ચેના સંપર્કનો મુખ્ય મુદ્દો હતો. સંશોધકે આ વ્યક્તિના પત્રો પર ધ્યાન કેન્દ્રિત કર્યું અને એક નવી શોધ સુધી પહોંચી. પરંતુ પહેલા ડોક્યુમેન્ટ્સમાંની તમામ લિંક્સ વેરીફાઈ કરી.
કેસ 2 - નોર્મલાઇઝેશન ભૂલે નંબર બગાડ્યો. એક વિદ્યાર્થીએ તેમને દસ્તાવેજોમાં સ્થાન કેટલી વખત દેખાયું તેની ગણતરી કરવા કહ્યું. AI એ એક જ સ્થાનના ત્રણ અલગ-અલગ સ્પેલિંગને અલગથી ગણ્યા હોવાથી, સંખ્યા વાસ્તવિક સંખ્યાના ત્રીજા ભાગની હોવાનું બહાર આવ્યું છે. જ્યારે જોડણીને જોડવામાં આવી હતી, ત્યારે સ્થાન ખરેખર ત્રીજી સૌથી વધુ વારંવાર બનતી સ્થિતિમાં હતું. પાઠ: સામાન્યકરણ વિના નંબર પર વિશ્વાસ કરી શકાતો નથી.
કેસ 3 - મેડ-અપ સમયરેખા. એક સંશોધકે અનડેટેડ દસ્તાવેજોમાંથી સમયરેખા બનાવી. AI એ અજાણી ઘટનાઓને "તાર્કિક" ક્રમમાં ગોઠવી અને ચોક્કસ ઘટનાક્રમ રજૂ કર્યો. જો કે, આ ક્રમ દસ્તાવેજોમાં ન હતો, એઆઈએ તેને બનાવ્યો હતો. પાઠ: સમયરેખા દસ્તાવેજમાં તારીખ હોય તેવી ઘટનાઓ પરથી જ બનાવવામાં આવે છે; બાકીનું "અનડેટેડ" રહે છે.
ચાર નકલ કરી શકાય તેવા નમૂનાઓ
1) NER (એન્ટિટી અનુમાન):
નીચે આપેલા દસ્તાવેજોમાં ઉલ્લેખિત વ્યક્તિઓ, સ્થાનો, સંસ્થાઓ અને તારીખો અલગ યાદી તરીકે દેખાય છે. દરેક એન્ટિટીનો ઉલ્લેખ કયા દસ્તાવેજ (સંદર્ભ)માં છે તે દર્શાવો. લખાણમાં સ્પષ્ટપણે જણાવવામાં આવ્યું છે તે જ લો; અનુમાન દ્વારા ઉમેરો. જો તમને ઉચ્ચાર વિશે ખાતરી ન હોય તો [?] ચિહ્નિત કરો. દસ્તાવેજો: [અહીં]
2) એન્ટિટી નોર્મલાઇઝેશન:
નીચેની એન્ટિટી સૂચિમાં, એક જ વ્યક્તિ/સ્થળ હોઈ શકે તેવા અલગ-અલગ જોડણીઓનું જૂથ બનાવો (દા.ત. "ઇસ્તાંબુલ / કોસ્ટેન્ટિનીયે"). દરેક જૂથ માટે સંભવિત સામાન્ય ફોર્મેટ સૂચવો પરંતુ ચોક્કસ સંયોજન લાદશો નહીં; નોંધ ઉમેરો "કદાચ સમાન, લોકોને ચકાસવા દો". જો તમને ખાતરી ન હોય તો તેને એકલા છોડી દો. સૂચિ: [અહીં]
3) સંબંધ/નેટવર્ક રૂપરેખા:
નીચેના પત્રવ્યવહાર/દસ્તાવેજોના સમૂહમાંથી "કોણ કોની સાથે સંબંધિત છે" લિંક્સ બહાર કાઢો. દરેક લિંક માટે, તે કયા દસ્તાવેજ (સંદર્ભ) પર આધારિત છે તે દર્શાવો. એવો સંબંધ બનાવ્યો જે દસ્તાવેજમાં સ્પષ્ટ નથી. અસ્પષ્ટ લિંક્સને [અસ્પષ્ટ] ચિહ્નિત કરો. દસ્તાવેજીકરણ: [અહીં]
4) તારીખની સમયરેખા:
કાલક્રમિક ક્રમમાં ફક્ત નીચેના દસ્તાવેજોમાં સ્પષ્ટપણે જણાવેલી ઘટનાઓની સૂચિ બનાવો; દરેક ઘટનાને તેના સ્ત્રોત સાથે લિંક કરો. "અનડેટેડ" શીર્ષક હેઠળ અનિશ્ચિત તારીખો સાથેની ઘટનાઓને અલગથી સૂચિબદ્ધ કરો, તેમને ક્રમમાં મૂકશો નહીં. અંદાજિત તારીખ બનાવશો નહીં. દસ્તાવેજીકરણ: [અહીં]
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા:
આ દસ્તાવેજોનું વિશ્લેષણ કરો અને મહત્વપૂર્ણ પેટર્ન, સંબંધો અને સમયરેખા બહાર કાઢો.
"મહત્વપૂર્ણ દાખલાઓને બહાર કાઢો" એ AI ને બિન-અસ્તિત્વ ધરાવતા જોડાણો અને ચોક્કસ ઘટનાક્રમની શોધ કરવા દબાણ કરે છે, સામાન્યકરણ વિના સંખ્યાઓ રજૂ કરે છે.
મજબૂત:
દરેકને દસ્તાવેજ સંદર્ભ સાથે જોડીને નીચેના દસ્તાવેજોમાંથી વ્યક્તિ/સ્થળ/સંસ્થા એકમોને બહાર કાઢે છે. વિવિધ જોડણીઓને ચિહ્નિત કરો જે "મર્જ થઈ શકે છે" સમાન હોઈ શકે, પરંતુ મર્જ કરશો નહીં. દસ્તાવેજમાં સ્પષ્ટપણે જણાવેલા ન હોય તેવા સંબંધો અને અનિશ્ચિત તારીખો સાથેની ઘટનાઓ નકલી નથી; તારીખો વગરના લોકોને અલગ રાખો. દસ્તાવેજીકરણ: [અહીં]
તફાવત: સ્ત્રોતને એટ્રિબ્યુશન, માનવો માટે સામાન્યકરણ છોડી દેવું, કાલ્પનિક સંબંધો/ઈતિહાસ પર પ્રતિબંધ અને અનડેટેડ ઘટનાઓને અલગ પાડવાથી પેટર્નને બચાવી શકાય છે.
સામાન્ય ભૂલો
- પુરાવા માટે પેટર્નમાં ભૂલ કરવી. પેટર્ન એ પૂર્વધારણા છે; દસ્તાવેજમાં ચકાસાયેલ છે.
- નોર્મલાઇઝેશન છોડવું. એક જ એન્ટિટીના જુદા જુદા સ્પેલિંગ નંબર અને નેટવર્કને વિકૃત કરે છે.
- સંખ્યા પર આંધળો વિશ્વાસ. અપૂર્ણ સંગ્રહ અને સેમ્પલિંગ પૂર્વગ્રહ નંબરને ભ્રામક બનાવે છે.
- બનાવેલ સમયરેખા. તારીખ વિનાની ઘટનાઓ ઘટનાક્રમમાં સમાવિષ્ટ નથી.
- સંદર્ભની અવગણના. તે "કેટલી વખત પસાર થયું" નથી, પરંતુ "તે કેવી રીતે પસાર થયું" તે મહત્વનું છે.
સારાંશમાં
સામગ્રી પૃથ્થકરણ અને પેટર્ન શોધ એ એક શક્તિશાળી ક્ષેત્ર છે જ્યાં AI દૃશ્યમાન માળખાં બનાવે છે જે એકલા વાંચન દ્વારા દૃશ્યક્ષમ ન હોય: એન્ટિટી એક્સટ્રેક્શન, રિલેશનશિપ નેટવર્ક્સ, વિષય ક્લસ્ટરો, સમયરેખા. પરંતુ દરેક પેટર્ન એક પૂર્વધારણા છે, પુરાવા નથી. અસ્કયામતોને સ્રોત સાથે લિંક કરો, કાળજીપૂર્વક અને માનવ માન્યતા સાથે સામાન્ય કરો, ખોવાયેલા ડેટા અને પૂર્વગ્રહ માટે ક્વેરી નંબરો, કાલ્પનિક સંબંધો અને ઘટનાક્રમ ટાળો. AI પેટર્નને ચિહ્નિત કરે છે; તેનો અર્થ શું છે અને તે સાચું છે કે કેમ તે ઇતિહાસકારનો ચુકાદો છે.
એપ્લિકેશન કાર્ય
દસ્તાવેજોના ઓછામાં ઓછા 15 ટુકડાઓ (સંદર્ભ સાથે) એકત્રિત કરો. "NER" ટેમ્પ્લેટ સાથે વ્યક્તિ અને સ્થાન એકમોને બહાર કાઢો. પછી અલગ અલગ જોડણીઓને "એન્ટિટી નોર્મલાઇઝેશન" સાથે જૂથબદ્ધ કરો અને જૂથોને જાતે ચકાસો. છેલ્લે, "ડેટેડ ટાઈમલાઈન" ટેમ્પલેટ ચલાવો અને જુઓ કે કેટલી ઈવેન્ટ્સ "અનડેટેડ" રહે છે. નબળી પ્રોમ્પ્ટિંગ સાથે AI કેટલી ઉપજાવી કાઢેલી લિંક્સ અથવા ઘટનાક્રમ ઉત્પન્ન કરશે તેની તુલના કરો.
ચેકલિસ્ટ
- [ ] મેં મારા પેટર્ન પ્રશ્નને સ્પષ્ટ રીતે વ્યાખ્યાયિત કર્યો છે.
- [ ] મારી પાસે દરેક એન્ટિટી દસ્તાવેજ સંદર્ભ સાથે જોડાયેલ છે.
- [ ] મેં એન્ટિટી ટાઇપિંગને સામાન્ય બનાવ્યું અને તેને માનવીય મંજૂરી સાથે જોડ્યું.
- [ ] મેં ગુમ થયેલ ડેટા અને પૂર્વગ્રહ માટે નંબરો પર પ્રશ્ન કર્યો.
- [ ] મેં અપરિચિત ઘટનાઓને ઘટનાક્રમમાં મૂકી નથી, મેં તેને અલગથી રાખી છે.