નફો:
- વર્ડ ફ્રીક્વન્સી, કોલોકેશન, શબ્દભંડોળની સમૃદ્ધિ અને આર્ટિફિશિયલ ઇન્ટેલિજન્સવાળા કીવર્ડ્સ જેવા કોર્પસ માપનો ડ્રાફ્ટ કરવાની ક્ષમતા
- એ જાણીને કે કૃત્રિમ બુદ્ધિ ચોક્કસ ગણતરીમાં અવિશ્વસનીય છે અને દરેક ગણતરીને અલગ સાધન વડે ચકાસવામાં સક્ષમ છે
- એ સમજવાની ક્ષમતા કે સંખ્યા પોતાની મેળે કંઈપણ કહેતી નથી અને ભાષાકીય અર્થઘટન જે અર્થ પ્રસ્થાપિત કરે છે તે મનુષ્યોની છે.
સાહિત્ય અને ભાષાનો અભ્યાસ માત્ર "કોમેન્ટરી" નથી; તેની પાસે માપી શકાય તેવું અને ગણી શકાય તેવું પાસું પણ છે. લેખક કેટલા અલગ-અલગ શબ્દો વાપરે છે, તે કયા શબ્દો સાથે કયા શબ્દોનો ઉપયોગ કરવાનું પસંદ કરે છે, કયા શબ્દો એક સમયગાળામાં સામાન્ય બને છે - આની તપાસ ભાષાશાસ્ત્ર દ્વારા કરવામાં આવે છે (વિજ્ઞાન જે ભાષાના અવાજ, બંધારણ, અર્થ અને ઉપયોગનો અભ્યાસ કરે છે) અને ખાસ કરીને કોર્પસ ભાષાશાસ્ત્ર. કોર્પસ એ ગ્રંથોનો સંગ્રહ છે, જેમ કે લેખકની સંપૂર્ણ કૃતિઓ, અખબારનું વાર્ષિક આર્કાઇવ અથવા સમયગાળાની કવિતાઓ. કોર્પસ વિશ્લેષણ આ હિસ્સામાં સંખ્યાત્મક પેટર્ન માટે જુએ છે.
આ એકમમાં, અમે કોર્પસ વિશ્લેષણ સહાયક તરીકે AI નો ઉપયોગ કરવાનું શીખીશું: ઝડપથી મેટ્રિક્સ કાઢવા જેમ કે શબ્દ આવર્તન (ટેક્સ્ટમાં શબ્દ કેટલી વખત આવે છે તે સંખ્યા), કોલોકેશન (શબ્દ જોડી જે વારંવાર એકસાથે થાય છે, દા.ત. "કાળો" + "મારું નસીબ"), શબ્દભંડોળ સમૃદ્ધિ અને મોસમી વિવિધતા. પરંતુ શરૂઆતથી એક ચેતવણી: AI એકલા ગણતરી કરતી વખતે ભૂલો કરી શકે છે; મોટી અને ચોક્કસ ગણતરીઓ માટે વિશેષ સાધનોની જરૂર છે, અને તમે ભાષાશાસ્ત્રી છો જે દરેક સંખ્યાનો અર્થ સ્થાપિત કરે છે.
કોર્પસ એનાલિસિસમાં AI ક્યાં મજબૂત છે અને ક્યાં નબળું છે?
તેની શક્તિઓ છે: નાના અને મધ્યમ ગ્રંથોમાં પેટર્નને ઓળખવી, ટેક્સ્ટની શબ્દભંડોળ વિશે પૂર્વધારણાઓ બનાવવી, કોલોકેશન માટે ઉમેદવારો સૂચવવા, પરિણામનું અર્થઘટન કરવું, પદ્ધતિનું વર્ણન કરવું. AI પૂછે છે "આ લેખકમાં કયા શબ્દસમૂહો અલગ છે?" તે પ્રશ્નની ઝડપી શરૂઆત આપે છે.
નબળાઈ: ચોક્કસ ગણતરી. AI એ ભાષાનું મોડેલ છે, કેલ્ક્યુલેટર નથી; લાંબા લખાણમાં "કેટલી વખત થયું છે" પ્રશ્નનો અંદાજિત અને ક્યારેક ખોટો જવાબ આપી શકે છે. ચોક્કસ આવર્તન, ચોક્કસ કોલોકેશન આંકડાઓ અથવા હજારો શબ્દોના મોટા કોર્પસ સ્કેનિંગ માટે, વિશિષ્ટ સોફ્ટવેર (દા.ત. કોર્પસ ટૂલ્સ જેમ કે AntConc અથવા સ્પ્રેડશીટ) નો ઉપયોગ થાય છે. AI આ સાધનોના આઉટપુટનું અર્થઘટન કરવામાં મૂલ્યવાન છે; પરંતુ તેને આંધળી રીતે કાચી ગણતરી કરવા ન દો.
ટીપ: જો તમને ચોક્કસ સંખ્યાની જરૂર હોય, તો બે રીતોનો ઉપયોગ કરો: નાના ટેક્સ્ટમાં ગણતરી કરવા માટે એક સાધન કહો અને AI દ્વારા તેનું અર્થઘટન કરો; અથવા AI કાઉન્ટ રાખો અને તેને બીજી રીતે વેરિફાય કરો. "એઆઈએ કહ્યું તે 47 વખત થાય છે" વાક્યનો ઉપયોગ પુષ્ટિ વિના ક્યારેય કરશો નહીં.
એક પગલું દ્વારા પગલું કોર્પસ અભ્યાસ
- એક પ્રશ્ન મૂકો. "આ કવિમાં રંગીન શબ્દો કેવી રીતે વહેંચાય છે?" સ્પષ્ટ પ્રશ્ન વિના ગણતરી અર્થહીન છે જેમ કે:
- કોર્પસ વ્યાખ્યાયિત કરો. કયા ગ્રંથો? કઈ આવૃત્તિ? કયો સમયગાળો? સરહદ સ્પષ્ટ હોવી જોઈએ.
- માપ પસંદ કરો. આવર્તન, સંકલન, શબ્દભંડોળની સમૃદ્ધિ?
- માપો અને ચકાસો. ગણતરી કરો, પછી બીજી રીતની પુષ્ટિ કરો.
- ટિપ્પણી. એકલો નંબર કંઈ કહેતો નથી; તે તમારી ટિપ્પણી છે જે શોધને "બીજા સમયગાળામાં રંગીન શબ્દો બમણી" અર્થપૂર્ણ બનાવે છે.
શબ્દભંડોળની સમૃદ્ધિનું વારંવાર વપરાતું માપ એ વિવિધ શબ્દોની સંખ્યા અને શબ્દોની કુલ સંખ્યા (ટાઈપ/ટોકન રેશિયો)નો ગુણોત્તર છે. જો આ ગુણોત્તર વધારે છે, તો ટેક્સ્ટ શબ્દ-વિવિધ છે, અને જો તે ઓછો છે, તો તેનો અર્થ એ છે કે તે પુનરાવર્તિત છે. પરંતુ આ ગુણોત્તર ટેક્સ્ટની લંબાઈથી પ્રભાવિત થાય છે; ટૂંકા અને લાંબા ગ્રંથોની સીધી સરખામણી કરતી વખતે સાવચેત રહો.
ત્રણ નાના કેસો
કેસ 1 - કોલોકેશન એક શૈલી દર્શાવે છે. એક સંશોધકે નવલકથાકારની 3 નવલકથાઓમાં વિશેષણ-સંજ્ઞાની જોડીની તપાસ કરી. AI એ સૂચવ્યું કે શબ્દ "નિસ્તેજ" 5 વિવિધ સંજ્ઞાઓ સાથે મેળ ખાય છે; સંશોધકે 4 ગ્રંથોની ચકાસણી કરી અને 1ને બનાવટી તરીકે કાઢી નાખ્યો. પુષ્ટિ થયેલ પેટર્ન લેખકની વર્ણનાત્મક શૈલી વિશે થીસીસ નિવેદન બની ગઈ.
કેસ 2 — ગણતરીની ભૂલ પકડાઈ. એક વિદ્યાર્થીએ એઆઈને પૂછ્યું કે 2,000-શબ્દના ટેક્સ્ટમાં "રાત" શબ્દ કેટલી વાર દેખાયો છે; એઆઈએ "23" કહ્યું. જ્યારે વિદ્યાર્થીએ ટેક્સ્ટને સ્પ્રેડશીટમાં નાખ્યો અને તેની ગણતરી કરી, ત્યારે વાસ્તવિક સંખ્યા 17 હતી. તે સ્પષ્ટ થઈ ગયું છે કે AI ની કાચી ગણતરી અવિશ્વસનીય છે.
કેસ 3 - સમયાંતરે ફેરફારથી વિવાદ થયો. એક જૂથે કવિની પ્રારંભિક અને અંતમાં કવિતાઓમાં અમૂર્ત શબ્દોના પ્રમાણની તુલના કરી. AI ના પ્રથમ ડ્રાફ્ટે એક વલણ સૂચવ્યું; જ્યારે જૂથ ટેક્સ્ટ પર પાછો ગયો અને ગણતરીની ચકાસણી કરી, ત્યારે વલણ વાસ્તવિક હોવાનું બહાર આવ્યું, પરંતુ AI દ્વારા સૂચવવામાં આવેલા "કારણો" અચકાસવા યોગ્ય અનુમાન હતા અને તેને દૂર કરવામાં આવ્યા હતા.
ચાર નકલ કરી શકાય તેવા નમૂનાઓ
1) શબ્દ આવર્તન રૂપરેખા (ચકાસણી સાથે):
નીચેના લખાણમાં 15 સૌથી વધુ વારંવાર બનતા સામગ્રી શબ્દોની સૂચિ બનાવો (જેમ કે સંયોજકો અને પૂર્વસર્જકોને બાકાત રાખો), તેમની અંદાજિત આવર્તન સાથે. ચેતવણી: નોંધ કરો કે ગણતરીઓ સચોટ ન પણ હોઈ શકે અને નોંધ કરો "સચોટ બનવા માટે, તેઓ અલગ ગણતરી સાધન વડે ચકાસવા જોઈએ." ટેક્સ્ટ: [ટેક્સ્ટ અહીં પેસ્ટ કરો]
2) કોલોકેશન ઉમેદવારો:
નીચેના ટેક્સ્ટમાં વારંવાર એકસાથે થતા શબ્દોની જોડી (કોલોકેશન) સૂચવો. દરેક જોડી માટે ટેક્સ્ટમાંથી ઓછામાં ઓછો એક અવતરણ આપો. ડબલ ફેબ્રિકેશન કે જે ટેક્સ્ટમાં કોઈ સમકક્ષ નથી; જો તમને ખાતરી ન હોય, તો તેને "ચકાસણીની જરૂર છે" તરીકે ચિહ્નિત કરો. ટેક્સ્ટ: [ટેક્સ્ટ પેસ્ટ કરો]
3) શબ્દભંડોળ સરખામણી:
હું તમને બે પાઠો આપીશ. દરેક માટે: અંદાજિત કુલ શબ્દો, વિવિધ શબ્દોની જાતો વિશે અવલોકનો અને અગ્રણી શબ્દ ડોમેન્સ (દા.ત. રંગ, પ્રકૃતિ, લાગણી). જણાવો કે સંખ્યાઓ અંદાજિત છે. મારી ચકાસણી સાથે સરખામણીનું અર્થઘટન છોડો. ટેક્સ્ટ A: [...] ટેક્સ્ટ B: [...]
4) પરિણામ અર્થઘટન:
મને ગણતરી ટૂલમાંથી નીચેના પરિણામો મળ્યા: [પરિણામો પેસ્ટ કરો]. આ સંખ્યાઓનો ભાષાકીય રીતે શું અર્થ થઈ શકે તે વિશે 2-3 પૂર્વધારણાઓ બનાવો. દરેક પૂર્વધારણાને "પુરાવાની જરૂર છે" તરીકે ચિહ્નિત કરો અને મને કહો કે હું તેનું પરીક્ષણ કેવી રીતે કરી શકું. વધુ પડતી ટિપ્પણીઓ ટાળો.
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા: "આ લખાણમાં કયો શબ્દ સૌથી વધુ જોવા મળે છે?"
સશક્ત: "આ ટેક્સ્ટમાં સૌથી વધુ વારંવાર આવતા સામગ્રી શબ્દોને તેમની અંદાજિત આવર્તન સાથે સૂચિબદ્ધ કરો; કાર્ય શબ્દોને બાકાત રાખો. તે સ્પષ્ટ કરો કે સંખ્યાઓ ચોક્કસ નથી અને તેને એક અલગ સાધનથી ચકાસવાની જરૂર છે. દરેક શબ્દ માટે એક ઉદાહરણ વાક્ય આપો."
શક્તિશાળી પ્રોમ્પ્ટ એઆઈને ગણતરી મર્યાદા સ્વીકારવા માટે બનાવે છે અને તમને અગાઉથી કહે છે કે ચકાસણી જરૂરી છે. નબળા પ્રોમ્પ્ટમાં, AI એક નંબર આપે છે અને તમે જાણતા નથી કે તે ખોટું હોઈ શકે છે.
માપન અને વિશ્વસનીયતા કોષ્ટક
માપ
શું બતાવે છે
એકલા AI
સાચો રસ્તો
શબ્દ આવર્તન
વારંવારના શબ્દો
વિશે, જોખમી
કાઉન્ટર + એઆઈ કોમેન્ટરી
સંકલન
જેઓ એક સાથે પસાર થયા
ઉમેદવારો પેદા કરે છે
ટેક્સ્ટમાંથી પુષ્ટિ
પ્રકાર/ટોકન રેશિયો
મૌખિક વિવિધતા
ભ્રામક બની શકે છે
સાધન સાથે એકાઉન્ટ
મોસમી ફેરફાર
સમય જતાં વલણ
પૂર્વધારણાઓ પેદા કરે છે
માપો અને ચકાસો
નિષ્કર્ષની ટિપ્પણી
અર્થ
શક્તિશાળી પરંતુ અતિશયોક્તિ
માનવ ચુકાદો
કીવર્ડ અને એન-ગ્રામ ખ્યાલો
કોર્પસ એનાલિસિસમાં બે ખ્યાલો તમારા કામને સરળ બનાવે છે. પ્રથમ કીવર્ડ છે (અંગ્રેજીમાં કીવર્ડ - શબ્દ કે જે ટેક્સ્ટ અથવા લેખકમાં સામાન્ય ભાષાની તુલનામાં અપેક્ષા કરતા ઘણી વાર જોવા મળે છે, જે તે ટેક્સ્ટને તેનું "અક્ષર" આપે છે). લેખકના કીવર્ડ્સ તેની રુચિઓ અને શૈલી દર્શાવે છે; ઉદાહરણ તરીકે, જો "સમુદ્ર" અને "અલગ" કવિમાં અપેક્ષા કરતા વધુ વાર થાય છે, તો આ આંકડાકીય પ્રસરણ અર્થઘટન માટે પ્રારંભિક બિંદુ બની જાય છે. કીવર્ડ્સને ઓળખવા માટે, ટેક્સ્ટની ફ્રીક્વન્સીઝની રેફરન્સ કોર્પસની ફ્રીક્વન્સીઝ સાથે સરખામણી કરવી જરૂરી છે (સરખામણી માટે વપરાયેલ ટેક્સ્ટનો સામાન્ય, મોટો ભાગ); આ સરખામણી એક નિશ્ચિત સાધન કાર્ય છે, તે એક ગણતરી છે જે AI તેના પોતાના પર વિશ્વસનીય રીતે કરી શકતું નથી.
બીજો n-ગ્રામ છે (ટેક્સ્ટમાં n સળંગ શબ્દોનો ક્રમ; બે શબ્દોના ક્રમને "બિગ્રામ" કહેવામાં આવે છે, ત્રણ શબ્દોના ક્રમને "ટ્રિગ્રામ" કહેવામાં આવે છે). એન-ગ્રામ વિશ્લેષણ લેખકના સૂત્રિક અભિવ્યક્તિઓ અને વારંવાર વપરાતા શબ્દસમૂહો દર્શાવે છે. ઉદાહરણ તરીકે, જો કોઈ લેખક "પ્રકારનો" અથવા "જો કે" જેવા શબ્દસમૂહોનો વારંવાર ઉપયોગ કરે છે, તો આ તેની વાક્યો બનાવવાની ટેવ દર્શાવે છે. AI ઉમેદવારો તરીકે આ શબ્દસમૂહો સૂચવી શકે છે; પરંતુ સાચી આવર્તન અને આંકડાકીય મહત્વ માટે ગણતરી સાધન પર પાછા આવવું જરૂરી છે.
સંકેત: AI ને કહો, "ઉમેદવારો તરીકે આ ટેક્સ્ટમાં નોંધપાત્ર શબ્દસમૂહો (બે અથવા ત્રણ શબ્દો) ની સૂચિ બનાવો અને દરેક માટે ટેક્સ્ટમાંથી ઉદાહરણ આપો." ઉમેદવારોની સૂચિ લો અને એક અલગ સાધન વડે વાસ્તવિક આવર્તનને માપો. AI ને “નોટિસર” તરીકે, એજન્ટને “કાઉન્ટર” તરીકે અને તમારી જાતને “દુભાષિયા” તરીકે સ્થાન આપો.
સામાન્ય ભૂલો
- AI ની કાચી ગણતરી પર આધાર રાખવો. AI એ કેલ્ક્યુલેટર નથી; અલગ ટૂલ દ્વારા ચોક્કસ નંબર ચકાસો.
- ટિપ્પણી વિના નંબર રજૂ કરી રહ્યા છીએ. "47 વખત પાસ" કંઈ કહેતું નથી; તમે અર્થ બનાવો.
- ટેક્સ્ટની લંબાઈને અવગણી. ગીતની વિવિધતા દર લંબાઈ સંવેદનશીલ હોય છે.
- કોલોકેશનની ચકાસણી કર્યા વિના થીસીસ બનાવવી. નોન-એઆઈ યુગલો સૂચવી શકે છે; ટેક્સ્ટમાંથી પુષ્ટિ કરો.
- આત્યંતિક ટિપ્પણી. AI દ્વારા સૂચવેલા "કારણો"ને પુરાવા વિના સ્વીકારશો નહીં.
સારાંશમાં
કોર્પસ વિશ્લેષણ સાહિત્યના ગણનાપાત્ર પાસાને ખોલે છે: આવર્તન, સંકલન, શબ્દભંડોળ, સામયિક પરિવર્તન. AI આ ક્ષેત્રમાં પેટર્નને ઓળખવામાં અને પરિણામોનું અર્થઘટન કરવામાં શક્તિશાળી છે; પરંતુ તે સંપૂર્ણ ગણતરીમાં અવિશ્વસનીય છે. અલગ ટૂલ વડે નંબર ચકાસો, ટેક્સ્ટમાંથી કોલોકેશન કન્ફર્મ કરો અને દરેક નંબરનો અર્થ જાતે જ સ્થાપિત કરો. સંખ્યા એ પુરાવા નથી, એ પુરાવાનો દરવાજો છે.
એપ્લિકેશન કાર્ય
ટૂંકું લખાણ (500-1000 શબ્દો) પસંદ કરો. સામગ્રી શબ્દ ઓળખો (દા.ત. "રાત" અથવા "રસ્તા"). પ્રથમ, તમારી જાતને ટેક્સ્ટમાં ગણો. પછી એઆઈને તેની ગણતરી કરો. બે પરિણામોની તુલના કરો; જો કોઈ તફાવત હોય, તો કારણ તપાસો. પછી ટેક્સ્ટમાં તે શબ્દના કાર્ય પર એક ફકરાની ટિપ્પણી લખો - સંખ્યાને અર્થમાં ફેરવો.
ચેકલિસ્ટ
- [ ] મેં સ્પષ્ટ ભાષાકીય પ્રશ્ન મૂક્યો છે.
- [ ] મેં કોર્પસ (ટેક્સ્ટ, એડિશન, પીરિયડ) ની સીમાઓ વ્યાખ્યાયિત કરી.
- [ ] મેં AI ની ગણતરી બીજી રીતે ચકાસી.
- [ ] મેં ટેક્સ્ટમાંથી કોલોકેશનની પુષ્ટિ કરી.
- [ ] મેં ટિપ્પણી કર્યા વિના નંબર છોડ્યો નથી; અર્થ મેં જાતે બનાવ્યો છે.