യൂണിറ്റുകൾ
1. തുർക്കി ഭാഷയിലും സാഹിത്യത്തിലും ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിൻ്റെ ആമുഖം: റോളുകൾ, അതിരുകൾ, സ്ഥിരീകരണം, ആധികാരികത, ധാർമ്മികത 2. ടെക്സ്റ്റ് വിശകലനവും അടുത്ത വായനയും: AI ഉപയോഗിച്ച് കവിത, ചെറുകഥ, നോവൽ എന്നിവ വിശകലനം ചെയ്യുന്നു 3. ഭാഷാശാസ്ത്രവും കോർപ്പസ് വിശകലനവും: അക്കങ്ങൾക്കൊപ്പം പദാവലി വായിക്കുന്നു 4. പുരാതന ഗ്രന്ഥങ്ങൾ, ലളിതവൽക്കരണം, ലിപ്യന്തരണം: ഓട്ടോമൻ, ദിവാൻ ഗ്രന്ഥങ്ങൾക്കൊപ്പം പ്രവർത്തിക്കുന്നു 5. കോഴ്‌സ് മെറ്റീരിയലുകളും ഇൻസ്ട്രക്ഷണൽ ഡിസൈനും: ഫലം, ഫലപ്രാപ്തി, അളവ് 6. സാഹിത്യ ചരിത്രവും ഗവേഷണവും: സാഹിത്യ അവലോകനം, സമന്വയം, സ്ഥിരീകരണം 7. എഡിറ്റിംഗ്, പ്രൂഫ് റീഡിംഗ്, ടൈപ്പ് സെറ്റിംഗ്: പ്രസിദ്ധീകരണത്തിനായി ടെക്സ്റ്റ് തയ്യാറാക്കൽ 8. ക്രിയേറ്റീവ് റൈറ്റിംഗിലും പ്രൊഡക്ഷനിലും ഹ്യൂമൻ-എഐ സഹകരണം 9. ഒറിജിനാലിറ്റി, കോപ്പിയടി, AI ഉപയോഗിച്ച് എഴുതിയ വാചകങ്ങൾ എന്നിവ വിലയിരുത്തുന്നു 10. ഉറവിട പരിശോധന, ഹാലൂസിനേഷൻ, ആട്രിബ്യൂഷൻ അച്ചടക്കം 11. സാഹിത്യ വ്യാഖ്യാനത്തിൽ മനുഷ്യൻ: സൗന്ദര്യാത്മക വിധി, ധാർമ്മികത, രഹസ്യാത്മകത, അതിരുകൾ
യൂണിറ്റ് 3 / 11

ഭാഷാശാസ്ത്രവും കോർപ്പസ് വിശകലനവും: അക്കങ്ങൾക്കൊപ്പം പദാവലി വായിക്കുന്നു

നേട്ടങ്ങൾ:

  • ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഉപയോഗിച്ച് വേഡ് ഫ്രീക്വൻസി, ക്ലോക്കേഷൻ, പദാവലി സമ്പന്നത, കീവേഡുകൾ എന്നിവ പോലുള്ള കോർപ്പസ് അളവുകൾ ഡ്രാഫ്റ്റ് ചെയ്യാനുള്ള കഴിവ്
  • കൃത്യമായ കൗണ്ടിംഗിൽ കൃത്രിമബുദ്ധി വിശ്വസനീയമല്ലെന്ന് അറിയുകയും ഓരോ കണക്കും പ്രത്യേക ഉപകരണം ഉപയോഗിച്ച് പരിശോധിക്കാൻ കഴിയുകയും ചെയ്യുന്നു
  • ഒരു സംഖ്യ സ്വന്തമായി ഒന്നും പറയുന്നില്ലെന്നും അർത്ഥം സ്ഥാപിക്കുന്ന ഭാഷാപരമായ വ്യാഖ്യാനം മനുഷ്യരുടേതാണെന്നും മനസ്സിലാക്കാനുള്ള കഴിവ്.

സാഹിത്യവും ഭാഷാപഠനവും "വ്യാഖ്യാനം" മാത്രമല്ല; ഇതിന് അളക്കാവുന്നതും കണക്കാക്കാവുന്നതുമായ ഒരു വശമുണ്ട്. ഒരു രചയിതാവ് എത്ര വ്യത്യസ്‌തമായ വാക്കുകൾ ഉപയോഗിക്കുന്നു, ഏതൊക്കെ വാക്കുകളോടൊപ്പം ഉപയോഗിക്കാൻ അവൻ ഇഷ്ടപ്പെടുന്നു, ഏത് പദങ്ങൾ ഒരു കാലഘട്ടത്തിൽ സാധാരണമായി മാറുന്നു - ഇവ ഭാഷാശാസ്ത്രം (ഭാഷയുടെ ശബ്ദം, ഘടന, അർത്ഥം, ഉപയോഗം എന്നിവ പഠിക്കുന്ന ശാസ്ത്രം), പ്രത്യേകിച്ച് കോർപ്പസ് ഭാഷാശാസ്ത്രം എന്നിവയിലൂടെ അന്വേഷിക്കുന്നു. ഒരു എഴുത്തുകാരൻ്റെ സമ്പൂർണ്ണ കൃതികൾ, ഒരു പത്രത്തിൻ്റെ വാർഷിക ആർക്കൈവ് അല്ലെങ്കിൽ ഒരു കാലഘട്ടത്തിലെ കവിതകൾ എന്നിങ്ങനെയുള്ള പാഠങ്ങളുടെ ഒരു ശേഖരമാണ് കോർപ്പസ്. കോർപ്പസ് വിശകലനം ഈ ഭാഗത്തിലെ സംഖ്യാ പാറ്റേണുകൾക്കായി തിരയുന്നു.

ഈ യൂണിറ്റിൽ, ഒരു കോർപ്പസ് അനാലിസിസ് അസിസ്റ്റൻ്റായി ഞങ്ങൾ AI ഉപയോഗിക്കാൻ പഠിക്കും: പദ ആവൃത്തി (ടെക്‌സ്റ്റിൽ ഒരു വാക്ക് എത്ര തവണ വരുന്നുവെന്നത്), കോലോക്കേഷൻ (പലപ്പോഴും ഒരുമിച്ച് സംഭവിക്കുന്ന പദ ജോഡികൾ, ഉദാ: "കറുപ്പ്" + "എൻ്റെ ഭാഗ്യം"), പദാവലി സമ്പന്നത, കാലാനുസൃതമായ വ്യതിയാനം തുടങ്ങിയ മെട്രിക്‌സ് വേഗത്തിൽ വേർതിരിച്ചെടുക്കുന്നു. എന്നാൽ തുടക്കം മുതൽ ഒരു മുന്നറിയിപ്പ്: ഒറ്റയ്ക്ക് എണ്ണുമ്പോൾ AI-ക്ക് തെറ്റുകൾ സംഭവിക്കാം; വലുതും കൃത്യവുമായ എണ്ണത്തിന് പ്രത്യേക ഉപകരണങ്ങൾ ആവശ്യമാണ്, ഓരോ സംഖ്യയുടെയും അർത്ഥം സ്ഥാപിക്കുന്ന ഭാഷാശാസ്ത്രജ്ഞൻ നിങ്ങളാണ്.

AI ശക്തവും കോർപ്പസ് വിശകലനത്തിൽ എവിടെ ദുർബലവുമാണ്?

ഇതിൻ്റെ ശക്തികൾ ഇവയാണ്: ചെറുതും ഇടത്തരവുമായ ഗ്രന്ഥങ്ങളിലെ പാറ്റേണുകൾ തിരിച്ചറിയൽ, ഒരു വാചകത്തിൻ്റെ പദാവലിയെക്കുറിച്ചുള്ള അനുമാനങ്ങൾ സൃഷ്ടിക്കൽ, കോൾക്കേഷനുകൾക്കായി ഉദ്യോഗാർത്ഥികളെ നിർദ്ദേശിക്കുക, ഫലം വ്യാഖ്യാനിക്കുക, ഒരു രീതിശാസ്ത്രം വിവരിക്കുക. AI ചോദിക്കുന്നു, “ഈ രചയിതാവിൽ എന്ത് വാക്യങ്ങളാണ് വേറിട്ടുനിൽക്കുന്നത്?” ഇത് ചോദ്യത്തിന് പെട്ടെന്ന് തുടക്കം നൽകുന്നു.

ബലഹീനത: കൃത്യമായ എണ്ണൽ. AI ഒരു ഭാഷാ മാതൃകയാണ്, ഒരു കാൽക്കുലേറ്ററല്ല; ഒരു നീണ്ട വാചകത്തിൽ "എത്ര തവണ സംഭവിച്ചു" എന്ന ചോദ്യത്തിന് ഏകദേശവും ചിലപ്പോൾ തെറ്റായതുമായ ഉത്തരം നൽകാൻ കഴിയും. കൃത്യമായ ആവൃത്തി, കൃത്യമായ ലൊക്കേഷൻ സ്ഥിതിവിവരക്കണക്കുകൾ അല്ലെങ്കിൽ ആയിരക്കണക്കിന് വാക്കുകളുടെ വലിയ കോർപ്പസ് സ്കാനിംഗ് എന്നിവയ്ക്കായി, പ്രത്യേക സോഫ്‌റ്റ്‌വെയർ (ഉദാ. AntConc അല്ലെങ്കിൽ ഒരു സ്‌പ്രെഡ്‌ഷീറ്റ് പോലുള്ള കോർപ്പസ് ടൂളുകൾ) ഉപയോഗിക്കുന്നു. ഈ ഉപകരണങ്ങളുടെ ഔട്ട്പുട്ട് വ്യാഖ്യാനിക്കുന്നതിൽ AI വിലപ്പെട്ടതാണ്; പക്ഷേ അവനെ അന്ധമായി റോ കൗണ്ട് ചെയ്യാൻ പ്രേരിപ്പിക്കരുത്.

നുറുങ്ങ്: നിങ്ങൾക്ക് കൃത്യമായ ഒരു നമ്പർ ആവശ്യമുണ്ടെങ്കിൽ, രണ്ട് വഴികൾ ഉപയോഗിക്കുക: ചെറിയ ടെക്‌സ്‌റ്റിൽ കൗണ്ടിംഗ് ചെയ്യാൻ ഒരു ഉപകരണം ഉണ്ടായിരിക്കുകയും അത് AI വ്യാഖ്യാനിക്കുകയും ചെയ്യുക; അല്ലെങ്കിൽ AI എണ്ണം എടുത്ത് മറ്റൊരു രീതിയിൽ പരിശോധിച്ചുറപ്പിക്കുക. സ്ഥിരീകരണമില്ലാതെ "AI പറഞ്ഞു ഇത് 47 തവണ സംഭവിക്കുന്നു" എന്ന വാചകം ഒരിക്കലും ഉപയോഗിക്കരുത്.

ഒരു ഘട്ടം ഘട്ടമായുള്ള കോർപ്പസ് പഠനം

  1. ഒരു ചോദ്യം ഇടുക. "ഈ കവിയിൽ വർണ്ണ വാക്കുകൾ എങ്ങനെയാണ് വിതരണം ചെയ്യുന്നത്?" ഇതുപോലുള്ള വ്യക്തമായ ചോദ്യമില്ലാതെ എണ്ണുന്നത് അർത്ഥശൂന്യമാണ്:
  2. കോർപ്പസ് നിർവചിക്കുക. ഏത് വാചകങ്ങൾ? ഏത് പതിപ്പാണ്? ഏത് കാലഘട്ടം? അതിർത്തി വ്യക്തമായിരിക്കണം.
  3. അളവ് തിരഞ്ഞെടുക്കുക. ആവൃത്തി, കൂട്ടിയിടി, പദസമ്പത്തിൻ്റെ സമ്പന്നത?
  4. അളക്കുക, പരിശോധിക്കുക. എണ്ണം ഉണ്ടാക്കുക, തുടർന്ന് രണ്ടാമത്തെ വഴി സ്ഥിരീകരിക്കുക.
  5. അഭിപ്രായം. നമ്പർ മാത്രം ഒന്നും പറയുന്നില്ല; "രണ്ടാം കാലഘട്ടത്തിൽ നിറമുള്ള വാക്കുകൾ ഇരട്ടിയായി" എന്ന കണ്ടെത്തലിനെ അർത്ഥവത്താക്കുന്നത് താങ്കളുടെ കമൻ്റാണ്.

പദാവലി സമ്പുഷ്ടതയുടെ പതിവായി ഉപയോഗിക്കുന്ന അളവുകോൽ, വ്യത്യസ്ത പദങ്ങളുടെ എണ്ണവും പദങ്ങളുടെ ആകെ എണ്ണവുമായുള്ള അനുപാതമാണ് (തരം/ടോക്കൺ അനുപാതം). ഈ അനുപാതം ഉയർന്നതാണെങ്കിൽ, വാചകം പദ-വൈവിധ്യമാണ്, അത് കുറവാണെങ്കിൽ, അത് ആവർത്തനമാണ്. എന്നാൽ ഈ അനുപാതം ടെക്സ്റ്റ് ദൈർഘ്യത്തെ ബാധിക്കുന്നു; ഹ്രസ്വവും ദീർഘവുമായ വാചകങ്ങൾ നേരിട്ട് താരതമ്യം ചെയ്യുമ്പോൾ ശ്രദ്ധിക്കുക.

മൂന്ന് മിനി കേസുകൾ

കേസ് 1 - ശേഖരണം ഒരു ശൈലി പ്രദർശിപ്പിച്ചു. ഒരു ഗവേഷകൻ ഒരു നോവലിസ്റ്റിൻ്റെ 3 നോവലുകളിലെ നാമവിശേഷണ-നാമ ജോടികൾ പരിശോധിച്ചു. "പേൾ" എന്ന വാക്ക് 5 വ്യത്യസ്ത നാമങ്ങളുമായി പൊരുത്തപ്പെടുന്നതായി AI നിർദ്ദേശിച്ചു; ഗവേഷകൻ 4 ഗ്രന്ഥങ്ങൾ പരിശോധിച്ചു, 1 കെട്ടിച്ചമച്ചതാണെന്ന് ഒഴിവാക്കി. സ്ഥിരീകരിച്ച പാറ്റേൺ രചയിതാവിൻ്റെ വിവരണാത്മക ശൈലിയെക്കുറിച്ചുള്ള ഒരു തീസിസ് പ്രസ്താവനയായി മാറി.

കേസ് 2 - കൗണ്ടിംഗ് പിശക് പിടികൂടി. 2,000 വാക്കുകളുള്ള ഒരു വാചകത്തിൽ "രാത്രി" എന്ന വാക്ക് എത്ര തവണ പ്രത്യക്ഷപ്പെട്ടുവെന്ന് ഒരു വിദ്യാർത്ഥി AI-യോട് ചോദിച്ചു; AI പറഞ്ഞു "23". വിദ്യാർത്ഥി ഒരു സ്‌പ്രെഡ്‌ഷീറ്റിലേക്ക് ടെക്‌സ്‌റ്റ് എറിഞ്ഞ് അത് എണ്ണിയപ്പോൾ, യഥാർത്ഥ നമ്പർ 17 ആയിരുന്നു. AI-യുടെ റോ കൗണ്ട് വിശ്വസനീയമല്ലെന്ന് വ്യക്തമായി.

കേസ് 3 - കാലാനുസൃതമായ മാറ്റം വിവാദത്തിന് കാരണമായി. ഒരു കൂട്ടർ കവിയുടെ ആദ്യകാല കവിതകളിലെ അമൂർത്ത പദങ്ങളുടെ അനുപാതം താരതമ്യം ചെയ്തു. AI-യുടെ ആദ്യ ഡ്രാഫ്റ്റ് ഒരു പ്രവണത നിർദ്ദേശിച്ചു; ഗ്രൂപ്പ് ടെക്‌സ്‌റ്റിലേക്ക് തിരികെ പോയി എണ്ണം പരിശോധിച്ചപ്പോൾ, ട്രെൻഡ് യഥാർത്ഥമാണെന്ന് തെളിഞ്ഞു, പക്ഷേ AI നിർദ്ദേശിച്ച "കാരണങ്ങൾ" സ്ഥിരീകരിക്കാനാകാത്ത ഊഹാപോഹങ്ങളായിരുന്നു, അവ ഇല്ലാതാക്കി.

പകർത്താവുന്ന നാല് ടെംപ്ലേറ്റുകൾ

1) വേഡ് ഫ്രീക്വൻസി ഔട്ട്‌ലൈൻ (പരിശോധിച്ചുറപ്പിക്കലിനൊപ്പം):

താഴെയുള്ള ടെക്‌സ്‌റ്റിൽ ഏറ്റവും പതിവായി സംഭവിക്കുന്ന 15 ഉള്ളടക്ക പദങ്ങൾ (സംയോജനങ്ങളും പ്രീപോസിഷനുകളും പോലുള്ള ഫംഗ്‌ഷൻ പദങ്ങൾ ഒഴിവാക്കുക) അവയുടെ ഏകദേശ ആവൃത്തികൾക്കൊപ്പം ലിസ്റ്റ് ചെയ്യുക. മുന്നറിയിപ്പ്: കണക്കുകൾ കൃത്യമാകണമെന്നില്ല എന്നതും ശ്രദ്ധിക്കുക "കൃത്യമായിരിക്കണമെങ്കിൽ, അവ ഒരു പ്രത്യേക കൗണ്ടിംഗ് ടൂൾ ഉപയോഗിച്ച് പരിശോധിച്ചിരിക്കണം." വാചകം: [വാചകം ഇവിടെ ഒട്ടിക്കുക]

2) ലൊക്കേഷൻ സ്ഥാനാർത്ഥികൾ:

ചുവടെയുള്ള ടെക്‌സ്‌റ്റിൽ ഇടയ്‌ക്കിടെ ഒരുമിച്ച് സംഭവിക്കുന്ന ജോഡി പദങ്ങൾ (കൊളോക്കേഷനുകൾ) നിർദ്ദേശിക്കുക. ഓരോ ജോഡിക്കും വാചകത്തിൽ നിന്ന് ഒരു ഉദ്ധരണിയെങ്കിലും നൽകുക. വാചകത്തിൽ തുല്യതയില്ലാത്ത ഇരട്ട ഫാബ്രിക്കേഷൻ; നിങ്ങൾക്ക് ഉറപ്പില്ലെങ്കിൽ, "പരിശോധന ആവശ്യമുണ്ട്" എന്ന് അടയാളപ്പെടുത്തുക. വാചകം: [വാചകം ഒട്ടിക്കുക]

3) പദാവലി താരതമ്യം:

ഞാൻ നിങ്ങൾക്ക് രണ്ട് വാചകങ്ങൾ തരാം. ഓരോന്നിനും: ഏകദേശ ആകെ പദങ്ങൾ, വ്യത്യസ്ത പദ ഇനങ്ങളെക്കുറിച്ചുള്ള നിരീക്ഷണങ്ങൾ, പ്രമുഖ പദ ഡൊമെയ്‌നുകൾ (ഉദാ. നിറം, സ്വഭാവം, വികാരം). സംഖ്യകൾ ഏകദേശമാണെന്ന് പ്രസ്താവിക്കുക. താരതമ്യത്തിൻ്റെ വ്യാഖ്യാനം എൻ്റെ സ്ഥിരീകരണത്തിലേക്ക് വിടുക. ടെക്സ്റ്റ് എ: [...] ടെക്സ്റ്റ് ബി: [...]

4) ഫല വ്യാഖ്യാനം:

ഒരു കൗണ്ടിംഗ് ടൂളിൽ നിന്ന് എനിക്ക് ഇനിപ്പറയുന്ന ഫലങ്ങൾ ലഭിച്ചു: [ഫലങ്ങൾ ഒട്ടിക്കുക]. ഈ സംഖ്യകൾ ഭാഷാപരമായി എന്താണ് അർത്ഥമാക്കുന്നത് എന്നതിനെക്കുറിച്ച് 2-3 അനുമാനങ്ങൾ സൃഷ്ടിക്കുക. ഓരോ സിദ്ധാന്തവും "തെളിവ് ആവശ്യമാണ്" എന്ന് അടയാളപ്പെടുത്തുകയും എനിക്ക് അത് എങ്ങനെ പരിശോധിക്കാമെന്ന് പറയുകയും ചെയ്യുക. അമിതമായ കമൻ്റുകൾ ഒഴിവാക്കുക.

ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്

ദുർബലമായത്: "ഈ വാചകത്തിൽ ഏറ്റവും കൂടുതൽ വരുന്ന വാക്ക് ഏതാണ്?"

ശക്തമായത്: "ഈ ടെക്‌സ്‌റ്റിലെ ഏറ്റവും സാധാരണമായ ഉള്ളടക്ക പദങ്ങൾ അവയുടെ ഏകദേശ ആവൃത്തിയിൽ ലിസ്റ്റുചെയ്യുക; ഫംഗ്‌ഷൻ വാക്കുകൾ ഒഴിവാക്കുക. അക്കങ്ങൾ കൃത്യമല്ലെന്നും ഒരു പ്രത്യേക ഉപകരണം ഉപയോഗിച്ച് പരിശോധിക്കേണ്ടതുണ്ടെന്നും വ്യക്തമാക്കുക. ഓരോ വാക്കിനും ഒരു ഉദാഹരണ വാക്യം നൽകുക."

ശക്തമായ പ്രോംപ്റ്റ്, AI-യെ എണ്ണൽ പരിധി അംഗീകരിക്കുകയും സ്ഥിരീകരണം ആവശ്യമാണെന്ന് മുൻകൂട്ടി അറിയിക്കുകയും ചെയ്യുന്നു. ദുർബലമായ പ്രോംപ്റ്റിൽ, AI ഒരൊറ്റ നമ്പർ നൽകുന്നു, അത് തെറ്റാകുമെന്ന് നിങ്ങൾക്കറിയില്ല.

അളവും വിശ്വാസ്യതയും പട്ടിക

അളവ്

എന്ത് കാണിക്കുന്നു

AI മാത്രം

ശരിയായ വഴി

പദ ആവൃത്തി

പതിവ് വാക്കുകൾ

ഏകദേശം, അപകടകരമായ

കൗണ്ടർ + AI കമൻ്ററി

ലൊക്കേഷൻ

ഒരുമിച്ച് കടന്നുപോയവർ

സ്ഥാനാർത്ഥികളെ ഉത്പാദിപ്പിക്കുന്നു

വാചകത്തിൽ നിന്നുള്ള സ്ഥിരീകരണം

തരം/ടോക്കൺ അനുപാതം

വാക്കാലുള്ള വൈവിധ്യം

തെറ്റിദ്ധരിപ്പിക്കുന്നതാകാം

ഉപകരണം ഉപയോഗിച്ച് അക്കൗണ്ട്

കാലാനുസൃതമായ മാറ്റം

കാലത്തിനനുസരിച്ച് ട്രെൻഡ്

അനുമാനങ്ങൾ സൃഷ്ടിക്കുന്നു

അളക്കുകയും പരിശോധിക്കുകയും ചെയ്യുക

ഉപസംഹാരം

അർത്ഥം

ശക്തവും എന്നാൽ അതിശയോക്തിപരവുമാണ്

മനുഷ്യ വിധി

കീവേഡും എൻ-ഗ്രാം ആശയങ്ങളും

കോർപ്പസ് വിശകലനത്തിൽ രണ്ട് ആശയങ്ങൾ നിങ്ങളുടെ ജോലി എളുപ്പമാക്കുന്നു. ആദ്യത്തേത് കീവേഡ് ആണ് (ഇംഗ്ലീഷിലെ കീവേഡ് - പൊതു ഭാഷയെ അപേക്ഷിച്ച് പ്രതീക്ഷിച്ചതിലും കൂടുതൽ തവണ ഒരു വാചകത്തിലോ രചയിതാവിലോ സംഭവിക്കുന്ന വാക്ക്, ആ വാചകത്തിന് അതിൻ്റെ "പ്രതീകം" നൽകുന്നു). ഒരു രചയിതാവിൻ്റെ കീവേഡുകൾ അവൻ്റെ താൽപ്പര്യങ്ങളും ശൈലിയും വെളിപ്പെടുത്തുന്നു; ഉദാഹരണത്തിന്, "കടൽ", "വിഭജനം" എന്നിവ ഒരു കവിയിൽ പ്രതീക്ഷിച്ചതിലും കൂടുതൽ തവണ സംഭവിക്കുകയാണെങ്കിൽ, ഈ സ്ഥിതിവിവരക്കണക്ക് ഒരു വ്യാഖ്യാനത്തിൻ്റെ ആരംഭ പോയിൻ്റായി മാറുന്നു. കീവേഡുകൾ തിരിച്ചറിയാൻ, ഒരു വാചകത്തിൻ്റെ ആവൃത്തികളെ ഒരു റഫറൻസ് കോർപ്പസിൻ്റെ ആവൃത്തികളുമായി താരതമ്യം ചെയ്യേണ്ടത് ആവശ്യമാണ് (താരതമ്യത്തിനായി ഉപയോഗിക്കുന്ന ഒരു പൊതു, വലിയ വാചകം); ഈ താരതമ്യം ഒരു നിർണായക ഉപകരണ ജോലിയാണ്, ഇത് AI-ക്ക് സ്വന്തമായി വിശ്വസനീയമായി ചെയ്യാൻ കഴിയാത്ത ഒരു കണക്കുകൂട്ടലാണ്.

രണ്ടാമത്തേത് n-gram ആണ് (ഒരു വാചകത്തിലെ n തുടർച്ചയായ പദങ്ങളുടെ ഒരു ശ്രേണി; രണ്ട് പദങ്ങളുടെ ഒരു ശ്രേണിയെ "ബിഗ്രാം" എന്ന് വിളിക്കുന്നു, മൂന്ന് പദങ്ങളുടെ ഒരു ശ്രേണിയെ "ട്രിഗ്രാം" എന്ന് വിളിക്കുന്നു). എൻ-ഗ്രാം വിശകലനം ഒരു രചയിതാവിൻ്റെ സൂത്രവാക്യങ്ങളും പതിവായി ഉപയോഗിക്കുന്ന ശൈലികളും വെളിപ്പെടുത്തുന്നു. ഉദാഹരണത്തിന്, ഒരു എഴുത്തുകാരൻ "തരം" അല്ലെങ്കിൽ "എന്നിരുന്നാലും" പോലുള്ള പദസമുച്ചയങ്ങൾ വളരെ ഇടയ്ക്കിടെ ഉപയോഗിക്കുകയാണെങ്കിൽ, ഇത് വാക്യങ്ങൾ നിർമ്മിക്കുന്ന അവൻ്റെ ശീലത്തെ സൂചിപ്പിക്കുന്നു. AI-ക്ക് ഈ ശൈലികൾ സ്ഥാനാർത്ഥികളായി നിർദ്ദേശിക്കാൻ കഴിയും; എന്നാൽ യഥാർത്ഥ ആവൃത്തിക്കും സ്റ്റാറ്റിസ്റ്റിക്കൽ പ്രാധാന്യത്തിനും കൗണ്ടിംഗ് ടൂളിലേക്ക് മടങ്ങേണ്ടത് ആവശ്യമാണ്.

സൂചന: AI-യോട് പറയുക, "ഈ വാചകത്തിലെ ശ്രദ്ധേയമായ ശൈലികൾ (രണ്ടോ മൂന്നോ വാക്കുകൾ) സ്ഥാനാർത്ഥികളായി പട്ടികപ്പെടുത്തുക, ഓരോന്നിനും വാചകത്തിൽ നിന്ന് ഒരു ഉദാഹരണം നൽകുക." കാൻഡിഡേറ്റ് ലിസ്റ്റ് എടുത്ത് ഒരു പ്രത്യേക ഉപകരണം ഉപയോഗിച്ച് യഥാർത്ഥ ആവൃത്തി അളക്കുക. AI-യെ "നോട്ടീസർ" ആയും ഏജൻ്റിനെ "കൌണ്ടർ" ആയും സ്വയം "വ്യാഖ്യാതാവ്" ആയും സ്ഥാപിക്കുക.

സാധാരണ തെറ്റുകൾ

  • AI-യുടെ അസംസ്‌കൃത എണ്ണത്തെ ആശ്രയിക്കുന്നു. AI ഒരു കാൽക്കുലേറ്ററല്ല; പ്രത്യേക ഉപകരണം ഉപയോഗിച്ച് കൃത്യമായ നമ്പർ പരിശോധിക്കുക.
  • അഭിപ്രായം പറയാതെ നമ്പർ അവതരിപ്പിക്കുന്നു. "47 തവണ പാസായി" ഒന്നും പറയുന്നില്ല; നിങ്ങൾ അർത്ഥം സൃഷ്ടിക്കുന്നു.
  • ടെക്സ്റ്റ് ദൈർഘ്യം അവഗണിക്കുന്നു. ലിറിക് ഡൈവേഴ്‌സിറ്റി നിരക്കുകൾ നീളം സെൻസിറ്റീവ് ആണ്.
  • ഒത്തുചേരൽ പരിശോധിക്കാതെ തീസിസ് ഉണ്ടാക്കുന്നു. AI ഇതര ദമ്പതികൾ നിർദ്ദേശിച്ചേക്കാം; വാചകത്തിൽ നിന്ന് സ്ഥിരീകരിക്കുക.
  • അങ്ങേയറ്റം അഭിപ്രായം. AI നിർദ്ദേശിച്ച "കാരണങ്ങൾ" തെളിവുകളില്ലാതെ സ്വീകരിക്കരുത്.

ചുരുക്കത്തിൽ

കോർപ്പസ് വിശകലനം സാഹിത്യത്തിൻ്റെ എണ്ണാവുന്ന വശം തുറക്കുന്നു: ആവൃത്തി, കൂട്ടുകെട്ട്, പദാവലി, ആനുകാലിക മാറ്റം. പാറ്റേണുകൾ തിരിച്ചറിയുന്നതിനും ഫലങ്ങൾ വ്യാഖ്യാനിക്കുന്നതിനും AI ഈ മേഖലയിൽ ശക്തമാണ്; എന്നാൽ കേവലമായ എണ്ണത്തിൽ അത് വിശ്വസനീയമല്ല. പ്രത്യേക ടൂൾ ഉപയോഗിച്ച് നമ്പർ പരിശോധിച്ചുറപ്പിക്കുക, ടെക്‌സ്‌റ്റിൽ നിന്നുള്ള കൊളോക്കേഷനുകൾ സ്ഥിരീകരിക്കുക, കൂടാതെ ഓരോ സംഖ്യയുടെയും അർത്ഥം സ്വയം സ്ഥാപിക്കുക. നമ്പർ തെളിവല്ല, തെളിവുകളിലേക്കുള്ള വാതിലാണ്.

ആപ്ലിക്കേഷൻ ടാസ്ക്

ഒരു ചെറിയ വാചകം തിരഞ്ഞെടുക്കുക (500-1000 വാക്കുകൾ). ഒരു ഉള്ളടക്ക വാക്ക് തിരിച്ചറിയുക (ഉദാ. "രാത്രി" അല്ലെങ്കിൽ "റോഡ്"). ആദ്യം, വാചകത്തിൽ സ്വയം കണക്കാക്കുക. തുടർന്ന് AI അത് കണക്കാക്കുക. രണ്ട് ഫലങ്ങളും താരതമ്യം ചെയ്യുക; വ്യത്യാസമുണ്ടെങ്കിൽ, കാരണം അന്വേഷിക്കുക. വാചകത്തിൽ ആ വാക്കിൻ്റെ പ്രവർത്തനത്തെക്കുറിച്ച് ഒരു ഖണ്ഡിക കമൻ്റ് എഴുതുക - സംഖ്യയെ അർത്ഥമാക്കി മാറ്റുക.

ചെക്ക്ലിസ്റ്റ്

  • [ ] ഞാൻ വ്യക്തമായ ഒരു ഭാഷാപരമായ ചോദ്യം വെച്ചു.
  • [ ] ഞാൻ കോർപ്പസിൻ്റെ അതിരുകൾ നിർവചിച്ചു (ടെക്സ്റ്റ്, പതിപ്പ്, കാലഘട്ടം).
  • [ ] ഞാൻ AI യുടെ എണ്ണം രണ്ടാം വഴി പരിശോധിച്ചു.
  • [ ] ഞാൻ ടെക്‌സ്‌റ്റിൽ നിന്നുള്ള കൊളോക്കേഷനുകൾ സ്ഥിരീകരിച്ചു.
  • [] ഞാൻ അഭിപ്രായം പറയാതെ നമ്പർ വിട്ടിട്ടില്ല; അർത്ഥം ഞാൻ തന്നെ സൃഷ്ടിച്ചു.