ඒකක
1. තුර්කි භාෂාව සහ සාහිත්‍යය පිළිබඳ කෘත්‍රිම බුද්ධිය හැඳින්වීම: භූමිකාවන්, සීමා මායිම්, සත්‍යාපනය, සත්‍යතාව සහ ආචාර ධර්ම 2. පෙළ විශ්ලේෂණය සහ සමීප කියවීම: AI සමඟ කවි, කෙටිකතා සහ නවකතා විශ්ලේෂණය 3. වාග් විද්‍යාව සහ කෝපස් විශ්ලේෂණය: අංක සමඟ වචන මාලාව කියවීම 4. පෞරාණික පාඨ, සරල කිරීම සහ අක්ෂර පරිවර්තනය: ඔටෝමාන් සහ දිවාන් පෙළ සමඟ වැඩ කිරීම 5. පාඨමාලා ද්‍රව්‍ය සහ උපදේශන සැලසුම්: ප්‍රතිඵලය, සඵලතාවය සහ මැනීම 6. සාහිත්‍ය ඉතිහාසය සහ පර්යේෂණ: සාහිත්‍ය සමාලෝචනය, සංශ්ලේෂණය සහ සත්‍යාපනය 7. සංස්කරණය, සෝදුපත් කියවීම සහ ටයිප් සැකසීම: ප්‍රකාශනය සඳහා පෙළ සකස් කිරීම 8. නිර්මාණාත්මක ලිවීමේ සහ නිෂ්පාදනයේ මානව-AI සහයෝගීතාව 9. AI සමඟින් ලියන ලද ප්‍රභවය, කොල්ලකෑම සහ පෙළ ඇගයීම 10. මූලාශ්‍ර සත්‍යාපනය, මායාව සහ ආරෝපණය විනය 11. සාහිත්‍ය පරිවර්ථනය තුළ මිනිසා: සෞන්දර්ය විනිශ්චය, ආචාර ධර්ම, රහස්‍යභාවය සහ සීමා මායිම්
ඒකකය 3 / 11

වාග් විද්‍යාව සහ කෝපස් විශ්ලේෂණය: අංක සමඟ වචන මාලාව කියවීම

ලාභ:

  • කෘත්‍රිම බුද්ධිය සමඟින් වචන සංඛ්‍යාතය, ඝට්ටනය, වචන මාලාවේ පොහොසත්කම සහ මූල පද වැනි කෝපස් මිනුම් කෙටුම්පත් කිරීමේ හැකියාව
  • කෘත්‍රිම බුද්ධිය නිවැරදිව ගණන් කිරීමේදී විශ්වාස කළ නොහැකි බව දැන ගැනීම සහ එක් එක් ගණන් වෙනම මෙවලමක් සමඟ සත්‍යාපනය කිරීමට හැකි වීම
  • අංකයක් තනිවම කිසිවක් නොකියන බවත්, අර්ථය තහවුරු කරන භාෂාමය අර්ථ නිරූපණය මිනිසුන්ට අයත් බවත් තේරුම් ගැනීමේ හැකියාව.

සාහිත්‍යය සහ භාෂා අධ්‍යයනය හුදෙක් "විවරණ" නොවේ; එය මැනිය හැකි සහ ගණන් කළ හැකි අංගයක් ද ඇත. කතුවරයකු විවිධ වචන කීයක් භාවිතා කරන්නේද, ඔහු කුමන වචන සමඟ භාවිතා කිරීමට කැමතිද, කුමන වචන කාල පරිච්ෙඡ්දය තුළ සුලභ වන්නේද - මේවා වාග් විද්‍යාව (භාෂාවේ ශබ්දය, ව්‍යුහය, අර්ථය සහ භාවිතය අධ්‍යයනය කරන විද්‍යාව) සහ විශේෂයෙන් කෝපස් වාග් විද්‍යාව හරහා විමර්ශනය කෙරේ. කෝපස් යනු කතුවරයෙකුගේ සම්පූර්ණ කෘති, පුවත්පතක වාර්ෂික ලේඛනාගාරය හෝ කාල පරිච්ඡේදයක කවි වැනි පාඨ එකතුවකි. කෝපස් විශ්ලේෂණය මෙම කොටසෙහි සංඛ්‍යාත්මක රටා සොයයි.

මෙම ඒකකය තුළ, අපි AI භාවිතා කිරීමට ඉගෙන ගනිමු: වචන සංඛ්‍යාතය (පෙළෙහි වචනයක් ඇති වාර ගණන), collocation (නිතර නිතර එකට සිදුවන වචන යුගල, උදා: "කළු" + "මගේ වාසනාව"), වචන මාලාවේ පොහොසත්කම සහ සෘතුමය විචලනය වැනි ප්‍රමිතික ඉක්මනින් උපුටා ගැනීම. නමුත් මුල සිටම අනතුරු ඇඟවීමක්: තනිව ගණන් කිරීමේදී AI වැරදි කළ හැකිය; විශාල සහ නිරවද්‍ය ගණන් සඳහා විශේෂ මෙවලම් අවශ්‍ය වන අතර, ඔබ එක් එක් සංඛ්‍යාවේ අර්ථය ස්ථාපිත කරන වාග් විද්‍යාඥයා වේ.

කෝපස් විශ්ලේෂණයේදී AI ශක්තිමත් සහ දුර්වල වන්නේ කොතැනද?

එහි ශක්තීන් නම්: කුඩා හා මධ්‍යම පෙළෙහි රටා හඳුනා ගැනීම, පෙළක වචන මාලාව පිළිබඳ උපකල්පන ජනනය කිරීම, collocations සඳහා අපේක්ෂකයන් යෝජනා කිරීම, ප්‍රතිඵලයක් අර්ථ නිරූපණය කිරීම, ක්‍රමවේදයක් විස්තර කිරීම. AI අසයි "මෙම කතුවරයා තුළ කැපී පෙනෙන වාක්‍ය ඛණ්ඩ මොනවාද?" එය ප්රශ්නයට ඉක්මන් ආරම්භයක් ලබා දෙයි.

දුර්වලතාව: නිවැරදි ගණන් කිරීම. AI යනු භාෂා ආකෘතියක් මිස ගණක යන්ත්‍රයක් නොවේ; දිගු පාඨයක "එය කොපමණ වාර ගණනක් සිදුවී තිබේද" යන ප්රශ්නයට ආසන්න වශයෙන් සහ සමහර විට වැරදි පිළිතුරක් ලබා දිය හැකිය. නිරවද්‍ය සංඛ්‍යාතය, නිවැරදි ස්ථානගත කිරීමේ සංඛ්‍යාලේඛන හෝ වචන දහස් ගණනක විශාල corpus ස්කෑන් කිරීම සඳහා, විශේෂිත මෘදුකාංග (උදා: AntConc හෝ පැතුරුම්පත වැනි corpus මෙවලම්) භාවිතා වේ. මෙම මෙවලම්වල ප්‍රතිදානය අර්ථ නිරූපණය කිරීමේදී AI වටිනා ය; නමුත් ඔහුව අන්ධ ලෙස raw count කරන්න කරන්න එපා.

ඉඟිය: ඔබට නිශ්චිත අංකයක් අවශ්‍ය නම්, ක්‍රම දෙකක් භාවිතා කරන්න: කුඩා අකුරුවලින් ගණන් කිරීමේ මෙවලමක් ඇති අතර AI එය අර්ථකථනය කරන්න; නැතහොත් AI ගණන් කර වෙනත් ආකාරයකින් එය සත්‍යාපනය කරන්න. තහවුරු කිරීමකින් තොරව "AI පැවසුවේ එය 47 වතාවක් සිදු වේ" යන වාක්‍යය කිසි විටෙක භාවිතා නොකරන්න.

පියවරෙන් පියවර corpus අධ්‍යයනයක්

  1. ප්‍රශ්නයක් දාන්න. "මෙම කවියා තුළ වර්ණ වචන බෙදා හැරෙන්නේ කෙසේද?" වැනි පැහැදිලි ප්‍රශ්නයක් නොමැතිව ගණන් කිරීම අර්ථ විරහිත ය:
  2. කෝපස් නිර්වචනය කරන්න. කුමන පාඨද? කුමන සංස්කරණයද? කුමන කාල පරිච්ඡේදයද? දේශ සීමාව පැහැදිලි විය යුතුය.
  3. මිනුම තෝරන්න. සංඛ්‍යාතය, ඝට්ටනය, වචන මාලාවේ පොහොසත්කම?
  4. මැන බැලීම සහ තහවුරු කිරීම. ගණන් කරන්න, ඉන්පසු දෙවන මාර්ගය තහවුරු කරන්න.
  5. අදහස් දක්වන්න. අංකය පමණක් කිසිවක් නොකියයි; "දෙවැනි කාලපරිච්ඡේදයේ වර්ණ වචන දෙගුණයක්" යන සොයාගැනීම අර්ථවත් කරන්නේ ඔබේ අදහසයි.

වචන මාලාවේ පොහොසත්කමේ නිතර භාවිතා වන මිනුමක් වන්නේ විවිධ වචන ගණන මුළු වචන ගණනට (වර්ගය/ටෝකන් අනුපාතය) අනුපාතයයි. මෙම අනුපාතය වැඩි නම්, පාඨය වචන-විවිධ වේ, එය අඩු නම්, එය පුනරාවර්තනය වේ. නමුත් මෙම අනුපාතය පෙළ දිගට බලපායි; කෙටි සහ දිගු පාඨ සෘජුවම සංසන්දනය කිරීමේදී ප්රවේශම් වන්න.

කුඩා නඩු තුනක්

නඩුව 1 - එකතු කිරීම ශෛලියක් පෙන්නුම් කරයි. පර්යේෂකයෙකු නවකතාකරුවෙකුගේ නවකතා 3 ක නාම විශේෂණ-නාම යුගල පරීක්ෂා කළේය. "සුදුමැලි" යන වචනය විවිධ නාම පද 5කට ගැළපෙන බව AI යෝජනා කළේය. පර්යේෂකයා පාඨවලින් 4ක් සත්‍යාපනය කර 1ක් ගොතන ලද ඒවා ලෙස ඉවත් කළේය. තහවුරු කළ රටාව කතුවරයාගේ විස්තරාත්මක ශෛලිය පිළිබඳ නිබන්ධන ප්‍රකාශයක් බවට පත් විය.

නඩුව 2 - ගණන් කිරීමේ දෝෂය හසු විය. ශිෂ්‍යයෙක් AI වෙතින් "රාත්‍රිය" යන වචනය වචන 2,000ක පාඨයක කී වතාවක් තිබේදැයි විමසීය; AI කිව්වා "23" කියලා. ශිෂ්‍යයා එම පෙළ පැතුරුම්පතකට විසි කර එය ගණන් කළ විට සත්‍ය සංඛ්‍යාව 17 විය. AI හි raw count එක විශ්වාස කළ නොහැකි බව පැහැදිලි වී ඇත.

නඩුව 3 - වරින් වර වෙනස් කිරීම මතභේදයට තුඩු දුන්නේය. එක් කණ්ඩායමක් කවියෙකුගේ මුල් සහ අග කවිවල වියුක්ත වචනවල අනුපාතය සංසන්දනය කළහ. AI හි පළමු කෙටුම්පත ප්‍රවණතාවක් යෝජනා කළේය; කණ්ඩායම නැවත පෙළ වෙත ගොස් ගණන් කිරීම සත්‍යාපනය කළ විට, ප්‍රවණතාවය සැබෑ බවට පත් වූ නමුත් AI විසින් යෝජනා කරන ලද "හේතු" සත්‍යාපනය කළ නොහැකි සමපේක්ෂන වූ අතර ඒවා ඉවත් කරන ලදී.

පිටපත් කළ හැකි සැකිලි හතරක්

1) වචන සංඛ්‍යාත දළ සටහන (සත්‍යාපනය සමඟ):

පහත පෙළෙහි, ඒවායේ ආසන්න සංඛ්‍යාත සමඟින් නිතර සිදුවන අන්තර්ගත වචන 15 ලැයිස්තුගත කරන්න (සංයෝජන සහ පෙරනිමිති වැනි ක්‍රියාකාරී වචන බැහැර කරන්න). අවවාදයයි: ගණන් කිරීම් නිවැරදි නොවිය හැකි බව සලකන්න සහ "නිවැරදි වීමට නම්, ඒවා වෙනම ගණන් කිරීමේ මෙවලමක් සමඟ සත්‍යාපනය කළ යුතුය" යන්න සටහන් කරන්න. පෙළ: [පෙළ මෙහි අලවන්න]

2) ස්ථාන අපේක්ෂකයින්:

පහත පෙළෙහි නිතර නිතර එකට සිදුවන වචන යුගල (collocations) යෝජනා කරන්න. එක් එක් යුගල සඳහා පාඨයෙන් අවම වශයෙන් එක් උපුටා දැක්වීමක් ලබා දෙන්න. පෙළෙහි කිසිදු සමානකමක් නොමැති ද්විත්ව සැකැස්ම; ඔබට විශ්වාස නැතිනම්, එය "සත්‍යාපනය අවශ්‍ය" ලෙස සලකුණු කරන්න. පෙළ: [පෙළ අලවන්න]

3) වචන මාලාව සංසන්දනය කිරීම:

මම ඔබට ලිපි දෙකක් දෙන්නම්. එක් එක් සඳහා: ආසන්න සම්පූර්ණ වචන, විවිධ වචන ප්‍රභේද පිළිබඳ නිරීක්ෂණ, සහ ප්‍රමුඛ වචන වසම් (උදා: වර්ණය, ස්වභාවය, හැඟීම්). සංඛ්‍යා දළ වශයෙන් බව සඳහන් කරන්න. සැසඳීමේ අර්ථ නිරූපණය මගේ සත්‍යාපනයට තබන්න. පෙළ A: [...] පෙළ B: [...]

4) ප්රතිඵල අර්ථ නිරූපණය:

ගණන් කිරීමේ මෙවලමකින් මට පහත ප්‍රතිඵල ලැබුණි: [ප්‍රතිඵල අලවන්න]. භාෂාමය වශයෙන් මෙම සංඛ්‍යා අදහස් කළ හැකි දේ පිළිබඳ උපකල්පන 2-3ක් ජනනය කරන්න. සෑම උපකල්පනයක්ම "සාක්ෂි අවශ්‍ය" ලෙස සලකුණු කර මට එය පරීක්‍ෂා කරන්නේ කෙසේදැයි කියන්න. අධික අදහස් දැක්වීමෙන් වළකින්න.

දුර්වල ක්ෂණික / ශක්තිමත් විමසුම

දුර්වල: "මෙම පාඨයේ වැඩිපුරම සඳහන් වන්නේ කුමන වචනයද?"

ප්‍රබල: "මෙම පාඨයේ ඇති නිතර නිතර අන්තර්ගත වචන ඒවායේ ආසන්න සංඛ්‍යාතය සමඟ ලැයිස්තුගත කරන්න; ශ්‍රිත වචන බැහැර කරන්න. සංඛ්‍යා නිවැරදි නොවන බවත් වෙනම මෙවලමකින් සත්‍යාපනය කළ යුතු බවත් පැහැදිලි කරන්න. එක් එක් වචනය සඳහා උදාහරණ වාක්‍යයක් දෙන්න."

ප්‍රබල විමසුම AI විසින් ගණන් කිරීමේ සීමාව පිළිගන්නා අතර සත්‍යාපනය අවශ්‍ය බව ඔබට කලින්ම කියයි. දුර්වල විමසුමේදී, AI තනි අංකයක් ලබා දෙන අතර එය වැරදි විය හැකි බව ඔබ නොදනී.

මිනුම් සහ විශ්වසනීයත්වය වගුව

මැනීම

මොනවද පෙන්නන්නේ

AI පමණක්

නිවැරදි මාර්ගය

වචන සංඛ්යාතය

නිතර වචන

ගැන, අවදානම්

කවුන්ටරය + AI විවරණ

colocation

එකට සමත් වූ අය

අපේක්ෂකයින් නිෂ්පාදනය කරයි

පාඨයෙන් තහවුරු කිරීම

වර්ගය/ටෝකන් අනුපාතය

වාචික විවිධත්වය

නොමග යවන්න පුළුවන්

මෙවලම සමඟ ගිණුම

සෘතුමය වෙනස් වීම

කාලයත් සමඟ ප්රවණතාවය

උපකල්පන ජනනය කරයි

මැන බැලීම සහ තහවුරු කිරීම

අවසන් අදහස් දැක්වීම

අර්ථය

බලවත් නමුත් අතිශයෝක්තියට නංවයි

මානව විනිශ්චය

මූල පද සහ n-gram සංකල්ප

සංකල්ප දෙකක් කෝපස් විශ්ලේෂණයේදී ඔබේ කාර්යය පහසු කරයි. පළමුවැන්න මූල පදයයි (ඉංග්‍රීසියෙන් ඇති මූල පදය - සාමාන්‍ය භාෂාවට සාපේක්ෂව පෙළ හෝ කර්තෘ බලාපොරොත්තු වූවාට වඩා බොහෝ විට සිදුවන වචනය, එම පෙළට එහි "චරිතය" ලබා දෙයි). කර්තෘගේ මූල පද ඔහුගේ රුචිකත්වයන් සහ ශෛලිය හෙළි කරයි; නිදසුනක් වශයෙන්, කවියෙකු තුළ බලාපොරොත්තු වූවාට වඩා "මුහුද" සහ "වෙන්වීම" නිතර සිදුවේ නම්, මෙම සංඛ්‍යානමය නෙරායාම අර්ථ නිරූපණයක ආරම්භක ලක්ෂ්‍යය බවට පත්වේ. මූල පද හඳුනා ගැනීම සඳහා, පාඨයක සංඛ්‍යාත සමුද්දේශ කෝපස් සංඛ්‍යාත සමඟ සංසන්දනය කිරීම අවශ්‍ය වේ (සැසඳීම සඳහා භාවිතා කරන සාමාන්‍ය, විශාල පෙළක්); මෙම සංසන්දනය නිශ්චිත මෙවලම් කාර්යයකි, එය AI හට විශ්වාසදායක ලෙස තනිවම කළ නොහැකි ගණනය කිරීමකි.

දෙවැන්න n-gram (පෙළක n අඛණ්ඩ වචන අනුපිළිවෙලකි; වචන දෙකක අනුපිළිවෙලක් "bigram" ලෙස හැඳින්වේ, වචන තුනක අනුපිළිවෙලක් "trigram" ලෙස හැඳින්වේ). N-gram විශ්ලේෂණය කර්තෘගේ සූත්‍ර ප්‍රකාශන සහ නිතර භාවිතා කරන වාක්‍ය ඛණ්ඩ හෙළි කරයි. නිදසුනක් වශයෙන්, ලේඛකයෙකු "ආකාරයේ" හෝ "කෙසේ වෙතත්" වැනි වාක්‍ය ඛණ්ඩ අතිශයින් නිතර භාවිතා කරන්නේ නම්, මෙය ඔහුගේ වාක්‍ය සෑදීමේ පුරුද්ද පෙන්නුම් කරයි. AI හට මෙම වාක්‍ය ඛණ්ඩ අපේක්ෂකයින් ලෙස යෝජනා කළ හැකිය; නමුත් සත්‍ය සංඛ්‍යාතය සහ සංඛ්‍යානමය වැදගත්කම සඳහා ගණන් කිරීමේ මෙවලම වෙත ආපසු යාම අවශ්‍ය වේ.

ඉඟිය: AI වෙත පවසන්න, "මෙම පාඨයේ ඇති කැපී පෙනෙන වාක්‍ය ඛණ්ඩ (වචන දෙකක් හෝ තුනක්) අපේක්ෂකයන් ලෙස ලැයිස්තුගත කර, එක් එක් පාඨයෙන් උදාහරණයක් දෙන්න." අපේක්ෂක ලැයිස්තුව ගෙන වෙනම මෙවලමකින් සැබෑ සංඛ්‍යාතය මැන බලන්න. AI “දැනුම්කරු” ලෙසත්, නියෝජිතයා “කවුන්ටරය” ලෙසත්, ඔබම “පරිවර්තකයා” ලෙසත් ස්ථානගත කරන්න.

පොදු වැරදි

  • AI හි raw ගණන් මත රඳා පවතී. AI යනු ගණක යන්ත්‍රයක් නොවේ; වෙනම මෙවලමක් මගින් නිශ්චිත අංකය තහවුරු කරන්න.
  • අදහස් දැක්වීමකින් තොරව අංකය ඉදිරිපත් කිරීම. "47 වතාවක් සමත්" කිසිවක් නොකියයි; ඔබ අර්ථය නිර්මාණය කරයි.
  • පෙළ දිග නොසලකා හැරීම. ගීත විවිධත්ව අනුපාත දිගට සංවේදී වේ.
  • collocation සත්‍යාපනය නොකර නිබන්ධනය සෑදීම. AI නොවන ජෝඩු යෝජනා කළ හැකිය; පාඨයෙන් තහවුරු කරන්න.
  • අතිශයින්ම අදහස් දැක්වීම. AI විසින් යෝජනා කරන ලද "හේතු" සාක්ෂි නොමැතිව පිළිගන්න එපා.

සාරාංශයක් ලෙස

කෝපස් විශ්ලේෂණය සාහිත්‍යයේ ගණන් කළ හැකි පැතිකඩ විවෘත කරයි: සංඛ්‍යාතය, ඝට්ටනය, වචන මාලාව, කාලානුරූප වෙනස් වීම. AI මෙම ප්‍රදේශයේ රටා හඳුනාගැනීමේ සහ ප්‍රතිඵල අර්ථකථනය කිරීමේ ප්‍රබලයි; නමුත් නිරපේක්ෂ ගණනය කිරීමේදී එය විශ්වාස කළ නොහැකිය. වෙනම මෙවලමක් සමඟ අංකය සත්‍යාපනය කරන්න, පෙළෙන් collocations තහවුරු කරන්න, සහ එක් එක් අංකයේ තේරුම ඔබම තහවුරු කරන්න. අංකය සාක්ෂි නොවේ, එය සාක්ෂි සඳහා දොරටුවයි.

යෙදුම් කාර්යය

කෙටි පාඨයක් තෝරන්න (වචන 500-1000). අන්තර්ගත වචනයක් හඳුනා ගන්න (උදා: "රාත්‍රිය" හෝ "මාර්ගය"). පළමුව, ඔබ පෙළෙහි ගණන් කරන්න. ඉන්පසු AI එය ගණන් කරන්න. ප්රතිඵල දෙක සසඳන්න; වෙනසක් ඇත්නම් හේතුව සොයා බලන්න. ඉන්පසු පෙළෙහි එම වචනයේ කාර්යය පිළිබඳ එක් ඡේදයක විවරණයක් ලියන්න - අංකය අර්ථය බවට පත් කිරීම.

පිරික්සුම් ලැයිස්තුව

  • [ ] මම පැහැදිලි භාෂාමය ප්‍රශ්නයක් දැම්මා.
  • [ ] මම corpus හි සීමාවන් නිර්වචනය කළෙමි (පෙළ, සංස්කරණය, කාල සීමාව).
  • [ ] මම AI ගණන් කිරීම දෙවන ආකාරයෙන් සත්‍යාපනය කළෙමි.
  • [ ] මම පාඨයෙන් collocations තහවුරු කළා.
  • [ ] මම අදහස් දැක්වීමකින් තොරව අංකය තැබුවේ නැත; මමම අර්ථය නිර්මාණය කළා.