ලාභ:
- කුට්ටි ප්රමාණය, අතිච්ඡාදනය සහ අර්ථකථන කොටස් හුවමාරු කිරීම් සංඛ්යාත්මකව තක්සේරු කරන්න
- විවිධ ලේඛන වර්ග (PDF, වගුව, කේතය, කතාබස් ලොගය) සඳහා සුදුසු කුට්ටි උපාය මාර්ගයක් තෝරා ගැනීම
- එක් එක් කුට්ටියට පාර-දත්ත එකතු කිරීමෙන් ලබා ගැනීමේ ගුණාත්මකභාවය සහ පෙරීම ශක්තිමත් කරන්න
මෙය RAG හි වඩාත්ම නොසලකා හරින ලද නමුත් වඩාත්ම තීරණාත්මක පියවරයි: ඔබ ලේඛනය බිඳ දමන ආකාරය. මෙය කුට්ටි කිරීම ලෙස හැඳින්වේ. ඔබ එකම ආකෘතියකට එකම ලේඛනය ලබා දුන්නද, වැරදි ලෙස කොටස් කිරීම හේතුවෙන් නැවත ලබා ගැනීම වැරදි කැබැල්ලක් ලබා දෙන අතර ආකෘතිය කිසි විටෙකත් විශිෂ්ට පිළිතුරක් ලබා නොදේ. මෙම ඒකකය තුළ, අපි ඛණ්ඩනය කිරීමේ උපාය මාර්ග, ලේඛන වර්ගය අනුව ඒවා අනුවර්තනය කරන්නේ කෙසේද සහ එක් එක් ඛණ්ඩනයට අර්ථවත් පාරදත්ත එකතු කරන්නේ කෙසේද යන්න ආවරණය කරයි.
අපි ඉරා දමන්නේ ඇයි?
හේතු තුනක් තිබේ. පළමුව, කාවැද්දීමේ ආකෘති නිශ්චිත දිගක් දක්වා පෙළ අර්ථවත් දෛශිකයක් බවට පරිවර්තනය කරයි; පිටු 40 කින් යුත් සම්පූර්ණ පරිච්ඡේදයක් තනි දෛශිකයකට තද කළහොත්, අර්ථය "බොඳ" වේ. දෙවනුව, අපට ආකෘතියට සන්දර්භය ලෙස අවශ්ය කොටස පමණක් ලබා දීමට අවශ්යය; සම්පූර්ණ ලේඛනය භාරදීම මිල අධික හා අවධානය වෙනතකට යොමු කිරීමකි. තෙවනුව, ලබා ගැනීම නිරවද්ය වීමට නම්, සෙවුම් ඒකකය කුඩා සහ අවධානය යොමු කළ යුතුය.
එබැවින් කුට්ටිය යනු නැවත ලබා ගැනීමේ කුඩාම ඒකකයයි. එය ඉතා විශාල හෝ කුඩා නොවිය යුතුය - හරි.
කුට්ටි ප්රමාණය සහ අතිච්ඡාදනය වන ශේෂය
ප්රධාන සැකසුම් දෙකක් ඇත: කුට්ටි ප්රමාණය (කුට්ටියක ටෝකන/වචන කීයක් තිබේද) සහ අතිච්ඡාදනය (අසල්වැසි කුට්ටි විසින් බෙදාගත් කොටස).
ඉතා කුඩා කැබලි (උදා: ටෝකන 100): නාභිගත නමුත් සන්දර්භයෙන් විසන්ධි වී ඇත. ඔහු පවසන්නේ "දින 14 සඳහා", නමුත් දින 14 යනු කුමක්ද යන්න කලින් වාක්යයේ ඉතිරිව ඇත. ඉතා විශාල කැබලි (උදා: ටෝකන 2000): සන්දර්භය ආරක්ෂා කරන නමුත් බොහෝ නූල් මිශ්ර කර ඇත; කාවැද්දීම අවුල් වන අතර අදාළ නොවන මාතෘකා එකට එකතු වේ.
අතිච්ඡාදනය මායිම් ගැටළුව විසඳයි. වාක්යයක් කොටස් දෙකක මායිමට හරියටම වැටුණොත්, එය අතිච්ඡාදනය නොවී දෙකට බෙදා එහි තේරුම නැති වී යයි. ටෝකන 50-100ක අතිච්ඡාදනය මඟින් සීමාව තුළට වැටෙන තොරතුරු අවම වශයෙන් එක් කොටසක නොවෙනස්ව පවතින බව සහතික කරයි.
කුට්ටි ප්රමාණය
වාසිය
අවාසිය
සුදුසු අන්තර්ගතය
කුඩා (ටෝකන 100-250)
ඉහළ සංවේදීතාව, අවධානය යොමු
සන්දර්භය බිඳී යා හැක
නිතර අසන පැන, කෙටි ලිපි, නිර්වචන
මධ්යම (ටෝකන 300-600)
ශේෂය; බොහෝ අවස්ථා
-
ක්රියා පටිපාටි, ප්රතිපත්ති පාඨ
විශාල (ටෝකන 800-1500)
සන්දර්භය අඛණ්ඩතාව
නොපැහැදිලි කාවැද්දීම
ආඛ්යාන, දීර්ඝ පැහැදිලි කිරීම්
ඉඟිය: ඔබ ආරම්භ කළ යුත්තේ කොතැනින්දැයි නොදන්නේ නම්, 400-500 ටෝකන් කුට්ටියකින් සහ 50-80 ටෝකන් අතිච්ඡාදනයකින් ආරම්භ කරන්න; ඉන්පසු ඔබේම දත්ත සමඟ මැනීම සහ සකස් කිරීම. "හරි" ප්රමාණය විශ්වීය නොවේ, එය සන්දර්භය මත රඳා පවතී.
කුට්ටි උපාය මාර්ග
ස්ථාවර ප්රමාණය: සෑම N ටෝකනයකම පෙළ කප්පාදු කරන්න. එය සරල සහ වේගවත්, නමුත් මැද වාක්යයට බාධා කළ හැක.
බෙදුම්කරු මත පදනම් වූ (ප්රත්යාවර්තක/විභේදකය): ඡේදය අනුව බෙදීම සහ පසුව වාක්ය මායිම්; එය අර්ථයේ අඛණ්ඩතාව වඩා හොඳින් ආරක්ෂා කරයි. බොහෝ නිෂ්පාදන පද්ධති මේ සමඟ ආරම්භ වේ.
Semantic chunking: එය වාක්යවල කාවැද්දීම දෙස බලන අතර විෂය වෙනස් වීම සිදුවන තැන ඒවා බෙදයි. එය ඉහළම ගුණාත්මක නමුත් වඩාත්ම මිල අධික ක්රමයකි; විශාල පරිමාවන් සමඟ ගනුදෙනු පිරිවැය වැඩිවේ.
ව්යුහය-දැනුවත්: මාතෘකා, කොටස්, වගු වැනි ලේඛන ව්යුහය භාවිතා කරයි. උදාහරණයක් ලෙස, මාර්ක්ඩවුන් ලේඛනයක් මාතෘකා මගින් බෙදීමෙන් එක් එක් කොටසට තමන්ගේම ශීර්ෂයක් ඇති බව සහතික කරයි.
ලේඛන වර්ගය අනුව අනුවර්තනය වීම
සෑම ලියවිල්ලක්ම එක හා සමාන නොවේ. උපායමාර්ගය වර්ගය අනුව වෙනස් වේ:
- PDF/ප්රතිපත්ති පෙළ: පිටු සලකුණ මත පදනම් වූ, මධ්යම ප්රමාණයේ. පිටු ඉහළ/පහළ පුනරාවර්තන හිස් කරන්න (ශීර්ෂකය/පාදය).
- වගු: රේඛාව සන්දර්භයෙන් ඉවතට නොගන්න; එක් එක් පේළිය ශීර්ෂ තොරතුරු සමඟ තබා ගන්න ("අයිතමය: X, මිල: Y, කොටස්: Z"). අමු වගුව සාමාන්ය පෙළ බවට පරිවර්තනය කිරීම බොහෝ විට අත්යවශ්ය වේ.
- කේතය: ශ්රිතය/පංති මායිම් අනුව බෙදීම; කාර්යයක් මාර්ගයෙන් කපා නොගන්න.
- කතාබස්/ප්රවේශපත්ර පටිගත කිරීම: පණිවිඩය හෝ සංවාද වටය අනුව බෙදීම; කවුරු මොනවා කිව්වද කියලා දැනුමක් තියාගන්න.
# වරහන් මත පදනම් වූ කුට්ටි (සංකල්පීය) කුට්ටි = bol(පෙළ, ඉලක්ක_ප්රමාණය=450, # ටෝකන අතිච්ඡාදනය=70, # ටෝකන් වරහන්=["\n\n", "\n", ". ", " "] # ඡේදය පළමු, වචනය අවසන්)
සෑම ධාවන පථයකටම පාරදත්ත එක් කරන්න
කුට්ටි කිරීම යනු "බෙදීම" පමණක් නොවේ; එක් එක් කෑල්ලක් පොහොසත් කිරීමයි. ඔබ ධාවන පථයට අමුණන සෑම ටැගයක්ම අනාගත පෙරීම සහ මූලාශ්ර උපුටා දැක්වීම සඳහා එහි බර රත්රන් වලින් වටී.
# සාරවත් කුට්ටිය (සංකල්පීය){ "පෙළ": "වසර 1-5 ක සේවා කාලයක් සහිත දින 14 ක වාර්ෂික වැටුප් සහිත නිවාඩු...", "පාරදත්ත": { "මූලාශ්රය": "ik_el_kitabi_v7.pdf", "section": "5.2 වාර්ෂික නිවාඩු", "පිටුව": 23, "25-0 කොටස": "23, "25-0 කොටස" "පෞද්ගලිකත්වය": "අභ්යන්තර" }}
තවත් ප්රබල තාක්ෂණයක් වන්නේ සන්දර්භීය ශීර්ෂයක් එකතු කිරීමයි: එක් එක් කොටසෙහි ආරම්භයේ එය අයත් වන පරිච්ඡේදයේ මාතෘකාව ලිවීම. මේ අනුව, "දින 14 සඳහා" වැනි විසංයෝජනය වූ කෑල්ලක් පවා "වාර්ෂික නිවාඩු - දින 14" ලෙස වඩා හොඳින් කාවැදී ඇති අතර වඩාත් අර්ථවත් වේ.
දුර්වල කොටස් කිරීම / ශක්තිමත් කැපීම
දුර්වල (අන්ධ දෘඪ කැපීම, පාරදත්ත නැත):
සෑම අක්ෂර 1000 කටම පෙළ කපා දමන්න. පෙළ පමණක් තබා ගන්න.# ප්රතිඵලය: වගු මැදින් බෙදී ඇත, "දින 14" සන්දර්භය නොමැතිව පවතී,# එය පැමිණියේ කුමන ලේඛනයෙන්දැයි නොදනී, පෙරහනක් සෑදිය නොහැක.
බලවත් (ව්යුහය-දැනුවත් + ශීර්ෂකය + පාරදත්ත):
ලේඛනය ශීර්ෂ අනුව බෙදන්න; එක් එක් කොටසට කොටස් මාතෘකාව එක් කරන්න; මූලාශ්රය, පිටුව, දිනය සහ රහස්යතා පාර-දත්ත අමුණන්න; වගු ඒවායේ ශීර්ෂයන් සමඟ සරල අකුරු බවට පරිවර්තනය කරන්න.
කුඩා නඩු තුනක්
නඩුව 1 - පින්තාරු කිරීමේ ව්යසනය. මූල්ය කණ්ඩායමක් පිටු 200ක මිල ලැයිස්තුව අන්ධ දෘඪ කැපීමකින් බෙදා ඇත; මේස පේළි අහඹු ලෙස බෙදී ඇත. "X නිෂ්පාදනයේ මිල කීයද?" ආකෘතිය වැරදි රේඛාවක් කියවා වැරදි මිලක් ලබා දුන්නේය (12 න් 9 ක් වැරදියි). මම වගු පේළි "නිෂ්පාදනය: … | මිල: … | ඒකකය: ..." ආකෘතියෙන් සරල අකුරු බවට පරිවර්තනය කළ විට දෝෂය 12 න් 0 දක්වා අඩු විය.
නඩුව 2 - අතිශය විශාල කුට්ටිය. විකිය තුළ, සෑම පිටුවක්ම තනි කුට්ටියකින් සාදා ඇත (සමහර අය පවසන්නේ ටෝකන් 3,000 ක් යැයි කියනු ලැබේ). එක් පිටුවක "නිවාඩු", "අතිකාල" සහ "පඩිපත්" ඇති නිසා කාවැද්දීම බොඳ වී ඇත; නිවාඩු ප්රශ්නය සම්බන්ධයෙන් වැඩ කරන වේලාවන් කොටසද ක්රියාත්මක විය. මාතෘකාව අනුව පිටු මධ්යම ප්රමාණයට බෙදූ විට, recall@5 64% සිට 91% දක්වා වැඩි විය.
නඩුව 3 - අතිච්ඡාදනය නොවී කප්පාදු කරන ලද වාක්යය. නීති කණ්ඩායමක් සඳහා ටෝකන් 250 ස්ථාවර කප්පාදුවක්, අතිච්ඡාදනය නොවේ. තීරනාත්මක අර්ථ දැක්වීමක් කොටස් දෙකක මායිම මත වැටී දෙකට බෙදී ගියේය; එකක හෝ අනෙකෙහි සම්පූර්ණ පිළිතුර අඩංගු නොවේ. ටෝකන අතිච්ඡාදනය 60 ක් එකතු කළ විට, එකම අර්ථ දැක්වීම එක කැබැල්ලක නොවෙනස්ව පැවති අතර නිවැරදි පිළිතුර ආපසු ලබා දෙන ලදී.
පොදු වැරදි
- අන්ධ ස්ථාවර කැපීම: වාක්ය සහ වගු මැදින් බෙදෙයි; අර්ථය නැති වී යයි.
- අතිච්ඡාදනය බිංදුවෙන් පිටවීම: මායිම මත වැටෙන තොරතුරු බෙදී නැති වී යයි.
- පාරදත්ත එකතු නොකිරීම: පෙරීම සහ මූලාශ්ර සංදර්ශණය කළ නොහැක.
- වගු අමුවෙන් තැබීම: ආකෘතියට වගු ව්යුහය විසඳිය නොහැක; රේඛා සරල පෙළට පරිවර්තනය කරන්න.
- එක් උපාය මාර්ගයක් පැනවීම: PDF, කේතය සහ වගුව එකම ක්රමයෙන් බෙදී නැත; ප්රභේදයට අනුගත වන්න.
අවවාදයයි: Chunking එක වරක් සකසා එය අමතක නොකරන්න. නව ලේඛන වර්ග (නව පද්ධතියකින් ප්රවේශපත්ර, ස්කෑන් කරන ලද PDF) පැමිණෙන විට ලබා ගැනීමේ ගුණාත්මකභාවය නැවත මැනීම. නරක ආදාන දත්ත යනු නරක ප්රතිචාරයකි ("කසළ ඇතුලට, කුණු පිටතට").
සාරාංශයක් ලෙස
- චුන්ක් යනු නැවත ලබා ගැනීමේ කුඩාම ඒකකයයි; ඉතා විශාල හෝ කුඩා නොවේ - එය අන්තර්ගතයට අනුව සමතුලිත විය යුතුය.
- කුට්ටි ප්රමාණය නාභිගත සන්දර්භය තුලනය පෙන්නුම් කරයි; අතිච්ඡාදනය සීමා පාඩු කළමනාකරණය කරයි.
- වරහන් මත පදනම් වූ සහ ව්යුහය-දැනුවත්ව කුට්ටි කිරීම බොහෝ ජනන පද්ධතිවල ආරම්භක ලක්ෂ්යය වේ; semantic chunking හොඳ තත්ත්වයේ නමුත් මිල අධිකයි.
- වගුව, ස්ක්රිප්ට්, සහ කතාබස් වැනි වර්ගවලට ඔවුන්ගේම උපාය මාර්ග අවශ්ය වේ; වගු සරල පෙළට පරිවර්තනය කරන්න.
- එක් එක් ධාවන පථයට මූලාශ්රය/දිනය/පරිච්ඡේදය/පෞද්ගලිකත්ව පාර-දත්ත සහ කොටස් මාතෘකාව එක් කරන්න; පෙරීම සහ උපුටා දැක්වීමේ පදනම මෙයයි.
යෙදුම් කාර්යය
ඔබ තෝරා ගන්නා ලේඛනයේ කොටසක් විවිධ ආකාර තුනකට කඩා දමන්න: (1) ටෝකන 200 ක කුඩා කැබලි, (2) ටෝකන 500 ක මධ්යම කොටස් (ටෝකන් 70 ක් අතිච්ඡාදනය), (3) තනි විශාල කෑලි. එක් එක් උපාය මාර්ගය සඳහා එකම ප්රශ්න 3ම අසන්න, කුමන කොටස ගෙන ආ යුතුද යන්න අතින් සලකුණු කරන්න, සහ එම ලේඛනය සඳහා වඩාත් හොඳින් ක්රියා කරන උපායමාර්ගය සඳහා තර්ක ලියන්න. ඉන්පසු සෑම ධාවන පථයකටම අවම වශයෙන් පාර-දත්ත ක්ෂේත්ර හතරක් සහ “පරිච්ඡේද මාතෘකාවක්” එක් කරන්න. ලේඛනයේ වගුවක් තිබේ නම්, වගු පේළියක් "ක්ෂේත්ර: අගය" ආකෘතියෙන් සරල පෙළකට පරිවර්තනය කරන්න.
පිරික්සුම් ලැයිස්තුව
- [ ] කුට්ටිය නැවත ලබා ගැනීමේ කුඩාම ඒකකය වන අතර ප්රමාණය නාභිගත-සන්දර්භ ශේෂය බව මට පැවසිය හැක.
- [ ] අතිච්ඡාදනය මායිම් නැතිවීම වළක්වන්නේ මන්දැයි මම දනිමි.
- [ ] මට වරහන් මත පදනම් වූ, අර්ථකථන සහ ව්යුහය-දැනුවත් කුට්ටිය අතර වෙනස හඳුනාගත හැකිය.
- [ ] මට වගුව, කේතය සහ කතාබස් සඳහා උපාය මාර්ග අනුවර්තනය කළ හැකිය.
- [ ] මම එක් එක් ධාවන පථයට පාරදත්ත සහ පරිච්ඡේද මාතෘකාව එක් කිරීමෙන් නැවත ලබා ගැනීම ශක්තිමත් කරමි.