ලාභ:
- කුළුණු හතරකින් ප්රතිනිෂ්පාදනය සහතික කිරීමේ හැකියාව (බීජ සවි කිරීම, දත්ත අනුවාදනය, මාධ්ය කැටි කිරීම, අත්හදා බැලීම් අධීක්ෂණය) සහ එකම ධාවනය නැවත නැවත කරන විට එකම ප්රතිඵලයක් ලබා දීම
- මොඩියුලයේ සියලුම නැවතුම් (මිතික, දත්ත, ආකෘතිය, LLM සංරචක, eval, සාධාරණත්වය, ආරක්ෂාව, බෙදාහැරීම, අධීක්ෂණය) අන්තයේ සිට අන්ත දාමයක් තුළ ඒකාබද්ධ කිරීමේ හැකියාව
- තීරණාත්මක තීරණය සෑම නැවතුමකදීම මිනිසා සමඟ පවතින බව තහවුරු කර ගැනීමට සහ ව්යාපෘතිය විගණනය කළ හැකි ආකාරයෙන් ලේඛනගත කිරීමට හැකියාව
ML ව්යාපෘතියක වඩාත්ම ද්රෝහී අසාර්ථකත්වය බිඳ වැටීමක් නොවේ; "ආයෙත් එකම ප්රතිඵලයක් ලැබෙන්නේ නෑ." ඔබ මාස තුනකට පෙර නිෂ්පාදනය කළ මාදිලියේ ලකුණු ප්රමාණය අද ඔබට ප්රතිනිෂ්පාදනය කළ නොහැකි නම්, ඔබ ඇත්තටම එම ආකෘතිය පාලනය කරන්නේ නැත. මෙම සංවෘත ඒකකය තුළ, අපි ප්රතිනිෂ්පාදනය ගැඹුරු කරන්නෙමු: එකම ආදාන සමඟ එකම ප්රති result ලය විශ්වාසදායක ලෙස ලබා ගැනීමේ හැකියාව සහ සම්පූර්ණ මොඩියුලයම අවසානය සිට අවසානය දක්වා ව්යාපෘති විනයකට ඒකාබද්ධ කිරීම.
ප්රතිනිෂ්පාදනය අපහසු ඇයි
සාමාන්ය මෘදුකාංග වලදී එකම කේතය එකම ප්රතිදානයක් ලබා දෙයි. ML හි ප්රතිඵලය තීරණය කරන තවත් බොහෝ විචල්යයන් තිබේ:
- අහඹු බව: දත්ත මාරු කිරීම, බර ආරම්භ කිරීම, දත්ත බෙදීම - සියල්ල අහඹු බව මත රඳා පවතී.
- දත්ත: එකම කේතය විවිධ දත්ත අනුවාදයන් සමඟ විවිධ මාදිලි නිෂ්පාදනය කරයි.
- පරිසරය: පුස්තකාල අනුවාද, දෘඪාංග (CPU/GPU), මෙහෙයුම් පද්ධතියට පවා ප්රතිඵලය වෙනස් කළ හැක.
- සැඟවුණු අවස්ථාව: නොසුරකින ලද අධි පරාමිතියක්, අතින් පෙර සැකසුම් පියවරක්, සටහන් නොකළ තේරීමක්.
ප්රතිනිෂ්පාදනය යනු "තිබීමට සතුටක්" නොව විද්යාත්මක හා ඉංජිනේරුමය අවශ්යතාවයකි. ප්රතිනිෂ්පාදනය කළ නොහැකි ප්රතිඵලයක් ඔප්පු කළ නොහැකි ප්රකාශයකි.
ප්රතිනිෂ්පාදනය කිරීමේ කුළුණු හතරක්
1. අහඹු බව නිවැරදි කරන්න. සියලුම අහඹු බීජ එක තැනක සකසන්න: දත්ත බෙදීම, ආකෘති ආරම්භ කිරීම, දත්ත මාරු කිරීම. ස්ථාවර බීජ යනු "ඔබ එකම ධාවනය නැවත නැවත කරන විට එකම ප්රතිඵලය" සහතිකයේ පදනමයි.
2. දත්ත අනුවාද කරන්න. එක් එක් අත්හදා බැලීම සිදු කළේ කුමන දත්ත අනුවාදයද යන්න සටහන් කරන්න (ඒකක 2 හි දත්ත අනුවාදනය). "නවතම දත්ත" අපැහැදිලි ය; "දත්ත අනුවාදය v3, hash abc123" නියමයි.
3. මාධ්යය කැටි කරන්න. සියලු පරායත්තයන් ඒවායේ නියම අනුවාදවලට අමුණන්න (උදා. numpy==1.26.4 වැනි නියම අනුවාදවල අවශ්යතා.txt, හෝ බහාලුම් රූපයක්). "නවතම අනුවාදය" එක් දිනක් සියල්ල බිඳ දමනු ඇත.
4. සෑම දෙයක්ම ලුහුබඳින්න (අත්හදා බැලීම් ලුහුබැඳීම). එක් එක් අත්හදා බැලීම සඳහා ස්වයංක්රීයව සුරකින්න: කේත අනුවාදය (git කැපවීම), දත්ත අනුවාදය, සියලුම අධිපරිමාණ, ප්රමිතික සහ ප්රතිදාන ව්යුහයන්. MLflow, Weights & Biases වැනි අත්හදා බැලීම් ලුහුබැඳීමේ මෙවලම් මෙය ක්රමානුකූලව සිදු කරයි. ලියාපදිංචියකින් තොරව, "හොඳම සැකසුම කුමක්ද" යන ප්රශ්නයට පිළිතුරු නොලැබේ.
අවවාදයයි: "මම පසුව මතක තබා ගන්නෙමි" යනු වඩාත්ම මිල අධික බොරුවයි. සති දෙකකට පසු, ඔබ භාවිතා කළේ කුමන බීජය, කුමන දත්තද, කුමන අධි පරාමිතියද යන්න ඔබට මතක නැත. ස්වයංක්රීය ලුහුබැඳීම මතකය මත යැපීම ඉවත් කරයි.
දුර්වල ප්රවේශය / ශක්තිමත් ප්රවේශය
දුර්වල: "මම හොඳම ආකෘතිය සොයා ගත්තා, එය සටහන් පොතේ ඇත, මම හිතන්නේ එහි ලකුණු 89% ක් විය."
ශක්තිමත්: "පරීක්ෂණ ලුහුබැඳීමේ මෙවලමෙහි #147 ධාවනය කරන්න: git commit a3f9c, දත්ත අනුවාදය v3 (hash abc123), බීජ 42, සියලුම අධිපරිමාණ ලියාපදිංචි කර, PR-AUC 0.887 පරීක්ෂා කරන්න. මම නැවත එම විධානය ක්රියාත්මක කරන විට, මට එම ප්රතිඵලය ටිකෙන් ටික ලැබේ. registry හි මෙම ධාවනය මත ආකෘතිය රඳා පවතී."
වෙනස: ශක්තිමත් ප්රවේශය තුළ ප්රතිඵලය මතකය මත නොව, ස්ථාවර සහ අධීක්ෂණ දාමයක් මත පදනම් වේ. සෑම කෙනෙකුටම සෑම විටම එකම ප්රතිඵලය ලබා ගත හැකිය.
අවසානය සිට අවසානය දක්වා ව්යාපෘතිය: මොඩියුලයේ සංයෝජනය
දැන් අපි සම්පූර්ණ මොඩියුලයම තනි ව්යාපෘති ප්රවාහයකට ඒකාබද්ධ කරමු. සැබෑ ML පද්ධතියක් මෙම නැවතුම් හරහා ගමන් කරන අතර, එක් එක් නැවතුම පෙර එක මත ගොඩනැගේ:
- ගැටළු නිර්වචනය: අප විසඳන්නේ කුමක්ද, සාර්ථකත්වය මනින ආකාරය (ඒකකය 3: නිවැරදි මෙට්රික්, ව්යාපාරික සන්දර්භය). මෙට්රික් සහ එළිපත්ත ආරම්භයේ සිට පැහැදිලිය.
- දත්ත නල මාර්ගය: එකතු කිරීම, වලංගු කිරීම, පිරිසිදු කිරීම, කාන්දු නොවන කොටස් කිරීම, අනුවාද කිරීම (ඒකකය 2).
- ආදර්ශ සංවර්ධනය: පුහුණුව, මූලික සංසන්දනය, හරස් වලංගුකරණය, දෘඪ බීජ (ඒකකය 3 + මෙම ඒකකය).
- LLM සංරචක (අදාළ නම්): RAG (ඒකක 4) සහ/හෝ නියෝජිතයන් (ඒකක 5); අවශ්ය නම් සියුම් සුසර කිරීම (ඒකකය 6).
- ඇගයීම: දාර සහ ආරක්ෂක අවස්ථා සහිත eval පොකුර, LLM පද්ධතිවල බහු-ස්ථර eval (ඒකකය 8).
- යුක්තිය සහ ආචාර ධර්ම විගණනය: උප සමූහ විශ්ලේෂණය, ආදර්ශ කාඩ්පත, පැහැදිලි කිරීමේ හැකියාව (ඒකක 10).
- ආරක්ෂක විගණනය: ක්ෂණික එන්නත් කිරීම, පෞද්ගලිකත්වය, සැපයුම් දාමය (ඒකකය 9).
- බෙදා හැරීම: ඇසුරුම්කරණය, ක්රමයෙන් බෙදා හැරීම, ආපසු හැරවීම, ආකෘති ලියාපදිංචිය (ඒකකය 7).
- අධීක්ෂණය: තට්ටු තුනක නිරීක්ෂණ, ප්ලාවිත අනතුරු ඇඟවීම් (ඒකකය 8).
- ප්රතිනිෂ්පාදනය: බීජ, දත්ත අනුවාදය, මාධ්ය සහ සම්පූර්ණ දාමය පුරා අත්හදා බැලීම් ලුහුබැඳීම (මෙම ඒකකය).
මෙම ප්රවාහයේදී, AI යනු සෑම නැවතුමකදීම ත්වරණකාරකයක් සහ බ්ලූපින්ට් උත්පාදකයක් වේ; නමුත් මෙට්රික් තේරීම, දත්ත තීරණ, සාධාරණත්වය ප්රමුඛත්වය, යෙදවීමේ සීමාව සහ මුදා හැරීම අනුමත කිරීම - තීරණාත්මක තීරණ මිනිසා සමඟ පවතී. මොඩියුලයේ සාරය මෙයයි.
ලේඛනගත කිරීම: අනාගතය ඔබට ස්තුති කරනු ඇත
හොඳ ML ව්යාපෘතියක් ලේඛනගත කරයි. අවම වශයෙන්, පහත සඳහන් දෑ ලිවිය යුතුය: ගැටළු සහ සාර්ථක නිර්ණායක, දත්ත මූලාශ්ර සහ අනුවාදය, ආකෘති තේරීම් සහ සාධාරණීකරණය, ඇගයීම් ප්රතිඵල (උප කණ්ඩායම් ඇතුළුව), දන්නා සීමාවන් සහ අවදානම්, යෙදවීම සහ ලබා ගැනීමේ ක්රියා පටිපාටිය, අධීක්ෂණ සැලැස්ම. මෙම ලේඛනය මාස හයකට පසු ව්යාපෘතියට නැවත පැමිණෙන පුද්ගලයාගේ හොඳම මිතුරා (සමහර විට එය ඔබ විය හැකිය).
කුඩා නඩු තුනක්
නඩුව 1 - නැතිවූ ප්රතිඵලය. ඉන්ජිනේරුවෙක් නියම මාදිලියක් පුහුණු කළා, නමුත් ඔහු බීජය සවි කළේ නැත, දත්ත අනුවාදය සුරැකුවේ නැත. ඔහු රැකියාවෙන් ඉවත් වූ විට, කිසිවෙකුට එම ප්රතිඵලය ප්රතිනිෂ්පාදනය කළ නොහැකි විය; මෙම ආකෘතිය "කළු පෙට්ටියේ පුරාවෘත්තයක්" බවට පත් වූ අතර අවසානයේ මුල සිටම ගොඩනඟන ලදී. සති ගණන් අපතේ ගියා. පාඩම: ප්රතිනිෂ්පාදනය කළ නොහැකි ප්රතිඵලයක් යනු නොපවතින ප්රතිඵලයකි.
නඩුව 2 - පරිසරය කඩා වැටීම. එක් කණ්ඩායමක් යැපීම් සවි කර නොතිබුණි. පුස්තකාලයක් ස්වයංක්රීයව යාවත්කාලීන වූ විට, ආකෘති නිමැවුම් නිශ්ශබ්දව වෙනස් වී නිෂ්පාදනය අඩාල විය. ගැටලුව සොයා ගැනීමට දින කිහිපයක් ගත විය. පරායත්තතා ශීත කළ විට සහ නිශ්චිත අනුවාද සමඟ බහාලන විට, ගැටළුව නැවත ඇති නොවීය. පාඩම: පරිසරය කැටි කරන්න.
නඩුව 3 - නිරීක්ෂණ බලය. කණ්ඩායමක් සෑම අත්හදා බැලීමක්ම ස්වයංක්රීයව නිරීක්ෂණය කරයි. මාස තුනකට පසුව, නියාමන විගණනයකදී, ඔවුන් "කුමන දත්ත සමඟ, කුමන සැකසුම් සමඟ, කුමන කණ්ඩායම් තුළ එය ලබා ගත්තේද?" යන ප්රශ්නයට පිළිතුරු දුන්හ. මිනිත්තු කිහිපයකින් සම්පූර්ණ පටිගත කිරීමක් සමඟ. පරීක්ෂාව සුමටව සිදු විය. පාඩම: අධීක්ෂණය යනු ඉංජිනේරුමය එකක් පමණක් නොව අනුකූලතා මෙවලමකි.
පිටපත් කළ හැකි සැකිලි
මෙම ML ව්යාපෘතිය සඳහා ප්රතිනිෂ්පාදන පරීක්ෂාවක් කරන්න.- සියලුම අහඹු බීජ ස්ථාවරද (බෙදීම, ආරම්භ කිරීම, කලවම් කිරීම)?- දත්ත අනුවාදනය කර තිබේද?- පරායත්තතා නිශ්චිත අනුවාදවලට ශීත කළද?- සෑම අත්හදා බැලීමක්ම (කේත කැපවීම, දත්ත, අධිපරාමිතිය, මෙට්රික්) ලුහුබැඳ තිබේද? එක් එක් නැතිවූ තීරුව සඳහා එය සවි කරන්නේ කෙසේද යන්න පිළිබඳ සංයුක්ත පියවර ලියන්න. ව්යාපෘති ව්යුහය: [විස්තරය]
මෙම අන්තයේ සිට අවසානය දක්වා ML ව්යාපෘතිය සඳහා සැලසුම් ඇටසැකිල්ලක් නිෂ්පාදනය කරන්න. ගැටලුව: [විස්තරය] පහත නැවතුම් ආවරණය කර එක් එක් නැවතුමේ මානව තීරණය ඇති ස්ථානය සලකුණු කරන්න: ගැටලුව/මිතික, නල මාර්ගය, ආකෘතිය, (RAG/agent/fine-tune?), eval, fairness, ආරක්ෂාව, බෙදා හැරීම, අධීක්ෂණය, ප්රතිනිෂ්පාදනය. එක් එක් නැවතුම සඳහා ප්රධාන අවදානම් සහ සත්යාපන පියවර ලියන්න.
මෙම ව්යාපෘතිය සඳහා තාක්ෂණික ලියකියවිලි ආකෘතියක් නිෂ්පාදනය කරන්න. අංශ: ගැටළු+සාර්ථකත්ව නිර්ණායක, දත්ත (මූලාශ්රය+අනුවාදය), ආදර්ශ තේරීම්+සාධාරණීකරණය, ඇගයීම (උප කණ්ඩායම් ඇතුළුව), දන්නා සීමාවන්+අවදානම, යෙදවීම+ආපසු හැරීම, අධීක්ෂණ සැලැස්ම. එක් එක් කොටස සඳහා පිරවිය යුතු ක්ෂේත්ර ප්රශ්න ලෙස දෙන්න.
මගේ අත්හදා බැලීම් අධීක්ෂණ සැකසුම පරීක්ෂා කරන්න: එය සෑම ධාවනයකදීම ස්වයංක්රීයව සුරකියිද: git කැපවීම, දත්ත අනුවාදය/hash, සියලු අධිපරිමාණ, සියලු ප්රමිතික, පරිසරය (පුස්තකාල අනුවාද)? මම නැවත එම ධාවනයම ධාවනය කරන විට මට එම ප්රතිඵලයම ලැබේද? සැකසුම: [විස්තරය]. අඩුපාඩු සහ නිවැරදි කිරීම් ලැයිස්තුගත කරන්න.
ප්රතිනිෂ්පාදන තීරු වගුව
තීරුව
ස්ථාවර දේ
වාහන උදාහරණය
අහඹු බව
සියලුම බීජ
බීජ සැකසීම
දත්ත
දත්ත අනුවාදය/හැෂ්
DVC
පරිසරය
පුස්තකාල අනුවාද
අවශ්යතා පින්, ඩොකර්
අධීක්ෂණය
කේතය+දත්ත+සැකසීම්+මෙට්රික්
MLflow, W&B
පොදු වැරදි
- බීජ සවි කිරීම නොවේ. ප්රතිඵලය නැවත නැවතත් කළ නොහැක.
- දත්ත අනුවාදය සුරැකීම නොවේ. "මොන දත්ත සමඟද?" පිළිතුරු නොමැතිව පවතී.
- ඇබ්බැහිවීම් කැටි කිරීම නොවේ. යාවත්කාලීනයක් නිහඬව සියල්ල බිඳ දමනු ඇත.
- අත්හදා බැලීම් මතකයට තබයි. සති දෙකකට පසු කිසිවක් මතක නැත.
- තීරණාත්මක තීරණ කෘතිම බුද්ධියට භාර දීම. ප්රමිතික, යුක්තිය සහ බෙදා හැරීමේ තීරණ මිනිසුන් සමඟ පැවතිය යුතුය.
- ලියකියවිලි කල් දැමීම. අනාගත කණ්ඩායම (සහ ඔබ) මිල ගෙවයි.
සාරාංශයක් ලෙස
ප්රතිනිෂ්පාදනය යනු බරපතල ML ඉංජිනේරු විද්යාවේ අත්සනයි: ප්රතිනිෂ්පාදනය කළ නොහැකි ප්රතිඵලය වන්නේ ඔප්පු කළ නොහැකි ප්රකාශයයි. එය තීරු හතරක් සමඟ පැමිණේ - අහඹු බව නිවැරදි කිරීම, අනුවාද දත්ත, කැටි පරිසරය, එක් එක් අත්හදා බැලීම නිරීක්ෂණය කරන්න. අන්තයේ සිට අවසානය දක්වා වූ ව්යාපෘතියක් මෙම මොඩියුලයේ සියලුම නැවතුම් (මෙට්රික්, දත්ත, ආකෘතිය, LLM සංරචක, eval, සාධාරණත්වය, ආරක්ෂාව, බෙදා හැරීම, අධීක්ෂණය) අන්තර් සම්බන්ධිත දාමයක් තුළ ඒකාබද්ධ කරයි; කෘත්රිම බුද්ධිය සෑම නැවතුමකදීම ත්වරකයකි, නමුත් තීරණාත්මක තීරණ මිනිසා සමඟ පවතී. සෑම දෙයක්ම ලේඛනගත කරන්න - අනාගත කණ්ඩායම සහ විගණන සඳහා. මෙම විනය යනු ඔබ මොඩියුලය පුරා ඉගෙන ගන්නා සෑම දෙයක්ම පවත්වා ගෙන යන රාමුවයි.
යෙදුම් කාර්යය
ප්රතිනිෂ්පාදන කුළුණු හතරකට එරෙහිව ML ව්යාපෘතියක් පරීක්ෂා කරන්න: බීජ වෙනස් කළ නොහැකිද, දත්ත අනුවාදනය කර තිබේද, පරිසරය ශීත කළද, අත්හදා බැලීම් නිරීක්ෂණය කර තිබේද? නැතිවූ තීරු නිවැරදි කර ඔබට එකම ධාවනය දෙවරක් ධාවනය කර එකම ප්රතිඵලය ලබා ගත හැකි බව ඔප්පු කරන්න. ඉන්පසුව එක් පිටුවක ව්යාපෘතියේ අවසානය සිට අවසානය දක්වා ප්රවාහය (නැවතුම් 10ක්) ප්රතිදානය කර සෑම නැවතුමකදීම "මිනිස් තීරණය කොතැනද" යන්න සලකුණු කරන්න. අවසාන වශයෙන්, කෙටි තාක්ෂණික ලියකියවිලි කෙටුම්පතක් ලියන්න.
පිරික්සුම් ලැයිස්තුව
- [ ] සියලුම අහඹු බීජ සවි කර ඇත.
- [ ] සෑම අත්හදා බැලීමක් සමඟම දත්ත අනුවාදය/හැෂ් වාර්තා කරනු ලැබේ.
- [ ] යැපීම් ස්ථිර අනුවාදවලට (පින්/බහාලුම්) ශීත කර ඇත.
- [ ] සෑම අත්හදා බැලීමක්ම ස්වයංක්රීයව නිරීක්ෂණය කෙරේ (කේත+දත්ත+සැකසුම+මෙට්රික්).
- [ ] මම එකම ධාවනය නැවත නැවත කරන විට, මට එකම ප්රතිඵලය ලැබේ.
- [ ] අවසානයේ සිට අවසානය දක්වා ප්රවාහයේ තීරණාත්මක තීරණ ගනු ලබන්නේ මිනිසුන් විසින් බව මම සත්යාපනය කර ලේඛනගත කළෙමි.
මොඩියුල විභාගය
1. ML ඉංජිනේරුවෙකු ලෙස, වැඩ ප්රවාහයේ කෘතිම බුද්ධිය ස්ථානගත කිරීමේදී හොඳම ප්රවේශය කුමක්ද?
- A) AI යනු අඩු අවදානම් ව්යාපාරවල ත්වරකයකි; ප්රමිතික, දත්ත සහ නිෂ්පාදනය වැනි තීරණාත්මක තීරණ වලංගු වන අතර මිනිසාට ඉතිරි වේ ✔
- B) AI ප්රතිදානයන් හොඳ පෙනුමක් ඇති තාක් කල්, සත්යාපනය අවශ්ය නොවේ
- C) කෘත්රිම බුද්ධියට ආකෘතිය නිෂ්පාදනය කිරීමට තීරණය කිරීම කාලය ඉතිරි කරයි.
- D) කෘතිම බුද්ධිය ප්රයෝජනවත් වන්නේ පෙළ ලිවීම සඳහා පමණි, එයට දත්ත සහ ආකෘති වැඩ සමඟ කිසිදු සම්බන්ධයක් නැත
විස්තරය: AI යනු අඩු අවදානම් සහිත, පහසුවෙන් සත්යාපනය කළ හැකි කේත, දත්ත ජීර්ණය සහ ලේඛන වැනි කාර්යයන් සඳහා ප්රබල ත්වරණයකි; කෙසේ වෙතත්, මුදල්, රහස්යභාවය සහ නීතිමය වගකීම් වලට බලපාන, මෙට්රික් තේරීම, දත්ත පුහුණුවට ඇතුළත් කිරීම සහ ආකෘතිය නිෂ්පාදනයට ඇතුළත් කිරීම වැනි තීරණ සඳහා වගකීම සුදුසුකම් ලත් ඉංජිනේරුවරයා සහ කණ්ඩායම සතු වේ. සෑම ප්රතිදානයක්ම සත්යාපනයකින් තොරව භාවිතා නොකළ යුතුය.
2. දත්ත නල මාර්ගයක ආරම්භයේ ස්කීමා වලංගුකරණය තබා ඇත්තේ ඇයි?
- A) එය සෘජුවම ආකෘතියේ නිරවද්යතාව වැඩි කරන බැවිනි
- B) එය දත්ත අනුවාදනය අනවශ්ය කරයි
- C) එය දූෂිත දත්ත මුල්ම සහ ලාභම අවස්ථාවේදී අල්ලාගෙන එය ඊළඟ පියවරවලට කාන්දු වීම වළක්වන නිසා ✔
- D) එය ලේබල් කිරීමේ අවශ්යතාවය ඉවත් කරන බැවිනි
පැහැදිලි කිරීම: කලින් දූෂිත දත්ත හසු වූ විට, එය නිවැරදි කිරීම ලාභදායී වේ. යෝජනා ක්රම වලංගුකරණය රේඛාවේ ආරම්භයේදී අපේක්ෂිත වර්ගය සහ පරාසයෙන් පිටත දත්ත ප්රතික්ෂේප කිරීම මගින් දූෂිත දත්ත පුහුණුවට හෝ නිෂ්පාදනයට නිශ්ශබ්දව කාන්දු වීම වළක්වයි (උදා: ඒකක වෙනස් වීමත් සමඟ මිල 100x මාරු වීම); නිෂ්පාදනයේදී අල්ලා ගන්නා ලද එම දෝෂය බොහෝ වාරයක් මිල අධික වේ.
3. කාලය (කාල ශ්රේණිය) සම්බන්ධ ගැටලුවකදී පුහුණුව සහ පරීක්ෂණයට දත්ත බෙදීමේදී නිවැරදි ප්රවේශය කුමක්ද?
- A) එය සැමවිටම සාධාරණම ක්රමය වන බැවින් අහඹු ලෙස බෙදීම භාවිතා කිරීම
- B) තාවකාලික බෙදීම භාවිතා කිරීම: අතීතය සමඟ පුහුණු කිරීමෙන් සහ අනාගතයේදී පරීක්ෂා කිරීමෙන් කාන්දු වීම වැළැක්වීම ✔
- C) පුහුණුව සහ පරීක්ෂා කිරීම යන දෙකම ලෙස සියලු දත්ත භාවිතා කිරීම
- D) පුහුණුවට පෙර පරිමාණ පරාමිතීන් වෙත පරීක්ෂණ දත්ත ඇතුළත් කිරීම
පැහැදිලි කිරීම: කාල ශ්රේණි මත අහඹු ලෙස බෙදීම, නිෂ්පාදනයේදී කිසිදා සිදු නොවන 'අනාගතය-දැකීමේ' වාසියක් ආකෘතියට ලබා දෙන අතර ප්රමිතික කෘත්රිමව පුම්බන (තාවකාලික කාන්දුව). නිවැරදි එක තාවකාලික බෙදීමයි: අතීතය සමඟ පුහුණු කරන්න, අනාගතයේදී පරීක්ෂා කරන්න. මෙය නිෂ්පාදනයේ තබා ගන්නා සැබෑ කාර්ය සාධනය මනිනු ලබයි.
4. 1.5% ක ධනාත්මක පන්ති අනුපාතයක් සහිත වංචා හඳුනාගැනීමේ ආකෘතියක නිරවද්යතාවය නොමඟ යවන්නේ ඇයි?
- A) අසමතුලිත දත්තවල නිරවද්යතාවය සැමවිටම අඩු නිසා
- B) නිරවද්යතාවය භාවිතා කළ හැක්කේ ප්රතිගාමී ගැටළු සඳහා පමණක් බැවිනි
- C) නිරවද්යතාවය ගණනය කිරීම සඳහා විශාල සැකසුම් බලයක් අවශ්ය වන බැවිනි
- D) බහුතර පන්තිය පුරෝකථනය කරන සොච්චම් ආකෘතියක් පවා ඉතා නිවැරදි විය හැකි අතර, එමගින් සැබෑ සාර්ථකත්වය සඟවයි ✔
පැහැදිලි කිරීම: අසමතුලිත දත්ත මත, 'සියල්ල සෘණාත්මකව අමතන්න' යැයි පවසන මූලික ආකෘතියක් පවා 98.5% ක නිරවද්යතාවයක් ලබා ගන්නා නමුත් එක වංචාවක්වත් හසු නොවේ. එබැවින්, අසමතුලිත වර්ගීකරණයේදී, නිරවද්යතාවය වෙනුවට නිරවද්යතාවය, නැවත කැඳවීම, F1 හෝ PR-AUC භාවිතා කරනු ලබන අතර, එක් එක් මෙට්රික් මූලික ආකෘතියකට අනුව අර්ථකථනය කෙරේ.
5. ආකෘතියක මෙට්රික් ගැන කතා කිරීමේදී මූලික සංසන්දනය අත්යවශ්ය වන්නේ ඇයි?
- A) මූලික ආකෘතිය සෑම විටම සැබෑ ආකෘතියට වඩා හොඳ නිසා
- B) මෙට්රික් එකක් අර්ථවත්ද නැද්ද යන්න පැහැදිලි වන්නේ සරල මූලික ආකෘතියක් හා සසඳන විට පමණක් ✔
- C) මූලික ආකෘතිය හරස් වලංගු කිරීම අනවශ්ය කරයි
- D) සෑම වාර්තාවකම මූලික ආකෘතිය නීත්යානුකූලව අවශ්ය වන බැවිනි
පැහැදිලි කිරීම: මෙට්රික් එකක් තනියම හොඳ හෝ නරක නැත; එය මූලික ආකෘතියකට අනුව හොඳ හෝ නරක ය. '85% නිවැරදි' යන වාක්යයේ තේරුම පාදක ආකෘතියට දැනටමත් 84%ක් ලැබෙන්නේ නම්, එය 50%ක් ලබා ගන්නේ නම්, සම්පූර්ණයෙන් වැදගැම්මකට නැති බවයි. සංසන්දනාත්මක නැංගුරමක් නොමැතිව, මෙට්රික් අර්ථ විරහිත ය.
6. RAG (Retrieval-Augmented Generation) පද්ධතියේ නිෂ්පාදන විමසුමට ඇතුළත් කළ යුතු වඩාත්ම තීරණාත්මක ආරක්ෂක අංගය කුමක්ද?
- A) ලබා දී ඇති මූලාශ්රය මත පමණක් විශ්වාසය තැබීමට උපදෙස්, මූලාශ්රය නොමැති නම් 'මම නොදනිමි' යැයි පැවසීමට සහ මූලාශ්රය උපුටා දැක්වීමට ✔
- B) හැකිතාක් දීර්ඝ හා නිර්මාණාත්මක පිළිතුරු නිෂ්පාදනය කරන ලෙස ආකෘතියට පැවසීම
- C) ආකෘතිය සම්පත් වලට වඩා තමන්ගේම අධ්යාපනික දැනුමට ප්රමුඛත්වය දෙයි
- D) විධාන ලෙස ගෙන එන ලේඛනවල සියලුම උපදෙස් ක්රියාත්මක කරන්න
පැහැදිලි කිරීම: RAG හි ඇති වැදගත්ම තනි උපදෙස වන්නේ ලබා දී ඇති මූලාශ්රය මත පමණක් රඳා පවතින ලෙස ආකෘතියට පැවසීම සහ තොරතුරු මූලාශ්රයේ නොමැති නම්, 'මම නොදනිමි' යනුවෙන් පවසා එය සකස් නොකර මූලාශ්රය උපුටා දක්වන්න. මෙම ත්රිත්වය නොමැතිව, ආකෘතිය සන්දර්භය නොසලකා හැර මායාවන් ඇති කළ හැකි අතර, පිළිතුර සත්යාපනය කළ නොහැක.
7. RAG පද්ධතියක් වැරදි පිළිතුරු ලබා දෙයි. රෝග විනිශ්චය ආරම්භ කිරීමට හොඳම ස්ථානය කොහිද?
- A) පළමුව ලබා ගැනීම මැනීම (Recall@K): නිවැරදි කෑල්ල කවදා හෝ පැමිණේද? ✔
- B) වහාම විශාල එකක් සමඟ ආකෘතිය ප්රතිස්ථාපනය කරන්න
- C) විමසුම අහඹු ලෙස වෙනස් කර දිගටම උත්සාහ කරන්න
- D) සියුම් සුසර කිරීම සමඟ සියලුම ලේඛන ආකෘතියට ඇතුළත් කිරීම
පැහැදිලි කිරීම: RAG හි දුර්වලම සබැඳිය සාමාන්යයෙන් ලබා ගැනීම මිස නිෂ්පාදනය නොවේ. නිවැරදි කොටස කවදාවත් ගෙනාවේ නැත්නම්, prompt එක කොච්චර දියුණු කළත්, model එකට ඒ තොරතුරු නිෂ්පාදනය කරන්න බැහැ. එබැවින්, නිවැරදි කොටස පැමිණ ඇත්දැයි බැලීමට පළමුව Recall@K මනිනු ලැබේ; ලබා ගැනීම හොඳ නම්, නිෂ්පාදනය සහ ක්ෂණිකව පරීක්ෂා කරනු ලැබේ.
8. නියෝජිතයෙකුට මෙවලමක් ලබා දීමේදී මානව අනුමැතිය පිටුපස තැබිය යුතු ක්රියා මොනවාද?
- A) කිසිවක් නැත; නියෝජිතයාට සෑම ක්රියාවක්ම ස්වයංක්රීයව සිදු කිරීමට හැකි විය යුතුය
- B) දත්ත කියවීම සහ සෙවීම වැනි ආපසු හැරවිය හැකි ක්රියා පමණි
- C) මුදල් මාරු කිරීම, මකා දැමීම, යැවීම ✔ වැනි ආපසු හැරවිය නොහැකි හෝ ඉහළ බලපෑම් ක්රියා
- D) ගණනය කිරීම් පමණක් ඇතුළත් වන ක්රියා
විස්තරය: ක්රියාවන් අවදානම් මට්ටම අනුව වෙන් කරනු ලැබේ. කියවීම, සෙවීම, ගණනය කිරීම සහ කෙටුම්පත් ජනනය කිරීම වැනි ආපසු ලබාගත හැකි කාර්යයන් ස්වයංක්රීයව සිදු කළ හැකිය; කෙසේ වෙතත්, මුදල් මාරු කිරීම, ඊමේල් යැවීම, දත්ත මකා දැමීම, ඇණවුම් කිරීම යනාදී ආපසු හැරවිය නොහැකි හෝ ඉහළ බලපෑමක් ඇති ක්රියාවන්ට මානව අනුමැතිය අවශ්ය වේ. ආපසු හැරවිය නොහැකි සෑම ක්රියාවක්ම කැමැත්තට යටත් විය යුතුය.
9. වක්ර කඩිනම් එන්නත් කිරීමේ අවදානමට එරෙහිව හොඳම නිර්මාණ ප්රවේශය කුමක්ද?
- A) පද්ධති විමසුමට 'ignore bad instruction' යන තනි වාක්යයක් එක් කිරීම ප්රමාණවත් වේ
- B) බාහිර අන්තර්ගතයේ උපදෙස් මත විශ්වාසය තැබීමෙන් ආකෘතියට වැඩි බලයක් ලබා දෙන්න
- ඇ) එන්නත් කිරීම වැළැක්විය නොහැකි බැවින් කිසිදු පූර්වාරක්ෂාවක් නොගැනීම
- D) බාහිර අන්තර්ගතය විශ්වාස කළ නොහැකි දත්ත ලෙස හුදකලා කිරීම සහ අවම අවසරය, අනුමැතිය සහ ප්රතිදාන පාලනයක් සහිත ස්ථර ආරක්ෂණ ස්ථාපනය කිරීම ✔
විස්තරය: වෙබ් පිටුවක්, ලේඛනයක්, විද්යුත් තැපෑලක් වැනි, නියෝජිතයා හෝ RAG විසින් සකසන ලද බාහිර අන්තර්ගතය විශ්වාස නොකළ දත්ත වන අතර රහස් උපදෙස් අඩංගු විය හැක. නිවැරදි ප්රවේශය වන්නේ ස්ථර ආරක්ෂාවයි: බාහිර අන්තර්ගතය පැහැදිලි පරිසීමක සහිත 'දත්ත මිස විධාන' ලෙස හුදකලා කිරීම, අවම අවසරය යෙදීම, ආපසු හැරවිය නොහැකි ක්රියාවන් මානව අනුමැතියට බැඳීම සහ ප්රතිදානය විගණනය කිරීම. උපදෙස් මාලාවක් පමණක් ප්රමාණවත් නොවේ.
10. ගැටලුවක් සියුම් සුසර කිරීම හෝ RAG මගින් විසඳිය යුතුද යන්න තීරණය කිරීමේදී ප්රධාන වෙනස කුමක්ද?
- A) තොරතුරු ගැටළු RAG සමඟ වඩා හොඳින් විසඳනු ලැබේ, හැසිරීම්/ආකෘති ගැටළු සියුම් සුසර කිරීම සමඟ වඩා හොඳින් විසඳනු ලැබේ ✔
- B) සෑම ගැටලුවක්ම සෑම විටම සියුම් ලෙස සකස් කිරීමෙන් විසඳිය යුතුය
- C) RAG භාවිතා කරනු ලබන්නේ කේත උත්පාදනය සඳහා පමණි, සියුම් සුසර කිරීම භාවිතා කරනුයේ පරිවර්තනය සඳහා පමණි
- D) සියුම් සුසර කිරීම සැමවිටම RAG වලට වඩා ලාභදායී සහ වේගවත්ව යාවත්කාලීන කළ හැක
පැහැදිලි කිරීම: ආදර්ශයට නව තොරතුරු ඉගැන්වීමේදී සියුම් සුසර කිරීම දුර්වල සහ අවදානම් සහගත ය; නමුත් හැසිරීම, ආකෘතිය, ස්වරය සහ ශෛලිය ඉගැන්වීමේ බලවත් වේ. 'ආදර්ශ සමාගම අපගේ දත්ත නොදනී' තොරතුරු ගැටළුවක් වන අතර එය RAG ට අයත් වේ. 'ආදර්ශය සැමවිටම අපගේ දැඩි ආකෘතියෙන් ප්රතිදානය කිරීමට ඉඩ දෙන්න' යනු හැසිරීමේ ගැටලුවක් වන අතර මනාව සකස් කිරීම සඳහා අපේක්ෂකයෙකි. අතිරේකව, සියුම්ව සුසර කිරීමට පෙර ක්ෂණික සහ කිහිපයක්-වෙඩි පරිභෝජනය කළ යුතුය.
11. නව මාදිලියක් නිෂ්පාදනයට යෙදවීමේදී ආරක්ෂිතව යෙදවීම සඳහා අනිවාර්ය වන්නේ කුමක්ද?
- A) මාදිලිය පරීක්ෂා කිරීමේදී හොඳ නම්, එය 100% තදබදයට කෙලින්ම විවෘත කරන්න
- B) යෙදවීමෙන් පසු අධීක්ෂණය කිසිසේත්ම සකස් නොකිරීම
- C) අදියර යෙදවීම (සෙවණ / කැනරි) සහ පෙර-පරීක්ෂා කළ ආපසු හැරීමේ සැලැස්ම ✔
- D) ඇගයීම් සීමාව සපුරා නොමැති වුවද ආකෘතිය ප්රකාශයට පත් කිරීම
පැහැදිලි කිරීම: සියලුම රථවාහන සඳහා සෘජුවම නව මාදිලිය විවෘත කිරීම අවදානම් සහිතයි; වැරදුනොත් හැමෝටම බලපානවා. නිවැරදි දෙය නම් එය ක්රමානුකූලව බෙදා හැරීමක් (සෙවණැල්ල, කැනරි) වන අතර සෑම බෙදාහැරීමකටම පරීක්ෂා කරන ලද ආපසු හැරීමේ සැලැස්මක් ඇත. clawback සැලැස්මක් නොමැතිව බෙදාහැරීමක් සම්පූර්ණ නොවේ; මිනිත්තු කිහිපයකින් පෙර අනුවාදය වෙත ආපසු යාමට හැකි වීම, ආකෘතිය නිෂ්පාදනයේදී අනපේක්ෂිත ලෙස හැසිරෙන විට පරිශීලකයා ආරක්ෂා කරයි.
12. ML ආකෘතියක් නිෂ්පාදනයේදී 'නිහඬව' අසමත් වන්නේ කෙසේද සහ මෙය අල්ලා ගත හැකි මාර්ගය කුමක්ද?
- A) ආකෘතිය කඩා වැටේ; සේවාදායක ලඝු-සටහන් මෙය පෙන්වයි
- B) වැරදි නොකර වැරදි අනාවැකි ඉදිරිපත් කිරීමෙන්; ✔ එය මෙහෙයුම්, ආදාන සහ ප්රතිදාන ස්ථර නිරීක්ෂණ ග්රහණය කරයි
- C) ආකෘතිය කිසි විටෙකත් නිශ්ශබ්දව අසමත් විය නොහැක, සෑම විටම අනතුරු අඟවයි
- D) කිසියම් පිරිහීමක් අල්ලා ගැනීමට ප්රමාදය නිරීක්ෂණය කිරීම ප්රමාණවත් වේ
පැහැදිලි කිරීම: බිඳ වැටීමකින් හෝ දෝෂ ලබා දීමකින් තොරව වැරදි අනාවැකි ඉදිරිපත් කිරීමෙන් ආකෘතිය අසාර්ථක විය හැක; මෙයට ප්රධාන හේතුව දත්ත ප්ලාවිතය සහ සංකල්ප ප්ලාවිතයයි. මෙහෙයුම් ප්රමිතික (ප්රමාදය, දෝෂ අනුපාතය) නිරීක්ෂණය කිරීම පමණක් ප්රමාණවත් නොවේ; ආදාන ව්යාප්තිය සහ ප්රතිදානය/අනාවැකි ව්යාප්තිය ද නිරීක්ෂණය කළ යුතුය. සැබෑ ප්රතිඵලය ප්රමාද වුවහොත් ආදාන ප්ලාවිතය පූර්ව අනතුරු ඇඟවීමක් ලබා දෙයි.
13. LLM පද්ධතියක් ඇගයීම සඳහා LLM-as-judge භාවිතා කිරීමේදී අත්යවශ්ය වන මූලධර්මය කුමක්ද?
- A) LLM-තීරකවරයා සැමවිටම නිවැරදියි, මානව සත්යාපනය අනවශ්යයි
- B) විනිසුරුවරයා තීරණයක් ගත යුත්තේ පිළිතුරේ දිග මත පමණි.
- C) විනිසුරුවන් භාවිතා කරන විට නීති මත පදනම් වූ පාලනයන් සහ මානව ඇගයීම සම්පූර්ණයෙන්ම ඉවත දැමිය යුතුය
- D) විනිසුරු ලකුණු මානව ලේබල් කළ නියැදියකින් ක්රමාංකනය කළ යුතු අතර ඒවා විශ්වාස කිරීමට පෙර ඒවායේ නැඹුරුව මැනිය යුතුය ✔
විස්තරය: LLM-තීරකය ද ආකෘතියකි; එය මායාව, පක්ෂග්රාහී (දිගු, විශ්වාසදායක පිළිතුරු වලට අනුග්රහය දැක්වීම) සහ නොගැලපෙන විය හැක. එබැවින්, විනිසුරු ලකුණු මානව ලේබල් කළ නියැදියක් සමඟ ක්රමාංකනය කළ යුතු අතර නිෂ්පාදන තීරණය ගැනීමට පෙර ඒවායේ ක්රමානුකූල නැඹුරුව මැනිය යුතුය. සත්යාපනය නොකළ විනිසුරුවරයෙකු ව්යාජ විශ්වාසයක් ලබා දෙයි.
14. ආදර්ශ නැඹුරුව තක්සේරු කිරීමේදී සමස්ත නිරවද්යතාවය දෙස බැලීම ප්රමාණවත් නොවන්නේ මන්ද?
- A) නරකම කණ්ඩායමේ කාර්ය සාධනය සැමවිටම පිළිබිඹු වන නිසා සමස්ත නිරවද්යතාවය ප්රමාණවත් වේ
- B) උප සමූහ අතර ක්රමානුකූල වෙනස (සැඟවුණු වෙනස්කම් කිරීම) සැඟවිය හැකි බැවින් සමස්ත නිරවද්යතාවය පමණක් ප්රමාණවත් නොවේ ✔
- C) නිරවද්යතාව යනු පක්ෂග්රාහී සමග කිසිදු සම්බන්ධයක් නැති මෙට්රික් එකක් වන බැවිනි
- D) Bias පැමිණෙන්නේ ආකෘතියෙන් පමණක් වන අතර දත්ත සමඟ කිසිදු සම්බන්ධයක් නැත.
පැහැදිලි කිරීම: සමස්ත නිරවද්යතාවය උප සමූහ අතර ක්රමානුකූල වෙනස්කම් සැඟවිය හැක. උදාහරණයක් ලෙස, සමස්ත නිරවද්යතාවය 88% වන අතර, එක් කණ්ඩායමක 91% සහ තවත් කණ්ඩායමක 67% විය හැක; ආකෘතිය ක්රමානුකූලව එම කණ්ඩායම මග හැරේ. එබැවින්, අනු කණ්ඩායම් (ජනවිද්යාව/ඛණ්ඩය) මත පදනම්ව ආකෘතිය ඇගයීමට ලක් කළ යුතු අතර යුක්තිය පිළිබඳ කුමන නිර්වචනයට ප්රමුඛත්වය දිය යුතුද යන්න පාර්ශවකරුවන් සමඟ තීරණය කළ යුතුය.
15. ML ප්රතිඵලයක් ප්රතිනිෂ්පාදනය කිරීම සඳහා එකට සවි කළ යුතු කරුණු හතර කුමක්ද?
- A) මාදිලියේ නම, ප්රමාණය, මිල සහ නිකුත් කරන දිනය පමණි
- B) GPU සන්නාමය සහ අන්තර්ජාල වේගය පමණි
- C) ආකෘතියේ අවසාන නිරවද්යතා ලකුණු පමණි; ඉතිරිය මතකයේ තබා ගත හැකිය
- D) සසම්භාවී බීජ, දත්ත අනුවාදය, පරිසරය (යැපීම් අනුවාද) සහ අත්හදා බැලීම් ලුහුබැඳීම ✔
විස්තරය: කුළුණු හතරක් හරහා ප්රතිනිෂ්පාදනය සාක්ෂාත් කරගනු ලැබේ: අහඹු බීජ සවි කිරීම, අනුවාද දත්ත (අනුවාදය/හැෂ්), පරිසරය කැටි කිරීම (නිශ්චිත පුස්තකාල අනුවාද/කන්ටේනරය), සහ එක් එක් අත්හදා බැලීම (කේත කැපවීම, දත්ත, අධිපරාමිතිය, මෙට්රික්). මෙම දාමය නොමැතිව එකම ප්රතිඵලය ප්රතිනිෂ්පාදනය කිරීමට නොහැකි ය; ප්රතිනිෂ්පාදනය කළ නොහැකි ප්රතිඵලයක් යනු ඔප්පු කළ නොහැකි ප්රකාශයකි.