ලාභ:
- ML කාර්ය ප්රවාහයේ (කේතය, දත්ත, ලේඛනය) කෘත්රිම බුද්ධිය අඩු අවදානමක් සහිතව කාලය ඉතිරි කරන්නේ කොතැනද සහ කාර්ය අවදානම් මට්ටමට අනුව මෙට්රික් / දත්ත / නිෂ්පාදනයට දැමීම වැනි තීරණ මිනිසාට ඉතිරි වන්නේ කොතැනදැයි වෙන්කර හඳුනා ගැනීමට හැකි වීම.
- එක් එක් AI ප්රතිදානය ප්රභවයට සම්බන්ධ කිරීමෙන්, එය නැවත ධාවනය කිරීමෙන්, මැනීමෙන් සහ ඉංජිනේරු පෙරහනක් හරහා ගමන් කිරීමෙන් සත්යාපනය කරන විනයක් යෙදීමේ හැකියාව.
- අමු රහස්ය සහ පුද්ගලික දත්ත බාහිර මෙවලම් වෙත නොයැවීම, ආයතනික අනුමැතිය ලත් මෙවලම් භාවිතා කිරීම සහ ආරක්ෂක ප්රශ්න ආරක්ෂක අරමුණු සඳහා පමණක් හැසිරවීමේ පුරුද්ද අත්කර ගැනීමේ හැකියාව.
යන්ත්ර ඉගෙනීමේ ඉංජිනේරු විද්යාවේ කෘතිම බුද්ධිය: භූමිකාව, සීමා මායිම්, වලංගුකරණය සහ වගකීම
යන්ත්ර ඉගෙනීමේ ඉංජිනේරුවෙකු (ML ඉංජිනේරුවෙකු: දත්ත වලින් නිෂ්පාදනයට ඉගෙන ගන්නා මාදිලි සැලසුම් කරන, පුහුණු කරන සහ ගෙන එන මෘදුකාංග වෘත්තිකයෙකි) අද ඔහුගේ රැකියාවේ සෑම පියවරකදීම තවත් කෘතිම බුද්ධි මෙවලමක් සමඟ ක්රියා කරයි. කේත ලිවීමේදී කේතීකරණ සහායකයක්, දත්ත ගවේෂණයේදී සංවාද ආකෘතියක් සහ ලේඛන නිෂ්පාදනය කිරීමේදී විශාල භාෂා ආකෘතියක් (LLM: පෙළ තේරුම් ගෙන නිෂ්පාදනය කරන බිලියන ගණනක පරාමිති සහිත ස්නායුක ජාලයක්) ක්රියාත්මක වේ. මෙම මොඩියුලය කෘතිම බුද්ධිය ML ඉංජිනේරුවෙකුගේ නිෂ්පාදනය සහ දෛනික වැඩ මෙවලම ලෙස සලකයි. භූමිකාවන් දෙක මිශ්ර නොකර වගකීමේ සීමාවන් පැහැදිලිව නිර්වචනය කිරීමෙන් එය ක්රියාත්මක වේ.
මෙම පළමු ඒකකය තුළ, අපි මූලික ප්රශ්නයට පිළිතුරු දෙමු: ML ඉංජිනේරු විද්යාවේදී කෘතිම බුද්ධිය තත්ය කාලය ඉතිරි කරන්නේ කොතැනද, සහ තීරණය මිනිසුන්ට භාර දිය යුත්තේ කොතැනින්ද? පිළිතුර ඉංජිනේරු විනයෙහි හදවතේ ඇත: සාදන තැනැත්තා වේගවත්ය, සත්යාපනය කරන්නා වගකිව යුතුය.
ML ඉංජිනේරු විද්යාවේදී කෘතිම බුද්ධිය ප්රයෝජනවත් වන්නේ කොතැනින්ද?
ML ව්යාපෘතියක් දළ වශයෙන් පහත රේඛා හරහා ගමන් කරයි: දත්ත එකතු කිරීම, දත්ත පිරිසිදු කිරීම, විශේෂාංග ඉංජිනේරු විද්යාව (අමු දත්ත ආකෘතියට තේරුම් ගත හැකි ඩිජිටල් සංඥා බවට පරිවර්තනය කිරීම), ආකෘති පුහුණුව, ඇගයීම, යෙදවීම (යෙදීම: සැබෑ පරිශීලකයාට ආකෘතිය විවෘත කිරීම) සහ අධීක්ෂණය. AI මෙම රේඛාවේ සෑම නැවතුමකදීම උපකාර කරයි, නමුත් එහි අධිකාරී මට්ටම වෙනස් වේ.
ඉහළ ප්රතිලාභ, අඩු අවදානම් සහිත ප්රදේශ: කේත ඇටසැකිල්ලක් නිෂ්පාදනය කිරීම, දත්ත පරිවර්තන ශ්රිතයක් කෙටුම්පත් කිරීම, ලොග් පණිවිඩ අර්ථ නිරූපණය කිරීම, තොග හෝඩුවාවක් විස්තර කිරීම, පරීක්ෂණ සටහන් සාරාංශ කිරීම, ලේඛන සහ READMEs ලිවීම, පරීක්ෂණ නඩුවක් යෝජනා කිරීම. මෙන්න, කෘතිම බුද්ධියේ වැරදි ලාභයි; මක්නිසාද යත් ප්රතිදානය දැනටමත් පරීක්ෂණ සහ සමාලෝචනය හරහා ගමන් කරනු ඇත.
ඉහළ අවදානම් ප්රදේශ: පුහුණුවට යන දත්ත තීරණය කිරීම, ආකෘතියක් නිෂ්පාදනයට යා යුතුද යන්න තහවුරු කිරීම, මෙට්රික් එකක් "ප්රමාණවත්" ලෙස විනිශ්චය කිරීම, පුද්ගලික දත්ත සැකසීමට තීරණය කිරීම, ආරක්ෂක අවදානමක් "කුණු" ලෙස වසා දැමීම. මේවා මුදල්, පෞද්ගලිකත්වය, නීතිමය වගකීම් සහ පරිශීලක විශ්වාසයට බලපායි. කෘතිම බුද්ධිය මෙහි යෝජනා ලබා දෙයි; තීරණය ගනු ලබන්නේ දක්ෂ ඉංජිනේරුවරයා සහ වගකිවයුතු කණ්ඩායම විසිනි.
ඉඟිය: AI වෙත කාර්යයක් බාහිරින් ලබා ගැනීමට පෙර, අසන්න: "මෙම ප්රතිදානය වැරදි නම් පිරිවැය කුමක්ද, සහ කවුරුන් හෝ එම වැරැද්ද අල්ලා ගන්නේ කෙසේද?" මිල අඩු නම් සහ අල්ලා ගැනීම පහසු නම්, එය ලබා දෙන්න. මිල වැඩි නම් හෝ අල්ලා ගැනීම අපහසු නම්, කෙටුම්පත සඳහා පමණක් AI භාවිතා කරන්න, ඔබ තීරණය කරන්න.
සත්යාපන විනය: පියවර තුනක්
ML ඉංජිනේරු විද්යාවේදී, AI ප්රතිදානය කිසි විටෙකත් “නිමි කාර්යයක්” නොවේ; එය කෙටුම්පතකි. මෙම පියවර තුන හරහා එක් එක් ප්රතිදානය ධාවනය කරන්න:
- එය මූලාශ්රය වෙත සම්බන්ධ කරන්න. ආකෘතිය අංකයක්, එළිපත්තක් හෝ "හොඳම භාවිතයක්" කීවේ නම්, එය නිල ලියකියවිලි, කේත පදනමේ සත්ය වටිනාකම හෝ මනින ලද මෙට්රික් මත පදනම් වේ. "ආකෘතිය සවි කිරීම" (මායාව: භාෂා ආකෘතිය මගින් සැබෑ නොවන තොරතුරු විශ්වාසදායක ලෙස නිෂ්පාදනය කිරීම) බොහෝ විට මෙහි අල්ලා ගනු ලැබේ.
- නැවත ආරම්භ කර මැනීම. ජනනය කරන ලද කේතය ක්රියාත්මක කරන්න, එය ඔබේම පරීක්ෂණ කට්ටලය මත නිපදවන මෙට්රික් නැවත ගණනය කරන්න, කුඩා නියැදියක යෝජිත SQL විමසුම වලංගු කරන්න. ලස්සනට පෙනුනත් ක්රියා නොකරන කේතයක් වටින්නේ නැහැ.
- එය ඉංජිනේරු පෙරහන හරහා යන්න. ප්රතිදානය පරිමාණයෙන් ඉහළ යයිද? එජ් කේස් (හිස් දත්ත, ඉතා විශාල ආදානය, නැතිවූ ක්ෂේත්ර) සලකා බලා තිබේද? ආරක්ෂාව සහ රහස්යතා කඩවීමක් තිබේද? මෙම පියවර කළ හැක්කේ ක්ෂේත්රය දන්නා කෙනෙකුට පමණි.
දුර්වල ක්ෂණික / ශක්තිමත් විමසුම
දුර්වල විමසුම: "මට ආදර්ශ පුහුණු කේතයක් ලියන්න."
බලගතු විමසුම: "sikit-learn සමඟ ද්විමය වර්ගීකරණය සඳහා පුහුණු පිටපතක් ලියන්න. ආදානය: data/train.parquet, ඉලක්ක තීරුව is_churn. පන්ති අසමතුලිතතාවයක් ඇත (ධනාත්මක අනුපාතය ~8%), class_weight සමඟ එය හසුරුවන්න. PR-AUC භාවිතා කරන්න (නිරවද්ය-මතක වක්රය යටතේ ඇති ප්රදේශය) දත්ත ප්රමිතික විමෝචන ප්රමිතිකය, වැරදි ලෙස ගැලපීම සඳහා වන නිසා. සසම්භාවී බීජය 42 ට සවි කරන්න. PR-AUC කේත මුද්රණ කට්ටලය අවසානයේ පරීක්ෂා කරන්න."
වෙනස: දෙවන කඩිනම් කාර්යයේ දත්ත සත්යය, නිවැරදි මෙට්රික්, අසමතුලිතතා තොරතුරු සහ පුනරාවර්තන අවශ්යතාවය අඩංගු වේ. ප්රතිදානය සත්යාපනය කළ හැකි සහ භාවිත කළ හැකි වන්නේ මෙම සන්දර්භයෙනි.
පුද්ගලිකත්වය සහ දත්ත ආරක්ෂාව: ඉංජිනේරුවරයාගේ පළමු වගකීම
ML ඉංජිනේරුවරයා බොහෝ විට සමාගමේ වඩාත්ම සංවේදී දත්ත ස්පර්ශ කරයි: පාරිභෝගික වාර්තා, ගනුදෙනු ඉතිහාසය, සෞඛ්ය හෝ මූල්ය දත්ත, නිෂ්පාදන පද්ධතිවල ලඝු-සටහන්. කෘතිම බුද්ධි මෙවලම් සඳහා දත්ත ලබා දීමේදී නීති තුනක්:
- අමු පුද්ගලික සහ රහස්ය දත්ත බාහිර මෙවලම් වෙත නොයවන්න. උදාහරණයක් ලෙස, පාරිභෝගික ඊමේල් විමසුමට ඇලවීම වෙනුවට, යෝජනා ක්රමය සහ ව්යාජ (කෘතිම) සාම්පල යවන්න. සැබෑ දත්ත වෙනුවට "උදා: ahmet@example.com" වැනි ආවරණ උදාහරණ භාවිතා කරන්න.
- ආයතනික අනුමත වාහන භාවිතා කරන්න. දත්ත සැකසෙන්නේ කොතැනද, එය ගබඩා කර තිබේද, අධ්යාපනය සඳහා භාවිතා කරන්නේද නැද්ද යන්න ගිවිසුම්ගතව පැහැදිලි මෙවලම් තෝරන්න. පුද්ගලික ගිණුමක් සමඟ ආයතනික දත්ත සැකසීම බොහෝ සමාගම්වල උල්ලංඝනය කිරීමකි.
- අවම දත්ත ප්රතිපත්තිය. කාර්යය විසඳීමට අවශ්ය අවම සන්දර්භය ලබා දෙන්න. සම්පූර්ණ වගුව නොව, අදාළ තීරු 5 සහ යෝජනා ක්රමය.
අවවාදයයි: ඔබ භාෂා ආකෘතියකට ලබා දෙන පාඨය පසුගමනය කළ නොහැකි යැයි උපකල්පනය කරන්න. "මම එය පසුව මකා දමමි" යැයි සිතා අමු පුද්ගලික දත්ත යවන්න එපා; එය යැවූ මොහොතේම අවදානම ඇති විය.
ආරක්ෂක ක්ෂේත්රයේ ආරක්ෂක භාවිතය
ML ඉංජිනේරුවන් බොහෝ විට ආරක්ෂක පද්ධති ස්ථාපනය කරයි: වංචා හඳුනාගැනීම, ද්වේෂසහගත ගමනාගමන වර්ගීකරණය, සත්යාපනය. මෙම මොඩියුලය පුරාවටම, අපි ආරක්ෂක ගැටළු ආවරණය කරන්නේ ආරක්ෂක අරමුණු සඳහා පමණි: ප්රහාරය හඳුනා ගැනීම, පද්ධතිය දැඩි කිරීම, අවදානම වැසීම. අනවසරයෙන් ප්රවේශ වීම, දත්ත කාන්දු වීම හෝ වෙනත් කෙනෙකුගේ පද්ධතියට අනවසර මැදිහත්වීම සඳහා කෘතිම බුද්ධිය භාවිතා කිරීම නීති විරෝධී මෙන්ම වෘත්තීය ආචාර ධර්මවලට පටහැනිය. ඔබ අවදානමක් සොයාගත් විට, නිවැරදි මාර්ගය වන්නේ එය වගකීමෙන් වාර්තා කර එය නිවැරදි කිරීමයි; ගසාකන්නේ නැත.
කුඩා නඩු තුනක්
නඩුව 1 - කාලය ඉතිරි වේ. ML ඉංජිනේරුවෙකු සාමාන්යයෙන් තීරු 40ක දත්ත කට්ටලයක ගවේෂණාත්මක දත්ත විශ්ලේෂණය (EDA) කරමින් දින භාගයක් ගත කරයි. ඔහු කෘත්රිම බුද්ධියට ස්කීමා සහ df.describe() ප්රතිදානය ලබා දී, "ඉහළ පිටස්තර සහ නැතිවූ අනුපාතයක් ඇති තීරු මොනවාද, ඔබ නිර්දේශ කරන්නේ කුමන පරිවර්තනද?" මිනිත්තු 20 කින්, ඔහුට ප්රමුඛතා ලැයිස්තුවක් ලැබුණි, සෑම අයිතමයක්ම එහිම කේතයෙන් සත්යාපනය කළේය. සුරකින්න: ~3 පැය, සෑම හිමිකම් පෑමක් ම මනින ලද නිසා දෝෂයේ අඩු අවදානම.
නඩුව 2 - අසු වූ දෝෂයකි. "පුහුණු කිරීමේ නිරවද්යතාවය 99%, විශිෂ්ටයි," ආකෘතියට කතාබස් සහායකයෙක් පැවසීය. ඉංජිනේරුවරයා තෙවැනි පියවර (ඉංජිනේරු පෙරහන) යෙදූ අතර අවබෝධ කරගත්තේය: ඉලක්ක තීරුවේ අහඹු ලෙස ගුණාංග කාන්දු වී ඇත (දත්ත කාන්දු වීම: ආකෘතිය පුහුණුවේදී නොපෙනෙන තොරතුරු දකියි). සැබෑ කාර්ය සාධනය බෙහෙවින් අඩු විය. ඉංජිනේරුවාගේ සංශයවාදය මිස AI හි "විශිෂ්ට" අර්ථ නිරූපණය නොවේ, කාර්යය ඉතිරි විය.
3 වන අවස්ථාව - රහස්යතා උල්ලංඝනය වැලැක්වීම. කණ්ඩායමක් නිෂ්පාදන දෝෂ ලොග් බාහිර ආකෘතියකට අලවා "මෙම දෝෂය නිවැරදි කරන්න" යැයි පවසමින් සිටියේය. ලොග් වල පාරිභෝගික හැඳුනුම් අංක තිබුණා. කණ්ඩායම මුලින්ම ලොග් ආවරණය කරන කුඩා ස්ක්රිප්ට් එකක් ලියා (ඔවුන්ගේ හැඳුනුම්පත් අංක *** බවට පත් කර) ඒවා ඒ ආකාරයෙන් යැවීමට නීතියක් සකස් කළේය. උල්ලංඝනය වීමේ අවදානම අතුරුදහන් වී ඇත, ආධාරයේ වේගය වෙනස් වී නැත.
පිටපත් කළ හැකි සැකිලි
කාර්යය: [කළ යුතු දේ, තනි වාක්ය] සන්දර්භය: [දත්ත සැලැස්ම, ප්රමාණය, සීමාවන්; සත්ය පුද්ගලික දත්ත නොමැත]බාධක: [භාෂාව/පුස්තකාලය, කාර්ය සාධනය, ප්රතිනිෂ්පාදනය]මිතික: [සාර්ථකත්වය මනින ආකාරය]අවශ්ය ප්රතිදානය: [කේතය/විස්තරය/ලැයිස්තුව] සහ ඇයි මෙම ආකෘතියෙන්
මෙම කේතය පරීක්ෂා කරන්න. එය ක්රියා කරන බව පමණක් නොව, ප්රකාරව ද ඇගයීමට ලක් කරන්න: 1) එජ් කේස් (හිස් ආදානය, නැතිවූ තීරුව, ඉතා විශාල දත්ත)2) දත්ත කාන්දු වීමේ අවදානම3) ප්රතිනිෂ්පාදනය (බීජය, අනුවාදය)ඔබ සොයා ගන්නා සෑම ගැටලුවක් සඳහාම විසඳුම් යෝජනා කරන්න. ඔබට විශ්වාස නැති තැන "සත්යාපනය" ලකුණු කරන්න. කේතය: [කේතය]
මෙම මෙට්රික් ප්රතිඵලය අර්ථකථනය කරන්න, නමුත් පළමුව අසන්න: මෙම ගැටලුව සඳහා මෙම මිතිකය නිවැරදිද? ගැටලුව: [සමතුලිත/අසමතුලිත වර්ගීකරණය, ප්රතිගමනය, ශ්රේණිගත කිරීම...]වාර්තා කරන ලද මෙට්රික් සහ අගය: [උදා. නිරවද්යතාවය 0.99]ඔබ නිර්දේශ කරන්නේ කුමන මෙට්රික් සහ ඇයි, සහ වත්මන් ප්රතිඵලය ගැන මා සැක කිරීමට මා සෙවිය යුතු ලකුණු මොනවාද?
පහත විමසුමට මා ලබා දෙන දත්තවල පුද්ගලික/රහසිගත තොරතුරු තිබේදැයි පරීක්ෂා කරන්න. පහත පෙළෙහි ආවරණය කළ යුතු ක්ෂේත්ර (නම, විද්යුත් තැපෑල, හැඳුනුම්පත අංකය, දුරකථනය, ලිපිනය) ලැයිස්තුගත කරන්න. පෙළ: [පෙළ]
කාර්යභාරය සහ අධිකාරී වගුව
ගවේෂණය
කෘතිම බුද්ධියේ කාර්යභාරය
තීරණයේ හිමිකරු
කේත ඇටසැකිල්ල / පරිවර්තන කාර්යය
කෙටුම්පත් උත්පාදක යන්ත්රය
ඉංජිනේරු (සමාලෝචන)
EDA / දත්ත සාරාංශය
ත්වරණකාරකය
ඉංජිනේරු (මිනීමෙන් තහවුරු කරයි)
මෙට්රික් අර්ථ නිරූපණය
යෝජනාව
ඉංජිනේරු
පුහුණුවට යන දත්ත මොනවාද?
යෝජනාව
කණ්ඩායම + දත්ත හිමිකරු
ආකෘතිය නිෂ්පාදනයට දමන්න
පිරික්සුම් ලැයිස්තු මතක් කිරීම
වගකිවයුතු ඉංජිනේරු + කණ්ඩායම
පුද්ගලික දත්ත සැකසීම
කිසිවක් නැත (භාවිතා කර නැත)
නීති + දත්ත පාලකය
පොදු වැරදි
- ප්රතිදානය වලංගු කිරීමකින් තොරව භාවිතා කිරීම. වඩාත්ම පොදු හා වඩාත්ම මිල අධික වැරැද්ද. හොඳ පෙනුමක් ඇති කේතය හෝ මෙට්රික් එය නිවැරදි බව අදහස් නොවේ.
- අමු රහස්ය දත්ත මෙවලමට ඇලවීම. එව්වහම ආපහු ගන්න බෑ.
- වැරදි මෙට්රික් මත විශ්වාසය තැබීම. අසමතුලිත දත්තවල නිරවද්යතාවය සහ ශ්රේණිගත කිරීමේ ගැටළු වල RMSE වැනි නොගැලපෙන ප්රමිතික නොමඟ යවන සුළුය.
- කෘතිම බුද්ධිය තීරණ ගන්නෙකු ලෙස වරදවා වටහා ගැනීම. ඔහු යෝජනා ඉදිරිපත් කරයි; වගකීම අත්සන් කරන්නාට පැවරේ.
- සන්දර්භ රහිත ක්ෂණික. "ආකෘතියක් ලියන්න" වැනි නොපැහැදිලි ඉල්ලීම් සත්යාපනය කළ නොහැකි ප්රතිදානයක් නිපදවයි.
සාරාංශයක් ලෙස
කෘත්රිම බුද්ධිය යනු ML ඉංජිනේරුවා සහ එහි දෛනික අනුවර්තකය විසින් වැඩි දියුණු කරන ලද නිෂ්පාදනයකි. කේත-දත්ත-ලේඛනය වැනි අඩු අවදානම්, පහසුවෙන් සත්යාපනය කළ කාර්යයන්හි එහි අගය ඉහළම වේ; මුදල්, පෞද්ගලිකත්වය සහ ආරක්ෂාව කෙරෙහි බලපාන තීරණ පුද්ගලයා සමඟ පවතී. එක් එක් ප්රතිදානය ප්රභවයට සම්බන්ධ කරන්න, නැවත මැනීම, ඉංජිනේරු පෙරහන හරහා යන්න. රහස්ය දත්ත ආරක්ෂා කරන්න, අනුමත වාහන භාවිතා කරන්න, ආරක්ෂක අරමුණු සඳහා පමණක් ආරක්ෂාවෙන් වැඩ කරන්න. මෙම විනය සියලු පසුකාලීන ඒකක සඳහා පදනම වේ.
යෙදුම් කාර්යය
ඔබගේම ව්යාපෘතියෙන් කාර්යයක් තෝරන්න (උදා. දත්ත පිරිසිදු කිරීමේ කාර්යයක් ලිවීම). පළමුව දුර්වල ප්රේරකයක් ලියන්න, පසුව මෙම ඒකකයේ ඇති අච්චුව භාවිතයෙන් ප්රබල විමසුමක් ලියන්න. නිමැවුම් දෙකම ගන්න, තුන්-පියවර සත්යාපනය යොදන්න (මූලාශ්රයට සබැඳිය, නැවත ධාවනය, ඉංජිනේරු පෙරහන). මිනිත්තු කීයක් සහ නිවැරදි කිරීම් කීයක් ඉතිරි කරන්නේ කුමන විමසුමද යන්න සටහන් කරන්න.
පිරික්සුම් ලැයිස්තුව
- [ ] මම මගේ කාර්යයේ අවදානම් මට්ටම (අඩු/ඉහළ) තීරණය කර ඇත.
- [ ] මම ප්රේරකය තුළ සැබෑ පුද්ගලික/රහස්ය දත්ත කිසිවක් තබා නැත; මම එය ආවරණය කළා හෝ කෘතිම සාම්පලයක් භාවිතා කළා.
- [ ] මම ප්රතිදානය ප්රභවයට සම්බන්ධ කර, එය නැවත ධාවනය කර, ඉංජිනේරුමය දෘෂ්ටිකෝණයකින් පෙරා ගත්තෙමි.
- [ ] මම නිවැරදි මිතිකය තෝරන ලද බව පරීක්ෂා කළෙමි.
- [ ] මම තීරණාත්මක තීරණය (එය නිෂ්පාදනයට දැමීම, දත්ත සැකසීම) මා විසින්ම/කණ්ඩායම සමඟ ගත්තෙමි, මම එය කෘතිම බුද්ධියට භාර නොදුන්නෙමි.
- [ ] මම ආයතනික අනුමත වාහනයක් භාවිතා කළා.