ලාභ:
- දත්ත විද්යාවේ අදියර හයක කාර්ය ප්රවාහය (ගැටළු නිර්වචනය, එකතු කිරීම, පිරිසිදු කිරීම, සොයා ගැනීම, ආකෘති නිර්මාණය, සන්නිවේදනය) සහ කාර්යය අවදානම් මට්ටම අනුව එක් එක් අදියරේදී කෘත්රිම බුද්ධිය ක්රියා කරන අධිකාරිය වෙන්කර හඳුනා ගැනීමේ හැකියාව
- එක් එක් කෘත්රිම බුද්ධි ප්රතිදානය ප්රභවයට සම්බන්ධ කිරීම, ධාවනය කිරීම සහ සංසන්දනය කිරීම සහ විශේෂඥ පෙරහන හරහා එය සම්මත කිරීම මගින් සත්යාපනය කරන විනයක් යෙදීමේ හැකියාව.
- ප්රතිනිෂ්පාදනය සහ රහස්යතා මූලධර්ම (කේතයට ලිවීම, නිර්නාමිකකරණය) පළමු දිනයේ සිට විශ්ලේෂණ පුරුදු බවට පත් කිරීමේ හැකියාව
අමු, අවුල් සහ බොහෝ විට “බොරු” දත්ත සෑම දිනකම දත්ත විද්යාඥයෙකුගේ මේසය මත පතිත වේ. විකුණුම් වගුවේ, දින තීරුව විවිධ ආකෘති තුනකින් ලියා ඇත; පාරිභෝගික අංක සමහර පේළිවල හිස් ය; තීරුවක නම "ආදායම" වේ, නමුත් එහි TL සහ USD අගයන් දෙකම අඩංගු වේ. දත්ත විද්යාවේ කාර්යය වන්නේ මෙම ව්යාකූලතාවයෙන් විශ්වාසදායක තීරණයක් ගැනීමයි: දත්ත එකතු කිරීම, එය පිරිසිදු කිරීම, එය ගවේෂණය කිරීම, ආකෘතියක් ගොඩනැගීම, ප්රතිඵලය වලංගු කිරීම සහ එය කථාවක් බවට පත් කිරීම. කෘත්රිම බුද්ධිය (AI, හෝ AI සඳහා කෙටි—පරිගණක පද්ධති සඳහා පෙළ සහ කේත ජනනය කිරීමට, රටා හඳුනා ගැනීමට, සාරාංශ කිරීමට සහ අනාවැකි කිරීමට) මෙම දාමයේ සෑම සබැඳියක්ම ස්පර්ශ කළ හැකිය: මිනිත්තු කිහිපයකින් පිරිසිදු කිරීමේ කේතය ලිවීම, ගවේෂණාත්මක විශ්ලේෂණය සඳහා ප්රස්ථාර නිර්දේශ කිරීම, ආකෘතියක මෙට්රික් අර්ථ නිරූපණය කිරීම, SQL විමසුමක් නිවැරදි කිරීම. නමුත් එම AI හට එය කිසිදා නොදුටු දත්ත සඳහා "correlation 0.72" වැනි විශ්වාසදායක ගොතන ලද නිර්මාණයක් ද ලබා දිය හැක.
මෙම පළමු ඒකකය පුස්තකාල හැඳින්වීමක් නොවේ. එහි පරමාර්ථය වන්නේ දත්ත විද්යා කාර්ය ප්රවාහයේ AI තැබිය යුත්තේ කොතැනද සහ එය කිසිදා නොතැබිය යුත්තේ කොතැනද යන්න පැහැදිලි කිරීමයි. මුල සිටම මූලික මූලධර්මය සකස් කරමු: AI යනු සහායකයෙක් මිස දත්ත විද්යාඥයෙක් නොවේ. කුමන දත්ත රැස් කළ යුතුද, කුමන මෙට්රික් තීරණය කළ යුතුද, ආකෘතියක් නිෂ්පාදනයට ඇතුළත් කළ යුතුද සහ සදාචාරාත්මක සීමාවන් අඳින්නේ කොතැනද යන්න පිළිබඳ තීරණය දක්ෂ විශේෂඥයා සතුය. අත්සන් නොකළ විශ්ලේෂණ වාර්තාවක් මෙන්ම සත්යාපනය නොකළ AI ප්රතිදානයක් අවදානම් සහගතය.
දත්ත විද්යා කාර්ය ප්රවාහය: අන්තයේ සිට අවසානය දක්වා සිතියම
දත්ත ව්යාපෘතියක් තේරුම් ගැනීමට, එය අදියර හයකට බෙදීම ප්රයෝජනවත් වේ. මෙම සම්පූර්ණ මොඩියුලය මෙම සිතියම අනුගමනය කරයි.
1. ගැටළු නිර්වචනය: අපි මනින්නේ කුමක් ද, ඇයි, කුමන තීරණයට සහාය දීමට ද? මෙම අදියර AI වෙත පවරා නැත; රැකියාව නිර්වචනය කරන්නේ පුද්ගලයා ය.
2. දත්ත රැස් කිරීම: මූලාශ්ර හඳුනා ගැනීම, දත්ත උපුටා ගැනීම, නියැදීම. (ඒකකය 2)
3. දත්ත පිරිසිදු කිරීම සහ පෙර සැකසුම්: අස්ථානගත වූ අගය, පිටස්තර, වර්ගය පරිවර්තනය. (ඒකකය 3)
4. ගවේෂණාත්මක දත්ත විශ්ලේෂණය (EDA - ගවේෂණාත්මක දත්ත විශ්ලේෂණය, "ඇසෙන්" දත්ත බෙදා හැරීම සහ සම්බන්ධතා හඳුනා ගැනීමේ අදියර): (ඒකකය 4)
5. විශේෂාංග ඉංජිනේරු සහ ආකෘති නිර්මාණය: විචල්ය උත්පාදනය, ඇල්ගොරිතම තේරීම, පුහුණුව, ඇගයීම. (ඒකක 5, 6, 7)
6. සන්නිවේදනය සහ නිෂ්පාදනය: දෘශ්යකරණය, කතාව, MLOps (ආකෘතිය සජීවීව ගෙන එය නිරීක්ෂණය කිරීමේ විනය). (අංක 8, 11)
AI මෙම සෑම අදියර හයකදීම වෙනස් අධිකාරියක් සමඟ ක්රියා කරයි. පහත වගුවේ මෙම අධිකාරිය බෙදා හැරීම සාරාංශ කරයි; මොඩියුලයේ වැදගත්ම වගුව මෙයයි.
වේදිකාව
AI හි කාර්යභාරය
අවදානම් මට්ටම
කවුද අනුමත කරන්නේ
ගැටළු නිර්වචනය
මොළය අවුල් කරන සහකරු
අඩු
දත්ත විද්යාඥ + කොටස්කරු
පිරිසිදු කිරීමේ කේතයක් ලියන්න
කේත ස්කීච් උත්පාදක යන්ත්රය
මධ්යම
දත්ත විද්යාඥ (කේතය කියවයි)
EDA අදහස
රටා යෝජනා කරන්නා
මධ්යම
දත්ත විද්යාඥයා
විශේෂාංග උත්පාදනය
අදහස සහ කේත උත්පාදක යන්ත්රය
මධ්යම-ඉහළ
කාන්දු පාලනය අනිවාර්ය වේ
ආදර්ශ තේරීම / මෙට්රික්
උපදේශක
ඉහළ
දත්ත විද්යාඥයා
නිෂ්පාදනයට ඇතුළත් කිරීමට තීරණය කිරීම
සහායක ආදානය
ඉතා ඉහළ
කණ්ඩායම + ව්යාපාර හිමිකරු
ආචාර ධර්ම/පෞද්ගලිකත්ව අනුමැතිය
උත්තේජක
ඉතා ඉහළ
මානව, සෑම විටම
මෙම ප්රස්ථාරයේ එක් වාක්යයක් මතක තබා ගන්න: කොටස් වැඩි වන විට, AI හි භූමිකාව හැකිලෙන අතර මානව අනුමැතිය වර්ධනය වේ.
සත්යාපනය මෙම ව්යාපාරයේ හදවත වන්නේ ඇයි
AI භාෂා ආකෘති නිසැකවම පෙනේ, නමුත් ඒවා විශ්වාස නොවිය හැකිය. තාක්ෂණික භාෂාවෙන්, මෙය මායාව ලෙස හැඳින්වේ: එය නොපවතින තොරතුරු සත්යයක් මෙන් චතුර වාක්යයකින් නිරූපිකාව විසින් ගොතන ලදී. දත්ත විද්යාවේදී මෙය ආකාර තුනකින් පැමිණේ. පළමුවැන්න ව්යාජ අංකයකි: ඔබ කිසිදු දත්තයක් ලබා නොදී "සාමාන්ය ඇණවුම් ප්රමාණය කොපමණද" යන ආකෘතියෙන් ඇසුවොත්, එය ඔබගේ දත්ත කිසිදා දැක නැති වුවද, එය විශ්වාසයෙන් ඔබට අංකයක් පවසනු ඇත. දෙවැන්න නොපවතින ශ්රිතයකි: ආකෘතිය pandas.read_excel_fast() වැනි කිසිසේත්ම නොපවතින ශ්රිතයක් යෝජනා කළ හැක. තෙවනුව, වැරදි සංඛ්යානමය අර්ථ නිරූපණය: ආකෘතියට "p-අගය 0.04, එබැවින් කල්පිතය 96% නිවැරදි" වැනි සම්භාව්ය සංඛ්යානමය දෝෂයක් සුමට ලෙස පුනරාවර්තනය කළ හැකිය.
සත්යාපන විනය පියවර තුනකින් සමන්විත වේ:
- මූලාශ්රය වෙත සබැඳිය: සෑම අංකයක්ම, අනුපාතයක් සහ ප්රවණතාවක්ම පැමිණිය යුත්තේ ඔබේ දත්තවලින් මිස AI හි මතකයෙන් නොවේ. දත්ත මතක තබා ගැනීමට නොව, දත්ත මත ක්රියාත්මක වන කේතය සඳහා AI භාවිත කරන්න.
- ධාවනය කර සංසන්දනය කරන්න: AI විසින් ලබා දී ඇති සෑම කේතයක්ම ඔබම ධාවනය කරන්න; එය නිපදවන සෑම මෙට්රික් එකක්ම ස්වාධීන පදනමකට සසඳන්න.
- ප්රවීණ පෙරහන: ප්රතිදානය සංඛ්යාලේඛන සහ වසම් දැනුමට පටහැනිද යන්න ඔබම පරීක්ෂා කරන්න.
අවවාදයයි: AI විසින් ලියන ලද විශ්ලේෂණයක් ධාවනය නොකර එය කියවීමකින් තොරව ඉදිරිපත් කිරීමකට දැමීම අත්සන් නොකළ වාර්තාවක් ඉදිරිපත් කිරීමක් වැනිය. කේතය ක්රියාත්මක වූ පමණින් එය නිවැරදි යැයි අදහස් නොවේ; වැරදි තීරුව සාරාංශ කරන කේතයක් ද දෝෂයකින් තොරව ක්රියා කරයි.
ප්රතිනිෂ්පාදනය: එකම ප්රතිඵලය දෙවරක් නිපදවීමට හැකි වීම
දත්ත විද්යාවේ නිහඬ නමුත් තීරනාත්මක මූලධර්මය වන්නේ ප්රතිනිෂ්පාදනයයි: ඔබ මාස හයකට පසුව හෝ වෙනත් පරිගණකයකින් නැවත විශ්ලේෂණයක් ක්රියාත්මක කරන විට, ඔබට එම ප්රතිඵලයම ලැබේ. AI සමඟ වැඩ කිරීමේදී මෙම අවදානම වැඩි වේ, මන්ද ඔබ AI ට "මෙම ප්රස්ථාරය සාදා එය අතින් වාදනය කරන ලෙස පවසන විට, පියවර අතුරුදහන් වේ. රීතිය: සෑම පියවරක්ම කේතය සහ අනුවාද පාලනය තුළ ලියාපදිංචි කළ යුතුය (Git වැනි); අහඹු බව සම්බන්ධ පියවර වලදී, සසම්භාවී බීජය (අහඹු සංඛ්යා උත්පාදකයේ ආරම්භක අගය; ස්ථාවර නම්, ප්රතිඵලය පුනරාවර්තනය වේ) ස්ථාවර කළ යුතුය. අපි මෙම මාතෘකාව 10 වන කොටසෙහි ගැඹුරු කරන්නෙමු. දැනට, මෙම පුරුද්ද ලබා ගන්න: "අතින් ක්ලික් කරන්න එපා, කේතය ලියන්න."
කුඩා නඩු තුනක්
නඩුව 1 - ආරක්ෂිත ත්වරණය. ඊ-වාණිජ්ය විශ්ලේෂකයෙකු සාමාන්යයෙන් පේළි 240,000 ක ඇණවුම් වගුවක් ඉවත් කිරීමට දින භාගයක් ගත කරයි. ඔහු තීරු නම් සහ පළමු පේළි 5 (පුද්ගලික දත්ත නොමැතිව) AI වෙත ලබා දී පැන්ඩා පිරිසිදු කිරීමේ කේතය ඉල්ලා සිටියේය. AI තත්පර 8 කින් කෙටුම්පතක් නිෂ්පාදනය කළේය; විශ්ලේෂක කේත පේළිය පේළියෙන් කියවා, දිනය විග්රහ කිරීමේ දෝෂයක් නිවැරදි කර එය ක්රියාත්මක කළේය. කාලය: පැය 4 වෙනුවට විනාඩි 35 යි. AI විසින් කේතය ලබා දී ඇත, සත්යාපනය මිනිසා සමඟ පැවතුනි.
නඩුව 2 - සාදන ලද මෙට්රික් උගුල. "මෙම දත්තවල අහඹු වනාන්තරය කෙතරම් නිවැරදිද?" යනුවෙන් සීමාවාසිකයෙකු AI ගෙන් විමසීය. ආකෘතිය කිසිසේත් පුහුණු නොකර. "89% පමණ" AI පැවසීය. සීමාවාසිකයා මෙය ඉදිරිපත් කිරීමට තැබුවේය; සැබෑ ආකෘතිය පුහුණු කරන විට, නිරවද්යතාව 71% කි. දෝෂය: AI වෙත දත්ත සහ ආකෘති ලබා නොදී ප්රමිතික සඳහා රැඳී සිටීම.
නඩුව 3 - නිහඬ කාන්දු වීම. එක් කණ්ඩායමක් ප්රශ්න කිරීමකින් තොරව "ඉලක්ක විචල්යයේ මධ්යන්යය විශේෂාංගයක් ලෙස එක් කරන්න" යන AI-යෝජිත අදහස ක්රියාවට නැංවීය. මෙම ආකෘතිය පරීක්ෂණ කට්ටලය මත 98% ක් ඉටු කළ නමුත් විශේෂාංගය අනාගත තොරතුරු කාන්දු වීම නිසා නිෂ්පාදනයේදී බිඳ වැටුණි (දත්ත කාන්දු වීම, ඒකකය 10). දෝෂය: AI නිර්දේශය සංඛ්යානමය වශයෙන් පෙරීම නොවේ.
දුර්වල ක්ෂණික / ශක්තිමත් විමසුම
දුර්වල ක්ෂණික:
මෙම විකුණුම් දත්ත විශ්ලේෂණය කර මට සාමාන්ය ආදායම කියන්න.
මෙම හිමිකම් පෑම දෝෂ සහිතයි: AI වෙත දත්ත ලබා දී නැත, එබැවින් "සාමාන්ය ආදායම" සෑදිය හැක්කේ පමණි. තීරු, කාල සීමාව හෝ මුදල් පැහැදිලි නැත.
බලවත් විමසුම:
ඔබගේ කාර්යභාරය: දත්ත විද්යාඥයෙකුට උපකාර කිරීම. මට pandas DataFrame එකක් තියෙනවා: df. තීරු:- order_date (පෙළ, ආකෘතියෙන් "2024-03-01")- amount_tl (දශම, NaN සමහර පේළිවල)- customer_id (නිඛිල) කාර්යය: (1) සාමාන්ය අගය ගණනය කරන pandas කේතය ලියන්න, (2) එය NaN අගයන් හසුරුවන ආකාරය පැහැදිලි කරන්න, (3) කේතය උපකල්පනය කරයි. දත්ත අන්තර්ගතය සකස් නොකරන්න; කේතය ජනනය කරන්න, මම ප්රතිඵලය ධාවනය කර සත්යාපනය කරන්නෙමි.
මෙම ඉල්ලීම තුළ, යෝජනා ක්රමය, අපේක්ෂාව සහ "ප්රබන්ධ කිරීම තහනම් කිරීම" පැහැදිලිය. ඔබ තවමත් ධාවනය කර ප්රතිදානය ඔබම සත්යාපනය කරයි.
ආචාර ධර්ම සහ පෞද්ගලිකත්වයේ ආරම්භය
දත්ත විද්යාව බොහෝ විට පුද්ගලික දත්ත සමඟ ක්රියා කරයි: පාරිභෝගික, රෝගියා, සේවක වාර්තා. Türkiye හි KVKK (පුද්ගලික දත්ත ආරක්ෂණ නීතිය) සහ යුරෝපයේ GDPR මෙම දත්ත ආරක්ෂා කරයි. ඔබගේ සැබෑ නම, හැඳුනුම්පත, ඊමේල් හෝ ලිපිනය පොදු AI මෙවලමකට ඇලවීම උල්ලංඝනය කිරීමකි. රීතිය: බෙදා ගැනීමට පෙර දත්ත නිර්නාමික කරන්න, අවශ්ය නම් ස්කීමා (තීරු නම්, වර්ග) සහ ව්යාජ උදාහරණ පේළිය පමණක් සපයන්න. අපි ඒකක 11 හි ආචාර ධර්ම පිළිබඳ මාතෘකාව ගැඹුරු කරන්නෙමු. මුල සිටම මූලධර්මය තබමු: දත්ත තේරුම් ගැනීමට, එහි ව්යුහය බෙදාගැනීම, එහි අන්තර්ගතය නොව, බොහෝ විට ප්රමාණවත් වේ.
පොදු වැරදි
- AI වෙත දත්ත ලබා නොදී අංක/මිතික සඳහා රැඳී සිටීම. ආකෘතියට දත්ත වෙත ප්රවේශ විය නොහැක; ඔහු දෙන අංකය ව්යාජ ය. සෑම විටම ප්රතිඵලය ගණනය කර ධාවනය කරන්න.
- වැඩ කරන කේතය නිවැරදි බව සිතීම. වැරදි තීරුව හසුරුවන කේතය ද දෝෂ නොමැතිව ධාවනය වේ; තර්කය කියවන්නේ නැතිව විශ්වාස කරන්න එපා.
- විවෘත මෙවලමට සැබෑ පුද්ගලික දත්ත ඇලවීම. නම, හැඳුනුම්පත, විද්යුත් තැපෑල කිසිවිටෙක බෙදා නොගනී; රූප සටහන ප්රමාණවත්ය.
- පියවර අතින් සිදු කිරීම සහ ඒවා කේතයට නොලියා සිටීම. ප්රතිනිෂ්පාදනය කළ නොහැකි විශ්ලේෂණය විශ්වාස කළ නොහැකි ය.
- ප්රශ්නයකින් තොරව AI හි සංඛ්යාලේඛන අර්ථ නිරූපණය පිළිගැනීම. AI හට p-අගය සහ සහසම්බන්ධය වැනි සංකල්පවල සම්භාව්ය වැරදි නැවත සිදු කළ හැක.
ඉඟිය: ඔබගේ සෑම AI සැසියක් තුළම කෙටි "නීති රේඛාවක්" ඇතුළත් කරන්න: "දත්ත අන්තර්ගතය සාදන්න එපා; කේතය/විශ්ලේෂණය උත්පාදනය කරන්න, මම ප්රතිඵලය ධාවනය කර සත්යාපනය කරන්නම්; ඔබට විශ්වාස නැති තැන 'විශ්වාස නැත' යන්න සඳහන් කරන්න." මෙම තනි වාක්යය මායාවන් ඇතිවීමේ අවදානම සැලකිය යුතු ලෙස අඩු කරයි.
සාරාංශයකින්
AI යනු දත්ත විද්යාවේ ප්රබල සහායකයෙකි: එය පිරිසිදු කිරීමේ කේතය, EDA අර්ථ නිරූපණය, ආකෘති නිර්දේශය සහ දෘශ්යකරණය වේගවත් කරයි. නමුත් ගැටළු නිර්වචනය, මෙට්රික් තෝරාගැනීම, නිෂ්පාදන තීරණය සහ සදාචාරාත්මක සීමාවන් මිනිසුන්ට අයත් වේ. කාර්ය ප්රවාහයට අදියර හයක් ඇති අතර, අවදානම වැඩි වන විට AI හි කාර්යභාරය කුඩා වේ. පුරුදු තුනක් සෑම දෙයකම පදනම වේ: මූලාශ්ර සම්බන්ධ කිරීම (වලංගු කිරීම), ප්රතිනිෂ්පාදනය (කේතකරණය) සහ නිර්නාමිකකරණය (රහස්යභාවය). ඔබ මෙම තුන අභ්යන්තරීකරණය කළ පසු, ඉතිරි මොඩියුලයේ ඇති සෑම මෙවලමක්ම ඔබට ආරක්ෂිත ත්වරණකාරකයක් බවට පත්වේ.
යෙදුම් කාර්යය
ඔබ සතුව ඇති කුඩා වගුවක (හෝ උපකල්පිත එකක්): තීරු නම්, වර්ග සහ ව්යාජ උදාහරණ පේළි 2-3 ක් (සැබෑ පුද්ගලික දත්ත නොමැතිව) සකස් කරන්න. ඉහත "Powerful prompt" අච්චුව භාවිතයෙන් සාරාංශ සංඛ්යාලේඛන කේතයක් සඳහා AI වෙතින් විමසන්න. කේතය ක්රියාත්මක කරන්න, ප්රතිදානය අත්පොත අගයකට සංසන්දනය කරන්න, කිසියම් ව්යාජ උපකල්පනයක් තිබේදැයි පරීක්ෂා කරන්න, සහ ඔබේ සොයාගැනීම් බුලට් පොයින්ට් 5කින් සටහන් කරන්න.
පිරික්සුම් ලැයිස්තුව
- [ ] මම සත්ය පුද්ගලික දත්ත වෙනුවට AI සඳහා යෝජනා ක්රමයක් සහ ව්යාජ සාම්පලයක් ලබා දුන්නාද?
- [ ] මම එය නිෂ්පාදනය කළ කේතය පේළියෙන් පේළිය කියවා ධාවනය කළාද?
- [ ] මම ප්රතිදානයේ සෑම අංකයක්ම ස්වාධීනව සත්යාපනය කර තිබේද?
- [ ] මම විශ්ලේෂණයේ සෑම පියවරක්ම කේතයට ලියා එය නැවත නැවත කළ හැකි බවට පත් කර තිබේද?
- [ ] මම මෙහෙයුමේ අවදානම් මට්ටම තීරණය කර අවසාන තීරණය මිනිසෙකුට පවරා තිබේද?