ඒකක
1. දත්ත විද්‍යාව සහ විශ්ලේෂණ පිළිබඳ කෘතිම බුද්ධිය හැඳින්වීම: කාර්ය ප්‍රවාහය, භූමිකාවන්, සීමා මායිම්, වලංගුකරණය සහ ආචාර ධර්ම 2. දත්ත රැස් කිරීම සහ මූලාශ්‍ර අවබෝධය: යෝජනා ක්‍රමය, නියැදීම, ගුණාත්මකභාවය සහ කාන්දුවීම් පිළිබඳ දැනුවත් කිරීම 3. දත්ත පිරිසිදු කිරීම සහ පෙර සැකසුම: අස්ථානගත වූ අගය, පිටස්තර සහ වර්ගය පරිවර්තනය 4. ගවේෂණාත්මක දත්ත විශ්ලේෂණය (EDA): බෙදාහැරීම්, සබඳතා සහ මූලික තීක්ෂ්ණ බුද්ධිය 5. විශේෂාංග ඉංජිනේරු: ප්‍රභේද ජනනය කිරීම, කේතනය කිරීම, පරිමාණය කිරීම සහ කාන්දු වීම වැළැක්වීම 6. ආදර්ශ ගොඩනැගීම: ගැටළු නිර්වචනය, ඇල්ගොරිතම තේරීම සහ පුහුණුව/පරීක්ෂණ බෙදීම 7. ආදර්ශ ඇගයීම: ප්‍රමිතික, හරස් වලංගුකරණය සහ අන්ත ඉගෙනීම 8. දෘශ්‍යකරණය සහ කතන්දර කීම: නිවැරදි ග්‍රැෆික්ස්, අවංක ග්‍රැෆික්ස් 9. කේත උත්පාදනය: Python (pandas) සහ SQL සමඟ AI-සහාය විශ්ලේෂණය 10. දත්ත කාන්දු වීම සහ ප්‍රතිනිෂ්පාදනය: නිහඬ විපත් සහ විනය 11. MLOps පදනම, ආචාර ධර්ම, පෞද්ගලිකත්වය සහ වගකීම් විශ්ලේෂණ
ඒකකය 2 / 11

දත්ත රැස් කිරීම සහ මූලාශ්‍ර අවබෝධය: යෝජනා ක්‍රමය, නියැදීම, ගුණාත්මකභාවය සහ කාන්දුවීම් පිළිබඳ දැනුවත් කිරීම

ලාභ:

  • විවිධ දත්ත ප්‍රභවයන් (දත්ත සමුදාය, API, ගොනුව, වෙබ් සීරීම්) සහ එක් එක් අන්තරායන් හඳුනා ගැනීමට සහ යෝජනා ක්‍රමය නිවැරදිව තේරුම් ගැනීමට හැකියාව
  • නියැදිය ජනගහනය සහ තේරීම් නැඹුරුව නියෝජනය කරන්නේ දැයි ඇගයීමෙන් නැවත නැවතත් නියැදීම සිදු කිරීමේ හැකියාව
  • එක් එක් තීරුව තුළ 'අනාවැකි කරන අවස්ථාවේදී මට එය තිබේද' යන ප්‍රශ්නය ඇසීමෙන් එකතු කිරීමේ අදියරේදී දත්ත කාන්දු වීම ඉවත් කිරීමට සහ නෛතික/ආචාර ධර්ම සීමාවන් නිරීක්ෂණය කිරීමට ඇති හැකියාව?

සෑම විශ්ලේෂණයක්ම ඔබ රැස් කරන දත්තවල ගුණාත්මක භාවය තරම්ම හොඳ ය. වැරදි ලෙස එකතු කරන ලද, පක්ෂග්‍රාහී ලෙස සාම්පල ලබා ගත් හෝ අනාගතය පිළිබඳ තොරතුරු අඩංගු දත්ත සමඟ ක්‍රියා කරන්නේ නම්, ලෝකයේ වඩාත්ම දියුණු මාදිලිය පවා විශ්වාස කළ නොහැකි ප්‍රතිඵල ඇති කරයි. පරිගණක විද්‍යාවේදී, මෙම මූලධර්මය සාරාංශ කර ඇත්තේ "කසළ ඇතුලට, කුණු පිටතට" (කසළ ඇතුලට, කුණු පිටතට) ලෙසිනි. මෙම ඒකකය තුළ, අපි දත්ත රැස් කිරීමේ අදියර ආවරණය කරන්නෙමු: මූලාශ්‍රය අවබෝධ කර ගැනීම, නියැදීම, ගුණාත්මක ප්‍රශ්න ඇසීම සහ දත්ත කාන්දු වීමේ අවදානම පිළිබඳව පළමු දිනයේ සිටම අවදියෙන් සිටීම. කෘතිම බුද්ධිය මෙම අදියරේදී බලවත් ආධාරකයකි; SQL විමසුම ලියයි, API ලේඛනය සාරාංශ කරයි, දත්ත ගිවිසුම් කෙටුම්පත් කරයි. නමුත් ඔබ රැස් කරන දත්ත මොනවාද සහ එම දත්ත ඔබව නියෝජනය කරන්නේද යන්න තීරණය කරන්නේ මිනිසායි.

දත්ත මූලාශ්ර දැන ගැනීම

දත්ත විවිධ ස්ථාන වලින් පැමිණෙන අතර, එක් එක් මූලාශ්‍රවලට එයටම ආවේණික වූ අන්තරායන් ඇත. දත්ත සමුදාය (සාමාන්‍යයෙන් SQL සමඟ විමසනු ලබන වගු තුළ ගබඩා කර ඇති ව්‍යුහගත දත්ත) වඩාත් පොදු මූලාශ්‍රය වේ; එය විශ්වසනීය ය, නමුත් එහි යෝජනා ක්රමය හොඳින් අවබෝධ කර ගැනීම අවශ්ය වේ. API (යෙදුම් ක්‍රමලේඛන අතුරුමුහුණත) සජීවී දත්ත සපයන නමුත් වේග සීමාවන් සහ ආකෘති වෙනස්වීම් අවදානම දරයි. ගොනු (CSV, Excel, JSON) නම්‍යශීලී නමුත් හැඩතල ගැන්වීමේ අනනුකූලතාවයට ගොදුරු වේ. වෙබ් සීරීම බලවත්, නමුත් එයට නීතිමය සහ සදාචාරාත්මක සීමාවන් ඇත; සෑම වෙබ් අඩවියක්ම සීරීමට නොහැකිය.

අවධානය: වෙබ් සීරීම් සහ ස්වයංක්‍රීය දත්ත රැස් කිරීම සඳහා, වෙබ් අඩවියේ භාවිත නියමයන්, robots.txt ගොනුව සහ KVKK/GDPR සමඟ අනුකූල වන්න. අනවසර දත්ත එකතු කිරීම නීතිමය වගකීමක් ඇති කරයි. තොරතුරු ආරක්‍ෂාවේ සන්දර්භය තුළ, දත්ත රැස් කිරීමේ මෙවලම් ඔබට අවසර දී ඇති පද්ධති මත පමණක් සහ ආරක්‍ෂක/විශ්ලේෂණ අරමුණු සඳහා භාවිත කරන්න; අනවසරයෙන් ඇතුළුවීම හෝ සීරීම තහනම්ය.

යෝජනා ක්රමය අවබෝධ කර ගැනීම: දත්ත සමඟ දැන හඳුනා ගැනීම

දත්ත කට්ටලයක් එකතු කිරීමට පෙර, ඔබ එහි යෝජනා ක්‍රමය (තීරුවල නම්, ඒවායේ දත්ත වර්ග, ඒවායේ අර්ථයන් සහ එකිනෙකා සමඟ ඇති සබඳතා) තේරුම් ගත යුතුය. "දත්ත ශබ්ද කෝෂයක්" නිර්මාණය කිරීමේදී AI ඉතා ප්‍රයෝජනවත් වේ — එක් එක් තීරුවේ තේරුම කුමක්ද යන්න පැහැදිලි කරන වගුවකි. නමුත් AI නිෂ්පාදනය කරන පැහැදිලි කිරීම් අනාවැකි වේ; දත්ත නිෂ්පාදනය කළ කණ්ඩායම සමඟ එක් එක් තීරුවේ සැබෑ අර්ථය තහවුරු කරන්න. උදාහරණයක් ලෙස, "තත්වය" නම් තීරුවක 0/1/2 අඩංගු විය හැක; මේවා "පොරොත්තු/අනුමත/අවලංගු" හෝ වෙනත් දෙයක්ද යන්න දන්නේ මුල් කණ්ඩායම පමණි.

පහත වගුව මූලික සම්පත් වර්ග සහ අනතුරු ඇඟවීම් සාරාංශ කරයි:

මූලාශ්රය

ශක්තිමත් ලක්ෂ්යය

උගුල

AI උදව් කරන ආකාරය

SQL දත්ත සමුදාය

ව්යුහාත්මක, විශ්වසනීය

සංකීර්ණ එකතු කිරීම්

විමසුම් කෙටුම්පතක් ලියයි

API

සජීවී දත්ත

වේග සීමාව, හැඩය වෙනස් කිරීම

ලේඛන සාරාංශ, අදින්න කේතය

CSV/Excel

නම්යශීලී, වේගවත්

ආකෘතියේ නොගැලපීම

කේතය කියවන්න/විග්‍රහ කරන්න

වෙබ් සීරීම

පුළුල් ළඟා

නෛතික/ආචාර ධර්ම සීමාව

විග්‍රහ කිරීමේ කෙටුම්පත (අධිකාරිය තුළ)

ලොග්/සිදුවීම් දත්ත

සවිස්තරාත්මක

විශාල පරිමාවක්

විමසුම පෙරීම

නිදර්ශනය: කොටස සමස්තය නියෝජනය කරයිද?

බොහෝ විට, ඔබ සම්පූර්ණ දත්ත වලට වඩා නියැදියක් (ජනගහනයෙන් තෝරාගත් උප කුලකයක්) සමඟ වැඩ කරයි. තීරනාත්මක ප්රශ්නය වන්නේ: මෙම නියැදිය ජනගහනය නියෝජනය කරන්නේද? තේරීම් නැඹුරුව වඩාත් පොදු උගුලකි. උදාහරණයක් ලෙස, ඔබ ජංගම යෙදුමෙන් පරිශීලකයින් පමණක් නියැදියහොත්, ඔබ වෙබ් පරිශීලකයින් නොදකින අතර ඔබේ ප්‍රතිඵල නොමඟ යවන සුළු වනු ඇත. සසම්භාවී නියැදීම (සෑම වාර්තාවක්ම තෝරා ගැනීමට සමාන අවස්ථාවක් ඇත) බොහෝ අවස්ථාවලදී ආරක්ෂිත වේ; නමුත් කාල ශ්‍රේණි දත්ත වලදී, බෙදීම අහඹු ලෙස නොව කාලානුක්‍රමිකව සිදු කෙරේ (අපි මෙය ඒකක 7 සහ 10 හි දකිමු).

පළමු දිනයේ සිට දැනුවත්භාවය කාන්දු වීම

දත්ත කාන්දු වීම බොහෝ ව්‍යසනවල මූලාශ්‍රය වන අතර සාමාන්‍යයෙන් දත්ත රැස් කිරීමේ අදියරේදී පැන නගී. උදාහරණය: "එය අවලංගු කරන ලද්දේද" යන්න පුරෝකථනය කරන විට, ඔබ "අවලංගු කිරීමේ දිනය" තීරුව දත්තවලට එකතු කළහොත්, ආකෘතිය අනාගතය දෙස බලයි. එක්රැස් කිරීමේ අදියරේදී, එක් එක් තීරුව සඳහා එක් ප්‍රශ්නයක් අසන්න: "මම අනාවැකි කියන අවස්ථාවේ මෙම තොරතුරු ඇත්ත වශයෙන්ම මා සතුව තිබේද?" පිළිතුර නැත නම්, එම තීරුව කාන්දු වේ. අපි මෙම මාතෘකාව 10 වන ඒකකයේ ගැඹුරින් ආවරණය කරන්නෙමු. නමුත් දැනුවත් කිරීම පළමු දිනයේ සිටම ආරම්භ කළ යුතුය.

කුඩා නඩු තුනක්

නඩුව 1 - නියෝජනය පිළිබඳ ගැටළුව. එක් බැංකුවක් එහි ණය අවදානම් ආකෘතිය (වාර්තා 18,500) සඳහා අනුමත ණය පිළිබඳ දත්ත පමණක් රැස් කළේය. ප්‍රතික්ෂේප කිරීම් දත්තවල නොතිබුණි. ප්‍රතික්‍ෂේප කරන්නන් හැසිරෙන්නේ කෙසේදැයි එය කිසිදා නොදුටු නිසා සැබෑ ලෝකයේ ආකෘතිය වැරදියි. පාඩම: නියැදිය ඔබ තීරණය කරන මුළු ජනගහනයම නියෝජනය කළ යුතුය.

නඩුව 2 - නිහඬ ස්වරූපය වෙනස් කිරීම. කණ්ඩායමක් සෑම දිනකම API එකකින් මිල දත්ත ලබා ගනිමින් සිටියේය. දිනක්, API සපයන්නා විසින් මුදල් ඒකකය USD සිට EUR දක්වා වෙනස් කළ නමුත් වසම් නාමය එලෙසම පැවතුනි. දින 12 ක් සඳහා වැරදි ඒකකයක දත්ත රැස් කරන ලදී; රේඛා 3,200ක් දූෂිත විය. පාඩම: API දත්තවල පරිමාව සහ ආකෘති අනුකූලතාව නිතිපතා පරීක්ෂා කරන්න.

නඩුව 3 - මුල් කාන්දු වීම. විශ්ලේෂකයෙකු "චන්" ඇස්තමේන්තුවක් සඳහා දත්ත රැස් කිරීමේදී "ගිණුම් වැසීමට හේතුව" තීරුව ඇතුළත් කර ඇත. මෙම තීරුව පිරවූයේ පාරිභෝගිකයා පිටව ගිය පසුවය. මෙම ආකෘතිය පරීක්ෂණ කට්ටලය මත 97% නිරවද්යතාව ලබා දුන්නේය; අනාවැකි කාලයට එම තීරුව හිස්ව තිබූ නිසා එය නිෂ්පාදනයේදී ක්‍රියා කළේ නැත. පාඩම: සෑම තීරුවකින්ම "අනාවැකි කරන අවස්ථාවේ මා සතුව එය තිබේද?" යන ප්‍රශ්නය අසන්න.

පිටපත් කළ හැකි සැකිලි හතරක්

1) දත්ත ශබ්දකෝෂය උපුටා ගැනීම:

ඔබේ කාර්යභාරය: දත්ත විද්‍යා සහකාර. වගුවක තීරු නාම සහ නියැදි (නිර්නාමික) අගයන් පහත දැක්වේ. සෑම තීරුවක් සඳහාම, එහි ඇස්තමේන්තුගත අර්ථය, දත්ත වර්ගය සහ විභව තත්ත්ව අවදානම් වගුවක ලැයිස්තුගත කරන්න. ඔබට විශ්වාස නැති තීරු "තහවුරු කිරීම අවශ්‍ය" ලෙස සලකුණු කරන්න; සෑදීමේ තේරුම. තීරු: [මෙහි අලවන්න]

2) නියැදි කේතය (අහඹු, පුනරාවර්තනය):

මට pandas df තියෙනවා. පේළි 200,000කින් නියෝජිත 5% අහඹු නියැදියක් උපුටා ගන්නා කේතයක් ලියන්න. random_state=42 (ප්‍රතිනිෂ්පාදනය සඳහා) භාවිතා කරන්න. නියැදියේ පන්ති ව්‍යාප්තිය ජනගහනයට සමානදැයි පරීක්ෂා කිරීමට කේතය එක් කරන්න.

3) කාන්දු ස්කෑනිං ප්රශ්නය:

මම ඔබට මෙම තීරු ලැයිස්තුව දෙන්නම්. මගේ ඉලක්කය වන්නේ "එය අවලංගු කර තිබේද" (0/1) පුරෝකථනය කිරීමයි. සෑම තීරුවක් සඳහාම, පුරෝකථනය කරන අවස්ථාවේ එය මා සතුව තිබේද යන්න තක්සේරු කර එය "ආරක්ෂිත / සැක සහිත / කාන්දු වීම" ලෙස සලකුණු කරන්න. ඔබේ තර්කය එක වාක්‍යයකින් ලියන්න. තීරු: [ලැයිස්තුව]

4) SQL අදින්න විමසුම් කෙටුම්පත:

මට PostgreSQL හි "ඇණවුම්" සහ "පාරිභෝගික" වගු ඇත. පසුගිය දින 90 ක ඇණවුම් පාරිභෝගික නගරය සමඟ ඒකාබද්ධ කර එක් නගරයකට ඇති මුළු මුදල සහ ඇණවුම් ගණන ආපසු ලබා දෙන JOIN විමසුමක් ලියන්න. දින පෙරහන සහ NULL නගර හසුරුවන ආකාරය පැහැදිලි කරන්න. මම විමසුම ධාවනය කර එය සත්‍යාපනය කරන්නෙමි.

දුර්වල ක්ෂණික / ශක්තිමත් විමසුම

දුර්වල ක්ෂණික:

මෙම දත්ත සමුදායෙන් මට හොඳ නියැදි දත්තයක් අදින්න.

"හොඳ" යන්න අපැහැදිලි ය; කුමන චිත්‍රයද, කුමන කාල පරිච්ඡේදයද, කුමන ප්‍රමාණයද, කුමන අරමුණද යන්න පැහැදිලි නැත. AI විසින් සාමාන්‍ය, සමහරවිට වැරදි විමසුමක් පමණක් නිපදවනු ඇත.

බලවත් විමසුම:

ඔබේ කාර්යභාරය: SQL සහකාර. මා සතුව "ගනුදෙනු" වගුවක් තිබේ: තීරු id, customer_id, දිනය (වේලා මුද්‍රාව), මුදල (සංඛ්‍යා), නාලිකාව (පෙළ: 'වෙබ්'/'ජංගම'). කාර්යය: 2024 වර්ෂය සඳහා එක් එක් නාලිකාවෙන් නියෝජිත පේළි 10,000ක් ආපසු ලබා දෙන නැවත නැවතත් කළ හැකි (ORDER BY සමඟ නිර්ණය කරන) විමසුමක් ලියන්න. අරමුණ: නාලිකා සංසන්දනාත්මක විශ්ලේෂණය. ඔබගේ විමසුමේ උපකල්පන ලැයිස්තුගත කරන්න.

මෙහි වගුව, අරමුණ, ප්රමාණය සහ පුනරාවර්තනය පැහැදිලිය.

පොදු වැරදි

  • නියැදියේ නියෝජිතත්වය ප්‍රශ්න නොකරයි. පහසුවෙන් ප්‍රවේශ විය හැකි දත්ත නිවැරදි දත්ත නොවේ; තේරීමේ නැඹුරුව ප්රතිඵලය විකෘති කරයි.
  • AI වෙත තීරු අර්ථයන් අනුවර්තනය කිරීම. මූලාශ්ර කණ්ඩායම අර්ථය දනී; AI පුරෝකථනය තහවුරු නොකර එය භාවිතා නොකරන්න.
  • API ආකෘතිය/ඒකක වෙනස් කිරීම නිරීක්ෂණය නොකරයි. නිහඬ වෙනස දින ගණනක් දූෂිත දත්ත රැස් කරයි.
  • එකතු කිරීමේ අදියරේදී කාන්දු වීම නොසලකා හැරීම. "අනාවැකි කරන අවස්ථාවේ එය මා සතුව තිබේද" යන ප්‍රශ්නය කලින් අසන්නේ නැත්නම්, ආකෘතිය ව්‍යාජ සාර්ථකත්වයක් ලබා දෙනු ඇත.
  • අනවසර හෝ නීති විරෝධී දත්ත රැස් කිරීම. robots.txt, භාවිත නියමයන් සහ KVKK උල්ලංඝනය කිරීම බරපතල අවදානමකි.
ඉඟිය: එක් එක් නව දත්ත මූලාශ්‍රය සඳහා එක් පිටුවක “දත්ත කාඩ්පතක්” තබා ගන්න: මූලාශ්‍රය, අදින්න දිනය, පේළි ගණන, දන්නා මායිම්, සහ කාන්දු වීමේ අවදානමක් ඇති තීරු. මෙම කාඩ්පත "මෙම දත්ත මොනවාද" යන ප්‍රශ්නය සහ මාස කිහිපයකට පසු ප්‍රතිනිෂ්පාදනය සුරකියි.

සාරාංශයක් ලෙස

එකතු කරන ලද දත්තවල ගුණාත්මකභාවය අනුව විශ්ලේෂණයේ ගුණාත්මකභාවය සීමා වේ. මූලාශ්‍රය (දත්ත සමුදාය, API, ගොනුව, සීරීම්) සහ ක්‍රමය හොඳින් දැන ගන්න; නියැදිය ජනගහනය නියෝජනය කරන බවට වග බලා ගන්න; සෑම තීරුවකින්ම “අනාවැකි කරන අවස්ථාවේදී එය මා සතුව තිබේද?” යනුවෙන් විමසීමෙන් පළමු දිනයේ සිට කාන්දු වීම ඉවත් කරන්න. AI යනු විමසුම් සහ ලේඛන කටයුතු සඳහා විශිෂ්ට ත්වරණයකි, නමුත් මිනිසුන් විසින් රැස් කළ යුතු දත්ත සහ එහි නියෝජනය තීරණය කරයි. අධිකාරියේ සීමාවන්, නීතිය සහ රහස්‍යභාවය සැමවිටම මුල් තැන ගනී.

යෙදුම් කාර්යය

දත්ත මූලාශ්‍රයක් තෝරන්න (ඔබගේම ව්‍යාපාරයෙන් හෝ උපකල්පිතයෙන්). ඉහත “දත්ත ශබ්දකෝෂ නිස්සාරණය” අච්චුව සමඟ AI වෙතින් දත්ත ශබ්ද කෝෂයක කෙටුම්පතක් ලබා ගන්න; ඉන්පසු එය කාන්දු වී ඇත්දැයි බැලීමට එක් එක් තීරුව අතින් ඇගයීමට ලක් කරන්න. අඩුම තරමින් එක් සැක සහිත/කාන්දු තීරුවක් සොයා ගැනීමට උත්සාහ කර එය අවදානම් වන්නේ මන්දැයි එක් වාක්‍යයකින් ලියන්න.

පිරික්සුම් ලැයිස්තුව

  • [ ] මම මූලාශ්‍ර කණ්ඩායම සමඟ දත්ත මූලාශ්‍රය සහ යෝජනා ක්‍රමය තහවුරු කර තිබේද?
  • [ ] නියැදිය ජනගහනය නියෝජනය කරන බව මම පරීක්ෂා කර තිබේද?
  • [ ] මම සෑම තීරුවකම "ඇස්තමේන්තු කරන අවස්ථාවේ එය මට තිබේද?" යන ප්‍රශ්නය අසා තිබේද?
  • [ ] මම නියැදීම නැවත නැවතත් කළ හැකි (ස්ථාවර බීජ) බවට පත් කර තිබේද?
  • [ ] මම එකතු කිරීමේ නීතිමය/ආචාර ධර්ම (අධිකාරිය, robots.txt, KVKK) සීමාවන් පරීක්ෂා කර තිබේද?