ඒකක
1. දත්ත විද්‍යාව සහ විශ්ලේෂණ පිළිබඳ කෘතිම බුද්ධිය හැඳින්වීම: කාර්ය ප්‍රවාහය, භූමිකාවන්, සීමා මායිම්, වලංගුකරණය සහ ආචාර ධර්ම 2. දත්ත රැස් කිරීම සහ මූලාශ්‍ර අවබෝධය: යෝජනා ක්‍රමය, නියැදීම, ගුණාත්මකභාවය සහ කාන්දුවීම් පිළිබඳ දැනුවත් කිරීම 3. දත්ත පිරිසිදු කිරීම සහ පෙර සැකසුම: අස්ථානගත වූ අගය, පිටස්තර සහ වර්ගය පරිවර්තනය 4. ගවේෂණාත්මක දත්ත විශ්ලේෂණය (EDA): බෙදාහැරීම්, සබඳතා සහ මූලික තීක්ෂ්ණ බුද්ධිය 5. විශේෂාංග ඉංජිනේරු: ප්‍රභේද ජනනය කිරීම, කේතනය කිරීම, පරිමාණය කිරීම සහ කාන්දු වීම වැළැක්වීම 6. ආදර්ශ ගොඩනැගීම: ගැටළු නිර්වචනය, ඇල්ගොරිතම තේරීම සහ පුහුණුව/පරීක්ෂණ බෙදීම 7. ආදර්ශ ඇගයීම: ප්‍රමිතික, හරස් වලංගුකරණය සහ අන්ත ඉගෙනීම 8. දෘශ්‍යකරණය සහ කතන්දර කීම: නිවැරදි ග්‍රැෆික්ස්, අවංක ග්‍රැෆික්ස් 9. කේත උත්පාදනය: Python (pandas) සහ SQL සමඟ AI-සහාය විශ්ලේෂණය 10. දත්ත කාන්දු වීම සහ ප්‍රතිනිෂ්පාදනය: නිහඬ විපත් සහ විනය 11. MLOps පදනම, ආචාර ධර්ම, පෞද්ගලිකත්වය සහ වගකීම් විශ්ලේෂණ
ඒකකය 9 / 11

කේත උත්පාදනය: Python (pandas) සහ SQL සමඟ AI-සහාය විශ්ලේෂණය

ලාභ:

  • කෘත්‍රිම බුද්ධියට පැහැදිලි සැලැස්මක් සහ අරමුණක් ලබා දීමෙන් ශක්තිමත් SQL සහ pandas කේතය ලබාගෙන එය පේළියෙන් පේළියෙන් කියවා සත්‍යාපනය කිරීමේ හැකියාව
  • පේළි ගණන, සවි කිරීමේ කාර්යය සහ ඒකාබද්ධ කිරීම/එකතු වීමෙන් පසු ප්‍රතිදානය වැනි නිහඬ දෝෂ අල්ලා ගැනීමේ හැකියාව
  • නිශ්ශබ්ද නොකර නිදොස්කරණයේදී ගැටළුව විසඳීමට සහ නිෂ්පාදන පරිසරය තුළ එය පරීක්ෂා නොකර කේතය ධාවනය කිරීමෙන් වැළකී සිටීමට හැකියාව

දත්ත විද්‍යාවට ප්‍රාථමික භාෂා දෙකක් ඇත: SQL (ව්‍යුහගත විමසුම් භාෂාව - දත්ත සමුදායෙන් දත්ත විමසන භාෂාව) සහ පයිතන් (විශේෂයෙන්, පැන්ඩාස් පුස්තකාලය - වගු ක්‍රමලේඛන ලෙස හැසිරවීමේ සම්මත මෙවලම). මෙම ඒකකය තුළ, අපි කේත හවුල්කරුවෙකු ලෙස AI භාවිතා කිරීමට ඉගෙන ගනිමු: නිවැරදි ප්‍රශ්න සමඟින් ඝන SQL සහ pandas කේතය ලබා ගැනීම, එම කේතය කියවා වලංගු කිරීම, එය දෝෂහරණය කිරීම සහ කිසි විටෙක එය අන්ධ ලෙස ධාවනය කිරීම. AI මිනිත්තු වෙනුවට තත්පර කිහිපයකින් පුනරාවර්තන කේතය ලියයි; නමුත් එය නිපදවන කේතය නිවැරදි තර්කනය සමඟ නිවැරදි තීරුව සැකසීමට වග බලා ගැනීම ඔබේ කාර්යයයි. වැඩ කරන කේතය යනු නිවැරදි කේතය නොවේ.

AI සමඟ කේතයක් නිෂ්පාදනය කිරීම බලවත් නමුත් අවදානම් වන්නේ ඇයි?

AI කේත උත්පාදනයේදී විශාල ප්‍රතිලාභ තුනක් සපයයි: වේගය (පේළි 30ක කණ්ඩායම්-පරිවර්තන මෙහෙයුමක් තත්පර කිහිපයකින් ලියයි), මතක් කිරීම (ඔබට අමතක වූ පැන්ඩා ශ්‍රිතයක් ඔබට මතක් කරයි) සහ ඉගැන්වීම (කේත පේළිය පේළියෙන් පැහැදිලි කරයි). නමුත් එය අවදානම් තුනක් දරයි: නිහඬ තාර්කික දෝෂය (වැරදි තීරුව දෝෂ රහිතව ක්‍රියාත්මක වන කේතය), සවිකර ඇති ශ්‍රිතය (නොපවතින ක්‍රමයක් යෝජනා කරයි), සහ අස්වැන්න උගුල (කුඩා දත්ත මත ක්‍රියා කරන නමුත් පේළි මිලියන 10කදී කඩා වැටෙන කේතය). එබැවින් ස්වර්ණමය රීතිය: AI හි කේතය ඔබම ලියා ඇති ආකාරයට කියවන්න. ඔබට නොතේරෙන රේඛාව ධාවනය නොකරන්න.

SQL: මූලාශ්‍රයේ දත්ත සැකසීම

SQL ඔබට දත්ත සමුදායෙන් දත්ත ලබා ගැනීමට සහ එය එහි සැකසීමට ඉඩ දෙයි; Python වෙත ඇද නොගෙන ඔබට පේළි මිලියන ගණනක් සාරාංශ කළ හැක. මූලික ගොඩනැඟිලි කොටස්: තෝරන්න (කුමන තීරු), කොහේද (කොයි පේළිද), GROUP BY (කණ්ඩායම් සහ සාරාංශ කරන්න), JOIN (වගුවලට සම්බන්ධ වන්න), HAVING (පශ්චාත් කණ්ඩායම් පෙරහන). සංකීර්ණ JOINs සහ window functions ලිවීමේදී AI ඉතා ප්‍රයෝජනවත් වේ, නමුත් කරුණු දෙකක් පරීක්ෂා කිරීමට වග බලා ගන්න: නිවැරදි යතුර හරහා සම්බන්ධ වීම (වැරදි යතුරු අනුපිටපත් පේළි) සහ පෙරහන් තර්කනය නිවැරදිද (විශේෂයෙන් NULL හැසිරීම් සහ දින පරාසයන්).

අවවාදයයි: නිෂ්පාදන දත්ත ගබඩාවට එරෙහිව සෘජුවම AI-ජනනය කරන ලද SQL විමසුමක් ධාවනය නොකරන්න. මුලින්ම කුඩා පිටපතක් හෝ LIMIT සමඟ පරීක්ෂා කරන්න. WHERE කොන්දේසිය වලංගු කිරීමකින් තොරව යාවත්කාලීන/මකන්න විමසුමක් කිසි විටෙකත් ධාවනය නොකරන්න; වැරදි කොතැනක සම්පූර්ණ වගුව මකා දැමිය හැක.

Python/pandas: නම්‍යශීලී විශ්ලේෂණය

pandas යනු Python හි වගු (DataFrame) හැසිරවීමේ සම්මත ක්‍රමයයි. AI හි වඩාත්ම කාර්යක්ෂම භාවිතය වන්නේ එයට පැහැදිලි යෝජනා ක්‍රමයක් සහ අරමුණක් ලබා දීමයි. බහුලව භාවිතා වන මෙහෙයුම්: පෙරහන, කණ්ඩායම් වශයෙන්, ඒකාබද්ධ කිරීම, විවර්තන_වගුව, අයදුම් කරන්න. AI මේවා ඉක්මනින් ලියයි; ඔබට පරීක්ෂා කිරීමට අවශ්‍ය වන්නේ තර්කනයයි: නිවැරදි තීරුවේ සමූහගත කිරීම, ඒකාබද්ධ කිරීම අනපේක්ෂිත ලෙස පේළි ගණන වෙනස් කර තිබේද (ඒකාබද්ධ වීමෙන් පසු පේළි ගණන සැමවිටම පරීක්ෂා කරන්න), මුල් පිටපත වෙනස් කරන දාම මෙහෙයුම් වේ.

ගනුදෙනුව

SQL

පැන්ඩාවන්

මුරපොල

පෙරීම

කොහෙද

df[df.x > 5]

NULL/NaN හැසිරීම

කණ්ඩායම් කිරීම

කණ්ඩායම විසින්

df.groupby()

එය නිවැරදි තීරුව ද?

ඒකාබද්ධ කරන්න

එක්වන්න

df.merge()

පේළි ගණන වෙනස් වේ

සාරාංශය

AVG(), SUM()

.මධ්‍යන්‍ය(), .sum()

කුමන තීරුව එකතු කරන ලදී

අනුව වර්ග කරන්න

විසින් ඇණවුම් කරන්න

.sort_values()

දිශාව (ආරෝහණ/බැසීම)

අනුපිටපත් කිරීම

DISTINCT

.drop_duplicates()

කුමන තීරුවලද?

නිදොස්කරණය: AI සමඟ

කේතය අසමත් වූ විට, AI විශිෂ්ට නිදොස් කිරීමේ හවුල්කරුවෙකි. එයට සම්පූර්ණ දෝෂ පණිවිඩය සහ අදාළ කේත කොටස ලබා දෙන්න. නමුත් උගුල් දෙකකින් පරෙස්සම් වන්න. පළමුව, AI විසින් දෝෂය "නිශ්ශබ්ද කරන" විසඳුමක් යෝජනා කළ හැකිය (උදා: ඇඟවීම් සැඟවීම) - මෙය දෝෂය නිවැරදි නොකරයි, එය සඟවයි. දෙවනුව, ගැටලුවක් "විසඳීම" අතරතුර AI සමහර විට නිහඬව වෙනත් හැසිරීමක් වෙනස් කරයි. රීතිය: නිවැරදි කිරීම තේරුම් ගන්න, නිශ්ශබ්ද නොකරන්න විසඳන්න, සහ නිවැරදි කිරීමෙන් පසුව ප්‍රතිදානය තවමත් නිවැරදි බව තහවුරු කරන්න.

අර්ථකථනය කළ හැකි සහ නඩත්තු කළ හැකි කේතයක් අවශ්‍යයි

AI වෙතින් කේතයක් මිලදී ගැනීමේදී, "වැඩ කරන" කේතය පමණක් නොව, කියවිය හැකි සහ නඩත්තු කළ හැකි කේතයක් ඉල්ලා සිටින්න. ඔබ හෝ සගයෙකු එම කේතය මාස කිහිපයකට පසුව විවෘත කරන විට, එය කරන්නේ කුමක්ද යන්න තේරුම් ගැනීමට එයට හැකි විය යුතුය. මෙය සිදු කිරීම සඳහා, AI හි කරුණු තුනක් ඇතුළත් කිරීම පුරුද්දක් කර ගන්න: අර්ථවත් විචල්‍ය නම් (orders_temiz, df2 නොවේ), තීරණාත්මක පියවරවල කෙටි විවරණ රේඛා (ඇයි, කරන්නේ කුමක්ද යන්න පැහැදිලි කිරීම) සහ මැජික් අංකයක් වෙනුවට නම් කරන ලද නියතයක් (0.85 කේතය වෙනුවට ACCEPT_ESIGI = 0.85 වෙනුවට). දිගු තනි පේළි දම්වැල් ද වළකින්න (එක් පේළියක ක්රියා පහක් සම්බන්ධ කිරීම); මේවා නිදොස්කරණය අපහසු කරයි. පෙරනිමියෙන්, AI බොහෝ විට සංක්ෂිප්ත සහ "ස්මාර්ට්" කේතය නිපදවයි; "කියවිය හැකි, අර්ථකථනය කළ හැකි, නඩත්තු කළ හැකි ලෙස ලියන්න" ඔබ පැහැදිලිව පැවසුවහොත්, ඔබට වඩාත් නඩත්තු කළ හැකි ප්‍රතිදානයක් ලැබෙනු ඇත. මෙය ප්‍රතිනිෂ්පාදනය කිරීමේ පදනම ද වේ (10 වන ඒකකය): තේරුම් නොගත් කේතය ආරක්ෂිතව නැවත ධාවනය කළ නොහැකි කේතයකි.

කුඩා නඩු තුනක්

නඩුව 1 - අනුකරණයට සම්බන්ධ වන්න. විශ්ලේෂකයෙකු නිෂ්පාදන වගුව සමඟ ඇණවුම් ඒකාබද්ධ කළ අතර මුළු පිරිවැටුම 3 ගුණයකින් වැඩි විය. හේතුව: සෑම නිෂ්පාදනයක්ම නිෂ්පාදන වගුවේ පේළි කිහිපයක් (විවිධ වර්ණ) තිබුණි; එක් එක් ඇණවුම අනුපිටපත් කර JOIN. AI හි කේතය "ක්‍රියා කරයි", නමුත් පේළි ගණන 240,000 සිට 690,000 දක්වා ඉහළ ගොස් ඇත. පාඩම: සෑම විටම ඒකාබද්ධ කිරීම/එකතු වීමෙන් පසු පේළි ගණන පරීක්ෂා කරන්න.

නඩුව 2 - සවි කිරීමේ කාර්යය. ඔහු සීමාවාසිකයෙකුට AI df.groupby('x').summarize() යෝජනා කළේය; pandas වල එහෙම ක්‍රමයක් නෑ (.agg() තියෙනවා). කේතය වැඩ කළේ නැත, ඉන්ටර්න් විනාඩි 20 ක් අහිමි විය. පාඩම: ලේඛනයෙන් ඔබ හඳුනා නොගත් කාර්යයක් සත්‍යාපනය කරන්න; AI වලට ක්‍රම හදන්න පුළුවන්.

නඩුව 3 - අස්වැන්න කඩා වැටීම. එක් කේතයක් එක් එක් පේළියට අදාළ දත්ත සමුදාය විමසමින්; එය පේළි 5,000කින් ධාවනය වූ අතර, මිලියන 4ක රේඛා ඔස්සේ පැය 9ක් ගත වී නතර විය. AI දෛශික (කාණ්ඩ) විසඳුමක් යෝජනා කළ විට, කාලය තත්පර 40 දක්වා අඩු විය. පාඩම: කුඩා දත්ත මත ක්‍රියා කරන කේතය විශාල දත්ත මත බිඳ වැටිය හැක; කාර්යක්ෂමතාව සලකා බලන්න.

පිටපත් කළ හැකි සැකිලි හතරක්

1) යෝජනා ක්‍රමය සමඟ SQL ඉල්ලීම:

ඔබේ භූමිකාව: SQL සහකාර (PostgreSQL). වගු:- ඇණවුම් (id, customer_id, දින වේලා මුද්‍රාව, ප්‍රමාණය සංඛ්‍යාත්මක)- පාරිභෝගිකයන්(id, නගර පෙළ) කාර්යය: 2024 දී නගරයකට මුළු පිරිවැටුම සහ ඇණවුම් ගණන, පිරිවැටුම අනුව පිරිවැටුම අනුව අවරෝහණ අනුපිළිවෙලට වර්ග කර ගන්න. ඔබ NULL නගර හසුරුවන ආකාරය පැහැදිලි කරන්න. මම මුලින්ම LIMIT සමඟ විමසුම පරීක්ෂා කරමි; උත්පාදනය යාවත්කාලීන/මකන්න.

2) මුරපොල සමඟ පැන්ඩා ක්‍රියාවලිය:

මට DataFrames df (ඇණවුම්) සහ df_customers (ගනුදෙනුකරුවන්) ඇත. නගරයකට සාමාන්‍ය මුදල ගණනය කරන්න. වැදගත්: ඒකාබද්ධ කිරීමට පෙර සහ පසු පේළි ගණන මුද්‍රණය කරන්න එවිට මට අනුපිටපත් තිබේදැයි බැලීමට හැකිය. ඔබ ඒකාබද්ධ කළේ කුමන තීරුවේද සහ ඔබ ඇතුල්/වම තෝරාගත්තේ ඇයිද යන්න පැහැදිලි කරන්න.

3) කේත පැහැදිලි කිරීම සහ සත්‍යාපනය:

පහත දැක්වෙන පැන්ඩා කේත පේළියෙන් පේළිය පැහැදිලි කරන්න: එක් එක් පේළිය කරන්නේ කුමක්ද, එය කරන්නේ කුමන උපකල්පනද, කුමන අවස්ථා වලදී එය වැරදි ප්‍රතිඵල ලබා දිය හැකිද? මම ෆජ් ශ්‍රිතයක් භාවිතා කළේ නම් මට දන්වන්න. කේතය: [පේස්ට්]

4) නිදොස්කරණය:

මෙම කේතය මෙම දෝෂය ලබා දෙයි. සම්පූර්ණ දෝෂ පණිවිඩය: [පේස්ට්]. කේතය: [පේස්ට්]. දෝෂයට මූලික හේතුව පැහැදිලි කර එය නිවැරදි කරන්න. අනතුරු ඇඟවීම නිශ්ශබ්ද කිරීමෙන් නොව, ඇත්ත වශයෙන්ම ගැටලුව විසඳීමෙන් එය නිවැරදි කරන්න. නිවැරදි කිරීම ප්‍රතිදානය වෙනස් කළේ දැයි ද දක්වන්න.

දුර්වල ක්ෂණික / ශක්තිමත් විමසුම

දුර්වල ක්ෂණික:

මට නගරයකට විකුණුම් ලබා දෙන විමසුමක් ලියන්න.

වගු නම්, තීරු, දත්ත සමුදා වර්ගය, NULL හැසිරීම අපැහැදිලි ය. AI පොදු වේ, එය ඔබගේ මේසයට නොගැලපෙන විමසුමක් නිපදවනු ඇත.

බලවත් විමසුම:

ඔබේ භූමිකාව: SQL සහකාර (MySQL 8). වගුව: විකුණුම්(id, නගර varchar, මුදල දශම, දිනය දිනය). කාර්යය: 2024 වර්ෂය සඳහා මුළු සහ සාමාන්‍ය මුදල, නගරයකට ඇණවුම් ගණන ලබා ගන්න; සම්පූර්ණ ප්‍රමාණය අනුව වර්ග කිරීම අඩු වීම; ඇණවුම් 100කට වඩා ඇති නගර පමණක් පෙන්වන්න (තිබේ). NULL නගරය හැර. විමසුම පැහැදිලි කරන්න; මම LIMIT සමඟ පරීක්ෂා කරන්නම්.

මෙහි දත්ත සමුදාය, යෝජනා ක්‍රමය, පෙරහන, වර්ග කිරීම සහ NULL රීතිය පැහැදිලිය.

පොදු වැරදි

  • කේතය කියවීමෙන් තොරව ධාවනය කිරීම. වැඩ කරන කේතය නිවැරදි කේතය නොවේ; වැරදි තීරුව හසුරුවන කේතය ද දෝෂයකින් තොරව ක්‍රියාත්මක වේ.
  • ඒකාබද්ධ කිරීම/එකතු වීමෙන් පසු පේළි ගණන පරීක්ෂා නොකිරීම. වැරදි යතුර නිශ්ශබ්දව පේළි අනුපිටපත් කර මුළු ගණන වැඩි කරයි.
  • සවි කිරීමේ කාර්යය සත්‍යාපනය නොකරයි. AI විසින් නොපවතින ක්‍රම යෝජනා කළ හැක; ඔබ එය හඳුනා නොගත් බව ලේඛනයෙන් තහවුරු කරන්න.
  • කාර්යක්ෂමතාව ගැන හිතන්නේ නැහැ. පේළි මිලියන ගණනක කුඩා දත්ත කඩා වැටීම් මත ක්‍රියා කිරීම/ලූප් කිරීම; දෛශික කරන්න.
  • නිෂ්පාදන දත්ත ගබඩාව මත කෙලින්ම ධාවනය කරන්න. විශේෂයෙන්ම කොහේ හෝ පරීක්ෂා කිරීමකින් තොරව යාවත්කාලීන/මකන්න ධාවනය කිරීම විනාශකාරී වේ.
ඉඟිය: ඔබට AI වෙතින් ලැබෙන සෑම කේතයකටම "වලංගු කිරීමේ රේඛාවක්" එක් කිරීමට පුරුදු වන්න: පෙර සහ පසු සැකසුම් රේඛා ගණන, නියැදි රේඛා කිහිපයක් සහ අතින් තීරණාත්මක එකතුවක්. මෙම චෙක්පත් තුන බොහෝ නිහඬ තර්ක දෝෂ අල්ලා ගනී.

සාරාංශයක් ලෙස

AI යනු SQL සහ pandas කේතය ඉක්මනින් නිපදවන බලවත් හවුල්කරුවෙකි, නමුත් එය අන්ධ අධිකාරියක් නොවේ. ඔහුට සැලැස්ම සහ අරමුණ පැහැදිලිව දෙන්න; ඔබ විසින්ම ලියා ඇති පරිදි එය නිපදවන කේතය කියවන්න; ඒකාබද්ධ කිරීම/එකතු වීමෙන් පසු පේළි ගණන, සවි කිරීමේ කාර්යයන් සහ ප්‍රතිදානය පරීක්ෂා කරන්න; නිෂ්පාදන දත්ත ගබඩාවේ එය පරීක්ෂා නොකර එය ධාවනය නොකරන්න. දෝශ නිරාකරණය කරන විට, ගැටලුව නිශ්ශබ්ද කිරීමට නොව විසඳීමට ඉලක්ක කරන්න. වැඩ කරන කේතය නිවැරදි කේතය නොවේ; නිරවද්යතාව සහතික කළ හැක්කේ ඔබට පමණි.

යෙදුම් කාර්යය

විශ්ලේෂණ ප්‍රශ්නයක් තෝරන්න (උදා: "නාලිකාවකට මාසික පිරිවැටුම") සහ SQL සහ pandas යන දෙකම සමඟ AI වෙතින් කේතය ඉල්ලන්න. කේත පේළි දෙකම පේළියෙන් කියවන්න, ඒකාබද්ධ කිරීමෙන් පසු පේළි ගණන පරීක්ෂා කරන්න/එකතු වන්න සහ අවම වශයෙන් එක් තීරණාත්මක එකතුවක් අතින් සත්‍යාපනය කරන්න. කේත දෙක එකම ප්‍රතිඵලයක් නිපදවන්නේද යන්න සසඳන්න; වෙනස් නම්, ඒ මන්දැයි සොයා බලන්න.

පිරික්සුම් ලැයිස්තුව

  • [ ] මම වගුව/ යෝජනා ක්‍රමය සහ අරමුණ පැහැදිලිව AI වෙත ලබා දී තිබේද?
  • [ ] එය නිෂ්පාදනය කරන ලද කේතය මම පේළියෙන් පේළිය කියවා තේරුම් ගත්තාද?
  • [ ] මම ඒකාබද්ධ කිරීම/එකතු වීමෙන් පසු පේළි ගණන පරීක්ෂා කළේද?
  • [ ] මම ලේඛනයෙන් මා හඳුනා නොගත් කාර්යයන් සත්‍යාපනය කර තිබේද?
  • [ ] මම මුලින්ම කේතය පරීක්‍ෂා කර ඇත්තේ නිෂ්පාදන පරිසරයේ නොව ආරක්ෂිත/කුඩා දත්ත මතද?