ክፍል 1 / 11

በኤምኤል ኢንጂነሪንግ ውስጥ አርቲፊሻል ኢንተለጀንስ፡ ሚና፣ ወሰን፣ ማረጋገጫ እና ኃላፊነት

ትርፍ፡

  • በኤምኤል የስራ ፍሰት (ኮድ፣ መረጃ፣ ሰነድ) ሰው ሰራሽ ኢንተለጀንስ በአነስተኛ አደጋ ጊዜን የሚቆጥብበትን ቦታ መለየት መቻል፣ እና እንደ ሜትሪክ/ዳታ/ወደ ምርት ላይ የሚደረጉ ውሳኔዎች በተግባሩ ስጋት ደረጃ ለሰው የተተዉ ናቸው።
  • እያንዳንዱን የ AI ውፅዓት ከምንጩ ጋር በማገናኘት ፣ እንደገና በማስኬድ ፣ በመለካት እና በምህንድስና ማጣሪያ ውስጥ በማለፍ የሚያረጋግጥ ዲሲፕሊን የመተግበር ችሎታ።
  • ጥሬ ሚስጥራዊ እና ግላዊ መረጃዎችን ወደ ውጫዊ መሳሪያዎች አለመላክ፣ በድርጅት የጸደቁ መሳሪያዎችን የመጠቀም እና የደህንነት ጉዳዮችን ለመከላከያ ዓላማዎች ብቻ የማስተናገድ ልምድ የማግኘት ችሎታ።

በማሽን መማር ምህንድስና ውስጥ ሰው ሰራሽ እውቀት፡ ሚና፣ ወሰን፣ ማረጋገጫ እና ኃላፊነት

የማሽን መማሪያ መሐንዲስ (ኤምኤል ኢንጂነር፡ የሶፍትዌር ባለሙያ ከመረጃ ወደ ምርት የሚማሩ ሞዴሎችን የሚቀርጽ፣ የሚያሠለጥን እና የሚያመጣ) ዛሬ በእያንዳንዱ የሥራ ደረጃ ላይ ሌላ አርቴፊሻል ኢንተለጀንስ መሣሪያን ይዞ ይሰራል። ኮድ በሚጽፍበት ጊዜ ኮዲንግ ረዳት ይተገበራል ፣ መረጃን በሚመረምርበት ጊዜ የውይይት ሞዴል ፣ እና ትልቅ የቋንቋ ሞዴል (LLM: ጽሑፍን የሚረዳ እና የሚያሰራ በቢሊዮኖች የሚቆጠሩ መለኪያዎች ያለው የነርቭ አውታረ መረብ) ሰነዶችን ሲያዘጋጁ። ይህ ሞጁል አርቴፊሻል ኢንተለጀንስ እንደ ተሻሻለው ምርት እና እንደ ML መሐንዲስ ዕለታዊ የሥራ መሣሪያ አድርጎ ይመለከታል። ሁለቱን ሚናዎች ሳያቀላቅሉ የኃላፊነት ድንበሮችን በግልጽ በመዘርዘር ይሠራል.

በዚህ የመጀመርያው ክፍል፣ መሠረታዊውን ጥያቄ እንመልሳለን፡ በኤምኤል ኢንጂነሪንግ ውስጥ አርቴፊሻል ኢንተለጀንስ እውነተኛ ጊዜን የሚቆጥብበት እና ውሳኔውን ለሰዎች የት መተው አለብን? መልሱ የምህንድስና ዲሲፕሊን እምብርት ነው፡ የሚሠራው ፈጣን ነው፣ ያረጋገጠው ተጠያቂ ነው።

በኤምኤል ኢንጂነሪንግ ውስጥ አርቴፊሻል ኢንተለጀንስ ከየት ይመጣል?

የኤምኤል ፕሮጄክት በግምት በሚከተሉት መስመሮች ውስጥ ያልፋል፡ የመረጃ አሰባሰብ፣ የመረጃ ጽዳት፣ የባህሪ ምህንድስና (ጥሬ መረጃን ወደ ዲጂታል ሲግናሎች መተርጎም)፣ የሞዴል ስልጠና፣ ግምገማ፣ ማሰማራት (ማሰማራት፡ ሞዴሉን ለእውነተኛ ተጠቃሚ መክፈት) እና ክትትል። AI በዚህ መስመር ላይ በእያንዳንዱ ማቆሚያ ይረዳል, ነገር ግን የስልጣን ደረጃው ይለያያል.

ከፍተኛ ሽልማት ያላቸው፣ ዝቅተኛ ስጋት ያለባቸው ቦታዎች፡ የኮድ አጽም ማምረት፣ የውሂብ ለውጥ ተግባርን መቅረጽ፣ የምዝግብ ማስታወሻ መልእክቶችን መተርጎም፣ የተቆለለ ዱካ መግለጽ፣ የሙከራ ማስታወሻዎችን ማጠቃለል፣ ሰነዶችን እና READMEs መጻፍ፣ የሙከራ ጉዳይን ማቅረብ። እዚህ, የሰው ሰራሽ የማሰብ ችሎታ ስህተቶች ርካሽ ናቸው; ምክንያቱም ውጤቱ አስቀድሞ በሙከራ እና በመገምገም ያልፋል።

ከፍተኛ ስጋት ያለባቸው ቦታዎች፡ ምን አይነት መረጃ ወደ ስልጠና እንደሚገባ መወሰን፣ ሞዴል ወደ ምርት መግባት እንዳለበት ማረጋገጥ፣ መለኪያን መገምገም "በቂ" ነው፣ የግል መረጃን ለማስኬድ መወሰን፣ የደህንነት ተጋላጭነትን እንደ "ቆሻሻ" መዝጋት። እነዚህ ገንዘብን፣ ግላዊነትን፣ ህጋዊ ተጠያቂነትን እና የተጠቃሚ እምነትን ይነካል። ሰው ሰራሽ የማሰብ ችሎታ እዚህ ምክሮችን ይሰጣል; ውሳኔው የሚወሰነው ብቃት ባለው መሐንዲስ እና ኃላፊነት ባለው ቡድን ነው።

ጠቃሚ ምክር፡ አንድን ተግባር ወደ AI ከመላክዎ በፊት፡ “ይህ ውፅዓት ስህተት ከሆነ ዋጋው ምን ያህል ነው፣ እና ማንም ሰው ስህተቱን እንዴት በቀላሉ ይይዛል?” ብለው ይጠይቁ። ዋጋው ዝቅተኛ ከሆነ እና መያዝ ቀላል ከሆነ, ያስተላልፉ. ዋጋው ከፍ ያለ ከሆነ ወይም መያዝ አስቸጋሪ ከሆነ, AI ለረቂቁ ብቻ ይጠቀሙ እና እርስዎ ይወስኑ.

የማረጋገጫ ዲሲፕሊን: ሶስት ደረጃዎች

በኤምኤል ኢንጂነሪንግ ፣ AI ውፅዓት በጭራሽ “የተጠናቀቀ ሥራ” አይደለም ። ረቂቅ ነው። እያንዳንዱን ውፅዓት በእነዚህ ሶስት ደረጃዎች ያሂዱ።

  1. ከምንጩ ጋር ያገናኙት። ሞዴሉ አንድ ቁጥር፣ ደፍ ወይም “ምርጥ ልምምድ” ካለ፣ በይፋዊ ሰነዶች፣ በኮድ ቤዝ ውስጥ ያለው ትክክለኛ እሴት ወይም በሚለካ መለኪያ ላይ መሰረቱት። “የአምሳያው መገጣጠም” (ቅዠት፡ በቋንቋው ሞዴል ትክክለኛ ያልሆነ መረጃ በራስ መተማመን) ብዙውን ጊዜ እዚህ ይያዛል።
  2. እንደገና ያስጀምሩ እና ይለኩ. የተፈጠረውን ኮድ ያሂዱ፣ በራሱ የሙከራ ስብስብ ላይ የሚያወጣውን መለኪያ እንደገና አስሉ፣ የቀረበውን የSQL መጠይቅ በትንሽ ናሙና ላይ ያረጋግጡ። ጥሩ ቢመስልም የማይሰራ ኮድ ዋጋ የለውም።
  3. በምህንድስና ማጣሪያ ውስጥ ይለፉ. የውጤቱ መጠን በመጠን ይይዛል? የጠርዝ ጉዳዮች (ባዶ ውሂብ፣ በጣም ትልቅ ግቤት፣ የጎደሉ መስኮች) ግምት ውስጥ ገብተዋል? የደህንነት እና የግላዊነት ጥሰት አለ? ሜዳውን የሚያውቅ ሰው ብቻ ይህንን እርምጃ ሊሰራ ይችላል.

ደካማ ጥያቄ / ጠንካራ ጥያቄ

ደካማ ጥያቄ፡ "አንዳንድ የሞዴል የስልጠና ኮድ ፃፉልኝ።"

ኃይለኛ ጥያቄ፡ "በሁለትዮሽ ምደባ የስልጠና ስክሪፕት ከscikit-learn ጋር ይፃፉ። ግቤት፡ ዳታ/train.parquet፣ ዒላማ ዓምድ is_churn። የክፍል ሚዛን መዛባት (አዎንታዊ መጠን ~ 8%)፣ ከክፍል_ክብደት ጋር ያዙት። PR-AUCን (በትክክል-ማስታወሻ ከርቭ ስር)ን ይጠቀሙ የግምገማ መለኪያው ትክክለኛ ሚዛን ስላልሆነ። ወደ 42. በኮድ ህትመት ስብስብ PR-AUC መጨረሻ ላይ ይሞክሩ።

ልዩነት፡ ሁለተኛው ፈጣን ተግባር የውሂብ እውነት፣ ትክክለኛ መለኪያ፣ ሚዛናዊ ያልሆነ መረጃ እና የመደጋገም መስፈርት ይዟል። ውጤቱ ሊረጋገጥ የሚችል እና ጥቅም ላይ የሚውለው ከዚህ አውድ ነው።

የግላዊነት እና የውሂብ ደህንነት፡ የመሐንዲሱ የመጀመሪያ ኃላፊነት

የኤምኤል መሐንዲሱ ብዙ ጊዜ የኩባንያውን በጣም ሚስጥራዊነት ያለው መረጃ ይነካል፡ የደንበኛ መዝገቦች፣ የግብይት ታሪክ፣ የጤና ወይም የፋይናንስ ውሂብ፣ የምርት ስርዓቶች ምዝግብ ማስታወሻዎች። ለአርቴፊሻል ኢንተለጀንስ መሳሪያዎች መረጃ ሲሰጡ ሶስት ህጎች፡-

  • ጥሬ የግል እና ሚስጥራዊ መረጃን ወደ ውጫዊ መሳሪያዎች አይላኩ። ለምሳሌ፣ የደንበኛ ኢሜይሎችን ወደ መጠየቂያው ውስጥ ከመለጠፍ ይልቅ፣ ሼማውን እና ዲሚ (synthetic) ናሙናዎችን ይላኩ። ከእውነተኛ ውሂብ ይልቅ ጭምብል የተደረገበትን ምሳሌ ይጠቀሙ።
  • በድርጅት ተቀባይነት ያላቸውን ተሽከርካሪዎች ይጠቀሙ። መረጃው የት እንደሚካሄድ፣ የተከማቸበት፣ ለትምህርት የሚውል ወይም የማይውል በውል ግልጽ የሆኑ መሳሪያዎችን ይምረጡ። የድርጅት ውሂብን በግል መለያ ማካሄድ በአብዛኛዎቹ ኩባንያዎች ውስጥ ጥሰት ነው።
  • አነስተኛ የውሂብ ፖሊሲ። ተግባሩን ለመፍታት የሚያስፈልገውን አነስተኛ አውድ ይስጡ። ሙሉውን ጠረጴዛ ሳይሆን ተዛማጅ 5 አምዶች እና ንድፍ.
ማስጠንቀቂያ፡ ለቋንቋ ሞዴል የሰጡት ጽሑፍ ሊቀለበስ እንደማይችል አስቡት። ጥሬ የግል መረጃን "በኋላ አጠፋዋለሁ" ብለው አያስቡ; አደጋው የተከሰተው በተላከበት ቅጽበት ነው።

በደህንነት መስክ ውስጥ የመከላከያ አጠቃቀም

የኤምኤል መሐንዲሶች ብዙውን ጊዜ የደህንነት ስርዓቶችን ይጭናሉ: ማጭበርበርን መለየት, አደገኛ የትራፊክ ምደባ, ማረጋገጥ. በዚህ ሞጁል ውስጥ የደህንነት ጉዳዮችን ለመከላከያ ዓላማዎች ብቻ እንሸፍናለን-ጥቃቱን መለየት, ስርዓቱን ማጠናከር, ተጋላጭነትን መዝጋት. ሰው ሰራሽ ኢንተለጀንስ ላልተፈቀደ መዳረሻ፣ የውሂብ መልቀቅ ወይም ያልተፈቀደ ጣልቃ ገብነት በሌላ ሰው ስርአት ውስጥ ህገወጥ እና ሙያዊ ስነ-ምግባርን የሚጻረር ነው። ተጋላጭነት ሲያገኙ ትክክለኛው መንገድ በኃላፊነት ሪፖርት ማድረግ እና ማስተካከል ነው; አለመበዝበዝ.

ሶስት ጥቃቅን ጉዳዮች

ጉዳይ 1 - ጊዜ ተቀምጧል. አንድ ML መሐንዲስ የ40-አምድ ዳታ ስብስብን ገላጭ መረጃ ትንተና (EDA) በመስራት ግማሽ ቀን ያሳልፋል። እሱ schema እና df.describe() ውጤቱን ለአርቴፊሻል ኢንተለጀንስ ሰጠ እና "የትኞቹ አምዶች ከፍተኛ የውጭ እና የጎደላቸው መጠን አላቸው፣ የትኞቹን ለውጦች ይመክራሉ?" በ 20 ደቂቃዎች ውስጥ እያንዳንዱን ንጥል በራሱ ኮድ በማረጋገጥ ቅድሚያ የሚሰጠውን ዝርዝር ተቀበለ. ይቆጥቡ፡ ~ 3 ሰአታት፣ አነስተኛ የስህተት አደጋ እያንዳንዱ የይገባኛል ጥያቄ ስለሚለካ።

ጉዳይ 2 - የተያዘ ስህተት. "የሥልጠና ትክክለኛነት 99% በጣም ጥሩ ነው" ሲል ሞዴሉ የውይይት ረዳት ተናግሯል። መሐንዲሱ ሶስተኛውን እርምጃ (የኢንጂነሪንግ ማጣሪያ) ተተግብሯል እና ተገነዘበ: የዒላማው አምድ በአጋጣሚ የፈሰሰ ባህሪያት ነበረው (የውሂብ መፍሰስ: ሞዴሉ በስልጠና ላይ ማየት የማይገባውን መረጃ ይመለከታል). ትክክለኛው አፈጻጸም በጣም ያነሰ ነበር። የኢንጂነሩ ጥርጣሬ እንጂ የ AI “ታላቅ” አተረጓጎም ሥራውን አዳነ።

ጉዳይ 3 - የግላዊነት ጥሰትን መከላከል። አንድ ቡድን የምርት ስህተት ምዝግብ ማስታወሻዎችን ወደ ውጫዊ ሞዴል እየለጠፈ እና "ይህን ስህተት አስተካክል" እያለ ነበር. በምዝግብ ማስታወሻዎች ውስጥ የደንበኛ መለያ ቁጥሮች ነበሩ። ቡድኑ መጀመሪያ ምዝግብ ማስታወሻዎቹን የሚሸፍን (መታወቂያ ቁጥራቸውን ***) የሚሸፍን ትንሽ ስክሪፕት የመፃፍ ህግ አውጥቶ በዚያ መንገድ ይልካቸዋል። የጥሰቱ አደጋ ጠፍቷል, የእርዳታ ፍጥነት አልተለወጠም.

ሊገለበጡ የሚችሉ አብነቶች

ተግባር፡ [ምን ማድረግ፣ ነጠላ ዓረፍተ ነገር] አውድ፡ [የመረጃ ንድፍ፣ መጠን፣ ገደቦች; ትክክለኛ የግል መረጃ የለም]እገዳዎች፡ [ቋንቋ/ቤተ-መጽሐፍት፣ አፈጻጸም፣ መባዛት] መለኪያዎች፡ [ስኬትን እንዴት እንደሚለካ] የሚፈለግ ውጤት፡ [ኮድ/መግለጫ/ዝርዝር] እና ለምን በዚህ ቅርጸት

ይህን ኮድ ይመልከቱ። የሚሰራ መሆኑን ብቻ ሳይሆን በሚከተለው መልኩ ገምግመው፡1) የጠርዝ ጉዳዮች (ባዶ ግብአት፣ የጎደለ አምድ፣ በጣም ትልቅ መረጃ)2) የውሂብ መፍሰስ አደጋ3) መራባት (ዘር፣ ስሪት) ላገኙት እያንዳንዱ ችግር ማስተካከያዎችን ይጠቁሙ። እርግጠኛ ባልሆኑበት ቦታ "አረጋግጥ" የሚለውን ምልክት ያድርጉ። ኮድ: [ኮድ]

የዚህን ልኬት ውጤት ይተርጉሙ፣ ግን መጀመሪያ ይጠይቁ፡ ይህ ልኬት ለዚህ ችግር ትክክል ነውን? ችግር፡ [ሚዛናዊ/ያልተመጣጠነ ምደባ፣ መመለሻ፣ ደረጃ...] ሪፖርት የተደረገ ሜትሪክ እና እሴት፡ [ለምሳሌ፡. ትክክለኛነት 0.99] የትኛውን መለኪያ ነው የምትመክረው እና ለምን፣ እና አሁን ያለውን ውጤት እንድጠራጠር ምን ምልክቶችን መፈለግ አለብኝ?

ለሚከተለው ጥያቄ በምሰጠው መረጃ ውስጥ የግል/ሚስጥራዊ መረጃ መኖሩን ያረጋግጡ። ከዚህ በታች ባለው ጽሑፍ ውስጥ መደበቅ ያለባቸውን መስኮች (ስም ፣ ኢሜል ፣ መታወቂያ ቁጥር ፣ ስልክ ፣ አድራሻ) ይዘርዝሩ። ጽሑፍ: [ጽሑፍ]

ሚና እና ስልጣን ሰንጠረዥ

ተልዕኮ

የሰው ሰራሽ የማሰብ ችሎታ ሚና

የውሳኔው ባለቤት

ኮድ አጽም / የመለወጥ ተግባር

ረቂቅ ጀነሬተር

መሐንዲስ (ግምገማዎች)

EDA / የውሂብ ማጠቃለያ

አፋጣኝ

መሐንዲስ (በመመዘን ያረጋግጣል)

ሜትሪክ ትርጉም

ጥቆማ

ኢንጂነር

ምን ውሂብ ወደ ስልጠና ይገባል?

ጥቆማ

የቡድን + የውሂብ ባለቤት

ሞዴሉን ወደ ምርት ያስገቡ

የማረጋገጫ ዝርዝር አስታዋሽ

ኃላፊነት ያለው መሐንዲስ + ቡድን

የግል ውሂብ ሂደት

ምንም (አልተጠቀመም)

የህግ + የውሂብ መቆጣጠሪያ

የተለመዱ ስህተቶች

  • ውጤቱን ሳያረጋግጡ መጠቀም. በጣም የተለመደው እና በጣም ውድ የሆነ ስህተት. ቆንጆ የሚመስለው ኮድ ወይም ሜትሪክ ትክክል ነው ማለት አይደለም።
  • በመሳሪያው ውስጥ ጥሬ ሚስጥራዊ መረጃን በመለጠፍ ላይ። አንዴ ከተላከ በኋላ ተመልሶ ሊወሰድ አይችልም።
  • በተሳሳተ መለኪያ ላይ መተማመን። እንደ ሚዛናዊ ባልሆነ መረጃ ትክክለኛነት እና RMSE ያሉ የማይጣጣሙ መለኪያዎች አሳሳች ናቸው።
  • እንደ ውሳኔ ሰጪው ሰው ሰራሽ የማሰብ ችሎታ ስህተት። እሱ ምክሮችን ይሰጣል; ኃላፊነቱ በፈራሚው ላይ ነው።
  • አውድ-አልባ ጥያቄ። እንደ “ሞዴል ጻፍ” ያሉ አሻሚ ጥያቄዎች የማይረጋገጥ ውጤት ያስገኛሉ።

በማጠቃለያው

አርቴፊሻል ኢንተለጀንስ ሁለቱም በኤምኤል መሐንዲስ የተገነባው እና በየእለቱ የሚባዛው ምርት ነው። ዋጋው ዝቅተኛ-አደጋ ውስጥ ከፍተኛ ነው, በቀላሉ የተረጋገጡ ተግባራት እንደ ኮድ-ዳታ-ሰነድ; ገንዘብን፣ ግላዊነትን እና ደህንነትን የሚነኩ ውሳኔዎች በሰውየው ላይ ይቀራሉ። እያንዳንዱን ውጤት ከምንጩ ጋር ያገናኙ ፣ እንደገና ይለኩ ፣ በምህንድስና ማጣሪያ ውስጥ ያልፉ። ሚስጥራዊ መረጃዎችን ይጠብቁ፣ የተፈቀዱ ተሽከርካሪዎችን ይጠቀሙ፣ በደህንነት ውስጥ ለመከላከያ ዓላማ ብቻ ይሰሩ። ይህ ተግሣጽ ለሁሉም ተከታታይ ክፍሎች መሠረት ነው.

የመተግበሪያ ተግባር

ከራስህ ፕሮጀክት አንድ ተግባር ምረጥ (ለምሳሌ የውሂብ ማጽዳት ተግባርን መጻፍ)። በመጀመሪያ ደካማ መጠየቂያ ይጻፉ፣ ከዚያም በዚህ ክፍል ውስጥ ያለውን አብነት በመጠቀም ጠንካራ ጥያቄ ይፃፉ። ሁለቱንም ውጤቶች ውሰዱ፣ ባለ ሶስት እርከን ማረጋገጫን ተግብር (ከምንጭ ጋር ማገናኘት፣ ዳግም ማስጀመር፣ የምህንድስና ማጣሪያ)። የትኛው ጥያቄ ምን ያህል ደቂቃዎችን እና ምን ያህል እርማቶችን እንደሚቆጥብ ልብ ይበሉ።

የማረጋገጫ ዝርዝር

  • [] የተግባሬን ስጋት ደረጃ (ዝቅተኛ/ከፍተኛ) ወስኛለሁ።
  • [ ] በጥያቄው ውስጥ ምንም አይነት የግል/ሚስጥራዊ መረጃ አላስቀመጥኩም። ጭንብል አድርጌዋለሁ ወይም ሰው ሰራሽ ናሙና ተጠቀምኩ።
  • [ ] ውጤቱን ከምንጩ ጋር አገናኘሁት፣ እንደገና ሮጥኩት፣ ከምህንድስና አንፃር አጣራሁት።
  • [ ] ትክክለኛውን መለኪያ እንደመረጥኩ አረጋግጫለሁ።
  • [ ] ወሳኝ ውሳኔውን (ወደ ምርት፣ መረጃ ማቀናበር) ራሴ/ከቡድኑ ጋር ወስኛለሁ፣ ለአርቴፊሻል ኢንተለጀንስ አልተውኩትም።
  • [] በድርጅት ተቀባይነት ያለው ተሽከርካሪ ተጠቀምኩኝ።