इकाइयाँ
1. एमएल इंजीनियरिंग में आर्टिफिशियल इंटेलिजेंस: भूमिका, सीमाएं, मान्यता और जिम्मेदारी 2. डेटा पाइपलाइन: संग्रहण, सफ़ाई, टैगिंग और संस्करणीकरण 3. मॉडल प्रशिक्षण और मूल्यांकन: सटीक मेट्रिक्स, ईमानदार बेंचमार्किंग 4. एलएलएम आवेदन: आरएजी के साथ आपके अपने डेटा के आधार पर उत्तर 5. एलएलएम एप्लीकेशन: एजेंट, टूलींग और सुरक्षित स्वचालन 6. फाइन-ट्यूनिंग आधार: कब, कैसे और किस जोखिम के साथ 7. एमएलओपीएस और परिनियोजन: मॉडल को लैब से उत्पादन तक ले जाना 8. मूल्यांकन और निगरानी: यह जानना कि मॉडल वास्तव में उत्पादन में क्या करता है 9. सुरक्षा और गोपनीयता: एआई सिस्टम का बचाव 10. पूर्वाग्रह, नैतिकता और लागत: जिम्मेदार और टिकाऊ एआई इंजीनियरिंग 11. प्रतिलिपि प्रस्तुत करने योग्यता और अंत-से-अंत परियोजना: हर चीज़ का संयोजन
इकाई 1 / 11

एमएल इंजीनियरिंग में आर्टिफिशियल इंटेलिजेंस: भूमिका, सीमाएं, मान्यता और जिम्मेदारी

लाभ:

  • एमएल वर्कफ़्लो (कोड, डेटा, दस्तावेज़) में अंतर करने में सक्षम होने के कारण कृत्रिम बुद्धिमत्ता कम जोखिम के साथ समय बचाती है, और जहां कार्य जोखिम स्तर के अनुसार मीट्रिक / डेटा / उत्पादन में लगाने जैसे निर्णय मानव पर छोड़ दिए जाते हैं।
  • एक अनुशासन लागू करने की क्षमता जो प्रत्येक एआई आउटपुट को स्रोत से जोड़कर, उसे फिर से चलाकर, मापकर और एक इंजीनियरिंग फ़िल्टर के माध्यम से पारित करके सत्यापित करती है।
  • कच्चे गोपनीय और व्यक्तिगत डेटा को बाहरी उपकरणों पर न भेजने, कॉर्पोरेट-अनुमोदित उपकरणों का उपयोग करने और केवल रक्षात्मक उद्देश्यों के लिए सुरक्षा मुद्दों को संभालने की आदत हासिल करने की क्षमता।

मशीन लर्निंग इंजीनियरिंग में आर्टिफिशियल इंटेलिजेंस: भूमिका, सीमाएँ, मान्यता और जिम्मेदारी

एक मशीन लर्निंग इंजीनियर (एमएल इंजीनियर: एक सॉफ्टवेयर पेशेवर जो डेटा से उत्पादन तक सीखने वाले मॉडल को डिजाइन, प्रशिक्षित और लाता है) आज अपनी नौकरी के हर चरण में एक अन्य कृत्रिम बुद्धिमत्ता उपकरण के साथ काम करता है। कोड लिखते समय एक कोडिंग सहायक प्रभावी होता है, डेटा की खोज करते समय एक वार्तालाप मॉडल, और दस्तावेज़ तैयार करते समय एक बड़ा भाषा मॉडल (एलएलएम: अरबों मापदंडों वाला एक तंत्रिका नेटवर्क जो पाठ को समझता है और उत्पन्न करता है)। यह मॉड्यूल कृत्रिम बुद्धिमत्ता को विकसित उत्पाद और एमएल इंजीनियर के दैनिक कार्य उपकरण दोनों के रूप में मानता है। यह दो भूमिकाओं को मिलाए बिना जिम्मेदारी की सीमाओं को स्पष्ट रूप से चित्रित करके संचालित होता है।

इस पहली इकाई में, हम मूल प्रश्न का उत्तर देते हैं: एमएल इंजीनियरिंग में कृत्रिम बुद्धिमत्ता कहां वास्तविक समय बचाती है, और कहां हमें निर्णय मनुष्यों पर छोड़ना पड़ता है? उत्तर इंजीनियरिंग अनुशासन के केंद्र में है: जो बनाता है वह तेज़ है, जो सत्यापित करता है वह ज़िम्मेदार है।

एमएल इंजीनियरिंग में कृत्रिम बुद्धिमत्ता कहाँ काम आती है?

एक एमएल प्रोजेक्ट मोटे तौर पर निम्नलिखित पंक्तियों से गुजरता है: डेटा संग्रह, डेटा सफाई, फीचर इंजीनियरिंग (कच्चे डेटा को डिजिटल सिग्नल में अनुवाद करना जिसे मॉडल समझ सकता है), मॉडल प्रशिक्षण, मूल्यांकन, तैनाती (तैनाती: मॉडल को वास्तविक उपयोगकर्ता के लिए खोलना) और निगरानी। एआई इस लाइन पर हर पड़ाव पर मदद करता है, लेकिन इसके अधिकार का स्तर भिन्न होता है।

उच्च-इनाम, कम-जोखिम वाले क्षेत्र: एक कोड स्केलेटन तैयार करना, एक डेटा ट्रांसफ़ॉर्मेशन फ़ंक्शन का मसौदा तैयार करना, लॉग संदेशों की व्याख्या करना, एक स्टैक ट्रेस का वर्णन करना, प्रयोग नोट्स का सारांश देना, दस्तावेज़ीकरण और रीडमी लिखना, एक परीक्षण मामले का प्रस्ताव करना। यहाँ, कृत्रिम बुद्धिमत्ता की गलतियाँ सस्ती हैं; क्योंकि आउटपुट पहले से ही परीक्षण और समीक्षा से गुजरेगा।

उच्च जोखिम वाले क्षेत्र: यह तय करना कि कौन सा डेटा प्रशिक्षण में जाएगा, यह पुष्टि करना कि क्या किसी मॉडल को उत्पादन में जाना चाहिए, एक मीट्रिक को "काफी अच्छा" मानना, व्यक्तिगत डेटा को संसाधित करने का निर्णय, सुरक्षा भेद्यता को "जंक" के रूप में बंद करना। ये धन, गोपनीयता, कानूनी दायित्व और उपयोगकर्ता विश्वास को प्रभावित करते हैं। आर्टिफिशियल इंटेलिजेंस यहां सुझाव देता है; निर्णय सक्षम इंजीनियर और जिम्मेदार टीम द्वारा किया जाता है।

युक्ति: किसी कार्य को एआई को आउटसोर्स करने से पहले, पूछें: "यदि यह आउटपुट गलत है तो लागत क्या है, और कोई भी कितनी आसानी से गलती पकड़ लेगा?" यदि कीमत कम है और पकड़ना आसान है, तो इसे आगे बढ़ा दें। यदि कीमत अधिक है या कब्जा करना मुश्किल है, तो केवल ड्राफ्ट के लिए एआई का उपयोग करें और आप निर्णय लें।

सत्यापन अनुशासन: तीन चरण

एमएल इंजीनियरिंग में, एआई आउटपुट कभी भी "समाप्त कार्य" नहीं होता है; यह एक मसौदा है. प्रत्येक आउटपुट को इन तीन चरणों के माध्यम से चलाएँ:

  1. इसे स्रोत से जोड़ें. यदि मॉडल ने एक संख्या, एक सीमा, या "सर्वोत्तम अभ्यास" कहा है, तो इसे आधिकारिक दस्तावेज़ीकरण, कोडबेस में वास्तविक मूल्य, या एक मापा मीट्रिक पर आधारित करें। "मॉडल की फिटिंग" (मतिभ्रम: भाषा मॉडल द्वारा गैर-वास्तविक जानकारी का आत्मविश्वासपूर्ण उत्पादन) अक्सर यहां पकड़ा जाता है।
  2. पुनरारंभ करें और मापें. जेनरेट किए गए कोड को चलाएँ, अपने स्वयं के परीक्षण सेट पर उत्पन्न मीट्रिक की पुनर्गणना करें, एक छोटे नमूने पर प्रस्तावित SQL क्वेरी को मान्य करें। जो कोड काम नहीं करता वह बेकार है, भले ही वह अच्छा दिखता हो।
  3. इसे इंजीनियरिंग फिल्टर से गुजारें। क्या आउटपुट बड़े पैमाने पर बना रहता है? क्या किनारे के मामलों (खाली डेटा, बहुत बड़ा इनपुट, लापता फ़ील्ड) पर विचार किया गया है? क्या कोई सुरक्षा और गोपनीयता का उल्लंघन है? यह कदम केवल वही व्यक्ति उठा सकता है जो इस क्षेत्र को जानता हो।

कमजोर संकेत/मजबूत संकेत

कमज़ोर संकेत: "मुझे कुछ मॉडल प्रशिक्षण कोड लिखें।"

शक्तिशाली संकेत: "स्किकिट-लर्न के साथ बाइनरी वर्गीकरण के लिए एक प्रशिक्षण स्क्रिप्ट लिखें। इनपुट: डेटा/ट्रेन.पैरक्वेट, लक्ष्य कॉलम is_churn। वर्ग असंतुलन है (सकारात्मक दर ~8%), इसे क्लास_वेट के साथ संभालें। मूल्यांकन मीट्रिक के रूप में पीआर-एयूसी (परिशुद्धता-रिकॉल वक्र के तहत क्षेत्र) का उपयोग करें, क्योंकि असंतुलित डेटा के लिए सटीकता भ्रामक है। यादृच्छिक बीज को 42 पर ठीक करें। कोड प्रिंट सेट पीआर-एयूसी के अंत में परीक्षण करें।"

अंतर: दूसरे त्वरित कार्य में डेटा सत्यता, सही मीट्रिक, असंतुलन जानकारी और दोहराव की आवश्यकता शामिल है। यह इस संदर्भ से है कि आउटपुट सत्यापन योग्य और प्रयोग योग्य है।

गोपनीयता और डेटा सुरक्षा: इंजीनियर की पहली जिम्मेदारी

एमएल इंजीनियर अक्सर कंपनी के सबसे संवेदनशील डेटा को छूता है: ग्राहक रिकॉर्ड, लेनदेन इतिहास, स्वास्थ्य या वित्तीय डेटा, उत्पादन प्रणालियों के लॉग। कृत्रिम बुद्धिमत्ता उपकरणों को डेटा देते समय तीन नियम:

  • अपरिष्कृत व्यक्तिगत और गोपनीय डेटा को बाहरी टूल पर न भेजें। उदाहरण के लिए, ग्राहक ईमेल को प्रॉम्प्ट में चिपकाने के बजाय, स्कीमा और डमी (सिंथेटिक) नमूने भेजें। वास्तविक डेटा के बजाय "उदा: ahmet@example.com" जैसे छिपे हुए उदाहरण का उपयोग करें।
  • कॉर्पोरेट अनुमोदित वाहनों का उपयोग करें। ऐसे उपकरण चुनें जो संविदात्मक रूप से स्पष्ट हों कि डेटा कहाँ संसाधित किया जाता है, क्या इसे संग्रहीत किया जाता है, इसका उपयोग शिक्षा के लिए किया जाता है या नहीं। व्यक्तिगत खाते से कॉर्पोरेट डेटा संसाधित करना अधिकांश कंपनियों में उल्लंघन है।
  • न्यूनतम डेटा नीति. कार्य को हल करने के लिए आवश्यक न्यूनतम संदर्भ दीजिए। संपूर्ण तालिका नहीं, बल्कि प्रासंगिक 5 कॉलम और स्कीमा।
सावधानी: मान लें कि आप भाषा मॉडल को जो पाठ देते हैं उसे पूर्ववत नहीं किया जा सकता है। यह सोचकर कच्चा व्यक्तिगत डेटा न भेजें कि "मैं इसे बाद में हटा दूंगा"; ख़तरा उसी क्षण हुआ जब इसे भेजा गया।

सुरक्षा के क्षेत्र में रक्षात्मक उपयोग

एमएल इंजीनियर अक्सर सुरक्षा प्रणालियाँ स्थापित करते हैं: धोखाधड़ी का पता लगाना, दुर्भावनापूर्ण ट्रैफ़िक वर्गीकरण, प्रमाणीकरण। इस पूरे मॉड्यूल में, हम केवल रक्षात्मक उद्देश्यों के लिए सुरक्षा मुद्दों को कवर करते हैं: हमले का पता लगाना, सिस्टम को सख्त करना, भेद्यता को बंद करना। अनधिकृत पहुंच, डेटा लीक या किसी अन्य के सिस्टम में अनधिकृत हस्तक्षेप के लिए कृत्रिम बुद्धिमत्ता का उपयोग करना अवैध और पेशेवर नैतिकता के खिलाफ है। जब आपको कोई भेद्यता मिलती है, तो सही तरीका यह है कि जिम्मेदारी से इसकी रिपोर्ट करें और इसे ठीक करें; शोषण नहीं.

तीन मिनी मामले

केस 1 - समय की बचत। एक एमएल इंजीनियर आमतौर पर 40-कॉलम डेटा सेट का खोजपूर्ण डेटा विश्लेषण (ईडीए) करने में आधा दिन बिताता है। उन्होंने आर्टिफिशियल इंटेलिजेंस को स्कीमा और df.describe() आउटपुट दिया और पूछा, "कौन से कॉलम में उच्च आउटलायर और लापता दर है, आप कौन से परिवर्तनों की अनुशंसा करते हैं?" 20 मिनट में, उन्हें एक प्राथमिकता सूची प्राप्त हुई, जिसमें प्रत्येक आइटम को उसके अपने कोड के साथ सत्यापित किया गया। सहेजें: ~3 घंटे, त्रुटि का कम जोखिम क्योंकि हर दावे को मापा जाता है।

केस 2 - पकड़ी गई त्रुटि। मॉडल ने एक चैट सहायक से कहा, "प्रशिक्षण सटीकता 99% है, बहुत बढ़िया।" इंजीनियर ने तीसरा चरण (इंजीनियरिंग फ़िल्टर) लागू किया और महसूस किया: लक्ष्य स्तंभ में गलती से विशेषताएँ लीक हो गई थीं (डेटा रिसाव: मॉडल वह जानकारी देखता है जो उसे प्रशिक्षण में नहीं देखनी चाहिए)। वास्तविक प्रदर्शन बहुत कम था. इंजीनियर के संदेह ने, न कि एआई की "महान" व्याख्या ने, नौकरी बचाई।

केस 3 - गोपनीयता भंग होने से रोकना। एक टीम उत्पादन त्रुटि लॉग को बाहरी मॉडल में चिपका रही थी और कह रही थी "इस त्रुटि को ठीक करें"। लॉग में ग्राहक पहचान संख्याएं थीं। टीम ने एक छोटी सी स्क्रिप्ट लिखने का नियम बनाया जो पहले लॉग्स को मास्क करती है (उनकी आईडी संख्या *** बनाती है) और उन्हें इस तरह भेजती है। उल्लंघन का जोखिम गायब हो गया है, सहायता की गति नहीं बदली है।

कॉपी करने योग्य टेम्पलेट

कार्य: [क्या करें, एकल वाक्य] संदर्भ: [डेटा स्कीमा, आकार, बाधाएं; कोई वास्तविक व्यक्तिगत डेटा नहीं] बाधाएं: [भाषा/पुस्तकालय, प्रदर्शन, प्रतिलिपि प्रस्तुत करने योग्यता] मेट्रिक्स: [सफलता को कैसे मापें] वांछित आउटपुट: [कोड/विवरण/सूची] और इस प्रारूप में क्यों

इस कोड को जांचें. न केवल इसका मूल्यांकन करें कि यह काम करता है, बल्कि इसके संदर्भ में भी: 1) एज केस (खाली इनपुट, गायब कॉलम, बहुत बड़ा डेटा) 2) डेटा लीक का जोखिम 3) पुनरुत्पादन (बीज, संस्करण) आपके द्वारा पाई जाने वाली प्रत्येक समस्या के लिए समाधान सुझाएं। जहां आप निश्चित नहीं हैं वहां "सत्यापित करें" चिह्नित करें। कोड: [कोड]

इस मीट्रिक के परिणाम की व्याख्या करें, लेकिन पहले पूछें: क्या यह मीट्रिक इस समस्या के लिए सही है? समस्या: [संतुलित/असंतुलित वर्गीकरण, प्रतिगमन, रैंकिंग...]रिपोर्ट की गई मीट्रिक और मूल्य: [उदाहरण के लिए। सटीकता 0.99] आप किस मीट्रिक की अनुशंसा करेंगे और क्यों, और मुझे वर्तमान परिणाम पर संदेह करने के लिए कौन से संकेत देखने चाहिए?

जांचें कि क्या डेटा में व्यक्तिगत/गोपनीय जानकारी है जो मैं निम्नलिखित संकेत पर दूंगा। उन फ़ील्ड्स (नाम, ई-मेल, आईडी नंबर, फ़ोन, पता) की सूची बनाएं जिन्हें नीचे दिए गए पाठ में छिपाने की आवश्यकता है। पाठ: [पाठ]

भूमिका और अधिकार तालिका

खोज

कृत्रिम बुद्धि की भूमिका

निर्णय का स्वामी

कोड कंकाल/परिवर्तन फ़ंक्शन

ड्राफ्ट जनरेटर

इंजीनियर (समीक्षा)

ईडीए/डेटा सारांश

त्वरक

इंजीनियर (मापकर पुष्टि करता है)

मीट्रिक व्याख्या

सुझाव

इंजीनियर

प्रशिक्षण में कौन सा डेटा जाएगा?

सुझाव

टीम + डेटा स्वामी

मॉडल को उत्पादन में लगाएं

चेकलिस्ट अनुस्मारक

जिम्मेदार इंजीनियर + टीम

व्यक्तिगत डेटा प्रोसेसिंग

कोई नहीं (इस्तेमाल नहीं किया गया)

कानूनी + डेटा नियंत्रक

सामान्य गलतियाँ

  • आउटपुट को सत्यापित किए बिना उसका उपयोग करना। सबसे आम और सबसे महंगी गलती. कोड या मीट्रिक जो अच्छा दिखता है इसका मतलब यह नहीं है कि वह सही है।
  • कच्चे गोपनीय डेटा को टूल में चिपकाना। एक बार भेजने के बाद इसे वापस नहीं लिया जा सकता.
  • ग़लत मीट्रिक पर भरोसा करना. असंतुलित डेटा में सटीकता और रैंकिंग समस्याओं में आरएमएसई जैसे असंगत मेट्रिक्स भ्रामक हैं।
  • कृत्रिम बुद्धिमत्ता को निर्णय-निर्माता समझने की भूल। वह सुझाव देता है; जिम्मेदारी हस्ताक्षरकर्ता की है।
  • प्रसंगहीन संकेत. "एक मॉडल लिखें" जैसे अस्पष्ट अनुरोध असत्यापित आउटपुट उत्पन्न करते हैं।

संक्षेप में

आर्टिफिशियल इंटेलिजेंस एमएल इंजीनियर द्वारा विकसित उत्पाद और इसका दैनिक प्रतिकृतिक दोनों है। इसका मूल्य कम जोखिम वाले, आसानी से सत्यापित कार्यों जैसे कोड-डेटा-दस्तावेज़ में सबसे अधिक है; धन, गोपनीयता और सुरक्षा को प्रभावित करने वाले निर्णय व्यक्ति के पास रहते हैं। प्रत्येक आउटपुट को स्रोत से कनेक्ट करें, फिर से मापें, इंजीनियरिंग फ़िल्टर से गुजरें। गोपनीय डेटा को सुरक्षित रखें, अनुमोदित वाहनों का उपयोग करें, केवल रक्षात्मक उद्देश्यों के लिए सुरक्षा में काम करें। यह अनुशासन बाद की सभी इकाइयों का आधार है।

आवेदन कार्य

अपने स्वयं के प्रोजेक्ट से एक कार्य चुनें (उदाहरण के लिए डेटा सफाई फ़ंक्शन लिखना)। पहले एक कमजोर प्रॉम्प्ट लिखें, फिर इस इकाई में टेम्पलेट का उपयोग करके एक मजबूत प्रॉम्प्ट लिखें। दोनों आउटपुट लें, तीन-चरणीय सत्यापन लागू करें (स्रोत से लिंक, पुनः चलाएँ, इंजीनियरिंग फ़िल्टर)। ध्यान दें कि कौन सा संकेत कितने मिनट बचाता है और कितने सुधार करता है।

चेकलिस्ट

  • [ ] मैंने अपने कार्य का जोखिम स्तर (कम/उच्च) निर्धारित कर लिया है।
  • [ ] मैंने प्रॉम्प्ट में कोई वास्तविक व्यक्तिगत/गोपनीय डेटा नहीं डाला; मैंने इसे छिपाया या सिंथेटिक नमूने का उपयोग किया।
  • [ ] मैंने आउटपुट को स्रोत से जोड़ा, इसे फिर से चलाया, इसे इंजीनियरिंग परिप्रेक्ष्य से फ़िल्टर किया।
  • [ ] मैंने जाँच की कि मैंने सही मीट्रिक का चयन किया है।
  • [ ] मैंने महत्वपूर्ण निर्णय (इसे उत्पादन, डेटा प्रोसेसिंग में लगाना) स्वयं/टीम के साथ लिया, मैंने इसे कृत्रिम बुद्धिमत्ता पर नहीं छोड़ा।
  • [ ] मैंने कॉर्पोरेट अनुमोदित वाहन का उपयोग किया।