युनिट्स
1. एमएल अभियांत्रिकीमध्ये कृत्रिम बुद्धिमत्ता: भूमिका, सीमा, प्रमाणीकरण आणि जबाबदारी 2. डेटा पाइपलाइन: संकलन, साफ करणे, टॅग करणे आणि आवृत्ती करणे 3. मॉडेल प्रशिक्षण आणि मूल्यमापन: अचूक मेट्रिक्स, प्रामाणिक बेंचमार्किंग 4. LLM अर्ज: RAG सह तुमच्या स्वतःच्या डेटावर आधारित उत्तरे 5. एलएलएम अर्ज: एजंट, टूलिंग आणि सुरक्षित ऑटोमेशन 6. फाइन-ट्यूनिंग बेस: केव्हा, कसे आणि कोणत्या जोखमीसह 7. MLOps आणि उपयोजन: प्रयोगशाळेतून उत्पादनाकडे मॉडेल हलवणे 8. इव्हल आणि मॉनिटरिंग: उत्पादनामध्ये मॉडेल खरोखर काय करते हे जाणून घेणे 9. सुरक्षा आणि गोपनीयता: AI सिस्टमचे रक्षण करणे 10. बायस, एथिक्स आणि कॉस्ट: जबाबदार आणि शाश्वत AI अभियांत्रिकी 11. पुनरुत्पादनक्षमता आणि एंड-टू-एंड प्रोजेक्ट: सर्वकाही एकत्र करणे
युनिट 1 / 11

एमएल अभियांत्रिकीमध्ये कृत्रिम बुद्धिमत्ता: भूमिका, सीमा, प्रमाणीकरण आणि जबाबदारी

नफा:

  • ML वर्कफ्लोमध्ये (कोड, डेटा, दस्तऐवज) कृत्रिम बुद्धिमत्ता कमी जोखमीसह वेळेची बचत करते आणि कार्य जोखीम पातळीनुसार मेट्रिक/डेटा/उत्पादनात टाकणे यासारखे निर्णय कोठे मनुष्यावर सोडले जातात हे वेगळे करण्यास सक्षम असणे.
  • प्रत्येक AI आउटपुटला स्त्रोताशी जोडून, ​​ते पुन्हा चालवून, त्याचे मोजमाप करून आणि अभियांत्रिकी फिल्टरमधून पास करून त्याची पडताळणी करणारी शिस्त लागू करण्याची क्षमता.
  • कच्चा गोपनीय आणि वैयक्तिक डेटा बाह्य साधनांना न पाठवण्याची, कॉर्पोरेट-मंजूर साधने वापरण्याची आणि केवळ बचावात्मक हेतूंसाठी सुरक्षा समस्या हाताळण्याची सवय लावण्याची क्षमता.

मशीन लर्निंग अभियांत्रिकीमध्ये कृत्रिम बुद्धिमत्ता: भूमिका, सीमा, प्रमाणीकरण आणि जबाबदारी

मशीन लर्निंग इंजिनीअर (ML इंजिनियर: एक सॉफ्टवेअर प्रोफेशनल जो डेटापासून उत्पादनापर्यंत शिकणारे मॉडेल डिझाइन करतो, ट्रेन करतो आणि आणतो) आज त्याच्या कामाच्या प्रत्येक टप्प्यावर दुसर्या कृत्रिम बुद्धिमत्तेच्या साधनासह कार्य करतो. कोड लिहिताना कोडींग असिस्टंट, डेटा एक्सप्लोर करताना संभाषण मॉडेल आणि दस्तऐवज तयार करताना मोठ्या भाषेचे मॉडेल (LLM: अब्जावधी पॅरामीटर्स असलेले न्यूरल नेटवर्क) दस्तऐवजीकरण तयार करताना प्रभावी असतो. हे मॉड्युल कृत्रिम बुद्धिमत्तेला विकसित केलेले उत्पादन आणि एमएल अभियंताचे दैनंदिन कामाचे साधन असे मानते. हे दोन भूमिकांचे मिश्रण न करता जबाबदारीच्या सीमा स्पष्टपणे रेखाटून कार्य करते.

या पहिल्या युनिटमध्ये, आम्ही मूलभूत प्रश्नाचे उत्तर देतो: एमएल अभियांत्रिकीमध्ये कृत्रिम बुद्धिमत्ता वास्तविक वेळेची कुठे बचत करते आणि आम्ही निर्णय कोठे मनुष्यांवर सोडायचा? उत्तर अभियांत्रिकी शाखेच्या केंद्रस्थानी आहे: जो बनवतो तो वेगवान आहे, जो पडताळतो तो जबाबदार आहे.

एमएल अभियांत्रिकीमध्ये कृत्रिम बुद्धिमत्ता कुठे उपयोगी पडते?

एमएल प्रकल्प साधारणपणे खालील ओळींमधून जातो: डेटा संकलन, डेटा साफ करणे, वैशिष्ट्य अभियांत्रिकी (कच्चा डेटा डिजिटल सिग्नलमध्ये अनुवादित करणे जे मॉडेलला समजू शकते), मॉडेल प्रशिक्षण, मूल्यमापन, उपयोजन (उपयोजन: वास्तविक वापरकर्त्यासाठी मॉडेल उघडणे) आणि देखरेख. AI या मार्गावरील प्रत्येक थांब्यावर मदत करते, परंतु त्याच्या अधिकाराची पातळी बदलते.

उच्च-रिवॉर्ड, कमी-जोखीम क्षेत्र: कोड स्केलेटन तयार करणे, डेटा ट्रान्सफॉर्मेशन फंक्शनचा मसुदा तयार करणे, लॉग मेसेजचा अर्थ लावणे, स्टॅक ट्रेसचे वर्णन करणे, प्रयोग नोट्स सारांशित करणे, दस्तऐवजीकरण आणि READMEs लिहिणे, चाचणी केस प्रस्तावित करणे. येथे, कृत्रिम बुद्धिमत्तेच्या चुका स्वस्त आहेत; कारण आउटपुट आधीच चाचणी आणि पुनरावलोकनातून जाईल.

उच्च जोखमीची क्षेत्रे: प्रशिक्षणात कोणता डेटा जातो हे ठरवणे, मॉडेल उत्पादनात जावे की नाही याची पुष्टी करणे, मेट्रिकचा न्याय करणे "पुरेसे चांगले आहे", वैयक्तिक डेटावर प्रक्रिया करण्याचा निर्णय, सुरक्षितता भेद्यता "जंक" म्हणून बंद करणे. हे पैसे, गोपनीयता, कायदेशीर दायित्व आणि वापरकर्त्याचा विश्वास प्रभावित करतात. कृत्रिम बुद्धिमत्ता येथे सूचना देते; निर्णय सक्षम अभियंता आणि जबाबदार टीम घेते.

टीप: एआयला एखादे कार्य आउटसोर्स करण्यापूर्वी, विचारा: "हे आउटपुट चुकीचे असल्यास किंमत किती आहे आणि कोणीही चूक किती सहज पकडेल?" किंमत कमी असल्यास आणि कॅप्चर करणे सोपे असल्यास, ते पुढे जा. जर किंमत जास्त असेल किंवा कॅप्चर करणे अवघड असेल, तर फक्त मसुद्यासाठी AI वापरा आणि तुम्ही ठरवा.

सत्यापन शिस्त: तीन चरण

एमएल अभियांत्रिकीमध्ये, एआय आउटपुट कधीही "पूर्ण काम" नसते; तो मसुदा आहे. या तीन चरणांमधून प्रत्येक आउटपुट चालवा:

  1. ते स्त्रोताशी कनेक्ट करा. मॉडेलने संख्या, थ्रेशोल्ड किंवा "सर्वोत्तम सराव" म्हटले असल्यास, ते अधिकृत दस्तऐवजीकरण, कोडबेसमधील वास्तविक मूल्य किंवा मोजलेल्या मेट्रिकवर आधारित आहे. "मॉडेलचे फिटिंग" (भ्रम: भाषेच्या मॉडेलद्वारे गैर-वास्तविक माहितीचे आत्मविश्वासपूर्ण उत्पादन) येथे बहुतेकदा पकडले जाते.
  2. रीस्टार्ट करा आणि मोजा. व्युत्पन्न केलेला कोड चालवा, तुमच्या स्वतःच्या चाचणी संचावर ते तयार केलेल्या मेट्रिकची पुनर्गणना करा, प्रस्तावित SQL क्वेरी एका लहान नमुन्यावर प्रमाणित करा. छान दिसला तरीही चालत नाही असा कोड व्यर्थ आहे.
  3. ते अभियांत्रिकी फिल्टरमधून पास करा. आउटपुट स्केलवर टिकून राहते का? एज केसेस (रिक्त डेटा, खूप मोठे इनपुट, गहाळ फील्ड) विचारात घेतले आहेत? सुरक्षा आणि गोपनीयतेचा भंग आहे का? फील्डची माहिती असलेली व्यक्तीच ही पायरी करू शकते.

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत प्रॉम्प्ट: "मला काही मॉडेल प्रशिक्षण कोड लिहा."

शक्तिशाली प्रॉम्प्ट: "स्किट-लर्नसह बायनरी वर्गीकरणासाठी प्रशिक्षण स्क्रिप्ट लिहा. इनपुट: data/train.parquet, लक्ष्य स्तंभ is_churn. वर्ग असमतोल आहे (सकारात्मक दर ~8%), ते class_weight सह हाताळा. PR-AUC वापरा (प्रिसिजन-रिकॉल वक्र अंतर्गत क्षेत्र) कारण चुकीचे मेट्रिक्स म्हणून PR-AUC वापरा. डेटा यादृच्छिक बियाणे 42 वर निश्चित करा. कोड प्रिंट सेट PR-AUC च्या शेवटी चाचणी करा."

फरक: दुसऱ्या प्रॉम्प्ट टास्कमध्ये डेटा सत्य, योग्य मेट्रिक, असंतुलन माहिती आणि पुनरावृत्तीची आवश्यकता असते. या संदर्भातच आउटपुट पडताळण्यायोग्य आणि वापरण्यायोग्य आहे.

गोपनीयता आणि डेटा सुरक्षा: अभियंता प्रथम जबाबदारी

एमएल अभियंता अनेकदा कंपनीच्या सर्वात संवेदनशील डेटाला स्पर्श करतो: ग्राहक रेकॉर्ड, व्यवहार इतिहास, आरोग्य किंवा आर्थिक डेटा, उत्पादन प्रणालीचे लॉग. कृत्रिम बुद्धिमत्ता साधनांना डेटा देताना तीन नियम:

  • कच्चा वैयक्तिक आणि गोपनीय डेटा बाह्य साधनांना पाठवू नका. उदाहरणार्थ, प्रॉम्प्टमध्ये ग्राहक ईमेल पेस्ट करण्याऐवजी, स्कीमा आणि डमी (सिंथेटिक) नमुने पाठवा. वास्तविक डेटाऐवजी "ex: ahmet@example.com" सारखे मुखवटा घातलेले उदाहरण वापरा.
  • कॉर्पोरेट मान्यताप्राप्त वाहने वापरा. डेटाची प्रक्रिया कुठे केली जाते, तो संग्रहित केला जातो की नाही, शिक्षणासाठी वापरला जातो की नाही हे करारानुसार स्पष्ट असलेली साधने निवडा. वैयक्तिक खात्यासह कॉर्पोरेट डेटावर प्रक्रिया करणे बहुतेक कंपन्यांमध्ये उल्लंघन आहे.
  • किमान डेटा धोरण. कार्य सोडवण्यासाठी आवश्यक असलेले किमान संदर्भ द्या. संपूर्ण सारणी नाही, परंतु संबंधित 5 स्तंभ आणि स्कीमा.
खबरदारी: तुम्ही भाषा मॉडेलला दिलेला मजकूर पूर्ववत करता येणार नाही असे गृहीत धरा. "मी नंतर हटवीन" असा विचार करून कच्चा वैयक्तिक डेटा पाठवू नका; तो पाठवण्याच्या क्षणी धोका निर्माण झाला.

सुरक्षिततेच्या क्षेत्रात संरक्षणात्मक वापर

एमएल अभियंते अनेकदा सुरक्षा प्रणाली स्थापित करतात: फसवणूक शोध, दुर्भावनापूर्ण रहदारी वर्गीकरण, प्रमाणीकरण. या संपूर्ण मॉड्यूलमध्ये, आम्ही केवळ संरक्षणात्मक हेतूंसाठी सुरक्षा समस्या कव्हर करतो: हल्ला शोधणे, सिस्टम कठोर करणे, असुरक्षा बंद करणे. अनधिकृत प्रवेश, डेटा गळती किंवा दुसऱ्याच्या सिस्टीममध्ये अनधिकृत हस्तक्षेप यासाठी कृत्रिम बुद्धिमत्ता वापरणे बेकायदेशीर आणि व्यावसायिक नैतिकतेच्या विरुद्ध आहे. जेव्हा तुम्हाला एखादी भेद्यता आढळते, तेव्हा योग्य मार्ग म्हणजे जबाबदारीने तक्रार करणे आणि त्याचे निराकरण करणे; शोषण नाही.

तीन लहान प्रकरणे

केस 1 - वेळ वाचला. एक एमएल अभियंता साधारणपणे 40-स्तंभ डेटा सेटचे अन्वेषण डेटा विश्लेषण (EDA) करण्यात अर्धा दिवस घालवतो. त्याने कृत्रिम बुद्धिमत्तेला स्कीमा आणि df.describe() आउटपुट दिले आणि विचारले, "कोणत्या कॉलममध्ये उच्च आउटलायर आणि गहाळ दर आहे, तुम्ही कोणत्या परिवर्तनाची शिफारस करता?" 20 मिनिटांत, प्रत्येक आयटमची त्याच्या स्वतःच्या कोडसह पडताळणी करून, त्याला प्राधान्य यादी प्राप्त झाली. जतन करा: ~3 तास, त्रुटीचा कमी धोका कारण प्रत्येक दावा मोजला.

प्रकरण 2 - त्रुटी पकडली. "प्रशिक्षण अचूकता 99% आहे, उत्तम," मॉडेलने चॅट असिस्टंटला सांगितले. अभियंत्याने तिसरी पायरी (अभियांत्रिकी फिल्टर) लागू केली आणि लक्षात आले: लक्ष्य स्तंभात चुकून विशेषता लीक झाली होती (डेटा गळती: मॉडेल प्रशिक्षणात पाहू नये अशी माहिती पाहते). वास्तविक कामगिरी खूपच कमी होती. एआयच्या "उत्तम" व्याख्येने नव्हे तर अभियंत्याच्या संशयामुळे नोकरी वाचली.

प्रकरण 3 - गोपनीयतेचा भंग रोखणे. एक संघ बाह्य मॉडेलमध्ये उत्पादन त्रुटी लॉग पेस्ट करत होता आणि "ही त्रुटी दूर करा" म्हणत होता. नोंदींमध्ये ग्राहक ओळख क्रमांक होते. संघाने एक लहान स्क्रिप्ट लिहिण्याचा नियम बनवला जो प्रथम लॉग मास्क करेल (त्यांचे आयडी क्रमांक *** बनवून) आणि त्या मार्गाने पाठवा. उल्लंघनाचा धोका नाहीसा झाला आहे, मदतीचा वेग बदलला नाही.

कॉपी करण्यायोग्य टेम्पलेट्स

कार्य: [काय करावे, एक वाक्य]संदर्भ: [डेटा स्कीमा, आकार, मर्यादा; कोणताही वास्तविक वैयक्तिक डेटा नाही]निर्बंध: [भाषा/लायब्ररी, कार्यप्रदर्शन, पुनरुत्पादनक्षमता]मेट्रिक्स: [यशाचे मोजमाप कसे करावे]इच्छित आउटपुट: [कोड/वर्णन/सूची] आणि या स्वरूपात का

हा कोड पहा. केवळ ते कार्य करते असेच नाही तर त्याचे मूल्यमापन करा:१) एज केसेस (रिक्त इनपुट, गहाळ कॉलम, खूप मोठा डेटा)2) डेटा लीकेजचा धोका3) पुनरुत्पादनक्षमता (बियाणे, आवृत्ती)तुम्हाला आढळलेल्या प्रत्येक समस्येचे निराकरण सुचवा. जिथे तुम्हाला खात्री नाही तिथे "सत्यापित करा" चिन्हांकित करा. कोड: [कोड]

या मेट्रिकच्या निकालाचा अर्थ लावा, परंतु प्रथम विचारा: या समस्येसाठी हे मेट्रिक योग्य आहे का? समस्या: [संतुलित/असंतुलित वर्गीकरण, प्रतिगमन, रँकिंग...]रिपोर्ट केलेले मेट्रिक आणि मूल्य: [उदा. अचूकता 0.99]तुम्ही कोणत्या मेट्रिकची शिफारस कराल आणि का, आणि मला सध्याच्या निकालाबद्दल शंका निर्माण करण्यासाठी मी कोणती चिन्हे शोधली पाहिजेत?

मी खालील प्रॉम्प्टवर देईन त्या डेटामध्ये वैयक्तिक/गोपनीय माहिती आहे का ते तपासा. खालील मजकुरात मुखवटा घालण्याची आवश्यकता असलेल्या फील्ड (नाव, ई-मेल, आयडी क्रमांक, फोन, पत्ता) सूचीबद्ध करा. मजकूर: [मजकूर]

भूमिका आणि अधिकार सारणी

शोध

कृत्रिम बुद्धिमत्तेची भूमिका

निर्णयाचा मालक

कोड स्केलेटन / ट्रान्सफॉर्मेशन फंक्शन

मसुदा जनरेटर

अभियंता (पुनरावलोकने)

EDA / डेटा सारांश

प्रवेगक

अभियंता (मापून पडताळतो)

मेट्रिक व्याख्या

सूचना

अभियंता

प्रशिक्षणात कोणता डेटा जाईल?

सूचना

टीम + डेटा मालक

मॉडेल उत्पादनात ठेवा

चेकलिस्ट स्मरणपत्र

जबाबदार अभियंता + संघ

वैयक्तिक डेटा प्रक्रिया

काहीही नाही (वापरलेले नाही)

कायदेशीर + डेटा नियंत्रक

सामान्य चुका

  • प्रमाणीकरण न करता आउटपुट वापरणे. सर्वात सामान्य आणि सर्वात महाग चूक. छान दिसणारा कोड किंवा मेट्रिक बरोबर आहे याचा अर्थ असा नाही.
  • टूलमध्ये कच्चा गोपनीय डेटा पेस्ट करत आहे. एकदा पाठवल्यानंतर ते परत घेता येत नाही.
  • चुकीच्या मेट्रिकवर अवलंबून राहणे. असंतुलित डेटामधील अचूकता आणि रँकिंग समस्यांमधील RMSE यासारखे विसंगत मेट्रिक्स दिशाभूल करणारे आहेत.
  • निर्णय घेणारा म्हणून कृत्रिम बुद्धिमत्ता चुकीची आहे. तो सूचना देतो; जबाबदारी स्वाक्षरीकर्त्याची आहे.
  • संदर्भहीन प्रॉम्प्ट. "मॉडेल लिहा" सारख्या अस्पष्ट विनंत्या असत्यापित आउटपुट देतात.

सारांशात

कृत्रिम बुद्धिमत्ता हे एमएल अभियंता आणि त्याचे दैनंदिन प्रतिकृती दोन्ही विकसित केलेले उत्पादन आहे. कोड-डेटा-दस्तऐवज सारख्या कमी-जोखीम, सहजपणे सत्यापित कार्यांमध्ये त्याचे मूल्य सर्वाधिक आहे; पैसा, गोपनीयता आणि सुरक्षितता प्रभावित करणारे निर्णय व्यक्तीकडे राहतात. प्रत्येक आउटपुटला स्त्रोताशी कनेक्ट करा, पुन्हा मोजा, ​​अभियांत्रिकी फिल्टरमधून जा. गोपनीय डेटा संरक्षित करा, मान्यताप्राप्त वाहने वापरा, केवळ संरक्षणात्मक हेतूंसाठी सुरक्षेत काम करा. ही शिस्त पुढील सर्व घटकांसाठी आधार आहे.

अर्ज कार्य

तुमच्या स्वतःच्या प्रोजेक्टमधून एखादे कार्य निवडा (उदा. डेटा क्लीनिंग फंक्शन लिहिणे). प्रथम एक कमकुवत प्रॉम्प्ट लिहा, नंतर या युनिटमधील टेम्पलेट वापरून एक मजबूत प्रॉम्प्ट लिहा. दोन्ही आउटपुट घ्या, थ्री-स्टेप व्हेरिफिकेशन लागू करा (स्रोत, पुन्हा रन, अभियांत्रिकी फिल्टरचा दुवा). लक्षात घ्या की कोणता प्रॉम्प्ट किती मिनिटे आणि किती दुरुस्त्या वाचवतो.

चेकलिस्ट

  • मी माझ्या कार्याची जोखीम पातळी (कमी/उच्च) निर्धारित केली आहे.
  • [] मी प्रॉम्प्टमध्ये कोणताही वास्तविक वैयक्तिक/गोपनीय डेटा ठेवला नाही; मी ते मास्क केले किंवा सिंथेटिक नमुना वापरला.
  • [ ] मी आउटपुट स्त्रोताशी जोडले, ते पुन्हा चालवले, अभियांत्रिकीच्या दृष्टीकोनातून ते फिल्टर केले.
  • मी योग्य मेट्रिक निवडले आहे हे मी तपासले.
  • [ ] मी स्वतः / संघासह गंभीर निर्णय घेतला (उत्पादनात, डेटा प्रक्रियेत टाकणे), मी ते कृत्रिम बुद्धिमत्तेवर सोडले नाही.
  • मी कॉर्पोरेट मान्यताप्राप्त वाहन वापरले.