एकाइहरू
1. एमएल इन्जिनियरिङमा कृत्रिम बुद्धिमत्ता: भूमिका, सीमा, प्रमाणीकरण र जिम्मेवारी 2. डाटा पाइपलाइन: सङ्कलन, सफाई, ट्यागिङ र संस्करण 3. मोडेल प्रशिक्षण र मूल्याङ्कन: सटीक मेट्रिक्स, इमानदार बेन्चमार्किङ 4. LLM आवेदन: RAG सँग तपाईंको आफ्नै डाटामा आधारित जवाफहरू 5. LLM आवेदन: एजेन्ट, उपकरण र सुरक्षित स्वचालन 6. फाइन-ट्यूनिंग आधार: कहिले, कसरी र के जोखिम संग 7. MLOps र तैनाती: प्रयोगशालाबाट उत्पादनमा मोडेल सार्दै 8. Eval र निगरानी: मोडेलले वास्तवमा उत्पादनमा के गर्छ भन्ने थाहा पाउनु 9. सुरक्षा र गोपनीयता: AI प्रणालीहरूको रक्षा गर्दै 10. पूर्वाग्रह, नैतिकता र लागत: जिम्मेवार र दिगो एआई ईन्जिनियरिङ् 11. पुन: उत्पादनशीलता र अन्त-देखि-अन्त परियोजना: सबै कुरा संयोजन
एकाइ 1 / 11

एमएल इन्जिनियरिङमा कृत्रिम बुद्धिमत्ता: भूमिका, सीमा, प्रमाणीकरण र जिम्मेवारी

लाभ:

  • ML कार्यप्रवाह (कोड, डाटा, कागजात) मा आर्टिफिसियल इन्टेलिजेन्सले कम जोखिममा समय बचत गर्छ र जहाँ मेट्रिक/डेटा/उत्पादनमा राख्ने जस्ता निर्णयहरू कार्य जोखिम स्तर अनुसार मानवमा छाडिन्छ भनी छुट्याउन सक्षम हुनु।
  • एक अनुशासन लागू गर्ने क्षमता जसले प्रत्येक AI आउटपुटलाई स्रोतमा जडान गरेर, यसलाई पुन: चलाएर, मापन गरेर, र यसलाई इन्जिनियरिङ फिल्टर मार्फत प्रमाणित गर्दछ।
  • बाह्य उपकरणहरूमा कच्चा गोप्य र व्यक्तिगत डेटा नपठाउने, कर्पोरेट-अनुमोदित उपकरणहरू प्रयोग गरेर, र सुरक्षाका मुद्दाहरू रक्षात्मक उद्देश्यका लागि मात्र ह्यान्डल गर्ने बानी प्राप्त गर्ने क्षमता।

मेसिन लर्निङ इन्जिनियरिङमा कृत्रिम बुद्धिमत्ता: भूमिका, सीमा, प्रमाणीकरण र जिम्मेवारी

एक मेसिन लर्निङ इन्जिनियर (ML इन्जिनियर: एक सफ्टवेयर पेशेवर जसले डेटाबाट उत्पादनमा सिक्ने मोडेलहरू डिजाइन, तालिम र ल्याउँछ) आज आफ्नो कामको प्रत्येक चरणमा अर्को कृत्रिम बुद्धिमत्ता उपकरणसँग काम गर्दछ। कोड लेख्दा कोडिङ सहायक प्रभावकारी हुन्छ, डाटा अन्वेषण गर्दा कुराकानीको मोडेल, र दस्तावेज उत्पादन गर्दा ठूलो भाषा मोडेल (LLM: अरबौं प्यारामिटरहरू भएको न्यूरल नेटवर्क)। यो मोड्युलले कृत्रिम बुद्धिमत्तालाई विकसित उत्पादन र एमएल इन्जिनियरको दैनिक कार्य उपकरण दुवैको रूपमा लिन्छ। यो दुई भूमिकाहरू मिश्रण नगरी जिम्मेवारीका सीमाहरू स्पष्ट रूपमा चित्रण गरेर सञ्चालन गर्दछ।

यस पहिलो एकाईमा, हामी आधारभूत प्रश्नको जवाफ दिन्छौं: एमएल इन्जिनियरिङमा कृत्रिम बुद्धिमत्ताले वास्तविक समय कहाँ बचत गर्छ, र हामीले निर्णय मानिसलाई कहाँ छोड्नुपर्छ? जवाफ ईन्जिनियरिङ् अनुशासनको मुटुमा छ: जसले बनाउँछ छिटो छ, जो प्रमाणित गर्छ त्यो जिम्मेवार छ।

एमएल इन्जिनियरिङमा आर्टिफिसियल इन्टेलिजेन्स कहाँ काममा आउँछ?

एउटा ML परियोजनाले लगभग निम्न रेखाहरू मार्फत जान्छ: डाटा सङ्कलन, डाटा क्लिनिङ, फीचर इन्जिनियरिङ (कच्चा डाटालाई मोडेलले बुझ्न सक्ने डिजिटल सिग्नलहरूमा अनुवाद गर्ने), मोडेल प्रशिक्षण, मूल्याङ्कन, डिप्लोइमेन्ट (डिप्लोइमेन्ट: वास्तविक प्रयोगकर्तालाई मोडेल खोल्ने) र निगरानी। AI ले यस लाइनको प्रत्येक स्टपमा मद्दत गर्छ, तर यसको अधिकार स्तर फरक हुन्छ।

उच्च-पुरस्कार, कम जोखिम क्षेत्रहरू: कोड कंकाल उत्पादन गर्दै, डेटा रूपान्तरण प्रकार्यको मस्यौदा तयार गर्ने, लग सन्देशहरू व्याख्या गर्ने, स्ट्याक ट्रेसको वर्णन गर्ने, प्रयोग नोटहरू संक्षेप गर्ने, कागजातहरू र READMEs लेख्ने, परीक्षण केस प्रस्ताव गर्ने। यहाँ, कृत्रिम बुद्धिमत्ताका गल्तीहरू सस्तो छन्; किनभने आउटपुट पहिले नै परीक्षण र समीक्षा मार्फत जान्छ।

उच्च जोखिम क्षेत्रहरू: कुन डेटा प्रशिक्षणमा जान्छ भन्ने निर्णय गर्दै, मोडेल उत्पादनमा जानुपर्छ कि हुँदैन भनेर पुष्टि गर्दै, मेट्रिकको न्याय गर्नु "पर्याप्त राम्रो", व्यक्तिगत डेटा प्रशोधन गर्ने निर्णय, सुरक्षा जोखिमलाई "जंक" को रूपमा बन्द गर्ने। यसले पैसा, गोपनीयता, कानूनी दायित्व, र प्रयोगकर्ता विश्वासलाई असर गर्छ। कृत्रिम बुद्धिले यहाँ सुझाव दिन्छ; निर्णय सक्षम इन्जिनियर र जिम्मेवार टोली द्वारा गरिन्छ।

सुझाव: AI मा कार्य आउटसोर्स गर्नु अघि, सोध्नुहोस्: "यदि यो आउटपुट गलत छ भने लागत के हो, र कसैले कति सजिलै गल्ती समात्छ?" यदि मूल्य कम छ र क्याप्चर सजिलो छ भने, यसलाई पास गर्नुहोस्। यदि मूल्य उच्च छ वा क्याप्चर गर्न गाह्रो छ भने, ड्राफ्टको लागि मात्र AI प्रयोग गर्नुहोस् र तपाईंले निर्णय गर्नुहुन्छ।

प्रमाणीकरण अनुशासन: तीन चरणहरू

एमएल इन्जिनियरिङमा, एआई आउटपुट कहिल्यै "सम्पन्न काम" होइन; यो मस्यौदा हो। यी तीन चरणहरू मार्फत प्रत्येक आउटपुट चलाउनुहोस्:

  1. यसलाई स्रोतमा जडान गर्नुहोस्। यदि मोडेलले नम्बर, थ्रेसहोल्ड वा "उत्तम अभ्यास" भनेको छ भने, यसलाई आधिकारिक कागजात, कोडबेसमा वास्तविक मान, वा मापन गरिएको मेट्रिकमा आधारित गर्नुहोस्। "मोडलको फिटिङ" (भ्रम: भाषा मोडेल द्वारा गैर-वास्तविक जानकारीको विश्वस्त उत्पादन) प्रायः यहाँ समातिएको छ।
  2. पुन: सुरु गर्नुहोस् र मापन गर्नुहोस्। उत्पन्न कोड चलाउनुहोस्, मेट्रिक पुन: गणना गर्नुहोस् यसले तपाईंको आफ्नै परीक्षण सेटमा उत्पादन गर्दछ, सानो नमूनामा प्रस्तावित SQL क्वेरी प्रमाणित गर्नुहोस्। राम्रो लागे पनि काम नगर्ने कोड बेकार छ।
  3. यसलाई ईन्जिनियरिङ् फिल्टर मार्फत पास गर्नुहोस्। के आउटपुट मापन मा समात्छ? के किनारा केसहरू (खाली डाटा, धेरै ठूलो इनपुट, हराइरहेको क्षेत्रहरू) विचार गरिएको छ? के त्यहाँ सुरक्षा र गोपनीयता उल्लंघन छ? क्षेत्र जान्ने व्यक्तिले मात्र यो चरण गर्न सक्छ।

कमजोर प्रम्प्ट / बलियो प्रम्प्ट

कमजोर प्रम्प्ट: "मलाई केहि मोडेल प्रशिक्षण कोड लेख्नुहोस्।"

शक्तिशाली प्रम्प्ट: "scikit-learn को साथ बाइनरी वर्गीकरणको लागि एक प्रशिक्षण स्क्रिप्ट लेख्नुहोस्। इनपुट: data/train.parquet, लक्ष्य स्तम्भ is_churn। त्यहाँ वर्ग असंतुलन (सकारात्मक दर ~8%) छ, यसलाई class_weight सँग ह्यान्डल गर्नुहोस्। PR-AUC प्रयोग गर्नुहोस् (प्रेसिजन-रिकल कर्भ अन्तर्गतको क्षेत्र) को लागि unbalcyd as misbalance, किनभने। डाटा 42 मा अनियमित बीज फिक्स। कोड प्रिन्ट सेट PR-AUC को अन्त्यमा परीक्षण गर्नुहोस्।

भिन्नता: दोस्रो प्रम्प्ट कार्यले डाटा सत्य, सही मेट्रिक, असंतुलन जानकारी र पुनरावृत्ति आवश्यकता समावेश गर्दछ। यो यस सन्दर्भबाट हो कि आउटपुट प्रमाणित र प्रयोगयोग्य छ।

गोपनीयता र डाटा सुरक्षा: इन्जिनियरको पहिलो जिम्मेवारी

एमएल इन्जिनियरले प्राय: कम्पनीको सबैभन्दा संवेदनशील डेटा छुन्छ: ग्राहक रेकर्डहरू, लेनदेन इतिहास, स्वास्थ्य वा वित्तीय डेटा, उत्पादन प्रणालीहरूको लगहरू। कृत्रिम बुद्धिमत्ता उपकरणहरूलाई डाटा दिँदा तीन नियमहरू:

  • बाह्य उपकरणहरूमा कच्चा व्यक्तिगत र गोप्य डाटा नपठाउनुहोस्। उदाहरणका लागि, प्रम्प्टमा ग्राहक इमेलहरू टाँस्नुको सट्टा, स्किमा र डमी (सिंथेटिक) नमूनाहरू पठाउनुहोस्। वास्तविक डेटाको सट्टा "ex: ahmet@example.com" जस्ता मास्क गरिएको उदाहरण प्रयोग गर्नुहोस्।
  • कर्पोरेट स्वीकृत सवारी साधन प्रयोग गर्नुहोस्। डेटा प्रशोधन भएको ठाउँमा संविदात्मक रूपमा स्पष्ट हुने उपकरणहरू छनौट गर्नुहोस्, यो भण्डारण गरिएको छ कि छैन, शिक्षाको लागि प्रयोग गरिन्छ वा छैन। व्यक्तिगत खाताको साथ कर्पोरेट डाटा प्रशोधन धेरै कम्पनीहरूमा उल्लङ्घन हो।
  • न्यूनतम डाटा नीति। कार्य समाधान गर्न आवश्यक न्यूनतम सन्दर्भ दिनुहोस्। सम्पूर्ण तालिका होइन, तर सान्दर्भिक ५ स्तम्भ र योजना।
सावधानी: मान्नुहोस् कि तपाईंले भाषा मोडेलमा दिनुभएको पाठलाई पूर्ववत गर्न सकिँदैन। "म यसलाई पछि मेटाउनेछु" सोचेर कच्चा व्यक्तिगत डेटा नपठाउनुहोस्; यो पठाइएको क्षणमा जोखिम भयो।

सुरक्षाको क्षेत्रमा रक्षात्मक प्रयोग

एमएल इन्जिनियरहरूले प्राय: सुरक्षा प्रणालीहरू स्थापना गर्छन्: धोखाधडी पत्ता लगाउने, खराब ट्राफिक वर्गीकरण, प्रमाणीकरण। यस मोड्युलमा, हामी सुरक्षा मुद्दाहरू रक्षात्मक उद्देश्यका लागि मात्र समावेश गर्छौं: आक्रमण पत्ता लगाउने, प्रणालीलाई कडा पार्ने, कमजोरी बन्द गर्ने। अनधिकृत पहुँच, डाटा चुहावट वा अरू कसैको प्रणालीमा अनधिकृत हस्तक्षेपको लागि कृत्रिम बुद्धिमत्ता प्रयोग गर्नु गैरकानूनी र व्यावसायिक नैतिकताको विरुद्ध हो। जब तपाइँ एक कमजोरी फेला पार्नुहुन्छ, सही तरीका भनेको यसलाई जिम्मेवारीपूर्वक रिपोर्ट गर्नु र यसलाई ठीक गर्नु हो; शोषण छैन।

तीन मिनी केसहरू

केस १ - समय बचत भयो। एक एमएल इन्जिनियरले सामान्यतया 40-स्तम्भ डेटा सेटको अन्वेषण डेटा विश्लेषण (EDA) गर्न आधा दिन खर्च गर्नेछ। उनले आर्टिफिसियल इन्टेलिजेन्सलाई स्कीमा र df.describe() आउटपुट दिए र सोधे, "कुन स्तम्भहरूमा उच्च आउटलियर र छुटेको दर छ, तपाइँ कुन परिवर्तनहरू सिफारिस गर्नुहुन्छ?" 20 मिनेटमा, उसले प्राथमिकता सूची प्राप्त गर्यो, प्रत्येक वस्तुलाई यसको आफ्नै कोडको साथ प्रमाणित गर्दै। बचत गर्नुहोस्: ~3 घण्टा, त्रुटिको कम जोखिम किनभने प्रत्येक दावी मापन गरियो।

केस २ - त्रुटि समातियो। "प्रशिक्षण सटीकता 99%, उत्कृष्ट छ," मोडेलले च्याट सहायकले भने। ईन्जिनियरले तेस्रो चरण (इन्जिनियरिङ फिल्टर) लागू गर्यो र महसुस गर्यो: लक्ष्य स्तम्भले गल्तिले विशेषताहरू लीक गरेको थियो (डेटा चुहावट: मोडेलले प्रशिक्षणमा नदेख्नु पर्ने जानकारी देख्छ)। वास्तविक प्रदर्शन धेरै कम थियो। AI को "महान" व्याख्याले होइन, इन्जिनियरको शंकाले काम बचायो।

केस 3 - गोपनीयता उल्लङ्घन रोक्न। एउटा टोलीले बाह्य मोडेलमा उत्पादन त्रुटि लगहरू टाँस्दै थियो र "यो त्रुटि ठीक गर्नुहोस्" भन्दै थियो। लगहरूमा ग्राहक पहिचान नम्बरहरू थिए। टोलीले एउटा सानो स्क्रिप्ट लेख्ने नियम बनायो जसले लगहरूलाई पहिले मास्क गर्छ (तिनीहरूको आईडी नम्बरहरू *** बनाउँदै) र त्यसरी पठाउने। उल्लंघनको जोखिम हराएको छ, सहायताको गति परिवर्तन भएको छैन।

प्रतिलिपि गर्न मिल्ने टेम्प्लेटहरू

कार्य: [के गर्ने, एकल वाक्य] सन्दर्भ: [डेटा स्किमा, साइज, अवरोधहरू; कुनै वास्तविक व्यक्तिगत डेटा छैन] अवरोधहरू: [भाषा/पुस्तकालय, कार्यसम्पादन, पुन: उत्पादन योग्यता] मेट्रिक्स: [कसरी सफलता मापन गर्ने] वांछित आउटपुट: [कोड/विवरण/सूची] र यो ढाँचामा किन

यो कोड जाँच गर्नुहोस्। मूल्याङ्कन गर्नुहोस् कि यसले काम गर्छ मात्र होइन, तर निम्न सर्तहरूमा पनि: 1) किनारा केसहरू (खाली इनपुट, हराएको स्तम्भ, धेरै ठूलो डेटा) 2) डाटा चुहावटको जोखिम3) पुन: उत्पादनशीलता (बीउ, संस्करण) तपाईंले फेला पार्नुहुने प्रत्येक समस्याको समाधानको सुझाव दिनुहोस्। "प्रमाणित" चिन्ह लगाउनुहोस् जहाँ तपाईं निश्चित हुनुहुन्न। कोड: [कोड]

यस मेट्रिकको नतिजाको व्याख्या गर्नुहोस्, तर पहिले सोध्नुहोस्: के यो मेट्रिक यस समस्याको लागि सही छ? समस्या: [सन्तुलित/असन्तुलित वर्गीकरण, प्रतिगमन, श्रेणीकरण...]रिपोर्ट गरिएको मेट्रिक र मान: [जस्तै। सटीकता ०.९९]तपाईँले कुन मेट्रिक सिफारिस गर्नुहुन्छ र किन, र हालको नतिजामा शंका गर्न मैले कुन संकेतहरू खोज्नुपर्छ?

मैले निम्न प्रम्प्टमा दिने डाटामा व्यक्तिगत/गोपनीय जानकारी छ कि छैन भनी जाँच गर्नुहोस्। तलको पाठमा मास्क गर्न आवश्यक क्षेत्रहरू (नाम, इ-मेल, आईडी नम्बर, फोन, ठेगाना) सूचीबद्ध गर्नुहोस्। पाठ: [पाठ]

भूमिका र अधिकार तालिका

खोज

आर्टिफिसियल इन्टेलिजेन्सको भूमिका

निर्णयको मालिक

कोड कंकाल / रूपान्तरण प्रकार्य

मस्यौदा जनरेटर

इन्जिनियर (समीक्षा)

EDA / डाटा सारांश

गतिवर्धक

इन्जिनियर (मापन द्वारा प्रमाणित)

मेट्रिक व्याख्या

सुझाव

इन्जिनियर

के डाटा प्रशिक्षण मा जानेछ?

सुझाव

टोली + डाटा मालिक

उत्पादनमा मोडेल राख्नुहोस्

चेकलिस्ट रिमाइन्डर

जिम्मेवार इन्जिनियर + टोली

व्यक्तिगत डाटा प्रशोधन

कुनै पनि छैन (प्रयोग गरिएको छैन)

कानूनी + डाटा नियन्त्रक

सामान्य गल्तीहरू

  • यसलाई प्रमाणीकरण बिना आउटपुट प्रयोग गर्दै। सबैभन्दा सामान्य र सबैभन्दा महँगो गल्ती। कोड वा मेट्रिक जुन राम्रो देखिन्छ यसको मतलब यो सही छैन।
  • उपकरणमा कच्चा गोप्य डाटा टाँस्दै। एकपटक पठाएपछि फिर्ता लिन सकिँदैन।
  • गलत मेट्रिकमा भर पर्दै। असंतुलित डाटामा शुद्धता र रैंकिंग समस्याहरूमा RMSE जस्ता असंगत मेट्रिकहरू भ्रामक छन्।
  • निर्णय निर्माताको रूपमा कृत्रिम बुद्धिमत्ता गलत गर्दै। उसले सुझाव दिन्छ; जिम्मेवारी हस्ताक्षरकर्ताको हो।
  • सन्दर्भरहित प्रम्प्ट। अस्पष्ट अनुरोधहरू जस्तै "एक मोडेल लेख्नुहोस्" अप्रमाणित आउटपुट उत्पादन गर्दछ।

संक्षेपमा

कृत्रिम बुद्धिमत्ता एमएल इन्जिनियर र यसको दैनिक प्रतिकृतिक द्वारा विकसित उत्पादन हो। कोड-डेटा-कागजात जस्ता कम जोखिम, सजिलै प्रमाणित कार्यहरूमा यसको मूल्य उच्चतम छ; पैसा, गोपनीयता र सुरक्षालाई असर गर्ने निर्णयहरू व्यक्तिसँग रहन्छ। प्रत्येक आउटपुटलाई स्रोतमा जडान गर्नुहोस्, फेरि मापन गर्नुहोस्, ईन्जिनियरिङ् फिल्टर मार्फत पास गर्नुहोस्। गोप्य डाटा सुरक्षित गर्नुहोस्, अनुमोदित सवारी साधनहरू प्रयोग गर्नुहोस्, रक्षात्मक उद्देश्यका लागि मात्र सुरक्षामा काम गर्नुहोस्। यो अनुशासन सबै पछिल्ला एकाइहरूको लागि आधार हो।

आवेदन कार्य

तपाईंको आफ्नै परियोजनाबाट कार्य छनौट गर्नुहोस् (जस्तै डाटा सफा गर्ने प्रकार्य लेख्नुहोस्)। पहिले कमजोर प्रम्प्ट लेख्नुहोस्, त्यसपछि यो एकाइमा टेम्प्लेट प्रयोग गरेर बलियो प्रम्प्ट लेख्नुहोस्। दुबै आउटपुटहरू लिनुहोस्, तीन-चरण प्रमाणिकरण लागू गर्नुहोस् (स्रोतमा लिङ्क, पुन: चलाउनुहोस्, इन्जिनियरिङ फिल्टर)। नोट गर्नुहोस् कुन प्रम्प्टले कति मिनेट र कति सुधारहरू बचत गर्छ।

चेकलिस्ट

  • [] मैले मेरो कार्यको जोखिम स्तर (कम/उच्च) निर्धारण गरेको छु।
  • [] मैले प्रम्प्टमा कुनै पनि वास्तविक व्यक्तिगत/गोपनीय डाटा राखेको छैन; मैले यसलाई मास्क गरें वा सिंथेटिक नमूना प्रयोग गरें।
  • [ ] मैले आउटपुटलाई स्रोतमा जडान गरें, यसलाई फेरि चलाएँ, यसलाई इन्जिनियरिङ परिप्रेक्ष्यबाट फिल्टर गरें।
  • [ ] मैले जाँच गरें कि मैले सही मेट्रिक चयन गरेको छु।
  • [] मैले आलोचनात्मक निर्णय (उत्पादन, डेटा प्रशोधनमा राख्ने) आफैले/टोलीसँग गरें, मैले यसलाई कृत्रिम बुद्धिमत्तामा छोडिनँ।
  • [] मैले कर्पोरेट स्वीकृत सवारी साधन प्रयोग गरें।