लाभ:
- डाटा पाइपलाइन सेट अप गर्ने क्षमता (सङ्ग्रह, प्रमाणीकरण, सफाई, रूपान्तरण, विभाजन, संस्करण) र पाइपलाइनको सुरुमा स्कीमा प्रमाणीकरण राख्ने
- डेटा चुहावट (समूह र अस्थायी) लाई रोक्न फिल्ड अर्थ र विभाजनको आधारमा छुटेको मान र लेबलिङ निर्णयहरू गर्ने क्षमता
- डाटा संस्करण र अनियमितता बीज फिक्स गरेर पुन: उत्पादन योग्य डाटा बेस सिर्जना गर्ने क्षमता
प्रत्येक मेसिन लर्निङ प्रणालीको वास्तविक शक्ति डेटामा हुन्छ, मोडेलमा होइन। अनुभवी इन्जिनियरहरूलाई थाहा छ: "फोहोर भित्र, फोहोर बाहिर" - सबैभन्दा उन्नत मोडेलले खराब डाटा फेड गर्दा पनि नराम्रो नतिजा ल्याउनेछ। यस एकाईमा, हामी डेटा पाइपलाइन (डेटा पाइपलाइन: मोडेल प्रशिक्षणको लागि कच्चा डाटा तयार गर्ने चरणहरूको श्रृंखला) स्थापना गर्छौं र यो लाइनको कुन चरणमा हामी कृत्रिम बुद्धिमत्ता सुरक्षित रूपमा प्रयोग गर्न सक्छौं भनेर जान्दछौं।
डाटा लाइन को चरणहरू
डाटा लाइन सामान्यतया यी स्टपहरू मार्फत जान्छ:
- सङ्कलन (इन्जेसन): स्रोतहरू (डेटाबेस, एपीआई, लग फाइलहरू, घटना स्ट्रिमहरू) बाट डेटा तान्दै।
- प्रमाणीकरण: डेटा अपेक्षित योजना, प्रकार, र दायराहरू अनुरूप छ कि छैन जाँच गर्दै।
- सफाई: छुटेका मानहरू, डुप्लिकेट रेकर्डहरू, आउटलियरहरू, र असंगतिहरू ह्यान्डल गर्दै।
- रूपान्तरण: कच्चा डाटालाई विशेषताहरूमा परिणत गर्दै — जस्तै वर्गीय चरलाई नम्बरमा रूपान्तरण गर्ने, मितिबाट "हप्ताको दिन" उत्पादन गर्ने।
- विभाजन: प्रशिक्षण, प्रमाणीकरण र परीक्षण सेटहरूमा विभाजन।
- संस्करण: रेकर्डिङ कुन मोडेल कुन डाटा संग तालिम दिइएको थियो।
आर्टिफिसियल इन्टेलिजेन्सले कोड ड्राफ्ट र आइडियाहरू उत्पन्न गरेर समय बचत गर्छ, विशेष गरी चरण २, ३ र ४ मा। तर कुन रेकर्ड खारेज गर्ने, कुन मूल्य नपुग्ने र कसरी भर्ने जस्ता निर्णयहरू डाटा जान्ने इन्जिनियरको हो। किनभने अनुचित सफाईले मोडेलमा लुकेको पूर्वाग्रह इन्जेक्ट गर्न सक्छ।
डाटा प्रमाणिकरण: लाइन को प्रारम्भिक रक्षा
सबैभन्दा महँगो त्रुटिहरू उत्पादनमा सुरु हुँदैन, तर जहाँ प्रमाणीकरण चरण छोडियो। स्कीमा प्रमाणीकरणले डेटाको प्रत्येक आगमन ब्याच अपेक्षित संरचना अनुरूप छ कि छैन भनेर स्वचालित रूपमा जाँच गर्दछ। उदाहरणका लागि, के ०-१२० बीचको उमेर स्तम्भ छ, इमेल क्षेत्र खाली छ, स्तम्भहरूको संख्या परिवर्तन भएको छ?
सुझाव: प्रमाणीकरण लाइनको सुरुमा राख्नुहोस्। भ्रष्ट डाटा जति चाँडो समातिन्छ, त्यसलाई सच्याउन त्यति नै सस्तो हुन्छ। उत्पादनमा समातिएको स्कीमा त्रुटि प्रशिक्षण चरणमा समातिएको भन्दा धेरै गुणा महँगो हुन्छ।
निम्न डेटा योजनाको लागि पान्डेरा (वा ठूलो अपेक्षाहरू) को साथ एक प्रमाणीकरण योजना लेख्नुहोस्। स्तम्भ र नियमहरू:- user_id: integer, null हुन सक्दैन, unique- age: integer, 0-120 बाट हुन सक्दैन- signup_date: मिति, भविष्यमा हुन सक्दैन- देश: वर्गीय, सेटबाट {TR, DE, US, UK}- ब्यालेन्स: दशमलव, नकारात्मक हुन सक्दैन प्रत्येक नियमको लागि एक अर्थपूर्ण त्रुटि सन्देश उत्पादन गर्नुहोस्। कोडको अन्त्यमा भाँचिएको रेखाको उदाहरणको साथ परीक्षण देखाउनुहोस्।
सरसफाई: मानिसले निर्णय गर्छ
छुटेका मानहरू प्रत्येक डेटा सेटको वास्तविकता हो। ह्यान्डल गर्ने तरिकाहरू:
- मेटाउने: धेरै उच्च छुटेको दर भएको पङ्क्ति/स्तम्भ खारेज गर्दै। तर सूचना हानि र पूर्वाग्रहको जोखिम छ।
- इम्प्युटेशन: माध्य, माध्य, धेरै बारम्बार मान, वा मोडेल-आधारित भविष्यवाणीको साथ आरोप।
- झण्डा: एक अलग फ्ल्याग स्तम्भमा जानकारी "हराइरहेको थियो" भण्डारण गर्दै - कहिलेकाहीँ हराइरहेको आफै संकेत हो।
कुन सही हो त्यो समस्यामा भर पर्छ। मेडिकल डाटा सेटमा, "रगतको मूल्य मापन गरिएको छैन" जानकारी मेटाउनुको सट्टा सुरक्षित गरिनु पर्छ; किनभने डाक्टरले मापन गर्न अस्वीकार गर्नु पनि संकेत हो। AI ले तपाईंलाई विकल्प र कोड दिन सक्छ; तपाईंले क्षेत्रको वास्तविकतामा फिट हुने छनौट गर्नुहोस्।
कमजोर प्रम्प्ट / बलियो प्रम्प्ट
कमजोर प्रम्प्ट: "हराएको मानहरू भर्नुहोस्।"
बलियो प्रम्प्ट: "निम्न स्तम्भहरूमा हराइरहेको मानहरू छन्: आय (12% हराइरहेको, दायाँ-तिरेको वितरण), last_login (30% हराइरहेको)। मध्यका साथ आय भर्ने सुझाव दिनुहोस्, तर मध्यका र मतलब किन होइन भनेर व्याख्या गर्नुहोस्। last_login को लागि, छुटेको मान महत्त्वपूर्ण हुन सक्छ (प्रयोगकर्ताले कहिले पनि लगइन_इन_लगइन गर्ने विचार नगर्न सक्छ); पूर्वाग्रह लेख्नुहोस् कि त दृष्टिकोणले मोडेलमा थप्नेछ।"
भिन्नता: बलियो प्रम्प्टले वितरण जानकारी र क्षेत्र अर्थ दिन्छ; कृत्रिम बुद्धिमत्ताले मेकानिकल फिलिंगको सट्टा निर्णय समर्थन उत्पादन गर्दछ।
लेबलिंग: गुणस्तर मापन गरिन्छ
पर्यवेक्षित सिकाइमा (जसका उदाहरणहरू सहि उत्तरहरू दिइएका छन्) मा, मोडेलले सिक्ने कुराहरू लेबलहरू हुन् (लेबलहरू: प्रत्येक उदाहरणको लागि सही जवाफ)। लेबल गुणस्तरले छत सेट गर्छ — यदि मानिसहरूले असंगत रूपमा लेबल गरे भने, मोडेलले असंगत रूपमा सिक्छ।
अन्तर-एनोटेटर सम्झौता दर मापन गर्दछ जसमा विभिन्न व्यक्तिहरूले एउटै नमूनालाई समान लेबल दिन्छन्; यो कोहेनको काप्पा जस्ता गुणांकद्वारा व्यक्त गरिएको छ। कम अनुपालनले कार्य अस्पष्ट छ वा निर्देशन कमजोर छ भनेर संकेत गर्दछ।
आर्टिफिसियल इन्टेलिजेन्सले दुई किसिमले लेबलिङ गर्न मद्दत गर्छ: (१) एनोटेशन गाइडलाइनको मस्यौदा तयार गर्ने, (२) पूर्व-लेबलिङ गर्ने र मानिसले मात्र यसलाई सच्याउने। तर LLM सँग प्रि-लेबलिङमा समस्या छ: मोडेलको व्यवस्थित त्रुटिले सम्पूर्ण लेबल सेटमा चुहावट हुन सक्छ। यही कारणले गर्दा मानिसहरूले सधैं केही LLM लेबलहरू जाँच गर्छन्।
ध्यान दिनुहोस्: LLM द्वारा उत्पादित लेबलहरूलाई "ग्राउन्ड ट्रुथ" को रूपमा नबिर्सनुहोस्। मानवसँग नमूना जाँच गर्नुहोस् र LLM-मानव फिट मापन गर्नुहोस्। यदि अनुपालन कम छ भने, पूर्व-लेबलिङले राम्रो भन्दा बढी हानि गर्नेछ।
डाटा विभाजन: चुहावट रोक्न
प्रशिक्षण/प्रमाणीकरण/परीक्षणमा डाटा विभाजन गर्दा सबैभन्दा खतरनाक गल्ती डाटा चुहावट हो: प्रशिक्षणमा परीक्षण जानकारीको मिश्रण। उदाहरणहरू:
- एउटै प्रयोगकर्ताको रेकर्डहरू दुवै प्रशिक्षण र परीक्षण (समूह चुहावट) मा पर्छन्।
- प्रशिक्षणमा भविष्य र समय श्रृंखलामा परीक्षणमा विगत प्रयोग गर्दै (टेम्पोरल लीकेज)।
- सबै डेटाबाट स्केलिंग (सामान्यीकरण) मापदण्डहरू गणना गर्दै र त्यसपछि विभाजन गर्दै।
समय समावेशी समस्याहरूको लागि अस्थायी विभाजन आवश्यक छ: अतीतसँग तालिम, भविष्यमा परीक्षण। अनियमित विभाजनले "भविष्य" लाभ दिन्छ जुन उत्पादनमा कहिल्यै हुने छैन र मेट्रिक्स फुलाउँछ।
डाटा संस्करण र पुन: उत्पादन क्षमता
"हामीले यो मोडेललाई कुन डाटासँग तालिम दियौं?" महिनौं पछि प्रश्नको जवाफ दिन सक्षम हुनु गम्भीर एमएल इन्जिनियरिङको विशेषता हो। डाटा संस्करणले प्रत्येक डाटा स्न्यापसटलाई आईडी (ह्यास वा संस्करण ट्याग) को साथ भण्डार गर्दछ। उपकरणहरू जस्तै DVC (डेटा संस्करण नियन्त्रण) संस्करण डेटा जस्तै कोड।
मोडेलको नतिजा पुन: उत्पादन गर्न, तीन चीजहरू निश्चित हुनुपर्छ: डेटा संस्करण, कोड संस्करण, र अनियमित बीज। यो त्रयी बिना "मैले समान परिणाम पाएँ" भन्न सम्भव छैन। हामी एकाइ ११ मा प्रजनन क्षमतालाई गहिरो बनाउनेछौं; तर डाटा पाइपलाइनमा बीउ फिक्सिङ यहाँबाट सुरु हुन्छ।
तीन मिनी केसहरू
केस १ - दिन स्किमा प्रमाणीकरण बचत गरियो। जब एक टोलीले अपस्ट्रीम प्रणाली मूल्य क्षेत्रलाई पेनीबाट लिरामा रूपान्तरण गर्यो, सबै मूल्यहरू १०० पटक घट्यो। स्कीमा प्रमाणीकरणले ब्याचलाई "दायराभन्दा बाहिरको मूल्य" भनी अस्वीकार गर्यो र मोडेललाई भ्रष्ट डाटासँग तालिम दिइएको थिएन। प्रमाणीकरण बिना, त्रुटि मात्र उत्पादन मा ध्यान दिइनेछ, गलत भविष्यवाणी संग।
केस २ - गलत फिलिंगको पूर्वाग्रह। क्रेडिट मोडेलमा, छुटेको आय मानहरू औसतले भरिएको थियो। तर छुटेको आय मुख्यतया कम आय समूहमा थियो; औसत कृत्रिम रूपमा "समृद्ध" यो समूह, र मोडेल तिनीहरूलाई एक अनुचित उच्च सीमा प्रस्ताव। मध्य + हराइरहेको झण्डाको साथ समस्या समाधान गरियो।
केस 3 - अस्थायी चुहावट। एक माग पूर्वानुमान मोडेल परीक्षण सेटमा राम्रो देखियो (95% शुद्धता) तर उत्पादनमा क्र्यास भयो। किन: अनियमित विभाजनको कारण, मोडेलले भविष्य देखेको थियो। टेम्पोरल बिनिङमा स्विच गर्दा परीक्षणको शुद्धता 78% मा घट्यो - तर त्यो वास्तविक प्रदर्शन थियो र यसलाई उत्पादनमा राखियो।
प्रतिलिपि गर्न मिल्ने टेम्प्लेटहरू
निम्न डेटासेटलाई तीन सेटमा विभाजन गर्नुहोस्: प्रशिक्षण/मान्यता/परीक्षण। अवरोध: यो समय श्रृंखला हो; टेम्पोरल विभाजन प्रयोग गर्नुहोस् (विगतमा रेल, भविष्यमा परीक्षण)। ब्याच चुहावट रोक्नुहोस्: एउटै 'ग्राहक_आईडी' एक क्लस्टरमा मात्र हो। तालिम सेटबाट मात्र स्केलिंग प्यारामिटरहरू गणना गर्नुहोस्, त्यसपछि सबैमा लागू गर्नुहोस्। प्रत्येक चरणमा कोडमा कति लाइनहरू बाँकी छन् प्रिन्ट गर्नुहोस् र कुनै लीक नभएको जाँच गर्ने दाबी थप्नुहोस्।
यो लेबलिङ कार्यको लागि मस्यौदा एनोटेशन दिशानिर्देश लेख्नुहोस्। कार्य: [जस्तै। लेबल ग्राहक समीक्षा सकारात्मक/नकारात्मक/तटस्थ] सीमा रेखा केसहरू स्पष्ट गर्नुहोस्: व्यंग्य, मिश्रित भावना, उत्पादनसँग सम्बन्धित नभएको समीक्षालाई कसरी लेबल गर्ने? 5 उदाहरणहरू र 3 कठिन किनारा केसहरू दिनुहोस् जसले ट्यागरहरूमा स्थिरता बढाउनेछ।
यस डाटा पाइपलाइनको लागि पुन: उत्पादन योग्यता जाँचसूची उत्पादन गर्नुहोस्:- डाटा संस्करण कसरी तय गर्नुपर्छ?- कुन अनियमितता बीजहरू कहाँ सेट गर्नुपर्छ?- कुन मेटाडेटा (डेटा ह्यास, पङ्क्ति गणना, मिति) लगइन गर्नुपर्छ? मेरो कोडबेस: [भाषा/पुस्तकालय]
डाटा चुहावट लागि यो क्लीनअप कोड जाँच गर्नुहोस्। विशेष रूपमा यसलाई हेर्नुहोस्: के स्केलिंग/इन्कोडिङ प्यारामिटरहरू विभाजन गर्नु अघि गणना गरिन्छ? के कुनै पनि तथ्याङ्कहरू सबै डेटा वा केवल प्रशिक्षणबाट गणना गरिएको छ? कोड: [कोड]
निर्णय तालिका: हराइरहेको मूल्य रणनीति
स्थिति
सिफारिस गरिएको दृष्टिकोण
किन
संख्यात्मक, विकृत वितरण
मध्यका साथ भर्नुहोस्
औसत बाहिरबाट प्रभावित हुन्छ
संख्यात्मक, सममित
औसत भर्नुहोस्
जानकारीको सुरक्षा गर्छ
कमी महत्त्वपूर्ण हुन सक्छ
फ्ल्याग स्तम्भ + भर्नुहोस्
अभाव एक संकेत हो
छुटेको दर > ६०%
स्तम्भ मूल्याङ्कन / खारेज गर्नुहोस्
कोलाहल धेरै छ
वर्गीय
"अज्ञात" वर्ग
कृत्रिम बहुमत सिर्जना गर्दैन
सामान्य गल्तीहरू
- प्रमाणीकरण छोड्दै। स्किमा नियन्त्रण बिना, भ्रष्ट डाटा चुपचाप भित्र लुक्छ।
- विभाजन गर्नु अघि स्केलिङ। यसले शिक्षामा परीक्षाको तथ्याङ्क चुहावट गर्छ।
- समय श्रृंखलामा अनियमित विभाजन प्रयोग गर्दै। यसले नक्कली उच्च मेट्रिक्स उत्पादन गर्दछ।
- LLM लेबलहरूमा अन्धाधुन्ध विश्वास गर्दै। प्रणालीगत त्रुटि डाटा भर फैलिएको छ।
- डाटा संस्करण बचत गर्दैन। तपाईंले परिणाम पुन: उत्पादन गर्न सक्नुहुन्न।
- औसतको साथ मेकानिकल भरिने। यसले क्षेत्रको अर्थलाई बेवास्ता गर्छ, पूर्वाग्रह थप्छ।
संक्षेपमा
डाटा पाइपलाइन ML प्रणालीको आधार हो र मोडेल भन्दा बढी प्रयासको योग्य छ। शीर्षमा प्रमाणिकरण राख्नुहोस्; डोमेन ज्ञानको साथ सफाई र लेबलिंग निर्णयहरू लिनुहोस्; कम्पार्टमेन्टमा चुहावट (समूह र अस्थायी) रोक्नुहोस्; डाटा संस्करण र बीज ठीक गर्नुहोस्। AI ले यस लाइनमा कोड र विचारहरू उत्पन्न गर्छ, तर कुन डाटा र कसरी प्रशोधन गर्ने भन्ने निर्णय गर्ने तपाईंमा निर्भर छ — किनकि यहाँ हरेक गलत निर्णय लुकेको त्रुटिको रूपमा मोडेलमा जान्छ।
आवेदन कार्य
तपाईंको आफ्नै डेटासेटमा प्रमाणीकरण योजना (पान्डेरा/महान अपेक्षाहरू) लेख्नुहोस् र जानाजानी खराब पङ्क्ति थप्नुहोस् र यो समातिएको देखाउनुहोस्। त्यसपछि डेटालाई अस्थायी रूपमा वा ब्याचवाइजमा विभाजन गर्नुहोस्, प्रशिक्षणबाट मात्र स्केलिंग प्यारामिटरहरू गणना गर्नुहोस्, र दाबीको साथ कुनै चुहावट छैन भनी प्रमाणित गर्नुहोस्। मेटाडेटा फाइलमा डाटा संस्करण र पङ्क्ति गणना लेख्नुहोस्।
चेकलिस्ट
- स्कीमा प्रमाणीकरण लाइनको शीर्षमा चल्छ।
- [ ] मैले फिल्ड अर्थमा आधारित छुटेको मूल्य रणनीति छनोट गरें, मैले यसलाई मेकानिकल रूपमा भरिन।
- [] मैले लेबल गुणस्तर (अनुपालन) मापन गरें; म मानव-जाँच गरिएको LLM ट्यागहरू।
- [] मैले फलकमा समूह र अस्थायी चुहावट रोकें।
- [] स्केलिंग/इन्कोडिङ तालिम सेटबाट मात्र गणना गरिन्छ।
- [] डाटा संस्करण, पङ्क्तिहरूको संख्या र बीउ रेकर्ड गरियो।