एकाइहरू
1. एमएल इन्जिनियरिङमा कृत्रिम बुद्धिमत्ता: भूमिका, सीमा, प्रमाणीकरण र जिम्मेवारी 2. डाटा पाइपलाइन: सङ्कलन, सफाई, ट्यागिङ र संस्करण 3. मोडेल प्रशिक्षण र मूल्याङ्कन: सटीक मेट्रिक्स, इमानदार बेन्चमार्किङ 4. LLM आवेदन: RAG सँग तपाईंको आफ्नै डाटामा आधारित जवाफहरू 5. LLM आवेदन: एजेन्ट, उपकरण र सुरक्षित स्वचालन 6. फाइन-ट्यूनिंग आधार: कहिले, कसरी र के जोखिम संग 7. MLOps र तैनाती: प्रयोगशालाबाट उत्पादनमा मोडेल सार्दै 8. Eval र निगरानी: मोडेलले वास्तवमा उत्पादनमा के गर्छ भन्ने थाहा पाउनु 9. सुरक्षा र गोपनीयता: AI प्रणालीहरूको रक्षा गर्दै 10. पूर्वाग्रह, नैतिकता र लागत: जिम्मेवार र दिगो एआई ईन्जिनियरिङ् 11. पुन: उत्पादनशीलता र अन्त-देखि-अन्त परियोजना: सबै कुरा संयोजन
एकाइ 3 / 11

मोडेल प्रशिक्षण र मूल्याङ्कन: सटीक मेट्रिक्स, इमानदार बेन्चमार्किङ

लाभ:

  • समस्याको प्रकार र व्यापार सन्दर्भमा उपयुक्त मेट्रिक छनौट गर्ने क्षमता (PR-AUC/असन्तुलित डाटामा रिकॉल, MAE/RMSE in regression) र ओभर/अन्डर सिकाइ पहिचान गर्ने क्षमता
  • आधार रेखा विरुद्ध प्रत्येक मेट्रिकको व्याख्या गर्ने क्षमता र विचलन मापन गर्ने र क्रस-प्रमाणीकरणको साथ प्रगतिबाट अलग आवाज
  • प्रमाणीकरण सेटको साथ हाइपरपेरामिटरहरू ट्युन गरेर र अन्त्यमा मात्र परीक्षण सेट प्रयोग गरेर गैर-आशावादी परिणामहरू रिपोर्ट गर्ने क्षमता।

मोडेल प्रशिक्षण (प्रशिक्षण: डेटाबाट ढाँचाहरू सिक्ने प्रक्रिया) एमएल इन्जिनियरिङको सबैभन्दा देखिने तर सबैभन्दा भ्रामक चरण हो। यो देखिन्छ किनभने यसले "सटीकता 95%" जस्तो सन्तोषजनक संख्या उत्पादन गर्दछ। भ्रामक किनभने त्यो संख्या अक्सर गलत प्रश्नको सही जवाफ हो। यस इकाईमा, शिक्षा र मूल्याङ्कन ईन्जिनियरिङ् अनुशासन संग छलफल गरिन्छ; हामी प्रायोगिक डिजाइनमा साझेदारको रूपमा आर्टिफिसियल इन्टेलिजेन्स प्रयोग गर्छौं र निर्णय मापनमा आधारित छ।

प्रशिक्षण चक्र को तर्क

मोडेलले हानि प्रकार्यलाई कम गरेर डेटामा ढाँचा सिक्छ: मोडेलको त्रुटिलाई संख्यात्मक रूपमा मापन गर्ने प्रकार्य। अनुकूलन एल्गोरिथ्म (जस्तै ढाँचा वंश) ले चरण-दर-चरण प्यारामिटरहरू समायोजन गरेर घाटा कम गर्दछ। उद्देश्य प्रशिक्षण डेटा याद गर्न को लागी हैन, तर यसलाई अभूतपूर्व डेटा मा सामान्यीकरण गर्न को लागी।

दुई मुख्य खतराहरू:

  • ओभरफिटिंग: मोडेलले प्रशिक्षण डेटा सम्झन्छ र नयाँ डेटामा असफल हुन्छ। प्रशिक्षण सफलता उच्च छ, प्रमाणीकरण सफलता कम छ।
  • अन्डरफिटिंग: मोडेलले ढाँचा खिच्न सक्दैन; प्रशिक्षण र प्रमाणीकरण सफलता दुवै कम छन्।

सन्तुलन खोज्नु शिक्षाको कला हो। यो सन्तुलन अनुगमन गर्नको लागि प्रमाणीकरण सेट छ: यदि प्रशिक्षण सफलता बढ्दै जाँदा प्रमाणीकरण सफलता घट्न थाल्छ भने, ओभरलर्निङ सुरु भएको छ।

सुझाव: प्रत्येक चरणमा प्रशिक्षण र प्रमाणीकरण हानि सँगै प्लट गर्नुहोस्। जुन बिन्दुमा दुई वक्रहरू भिन्न हुन थाल्छन् जहाँ ओभरलर्निङ सुरु हुन्छ र "प्रारम्भिक रोक्न" को लागि सही समय हो।

मेट्रिक चयन: सबैभन्दा महत्वपूर्ण निर्णय

गलत मेट्रिकले राम्रो मोडेललाई नराम्रो र नराम्रो मोडेल राम्रो देखिन्छ। समस्याले मेट्रिक निर्धारण गर्छ:

  • असंतुलित वर्गीकरण (एउटा वर्ग एकदमै दुर्लभ छ, जस्तै धोखाधडी): शुद्धता भ्रामक छ। एउटा मोडेल जसले "सबै कुरालाई सामान्य कल गर्नुहोस्" भन्यो ९९% शुद्धता प्राप्त गर्नेछ तर एकल धोखाधडी पक्रने छैन। यसको सट्टा, परिशुद्धता (मैले समातेको कति वास्तवमा सकारात्मक छ), सम्झनुहोस् (मैले समातेको कति साँचो सकारात्मक छ) र तिनीहरूको ब्यालेन्स F1 वा PR-AUC प्रयोग गरिन्छ।
  • सन्तुलित वर्गीकरण: शुद्धता र ROC-AUC उपयुक्त हुन सक्छ।
  • प्रतिगमन (संख्या अनुमान): MAE (अर्थपूर्ण त्रुटि), RMSE (ठूला त्रुटिहरूलाई दण्डित गर्दछ), MAPE (प्रतिशत त्रुटि)।
  • रैंकिंग/सिफारिस: NDCG, MRR, Recall@K.

परिशुद्धता वा सम्झना महत्त्वपूर्ण छ कि व्यापार सन्दर्भमा निर्भर गर्दछ। याद गर्नुहोस् (कुनै पनि बिरामी नछुटाउनु) क्यान्सर स्क्रिनिङमा प्राथमिकता हो; स्प्याम फिल्टरमा सटीकता (स्प्याममा महत्त्वपूर्ण इ-मेलहरू नपठाउने) महत्त्वपूर्ण छ। यो एक व्यापारिक निर्णय हो, प्राविधिक होइन, र ईन्जिनियर र मालिक द्वारा सँगै गरिएको हो।

कमजोर प्रम्प्ट / बलियो प्रम्प्ट

कमजोर प्रम्प्ट: "मेरो मोडेलको कार्यसम्पादन, शुद्धता ०.९७ मूल्याङ्कन गर्नुहोस्।"

शक्तिशाली प्रम्प्ट: "मसँग धोखाधडी पत्ता लगाउने मोडेल छ; सकारात्मक वर्ग दर 1.5% छ। शुद्धता 0.97 को रूपमा रिपोर्ट गरिएको छ। यो मेट्रिक किन भ्रामक हुन सक्छ भनेर व्याख्या गर्नुहोस्, मलाई कुन मेट्रिक्स (परिशुद्धता, सम्झना, PR-AUC) रुचाउनु पर्छ र किन। साथै यो पनि गणना गर्नुहोस् कि 'कल डाटाले वास्तविक डेटा' मा जोडिएको सबै कुरा नकारात्मक देख्न सक्छ।

भिन्नता: शक्तिशाली प्रम्प्टले वर्ग अनुपात र व्यापार सन्दर्भ दिन्छ; यसले आधारभूत मोडेल तुलनाको लागि पनि सोध्छ — यो मेट्रिक अर्थपूर्ण छ कि छैन भनेर सबैभन्दा महत्त्वपूर्ण एंकर हो।

आधार रेखा: तुलना बिना मेट्रिक अर्थहीन छ

मेट्रिक आफैंमा राम्रो वा खराब हुँदैन; यो आधारभूत मोडेल अनुसार राम्रो वा खराब छ। आधारभूत मोडेल सबैभन्दा सरल समाधान हो जुन दिमागमा आउँछ: "सधैं बहुमत वर्गलाई भन्नुहोस्", "गत हप्ताको मूल्य दोहोर्याउनुहोस्", "मान अनुमान गर्नुहोस्"। यदि तपाइँको मोडेल स्पष्ट रूपमा यो सरल समाधान पास गर्न सक्दैन भने, सबै जटिलता केहिको लागि छैन।

सावधानी: वाक्य "मेरो मोडेल 85% सही छ" आफैंले केहि बोल्दैन। यदि आधार मोडेलले पहिले नै 84% पाउँछ भने, तपाईंको मोडेल लगभग बेकार छ; यदि आधार मोडेलले 50% पाउँछ भने, तपाईंको मोडेल उत्तम छ। सधैं आधारभूत मोडेलको सन्दर्भमा बोल्नुहोस्।

क्रस-प्रमाणीकरण र विश्वास

एकल प्रशिक्षण/परीक्षण विभाजन संयोगको कारण हुन सक्छ। क्रस-प्रमाणीकरण: डाटालाई k भागहरूमा विभाजन गरेर र प्रत्येक भागलाई क्रमिक रूपमा परीक्षण गर्दा प्रदर्शन कति स्थिर छ भनेर देखाउँछ। 5-गुणा क्रस प्रमाणीकरणमा तपाईंले पाँच फरक स्कोरहरू प्राप्त गर्नुहुन्छ; तिनीहरूको औसत र मानक विचलन महत्त्वपूर्ण छ। यदि औसत 80% छ तर विचलन ±12% छ भने, तपाईंको मोडेल अस्थिर छ - यसले डेटाको अर्को ब्याचमा धेरै फरक व्यवहार गर्न सक्छ।

यो "दुई मोडेल तुलना" को लागी पनि महत्वपूर्ण छ। यदि मोडेल A ले 81% र मोडेल B ले 82% पायो भने, B साँच्चै राम्रो छ? यदि विचलन ±3% छ भने, यो भिन्नता आवाज हुन सक्छ। निर्णय गर्नु अघि फरक महत्त्वपूर्ण छ कि छैन विचार गर्नुहोस्।

हाइपरपेरामिटर ट्युनिङ: प्रमाणीकरणको साथ, परीक्षण होइन

हाइपरप्यारामिटरहरू (प्रशिक्षण अघि म्यानुअल रूपमा निर्धारण गरिएका सेटिङहरू — सिकाइ दर, रूखको गहिराइ, आदि) प्रमाणीकरण सेटसँग सेट गरिएका छन्। परीक्षण सेट एक पटक मात्र अन्त्यमा प्रयोग गरिन्छ। यदि तपाईंले परीक्षण सेट हेरेर हाइपरपेरामिटरहरू चयन गर्नुभयो भने, परीक्षण सेट दूषित हुनेछ र तपाईंले रिपोर्ट गर्नुभएको कार्यसम्पादन आशावादी हुनेछ जुन वास्तविकतामा त्यस्तो छैन।

हाइपरपेरामिटर खोज स्थान डिजाइन गर्न र खोज कोड (ग्रिड खोज, अनियमित खोज, बेयसियन अप्टिमाइजेसन) लेख्न कृत्रिम बुद्धिमत्ता राम्रो सहायक हो। तर तपाइँ अझै पनि निर्णय गर्नुहुन्छ "हामी कुन मेट्रिक अप्टिमाइज गर्नेछौं?"

तीन मिनी केसहरू

केस १ - शुद्धता जाल। एक मेडिकल टोलीले एउटा दुर्लभ रोग पत्ता लगाउने मोडेलमा गर्व गर्यो: 98% शुद्धता। जब आधारभूत मोडेल तुलना गरिएको थियो, सत्य देखा पर्यो: रोग दर 2% भएकोले, "सबैलाई स्वस्थ कल गर्नुहोस्" भन्ने मोडेलले पनि 98% प्राप्त गर्यो। मोडेलको सम्झना केवल 11% थियो - धेरै बिरामीहरू हराइरहेका थिए। मेट्रिकलाई PR-AUC मा रूपान्तरण गरिसकेपछि, वास्तविक कार्यसम्पादन मापन गरियो र मोडेललाई पुन: डिजाइन गरिएको थियो।

केस २ - प्रगतिको लागि गलत आवाज। एक टोलीले 86.2% बाट 86.9% मा मोडेल सुधार गर्न महिनौं खर्च गर्यो। क्रस-प्रमाणीकरणले देखायो कि पूर्वाग्रह ±1.4% थियो - त्यसैले 0.7 बिन्दु "सुधार" सांख्यिकीय शोर थियो। टोलीले अवास्तविक कमाईमा तीन हप्ता बर्बाद गरेको थियो। पाठ: विचलन भन्दा सुधार ठूलो छ भनेर प्रमाणित नगरी विजयको घोषणा नगर्नुहोस्।

केस 3 - परीक्षण सेट को प्रदूषण। एक इन्जिनियरले उत्कृष्ट हाइपरपेरामिटरहरू छनौट गर्न परीक्षण सेटलाई बारम्बार हेरे। 91% यसले उत्पादनमा 83% मा झरेको रिपोर्ट गर्यो। किन: उसले अनजानमा परीक्षण सेटलाई बारम्बार हेरेर (टेस्ट सेटमा ओभरलर्निङ) हेरेर सोही अनुसार मोडेल छनोट गरेको थियो। अलग प्रमाणीकरण सेट प्रयोग गर्दा रिपोर्ट गरिएको र वास्तविक कार्यसम्पादन ओभरल्याप गरियो।

प्रतिलिपि गर्न मिल्ने टेम्प्लेटहरू

मलाई यो वर्गीकरण समस्याको लागि सही मेट्रिक छनोट गर्न मद्दत गर्नुहोस्। समस्या: [के अनुमान गरिएको छ] वर्ग वितरण: [सकारात्मक दर

निम्न दुई मोडेलहरूको तुलनाको मूल्याङ्कन गर्नुहोस्। मोडेल ए क्रस-प्रमाणीकरण: [अंकहरूको सूची] मोडेल बी क्रस-प्रमाणीकरण: [अङ्कहरूको सूची] माध्य र मानक विचलन गणना गर्नुहोस्। के भिन्नता सांख्यिकीय रूपमा महत्त्वपूर्ण छ वा यो केवल विचलन भित्रको आवाज हो? मैले कुन रोज्ने सिफारिस गर्नुहुन्छ र किन?

निम्नका लागि यो प्रशिक्षण कोड जाँच गर्नुहोस्: 1) के हाइपरप्यामिटरहरू परीक्षण सेट वा प्रमाणीकरण सेटको साथ चयन गरिएको छ? 2) के प्रारम्भिक रोक्न सही सेटको साथ अनुगमन गरिएको छ? 3) के त्यहाँ अधिक शिक्षा (प्रशिक्षण/मान्यता हानि भिन्नता) को कुनै संकेतहरू छन्? कोड: [कोड]

यस रिग्रेसन समस्याको लागि मैले कुन MAE, RMSE, र MAPE लाई रिपोर्ट गर्नुपर्छ? लक्ष्य चरको स्केल: [दायरा] के ठूला त्रुटिहरू असमान रूपमा खराब छन् (RMSE), वा तिनीहरू सबै बराबर छन् (MAE)? के त्यहाँ शून्यको नजिक मानहरू छन् (के तिनीहरूले MAPE विकृत गर्छन्)? संक्षिप्त औचित्यका साथ सुझाव दिनुहोस्।

मेट्रिक चयन तालिका

समस्या प्रकार

उपयुक्त मेट्रिक

जोगिनु पर्छ

किन

असंतुलित वर्गीकरण

PR-AUC, F1, सम्झना

शुद्धता

बहुमत वर्गले मेट्रिक बढाउँछ

सन्तुलित वर्गीकरण

शुद्धता, ROC-AUC

-

सन्तुलित डाटामा भरपर्दो

प्रतिगमन (महत्वपूर्ण आउटलायर)

RMSE

MAPE (यदि शून्य)

ठूला गल्तीहरूलाई सजाय दिन्छ

प्रतिगमन (समान वजन)

MAE

-

व्याख्या गर्न सजिलो

श्रेणीकरण/सिफारिस

NDCG, Recal@K

शुद्धता

अर्डर महत्त्वपूर्ण छ

सामान्य गल्तीहरू

  • असन्तुलित डाटामा शुद्धता प्रयोग गर्दै। सबैभन्दा सामान्य मेट्रिक त्रुटि।
  • आधार मोडेल तुलना नगर्ने। यसले मेट्रिकको अर्थ गुमाउँछ।
  • हाइपरपेरामिटरहरूको लागि परीक्षण सेट हेर्दै। आशावादी, अवास्तविक परिणाम।
  • एउटै कम्पार्टमेन्टमा भर पर्दै। क्रस-प्रमाणीकरण बिना तपाईंले पूर्वाग्रह देख्नुहुने छैन।
  • प्रगतिको लागि गलत हल्ला। विचलनबाट साना "सुधारहरू" प्रायः भाग्य हुन्।
  • व्यापार सन्दर्भलाई बेवास्ता गर्दै। परिशुद्धता/रिकल ब्यालेन्स एक व्यापार निर्णय हो।

संक्षेपमा

मोडेल प्रशिक्षणमा वास्तविक सीप भनेको उच्च संख्या उत्पादन गर्नु होइन, तर त्यो संख्याको अर्थ के हो भनेर जान्न हो। समस्या र व्यापार सन्दर्भले सही मेट्रिक निर्धारण गर्दछ; आधार रेखा मोडेल अनुसार प्रत्येक मेट्रिक व्याख्या; क्रस-प्रमाणीकरणको साथ पूर्वाग्रह मापन गर्नुहोस् र प्रगतिको लागि गल्ती नगर्नुहोस्; अन्तिममा मात्र परीक्षण सेट प्रयोग गर्नुहोस्, एक पटक। AI प्रयोग डिजाइनमा तपाइँको साझेदार हो, तर "पर्याप्त राम्रो" को निर्णय तपाइँ र तपाइँको हो।

आवेदन कार्य

वर्गीकरण मोडेलको लागि: (१) वर्ग वितरण लेख्नुहोस्, (२) उपयुक्त आधार मोडेल बनाउनुहोस् र यसको स्कोर नाप्नुहोस्, (३) ५-गुणा क्रस प्रमाणीकरणको साथ आफ्नो मोडेलको मूल्याङ्कन गर्नुहोस् र औसत र मानक विचलन रिपोर्ट गर्नुहोस्, (४) सटीकताको सट्टा समस्याको लागि उपयुक्त मेट्रिक गणना गर्नुहोस् (जस्तै PR-AUC)। तपाईंको मोडेलले आधारभूत मोडेललाई पूर्वाग्रह बिना ठूलो मार्जिनले हराउँछ कि गर्दैन भनेर लेख्नुहोस्।

चेकलिस्ट

  • [ ] मैले समस्या प्रकार र व्यापार सन्दर्भमा आधारित मेट्रिक छनोट गरें।
  • [ ] मैले आधार मोडेल बनाए र यसको विरुद्ध तुलना गरें।
  • [ ] मैले क्रस-प्रमाणीकरणको साथ मतलब र विचलन रिपोर्ट गरें।
  • [ ] मैले पुष्टि गरें कि सुधार विचलन भन्दा ठूलो छ।
  • [ ] मैले मान्यता सेटको साथ हाइपरपेरामिटरहरू चयन गरें।
  • [ ] मैले अन्तिममा एक पटक मात्र परीक्षण सेट प्रयोग गरें।