युनिट्स
1. एमएल अभियांत्रिकीमध्ये कृत्रिम बुद्धिमत्ता: भूमिका, सीमा, प्रमाणीकरण आणि जबाबदारी 2. डेटा पाइपलाइन: संकलन, साफ करणे, टॅग करणे आणि आवृत्ती करणे 3. मॉडेल प्रशिक्षण आणि मूल्यमापन: अचूक मेट्रिक्स, प्रामाणिक बेंचमार्किंग 4. LLM अर्ज: RAG सह तुमच्या स्वतःच्या डेटावर आधारित उत्तरे 5. एलएलएम अर्ज: एजंट, टूलिंग आणि सुरक्षित ऑटोमेशन 6. फाइन-ट्यूनिंग बेस: केव्हा, कसे आणि कोणत्या जोखमीसह 7. MLOps आणि उपयोजन: प्रयोगशाळेतून उत्पादनाकडे मॉडेल हलवणे 8. इव्हल आणि मॉनिटरिंग: उत्पादनामध्ये मॉडेल खरोखर काय करते हे जाणून घेणे 9. सुरक्षा आणि गोपनीयता: AI सिस्टमचे रक्षण करणे 10. बायस, एथिक्स आणि कॉस्ट: जबाबदार आणि शाश्वत AI अभियांत्रिकी 11. पुनरुत्पादनक्षमता आणि एंड-टू-एंड प्रोजेक्ट: सर्वकाही एकत्र करणे
युनिट 11 / 11

पुनरुत्पादनक्षमता आणि एंड-टू-एंड प्रोजेक्ट: सर्वकाही एकत्र करणे

नफा:

  • चार खांबांसह पुनरुत्पादकता सुनिश्चित करण्याची क्षमता (सीड फिक्सेशन, डेटा व्हर्जनिंग, मीडिया फ्रीझिंग, प्रयोग मॉनिटरिंग) आणि त्याच रनची पुनरावृत्ती करताना समान परिणाम देण्याची क्षमता
  • मॉड्यूलचे सर्व स्टॉप (मेट्रिक्स, डेटा, मॉडेल, एलएलएम घटक, इव्हल, निष्पक्षता, सुरक्षा, वितरण, मॉनिटरिंग) एंड-टू-एंड चेनमध्ये एकत्र करण्याची क्षमता
  • प्रत्येक स्टॉपवर गंभीर निर्णय मानवाकडेच राहतो याची पडताळणी करण्याची आणि प्रकल्पाचे ऑडिट करण्यायोग्य पद्धतीने दस्तऐवजीकरण करण्याची क्षमता

एमएल प्रकल्पाचे सर्वात कपटी अपयश म्हणजे क्रॅश नाही; "पुन्हा तोच निकाल मिळत नाही." तुम्ही तीन महिन्यांपूर्वी उत्पादनात आणलेल्या मॉडेलचा आजचा स्कोअर तुम्ही पुनरुत्पादित करू शकत नसल्यास, तुम्ही त्या मॉडेलवर खरोखर नियंत्रण ठेवू शकत नाही. या क्लोजिंग युनिटमध्ये, आम्ही पुनरुत्पादनक्षमता अधिक सखोल करतो: समान इनपुटसह समान परिणाम विश्वसनीयरित्या प्राप्त करण्याची आणि एंड-टू-एंड प्रोजेक्ट शिस्तीमध्ये संपूर्ण मॉड्यूल एकत्र करण्याची क्षमता.

पुनरुत्पादन करणे कठीण का आहे

सामान्य सॉफ्टवेअरमध्ये, समान कोड समान आउटपुट देतो. ML मध्ये आणखी बरेच चल आहेत जे परिणाम निर्धारित करतात:

  • यादृच्छिकता: डेटा बदलणे, वजन प्रारंभ करणे, डेटा विभाजित करणे - सर्व यादृच्छिकतेवर अवलंबून असतात.
  • डेटा: समान कोड भिन्न डेटा आवृत्तीसह भिन्न मॉडेल तयार करतो.
  • पर्यावरण: लायब्ररी आवृत्त्या, हार्डवेअर (CPU/GPU), अगदी ऑपरेटिंग सिस्टीमही परिणाम बदलू शकतात.
  • लपलेले केस: जतन न केलेले हायपरपॅरामीटर, मॅन्युअल प्रीप्रोसेसिंग पायरी, एक अननोट केलेली निवड.

पुनरुत्पादकता ही "आणणे छान" नसून एक वैज्ञानिक आणि अभियांत्रिकी अत्यावश्यक आहे. पुनरुत्पादित केला जाऊ शकत नाही असा निकाल हा दावा आहे जो सिद्ध केला जाऊ शकत नाही.

पुनरुत्पादनक्षमतेचे चार स्तंभ

1. यादृच्छिकता निश्चित करा. सर्व यादृच्छिक बिया एकाच ठिकाणी सेट करा: डेटा विभाजित करणे, मॉडेल आरंभ करणे, डेटा शफल करणे. स्थिर बियाणे हा "तुम्ही समान रन पुन्हा कराल तेव्हा समान परिणाम" हमी आधार आहे.

2. डेटा आवृत्ती. प्रत्येक प्रयोग कोणत्या डेटा आवृत्तीसह केला गेला याची नोंद करा (युनिट 2 मधील डेटा आवृत्ती). "नवीनतम डेटा" अस्पष्ट आहे; "डेटा आवृत्ती v3, हॅश abc123" अचूक आहे.

3. मध्यम गोठवा. सर्व अवलंबनांना त्यांच्या अचूक आवृत्त्यांमध्ये पिन करा (उदा. आवश्यकता.txt मधील numpy==1.26.4 किंवा कंटेनर इमेज सारख्या अचूक आवृत्त्या). "नवीनतम आवृत्ती" एक दिवस सर्वकाही खंडित करेल.

4. प्रत्येक गोष्टीचा मागोवा घ्या (प्रयोग ट्रॅकिंग). प्रत्येक प्रयोगासाठी स्वयंचलितपणे जतन करा: कोड आवृत्ती (गिट कमिट), डेटा आवृत्ती, सर्व हायपरपॅरामीटर्स, मेट्रिक्स आणि आउटपुट संरचना. MLflow, Weights & Biases सारखी प्रयोग ट्रॅकिंग साधने हे पद्धतशीरपणे करतात. नोंदणीशिवाय, "कोणती सेटिंग सर्वोत्तम होती" हा प्रश्न अनुत्तरित राहतो.

खबरदारी: "मला नंतर लक्षात येईल" ही सर्वात महागडी चूक आहे. दोन आठवड्यांनंतर तुम्ही कोणते बियाणे, कोणता डेटा, कोणता हायपरपॅरामीटर वापरला हे तुम्हाला आठवत नाही. स्वयंचलित ट्रॅकिंग मेमरीवरील अवलंबित्व काढून टाकते.

कमकुवत दृष्टीकोन / मजबूत दृष्टीकोन

कमकुवत: "मला सर्वोत्कृष्ट मॉडेल सापडले, ते नोटबुकवर आहे, मला वाटते की त्याचा स्कोअर 89% होता."

सशक्त: "प्रयोग ट्रॅकिंग टूलमध्ये #147 चालवा: git कमिट a3f9c, डेटा आवृत्ती v3 (हॅश abc123), सीड 42, नोंदणीकृत सर्व हायपरपॅरामीटर्स, चाचणी PR-AUC 0.887. जेव्हा मी तीच कमांड पुन्हा चालवतो, तेव्हा मला थोडा-थोडा तोच परिणाम मिळतो. मॉडेल हे रजिस्ट्रीमधील या रनवर अवलंबून असते."

फरक: सशक्त दृष्टिकोनात परिणाम मेमरीवर आधारित नसून स्थिर आणि निरीक्षण केलेल्या साखळीवर आधारित आहे. प्रत्येकजण प्रत्येक वेळी समान परिणाम देऊ शकतो.

एंड-टू-एंड प्रोजेक्ट: मॉड्यूलचे संयोजन

आता संपूर्ण मॉड्यूल एका प्रोजेक्ट फ्लोमध्ये एकत्र करू. वास्तविक एमएल सिस्टम या स्टॉपमधून जाते आणि प्रत्येक स्टॉप मागील स्टॉपवर तयार होतो:

  1. समस्येची व्याख्या: आम्ही काय सोडवत आहोत, यश कसे मोजायचे (एकक 3: योग्य मेट्रिक, व्यवसाय संदर्भ). मेट्रिक आणि थ्रेशोल्ड सुरुवातीपासून स्पष्ट आहेत.
  2. डेटा पाइपलाइन: संकलन, प्रमाणीकरण, साफ करणे, लीक-मुक्त विभाजन, आवृत्ती (युनिट 2).
  3. मॉडेल डेव्हलपमेंट: प्रशिक्षण, बेसलाइन तुलना, क्रॉस-व्हॅलिडेशन, हार्ड सीड (युनिट 3 + हे युनिट).
  4. LLM घटक (लागू असल्यास): RAG (युनिट 4) आणि/किंवा एजंट (युनिट 5); आवश्यक असल्यास फाइन-ट्यूनिंग (युनिट 6).
  5. मूल्यमापन: एज आणि सिक्युरिटी केसेससह इव्हल क्लस्टर, एलएलएम सिस्टम्समध्ये मल्टी-लेयर इव्हल (युनिट 8).
  6. न्याय आणि नैतिकता ऑडिट: उपसमूह विश्लेषण, मॉडेल कार्ड, स्पष्टीकरणक्षमता (युनिट 10).
  7. सुरक्षा ऑडिट: प्रॉम्प्ट इंजेक्शन, गोपनीयता, पुरवठा साखळी (युनिट 9).
  8. वितरण: पॅकेजिंग, क्रमिक वितरण, रोलबॅक, मॉडेल रेजिस्ट्री (युनिट 7).
  9. मॉनिटरिंग: थ्री-लेयर मॉनिटरिंग, ड्रिफ्ट अलार्म (युनिट 8).
  10. पुनरुत्पादनक्षमता: संपूर्ण शृंखला (हे युनिट) मध्ये बियाणे, डेटा आवृत्ती, मीडिया आणि प्रयोग ट्रॅकिंग.

या प्रवाहात, AI प्रत्येक थांब्यावर एक प्रवेगक आणि ब्लूप्रिंट जनरेटर आहे; परंतु मेट्रिक निवड, डेटा निर्णय, निष्पक्षता प्राधान्य, उपयोजन थ्रेशोल्ड आणि रिलीझ मंजूरी - गंभीर निर्णय मानवाकडेच राहतात. हे मॉड्यूलचे सार आहे.

दस्तऐवजीकरण: भविष्य तुमचे आभार मानेल

एक चांगला एमएल प्रकल्प दस्तऐवज स्वतः. कमीतकमी, खालील गोष्टी लिहिल्या पाहिजेत: समस्या आणि यशाचे निकष, डेटा स्त्रोत आणि आवृत्ती, मॉडेल निवड आणि समर्थन, मूल्यांकन परिणाम (उपसमूहांसह), ज्ञात मर्यादा आणि जोखीम, तैनाती आणि पुनर्प्राप्ती प्रक्रिया, देखरेख योजना. हा दस्तऐवज त्या व्यक्तीचा सर्वात चांगला मित्र आहे (कदाचित ते तुम्ही आहात) जो सहा महिन्यांनंतर प्रकल्पावर परत येतो.

तीन लहान प्रकरणे

केस 1 - निकाल गमावला. एका अभियंत्याने उत्कृष्ट मॉडेलला प्रशिक्षण दिले, परंतु त्याने बियाणे दुरुस्त केले नाही आणि डेटा आवृत्ती जतन केली नाही. जेव्हा त्याने नोकरी सोडली, तेव्हा कोणीही तो परिणाम पुनरुत्पादित करू शकला नाही; मॉडेल एक "ब्लॅक बॉक्स लीजेंड" बनले आणि अखेरीस सुरवातीपासून तयार केले गेले. आठवडे वाया गेले. धडा: पुनरुत्पादन न करता येणारा परिणाम हा अस्तित्वात नसलेला परिणाम आहे.

प्रकरण 2 - पर्यावरण संकुचित. एका संघाने अवलंबित्व निश्चित केले नव्हते. जेव्हा लायब्ररी स्वयंचलितपणे अद्यतनित केली जाते, तेव्हा मॉडेल आउटपुट शांतपणे बदलले आणि उत्पादन विस्कळीत झाले. समस्या शोधण्यासाठी दिवस गेले. जेव्हा अवलंबित्व गोठवले गेले आणि निश्चित आवृत्त्यांसह कंटेनर केले गेले, तेव्हा समस्या पुन्हा उद्भवली नाही. धडा: वातावरण गोठवा.

केस 3 - देखरेखीची शक्ती. एका टीमने प्रत्येक प्रयोगाचे आपोआप निरीक्षण केले. तीन महिन्यांनंतर, नियामक ऑडिट दरम्यान, त्यांनी "कोणत्या डेटासह, कोणत्या सेटिंग्जसह, कोणत्या गटांमध्ये काय कार्यप्रदर्शन मिळाले?" या प्रश्नाचे उत्तर दिले. मिनिटांत पूर्ण रेकॉर्डिंगसह. तपासणी सुरळीत पार पडली. धडा: निरीक्षण हे केवळ अभियांत्रिकी साधन नसून अनुपालन साधन आहे.

कॉपी करण्यायोग्य टेम्पलेट्स

या एमएल प्रकल्पासाठी पुनरुत्पादनक्षमता तपासा.- सर्व यादृच्छिकता बिया निश्चित केल्या आहेत (विभाजित करा, आरंभ करा, शफल करा)?- डेटा आवृत्ती आहे का?- अवलंबित्व अचूक आवृत्त्यांसाठी गोठवले आहे का?- प्रत्येक प्रयोग (कोड कमिट, डेटा, हायपरपॅरामीटर, मेट्रिक) ट्रॅक केला आहे का? प्रत्येक गहाळ स्तंभासाठी त्याचे निराकरण कसे करायचे यावर ठोस पावले लिहा. प्रकल्प रचना: [वर्णन]

या एंड-टू-एंड एमएल प्रकल्पासाठी योजना सांगाडा तयार करा. समस्या: [वर्णन] खालील थांबे झाकून ठेवा आणि प्रत्येक स्टॉपवर मानवी निर्णय कुठे आहे हे चिन्हांकित करा: समस्या/मेट्रिक, पाइपलाइन, मॉडेल, (RAG/एजंट/फाईन-ट्यून?), इव्हल, निष्पक्षता, सुरक्षा, वितरण, निरीक्षण, पुनरुत्पादनक्षमता. प्रत्येक स्टॉपसाठी मुख्य जोखीम आणि पडताळणीची पायरी लिहा.

या प्रकल्पासाठी तांत्रिक दस्तऐवजीकरण टेम्पलेट तयार करा. विभाग: समस्या+यशाचे निकष, डेटा (स्रोत+आवृत्ती), मॉडेल निवड+औचित्य, मूल्यमापन (उपसमूहांसह), ज्ञात मर्यादा+जोखीम, उपयोजन + रोलबॅक, देखरेख योजना. प्रश्न म्हणून प्रत्येक विभागासाठी भरावयाची फील्ड द्या.

माझे प्रयोग मॉनिटरिंग सेटअप तपासा: प्रत्येक रनवर ते स्वयं-सेव्ह केले जाते: git कमिट, डेटा आवृत्ती/हॅश, सर्व हायपरपॅरामीटर्स, सर्व मेट्रिक्स, पर्यावरण (लायब्ररी आवृत्त्या)? जेव्हा मी पुन्हा तीच धाव घेतो तेव्हा मला समान परिणाम मिळतो का? सेटअप: [वर्णन]. त्रुटींची यादी करा आणि सुधारणा करा.

पुनरुत्पादनक्षमता स्तंभ सारणी

स्तंभ

काय निश्चित आहे

वाहनाचे उदाहरण

यादृच्छिकता

सर्व बिया

बियाणे सेटिंग

डेटा

डेटा आवृत्ती/हॅश

DVC

वातावरण

लायब्ररी आवृत्त्या

आवश्यकता पिन, डॉकर

देखरेख

कोड+डेटा+सेटिंग+मेट्रिक

MLflow, W&B

सामान्य चुका

  • बी फिक्सिंग नाही. परिणाम पुनरावृत्ती होऊ शकत नाही.
  • डेटा आवृत्ती जतन करत नाही. "कोणत्या डेटासह?" अनुत्तरीत राहते.
  • गोठवणारी व्यसनं नाही. एक अद्यतन शांतपणे सर्वकाही खंडित करेल.
  • प्रयोग स्मृतीवर सोडून. दोन आठवड्यांनंतर काहीच आठवत नाही.
  • गंभीर निर्णय कृत्रिम बुद्धिमत्तेवर सोडणे. मेट्रिक्स, न्याय आणि वितरणाचे निर्णय लोकांकडे राहिले पाहिजेत.
  • कागदपत्रे पुढे ढकलणे. भावी संघ (आणि तुम्ही) किंमत द्या.

सारांशात

पुनरुत्पादकता ही गंभीर एमएल अभियांत्रिकीची स्वाक्षरी आहे: पुनरुत्पादन न करता येणारा परिणाम हा अप्रमाणित दावा आहे. हे चार स्तंभांसह येते — यादृच्छिकता, आवृत्ती डेटा, फ्रीझ वातावरण, प्रत्येक प्रयोगाचा मागोवा घ्या. एंड-टू-एंड प्रोजेक्ट या मॉड्यूलचे सर्व स्टॉप (मेट्रिक, डेटा, मॉडेल, LLM घटक, eval, निष्पक्षता, सुरक्षा, वितरण, मॉनिटरिंग) एकमेकांशी जोडलेल्या साखळीमध्ये एकत्र करतो; आर्टिफिशियल इंटेलिजन्स हा प्रत्येक स्टॉपवर एक प्रवेगक आहे, परंतु गंभीर निर्णय माणसाकडेच राहतात. भविष्यातील कार्यसंघ आणि ऑडिटसाठी सर्वकाही दस्तऐवजीकरण करा. ही शिस्त अशी चौकट आहे जी तुम्ही संपूर्ण मॉड्यूलमध्ये शिकत असलेल्या प्रत्येक गोष्टीला टिकवून ठेवते.

अर्ज कार्य

चार पुनरुत्पादकता खांबांवर एमएल प्रकल्प तपासा: बिया अपरिवर्तनीय आहेत का, डेटा आवृत्तीत आहे का, वातावरण गोठलेले आहे का, प्रयोगांचा मागोवा घेतला आहे का? कोणत्याही गहाळ स्तंभांचे निराकरण करा आणि सिद्ध करा की तुम्ही समान रन दोनदा चालवू शकता आणि समान परिणाम मिळवू शकता. नंतर प्रोजेक्टचा एंड-टू-एंड फ्लो (10 स्टॉप) एका पृष्ठावर आउटपुट करा आणि प्रत्येक स्टॉपवर "मानवी निर्णय कुठे आहे" असे चिन्हांकित करा. शेवटी, एक लहान तांत्रिक दस्तऐवजीकरण मसुदा लिहा.

चेकलिस्ट

  • [ ] सर्व यादृच्छिकता बिया निश्चित.
  • प्रत्येक प्रयोगासह डेटा आवृत्ती/हॅश रेकॉर्ड केले जाते.
  • [ ] अवलंबित्व फर्म आवृत्त्यांमध्ये (पिन/कंटेनर) गोठवले जाते.
  • [] प्रत्येक प्रयोगाचे आपोआप निरीक्षण केले जाते (कोड+डेटा+सेटिंग+मेट्रिक).
  • [ ] जेव्हा मी तीच धाव पुनरावृत्ती करतो तेव्हा मला तोच परिणाम मिळतो.
  • [ ] मी पडताळले आणि दस्तऐवजीकरण केले की एंड-टू-एंड प्रवाहातील गंभीर निर्णय मानवाकडून घेतले जातात.

मॉड्यूल परीक्षा

1. ML अभियंता म्हणून, वर्कफ्लोमध्ये कृत्रिम बुद्धिमत्ता ठेवताना सर्वोत्तम दृष्टीकोन कोणता आहे?

  • अ) AI कमी जोखमीच्या व्यवसायांमध्ये प्रवेगक आहे; मेट्रिक्स, डेटा आणि उत्पादन यांसारखे गंभीर निर्णय प्रमाणित राहतात आणि माणसावर सोडले जातात ✔
  • ब) जोपर्यंत AI आउटपुट चांगले दिसत आहेत, तोपर्यंत पडताळणीची गरज नाही
  • क) मॉडेलचे उत्पादन कृत्रिम बुद्धिमत्तेवर ठेवण्याचा निर्णय सोडल्याने वेळेची बचत होते.
  • ड) कृत्रिम बुद्धिमत्ता केवळ मजकूर लिहिण्यासाठी उपयुक्त आहे, त्याचा डेटा आणि मॉडेलच्या कामाशी काहीही संबंध नाही

वर्णन: कोड, डेटा डायजेस्ट आणि दस्तऐवज यांसारख्या कमी-जोखीम, सहजपणे सत्यापित कार्यांसाठी AI एक शक्तिशाली प्रवेगक आहे; तथापि, पैसे, गोपनीयतेवर आणि कायदेशीर उत्तरदायित्वावर परिणाम करणाऱ्या निर्णयांची जबाबदारी, जसे की मेट्रिक निवड, कोणता डेटा प्रशिक्षणात जातो आणि मॉडेलला उत्पादनात आणणे, हे पात्र अभियंता आणि टीमवर आहे. प्रत्येक आउटपुट सत्यापनाशिवाय वापरला जाऊ नये.

2. डेटा पाइपलाइनच्या सुरुवातीला स्कीमा प्रमाणीकरण का ठेवले जाते?

  • अ) कारण ते थेट मॉडेलची अचूकता वाढवते
  • ब) कारण ते डेटा व्हर्जनिंग अनावश्यक बनवते
  • क) कारण ते दूषित डेटा लवकरात लवकर आणि स्वस्त बिंदूवर पकडते आणि पुढील चरणांमध्ये लीक होण्यापासून प्रतिबंधित करते ✔
  • ड) कारण ते लेबलिंगची गरज काढून टाकते

स्पष्टीकरण: पूर्वीचा भ्रष्ट डेटा पकडला जातो, तो दुरुस्त करणे तितके स्वस्त. स्कीमा प्रमाणीकरण रेषेच्या सुरुवातीला अपेक्षित प्रकार आणि श्रेणीबाहेरील डेटा नाकारून भ्रष्ट डेटाला प्रशिक्षण किंवा उत्पादनामध्ये शांतपणे लीक होण्यापासून प्रतिबंधित करते (उदा. युनिट बदलासह किंमत 100x बदलणे); उत्पादनात पकडलेली समान त्रुटी अनेक पटींनी महाग आहे.

3. वेळ (वेळ मालिका) समाविष्ट असलेल्या समस्येमध्ये प्रशिक्षण आणि चाचणीमध्ये डेटा विभाजित करताना योग्य दृष्टीकोन कोणता आहे?

  • अ) यादृच्छिक विभाजन वापरणे कारण ती नेहमीच सर्वात योग्य पद्धत असते
  • ब) टेम्पोरल स्प्लिटिंग वापरणे: भूतकाळाचे प्रशिक्षण देऊन आणि भविष्यात चाचणी करून गळती रोखा ✔
  • क) प्रशिक्षण आणि चाचणी दोन्ही म्हणून सर्व डेटा वापरणे
  • ड) प्रशिक्षणापूर्वी चाचणी डेटा स्केलिंग पॅरामीटर्समध्ये समाविष्ट करणे

स्पष्टीकरण: वेळेच्या मालिकेवर यादृच्छिक विभाजनामुळे मॉडेलला एक 'भविष्य पाहण्याचा' फायदा मिळतो जो उत्पादनात कधीही होणार नाही आणि कृत्रिमरित्या मेट्रिक्स (टेम्पोरल लीकेज) वाढवते. तात्पुरती विभागणी योग्य आहे: भूतकाळासह ट्रेन करा, भविष्यात चाचणी घ्या. हे उत्पादनात ठेवणारी वास्तविक कामगिरी मोजते.

4. 1.5% च्या सकारात्मक वर्ग दरासह फसवणूक शोध मॉडेलमध्ये अचूकता दिशाभूल का आहे?

  • अ) कारण असंतुलित डेटावर अचूकता नेहमीच कमी असते
  • ब) कारण अचूकता केवळ प्रतिगमन समस्यांवर वापरली जाऊ शकते
  • क) कारण अचूकतेच्या गणनेसाठी भरपूर प्रक्रिया शक्ती लागते
  • ड) बहुसंख्य वर्गाचा अंदाज लावणारे तुटपुंजे मॉडेलही अगदी अचूक असू शकते, त्यामुळे खरे यश लपवले जाते ✔

स्पष्टीकरण: असंतुलित डेटावर, अगदी 'कॉल एव्हरीथिंग निगेटिव्ह' म्हणणाऱ्या मूलभूत मॉडेलला 98.5% अचूकता मिळते परंतु एकही फसवणूक होणार नाही. म्हणून, असंतुलित वर्गीकरणात, अचूकतेऐवजी अचूकता, रिकॉल, F1 किंवा PR-AUC वापरले जातात आणि प्रत्येक मेट्रिकचा आधार मॉडेलनुसार अर्थ लावला जातो.

5. मॉडेलच्या मेट्रिकबद्दल बोलत असताना बेसलाइन तुलना का आवश्यक आहे?

  • अ) कारण मूळ मॉडेल हे वास्तविक मॉडेलपेक्षा नेहमीच चांगले असते
  • ब) कारण साध्या बेसलाइन मॉडेलशी तुलना करताना मेट्रिक अर्थपूर्ण आहे की नाही हे स्पष्ट होते ✔
  • क) कारण बेस मॉडेल क्रॉस-व्हॅलिडेशन अनावश्यक बनवते
  • ड) कारण प्रत्येक अहवालात मूलभूत मॉडेल कायदेशीररित्या आवश्यक आहे

स्पष्टीकरण: मेट्रिक स्वतःच चांगला किंवा वाईट नसतो; मूलभूत मॉडेलनुसार ते चांगले किंवा वाईट आहे. '85% बरोबर' या वाक्याचा अर्थ बेस मॉडेलला आधीपासून 84% मिळाले तर जवळजवळ निरुपयोगी आणि 50% मिळाले तर परिपूर्ण. तुलनात्मक अँकरशिवाय, मेट्रिक निरर्थक आहे.

6. RAG (Retrieval-Augmented Generation) प्रणालीच्या उत्पादन प्रॉम्प्टमध्ये कोणता सर्वात गंभीर सुरक्षा घटक समाविष्ट केला पाहिजे?

  • अ) केवळ दिलेल्या स्त्रोतावर अवलंबून राहण्याची सूचना, स्त्रोत अस्तित्वात नसल्यास 'मला माहित नाही' असे म्हणणे आणि स्त्रोत उद्धृत करणे ✔
  • ब) मॉडेलला शक्य तितकी लांब आणि सर्जनशील उत्तरे तयार करण्यास सांगणे
  • क) मॉडेल संसाधनांपेक्षा स्वतःच्या शैक्षणिक ज्ञानाला प्राधान्य देते
  • ड) आदेश म्हणून आणलेल्या कागदपत्रांमधील सर्व सूचनांची अंमलबजावणी करा

स्पष्टीकरण: RAG ची सर्वात महत्त्वाची सूचना म्हणजे मॉडेलला केवळ दिलेल्या स्त्रोतावर अवलंबून राहण्यास सांगणे आणि जर माहिती स्त्रोतामध्ये नसेल तर 'मला माहित नाही' असे म्हणा आणि ते न बनवता स्त्रोताचा उल्लेख करा. या ट्रायडशिवाय, मॉडेल संदर्भाकडे दुर्लक्ष करू शकते आणि भ्रम निर्माण करू शकते आणि उत्तर अप्रमाणित होते.

7. RAG प्रणाली चुकीची उत्तरे देते. निदान सुरू करण्यासाठी सर्वोत्तम ठिकाण कोठे आहे?

  • अ) प्रथम आणणे मोजणे (रिकॉल@के): योग्य तुकडा कधी येतो का? ✔
  • ब) ताबडतोब मोठ्या मॉडेलसह बदला
  • क) प्रॉम्प्ट यादृच्छिकपणे बदला आणि प्रयत्न करणे सुरू ठेवा
  • ड) सर्व दस्तऐवज मॉडेलमध्ये फाइन-ट्यूनिंगसह एम्बेड करणे

स्पष्टीकरण: RAG ची सर्वात कमकुवत लिंक सहसा आणते, उत्पादन नाही. योग्य भाग कधीही आणला नसल्यास, प्रॉम्प्ट कितीही सुधारले तरीही मॉडेल ती माहिती तयार करू शकत नाही. म्हणून, योग्य भाग आला आहे की नाही हे पाहण्यासाठी प्रथम Recall@K मोजले जाते; आणणे चांगले असल्यास, उत्पादन आणि प्रॉम्प्ट तपासले जाते.

8. एजंटला एखादे साधन देताना मानवी संमतीच्या मागे कोणत्या कृती केल्या पाहिजेत?

  • अ) काहीही नाही; एजंट प्रत्येक कृती स्वायत्तपणे करण्यास सक्षम असणे आवश्यक आहे
  • ब) डेटा वाचणे आणि शोधणे यासारख्या केवळ उलट करण्यायोग्य क्रिया
  • क) पैसे हस्तांतरित करणे, हटवणे, पाठवणे यासारख्या अपरिवर्तनीय किंवा उच्च प्रभावाच्या क्रिया ✔
  • ड) कृती ज्यामध्ये फक्त गणना समाविष्ट आहे

वर्णन: क्रिया जोखीम पातळीनुसार विभक्त केल्या जातात. वाचन, शोधणे, गणना करणे आणि मसुदे तयार करणे यासारखी पुनर्प्राप्त करण्यायोग्य कार्ये स्वायत्तपणे केली जाऊ शकतात; तथापि, पैसे हस्तांतरित करणे, ईमेल पाठवणे, डेटा हटवणे, ऑर्डर देणे इ. यांसारख्या अपरिवर्तनीय किंवा उच्च-प्रभावी क्रियांना मानवी संमती आवश्यक आहे. प्रत्येक अपरिवर्तनीय कृती संमतीच्या अधीन असणे आवश्यक आहे.

9. अप्रत्यक्ष प्रॉम्प्ट इंजेक्शनच्या जोखमीविरूद्ध सर्वोत्तम डिझाइन दृष्टीकोन कोणता आहे?

  • अ) सिस्टम प्रॉम्प्टमध्ये 'वाईट सूचनांकडे दुर्लक्ष करा' हे एक वाक्य जोडणे पुरेसे आहे
  • ब) बाह्य सामग्रीमधील सूचनांवर अवलंबून राहून मॉडेलला अधिक अधिकार द्या
  • क) कोणतीही खबरदारी न घेणे कारण इंजेक्शन प्रतिबंधित नाही
  • ड) बाह्य सामग्रीला अविश्वसनीय डेटा म्हणून वेगळे करणे आणि कमीतकमी अधिकृतता, मंजूरी आणि आउटपुट नियंत्रणासह स्तरित संरक्षण स्थापित करणे ✔

वर्णन: एजंट किंवा RAG द्वारे प्रक्रिया केलेली बाह्य सामग्री, जसे की वेब पृष्ठ, दस्तऐवज, ईमेल इ. हा अविश्वसनीय डेटा आहे आणि त्यात गुप्त सूचना असू शकतात. योग्य दृष्टीकोन हा स्तरित संरक्षण आहे: स्पष्ट सीमांकांसह बाह्य सामग्रीला 'डेटा, कमांड नाही' म्हणून वेगळे करणे, किमान अधिकृतता लागू करणे, मानवी मान्यतेसाठी अपरिवर्तनीय क्रिया बंधनकारक करणे आणि आउटपुटचे ऑडिट करणे. सूचनांची एक ओळ पुरेशी नाही.

10. फाइन-ट्यूनिंग किंवा RAG सह समस्या सोडवायची की नाही हे ठरवताना मुख्य फरक काय आहे?

  • अ) माहितीच्या समस्या आरएजीने चांगल्या प्रकारे सोडवल्या जातात, वर्तन/स्वरूपातील समस्या फाइन-ट्यूनिंगसह चांगल्या प्रकारे सोडवल्या जातात ✔
  • ब) प्रत्येक समस्या नेहमी फाइन-ट्यूनिंगद्वारे सोडवली पाहिजे
  • C) RAG फक्त कोड जनरेशनसाठी वापरला जातो, फाइन-ट्यूनिंग फक्त भाषांतरासाठी वापरला जातो
  • ड) फाइन-ट्यूनिंग नेहमी RAG पेक्षा स्वस्त आणि जलद अपडेट केले जाऊ शकते

स्पष्टीकरण: मॉडेल नवीन माहिती शिकवण्यात फाइन-ट्यूनिंग कमकुवत आणि धोकादायक आहे; पण शिकवण्याची वर्तणूक, स्वरूप, स्वर आणि शैली मध्ये शक्तिशाली आहे. 'मॉडेल कंपनीला आमचा डेटा माहीत नाही' ही माहितीची समस्या आहे आणि ती RAG ची आहे. 'मॉडेलला नेहमी आमच्या कठोर स्वरूपात आउटपुट करू द्या' ही वर्तणुकीशी संबंधित समस्या आहे आणि उत्कृष्ट ट्यूनिंगसाठी उमेदवार आहे. याव्यतिरिक्त, फाइन-ट्यूनिंग करण्यापूर्वी प्रॉम्प्ट आणि काही-शॉट्स सेवन केले पाहिजेत.

11. उत्पादनात नवीन मॉडेल टाकताना सुरक्षित तैनातीसाठी कोणते अनिवार्य आहे?

  • अ) मॉडेल चाचणीमध्ये चांगले असल्यास, ते थेट 100% रहदारीसाठी उघडा
  • ब) तैनातीनंतर अजिबात मॉनिटरिंग सेट न करणे
  • क) टप्प्याटप्प्याने उपयोजन (सावली/कॅनरी) आणि पूर्व-चाचणी रोलबॅक योजना ✔
  • ड) मूल्यमापन थ्रेशोल्ड पूर्ण होत नसले तरीही मॉडेल प्रकाशित करणे

स्पष्टीकरण: नवीन मॉडेल थेट सर्व रहदारीसाठी उघडणे धोकादायक आहे; जर ते चुकीचे असेल तर प्रत्येकजण प्रभावित होतो. योग्य गोष्ट अशी आहे की हे क्रमिक वितरण (सावली, कॅनरी) आहे आणि प्रत्येक वितरणाची चाचणी केलेली रोलबॅक योजना आहे. क्लॉबॅक योजनेशिवाय वितरण पूर्ण होत नाही; जेव्हा मॉडेल उत्पादनामध्ये अनपेक्षितपणे वागते तेव्हा काही मिनिटांत मागील आवृत्तीवर परत येण्यास सक्षम असणे वापरकर्त्याचे संरक्षण करते.

12. एमएल मॉडेल उत्पादनात 'शांतपणे' कसे अयशस्वी होऊ शकते आणि हे पकडण्याचा मार्ग कोणता आहे?

  • अ) मॉडेल कोसळते; सर्व्हर लॉग हे दर्शवतात
  • ब) चुका न करता चुकीचे अंदाज निर्माण करून; ✔ हे ऑपरेशनल, इनपुट आणि आउटपुट स्तरित मॉनिटरिंग कॅप्चर करते
  • क) मॉडेल कधीही शांतपणे अपयशी होऊ शकत नाही, नेहमी अलार्म
  • ड) कोणतीही ऱ्हास पकडण्यासाठी फक्त विलंबाचे निरीक्षण करणे पुरेसे आहे

स्पष्टीकरण: मॉडेल क्रॅश न होता किंवा त्रुटी न देता चुकीचे अंदाज निर्माण करून अयशस्वी होऊ शकते; याचे मुख्य कारण म्हणजे डेटा ड्रिफ्ट आणि कॉन्सेप्ट ड्रिफ्ट. केवळ ऑपरेशनल मेट्रिक्स (विलंबता, त्रुटी दर) निरीक्षण करणे पुरेसे नाही; इनपुट वितरण आणि आउटपुट/अंदाज वितरणाचे देखील परीक्षण केले पाहिजे. वास्तविक परिणाम विलंब झाल्यास इनपुट ड्रिफ्ट लवकर चेतावणी देते.

13. LLM प्रणालीचे मूल्यांकन करण्यासाठी LLM-जज-जज वापरताना कोणते तत्व आवश्यक आहे?

  • अ) एलएलएम-रेफरी नेहमीच बरोबर असतो, मानवी पडताळणी अनावश्यक असते
  • ब) पंचाने केवळ उत्तराच्या लांबीवर आधारित निर्णय घेणे आवश्यक आहे.
  • क) रेफरी वापरताना नियम-आधारित नियंत्रणे आणि मानवी मूल्यमापन पूर्णपणे टाकून द्यावे
  • ड) न्यायाधीशांचे गुण मानव-लेबल केलेल्या नमुन्याने कॅलिब्रेट केले जावे आणि त्यांच्यावर विश्वास ठेवण्याआधी त्यांचे पूर्वाग्रह मोजले जावे ✔

वर्णन: एलएलएम-रेफरी देखील एक मॉडेल आहे; हे भ्रामक, पक्षपाती (दीर्घ, आत्मविश्वासपूर्ण उत्तरांना अनुकूल) आणि विसंगत असू शकते. म्हणून, रेफरी स्कोअर मानवी लेबल केलेल्या नमुन्याने कॅलिब्रेट करणे आवश्यक आहे आणि उत्पादन निर्णय घेण्यापूर्वी त्यांचे पद्धतशीर पूर्वाग्रह मोजले जाणे आवश्यक आहे. एक असत्यापित रेफरी खोटा आत्मविश्वास देतो.

14. मॉडेल बायसचे मूल्यमापन करताना एकूण अचूकता अपुरी का आहे?

  • अ) एकूणच अचूकता पुरेशी आहे कारण ती नेहमी सर्वात वाईट गटाची कामगिरी प्रतिबिंबित करते
  • ब) एकूणच अचूकता अपुरी आहे कारण ती उपसमूहांमधील पद्धतशीर फरक (लपलेला भेदभाव) अस्पष्ट करू शकते ✔
  • क) कारण अचूकता ही एक मेट्रिक आहे ज्याचा पूर्वाग्रहाशी काहीही संबंध नाही
  • डी) बायस फक्त मॉडेलमधून येतो आणि डेटाशी त्याचा काहीही संबंध नाही.

स्पष्टीकरण: एकूणच अचूकता उपसमूहांमधील पद्धतशीर फरक अस्पष्ट करू शकते. उदाहरणार्थ, एकूण अचूकता ८८% असताना, एका गटात ९१% आणि दुसऱ्या गटात ६७% असू शकते; मॉडेल पद्धतशीरपणे त्या गटाला चुकते. म्हणून, उपसमूह (लोकसंख्या/विभाग) च्या आधारे मॉडेलचे मूल्यमापन केले जावे आणि न्यायाच्या कोणत्या व्याख्येला प्राधान्य द्यायचे हे भागधारकांसोबत ठरवले जावे.

15. ML परिणाम पुनरुत्पादक होण्यासाठी कोणत्या चार गोष्टी एकत्र निश्चित केल्या पाहिजेत?

  • अ) फक्त मॉडेलचे नाव, आकार, किंमत आणि प्रकाशन तारीख
  • ब) फक्त GPU ब्रँड आणि इंटरनेट गती
  • सी) मॉडेलचा केवळ अंतिम अचूकता स्कोअर; उर्वरित स्मृतीमध्ये ठेवता येते
  • ड) यादृच्छिकता बियाणे, डेटा आवृत्ती, पर्यावरण (अवलंबन आवृत्ती) आणि प्रयोग ट्रॅकिंग ✔

वर्णन: पुनरुत्पादकता चार स्तंभांद्वारे प्राप्त केली जाते: यादृच्छिकता बियाणे, आवृत्ती डेटा (आवृत्ती/हॅश), वातावरण गोठवणे (अचूक लायब्ररी आवृत्त्या/कंटेनर), आणि प्रत्येक प्रयोगाचा मागोवा घेणे (कोड कमिट, डेटा, हायपरपॅरामीटर, मेट्रिक). या साखळीशिवाय समान परिणाम पुनरुत्पादित करणे शक्य नाही; पुनरुत्पादित न करता येणारा परिणाम असा दावा आहे जो सिद्ध होऊ शकत नाही.