इकाइयाँ
1. एमएल इंजीनियरिंग में आर्टिफिशियल इंटेलिजेंस: भूमिका, सीमाएं, मान्यता और जिम्मेदारी 2. डेटा पाइपलाइन: संग्रहण, सफ़ाई, टैगिंग और संस्करणीकरण 3. मॉडल प्रशिक्षण और मूल्यांकन: सटीक मेट्रिक्स, ईमानदार बेंचमार्किंग 4. एलएलएम आवेदन: आरएजी के साथ आपके अपने डेटा के आधार पर उत्तर 5. एलएलएम एप्लीकेशन: एजेंट, टूलींग और सुरक्षित स्वचालन 6. फाइन-ट्यूनिंग आधार: कब, कैसे और किस जोखिम के साथ 7. एमएलओपीएस और परिनियोजन: मॉडल को लैब से उत्पादन तक ले जाना 8. मूल्यांकन और निगरानी: यह जानना कि मॉडल वास्तव में उत्पादन में क्या करता है 9. सुरक्षा और गोपनीयता: एआई सिस्टम का बचाव 10. पूर्वाग्रह, नैतिकता और लागत: जिम्मेदार और टिकाऊ एआई इंजीनियरिंग 11. प्रतिलिपि प्रस्तुत करने योग्यता और अंत-से-अंत परियोजना: हर चीज़ का संयोजन
इकाई 10 / 11

पूर्वाग्रह, नैतिकता और लागत: जिम्मेदार और टिकाऊ एआई इंजीनियरिंग

लाभ:

  • यह समझकर कि पूर्वाग्रह डेटा (ऐतिहासिक, प्रतिनिधित्वात्मक, माप, एकत्रीकरण) से आता है और उपसमूहों के आधार पर मॉडल का मूल्यांकन करके छिपे हुए भेदभाव का पता लगाने की क्षमता
  • एक मॉडल कार्ड के साथ उच्च प्रभाव वाले निर्णयों और दस्तावेज़ पारदर्शिता में व्याख्या, मानवीय निरीक्षण और जवाबदेही प्रदान करने की क्षमता
  • सबसे छोटे पर्याप्त मॉडल, त्वरित शॉर्टिंग, कैश और बैच के साथ गुणवत्ता से समझौता किए बिना वित्तीय और पर्यावरणीय लागतों का प्रबंधन करने की क्षमता

एक मॉडल तकनीकी रूप से पूरी तरह से काम कर सकता है लेकिन फिर भी गलत हो सकता है - अगर यह कुछ लोगों के लिए अनुचित है, समझ से बाहर है, या अस्थिर लागत पैदा करता है। इस इकाई में, हम एमएल इंजीनियरिंग के तीन "अदृश्य" लेकिन निर्णायक आयामों को कवर करते हैं: पूर्वाग्रह और निष्पक्षता, नैतिकता और पारदर्शिता, लागत और स्थिरता। ये बाद में जोड़े गए आभूषण नहीं हैं, बल्कि इंजीनियरिंग गुणवत्ता के अभिन्न अंग हैं।

पूर्वाग्रह कहाँ से आता है?

मॉडल पूर्वाग्रह (मॉडल का कुछ समूहों के साथ अलग/अनुचित तरीके से व्यवस्थित व्यवहार) आमतौर पर डेटा से आता है, मॉडल से नहीं। स्रोत:

  • ऐतिहासिक पूर्वाग्रह: डेटा पिछले अन्याय को दर्शाता है। यदि किसी विशेष समूह को अतीत में कम श्रेय दिया गया है, तो उस डेटा पर प्रशिक्षित मॉडल सीख जाएगा और इस भेदभाव को कायम रखेगा।
  • प्रतिनिधित्व पूर्वाग्रह: कुछ समूहों को डेटा में कम प्रतिनिधित्व दिया गया है; मॉडल उनके लिए खराब प्रदर्शन करता है (उदाहरण के लिए एक छोटे जनसांख्यिकीय नमूना में कम सटीकता)।
  • मापन पूर्वाग्रह: लेबल स्वयं पक्षपाती होते हैं (उदाहरण के लिए, यदि "अच्छे कर्मचारी" की परिभाषा पिछले पदोन्नति निर्णयों पर आधारित है)।
  • एकत्रीकरण पूर्वाग्रह: क्योंकि डेटा एक विशिष्ट चैनल से आता है, यह ब्रह्मांड का प्रतिनिधि नहीं है।

मॉडल सिर्फ इन पूर्वाग्रहों को नहीं सीखता है; इसे स्वचालित करके स्केल किया जाता है। एक व्यक्ति का पक्षपातपूर्ण निर्णय दूसरे व्यक्ति को प्रभावित करता है; एक पक्षपाती मॉडल का फैसला लाखों का होता है।

सावधानी: यह कहने की गलती न करें कि "मॉडल तटस्थ है क्योंकि यह सिर्फ गणित है।" मॉडल डेटा में मानवीय पूर्वाग्रह को सीखता है और स्वचालित करता है। तटस्थता कोई डिफ़ॉल्ट नहीं है, बल्कि एक परिणाम है जिसे मापा और सुनिश्चित किया जाना चाहिए।

न्याय को मापना

न्याय का प्रबंध करने के लिए सबसे पहले उसे मापना आवश्यक है। ऐसा करने के लिए, उपसमूह के आधार पर मॉडल का मूल्यांकन करें: क्या सटीकता, रिकॉल, झूठी सकारात्मक दर जैसे मेट्रिक्स विभिन्न जनसांख्यिकीय समूहों में समान हैं? न्याय की कुछ अवधारणाएँ:

  • समूह निष्पक्षता: क्या मॉडल विभिन्न समूहों के साथ समान दरों पर सही/गलत व्यवहार करता है?
  • अवसर की समानता: क्या मॉडल वास्तव में सकारात्मक लोगों को सभी समूहों में समान रूप से कैप्चर करता है (समान स्मरण)?

महत्वपूर्ण तथ्य: न्याय की विभिन्न परिभाषाएँ एक ही समय में संतुष्ट नहीं हो सकती हैं (यह एक गणितीय परिणाम है)। इस संदर्भ में न्याय की कौन सी परिभाषा को प्राथमिकता दी जाती है, यह एक नैतिक और व्यावसायिक निर्णय है, तकनीकी नहीं, और हितधारकों के साथ मिलकर बनाया गया है।

कमजोर दृष्टिकोण/मजबूत दृष्टिकोण

ख़राब: "मॉडल की समग्र सटीकता 88% है, जो उचित है।"

गुक्लु: "कुल सटीकता 88% थी, लेकिन जब हमने इसे उपसमूहों में विभाजित किया, तो एक समूह में रिकॉल 91% और दूसरे समूह में 67% था - मॉडल व्यवस्थित रूप से उस समूह को गायब कर रहा था। हमने कारण (प्रतिनिधित्व की कमी) का दस्तावेजीकरण किया, उस समूह के लिए डेटा एकत्र किया और समान-रिकॉल लक्ष्य के साथ इसका पुनर्मूल्यांकन किया। हमने हितधारकों के साथ निर्णय लिया कि हम निष्पक्षता की किस परिभाषा को प्राथमिकता देंगे।"

अंतर: मजबूत दृष्टिकोण सामान्य मीट्रिक के पीछे नहीं छिपता, यह उपसमूहों को अलग करता है और निष्पक्षता को एक खुले निर्णय के रूप में मानता है।

नैतिकता और पारदर्शिता

जिम्मेदार AI के मूल सिद्धांत हैं:

  • स्पष्टीकरण: क्या यह बताया जा सकता है कि मॉडल ने यह निर्णय क्यों लिया? उच्च प्रभाव वाले निर्णयों (क्रेडिट, नियुक्ति, स्वास्थ्य देखभाल) में किसी को स्पष्टीकरण का अधिकार है। इन क्षेत्रों में अस्पष्टीकृत मॉडल का उपयोग नहीं किया जाना चाहिए या किसी व्याख्या योग्य विधि द्वारा समर्थित होना चाहिए।
  • मानवीय निरीक्षण: उच्च प्रभाव वाले निर्णय स्वचालित रूप से नहीं लिए जाने चाहिए; मॉडल सुझाव देता है, मानव पुष्टि करता है।
  • जवाबदेही: यह स्पष्ट होना चाहिए कि जब मॉडल कोई त्रुटि करता है तो कौन जिम्मेदार है। "मॉडल ने निर्णय लिया" कोई बहाना नहीं है।
  • पारदर्शिता: उपयोगकर्ता को पता होना चाहिए कि वे एआई के साथ बातचीत कर रहे हैं और उनके डेटा का उपयोग कैसे किया जाता है।

कई देशों और क्षेत्रों में, ये सिद्धांत कानून (उच्च जोखिम वाले एआई सिस्टम के लिए पारदर्शिता, ऑडिटिंग और मानव निरीक्षण दायित्व) में भी अंतर्निहित हैं। इंजीनियर अपने क्षेत्र के नियमों को जानने के लिए जिम्मेदार है।

युक्ति: प्रत्येक उच्च-प्रभाव वाले मॉडल के लिए एक "मॉडल कार्ड" रखें: मॉडल क्या करता है, इसे किस डेटा पर प्रशिक्षित किया गया था, यह किन समूहों में कितना अच्छा/खराब काम करता है, इसकी ज्ञात सीमाएँ क्या हैं। यह दस्तावेज़ पारदर्शिता और जवाबदेही दोनों उपकरण है।

लागत और स्थिरता

एआई सस्ता नहीं है. लागत का प्रबंधन दो आयामों में किया जाता है:

वित्तीय लागत:

  • टोकन लागत (एलएलएम): प्रत्येक अनुरोध और प्रतिक्रिया में टोकन की लागत होती है; जैसे-जैसे वॉल्यूम बढ़ता है, बिल बढ़ता है। अनावश्यक रूप से लंबे संकेत, अत्यधिक बड़े मॉडल चयन और अनियंत्रित एजेंट लूप (यूनिट 5) लागत को बढ़ाते हैं।
  • प्रशिक्षण और होस्टिंग: फाइन-ट्यूनिंग और मॉडल प्रस्तुति में हार्डवेयर लागत लगती है।
  • अनुकूलन: यदि छोटा मॉडल पर्याप्त है तो बड़े मॉडल का उपयोग न करें; कैश अक्सर पूछे जाने वाले प्रश्न; संकेत को छोटा करें; जो संसाधित किया जा सकता है उसे बैचें।

पर्यावरणीय लागत: बड़े मॉडल प्रशिक्षण और अनुमान में महत्वपूर्ण ऊर्जा की खपत होती है। स्थिरता अनावश्यक गणनाओं (सही आकार मॉडल, कुशल वास्तुकला) से बचने को एक पेशेवर जिम्मेदारी बनाती है।

युक्ति: लागत अनुकूलन का पहला नियम: "इस कार्य के लिए सबसे छोटा पर्याप्त मॉडल क्या है?" सबसे शक्तिशाली मॉडल को हर जगह रखना हथौड़े से कील ठोंकने जैसा है - महंगा और अनावश्यक।

तीन मिनी मामले

केस 1 - छिपा हुआ भेदभाव। एक भर्ती स्क्रीनिंग मॉडल कुल मिलाकर अच्छा लग रहा था। उपसमूह विश्लेषण में पाया गया कि मॉडल ने व्यवस्थित रूप से महिला उम्मीदवारों को रेखांकित किया क्योंकि ऐतिहासिक डेटा पुरुष-प्रधान था - इसने ऐतिहासिक पूर्वाग्रह सीखा था। मॉडल को रोक दिया गया, डेटा संतुलित किया गया और निष्पक्षता मेट्रिक्स की निगरानी की गई। सामान्य धार्मिकता ने छुपे हुए भेदभाव को ढक दिया।

केस 2 - अस्पष्टीकृत अस्वीकृति। एक क्रेडिट मॉडल आवेदनों को अस्वीकार कर रहा था, लेकिन कोई भी इसका कारण नहीं बता सका। जब एक ग्राहक ने कानूनी स्पष्टीकरण का अनुरोध किया, तो टीम जवाब देने में असमर्थ थी। मॉडल को उच्च-प्रभाव वाले निर्णयों में उपयोग से तब तक वापस ले लिया गया जब तक कि एक समझाने योग्य विधि नहीं जोड़ी गई और प्रत्येक अस्वीकृति के लिए औचित्य उत्पन्न नहीं किया गया। पाठ: उच्च प्रभाव वाले निर्णय लेने में व्याख्यात्मकता आवश्यक है।

केस 3 - बिल का झटका। एक टीम प्रत्येक अनुरोध के लिए सबसे बड़े एलएलएम और बहुत लंबे संकेतों का उपयोग कर रही थी। मासिक बिल अप्रत्याशित रूप से बढ़ गया है. पोस्ट विश्लेषण: अधिकांश अनुरोधों को एक छोटे मॉडल के साथ हल किया जा सकता था, आधे संकेत अनावश्यक थे, और लगातार प्रश्नों को कैश किया जा सकता था। इन तीन अनुकूलनों ने गुणवत्ता से समझौता किए बिना, लागत को काफी कम कर दिया। सीख: हर जगह सबसे ताकतवर मॉडल जरूरी नहीं है.

कॉपी करने योग्य टेम्पलेट

पूर्वाग्रह/निष्पक्षता के लिए इस मॉडल का मूल्यांकन करने में मेरी सहायता करें। मुझे किन उपसमूहों (जनसांख्यिकीय/खंड) को विभाजित और मापना चाहिए? मुझे किस मेट्रिक्स (सटीकता, रिकॉल, समूह द्वारा गलत सकारात्मक दर) की तुलना करनी चाहिए? क्या निष्पक्षता की विभिन्न परिभाषाएँ विरोधाभासी हो सकती हैं, इस संदर्भ में मुझे किसे प्राथमिकता देनी चाहिए और क्यों? मॉडल/निर्णय संदर्भ: [स्पष्टीकरण]

इस उच्च प्रभाव वाले मॉडल के लिए एक ड्राफ्ट मॉडल कार्ड तैयार करें। इसमें शामिल होना चाहिए: उद्देश्य, प्रशिक्षण डेटा और तिथि, उपसमूहों में प्रदर्शन, ज्ञात सीमाएं, उचित/अनुचित उपयोग, व्याख्यात्मक स्थिति, मानव निरीक्षण का बिंदु। मॉडल: [विवरण]

गुणवत्ता से समझौता किए बिना, इस एलएलएम कार्यान्वयन की लागत को कम करने में मेरी सहायता करें। उपलब्ध: मॉडल आकार, औसत प्रॉम्प्ट लंबाई, अनुरोध मात्रा, क्या कैश है? मूल्यांकन करें: 1) क्या छोटा मॉडल पर्याप्त है (किन कार्यों के लिए)? 2) क्या प्रॉम्प्ट को छोटा किया जा सकता है? 3) क्या लगातार अनुरोधों को कैश किया जा सकता है? 4) क्या बैच के लिए काम उपलब्ध है? प्रत्येक सुझाव का अनुमानित प्रभाव लिखें।

इस उच्च-प्रभाव निर्णय प्रणाली के लिए एक नैतिकता/जिम्मेदारी चेकलिस्ट तैयार करें। - स्पष्टीकरण: क्या निर्णय का औचित्य उत्पन्न किया जा सकता है? - मानवीय निरीक्षण: क्या उच्च प्रभाव वाला निर्णय अनुमोदन के अधीन है? - जवाबदेही: त्रुटि के मामले में कौन जिम्मेदार है? - पारदर्शिता: क्या उपयोगकर्ता जानता है कि एआई का उपयोग किया जा रहा है? - विनियमन: इसमें कानूनी दायित्व क्या शामिल हैं? प्रणाली: [विवरण]

पूर्वाग्रह स्रोत तालिका

स्रोत

लक्षण

एहतियात

ऐतिहासिक पूर्वाग्रह

पिछला भेदभाव जारी है

डेटा ऑडिट + निष्पक्षता मीट्रिक

प्रतिनिधित्व पूर्वाग्रह

छोटे नमूना समूह में कम सटीकता

उपसमूह विश्लेषण + संतुलन

माप पूर्वाग्रह

पक्षपाती लेबल

लेबल प्रक्रिया की समीक्षा

एकत्रीकरण पूर्वाग्रह

ब्रह्मांड का प्रतिनिधित्व नहीं किया गया है

संसाधन विविधीकरण

सामान्य गलतियाँ

  • समग्र मीट्रिक पर भरोसा करना। उपसमूह विश्लेषण के बिना छिपे हुए भेदभाव को नहीं देखा जा सकता है।
  • "मॉडल तटस्थ" मानते हुए। मॉडल डेटा में पूर्वाग्रह सीखता है और बढ़ाता है।
  • उच्च प्रभाव वाले निर्णय को अस्पष्टीकृत मॉडल पर छोड़ना। कानूनी और नैतिक जोखिम.
  • मानवीय पर्यवेक्षण को दरकिनार करना। "मॉडल ने निर्णय लिया" कोई बहाना नहीं है।
  • हर जगह सबसे बड़ा मॉडल लगाना. अनावश्यक लागत और ऊर्जा.
  • लागत पर नज़र नहीं रखना. बिल चुपचाप फूल जाता है.

संक्षेप में

तकनीकी रूप से सही मॉडल तब भी असफल है यदि वह निष्पक्ष, समझाने योग्य और टिकाऊ नहीं है। पूर्वाग्रह अधिकतर डेटा से आता है और मॉडल इसे बड़े पैमाने पर बढ़ाता है; उपसमूहों द्वारा निष्पक्षता को मापें और हितधारकों से सहमत हों कि निष्पक्षता की किस परिभाषा को प्राथमिकता दी जाए। उच्च प्रभाव वाले निर्णयों में व्याख्यात्मकता, मानवीय निरीक्षण और जवाबदेही आवश्यक हैं; मॉडल कार्ड के साथ दस्तावेज़ पारदर्शिता. लागत और ऊर्जा प्रबंधित करें: सबसे छोटा पर्याप्त मॉडल चुनें, प्रॉम्प्ट को छोटा करें, कैश और बैच का उपयोग करें। ये आयाम इंजीनियरिंग गुणवत्ता के अभिन्न अंग हैं, बाद में जोड़े गए तामझाम नहीं।

आवेदन कार्य

एक मॉडल को कम से कम दो उपसमूहों में विभाजित करें और समूह के आधार पर रिकॉल और झूठी सकारात्मक दर की तुलना करें; यदि कोई महत्वपूर्ण अंतर हो तो कारण एवं सावधानी लिखें। एक उच्च-प्रभाव वाले मॉडल (उद्देश्य, डेटा, उपसमूह प्रदर्शन, सीमाएँ, व्याख्यात्मकता) के लिए एक संक्षिप्त मॉडल कार्ड का मसौदा तैयार करें। एलएलएम को लागू करने की लागत को कम करने और उनके अनुमानित प्रभाव को लिखने के लिए कम से कम दो ठोस अनुकूलन (न्यूनतम / त्वरित ट्रंकेशन / कैश / बैच) की पहचान करें।

चेकलिस्ट

  • [ ] मैंने उपसमूहों के आधार पर मॉडल का मूल्यांकन किया, मैंने सामान्य मीट्रिक पर भरोसा नहीं किया।
  • [ ] मैंने हितधारकों के साथ निर्णय लिया कि मैं न्याय की किस परिभाषा को प्राथमिकता दूंगा।
  • [ ] उच्च प्रभाव वाला निर्णय व्याख्या योग्य है और मानवीय अनुमोदन के अधीन है।
  • [ ] मैंने पैटर्न कार्ड के साथ पारदर्शिता और सीमाओं का दस्तावेजीकरण किया।
  • [ ] मैंने सबसे छोटा पर्याप्त मॉडल चुना; मैंने प्रॉम्प्ट/कैश/बैच को अनुकूलित किया है।
  • [ ] मैं लागत और ऊर्जा प्रभाव की निगरानी करता हूं।