एकाइहरू
1. जीवविज्ञानमा कृत्रिम बुद्धिमत्ताको परिचय: भूमिका, सीमा, प्रमाणीकरण र नैतिकता 2. पाइथनको साथ जैविक डेटा विश्लेषण आधारभूत कुराहरू 3. अनुक्रम विश्लेषण र जैव सूचना विज्ञान: डीएनए, आरएनए र प्रोटीन 4. ओमिक्स डाटा र उच्च आयामी विश्लेषण 5. प्रोटीन संरचना र अल्फाफोल्ड: जीवविज्ञानमा कृत्रिम बुद्धिमत्ताको विजय 6. छवि विश्लेषण र प्रकार/सेल पहिचान 7. प्रायोगिक डिजाइन: कृत्रिम बुद्धिमत्ताको साथ ठोस योजना स्थापना गर्दै 8. डाटा विश्लेषण र सांख्यिकीय प्रमाणीकरण 9. वैज्ञानिक भिजुअलाइजेशन: डेटा इमानदारीपूर्वक र बुझ्न योग्य रूपमा प्रदर्शन गर्दै 10. साहित्य समीक्षा र वैज्ञानिक लेखन 11. नैतिकता, जैविक सुरक्षा, गोपनीयता र वैज्ञानिक अखण्डता
एकाइ 11 / 11

नैतिकता, जैविक सुरक्षा, गोपनीयता र वैज्ञानिक अखण्डता

लाभ:

  • KVKK, GDPR र नैतिकता समिति नियमहरू अनुसार संवेदनशील मानव/आनुवंशिक डेटाको सुरक्षा गर्ने क्षमता र तिनीहरूलाई खुला मोडेलमा दिनबाट बच्न।
  • जैवसुरक्षा/दोहोरो प्रयोग र जनसंख्या पूर्वाग्रहको जोखिमहरू मूल्याङ्कन गरेर परिणामहरूको वैधतामा प्रश्न गर्ने क्षमता
  • नैतिक जिम्मेवारी गाडीमा सुम्पन सकिँदैन र त्यो अर्थपूर्ण मानव-इन-द-लूप आवश्यक छ भन्ने कुरा बुझ्दै

जीवविज्ञानमा कृत्रिम बुद्धिमत्ताको प्रयोगलाई जिम्मेवारीपूर्वक प्रयोग गरेर पूरक हुन्छ। जीवविज्ञान एक संवेदनशील क्षेत्र हो जसले मानव स्वास्थ्य, आनुवंशिक गोपनीयता, वातावरण र जैविक सुरक्षालाई छुन्छ। यस इकाईमा, हामी जैविक अध्ययनहरूमा कृत्रिम बुद्धिमत्ता प्रयोग गर्दा तपाईंले सामना गर्नुपर्ने नैतिक, कानुनी र सुरक्षा जिम्मेवारीहरूबारे छलफल गर्नेछौं। यो एकाइ अघिल्लो सबै एकाइहरूमा प्रमाणिकरण र इमानदारीको सिद्धान्तहरूमा निर्मित फ्रेमवर्क हो।

आधारभूत सिद्धान्त: एआई एक उपकरण हो; नैतिक उत्तरदायित्व सधैं मानिसमा हुन्छ। "सुझाव गरिएको मोडेल" कुनै बहाना होइन।

जिम्मेवारीका चार क्षेत्र

1. डाटा गोपनीयता र मानव डाटा

मानव सहभागीहरूबाट आनुवंशिक, क्लिनिकल वा स्वास्थ्य डेटा अत्यन्त संवेदनशील छ। एक व्यक्तिको डीएनए अनुक्रमले उनीहरूको र उनीहरूका आफन्तहरूको रोग जोखिम र पहिचान प्रकट गर्न सक्छ; जीनोमिक डेटालाई पनि गुमनाम मानिएको पुन: पहिचान गर्न सकिन्छ। सार्वजनिक रूपमा उपलब्ध एआई मोडेलमा यो डाटा टाँस्दा डाटा सुरक्षा कानून (Türkiye मा KVKK, युरोपमा GDPR) र नैतिकता बोर्ड (IRB/एथिक्स समिति) स्वीकृतिहरू उल्लङ्घन हुन सक्छ।

  • खुला मोडेलमा व्यक्तिगत/क्लिनिकल डाटा प्रदान नगर्नुहोस्।
  • सहमतिको दायराभन्दा बाहिर प्रयोग नगर्नुहोस्; सहभागीले के स्वीकार गरे?
  • उद्यम/स्थानीय (अन-प्रिमाइस) वा डेटा प्रशोधन सम्झौता उपकरणहरूको लागि अप्ट गर्नुहोस्।

2. जैविक सुरक्षा र दोहोरो प्रयोग

केहि जैविक जानकारी "दोहोरो प्रयोग" हो: यो उपयोगी र हानिकारक दुवै हुन सक्छ; उदाहरणका लागि, रोगजनक (रोग निम्त्याउने) अनुक्रम, विष उत्पादन। खतरनाक रोगजनकहरू बढाउने वा हानिकारक जैविक एजेन्टहरू डिजाइन गर्ने बारे जानकारीको लागि AI लाई सोध्नु धेरै ठाउँहरूमा अनैतिक र अवैध छ।

  • खतरनाक दोहोरो-प्रयोग अनुरोधहरू नगर्नुहोस्।
  • आफ्नो संस्थाको बायोसेफ्टी बोर्ड (IBC) दिशानिर्देशहरू पालना गर्नुहोस्।

3. वैज्ञानिक अखण्डता

हामीले अघिल्लो एकाइहरूमा देखेका सबै कुराहरू यहाँ सँगै आउँछन्: कुनै नकली एट्रिब्युसन छैन, कुनै डाटा ब्यूटिफिकेशन छैन, कुनै पी-ह्याकिंग छैन, कुनै छनौट रिपोर्टिङ छैन। कृत्रिम बुद्धिले यी सजिलो वा कठिन बनाउन सक्छ; फरक तपाईको इमानदारीमा छ।

  • सबै परिणामहरू रिपोर्ट गर्नुहोस् (नकारात्मक सहित)।
  • कृत्रिम बुद्धिमत्ताको प्रयोग घोषणा गर्नुहोस्।
  • कच्चा डाटा र कोड (यदि सम्भव भएमा) साझेदारी गरेर पुन: उत्पादन क्षमतालाई समर्थन गर्नुहोस्।

४. पूर्वाग्रह र निष्पक्षता

एआई मोडेलहरूले डेटाको पूर्वाग्रहहरू बोक्छन् जसमा उनीहरूलाई तालिम दिइन्छ। जीनोमिक डाटाबेसहरू मुख्यतया युरोपेली मूलको जनसंख्याबाट आउँछन्; यसले अन्य जनसंख्यामा गरिब भविष्यवाणीहरू निम्त्याउँछ। एउटा छवि मोडेलले प्रशिक्षण डेटामा कम प्रतिनिधित्व गरेको अवस्थामा खराब प्रदर्शन गर्न सक्छ।

  • कुन जनसङ्ख्या/डेटामा मोडेललाई तालिम दिइएको थियो भन्ने प्रश्न गर्नुहोस्।
  • मूल्याङ्कन गर्नुहोस् कि परिणामहरू सबै समूहहरूमा राख्छन्।
सुझाव: आफैलाई सोध्नुहोस्: "यदि मैले यो डेटा मोडेललाई दिन्छु भने, यो कसको हो र त्यो व्यक्तिले अनुमति दियो?" यदि जवाफ अस्पष्ट छ भने, यसलाई नदिनुहोस्। गोपनीयताको उल्लङ्घन अपरिवर्तनीय छ।

चरणबद्ध रूपमा: जिम्मेवार एआई नियन्त्रण

  1. डाटा स्रोत वर्गीकृत गर्नुहोस्: व्यक्तिगत/संवेदनशील वा सार्वजनिक?
  2. सहमति र अनुमतिहरू जाँच गर्नुहोस्: के यो प्रयोग कभर गरिएको छ?
  3. सही उपकरण छनौट गर्नुहोस्: संवेदनशील डेटाको लागि सुरक्षित/स्थानीय वातावरण।
  4. दोहोरो प्रयोगको जोखिमलाई विचार गर्नुहोस्।
  5. प्रश्न पूर्वाग्रह: के परिणाम सबै समूहहरूमा मान्य छ?
  6. कागजात र प्रयोग घोषणा गर्नुहोस्।

प्रतिलिपि गर्न मिल्ने प्रम्प्ट टेम्प्लेटहरू

नैतिक परिप्रेक्ष्यबाट तलको मेरो विश्लेषण योजनाको समीक्षा गर्नुहोस्: डेटा गोपनीयता, सहभागी सहमति, सम्भावित पूर्वाग्रह, र दोहोरो प्रयोगको जोखिम सम्बन्धी सावधानीहरू सूचीबद्ध गर्नुहोस्। योजना: [पाठ] (नोट: म वास्तविक बिरामी डेटा साझा गरिरहेको छैन, केवल योजना।)

यो जीनोमिक डेटासेट प्रयोग गर्नु अघि मैले कुन गोपनीयता र सहमति प्रश्नहरूको जवाफ दिनुपर्छ? KVKK/GDPR र नैतिकता समितिको सन्दर्भमा चेकलिस्ट तयार गरिएको छ।

मैले मेरो लेखको विधि खण्डमा प्रयोग गरेको कृत्रिम बुद्धिमत्ता उपकरणलाई कसरी पारदर्शी रूपमा घोषणा गर्नुपर्छ? एक उदाहरण घोषणात्मक वाक्य लेख्नुहोस्; कुन जानकारी (उपकरण, संस्करण, प्रयोगको दायरा) यसमा समावेश हुनुपर्छ?

यस मोडेलका नतिजाहरूमा जनसंख्या पूर्वाग्रह छ कि छैन भनेर म कसरी मूल्याङ्कन गर्छु? मैले प्रशिक्षण डेटा र जाँचका चरणहरू बारे सोध्नु पर्ने प्रश्नहरूको सूची बनाउनुहोस्।

कमजोर प्रम्प्ट / बलियो प्रम्प्ट

कमजोर: "निम्न बिरामीको आनुवंशिक डाटा विश्लेषण गर्नुहोस्: [वास्तविक डाटा]।"

Güçlü: "म क्लिनिकल जीनोमिक डेटा संग काम गर्ने एक विश्लेषण योजना सेट अप गर्दैछु, तर म वास्तविक रोगी डाटा साझा गर्दिन। केवल एक पद्धतिगत दृष्टिकोणबाट: मैले कुन गोप्यता उपायहरू लिनु पर्छ, कुन वातावरणमा मैले डाटा प्रशोधन गर्नुपर्छ, कुन स्वीकृति र नैतिकता समितिका सर्तहरू पूरा गर्नुपर्छ? तपाईंले डमी/नमूना डाटाको साथ प्रवाह देखाउन सक्नुहुन्छ।"

भिन्नता: शक्तिशाली प्रम्प्टमा कुनै वास्तविक संवेदनशील डाटा साझेदारी गरिएको छैन; विधि मात्र सोधिन्छ। गोपनीयता कायम राखिएको छ, मोडेल अझै पनि मद्दत गर्छ।

तीन मिनी केसहरू

केस 1 - गोपनीयता उल्लङ्घन: एक अनुसन्धानकर्ताले यसलाई विश्लेषण गर्नको लागि खुला मोडेलमा अज्ञात रोगी एक्सोम डेटा हो भनेर सोचेको कुरा टाँस्यो। जब नैतिकता समितिले यो थाहा पाए, अध्ययन निलम्बित गरियो; त्यहाँ कुनै डाटा प्रोसेसिंग सम्झौता थिएन। पाठ: संवेदनशील डेटा कहिल्यै खुला मोडेलमा प्रवेश गर्दैन।

केस 2 — जनसंख्या पूर्वाग्रह: एक पोलिजेनिक जोखिम स्कोर उपकरण युरोपेली मूल को डेटा मा प्रशिक्षित गरिएको थियो; अर्को जनसंख्यामा, जोखिम अनुमानहरू उल्लेखनीय रूपमा गलत थिए। जब मोडेलले प्रशिक्षण डेटाको संरचनामा प्रश्न उठाउने सुझाव दियो, टोलीले त्यो जनसंख्यामा उपकरण प्रयोग नगर्ने निर्णय गर्‍यो। पाठ: पूर्वाग्रहले जीवन बचाउँछ वा हानि गर्छ।

केस ३ — खुलासा र पारदर्शिता: एउटा टोलीले AI सँग डाटा क्लिनिङ कोड लेख्यो र यसलाई विधि खण्डमा स्पष्ट रूपमा बताए। उनले कोड पनि साझा गरे। समीक्षकहरूले यसलाई स्वागत गरे किनभने पुनरावृत्ति बलियो थियो। पाठ: पारदर्शिताले विश्वास पैदा गर्छ।

तुलना चार्ट

क्षेत्र

सुरक्षित व्यवहार

जोखिमपूर्ण व्यवहार

बिरामी डाटा

स्थानीय/सुरक्षित वातावरण

मोडेल खोल्न टाँस्नुहोस्

सहमति

दायरा भित्र प्रयोग गर्नुहोस्

दायरा भन्दा बढि नगर्नुहोस्

जैविक सुरक्षा

दोहोरो प्रयोगबाट बच्ने

खतरनाक माग

अखण्डता

सबै परिणामहरू रिपोर्ट गर्नुहोस्

छनौट रिपोर्टिङ

पूर्वाग्रह

जनसंख्या सोध्नुहोस्

अन्धाधुन्ध लागू गर्नुहोस्

पारदर्शिता

उपयोग घोषणा गर्नुहोस्

लुकाउने

सामान्य गल्तीहरू

  • खुला मोडेलमा संवेदनशील डेटा दिँदै: अपरिवर्तनीय गोपनीयता उल्लङ्घन।
  • सहमतिको दायरा भन्दा बढि: प्रयोग गर्नुहोस् सहभागी द्वारा अधिकृत छैन।
  • पूर्वाग्रहलाई बेवास्ता गर्दै: सबै समूहहरूमा परिणामहरू सामान्यीकरण।
  • लुकाउने प्रयोग: एआई योगदान घोषणा गर्दैन।
  • "मोडेलले सुझाव दियो" प्रतिरक्षा: गाडीलाई जिम्मेवारी दिने।
सावधानी: उच्च परिणाम जैविक कार्यमा (क्लिनिकल निर्णय, जैव सुरक्षा, मानव डेटा) AI आउटपुट सक्षम विशेषज्ञ प्रमाणीकरण र नैतिक निरीक्षण को विकल्प होइन; यसले मात्र गति दिन्छ। निर्णयको नैतिक र वैज्ञानिक नतिजाहरूको साथसाथै अन्तिम जिम्मेवारी सधैं मानिसको साथमा हुन्छ।

वातावरण, पारिस्थितिकी र परम्परागत ज्ञान

नैतिक जिम्मेवारी मानव डेटा मा सीमित छैन। इकोलोजी र संरक्षण जीवविज्ञानमा कृत्रिम बुद्धिमत्ता प्रयोग गर्दा सावधानी पनि आवश्यक छ। उदाहरणका लागि, लोपोन्मुख प्रजातिको सटीक स्थान डेटा (क्यामेरा ट्र्याप समन्वय) सिकारीको जोखिमको कारणले संवेदनशील हुन्छ; यो डाटा खुला मोडेल वा सार्वजनिकमा जारी गर्दा प्रजातिहरूलाई हानि हुन सक्छ। त्यसैगरी, स्थानीय समुदायको परम्परागत जैविक ज्ञान (जस्तै बिरुवाको प्रयोग) बिना अनुमति प्रयोग गर्दा नैतिक र कानुनी (जस्तै नागोया प्रोटोकल) समस्याहरू उत्पन्न हुन्छन्। डाटा प्रयोग गर्नु अघि, "यो जानकारी कसको हो र यसको खुलासाबाट कसलाई नोक्सान हुन्छ?" सधैं प्रश्न सोध्नुहोस्।

मानव निरीक्षण र अन्तिम निर्णय

यस सम्पूर्ण मोड्युलको सार एउटै सिद्धान्तमा उबलिन्छ: अर्थपूर्ण मानव निरीक्षण। AI ले सुझाव उत्पादन गर्छ, मस्यौदा लेख्छ, ढाँचा देखाउँछ; तर जैविक, नैदानिक ​​वा नैतिक निर्णय कहिल्यै सीधै मोडेल आउटपुटमा आधारित हुँदैन। विशेष गरी उच्च जोखिम क्षेत्रहरूमा (निदान, उपचार, प्रजाति संरक्षण निर्णय, रिलीज), मोडेलको भूमिका निर्णय लिनु होइन, तर विशेषज्ञको निर्णयलाई गति दिनु हो। "मानव-इन-द-लूप" दृष्टिकोण नारा होइन, तर आवश्यकता हो।

यो निगरानी काम गर्नको लागि, पर्यवेक्षक सक्षम हुनुपर्छ। अन्धो सहमति ("मोडेलले भने, स्वीकृति") निरीक्षण होइन। साँचो निरीक्षणको लागि विशेषज्ञता चाहिन्छ जसले आउटपुटलाई प्रश्न गर्न सक्छ, यसको त्रुटि समात्न सक्छ, र आवश्यक पर्दा अस्वीकार गर्न सक्छ। त्यसकारण, कृत्रिम बुद्धिमत्ताले विशेषज्ञलाई प्रतिस्थापन गर्दैन; यसले विशेषज्ञलाई अझ अपरिहार्य बनाउँछ। जसले गाडीलाई राम्रोसँग प्रयोग गर्छ उसले यसलाई नियन्त्रण गर्न सक्छ।

संक्षेपमा

जीवविज्ञानमा AI को जिम्मेवार प्रयोगले चार क्षेत्रहरू समेट्छ: डेटा गोपनीयता (संवेदनशील मानव डेटाको सुरक्षा), जैविक सुरक्षा (दोहोरो प्रयोगबाट जोगिन), वैज्ञानिक अखण्डता (इमानदार र पूर्ण रिपोर्टिङ) र पूर्वाग्रह जागरूकता (सबै समूहहरूमा परिणामहरूको वैधता)। खुला मोडेलमा संवेदनशील डाटा प्रदान नगर्नुहोस्, पारदर्शी रूपमा प्रयोग घोषणा गर्नुहोस्, जनसंख्या पूर्वाग्रह प्रश्न गर्नुहोस्। एजेन्टलाई नैतिक जिम्मेवारी कहिल्यै सुम्पिन सकिँदैन; यो सधैं मानिसमा हुन्छ।

आवेदन कार्य

तपाईंको आफ्नै कार्यस्थानबाट एक परिदृश्यलाई विचार गर्नुहोस् (जस्तै मानव डेटासेट वा छवि मोडेल प्रयोग गरेर)। AI लाई वास्तविक डाटा साझेदारी नगरी यस परिदृश्य (गोपनीयता, सहमति, पूर्वाग्रह, दोहोरो प्रयोग, पारदर्शिता) को नैतिक चेकलिस्टको साथ आउन दिनुहोस्। प्रत्येक वस्तुको लागि, यसलाई तपाईंको परिस्थितिमा "उपयुक्त/जोखिमपूर्ण/अनिश्चित" भनी चिन्ह लगाउनुहोस् र जोखिमपूर्ण/अनिश्चित भएकाहरूका लागि कार्य योजना लेख्नुहोस्। तपाईंको लेखको लागि AI प्रयोग कथन ड्राफ्ट पनि राख्नुहोस्।

चेकलिस्ट

  • [ ] मैले खुला मोडेलमा संवेदनशील/व्यक्तिगत डाटा उपलब्ध गराएको छैन।
  • [] मैले सहमति र नैतिकता समितिको दायरा जाँच गरें।
  • [] मैले दोहोरो प्रयोग/बायोसेक्युरिटी जोखिमको मूल्याङ्कन गरेको छु।
  • [ ] मैले सबै परिणामहरू इमानदारीपूर्वक रिपोर्ट गरें।
  • [] मैले जनसंख्या/डेटा पूर्वाग्रहमा प्रश्न उठाएँ।
  • [] मैले पारदर्शी रूपमा कृत्रिम बुद्धिमत्ताको प्रयोग घोषणा गरेको छु र जिम्मेवारी लिएको छु।

मोड्युल परीक्षा

1. एक विद्यार्थीले भाषा मोडेललाई सोधे 'यो फास्टा फाइलमा कतिवटा स्ट्रिङ छन्?' उसले सोध्छ र मोडेलले '48' जवाफ दिन्छ। सबैभन्दा सही दृष्टिकोण कुन हो?

  • A) प्रत्यक्ष रूपमा मोडेल द्वारा दिइएको नम्बर 48 प्रयोग गर्दै; मोडेल भरपर्दो छ किनभने यसले फाइल देख्छ
  • ख) नम्बरलाई फेरि एकपटक सोध्नुहोस् र दुईवटा उत्तर एउटै भएमा सही भनी स्वीकार गर्नुहोस्
  • C) Biopython को साथ फाइल पढ्दै, कोड संग क्रम संख्या गणना र आउटपुट प्रयोग ✔
  • घ) फाइल म्यानुअल रूपमा खोलेर आँखाको निर्णयबाट गणना गर्ने

व्याख्या: गणना र मापन जस्ता निर्धारक कार्यहरू तपाईंले चलाउनुहुने कोडमा छोडिनुपर्छ, भाषा मोडेलमा होइन। मोडेलले नम्बरलाई 'सम्झना' गर्दैन, यसले सम्भाव्य मान उत्पादन गर्छ र गलत हुन सक्छ; Biopython जस्तै उपकरण संग गणना सही र पुन: उत्पादन योग्य परिणाम दिन्छ।

2. तपाईं माइक्रोस्कोप छविमा कक्षहरू गणना गर्न र प्रत्येकको क्षेत्रफल मापन गर्न चाहनुहुन्छ। यो कार्यको लागि सबैभन्दा उपयुक्त दृष्टिकोण के हो?

  • A) Cellpose/StarDist जस्ता विशेषज्ञ सेग्मेन्टेसन उपकरण प्रयोग गरी नतिजा म्यानुअल रूपमा प्रमाणित गर्ने ✔
  • B) छविलाई सामान्य भाषा मोडेलमा टाँस्नुहोस् र सोध्नुहोस् 'कति कक्षहरू छन्'
  • C) मोडेलमा छविको वर्णन गर्नुहोस् र अनुमानित संख्याको लागि सोध्नुहोस्
  • D) पिक्सेलको संख्यालाई कुनै पनि क्यालिब्रेसन बिना कक्षहरूको संख्याको रूपमा स्वीकार गर्दै

स्पष्टीकरण: सेल विभाजन र मापन सामान्य भाषा मोडेलको डोमेन होइन, तर विशेष छवि मोडेलहरू (सेलपोज, स्टारडिस्ट) यस कार्यको लागि विशेष रूपमा प्रशिक्षित। भाषा मोडेलले यी उपकरणहरूलाई कल गर्ने कोड लेख्छ; विशेषज्ञ मोडेलले मापन गर्दछ, र जीवविज्ञानीले परिणाम प्रमाणित गर्दछ।

3. एक स्नातक विद्यार्थीले आफ्नो थीसिस परिचयमा भाषा मोडेलद्वारा उत्पादित ८ स्रोतहरू थप्छन्। सल्लाहकारले पत्ता लगाए कि यी मध्ये 3 अवस्थित छैन। यो अवस्थालाई कसरी रोक्न सकिन्छ ?

  • क) मोडेललाई पुन: स्रोत उत्पादन गर्न सोधेर
  • B) केवल DOI को साथ उद्धरणहरू चयन गरेर (यदि त्यहाँ DOI छ भने, यो वास्तविक हो)
  • ग) मोडेललाई 'फिट' गर्न निर्देशन दिएर सूची अनुरोध गर्दै
  • D) PubMed/doi.org मा प्रत्येक उद्धरणलाई स्वतन्त्र रूपमा प्रमाणित गर्दै र उनले पढेका लेखहरू मात्र उद्धृत गर्दै ✔

स्पष्टीकरण: सामान्य भाषा मोडेलहरू साहित्य डेटाबेस होइनन्; वास्तविक रेकर्ड खोज्नुको सट्टा, यसले यथार्थवादी-ध्वनि एट्रिब्युसन (फब्रिकेटेड एट्रिब्युसन) 'उत्पन्न' गर्छ। PubMed/doi.org जस्ता स्रोतहरूमा स्वतन्त्र प्रमाणीकरण बिना प्रत्येक बाइलाइन र DOI प्रयोग गर्नु हुँदैन र वास्तवमा पढेका लेखहरू मात्र उद्धृत गर्दै।

४. आर्टिफिसियल इन्टेलिजेन्सद्वारा लेखिएको डाटा क्लिनिङ कोडको शुद्धता सुनिश्चित गर्ने सबैभन्दा शक्तिशाली तरिका के हो?

  • A) यदि कोड त्रुटि बिना काम गर्दछ भने, यसलाई सही रूपमा स्वीकार गर्नुहोस्।
  • ख) एउटा सानो ज्ञात नमूनाको साथ नतिजा परीक्षण गर्दै र assert ✔ को साथ अपेक्षा प्रमाणित गर्दै
  • ग) मोडेललाई सोध्नुहोस् 'के कोड सही छ?' सोध्दै र विश्वास गर्दै जवाफ 'हो'
  • D) कोड धेरै पटक चलाउनुहोस् र प्रत्येक पटक समान आउटपुट प्राप्त गर्नुहोस्

टिप्पणी: कोडले त्रुटिविना काम गरेकोले यो सही छ भन्ने होइन; 'त्रुटि बिना काम गर्ने गलत कोड' जीवविज्ञानमा सबैभन्दा खतरनाक अवस्था हो। एउटा सानो नमूनाको साथ परीक्षण गर्नु जसको नतिजा तपाईलाई पहिले नै थाहा छ र कोडमा अपेक्षालाई जोड दिनु भनेको मौन गलत नतिजाहरू विरुद्ध सबैभन्दा बलियो ढाल हो।

5. एक RNA-seq विश्लेषणमा, 20,000 जीनहरू परीक्षण गरिन्छ र 3,800 जीनहरू सुधार बिना p <0.05 सँग 'महत्वपूर्ण' पाइन्छ। यो निष्कर्षमा मुख्य समस्या के हो?

  • क) नमूनाहरूको संख्या धेरै छ, यसलाई घटाउनुपर्छ
  • B) p थ्रेसहोल्ड धेरै उच्च छ, 0.10 प्रयोग गरिएको हुनुपर्छ
  • C) बहु तुलना सुधार (FDR) प्रदर्शन गरिएको थिएन; त्यहाँ धेरै गलत सकारात्मक छन् ✔
  • घ) जीनको सट्टा नमूनाहरू परीक्षण गरिएको हुनुपर्छ

स्पष्टीकरण: जब तपाइँ हजारौं जीनहरू एक साथ परीक्षण गर्नुहुन्छ, धेरै जीनहरू संयोगले 'महत्वपूर्ण' देखिन्छन्, कुनै वास्तविक भिन्नता नभए पनि; यसलाई बहु तुलना समस्या भनिन्छ। समाधान बेन्जामिनी-होचबर्ग जस्ता विधिको साथ FDR (झूटा खोज दर) सुधार लागू गर्नु हो; सुधारको साथ, सूची सामान्यतया दसौं देखि केही सय जीनहरूमा घट्छ।

6. BLAST परिणाममा सबैभन्दा राम्रो खेलको E-value 2.0 छ। यसको मतलब के हो?

  • A) खेल सम्भवतः अनियमित छ; ✔ भरपर्दो मेल होइन
  • ख) युग्मन धेरै बलियो छ; ई-मान जति ठूलो हुन्छ, त्यति राम्रो हुन्छ
  • C) अनुक्रम 2% को दरमा मिल्यो
  • D) त्यहाँ दुई अनुक्रमहरू बीच 2 आधार भिन्नता छ

स्पष्टीकरण: E-value ले मेलको अपेक्षा यादृच्छिक भएको संकेत गर्दछ; सानो हुनु राम्रो हो। १ भन्दा ठुलो ई-मानले मिल्दो सम्भावित अनियमित छ भनी संकेत गर्छ। भरपर्दो खेलहरूको लागि, धेरै सानो थ्रेसहोल्डहरू जस्तै e <1e-5 सामान्यतया खोजिन्छ।

7. अल्फाफोल्ड मोडेलमा, प्रोटिनको टर्मिनल क्षेत्रले कम pLDDT स्कोर (<50) देखाउँछ। यस क्षेत्रलाई कसरी व्याख्या गर्नुपर्छ?

  • A) AlphaFold ले यस क्षेत्रमा त्रुटि गरेको छ, यो क्षेत्र विश्लेषणबाट हटाउनु पर्छ
  • ख) यो क्षेत्र निश्चित रूपमा अल्फा हेलिक्स हो
  • C) मोडेल पूर्ण रूपमा अविश्वसनीय छ, संरचना प्रयोग गर्नु हुँदैन
  • D) क्षेत्र सम्भवतः अनियमित / लोचदार छ; 'झूटा' भन्दा 'अस्पष्ट' को रूपमा व्याख्या गरिनु पर्छ ✔

विवरण: pLDDT प्रत्येक एमिनो एसिडको लागि स्थानीय आत्मविश्वास स्कोर हो; ५० भन्दा कम मानहरूले प्रायः साँच्चै अनियमित (लचिलो, गैर-स्थिर) क्षेत्रहरू प्रतिबिम्बित गर्दछ। यी क्षेत्रहरूलाई 'गलत अनुमान' को रूपमा स्वचालित रूपमा मेटाउन गलत छ; कम अंकलाई 'अनिश्चित/लचिलो' भनेर पढ्नुपर्छ र यसको जैविक महत्त्व मूल्याङ्कन गर्नुपर्छ।

8. एक शोधकर्ताले पिक्सेलमा मात्र सेल क्षेत्रहरू रिपोर्ट गर्दछ र परिणामहरू साहित्यसँग असंगत छन्। हराएको चरण के हो?

  • क) धेरै कक्षहरू गणना गरिएको हुनुपर्छ
  • B) स्केल क्यालिब्रेसन (पिक्सेल-देखि-माइक्रोमिटर रूपान्तरण) प्रदर्शन गरिएको थिएन, परिणामहरू भौतिक एकाइहरूमा रूपान्तरण गरिएको थिएन ✔
  • C) विभाजन उपकरण गलत छनोट गरिएको थियो
  • D) छवि रिजोल्युसन धेरै उच्च छ

स्पष्टीकरण: छविबाट भौतिक आकार निकाल्न स्केल क्यालिब्रेसन (प्रति पिक्सेल कति माइक्रोमिटर) आवश्यक छ। यदि यो चरण छोडियो भने मानहरू अतुलनीय रहन्छन्, माइक्रोस्कोप सेटिङमा निर्भर गर्दछ। क्षेत्रहरूलाई भौतिक एकाइहरू जस्तै वर्ग माइक्रोमिटरहरूमा रूपान्तरण गर्नुपर्छ।

9. एक विद्यार्थीले एउटै मुसाबाट 10 वटा टिस्यु नमूनाहरू लिन्छ र तथ्याङ्कमा 'n=10' प्रयोग गर्दछ। यो किन गलत छ?

  • A) 10 नमूनाहरू तथ्याङ्कहरूको लागि धेरै थोरै छन्, कम्तिमा 30 आवश्यक छ
  • ख) विभिन्न अंगहरूबाट टिस्यु नमूनाहरू लिनुपर्थ्यो
  • ग) यी १० उदाहरणहरू प्राविधिक पुनरावृत्ति हुन्; जैविक n अझै 1 हो, यो तथाकथित पुनरावृत्ति हो ✔
  • D) नमूनाहरू अमान्य छन् किनभने तिनीहरू एकै दिन लिइएका थिए

स्पष्टीकरण: एउटै व्यक्तिबाट दोहोर्याइएको मापन प्राविधिक दोहोरिने हो; जहाँ सांख्यिकीय n जैविक एकाइहरूको संख्या हो (यहाँ मुसाहरू)। प्राविधिक पुनरावृत्तिलाई जैविक (स्यूडोरेप्लिकेशन) को रूपमा विचार गर्दा गलत महत्त्व उत्पन्न हुन्छ। उचित डिजाइन भनेको धेरै व्यक्तिहरूसँग काम गर्नु हो।

10. एउटा विश्लेषणले p=0.03 फेला पार्यो। यो मूल्य को सही व्याख्या के हो?

  • क) यो वा धेरै चरम नतिजा देख्ने 3% मौका छ जब वास्तविकता मा कुनै फरक छैन ✔
  • ख) प्रभाव वास्तविक हुने सम्भावना 97% छ
  • C) शून्य परिकल्पना सत्य हुने सम्भावना 3% छ
  • D) परिणाम 97% दोहोर्याउन योग्य छ

स्पष्टीकरण: p-value 'परिकल्पना सत्य हो भन्ने सम्भावना' वा 'प्रभाव सत्य हो भन्ने सम्भावना' होइन। p-value भनेको वास्तवमा कुनै भिन्नता नभएको बेला देखाइएको भन्दा बढी वा चरमको रूपमा भिन्नता देख्ने सम्भावना हो। त्यसैले p=0.03 को मतलब 'प्रभाव 97% वास्तविक' होइन; परिणामहरू पनि प्रभाव आकार र विश्वास अन्तराल द्वारा मूल्याङ्कन गर्नुपर्छ।

11. प्रस्तुतीकरणमा, y-अक्षलाई 95-100 दायरामा कम्प्रेस गरेर दुई समूहहरू बीचको 3% भिन्नतालाई ठूलो रूपमा देखाइएको छ। यो के को उदाहरण हो?

  • ए) एक राम्रो दृश्य प्रविधि; भिन्नता हाइलाइट गर्दछ
  • B) Colorblind अनुकूल प्यालेट समस्या
  • सी) एक स्वीकार्य शैली विकल्प
  • D) एक भ्रामक र बेइमान चार्ट जसले काटिएको अक्षको साथ भिन्नता बढाइचढाइ गर्दछ ✔

स्पष्टीकरण: शून्यबाट अक्ष प्रारम्भ नगर्ने (काटिएको अक्ष) सानो भिन्नतालाई दृष्टिगत रूपमा बढाइचढाइ गरेर दर्शकलाई बहकाउँछ। यो इमानदारी को सिद्धान्त को उल्लङ्घन हो; विशेष गरी बार चार्टहरूमा, अक्ष शून्यबाट सुरु हुनुपर्छ र फरक यसको वास्तविक आकारसँग देखाइनुपर्छ।

12. एक अनुसन्धानकर्ताले यसलाई विश्लेषण गर्नको लागि एक सार्वजनिक भाषा मोडेलमा अज्ञात रोगी एक्सोम डाटालाई के सोच्दछ। यो व्यवहार किन समस्याग्रस्त छ?

  • क) कुनै समस्या छैन; यदि अज्ञात छ भने डाटा साझेदारी गर्न सकिन्छ
  • B) संवेदनशील बिरामी डेटा खुला मोडेलमा उपलब्ध गराउनु गोपनीयता र नैतिक/कानूनी (KVKK/GDPR) को उल्लङ्घन हो र यसलाई उल्टाउन सकिँदैन ✔
  • ग) यो समस्याग्रस्त छ किनभने विश्लेषण ढिलो हुनेछ
  • D) मोडेल समस्याग्रस्त छ किनभने यसले डेटा बुझ्न सक्दैन

विवरण: रोगी आनुवंशिक/क्लिनिकल डेटा अत्यन्त संवेदनशील छ; जीनोमिक डेटालाई पनि गुमनाम मानिएको पुन: पहिचान गर्न सकिन्छ। यो डाटा सार्वजनिक मोडेलमा उपलब्ध गराउनुले KVKK/GDPR र नैतिक समिति (IRB) को अनुमोदनहरूको उल्लङ्घन गर्छ र गोपनीयताको अपरिवर्तनीय उल्लङ्घन हो। संवेदनशील डाटा स्थानीय/सुरक्षित, अनुबंधित वातावरणमा प्रशोधन गरिनु पर्छ।

13. एउटा अध्ययनमा, उनीहरूले 'बिरामी बनाम नियन्त्रण' सोचेको भिन्नता वास्तवमा नमूनाहरू दुई फरक दिनमा प्रशोधन गरिएको कारण थियो। यस अवस्थालाई के भनिन्छ र यसलाई कसरी व्यवस्थापन गरिन्छ?

  • क) यो बाह्य प्रभाव हो; बिन्दुहरू मेटाउनु पर्छ
  • ख) यो सामान्यीकरण को कमी हो; मापन सुधार मात्र पर्याप्त छ
  • सी) यो ब्याच प्रभाव छ; डिजाइनमा सन्तुलित हुनुपर्छ र ब्याच चलको रूपमा मोडेलमा थपिएको हुनुपर्छ ✔
  • घ) पी-ह्याकिंग; परीक्षण परिवर्तन गर्नुपर्छ

स्पष्टीकरण: नमूना ब्याच/प्रशोधन दिनको कारणले प्राविधिक भिन्नतालाई ब्याच प्रभाव भनिन्छ र जैविक भिन्नतासँग भ्रमित हुन सक्छ। सही दृष्टिकोण भनेको डिजाइनमा ब्याचहरू सन्तुलनमा राख्नु र ब्याच चरलाई सांख्यिकीय मोडेलमा थप्नु हो (जस्तै '~ ब्याच + अवस्था'), यसरी जैविक संकेतबाट प्राविधिक सङ्केत अलग गर्ने।

14. तपाईं DNA अनुक्रमको GC अनुपात गणना गर्न चाहनुहुन्छ। सही र दोहोरिने दृष्टिकोण कुन हो?

  • A) Biopython मार्फत GC दर गणना गर्ने कोड छाप्नुहोस्, यसलाई चलाउनुहोस् र आउटपुट प्रयोग गर्नुहोस् ✔
  • B) मोडेललाई अनुक्रम दिनुहोस् र यसलाई मौखिक रूपमा GC दर बताउन सोध्नुहोस्
  • C) अर्को मोडेलद्वारा मोडेलले दिएको अनुपात पुष्टि गर्दै
  • D) शृङ्खलाको पहिलो 100 अक्षरहरू हेर्दै र आँखाले अनुमान गर्दै

स्पष्टीकरण: GC दर एक निर्धारणात्मक गणना हो; एरेलाई प्रशोधन गर्ने कोडमा आधारित हुनुपर्छ, भाषा मोडेलले 'सम्झने' मानमा होइन। मोडेलले यसलाई गणना गर्नुको सट्टा, Biopython जस्तै उपकरणको साथ गणना कोड प्रिन्ट गरेर र यसलाई आफैं चलाउँदा एक सटीक आउटपुट प्रदान गर्दछ जुन तपाईले यसलाई चलाउँदा प्रत्येक पटक उही परिणाम दिन्छ।