লাভ:
- কেভিকেকে, জিডিপিআর এবং নীতিশাস্ত্র কমিটির নিয়ম অনুসারে সংবেদনশীল মানব/জেনেটিক ডেটা রক্ষা করার ক্ষমতা এবং সেগুলি খোলা মডেলে দেওয়া এড়াতে
- বায়োসিকিউরিটি/দ্বৈত ব্যবহার এবং জনসংখ্যার পক্ষপাতের ঝুঁকি মূল্যায়ন করে ফলাফলের বৈধতা নিয়ে প্রশ্ন তোলার ক্ষমতা
- বোঝা যে নৈতিক দায়িত্ব গাড়ির উপর অর্পণ করা যাবে না এবং অর্থপূর্ণ মানব-ইন-দ্য লুপ প্রয়োজনীয়
জীববিজ্ঞানে কৃত্রিম বুদ্ধিমত্তা দৃঢ়ভাবে ব্যবহার করা দায়িত্বের সাথে ব্যবহার করে পরিপূরক হয়। জীববিজ্ঞান একটি সংবেদনশীল ক্ষেত্র যা মানুষের স্বাস্থ্য, জেনেটিক গোপনীয়তা, পরিবেশ এবং এমনকি জৈব নিরাপত্তাকে স্পর্শ করে। এই ইউনিটে, আমরা জৈবিক অধ্যয়নে কৃত্রিম বুদ্ধিমত্তা ব্যবহার করার সময় আপনি যে নৈতিক, আইনগত এবং সুরক্ষা দায়িত্বগুলির মুখোমুখি হবেন তা নিয়ে আলোচনা করব। এই ইউনিটটি পূর্ববর্তী সমস্ত ইউনিটে যাচাইকরণ এবং সততার নীতির উপর নির্মিত একটি কাঠামো।
মৌলিক নীতি: এআই একটি টুল; নৈতিক দায়িত্ব সবসময় মানুষের উপর নিহিত। "মডেল প্রস্তাবিত" একটি অজুহাত নয়.
দায়িত্বের চারটি ক্ষেত্র
1. ডেটা গোপনীয়তা এবং মানুষের ডেটা
মানব অংশগ্রহণকারীদের জেনেটিক, ক্লিনিকাল বা স্বাস্থ্য তথ্য অত্যন্ত সংবেদনশীল। একজন ব্যক্তির ডিএনএ ক্রম তার এবং তাদের আত্মীয়দের রোগের ঝুঁকি এবং পরিচয় প্রকাশ করতে পারে; এমনকি বেনামী বলে মনে করা জিনোমিক ডেটা পুনরায় সনাক্ত করা যেতে পারে। একটি সর্বজনীনভাবে উপলব্ধ AI মডেলে এই ডেটা পেস্ট করা ডেটা সুরক্ষা আইন (Türkiye-এ KVKK, ইউরোপে GDPR) এবং নীতিশাস্ত্র বোর্ড (IRB/এথিক্স কমিটি) অনুমোদন লঙ্ঘন করতে পারে।
- খোলা মডেলে ব্যক্তিগত/ক্লিনিকাল ডেটা প্রদান করবেন না।
- সম্মতির সুযোগের বাইরে ব্যবহার এড়িয়ে চলুন; অংশগ্রহণকারী কি সম্মতি দিয়েছেন?
- এন্টারপ্রাইজ/স্থানীয় (অন-প্রিমাইজ) বা ডেটা প্রসেসিং চুক্তির টুল বেছে নিন।
2. জৈব নিরাপত্তা এবং দ্বৈত ব্যবহার
কিছু জৈবিক তথ্য "দ্বৈত ব্যবহার": এটি দরকারী এবং ক্ষতিকারক উভয়ই হতে পারে; উদাহরণস্বরূপ, প্যাথোজেন (রোগ সৃষ্টিকারী) ক্রম, টক্সিন উত্পাদন। বিপজ্জনক প্যাথোজেন বাড়ানো বা ক্ষতিকারক জৈবিক এজেন্ট ডিজাইন করার বিষয়ে তথ্যের জন্য এআইকে জিজ্ঞাসা করা বেশিরভাগ জায়গায় অনৈতিক এবং অবৈধ।
- বিপজ্জনক দ্বৈত-ব্যবহারের অনুরোধ করবেন না।
- আপনার প্রতিষ্ঠানের বায়োসেফটি বোর্ড (IBC) নির্দেশিকা অনুসরণ করুন।
3. বৈজ্ঞানিক অখণ্ডতা
আমরা পূর্ববর্তী ইউনিটগুলিতে যা দেখেছি তা এখানে একত্রিত হয়: কোনও জাল অ্যাট্রিবিউশন নেই, কোনও ডেটা বিউটিফিকেশন নেই, কোনও পি-হ্যাকিং নেই, কোনও নির্বাচনী প্রতিবেদন নেই। কৃত্রিম বুদ্ধিমত্তা এগুলোকে সহজ বা কঠিন করে তুলতে পারে; পার্থক্য আপনার সততার মধ্যে.
- সমস্ত ফলাফলের রিপোর্ট করুন (নেতিবাচক সহ)।
- কৃত্রিম বুদ্ধিমত্তার ব্যবহার ঘোষণা করুন।
- অপরিশোধিত ডেটা এবং কোড শেয়ার করে প্রজননযোগ্যতা সমর্থন করুন (যদি সম্ভব হয়)।
4. পক্ষপাত এবং ন্যায্যতা
AI মডেলগুলি যে ডেটার উপর তাদের প্রশিক্ষণ দেওয়া হয় তার পক্ষপাত বহন করে। জিনোমিক ডাটাবেস প্রধানত ইউরোপীয় বংশোদ্ভূত জনসংখ্যা থেকে আসে; এটি অন্যান্য জনসংখ্যার দরিদ্র ভবিষ্যদ্বাণীর দিকে পরিচালিত করে। একটি ইমেজ মডেল এমন অবস্থায় খারাপভাবে পারফর্ম করতে পারে যা প্রশিক্ষণের ডেটাতে উপস্থাপিত হয় না।
- মডেলটি কী জনসংখ্যা/ডেটাতে প্রশিক্ষিত হয়েছিল তা প্রশ্ন করুন।
- সমস্ত গোষ্ঠীতে ফলাফল ধরে আছে কিনা তা মূল্যায়ন করুন।
টিপ: নিজেকে জিজ্ঞাসা করুন: "আমি যদি এই ডেটা মডেলকে দিই, তাহলে এটি কার এবং সেই ব্যক্তি কি অনুমতি দিয়েছিল?" উত্তরটি অস্পষ্ট হলে, এটি দেবেন না। গোপনীয়তার লঙ্ঘন অপরিবর্তনীয়।
ধাপে ধাপে: দায়ী এআই নিয়ন্ত্রণ
- তথ্য উৎস শ্রেণীবদ্ধ করুন: ব্যক্তিগত/সংবেদনশীল বা সর্বজনীন?
- সম্মতি এবং অনুমতি পরীক্ষা করুন: এই ব্যবহার কভার করা হয়?
- সঠিক টুল বেছে নিন: সংবেদনশীল ডেটার জন্য সুরক্ষিত/নেটিভ এনভায়রনমেন্ট।
- দ্বৈত ব্যবহারের ঝুঁকি বিবেচনা করুন।
- প্রশ্ন পক্ষপাত: ফলাফল সব গ্রুপে বৈধ?
- নথিপত্র এবং ব্যবহার ঘোষণা.
অনুলিপিযোগ্য প্রম্পট টেমপ্লেট
একটি নৈতিক দৃষ্টিকোণ থেকে নীচে আমার বিশ্লেষণ পরিকল্পনা পর্যালোচনা করুন: ডেটা গোপনীয়তা, অংশগ্রহণকারীদের সম্মতি, সম্ভাব্য পক্ষপাত এবং দ্বৈত ব্যবহারের ঝুঁকি সম্পর্কিত সতর্কতা তালিকাভুক্ত করুন। পরিকল্পনা: [টেক্সট] (দ্রষ্টব্য: আমি প্রকৃত রোগীর ডেটা ভাগ করছি না, শুধু পরিকল্পনা।)
এই জিনোমিক ডেটাসেটটি ব্যবহার করার আগে আমার কোন গোপনীয়তা এবং সম্মতি প্রশ্নের উত্তর দেওয়া উচিত? কেভিকেকে/জিডিপিআর এবং নীতিশাস্ত্র কমিটির পরিপ্রেক্ষিতে একটি চেকলিস্ট প্রস্তুত করা হয়েছে।
আমার নিবন্ধের পদ্ধতি বিভাগে আমি যে কৃত্রিম বুদ্ধিমত্তার সরঞ্জামটি ব্যবহার করি তা আমি কীভাবে স্বচ্ছভাবে ঘোষণা করব? একটি উদাহরণ ঘোষণামূলক বাক্য লিখুন; কোন তথ্য (সরঞ্জাম, সংস্করণ, ব্যবহারের সুযোগ) এটি থাকা উচিত?
এই মডেলের ফলাফলে জনসংখ্যার পক্ষপাত আছে কিনা তা আমি কিভাবে মূল্যায়ন করব? প্রশিক্ষণের ডেটা এবং চেক পদক্ষেপগুলি সম্পর্কে আমার যে প্রশ্নগুলি জিজ্ঞাসা করা উচিত তা তালিকাভুক্ত করুন।
দুর্বল প্রম্পট / শক্তিশালী প্রম্পট
দুর্বল: "নিম্নলিখিত রোগীর জেনেটিক ডেটা বিশ্লেষণ করুন: [বাস্তব তথ্য]।"
Güçlü: "আমি একটি বিশ্লেষণ পরিকল্পনা সেট আপ করছি যা ক্লিনিকাল জিনোমিক ডেটার সাথে কাজ করে, কিন্তু আমি প্রকৃত রোগীর ডেটা ভাগ করি না৷ শুধুমাত্র একটি পদ্ধতিগত দৃষ্টিকোণ থেকে: আমার কী গোপনীয়তার ব্যবস্থা নেওয়া উচিত, আমি কোন পরিবেশে ডেটা প্রক্রিয়া করব, কী অনুমোদন এবং নীতিশাস্ত্র কমিটির শর্তগুলি পূরণ করা উচিত? আপনি ডামি/নমুনা ডেটা সহ প্রবাহ দেখাতে পারেন।"
পার্থক্য: শক্তিশালী প্রম্পটে কোনো প্রকৃত সংবেদনশীল তথ্য ভাগ করা হয় না; শুধুমাত্র পদ্ধতি জিজ্ঞাসা করা হয়। গোপনীয়তা বজায় রাখা হয়, মডেল এখনও সাহায্য করে.
তিনটি মিনি কেস
কেস 1 — গোপনীয়তা লঙ্ঘন: একজন গবেষক যা ভেবেছিলেন তা বেনামী রোগীর এক্সোম ডেটা বিশ্লেষণ করার জন্য একটি উন্মুক্ত মডেলে পেস্ট করেছেন। যখন নীতিশাস্ত্র কমিটি এটি জানতে পেরেছিল, অধ্যয়নটি স্থগিত করা হয়েছিল; কোন তথ্য প্রক্রিয়াকরণ চুক্তি ছিল. পাঠ: সংবেদনশীল ডেটা কখনই খোলা মডেলে প্রবেশ করে না।
কেস 2 — জনসংখ্যার পক্ষপাত: একটি পলিজেনিক রিস্ক স্কোর টুল ইউরোপীয় বংশোদ্ভূত ডেটার উপর প্রশিক্ষিত ছিল; অন্য জনসংখ্যায়, ঝুঁকি অনুমান উল্লেখযোগ্যভাবে ভুল ছিল। যখন মডেলটি প্রশিক্ষণের ডেটার গঠন নিয়ে প্রশ্ন করার পরামর্শ দেয়, দলটি সেই জনসংখ্যার মধ্যে টুলটি ব্যবহার না করার সিদ্ধান্ত নেয়। পাঠ: পক্ষপাত জীবন বাঁচায় বা ক্ষতি করে।
কেস 3 — প্রকাশ এবং স্বচ্ছতা: একটি দল AI দিয়ে ডেটা ক্লিনিং কোড লিখেছে এবং পদ্ধতি বিভাগে এটি স্পষ্টভাবে বলেছে; তিনি কোডটিও শেয়ার করেছেন। সমালোচকরা এটিকে স্বাগত জানিয়েছেন কারণ পুনরাবৃত্তিযোগ্যতা শক্তিশালী ছিল। পাঠ: স্বচ্ছতা বিশ্বাসের জন্ম দেয়।
তুলনা চার্ট
এলাকা
নিরাপদ আচরণ
ঝুঁকিপূর্ণ আচরণ
রোগীর তথ্য
স্থানীয়/নিরাপদ পরিবেশ
মডেল খুলতে পেস্ট করুন
সম্মতি
সুযোগের মধ্যে ব্যবহার করুন
পরিধি অতিক্রম করবেন না
জৈব নিরাপত্তা
দ্বৈত ব্যবহার এড়িয়ে চলা
বিপজ্জনক চাহিদা
সততা
সমস্ত ফলাফল রিপোর্ট
নির্বাচনী প্রতিবেদন
পক্ষপাত
জনসংখ্যা জিজ্ঞাসা করুন
অন্ধভাবে প্রয়োগ করুন
স্বচ্ছতা
ব্যবহার ঘোষণা করুন
লুকানো
সাধারণ ভুল
- খোলা মডেলে সংবেদনশীল ডেটা দেওয়া: অপরিবর্তনীয় গোপনীয়তা লঙ্ঘন।
- সম্মতির সুযোগ অতিক্রম করা: অংশগ্রহণকারীর দ্বারা অনুমোদিত নয় ব্যবহার।
- পক্ষপাত উপেক্ষা করা: সমস্ত গোষ্ঠীর ফলাফলকে সাধারণীকরণ করা।
- ব্যবহার গোপন করা: AI অবদান ঘোষণা না করা।
- "মডেল প্রস্তাবিত" প্রতিরক্ষা: গাড়ির দায়িত্ব দায়ী করা।
সতর্কতা: উচ্চ-পরিণাম জৈবিক কাজে (ক্লিনিকাল সিদ্ধান্ত, জৈব নিরাপত্তা, মানব ডেটা) এআই আউটপুট উপযুক্ত বিশেষজ্ঞ যাচাইকরণ এবং নৈতিক তদারকির বিকল্প নয়; এটা শুধুমাত্র এটা গতি. সিদ্ধান্তের নৈতিক এবং বৈজ্ঞানিক পরিণতি সহ চূড়ান্ত দায়িত্ব সর্বদা মানুষের উপর বর্তায়।
পরিবেশ, বাস্তুবিদ্যা এবং ঐতিহ্যগত জ্ঞান
নৈতিক দায়িত্ব মানুষের তথ্যের মধ্যে সীমাবদ্ধ নয়। বাস্তুবিদ্যা এবং সংরক্ষণ জীববিজ্ঞানে কৃত্রিম বুদ্ধিমত্তা ব্যবহার করার সময়ও সতর্কতা প্রয়োজন। উদাহরণস্বরূপ, একটি বিপন্ন প্রজাতির সুনির্দিষ্ট অবস্থানের তথ্য (ক্যামেরা ট্র্যাপ স্থানাঙ্ক) শিকারের ঝুঁকির কারণে সংবেদনশীল; একটি খোলা মডেল বা জনসাধারণের কাছে এই ডেটা প্রকাশ করা প্রজাতির ক্ষতি করতে পারে। একইভাবে, নৈতিক এবং আইনগত (যেমন নাগোয়া প্রোটোকল) সমস্যা দেখা দেয় যখন স্থানীয় সম্প্রদায়ের ঐতিহ্যগত জৈবিক জ্ঞান (যেমন একটি উদ্ভিদের ব্যবহার) অনুমতি ছাড়াই ব্যবহার করা হয়। ডেটা ব্যবহার করার আগে, "এই তথ্যটি কার অন্তর্গত এবং এর প্রকাশের ফলে কার ক্ষতি হবে?" সর্বদা প্রশ্ন জিজ্ঞাসা করুন.
মানুষের তদারকি এবং চূড়ান্ত সিদ্ধান্ত
এই সম্পূর্ণ মডিউলটির সারমর্ম একটি নীতিতে ফুটে উঠেছে: অর্থপূর্ণ মানব তত্ত্বাবধান। AI একটি পরামর্শ তৈরি করে, একটি খসড়া লেখে, একটি প্যাটার্ন দেখায়; কিন্তু একটি জৈবিক, ক্লিনিকাল বা নৈতিক সিদ্ধান্ত সরাসরি মডেল আউটপুটের উপর ভিত্তি করে হয় না। বিশেষ করে উচ্চ-ঝুঁকিপূর্ণ এলাকায় (নির্ণয়, চিকিৎসা, প্রজাতি সংরক্ষণ সিদ্ধান্ত, মুক্তি), মডেলের ভূমিকা সিদ্ধান্ত নেওয়ার নয়, বিশেষজ্ঞের সিদ্ধান্তকে ত্বরান্বিত করা। "হিউম্যান-ইন-দ্য-লুপ" পদ্ধতিটি একটি স্লোগান নয়, একটি প্রয়োজনীয়তা।
এই নজরদারি কাজ করার জন্য, সুপারভাইজারকে অবশ্যই দক্ষ হতে হবে। অন্ধ সম্মতি ("মডেল বলেছেন, গ্রহণযোগ্যতা") তত্ত্বাবধান নয়। সত্যিকারের তদারকির জন্য এমন দক্ষতার প্রয়োজন হয় যা আউটপুটকে প্রশ্নবিদ্ধ করতে পারে, এর ত্রুটি ধরতে পারে এবং প্রয়োজনে প্রত্যাখ্যান করতে পারে। অতএব, কৃত্রিম বুদ্ধিমত্তা বিশেষজ্ঞের প্রতিস্থাপন করে না; এটি বিশেষজ্ঞকে আরও বেশি অপরিহার্য করে তোলে। যে বাহনটি সবচেয়ে ভালো ব্যবহার করে সে-ই সবচেয়ে ভালোভাবে নিয়ন্ত্রণ করতে পারে।
সংক্ষেপে
জীববিজ্ঞানে AI এর দায়িত্বশীল ব্যবহার চারটি ক্ষেত্রকে কভার করে: ডেটা গোপনীয়তা (সংবেদনশীল মানুষের ডেটা রক্ষা করা), জৈব নিরাপত্তা (দ্বিগুণ ব্যবহার এড়ানো), বৈজ্ঞানিক সততা (সৎ এবং সম্পূর্ণ রিপোর্টিং) এবং পক্ষপাতিত্ব সচেতনতা (সমস্ত গ্রুপে ফলাফলের বৈধতা)। খোলা মডেলে সংবেদনশীল তথ্য প্রদান করবেন না, স্বচ্ছভাবে ব্যবহার ঘোষণা করুন, জনসংখ্যার পক্ষপাতিত্ব নিয়ে প্রশ্ন করুন। নৈতিক দায়িত্ব কখনই এজেন্টকে অর্পণ করা যায় না; এটি সর্বদা মানুষের মধ্যে থাকে।
আবেদন টাস্ক
আপনার নিজের কর্মক্ষেত্র থেকে একটি দৃশ্যকল্প বিবেচনা করুন (যেমন একটি মানব ডেটাসেট বা একটি চিত্র মডেল ব্যবহার করে)। প্রকৃত তথ্য ভাগ না করে এআইকে এই দৃশ্যের (গোপনীয়তা, সম্মতি, পক্ষপাত, দ্বৈত ব্যবহার, স্বচ্ছতা) নৈতিক চেকলিস্ট নিয়ে আসতে দিন। প্রতিটি আইটেমের জন্য, এটিকে আপনার পরিস্থিতিতে "উপযুক্ত/ঝুঁকিপূর্ণ/অনিশ্চিত" হিসাবে চিহ্নিত করুন এবং ঝুঁকিপূর্ণ/অনিশ্চিত তাদের জন্য একটি কর্ম পরিকল্পনা লিখুন। এছাড়াও আপনার নিবন্ধের জন্য একটি AI ব্যবহারের বিবৃতি তৈরি করুন।
চেকলিস্ট
- [ ] আমি খোলা মডেলে সংবেদনশীল/ব্যক্তিগত ডেটা প্রদান করিনি।
- [ ] আমি সম্মতি এবং নীতিশাস্ত্র কমিটির সুযোগ পরীক্ষা করেছি৷
- [] আমি দ্বৈত ব্যবহার/বায়োসিকিউরিটি ঝুঁকি মূল্যায়ন করেছি।
- আমি সব ফলাফল সততার সাথে রিপোর্ট করেছি।
- [] আমি জনসংখ্যা/ডেটা পক্ষপাত নিয়ে প্রশ্ন করেছি।
- আমি স্বচ্ছভাবে কৃত্রিম বুদ্ধিমত্তার ব্যবহার ঘোষণা করেছি এবং দায়িত্ব নিয়েছি।
মডিউল পরীক্ষা
1. একজন ছাত্র ভাষা মডেলকে জিজ্ঞাসা করেছিল 'এই FASTA ফাইলে কয়টি স্ট্রিং আছে?' তিনি জিজ্ঞাসা করেন এবং মডেল '48' উত্তর দেয়। সবচেয়ে সঠিক পন্থা কোনটি?
- ক) মডেল দ্বারা প্রদত্ত 48 নম্বরটি সরাসরি ব্যবহার করে; মডেলটি নির্ভরযোগ্য কারণ এটি ফাইলটি দেখে
- খ) নম্বরটি আবার জিজ্ঞাসা করুন এবং দুটি উত্তর একই হলে এটি সঠিক হিসাবে গ্রহণ করুন
- গ) বায়োপিথন দিয়ে ফাইলটি পড়া, কোড সহ ক্রম সংখ্যা গণনা করা এবং আউটপুট ব্যবহার করা ✔
- ঘ) ফাইলটি ম্যানুয়ালি খোলা এবং চোখের সিদ্ধান্ত দ্বারা গণনা করা
ব্যাখ্যা: গণনা এবং পরিমাপের মতো নির্ধারক কাজগুলি আপনার চালানো কোডের উপর ছেড়ে দেওয়া উচিত, ভাষা মডেলের উপর নয়। মডেলটি সংখ্যাটিকে 'মনে রাখে না', এটি একটি সম্ভাব্য মান তৈরি করে এবং ভুল হতে পারে; বায়োপাইথনের মতো একটি টুল দিয়ে গণনা করা সঠিক এবং পুনরুত্পাদনযোগ্য ফলাফল দেয়।
2. আপনি একটি মাইক্রোস্কোপ ছবিতে কোষ গণনা করতে চান এবং প্রতিটির ক্ষেত্রফল পরিমাপ করতে চান। এই কাজের জন্য সবচেয়ে উপযুক্ত পদ্ধতি কি?
- ক) সেলপোজ/স্টারডিস্টের মতো একটি বিশেষজ্ঞ সেগমেন্টেশন টুল ব্যবহার করে এবং ম্যানুয়ালি ফলাফল যাচাই করা ✔
- খ) চিত্রটিকে সাধারণ ভাষার মডেলে আটকান এবং জিজ্ঞাসা করুন 'কতটি কোষ আছে'
- গ) মডেলের কাছে চিত্রটি বর্ণনা করুন এবং একটি আনুমানিক সংখ্যা জিজ্ঞাসা করুন
- ঘ) কোনো ক্রমাঙ্কন ছাড়াই পিক্সেলের সংখ্যাকে কোষের সংখ্যা হিসাবে গ্রহণ করা
ব্যাখ্যা: কোষ বিভাজন এবং পরিমাপ সাধারণ ভাষার মডেলের ডোমেন নয়, তবে এই কাজের জন্য বিশেষভাবে প্রশিক্ষিত বিশেষ চিত্র মডেলের (সেলপোজ, স্টারডিস্ট)। ভাষা মডেল কোড লিখে যে এই টুল কল; বিশেষজ্ঞ মডেল পরিমাপ করে, এবং জীববিজ্ঞানী ফলাফল যাচাই করে।
3. একজন স্নাতক ছাত্র তার থিসিস ভূমিকায় ভাষা মডেল দ্বারা উত্পাদিত 8টি উত্স যোগ করে। পরামর্শদাতা দেখতে পান যে এর মধ্যে 3টির অস্তিত্বই নেই। কিভাবে এই পরিস্থিতি প্রতিরোধ করা যেতে পারে?
- ক) মডেলটিকে আবার সম্পদ উৎপাদন করতে বলে
- খ) DOI সহ শুধুমাত্র উদ্ধৃতিগুলি নির্বাচন করে (যদি DOI থাকে তবে এটি বাস্তব)
- গ) মডেলকে 'ফিট' করার নির্দেশ দিয়ে তালিকার অনুরোধ করা
- D) PubMed/doi.org-এ প্রতিটি উদ্ধৃতি স্বাধীনভাবে যাচাই করা এবং শুধুমাত্র যে নিবন্ধগুলি তিনি পড়েছেন তার উল্লেখ করা ✔
ব্যাখ্যা: সাধারণ ভাষা মডেল একটি সাহিত্য ডাটাবেস নয়; বাস্তব রেকর্ড অনুসন্ধান করার পরিবর্তে, এটি বাস্তবসম্মত-শব্দযুক্ত বৈশিষ্ট্য (বানোয়াট বৈশিষ্ট্য) 'উত্পন্ন' করে। PubMed/doi.org-এর মতো উত্সগুলিতে স্বাধীন যাচাই না করে প্রতিটি বাইলাইন এবং DOI ব্যবহার করা উচিত নয় এবং শুধুমাত্র প্রকৃতপক্ষে পড়া নিবন্ধগুলি উদ্ধৃত করা উচিত।
4. কৃত্রিম বুদ্ধিমত্তা দ্বারা লিখিত ডেটা ক্লিনিং কোডের যথার্থতা নিশ্চিত করার সবচেয়ে শক্তিশালী উপায় কী?
- ক) যদি কোডটি ত্রুটি ছাড়াই কাজ করে তবে এটিকে সঠিক হিসাবে গ্রহণ করুন।
- খ) একটি ছোট পরিচিত নমুনা দিয়ে ফলাফল পরীক্ষা করা এবং দাবির সাথে প্রত্যাশা যাচাই করা ✔
- গ) মডেলটিকে জিজ্ঞাসা করুন 'কোডটি কি সঠিক?' জিজ্ঞাসা করা এবং উত্তর 'হ্যাঁ' বিশ্বাস করা
- ঘ) কোডটি কয়েকবার চালান এবং প্রতিবার একই আউটপুট পান
মন্তব্য: কোডটি ত্রুটি ছাড়াই কাজ করে তার মানে এই নয় যে এটি সঠিক; 'ভুল কোড ত্রুটি ছাড়াই কাজ করছে' জীববিজ্ঞানের সবচেয়ে বিপজ্জনক পরিস্থিতি। একটি ছোট নমুনা দিয়ে পরীক্ষা করা যার ফলাফল আপনি আগে থেকেই জানেন এবং কোডে প্রত্যাশাকে জাহির সহ এম্বেড করা নীরব ভুল ফলাফলের বিরুদ্ধে সবচেয়ে শক্তিশালী ঢাল।
5. একটি RNA-seq বিশ্লেষণে, 20,000 জিন পরীক্ষা করা হয় এবং 3,800 জিন সংশোধন ছাড়াই p <0.05 সহ 'গুরুত্বপূর্ণ' বলে পাওয়া যায়। এই উপসংহারে প্রধান সমস্যা কি?
- ক) নমুনার সংখ্যা খুব বেশি, এটা কমাতে হবে
- খ) p থ্রেশহোল্ড খুব বেশি, 0.10 ব্যবহার করা উচিত ছিল
- গ) একাধিক তুলনা সংশোধন (FDR) সঞ্চালিত হয়নি; অনেক মিথ্যা ইতিবাচক আছে ✔
- ঘ) জিনের পরিবর্তে নমুনা পরীক্ষা করা উচিত ছিল
ব্যাখ্যা: আপনি যখন এক সাথে হাজার হাজার জিন পরীক্ষা করেন, তখন অনেক জিন দৈবক্রমে 'তাৎপর্যপূর্ণ' দেখা যায়, এমনকি বাস্তবে কোনো পার্থক্য না থাকলেও; একে একাধিক তুলনা সমস্যা বলা হয়। সমাধান হল বেঞ্জামিনি-হচবার্গের মতো একটি পদ্ধতির সাহায্যে FDR (মিথ্যা আবিষ্কারের হার) সংশোধন প্রয়োগ করা; সংশোধনের সাথে, তালিকাটি সাধারণত দশ থেকে কয়েকশ জিনে কমে যায়।
6. BLAST ফলাফলে সেরা ম্যাচের ই-মান 2.0 আছে। এর মানে কি?
- ক) ম্যাচটি সম্ভবত এলোমেলো; ✔ নির্ভরযোগ্য ম্যাচ নয়
- খ) কাপলিং খুব শক্তিশালী; ই-মূল্য যত বেশি, তত ভাল
- গ) ক্রমটি 2% হারে মিলেছে
- ঘ) দুটি অনুক্রমের মধ্যে একটি 2 ভিত্তি পার্থক্য রয়েছে
ব্যাখ্যা: ই-মান ইঙ্গিত করে যে ম্যাচটি এলোমেলো হওয়ার প্রত্যাশা; ছোট হওয়াই ভালো। 1-এর বেশি একটি ই-মান ইঙ্গিত করে যে ম্যাচটি সম্ভবত এলোমেলো। নির্ভরযোগ্য ম্যাচের জন্য, খুব ছোট থ্রেশহোল্ড যেমন e <1e-5 সাধারণত চাওয়া হয়।
7. একটি আলফাফোল্ড মডেলে, প্রোটিনের টার্মিনাল অঞ্চল একটি কম pLDDT স্কোর (<50) দেখায়। এই অঞ্চল কিভাবে ব্যাখ্যা করা উচিত?
- ক) আলফাফোল্ড এই অঞ্চলে একটি ত্রুটি করেছে, অঞ্চলটিকে বিশ্লেষণ থেকে সরানো উচিত
- খ) এই অঞ্চলটি অবশ্যই একটি আলফা হেলিক্স
- গ) মডেলটি সম্পূর্ণরূপে অবিশ্বস্ত, কাঠামো ব্যবহার করা উচিত নয়
- ঘ) অঞ্চলটি সম্ভবত অনিয়মিত/ইলাস্টিক; 'মিথ্যা' এর পরিবর্তে 'অস্পষ্ট' হিসাবে ব্যাখ্যা করা উচিত ✔
বর্ণনা: pLDDT হল প্রতিটি অ্যামিনো অ্যাসিডের স্থানীয় আত্মবিশ্বাসের স্কোর; 50-এর নীচের মানগুলি প্রায়ই সত্যিকারের অনিয়মিত (নমনীয়, অ-স্থির) অঞ্চলগুলিকে প্রতিফলিত করে। এই অঞ্চলগুলিকে 'ভুল অনুমান' হিসাবে স্বয়ংক্রিয়ভাবে মুছে ফেলা ভুল; একটি কম স্কোর 'অনিশ্চিত/নমনীয়' হিসাবে পড়া উচিত এবং এর জৈবিক তাত্পর্য মূল্যায়ন করা উচিত।
8. একজন গবেষক শুধুমাত্র পিক্সেলে কোষের এলাকা রিপোর্ট করেন এবং ফলাফল সাহিত্যের সাথে অসঙ্গতিপূর্ণ। অনুপস্থিত পদক্ষেপ কি?
- ক) আরও কোষ গণনা করা উচিত ছিল
- খ) স্কেল ক্রমাঙ্কন (পিক্সেল-থেকে-মাইক্রোমিটার রূপান্তর) সঞ্চালিত হয়নি, ফলাফলগুলি শারীরিক ইউনিটে রূপান্তরিত হয়নি ✔
- গ) সেগমেন্টেশন টুলটি ভুলভাবে বেছে নেওয়া হয়েছে
- D) ছবির রেজোলিউশন খুব বেশি
ব্যাখ্যা: চিত্র থেকে শারীরিক আকার বের করার জন্য স্কেল ক্রমাঙ্কন (পিক্সেল প্রতি কত মাইক্রোমিটার) অপরিহার্য। এই ধাপটি এড়িয়ে গেলে মাইক্রোস্কোপ সেটিং এর উপর নির্ভর করে মানগুলি অতুলনীয় থেকে যায়। ক্ষেত্রগুলিকে অবশ্যই ভৌত ইউনিটে রূপান্তর করতে হবে যেমন বর্গ মাইক্রোমিটার।
9. একজন ছাত্র একটি একক মাউস থেকে 10 টি টিস্যুর নমুনা নেয় এবং পরিসংখ্যানে 'n=10' ব্যবহার করে। কেন এই ভুল?
- ক) পরিসংখ্যানের জন্য 10টি নমুনা খুব কম, কমপক্ষে 30টি প্রয়োজন৷
- খ) বিভিন্ন অঙ্গ থেকে টিস্যুর নমুনা নিতে হয়েছিল
- গ) এই 10টি উদাহরণ হল প্রযুক্তিগত পুনরাবৃত্তি; জৈবিক n এখনও 1, এটি তথাকথিত পুনরাবৃত্তি ✔
- ঘ) নমুনাগুলি অবৈধ কারণ সেগুলি একই দিনে নেওয়া হয়েছিল৷
ব্যাখ্যা: একই ব্যক্তি থেকে বারবার নেওয়া পরিমাপগুলি প্রযুক্তিগত পুনরাবৃত্তি; যেখানে পরিসংখ্যানগত n হল জৈবিক এককের সংখ্যা (এখানে ইঁদুর)। প্রযুক্তিগত পুনরাবৃত্তিকে জৈবিক (ছদ্ম প্রতিলিপি) হিসাবে বিবেচনা করা মিথ্যা তাত্পর্য তৈরি করে। সঠিক ডিজাইন মানে একাধিক ব্যক্তির সাথে কাজ করা।
10. একটি বিশ্লেষণ p=0.03 পাওয়া গেছে। এই মান সঠিক ব্যাখ্যা কি?
- ক) এই বা তার বেশি চরম ফলাফল দেখার 3% সম্ভাবনা আছে যখন বাস্তবে কোন পার্থক্য নেই ✔
- খ) প্রভাব বাস্তব হওয়ার সম্ভাবনা 97%
- গ) শূন্য অনুমান সত্য হওয়ার সম্ভাবনা 3%
- D) ফলাফল 97% পুনরাবৃত্তিযোগ্য
ব্যাখ্যা: পি-মান 'সম্ভাব্যতা যে অনুমানটি সত্য' বা 'সম্ভাব্যতা যে প্রভাবটি সত্য' নয়। p-মান হল একটি পার্থক্য দেখার সম্ভাবনা বা তার চেয়ে বেশি চরম হিসাবে দেখা যায় যখন আসলে কোন পার্থক্য থাকে না। সুতরাং p=0.03 এর অর্থ এই নয় যে 'প্রভাবটি 97% বাস্তব'; ফলাফলগুলিও প্রভাবের আকার এবং আত্মবিশ্বাসের ব্যবধান দ্বারা মূল্যায়ন করা উচিত।
11. একটি উপস্থাপনায়, y-অক্ষকে 95-100 পরিসরে সংকুচিত করে দুটি গ্রুপের মধ্যে একটি 3% পার্থক্য বিশাল হিসাবে দেখানো হয়েছে। এই একটি উদাহরণ কি?
- ক) একটি ভাল ভিজ্যুয়ালাইজেশন কৌশল; পার্থক্য তুলে ধরে
- খ) কালারব্লাইন্ড ফ্রেন্ডলি প্যালেট সমস্যা
- গ) একটি গ্রহণযোগ্য শৈলী পছন্দ
- ঘ) একটি বিভ্রান্তিকর এবং অসাধু তালিকা যা ছাঁটাই করা অক্ষের সাথে পার্থক্যকে অতিরঞ্জিত করে ✔
ব্যাখ্যা: শূন্য থেকে অক্ষের সূচনা না করা (কাটা অক্ষ) একটি ছোট পার্থক্যকে দৃশ্যত অতিরঞ্জিত করে দর্শককে বিভ্রান্ত করে। এটি সততার নীতির লঙ্ঘন; বিশেষ করে বার চার্টে, অক্ষটি শূন্য থেকে শুরু হওয়া উচিত এবং পার্থক্যটি তার প্রকৃত আকারের সাথে দেখানো উচিত।
12. একজন গবেষক বেনামী রোগীর এক্সোম ডেটা যা মনে করেন তা বিশ্লেষণ করার জন্য একটি পাবলিক ল্যাঙ্গুয়েজ মডেলে পেস্ট করেন। কেন এই আচরণ সমস্যাযুক্ত?
- ক) কোন সমস্যা নেই; বেনামী হলে ডেটা ভাগ করা যেতে পারে
- খ) একটি খোলা মডেলে সংবেদনশীল রোগীর ডেটা সরবরাহ করা গোপনীয়তা এবং নৈতিক/আইনি (KVKK/GDPR) লঙ্ঘন এবং উল্টানো যাবে না ✔
- গ) এটি সমস্যাযুক্ত কারণ বিশ্লেষণ ধীর হবে
- D) মডেলটি সমস্যাযুক্ত কারণ এটি ডেটা বুঝতে পারে না
বর্ণনা: রোগীর জেনেটিক/ক্লিনিকাল ডেটা অত্যন্ত সংবেদনশীল; এমনকি বেনামী বলে মনে করা জিনোমিক ডেটা পুনরায় সনাক্ত করা যেতে পারে। একটি পাবলিক মডেলে এই ডেটা প্রদান করা KVKK/GDPR এবং নীতিশাস্ত্র কমিটির (IRB) অনুমোদন লঙ্ঘন করে এবং এটি গোপনীয়তার একটি অপরিবর্তনীয় লঙ্ঘন। সংবেদনশীল তথ্য স্থানীয়/সুরক্ষিত, চুক্তিবদ্ধ পরিবেশে প্রক্রিয়া করা উচিত।
13. একটি গবেষণায়, তারা যে পার্থক্যটিকে 'রোগী বনাম নিয়ন্ত্রণ' ভেবেছিল তা আসলে দুটি ভিন্ন দিনে নমুনা প্রক্রিয়াকরণের কারণে হয়েছিল। এই পরিস্থিতি কি বলা হয় এবং কিভাবে এটি পরিচালনা করা হয়?
- ক) এটি বহিরাগত প্রভাব; বিন্দু মুছে ফেলা উচিত
- খ) এটি স্বাভাবিককরণের অভাব; শুধুমাত্র স্কেল সংশোধন যথেষ্ট
- গ) এটি ব্যাচ প্রভাব; ডিজাইনে ভারসাম্য আনতে হবে এবং মডেলে ব্যাচ ভেরিয়েবল হিসেবে যোগ করতে হবে ✔
- ঘ) পি-হ্যাকিং; পরীক্ষা পরিবর্তন করা উচিত
ব্যাখ্যা: স্যাম্পলিং ব্যাচ/প্রসেসিং ডে এর কারণে প্রযুক্তিগত পার্থক্যকে ব্যাচ ইফেক্ট বলা হয় এবং জৈবিক পার্থক্যের সাথে বিভ্রান্ত হতে পারে। সঠিক পদ্ধতি হল ডিজাইনে ব্যাচগুলির ভারসাম্য বজায় রাখা এবং পরিসংখ্যানগত মডেলে ব্যাচ ভেরিয়েবল যোগ করা (যেমন '~ব্যাচ + কন্ডিশন'), এইভাবে জৈবিক সংকেত থেকে প্রযুক্তিগত সংকেতকে আলাদা করা।
14. আপনি একটি DNA অনুক্রমের GC অনুপাত গণনা করতে চান। কোনটি সঠিক এবং পুনরাবৃত্তিযোগ্য পদ্ধতি?
- ক) বায়োপিথন দিয়ে জিসি রেট গণনা করে এমন কোডটি প্রিন্ট করুন, এটি চালান এবং আউটপুট ব্যবহার করুন ✔
- খ) মডেলটিকে ক্রমটি দিন এবং মৌখিকভাবে GC হার বলতে বলুন
- গ) অন্য মডেল দ্বারা মডেল দ্বারা প্রদত্ত অনুপাত নিশ্চিত করা
- ঘ) সিরিজের প্রথম 100টি অক্ষর দেখে এবং চোখ দিয়ে অনুমান করা
ব্যাখ্যা: GC হার একটি নির্ধারক গণনা; অ্যারেকে প্রসেস করে এমন কোডের উপর ভিত্তি করে হওয়া উচিত, ভাষার মডেল 'মনে রাখে' এমন মানের উপর নয়। মডেলটিকে এটি গণনা করার পরিবর্তে, Biopython-এর মতো একটি টুল দিয়ে গণনার কোডটি প্রিন্ট করা এবং এটি নিজে চালানো একটি সঠিক আউটপুট প্রদান করবে যা প্রতিবার আপনি এটি চালানোর সময় একই ফলাফল দেয়৷