ইউনিট
1. বায়োইঞ্জিনিয়ারিংয়ে কৃত্রিম বুদ্ধিমত্তার ভূমিকা: ভূমিকা, সীমানা, বৈধতা, নীতিশাস্ত্র এবং জৈব নিরাপত্তা 2. বায়োইনফরমেটিক্স এবং সিকোয়েন্স অ্যানালাইসিস: কৃত্রিম বুদ্ধিমত্তা দিয়ে ডিএনএ, আরএনএ এবং প্রোটিন সিকোয়েন্স বোঝা 3. Omics ডেটা বিশ্লেষণ: ট্রান্সক্রিপ্টমিক্স, প্রোটিওমিক্স এবং মাল্টি-ওমিক্স ইন্টিগ্রেশন 4. প্রোটিন গঠন এবং আণবিক মডেলিং: আলফাফোল্ড, ডকিং এবং আণবিক নকশা 5. পরীক্ষামূলক নকশা এবং অপ্টিমাইজেশন: DoE, সক্রিয় শিক্ষা এবং স্মার্ট ল্যাবরেটরি পরিকল্পনা 6. ল্যাবরেটরি ডেটা এবং চিত্র বিশ্লেষণ: মাইক্রোস্কোপি, ফ্লো সাইটোমেট্রি এবং প্লেট ডেটা 7. বায়োপ্রসেস ডেভেলপমেন্ট এবং অপ্টিমাইজেশান: ফার্মেন্টেশন থেকে স্কেল-আপ পর্যন্ত 8. সাহিত্য পর্যালোচনা এবং জ্ঞান সংশ্লেষণ: RAG, পদ্ধতিগত সংকলন এবং হাইপোথিসিস জেনারেশন 9. নীতিশাস্ত্র, জৈব নিরাপত্তা, দ্বৈত-ব্যবহার এবং নিয়ন্ত্রক সম্মতি 10. এন্ড-টু-এন্ড প্রজেক্ট: এআই-সহায়তা বায়োইঞ্জিনিয়ারিং ওয়ার্কফ্লো এবং পাইথনের সাথে বৈধতা
ইউনিট 3 / 10

Omics ডেটা বিশ্লেষণ: ট্রান্সক্রিপ্টমিক্স, প্রোটিওমিক্স এবং মাল্টি-ওমিক্স ইন্টিগ্রেশন

লাভ:

  • ডিফারেনশিয়াল এক্সপ্রেশন বিশ্লেষণে একাধিক পরীক্ষার সংশোধন (সংশোধিত পি-মান) এবং ভাঁজ পরিবর্তনকে সঠিকভাবে ব্যাখ্যা করার এবং মিথ্যা ইতিবাচক এড়ানোর ক্ষমতা
  • ব্যাচ প্রভাব সনাক্ত করা এবং PCA এর সাথে মডেলে যোগ করা এবং জৈবিক পার্থক্য থেকে প্রযুক্তিগত শব্দ আলাদা করা
  • প্রতিটি পথ পরিচয়কে উৎসের সাথে লিঙ্ক করার ক্ষমতা এবং পাথওয়ে সমৃদ্ধকরণ এবং মাল্টি-ওমিক্স ইন্টিগ্রেশনে জৈবিক সামঞ্জস্যের সাথে নিয়ন্ত্রণ করার ক্ষমতা

একটি ঘর একটি একক সংখ্যা নয়; এটি এমন একটি সিস্টেম যেখানে হাজার হাজার জিন, প্রোটিন এবং মেটাবোলাইট একই সাথে নাচে। ওমিকস (পন্থাগুলির সম্মিলিত নাম যা একটি জৈবিক স্তরকে সামগ্রিকভাবে পরিমাপ করে) এই পুরো নৃত্যটি ধরার চেষ্টা করে: জিনোমিক্স (ডিএনএ), ট্রান্সক্রিপ্টমিক্স (আরএনএ — কোন জিন কাজ করে এবং কতটা), প্রোটিওমিক্স (প্রোটিন), বিপাকবিদ্যা (ছোট অণু)। প্রতিটি ওমিক্স স্তর হাজার হাজার মাত্রিক, গোলমাল এবং ব্যয়বহুল ডেটা তৈরি করে। AI এই উচ্চ-মাত্রিক ডেটা স্ক্যান করতে এবং প্যাটার্ন চিহ্নিত করার ক্ষেত্রে শক্তিশালী; কিন্তু আপনিই সিদ্ধান্ত নেন কোন প্যাটার্নটি জৈবিক সত্য এবং কোনটি প্রযুক্তিগত গোলমাল।

এই ইউনিটে, আমরা ট্রান্সক্রিপ্টমিক্সের মাধ্যমে এগিয়ে যাব, সবচেয়ে সাধারণ ওমিক্স বিশ্লেষণ; নীতিগুলি অন্যান্য স্তরগুলিতেও প্রযোজ্য। সাধারণ কর্মপ্রবাহ: কাঁচা ডেটা থেকে এক্সপ্রেশন ম্যাট্রিক্স (সারি হল জিন, কলাম হল নমুনা, কোষ হল এক্সপ্রেশন লেভেল), স্বাভাবিকীকরণ (প্রযুক্তিগত পার্থক্য অপসারণ), ডিফারেনশিয়াল এক্সপ্রেশন বিশ্লেষণ (দুটি অবস্থার মধ্যে উল্লেখযোগ্যভাবে পরিবর্তিত হওয়া জিনগুলি খুঁজে বের করা), পাথওয়ে সমৃদ্ধকরণ (পরিবর্তিত জিনগুলি কোন জৈবিক পথের সন্ধান করা) এবং ক্লাস্টারে আন্তঃপ্রকাশ।

ডিফারেনশিয়াল এক্সপ্রেশন: ভাঁজ পরিবর্তন এবং সংশোধন করা p-মান

একটি জিন "পরিবর্তন" হয়েছে কিনা তা জানাতে দুটি সংখ্যার দিকে নজর দেওয়া হয়: ভাঁজ পরিবর্তন — কতবার অভিব্যক্তি বাড়ে/কমে যায়, সাধারণত লগ 2 স্কেলে — এবং সামঞ্জস্য করা পি-মান (প্যাডজ — একাধিক পরীক্ষা করা হলে মিথ্যা ইতিবাচকের জন্য পরিসংখ্যান নিয়ন্ত্রণ করে)। কেন ঠিক করবেন? কারণ আপনি একই সময়ে 20,000 জিন পরীক্ষা করেন; এমনকি দৈবক্রমে, শত শত জিন "উল্লেখযোগ্য" হতে পারে। একাধিক পরীক্ষার সংশোধন ছাড়াই - বেঞ্জামিনি-হচবার্গের মতো পদ্ধতিগুলির সাথে মিথ্যা আবিষ্কারের হার সীমিত করা - তালিকাটি বিভ্রান্তিকর। এআই এমন স্ক্রিপ্ট লিখতে পারে যা এই পরিসংখ্যানটি গণনা করে, তবে যদি এটি সংশোধন বাদ দেয় তবে আপনার ফলাফল বৈজ্ঞানিকভাবে অপ্রতিরোধ্য।

সতর্কতা: কাঁচা পি-মানের উপর ভিত্তি করে একটি AI বলতে পারে "500 জিন উল্লেখযোগ্যভাবে পরিবর্তিত হয়েছে"। সংশোধন করা p-মান দেখে, সংখ্যাটি 30-এ নেমে যেতে পারে। সর্বদা নিজেই বহু-পরীক্ষা সংশোধন পরীক্ষা করুন; এটি প্রকাশের গ্রহণ এবং প্রত্যাখ্যানের মধ্যে পার্থক্য।

ব্যাচ প্রভাব: সবচেয়ে কপট ফাঁদ

ব্যাচ ইফেক্ট (ভিন্ন দিন, ডিভাইস বা লোকেদের দ্বারা নমুনা প্রক্রিয়াকরণের ফলে উদ্ভূত প্রযুক্তিগত পার্থক্য) ওমিক্স বিশ্লেষণে ত্রুটির সবচেয়ে বড় উৎস। আপনার দুটি শর্ত দুটি ভিন্ন দিনে প্রক্রিয়া করা হলে, আপনি যে "জৈবিক পার্থক্য" দেখতে পান তা আসলে দিনের পার্থক্য হতে পারে। AI মডেলটিতে ব্যাচ ভেরিয়েবল যোগ করার পরামর্শ দিতে পারে (যেমন ~ ব্যাচ + কন্ডিশন), তবে এটি সঠিকভাবে সেট আপ করা এবং পরীক্ষামূলক ডিজাইনে এটি মিশ্রিত না করা আপনার দায়িত্ব।

টিপ: বিশ্লেষণ শুরু করার আগে, একটি PCA (প্রধান উপাদান বিশ্লেষণ - একটি পদ্ধতি যা বিভিন্ন অক্ষে উচ্চ-মাত্রিক ডেটার সারসংক্ষেপ এবং কল্পনা করে) চার্ট আঁকুন। যদি নমুনাগুলি জৈবিক অবস্থার পরিবর্তে ব্যাচ দ্বারা ক্লাস্টার করা হয় তবে ব্যাচের প্রভাব প্রভাবশালী এবং প্রথমে সংশোধন করা আবশ্যক।

মাল্টি-ওমিক্স ইন্টিগ্রেশন

প্রকৃত বোধগম্য প্রায়শই স্তরগুলিকে একত্রিত করার মাধ্যমে আসে: যদি একটি জিন কঠোর পরিশ্রম করে কিন্তু তার প্রোটিন বৃদ্ধি না পায়, তবে নিয়ন্ত্রণটি অনুবাদের স্তরে। মাল্টি-ওমিক্স ইন্টিগ্রেশন—বিভিন্ন ওমিক্স স্তরগুলিকে একটি একক মডেলে একত্রিত করা—যেখানে AI শক্তিশালী হয় কিন্তু যেখানে এটি সবচেয়ে বেশি বিভ্রান্ত করে; কারণ স্তরগুলির স্কেল, শব্দ এবং নমুনা মিলগুলি আলাদা। AI একটি ইন্টিগ্রেশন ওয়ার্কফ্লো প্রস্তাব করে, কিন্তু আপনি ফলাফলের জৈবিক সামঞ্জস্য নিয়ন্ত্রণ করেন।

তিনটি মিনি কেস

কেস 1 — সমৃদ্ধকরণ ত্বরান্বিত। একটি ক্যান্সার প্রকল্পে 1,240 ডিফারেনশিয়াল জিন পাওয়া গেছে। পাথওয়ে সমৃদ্ধকরণ, কোষ চক্র এবং ডিএনএ মেরামতের পথগুলিকে হাইলাইট করার জন্য এআই তাদের প্রাথমিকভাবে তৈরি করেছে; দলটি 2 ঘন্টার মধ্যে একটি হাইপোথিসিস ম্যাপ তৈরি করেছে। কিন্তু তারা একটি স্বাধীন টুল (g:Profiler) দিয়ে প্রতিটি পথকে পুনরায় পরীক্ষা করে দেখেছে যে একটি পথ এআই দ্বারা ভুল ম্যাপ করা হয়েছে।

কেস 2 - ব্যাচ ফাঁদ। একটি পরীক্ষাগার দুটি চিকিত্সা গ্রুপের মধ্যে একটি "আঘাতজনক" 900-জিনের পার্থক্য খুঁজে পেয়েছে। যখন তারা পিসিএ সঞ্চালন করেছিল, তারা দেখেছিল যে নমুনাগুলি সিকোয়েন্সিং ব্যাচ দ্বারা পৃথক করা হয়েছিল। ব্যাচ সংশোধনের পরে, প্রকৃত পার্থক্য 60 জিনে কমে গেছে। AI প্রথম বিশ্লেষণে অনিচ্ছাকৃতভাবে ব্যাচ ভেরিয়েবল বাদ দিয়েছিল।

কেস 3 — তৈরি পথের নাম। একজন ছাত্র AI কে জিন তালিকা দিয়ে জিজ্ঞেস করল, "কোন কেইজিজি পাথওয়ে?" এআই একটি পাথওয়ে আইডি এবং নাম প্রদান করেছে যেন এটি বাস্তব। ছাত্রটি কেইজিতে অনুসন্ধান করলে সে দেখে যে ওই আইডিটির কোনো অস্তিত্ব নেই; যাচাই একটি বানোয়াট ফলাফল প্রতিরোধ.

চারটি অনুলিপিযোগ্য টেমপ্লেট

1) DESeq2 ওয়ার্কফ্লো রূপরেখা:

আপনার ভূমিকা: কম্পিউটেশনাল জীববিজ্ঞানী। R/DESeq2 সহ RNA-seq ডিফারেনশিয়াল এক্সপ্রেশন বিশ্লেষণের জন্য ধাপে ধাপে স্ক্রিপ্ট লিখুন: গণনা ম্যাট্রিক্স রিডিং, ডিজাইন সূত্র (~ ব্যাচ + শর্ত), স্বাভাবিককরণ, ফলাফল টেবিল। স্পষ্টভাবে একাধিক পরীক্ষার সংশোধন (BH) প্রয়োগ করুন এবং padjcolumn ব্যবহার করুন। প্রতিটি পদক্ষেপ একটি মন্তব্য লাইনে কি করে তা ব্যাখ্যা করুন।

2) গুণমান/ব্যাচ নিয়ন্ত্রণ:

আমাকে একটি RNA-seq QC চেকলিস্ট দিন: PCA সহ ব্যাচ নিয়ন্ত্রণ, লাইব্রেরির আকার, জিন সনাক্তকরণের সংখ্যা, আউটলিয়ার সনাক্তকরণ। প্রতিটি মেট্রিকের জন্য, "আমি যা দেখি তা আমাকে চিন্তিত করে" থ্রেশহোল্ড নির্দিষ্ট করুন। ব্যাচ এবং জৈবিক অবস্থা মিশ্রিত হলে আমার কী করা উচিত তা ব্যাখ্যা করুন।

3) সমৃদ্ধকরণ ফলাফল যাচাইকরণ:

আমি আপনাকে একটি সমৃদ্ধ পথের তালিকা দিব (পথের সংখ্যা, প্যাডজ, জিন)। প্রতিটি পথের পরিচয় লিখুন (KEGG/GO ID) শব্দার্থে এবং এটি তৈরি করবেন না। padj <0.05 দিয়ে ফলাফল ফিল্টার করুন। কোন পথগুলি জৈবিকভাবে একে অপরকে সমর্থন করে তা নির্দিষ্ট করুন, তবে প্রতিটি পরিচয়কে "ডাটাবেসে যাচাই করা আবশ্যক" হিসাবে চিহ্নিত করুন৷

4) মাল্টি-ওমিক্স ধারাবাহিকতা পরীক্ষা:

একটি জিন/প্রোটিন জোড়ার জন্য ট্রান্সক্রিপ্টোমিক এবং প্রোটিওমিক ফলন বিরোধী অভিব্যক্তির দিকনির্দেশ। এর জন্য সম্ভাব্য জৈবিক (অনুবাদ-পরবর্তী সম্পাদনা) এবং প্রযুক্তিগত (পরিমাপের শব্দ, নমুনা মিল) কারণগুলি তালিকাভুক্ত করুন এবং আমাকে বলুন কিভাবে প্রতিটি পরীক্ষা করা যায়।

দুর্বল প্রম্পট / শক্তিশালী প্রম্পট

দুর্বল প্রম্পট:

এই জিন তালিকায় গুরুত্বপূর্ণ পথের নাম দিন।

কোন উৎস নেই, পরিসংখ্যান নেই, গড়া পথের উচ্চ ঝুঁকি।

শক্তিশালী প্রম্পট:

আপনার ভূমিকা: কম্পিউটেশনাল জীববিজ্ঞানী। সংযুক্ত ডিফারেনশিয়াল জিন টেবিলে (জিন, log2FC, padj) শুধুমাত্র প্যাডজ <0.05 সহ জিন গ্রহণ করুন। এই জিনগুলির সাথে সম্পাদিত একটি GO সমৃদ্ধকরণ বিশ্লেষণের ধাপগুলি এবং আমি যে টুল (g:Profiler) ব্যবহার করব তা আমাকে বলুন৷ পথের নাম জাল; আমি টুলটি চালাব এবং বিশ্লেষণ করব, আপনি শুধু সঠিক পদ্ধতি এবং একাধিক পরীক্ষার সংশোধন বর্ণনা করুন।

পার্থক্য: পরিষ্কার ফিল্টার, পদ্ধতির ফোকাস, বানোয়াট উপর নিষেধাজ্ঞা এবং ব্যবহারকারীর কাছে যাচাইকরণ ছেড়ে দেওয়া।

Omics বিশ্লেষণ পদক্ষেপ

পদক্ষেপ

উদ্দেশ্য

সাধারণ ভুল

এআই ভূমিকা

স্বাভাবিকীকরণ

প্রযুক্তিগত পার্থক্য দূর করুন

ভুল পদ্ধতি পছন্দ

স্ক্রিপ্ট + যুক্তি

পিসিএ/কিউসি

ব্যাচ এবং আউটলিয়ার সনাক্তকরণ

আমার পদক্ষেপ এড়িয়ে যান

ছবি + মন্তব্য

ডিফারেনশিয়াল এক্সপ্রেশন

পরিবর্তনশীল জিন খোঁজা

অসংশোধিত পি

স্ক্রিপ্ট খসড়া

সমৃদ্ধকরণ

একটি পথ খুঁজে বের করুন

গড়া পথ

পদ্ধতি

ইন্টিগ্রেশন

স্তরগুলি একত্রিত করুন

স্কেল/মিল ত্রুটি

ওয়ার্কফ্লো সুপারিশ

একক কোষ ওমিক্স: একটি নতুন স্কেল

সাম্প্রতিক বছরগুলিতে, একক-কোষ সিকোয়েন্সিং - হাজার হাজার কোষের প্রতিটির এক্সপ্রেশন প্রোফাইলকে আলাদাভাবে পরিমাপ করা - ওমিক্সকে একটি নতুন মাত্রায় নিয়ে গেছে। এখন, "একটি টিস্যুর গড় অভিব্যক্তি" এর পরিবর্তে, আমরা সেই টিস্যুর মধ্যে প্রতিটি কোষের ধরন আলাদাভাবে দেখতে পারি। এই শক্তি নতুন ক্ষতির পরিচয় দেয়: ডেটা অত্যন্ত বিক্ষিপ্ত (বেশিরভাগ জিনের বেশিরভাগ কোষে শূন্য পাঠ রয়েছে - ড্রপআউট), আকার হল দশ হাজার কোষ × বিশ-হাজার জিন, এবং কোষের প্রকারগুলিকে আলাদা করা বেশিরভাগই ক্লাস্টারিংয়ের মাধ্যমে করা হয়। AI একক কোষের ডেটাতে ক্লাস্টারিং এবং সেল টাইপ লেবেলিং রূপরেখা তৈরিতে শক্তিশালী; কিন্তু আপনি পরিচিত মার্কার জিন দিয়ে যাচাই করেন যে প্রতিটি ক্লাস্টার একটি বাস্তব কোষের প্রকার বা একটি প্রযুক্তিগত শিল্প (যেমন মৃত কোষ, দুটি কোষ একসাথে ধরা)। প্রকৃত সাহিত্যে সেই ক্লাস্টারের মার্কার জিনগুলি নিশ্চিত না করে AI দ্বারা প্রস্তাবিত সেল টাইপ লেবেল গ্রহণ করবেন না।

টিপ: একটি একক-কোষ বিশ্লেষণে, যদি AI একটি ক্লাস্টারে একটি "T cell" লেবেল প্রস্তাব করে, তাহলে নিজের জন্য পরীক্ষা করে দেখুন যে T সেল মার্কারগুলি (যেমন CD3) সত্যিই সেই ক্লাস্টারে অত্যন্ত প্রকাশ করা হয়েছে৷ লেবেল টোকেন দ্বারা সমর্থিত না হলে, এটি একটি অনুমান, একটি উপসংহার নয়।

সাধারণ ভুল

  • একাধিক পরীক্ষার সংশোধন এড়িয়ে যাওয়া। তালিকা কাঁচা পি-মান সঙ্গে swells; padj ব্যবহার করা উচিত।
  • জীববিজ্ঞানের জন্য ব্যাচ প্রভাব ভুল করা. এটি প্রথমে পিসিএ দিয়ে পরীক্ষা করা উচিত।
  • মেঝে পরিবর্তন করা একমাত্র মানদণ্ড। উচ্চ ভাঁজ পরিবর্তন কম অভিব্যক্তি, শোরগোল জিনে বিভ্রান্তিকর হতে পারে।
  • তৈরি করা পথ/GO পরিচয় গ্রহণ করা। প্রতিটি পরিচয় ডাটাবেসে যাচাই করতে হবে।
  • নমুনা আকার অবমূল্যায়ন. 2 বাই 2 ডিজাইনে পরিসংখ্যান শক্তি কম; ফলাফলগুলি সতর্কতার সাথে ব্যাখ্যা করা উচিত।

সংক্ষেপে

ওমিক্স বিশ্লেষণ উচ্চ-মাত্রিক, শোরগোলযুক্ত ডেটার সাথে কাজ করে এবং AI এই ডেটাটিকে স্ক্যান করে, স্ক্রিপ্ট লিখে এবং প্যাটার্ন চিহ্নিত করে ত্বরান্বিত করে। কিন্তু ডিফারেনশিয়াল এক্সপ্রেশনে একাধিক পরীক্ষা সংশোধন, পিসিএ সহ ব্যাচ নিয়ন্ত্রণ এবং সমৃদ্ধকরণে উৎস যাচাই অপরিহার্য। মাল্টি-ওমিক্স ইন্টিগ্রেশন শক্তিশালী কিন্তু বিভ্রান্তিকর; স্তরগুলির স্কেল এবং শব্দের পার্থক্য বিবেচনা করে জৈবিক ধারাবাহিকতার সাথে প্রতিটি ফলাফল পরীক্ষা করুন।

আবেদন টাস্ক

একটি সর্বজনীনভাবে উপলব্ধ RNA-seq গণনা ম্যাট্রিক্স খুঁজুন (যেমন GEO থেকে)। AI-কে "DESeq2 ওয়ার্কফ্লো" টেমপ্লেটের সাথে একটি বিশ্লেষণ স্ক্রিপ্ট লিখতে বলুন এবং কোডে চেক করুন যে একাধিক পরীক্ষার সংশোধন আসলে প্রয়োগ করা হয়েছে। তারপরে AI-কে একটি সমৃদ্ধকরণ মন্তব্যের জন্য জিজ্ঞাসা করুন এবং এটি KEGG বা GO ডাটাবেসের বিপরীতে একে একে ফেরত দেওয়া সমস্ত পাথওয়ে আইডি যাচাই করুন; কতগুলো আসল তা খেয়াল করুন।

চেকলিস্ট

  • [ ] আমি ডিফারেনশিয়াল বিশ্লেষণে padj (সংশোধিত) ব্যবহার করেছি, কাঁচা পি-মান নয়।
  • [ ] আমি PCA এর সাথে ব্যাচ প্রভাব পরীক্ষা করেছি এবং প্রয়োজনে এটি মডেলে যোগ করেছি।
  • [ ] আমি উচ্চ ভাঁজ পরিবর্তনের সাথে জিনকে ব্যাখ্যা করেছি কিন্তু সতর্কতার সাথে কম অভিব্যক্তি।
  • আমি বাস্তব ডাটাবেসের বিপরীতে প্রতিটি পথ/গো আইডি যাচাই করেছি।
  • [ ] আমি নমুনার আকারের পরিসংখ্যানগত শক্তি মূল্যায়ন করেছি৷
  • আমি মাল্টি-ওমিক্স দ্বন্দ্বগুলিকে জৈবিক এবং প্রযুক্তিগত কারণগুলিতে ভাগ করেছি।