ክፍል 4 / 11

የኦሚክስ መረጃ እና ከፍተኛ ልኬት ትንተና

ትርፍ፡

  • የበርካታ ንጽጽር ችግሮችን የመረዳት ችሎታ እና በመተንተን ውስጥ የ FDR (የውሸት ግኝት መጠን) እርማትን ያካትታል
  • የ p-value እና የውጤት መጠን (ሎግ2 ፎል ለውጥ) አንድ ላይ በመገምገም ስታቲስቲካዊ እና ባዮሎጂያዊ ጠቀሜታ የመለየት ችሎታ።
  • እንደ ባች ውጤት እና የምክንያት ዝላይ ያሉ ባለከፍተኛ-ልኬት የውሂብ ወጥመዶችን የማወቅ እና የማስወገድ ችሎታ

“ኦሚክስ” የሚለው ቃል በሴል ውስጥ ያሉትን አጠቃላይ የሞለኪውሎች ክፍል የሚለኩ አቀራረቦችን ይገልፃል፡- ጂኖሚክስ (ሁሉም ዲ ኤን ኤ)፣ ትራንስክሪፕቶሚክስ (ሁሉም አር ኤን ኤ/ጂን አገላለጽ)፣ ፕሮቲዮሚክስ (ሁሉም ፕሮቲኖች)፣ ሜታቦሎሚክስ (ሁሉም ትናንሽ ሞለኪውሎች)። የእነዚህ መመዘኛዎች የጋራ ባህሪያቸው ከፍተኛ መጠን ያለው ነው: በሺዎች ወይም በአስር ሺዎች የሚቆጠሩ ተለዋዋጮች (ጂኖች, ፕሮቲኖች) በአንድ ጊዜ በአንድ ናሙና ይለካሉ, ነገር ግን የናሙናዎች ቁጥር በአብዛኛው ትንሽ ነው (ለምሳሌ 20 ታካሚዎች). ይህ “ብዙ ተለዋዋጮች፣ ጥቂት ናሙናዎች” ሁኔታ ለባዮሎጂ ልዩ የሆኑ ተግዳሮቶች ምንጭ እና AI በጣም አጋዥ ሊሆኑ የሚችሉባቸው አካባቢዎች ነው።

በዚህ ክፍል ውስጥ፣ የልዩነት አገላለጽ ትንተና (አገላለጻቸው በሁለት ቡድኖች መካከል በጣም የሚለዋወጥ ጂኖችን ማግኘት) እና በዚህ የስራ ሂደት ውስጥ ስለ አርቴፊሻል ኢንተለጀንስ ሚና በ transcriptomics (RNA-seq) ምሳሌ እንነጋገራለን።

የከፍተኛ ልኬት ውሂብ ዋና ችግር

በአንድ ጊዜ በሺዎች የሚቆጠሩ ጂኖችን ብትፈትሽ በአጋጣሚ "ጉልህ" የሚመስሉ ጂኖች ታገኛለህ፣ ምንም እንኳን እውነተኛ ልዩነቶች ባይኖሩም። 20,000 ጂኖችን በ5% የስህተት ህዳግ ከፈተሽ ~1,000 ጂኖች በአጋጣሚ “ጉልህ” ሊሆኑ ይችላሉ። ይህ የበርካታ ንጽጽር ችግር ተብሎ የሚጠራ ሲሆን እጅግ በጣም ወሳኝ የሆነ የኦሚክስ ትንታኔ ነው። መፍትሄው p-እሴቶችን ማረም ነው (ለምሳሌ FDR አስላ - የውሸት ግኝት መጠን በቢንያኒ-ሆችበርግ ዘዴ)። AI ይህንን ጽንሰ-ሐሳብ ለማብራራት እና ትክክለኛውን ኮድ ለመጻፍ በጣም ይረዳል; ግን እርማቱን መተግበሩን ማስታወስዎ የእርስዎ ሃላፊነት ነው.

ጠቃሚ ምክር፡ እንደ "3,000 ጂኖች በከፍተኛ ሁኔታ ተቀይረዋል" የሚል ቁጥር ካየህ አስደነግጥ። ይህ ብዙውን ጊዜ ብዙ የንፅፅር እርማት እንዳልተደረገ የሚያሳይ ምልክት ነው። ትክክለኛ ዝርዝር በጥሩ ሁኔታ በተዘጋጀ ሙከራ ውስጥ ከአስር እስከ ብዙ መቶ ጂኖች ይሆናል።

RNA-seq ልዩነት መግለጫ: ደረጃ በደረጃ

  1. ጥሬ ቆጠራ፡ ለእያንዳንዱ ዘረ-መል ምን ያህል ንባብ በእያንዳንዱ ናሙና ውስጥ እንደወደቀ የያዘ ሠንጠረዥ።
  2. ጥራት እና ማጣሪያ፡ በጣም ዝቅተኛ አገላለጽ ያላቸውን ጂኖች ያስወግዱ።
  3. መደበኛ ማድረግ፡ በናሙናዎች መካከል ትክክለኛ የቤተ መፃህፍት መጠን ልዩነት (የማይነፃፀር ቁጥር)።
  4. የስታቲስቲካዊ ሞዴል፡ የቡድን ልዩነት ከDESeq2 ወይም EdgeR (R Library) ወይም pyDESeq2 ጋር በፓይዘን ሞክር።
  5. ብዙ ንጽጽር እርማት: FDR አስላ; ብዙውን ጊዜ የኤፍዲአር ገደብ <0.05።
  6. የውጤት መጠን፡ በሎግ2 መታጠፍ ለውጥ ይገምግሙ፡ አገላለጹ ስንት ጊዜ ይጨምራል/ይቀንስ።
  7. አስተያየት፡ ጉልህ የሆኑ ጂኖችን ከባዮሎጂካል መንገዶች ጋር ያገናኙ።

አርቲፊሻል ኢንተለጀንስ 3-6. ደረጃዎቹን ኮድ ያወጣል፣ ፅንሰ-ሀሳቦቹን ያብራራል እና ውጤቱን ለመተርጎም ይረዳዎታል። ይሁን እንጂ ሞዴሉ የእርስዎን ጥሬ መረጃ ሳያይ "የትኛው ጂን ተቀይሯል" ማለት አይችልም; ኮድ እና ስታቲስቲክስ ይህን ይነግሩዎታል.

ሊገለበጡ የሚችሉ የጥያቄ አብነቶች

ሚና፡ እርስዎ የጽሑፍ ግልባጭ ትንተና ረዳት ነዎት። አውድ፡- ከ12 ቁጥጥር፣ 12 የሕክምና ናሙናዎች የ RNA-seq ጥሬ ቆጠራ ሰንጠረዥ (CSV) አለኝ። ተግባር፡ የልዩነት አገላለጽ ትንተና ደረጃዎችን በ pyDESeq2 ይዘርዝሩ፣ እያንዳንዱ እርምጃ ለምን አስፈላጊ እንደሆነ ያብራሩ። መጀመሪያ ያቅዱ፣ ሁለተኛ ኮድ። ብዙ የንጽጽር እርማትን ማካተትዎን እርግጠኛ ይሁኑ.

የእኔ የትንታኔ ውጤት 4,200 ጂኖችን እንደ "p<0.05" አሳይቷል። ይህ ለምን አጠራጣሪ ሊሆን ይችላል? ብዙ የንፅፅር እርማትን (ቤንጃሚኒ-ሆችበርግ ኤፍዲአር) ያብራሩ እና ትክክለኛውን ማጣሪያ የሚሰራ የፓይዘን ኮድ ይስጡ።

ከኔ ልዩነት አገላለጽ የውጤት ሠንጠረዥ (ጂን፣ ሎግ2ኤፍሲ፣ ፓድጅ አምዶች) የእሳተ ገሞራ ሴራ የሚስል ኮድ ይፃፉ። ጂኖቹን በFDR<0.05 እና |log2FC|>1 ይቀቡ፣ 10 ቱን ይሰይሙ።

ለመንገዶች ማበልጸጊያ ይህን ጠቃሚ የጂን ዝርዝር እንዴት ነው የምተነትነው? የ gseapy ወይም g:Profiler ደረጃዎችን ያብራሩ። በአስተያየቱ ውስጥ ፍፁም የሆነ ምክንያት አትበል፣ ተዛማጅ ቋንቋ ተጠቀም። የዘር ዝርዝር፡ [ዝርዝር]

ደካማ ጥያቄ / ጠንካራ ጥያቄ

ደካማ፡ "በአር ኤን ኤ ሴክ ምርት ውስጥ የትኞቹ ጂኖች አስፈላጊ እንደሆኑ ንገረኝ"

ጠንካራ: "እኔ pyDESeq2 ከ 12 ቁጥጥር ውጤት አለኝ, 12 የሕክምና ናሙናዎች: ጂን ጋር ሰንጠረዥ, log2FoldChange, padj አምዶች. ጉልህ የሆኑ ጂኖች FDR ጣራ<0.05 እና |log2FC|>1 ጋር የሚያጣራ ኮድ ስጡ, ቁጥራቸውን ሪፖርት ያደርጋል እና 20 በጣም ጠንካራ ጂኖች በውጤታማነት ደረጃ ላይ ያስቀምጣቸዋል."

ልዩነት፡ ኃይለኛ መጠየቂያው ትክክለኛ የውጤት አምዶች፣ ገደቦች እና የማረጋገጫ ጥያቄ አለው። ሞዴሉ የተሰራውን የጂን ስም ከማመንጨት ይልቅ የእርስዎን ውሂብ ያስኬዳል።

ሶስት ጥቃቅን ጉዳዮች

ጉዳይ 1 - ጥፋት ሳይታረም፡ አንድ ቡድን 3,800 "ጉልህ" ጂኖችን ከ p<0.05 ጋር ያለምንም እርማት አግኝቶ ለህትመት አቀረበ። ዳኛው FDR እንዲስተካከል ሲጠይቁ ዝርዝሩ ወደ 47 ጂኖች ወርዷል። አርቴፊሻል ኢንተለጀንስ ከመጀመሪያው ጀምሮ የቤንጃሚን-ሆችበርግ ኮድ ቢጨምር ኖሮ ይህ አሳፋሪ ነገር አይከሰትም ነበር። ትምህርት፡ እርማት ለድርድር የማይቀርብ ነው።

ጉዳይ 2 — ባች ውጤት፡ በአንድ ጥናት ውስጥ ናሙናዎች በሁለት የተለያዩ ቀናት ተከናውነዋል። የ"ታካሚ እና ቁጥጥር" ልዩነት ነው ብለው ያሰቡት ነገር በእውነቱ "የ1ኛ ቀን ከ2ኛ ቀን" ልዩነት ነበር (የባች ውጤት፡ በናሙና ፓርቲ ምክንያት የቴክኒክ ልዩነት)። AI የባች ተለዋዋጭ ወደ ሞዴሉ (~ ባች + ሁኔታ በአምሳያው ቀመር) ላይ እንዲጨምር በመጠቆም አጭበርባሪውን ምልክት አረም እንዲያጠፋ ረድቷል።

ጉዳይ 3 — የመታጠፍ ለውጥን ችላ ማለት፡ ተማሪው "በጣም አስፈላጊ" ያለውን ዘረ-መል (ጅን) አውጇል፣ አገላለፁ በ2% የተቀየረ ነገር ግን በጣም የተረጋጋ ሆኖ የሚለካው p-valueን በመመልከት ብቻ ነው። የውጤቱ መጠን (ሎግ2ኤፍሲ) ዜሮ ነበር ማለት ይቻላል። ስታትስቲካዊ ጠቀሜታ ባዮሎጂያዊ ጠቀሜታ አይደለም. ሞዴሉ ይህንን ልዩነት በማብራራት በእሳተ ገሞራ ግራፍ እንዲታይ ሐሳብ አቅርቧል።

የንጽጽር ሰንጠረዥ፡ የፅንሰ-ሃሳብ ግልጽነት

ጽንሰ-ሐሳብ

ትርጉም

ለምን አስፈላጊ ነው?

p-እሴት

የልዩነቱ ዕድል በአጋጣሚ ነው።

ብቻውን አሳሳች ሊሆን ይችላል።

FDR (padj)

በብዙ ሙከራዎች ውስጥ የተስተካከለ የስህተት መጠን

የውሸት አወንቶችን ይገድባል

log2 መታጠፍ ለውጥ

የውጤት መጠን

ባዮሎጂያዊ ጠቀሜታ ያሳያል

የምድብ ውጤት

የቴክኒክ ስብስብ ልዩነት

የውሸት ምልክት ይፈጥራል

መደበኛነት

የኢንተር-ናሙና ልኬት እርማት

ንጽጽርን ፍትሃዊ ያደርገዋል

የተለመዱ ስህተቶች

  • ብዙ የንጽጽር እርማትን መዝለል፡ በጣም የተለመደው እና በጣም ከባድ ስህተት።
  • የ p-valueን መመልከት ብቻ፡ የውጤት መጠኑን (log2FC) አንድ ላይ ማጤንዎን ያረጋግጡ።
  • በአምሳያው ውስጥ ያለውን የቡድን ውጤት ሳያካትት: ለሥነ-ህይወት ልዩነት የቴክኒካዊ ልዩነት ስህተት.
  • መደበኛነትን በመርሳት፡ ጥሬ ቁጥሮችን በቀጥታ ማወዳደር።
  • የምክንያት ቋንቋ: "ይህ ጂን በሽታን ያመጣል" በማለት; የኦሚክስ መረጃ ትስስርን ያሳያል፣ምክንያቱም ተጨማሪ ሙከራን ይፈልጋል።
ማስጠንቀቂያ፡- በከፍተኛ-ልኬት መረጃ “በስታቲስቲክስ ጉልህ” እና “ባዮሎጂያዊ ጠቀሜታ” ሁለት የተለያዩ ነገሮች ናቸው። በአርቴፊሻል ኢንተለጀንስ የተሰራው የጂን ዝርዝር የመነሻ መላምት ነው; እያንዳንዱ እጩ ጂን በገለልተኛ ዘዴ (qPCR፣ ፕሮቲን መለኪያ) ሳይረጋገጥ እንደ ፍቺ ሊቆጠር አይገባም።

የመጠን ቅነሳ እና የጥራት ቁጥጥር

በከፍተኛ-ልኬት መረጃ ውስጥ የመጀመሪያው ነገር የናሙናዎችን አጠቃላይ መዋቅር ማየት ነው. PCA (የዋና አካል ትንተና፡ በሺዎች የሚቆጠሩ ተለዋዋጮችን ወደ ጥቂት ማጠቃለያ መጥረቢያዎች በመቀነስ እና በ 2 ልኬቶች ማሳየት) ለዚህ መደበኛ መሳሪያ ነው። የሚጠብቃቸው ቡድኖች (ቁጥጥር/ህክምና) በ PCA ገበታ ውስጥ ቢለያዩ ጥሩ ነው። ነገር ግን ናሙናዎቹ በቡድን ሳይሆን በ"ቀን በተሰራ" ከተሰበሰቡ ይህ የቡድን ውጤት ማስጠንቀቂያ ነው። ተመሳሳዩ ገበታ እንዲሁ ወዲያውኑ አንድ ነጠላ ውጫዊ (ያልተሳካ) ምሳሌ ያሳያል።

PCA ከመደበኛው የገለጻ ሠንጠረዥ ይሳሉ (የረድፍ ጂን፣ የአምድ ናሙና)። የቀለም ናሙናዎች በቡድን (ቁጥጥር / ህክምና), ባች በማቀነባበር ቅርጽ. በግራፉ ላይ የቡድን ውጤት ወይም ውጫዊ ንድፍ ስለመታየቱ አስተያየት ይስጡ።

ይህ የሂዩሪዝም እርምጃ ቀሪውን ትንታኔ ያነሳሳል-በአስመሳይ ውጤት ላይ ወራትን ከማባከን ይልቅ ዘግይቶ መያዝ የተሻለ ነው።

ነጠላ ሕዋስ ውሂብ፡ አዲስ ልኬት

በቅርብ ዓመታት ውስጥ, ነጠላ-ሴል አር ኤን ኤ ቅደም ተከተል (ነጠላ-ሴል RNA-seq: በሺዎች የሚቆጠሩ የግለሰብ ሴሎችን መግለጫ መለካት) በስፋት ተስፋፍቷል. እዚህ መረጃው የበለጠ እየጨመረ ይሄዳል፡ በአስር ሺዎች የሚቆጠሩ ሴሎች፣ እያንዳንዳቸው በሺዎች የሚቆጠሩ ጂኖች። እንደ Scanpy (Python) ያሉ መሳሪያዎች ይህንን ውሂብ ያካሂዳሉ; ሴሎችን ሰብስብ እና የሕዋስ ዓይነቶችን ይለያል። AI ለዚህ የስራ ሂደት ኮድ ይጽፋል, ነገር ግን የሕዋስ ዓይነቶች ባዮሎጂያዊ ስያሜ (ክላስተር "ቲ ሴል" ወይም "ማክሮፋጅ") በጠቋሚ ጂኖች እና በባለሙያ እውቀት ላይ የተመሰረተ ነው. ሞዴሉ ከታወቁ ማርከሮች ጋር ለክላስተር የሚሰጠውን የሕዋስ ዓይነት መለያ ማረጋገጥዎን ያረጋግጡ። ይህ በነጠላ ሕዋስ ትንተና ውስጥ በጣም የተለመደው የተሳሳተ እርምጃ ነው።

ክፈት ውሂብ እና መራባት

አብዛኛዎቹ የኦሚክስ ጥናቶች ውሂባቸውን ወደ የህዝብ ማከማቻዎች ይሰቅላሉ፡ ጂኢኦ (ጂን ኤክስፕሬሽን ኦምኒቡስ) እና ArrayExpress ለጂን አገላለጽ፣ SRA (ቅደም ተከተል መዝገብ ማኅደር) ለጥሬ ቅደም ተከተሎች፣ PRIDE for proteomics። ሌሎች የእርስዎን ውጤቶች እንዲያረጋግጡ እና ከሌሎች ጥናቶች የተገኙ መረጃዎችን እንደገና እንዲመረምሩ ይህ ወሳኝ ነው። AI ከጂኦኦ መመዝገቢያ ቁጥር (ለምሳሌ የጂኤስኢ ቁጥር) የሚያወርድ እና የሚያደራጅ ኮድ (እንደ GEOparse ባሉ መሳሪያዎች) መፃፍ ይችላል። ነገር ግን ያወረዱትን የውሂብ ንድፍ (ምን ያህል ቡድኖች, ምን ያህል ድግግሞሽ, የትኛው ሂደት) ከመጀመሪያው መዝገብ ማንበብ እና ማረጋገጥዎን ያረጋግጡ. ሞዴሉ የጥናት ንድፍን "አስታውስ" የሚል ከሆነ, ይህ ሁልጊዜ ማለት ይቻላል መረጋገጥ ያለበት ግምት ነው.

በማጠቃለያው

የኦሚክስ መረጃ በሺዎች የሚቆጠሩ ተለዋዋጮችን በትንሽ ናሙና መጠን ይለካሉ; ይህ የበርካታ ንፅፅር ወጥመዶችን፣ ባች ተፅእኖዎችን እና ከመጠን በላይ መተርጎምን ይፈጥራል። ሰው ሰራሽ የማሰብ ችሎታ; የልዩነት አገላለጽ ትንተና ኮድ ይጽፋል፣ ፅንሰ-ሀሳቦቹን ያብራራል እና ውጤቱን ለመተርጎም ያግዝዎታል። ነገር ግን፣ የFDR እርማትን መተግበር፣ የውጤት መጠንን መገምገም እና የምክንያት ቋንቋን ማስወገድ የእርስዎ ኃላፊነት ነው። እጩ ጂኖች በገለልተኛ ዘዴ እስኪረጋገጡ ድረስ መላምቶች ናቸው።

የመተግበሪያ ተግባር

የናሙና ልዩነት አገላለጽ የውጤት ሠንጠረዥ (gen፣ log2FC፣ padj) ያግኙ ወይም ይፍጠሩ። በFDR<0.05 እና |log2FC|>1 የሚያጣራ፣ የጉልህ ጂኖችን ቁጥር ሪፖርት የሚያደርግ እና የእሳተ ገሞራ ግራፍ የሚያቅድ AI ኮድ ይፃፉ። ኮዱን ያሂዱ። ከዚያም ሞዴሉ እርማቱ ካልተደረገ ምን ያህል ጂኖች “ጉልህ” እንደሚመስሉ አስላ እና ልዩነቱን ይተርጉሙ።

የማረጋገጫ ዝርዝር

  • [] ብዙ የንፅፅር ማስተካከያ (ኤፍዲአር) ተጠቀምኩኝ።
  • የውጤቱን መጠን (log2FC) እንዲሁም [] p-valueን ገምግሜያለሁ።
  • [] ባች/የቴክኒካል ተለዋዋጮችን አረጋገጥኩ።
  • [ ] የመደበኛነት ደረጃን አልዘለልኩም።
  • [ ] ከምክንያታዊነት ይልቅ የግንኙነት ቋንቋን ተጠቀምኩ።
  • [ ] የእጩ ጂኖችን መረጋገጥ የሚያስፈልጋቸው መላምቶች አድርጌያለሁ።