ஆதாயங்கள்:
- பல ஒப்பீட்டு சிக்கலைப் புரிந்துகொள்ளும் திறன் மற்றும் பகுப்பாய்வில் FDR (தவறான கண்டுபிடிப்பு விகிதம்) திருத்தம் அடங்கும்
- p-மதிப்பு மற்றும் விளைவு அளவை (log2 மடங்கு மாற்றம்) ஒன்றாக மதிப்பிடுவதன் மூலம் புள்ளிவிவர மற்றும் உயிரியல் முக்கியத்துவத்தை வேறுபடுத்தும் திறன்
- தொகுதி விளைவு மற்றும் காரண ஜம்ப் போன்ற உயர் பரிமாண தரவு பொறிகளை அடையாளம் கண்டு தவிர்க்கும் திறன்
"ஓமிக்ஸ்" என்ற வார்த்தையானது, ஒரு கலத்தில் உள்ள மூலக்கூறுகளின் முழு வகுப்பையும் அளவிடும் அணுகுமுறைகளை விவரிக்கிறது: மரபியல் (அனைத்து டிஎன்ஏ), டிரான்ஸ்கிரிப்டோமிக்ஸ் (அனைத்து ஆர்என்ஏ / மரபணு வெளிப்பாடு), புரோட்டியோமிக்ஸ் (அனைத்து புரதங்களும்), வளர்சிதை மாற்றம் (அனைத்து சிறிய மூலக்கூறுகளும்). இந்த அளவீடுகளின் பொதுவான அம்சம் அவற்றின் உயர் பரிமாணமாகும்: ஆயிரக்கணக்கான அல்லது பல்லாயிரக்கணக்கான மாறிகள் (மரபணுக்கள், புரதங்கள்) ஒரே மாதிரியில் ஒரே நேரத்தில் அளவிடப்படுகின்றன, ஆனால் மாதிரிகளின் எண்ணிக்கை பொதுவாக சிறியதாக இருக்கும் (எ.கா. 20 நோயாளிகள்). இந்த "பல மாறிகள், சில மாதிரிகள்" சூழ்நிலை உயிரியல் மற்றும் AI மிகவும் உதவியாக இருக்கும் பகுதிகளுக்கு தனித்துவமான சவால்களின் மூலமாகும்.
இந்த அலகில், டிரான்ஸ்கிரிப்டோமிக்ஸ் (RNA-seq) உதாரணத்தின் மூலம் வேறுபட்ட வெளிப்பாடு பகுப்பாய்வு (இரண்டு குழுக்களுக்கு இடையே வெளிப்பாடு கணிசமாக மாறும் மரபணுக்களைக் கண்டறிதல்) மற்றும் இந்த வேலைப்பாய்வுகளில் செயற்கை நுண்ணறிவின் பங்கு பற்றி விவாதிப்போம்.
உயர் பரிமாண தரவுகளின் முக்கிய பிரச்சனை
நீங்கள் ஒரே நேரத்தில் ஆயிரக்கணக்கான மரபணுக்களை சோதித்தால், உண்மையான வேறுபாடுகள் இல்லாவிட்டாலும், தற்செயலாக "குறிப்பிடத்தக்கதாக" தோன்றும் மரபணுக்களை நீங்கள் காணலாம். நீங்கள் 20,000 மரபணுக்களை 5% மார்ஜின் பிழையுடன் சோதித்தால், ~1,000 மரபணுக்கள் தற்செயலாக "குறிப்பிடத்தக்கதாக" மாறக்கூடும். இது பல ஒப்பீட்டு சிக்கல் என்று அழைக்கப்படுகிறது மற்றும் ஓமிக்ஸ் பகுப்பாய்வின் மிக முக்கியமான ஆபத்து ஆகும். p-மதிப்புகளை சரிசெய்வதே தீர்வு (எ.கா. FDR-ஐ பெஞ்சமினி-ஹோச்பெர்க் முறையில் தவறான கண்டுபிடிப்பு விகிதம் கணக்கிடுதல்). இந்தக் கருத்தை விளக்குவதற்கும் சரியான குறியீட்டை எழுதுவதற்கும் AI மிகவும் உதவியாக இருக்கிறது; ஆனால் திருத்தத்தைப் பயன்படுத்துவதை நினைவில் கொள்வது உங்கள் பொறுப்பு.
உதவிக்குறிப்பு: ஓமிக்ஸ் முடிவில் "3,000 மரபணுக்கள் கணிசமாக மாறியுள்ளன" போன்ற எண்ணைக் கண்டால், எச்சரிக்கையாக இருங்கள். இது பொதுவாக பல ஒப்பீடு திருத்தம் செய்யப்படவில்லை என்பதற்கான அறிகுறியாகும். ஒரு யதார்த்தமான பட்டியல் நன்கு வடிவமைக்கப்பட்ட சோதனையில் பத்து முதல் பல நூறு மரபணுக்கள் வரை இருக்கும்.
RNA-seq வேறுபாடு வெளிப்பாடு: படிப்படியாக
- மூல எண்ணிக்கைகள்: ஒவ்வொரு மரபணுவிற்கும் ஒவ்வொரு மாதிரியிலும் எத்தனை ரீட்கள் விழுந்தன என்பதைக் கொண்ட அட்டவணை.
- தரம் மற்றும் வடிகட்டுதல்: மிகக் குறைந்த வெளிப்பாடு கொண்ட மரபணுக்களை நிராகரிக்கவும்.
- இயல்பாக்கம்: மாதிரிகள் இடையே சரியான நூலக அளவு வேறுபாடு (முரட்டு எண்ணை ஒப்பிட முடியாது).
- புள்ளிவிவர மாதிரி: பைத்தானில் DESeq2 அல்லது எட்ஜ்ஆர் (R நூலகங்கள்) அல்லது pyDESeq2 உடன் குழு வேறுபாட்டைச் சோதிக்கவும்.
- பல ஒப்பீடு திருத்தம்: FDR ஐக் கணக்கிடுங்கள்; பொதுவாக FDR <0.05 இன் வரம்பு.
- விளைவு அளவு: log2 மடங்கு மாற்றத்துடன் மதிப்பிடவும்: வெளிப்பாடு எத்தனை முறை அதிகரிக்கிறது/குறைகிறது.
- கருத்து: உயிரியல் பாதைகளுடன் குறிப்பிடத்தக்க மரபணுக்களை இணைக்கவும்.
செயற்கை நுண்ணறிவு 3-6. இது படிகளை குறியிடுகிறது, கருத்துகளை விளக்குகிறது மற்றும் வெளியீட்டை விளக்க உதவுகிறது. இருப்பினும், உங்கள் மூலத் தரவைப் பார்க்காமல் "எந்த மரபணு மாறியது" என்று மாடல் கூற முடியாது; குறியீடு மற்றும் புள்ளிவிவரங்கள் இதை உங்களுக்குக் கூறுகின்றன.
நகலெடுக்கக்கூடிய உடனடி வார்ப்புருக்கள்
பங்கு: நீங்கள் டிரான்ஸ்கிரிப்டோமிக் பகுப்பாய்வு உதவியாளர். சூழல்: என்னிடம் 12 கட்டுப்பாடு, 12 சிகிச்சை மாதிரிகளிலிருந்து RNA-seq raw count table (CSV) உள்ளது. பணி: pyDESeq2 உடன் வேறுபட்ட வெளிப்பாடு பகுப்பாய்வின் படிகளைப் பட்டியலிடுங்கள், ஒவ்வொரு அடியும் ஏன் அவசியம் என்பதை விளக்குங்கள். முதலில் திட்டமிடுங்கள், இரண்டாவது குறியீடு. பல ஒப்பீட்டுத் திருத்தங்களைச் சேர்க்க வேண்டும்.
எனது பகுப்பாய்வு வெளியீடு 4,200 மரபணுக்களை "p<0.05" எனக் காட்டியது. இது ஏன் சந்தேகத்திற்குரியதாக இருக்கலாம்? பல ஒப்பீட்டு திருத்தத்தை (பெஞ்சமினி-ஹோச்பெர்க் FDR) விளக்கி, சரியான வடிகட்டலைச் செய்யும் பைதான் குறியீட்டைக் கொடுங்கள்.
எனது வேறுபட்ட வெளிப்பாடு முடிவு அட்டவணையில் (ஜீன், log2FC, padj நெடுவரிசைகள்) இருந்து எரிமலை சதி வரையப்பட்ட குறியீட்டை எழுதவும். FDR<0.05 மற்றும் |log2FC|>1 உடன் மரபணுக்களுக்கு வண்ணம் கொடுங்கள், முதல் 10ஐ லேபிளிடுங்கள்.
பாதை செறிவூட்டலுக்கான இந்த குறிப்பிடத்தக்க மரபணு பட்டியலை நான் எவ்வாறு பகுப்பாய்வு செய்வது? gseapy அல்லது g:Profiler படிகளை விளக்குங்கள். கருத்துரையில் முழுமையான காரணத்தைக் கோர வேண்டாம், தொடர்பு மொழியைப் பயன்படுத்தவும். மரபணு பட்டியல்: [பட்டியல்]
பலவீனமான வரியில் / வலுவான வரியில்
பலவீனம்: "RNA-seq விளைச்சலில் எந்த மரபணுக்கள் முக்கியமானவை என்று சொல்லுங்கள்."
வலிமையானது: "என்னிடம் 12 கட்டுப்பாடு, 12 சிகிச்சை மாதிரிகள்: மரபணு, log2FoldChange, padj நெடுவரிசைகள் ஆகியவற்றிலிருந்து pyDESeq2 வெளியீடு உள்ளது. குறிப்பிடத்தக்க மரபணுக்களை FDR<0.05 மற்றும் |log2FC|>1 ஆகியவற்றின் நுழைவாயில்களுடன் வடிகட்டும் குறியீட்டைக் கொடுங்கள், அவற்றின் எண்களைப் புகாரளித்து, இந்த மரபணுவின் அளவு ஏன் வலுவானது என்பதை விளக்குகிறது. நியாயமான."
வேறுபாடு: சக்திவாய்ந்த வரியில் உண்மையான வெளியீட்டு நெடுவரிசைகள், வரம்புகள் மற்றும் சரிபார்ப்பு கோரிக்கை உள்ளது. உருவாக்கப்பட்ட மரபணு பெயரை உருவாக்குவதற்கு பதிலாக மாதிரி உங்கள் தரவை செயலாக்குகிறது.
மூன்று சிறிய வழக்குகள்
வழக்கு 1 — திருத்தம் இல்லாத பேரழிவு: ஒரு குழு p<0.05 உடன் 3,800 "குறிப்பிடத்தக்க" மரபணுக்களை திருத்தம் செய்யாமல் கண்டறிந்து அதை ஒரு வெளியீட்டிற்கு சமர்ப்பித்தது. நடுவர் FDR திருத்தத்தைக் கேட்டபோது, பட்டியல் 47 மரபணுக்களாகக் குறைந்தது. செயற்கை நுண்ணறிவு ஆரம்பத்திலிருந்தே பெஞ்சமினி-ஹோச்பெர்க் குறியீட்டை சேர்த்திருந்தால், இந்த சங்கடம் ஏற்பட்டிருக்காது. பாடம்: திருத்தம் என்பது பேரம் பேச முடியாதது.
வழக்கு 2 - தொகுதி விளைவு: ஒரு ஆய்வில், மாதிரிகள் இரண்டு வெவ்வேறு நாட்களில் செயலாக்கப்பட்டன. "நோயாளி மற்றும் கட்டுப்பாடு" வித்தியாசம் என்று அவர்கள் நினைத்தது உண்மையில் "1வது நாள் மற்றும் 2வது நாள்" வித்தியாசம் (தொகுப்பு விளைவு: மாதிரி பார்ட்டி காரணமாக தொழில்நுட்ப வேறுபாடு). மாதிரியில் தொகுதி மாறியைச் சேர்ப்பதன் மூலம் போலியான சிக்னலைக் களைய AI உதவியது (மாடல் சூத்திரத்தில் ~ தொகுதி + நிபந்தனை).
வழக்கு 3 — மடிப்பு மாற்றத்தை புறக்கணித்தல்: ஒரு மாணவர் "மிக முக்கியமான" மரபணுவை அறிவித்தார், அதன் வெளிப்பாடு 2% மாறியது, ஆனால் p-மதிப்பைப் பார்ப்பதன் மூலம் மிகவும் நிலையானதாக அளவிடப்பட்டது. அதேசமயம் விளைவு அளவு (log2FC) கிட்டத்தட்ட பூஜ்ஜியமாக இருந்தது; புள்ளிவிவர முக்கியத்துவம் உயிரியல் முக்கியத்துவம் அல்ல. மாடல் இந்த வேறுபாட்டை விளக்கியது மற்றும் அதை எரிமலை வரைபடத்துடன் காட்சிப்படுத்த பரிந்துரைத்தது.
ஒப்பீட்டு அட்டவணை: கருத்து தெளிவு
கருத்து
பொருள்
அது ஏன் முக்கியம்?
p-மதிப்பு
வித்தியாசத்தின் நிகழ்தகவு ஒரு தற்செயல்
மட்டுமே தவறாக வழிநடத்த முடியும்
FDR (padj)
பல சோதனைகளில் பிழை விகிதம் சரி செய்யப்பட்டது
தவறான நேர்மறைகளை கட்டுப்படுத்துகிறது
log2 மடங்கு மாற்றம்
விளைவு அளவு
உயிரியல் முக்கியத்துவத்தைக் குறிக்கிறது
தொகுதி விளைவு
தொழில்நுட்ப தொகுதி வேறுபாடு
போலியான சமிக்ஞையை உருவாக்குகிறது
இயல்பாக்கம்
மாதிரி அளவிலான திருத்தம்
ஒப்பீட்டை நியாயப்படுத்துகிறது
பொதுவான தவறுகள்
- பல ஒப்பீடு திருத்தத்தைத் தவிர்ப்பது: மிகவும் பொதுவான மற்றும் மிகவும் தீவிரமான தவறு.
- p-மதிப்பைப் பார்க்கவும்: விளைவு அளவை (log2FC) ஒன்றாகக் கருத்தில் கொள்ளுங்கள்.
- மாதிரியில் தொகுதி விளைவைச் சேர்க்கவில்லை: உயிரியல் வேறுபாட்டிற்கு தொழில்நுட்ப வேறுபாட்டைத் தவறாகப் புரிந்துகொள்வது.
- இயல்பாக்கத்தை மறத்தல்: மூல எண்களை நேரடியாக ஒப்பிடுதல்.
- காரண மொழி: "இந்த மரபணு நோயை உண்டாக்குகிறது" என்று கூறுவது; ஓமிக்ஸ் தரவு தொடர்புகளைக் காட்டுகிறது, காரணத்திற்கு கூடுதல் பரிசோதனை தேவைப்படுகிறது.
எச்சரிக்கை: உயர் பரிமாண தரவுகளில், "புள்ளியியல் முக்கியத்துவம் வாய்ந்தது" மற்றும் "உயிரியல் ரீதியாக முக்கியத்துவம் வாய்ந்தது" என்பது இரண்டு வெவ்வேறு விஷயங்கள். செயற்கை நுண்ணறிவால் உருவாக்கப்பட்ட மரபணு பட்டியல் ஆரம்ப கருதுகோள்; ஒவ்வொரு வேட்பாளர் மரபணுவும் சுயாதீன முறை (qPCR, புரத அளவீடு) மூலம் சரிபார்க்கப்படாமல் உறுதியானதாக கருதப்படக்கூடாது.
அளவு குறைப்பு மற்றும் தரக் கட்டுப்பாடு
உயர் பரிமாண தரவுகளில் முதலில் செய்ய வேண்டியது மாதிரிகளின் பொதுவான கட்டமைப்பைப் பார்ப்பது. பிசிஏ (முக்கிய கூறு பகுப்பாய்வு: ஆயிரக்கணக்கான மாறிகளை ஒரு சில சுருக்க அச்சுகளாகக் குறைத்து அவற்றை 2 பரிமாணங்களில் காட்டுவது) இதற்கான நிலையான கருவியாகும். நீங்கள் எதிர்பார்க்கும் குழுக்கள் (கட்டுப்பாடு/சிகிச்சை) பிசிஏ விளக்கப்படத்தில் பிரிக்கப்பட்டிருந்தால், அது நல்லது; ஆனால் மாதிரிகள் குழுவாக இல்லாமல் "நாள் செயலாக்கம்" மூலம் கொத்தாக இருந்தால், இது ஒரு தொகுதி விளைவு எச்சரிக்கை. அதே விளக்கப்படம் உடனடியாக ஒரு ஒற்றை வெளிப்புற (தோல்வியுற்ற) உதாரணத்தைக் காட்டுகிறது.
எனது இயல்பாக்கப்பட்ட வெளிப்பாடு அட்டவணையில் இருந்து PCA ஐ வரையவும் (வரிசை மரபணு, நெடுவரிசை மாதிரி). குழுவின் வண்ண மாதிரிகள் (கட்டுப்பாடு/சிகிச்சை), செயலாக்க தொகுதி மூலம் வடிவம். வரைபடத்தில் ஒரு தொகுதி விளைவு அல்லது வெளிப்புற முறை காணப்படுகிறதா என்பதைப் பற்றி கருத்து தெரிவிக்கவும்.
இந்த ஹூரிஸ்டிக் படி மீதமுள்ள பகுப்பாய்வை இயக்குகிறது: போலியான முடிவுகளில் மாதங்களை வீணாக்குவதை விட, ஒரு வெளிப்புறத்தை முன்கூட்டியே பிடிப்பது நல்லது.
ஒற்றை செல் தரவு: ஒரு புதிய பரிமாணம்
சமீபத்திய ஆண்டுகளில், ஒற்றை செல் RNA வரிசைமுறை (ஒற்றை செல் RNA-seq: ஆயிரக்கணக்கான தனிப்பட்ட செல்களின் வெளிப்பாடு சுயவிவரத்தை அளவிடுதல்) பரவலாகிவிட்டது. இங்கே தரவு இன்னும் பெரியதாகிறது: பல்லாயிரக்கணக்கான செல்கள், ஆயிரக்கணக்கான மரபணுக்கள் ஒவ்வொன்றும். Scanpy (Python) போன்ற கருவிகள் இந்தத் தரவைச் செயலாக்குகின்றன; செல்களைக் கூட்டி, செல் வகைகளை அடையாளம் காட்டுகிறது. இந்த பணிப்பாய்வுக்கான குறியீட்டை AI எழுதுகிறது, ஆனால் உயிரணு வகைகளின் உயிரியல் பெயரிடல் (ஒரு கிளஸ்டர் "டி செல்" அல்லது "மேக்ரோபேஜ்") மார்க்கர் மரபணுக்கள் மற்றும் நிபுணர் அறிவை நம்பியுள்ளது. அறியப்பட்ட குறிப்பான்களைக் கொண்ட ஒரு கிளஸ்டருக்கு மாடல் ஒதுக்கும் செல் வகை லேபிளை உறுதிசெய்யவும்; ஒற்றை செல் பகுப்பாய்வில் இது பொதுவாக தவறாகப் புரிந்துகொள்ளப்பட்ட படியாகும்.
திறந்த தரவு மற்றும் இனப்பெருக்கம்
பெரும்பாலான ஓமிக்ஸ் ஆய்வுகள் பொது களஞ்சியங்களில் தங்கள் தரவைப் பதிவேற்றுகின்றன: GEO (ஜீன் எக்ஸ்பிரஷன் ஆம்னிபஸ்) மற்றும் மரபணு வெளிப்பாட்டிற்கான ArrayExpress, மூல வரிசைகளுக்கு SRA (வரிசை வாசிப்பு காப்பகம்), புரோட்டியோமிக்ஸிற்கான PRIDE. இது மிகவும் முக்கியமானது, இதனால் மற்றவர்கள் உங்கள் முடிவுகளைச் சரிபார்க்க முடியும் மற்றும் பிற ஆய்வுகளின் தரவை நீங்கள் மறுபரிசீலனை செய்ய முடியும். ஜியோ பதிவு எண்ணிலிருந்து (எ.கா. GSE எண்) தரவைப் பதிவிறக்கி ஒழுங்கமைக்கும் குறியீட்டை (GEOparse போன்ற கருவிகளுடன்) AI எழுத முடியும்; ஆனால் அசல் பதிவிலிருந்து நீங்கள் பதிவிறக்கிய தரவின் வடிவமைப்பை (எத்தனை குழுக்கள், எத்தனை முறை, எந்த செயல்முறை) படித்து உறுதிப்படுத்திக் கொள்ளுங்கள். மாதிரியானது ஒரு ஆய்வின் வடிவமைப்பை "நினைவில் வைத்திருப்பதாக" கூறினால், இது எப்போதும் சரிபார்க்கப்பட வேண்டிய ஒரு யூகமாகும்.
சுருக்கமாக
ஓமிக்ஸ் தரவு ஒரு சிறிய மாதிரி அளவில் ஆயிரக்கணக்கான மாறிகளை அளவிடுகிறது; இது பல ஒப்பீடுகள், தொகுதி விளைவுகள் மற்றும் மிகை விளக்கம் ஆகியவற்றின் பொறிகளை உருவாக்குகிறது. செயற்கை நுண்ணறிவு; இது வேறுபட்ட வெளிப்பாடு பகுப்பாய்விற்கான குறியீட்டை எழுதுகிறது, கருத்துகளை விளக்குகிறது மற்றும் முடிவுகளை விளக்க உதவுகிறது. எவ்வாறாயினும், FDR திருத்தத்தைப் பயன்படுத்துவது, விளைவு அளவை மதிப்பிடுவது மற்றும் காரணத்தின் மொழியைத் தவிர்ப்பது உங்கள் பொறுப்பு. சுயாதீன முறை மூலம் சரிபார்க்கப்படும் வரை வேட்பாளர் மரபணுக்கள் கருதுகோள்களாகும்.
விண்ணப்ப பணி
மாதிரி வேறுபாடு வெளிப்பாடு முடிவுகள் அட்டவணையைப் பெறவும் அல்லது உருவாக்கவும் (gen, log2FC, padj). FDR<0.05 மற்றும் |log2FC|>1 மூலம் வடிகட்டி, குறிப்பிடத்தக்க மரபணுக்களின் எண்ணிக்கையைப் புகாரளித்து, எரிமலை வரைபடத்தைத் திட்டமிடும் AI எழுத்துக் குறியீட்டை வைத்திருங்கள். குறியீட்டை இயக்கவும். திருத்தம் செய்யப்படாவிட்டால், எத்தனை மரபணுக்கள் "குறிப்பிடத்தக்கதாக" தோன்றும் என்பதை மாதிரி கணக்கிட்டு, வேறுபாட்டை விளக்கவும்.
சரிபார்ப்பு பட்டியல்
- [ ] நான் பல ஒப்பீட்டு திருத்தத்தை (FDR) பயன்படுத்தினேன்.
- நான் விளைவு அளவு (log2FC) மற்றும் [ ] p-மதிப்பை மதிப்பீடு செய்தேன்.
- [ ] நான் தொகுதி/தொழில்நுட்ப மாறிகளை சரிபார்த்தேன்.
- [ ] நான் இயல்பாக்குதல் படியைத் தவிர்க்கவில்லை.
- [ ] நான் காரணத்தை விட தொடர்பு மொழியை பயன்படுத்தினேன்.
- [ ] நான் வேட்பாளர் மரபணுக்களை உறுதிப்படுத்த வேண்டிய கருதுகோள்களாகக் குறித்தேன்.