ලාභ:
- බහු සංසන්දනාත්මක ගැටලුව අවබෝධ කර ගැනීමේ හැකියාව සහ විශ්ලේෂණයේදී FDR (ව්යාජ සොයාගැනීම් අනුපාතය) නිවැරදි කිරීම ඇතුළත් කිරීම
- p-අගය සහ ප්රයෝග ප්රමාණය (log2 ගුණයකින් වෙනස් වීම) එකට ඇගයීම මගින් සංඛ්යානමය සහ ජීව විද්යාත්මක වැදගත්කම වෙන්කර හඳුනා ගැනීමේ හැකියාව
- කාණ්ඩ ආචරණය සහ හේතුව පැනීම වැනි අධි-මාන දත්ත උගුල් හඳුනා ගැනීමට සහ වළක්වා ගැනීමට හැකියාව
"ඕමික්ස්" යන වචනය සෛලයක ඇති අණු කාණ්ඩයක් මනිනු ලබන ප්රවේශයන් විස්තර කරයි: ප්රවේණි විද්යාව (සියලු DNA), ට්රාන්ස්ක්රිප්ටොමික්ස් (සියලු RNA / ජාන ප්රකාශනය), ප්රෝටියෝමික්ස් (සියලු ප්රෝටීන), පරිවෘත්තීය (සියලු කුඩා අණු). මෙම මිනුම්වල පොදු ලක්ෂණය වන්නේ ඒවායේ ඉහළ මානයයි: එක් නියැදියක දහස් ගණනක් හෝ දස දහස් ගණනක් (ජාන, ප්රෝටීන) එකවර මනිනු ලැබේ, නමුත් සාම්පල සංඛ්යාව සාමාන්යයෙන් කුඩා වේ (උදා: රෝගීන් 20). මෙම "බොහෝ විචල්යයන්, සාම්පල කිහිපයක්" තත්ත්වය ජීව විද්යාවට අනන්ය වූ අභියෝගවල මූලාශ්රය සහ AI වඩාත් ප්රයෝජනවත් විය හැකි ක්ෂේත්ර වේ.
මෙම ඒකකයේදී, අපි අවකල ප්රකාශන විශ්ලේෂණය (කණ්ඩායම් දෙකක් අතර ප්රකාශනය සැලකිය යුතු ලෙස වෙනස් වන ජාන සොයා ගැනීම) සහ මෙම කාර්ය ප්රවාහයේ කෘතිම බුද්ධියේ භූමිකාව පිටපත් කිරීමේ උදාහරණය හරහා සාකච්ඡා කරමු (RNA-seq).
ඉහළ මාන දත්තවල ප්රධාන ගැටළුව
ඔබ ජාන දහස් ගණනක් එකවර පරීක්ෂා කළහොත්, සැබෑ වෙනස්කම් නොමැති වුවද, අහම්බෙන් "වැදගත්" ලෙස පෙනෙන ජාන ඔබට හමුවනු ඇත. ඔබ ජාන 20,000ක් 5% ආන්තික දෝෂයක් සමඟ පරීක්ෂා කළහොත්, ජාන ~1,000ක් අහම්බෙන් "වැදගත්" බවට පත් විය හැක. මෙය බහු සංසන්දන ගැටලුව ලෙස හඳුන්වනු ලබන අතර ඔමික්ස් විශ්ලේෂණයේ වඩාත් තීරණාත්මක අන්තරාය වේ. විසඳුම වන්නේ p-අගය නිවැරදි කිරීමයි (උදා: FDR ගණනය කිරීම - Benjamini-Hochberg ක්රමය සමඟ වැරදි සොයාගැනීම් අනුපාතය). මෙම සංකල්පය පැහැදිලි කිරීමට සහ නිවැරදි කේතය ලිවීමට AI ඉතා උපකාරී වේ; නමුත් නිවැරදි කිරීම යෙදීමට මතක තබා ගැනීම ඔබේ වගකීමකි.
ඉඟිය: ඔමික්ස් ප්රතිඵලයක "ජාන 3,000ක් සැලකිය යුතු ලෙස වෙනස් වී ඇත" වැනි සංඛ්යාවක් ඔබ දුටුවහොත් කලබල වන්න. මෙය සාමාන්යයෙන් බහු සංසන්දන නිවැරදි කිරීමක් සිදු කර නොමැති බවට ලකුණකි. යථාර්ථවාදී ලැයිස්තුවක් හොඳින් සැලසුම් කරන ලද අත්හදා බැලීමක දී ජාන දස සිට සිය ගණනක් දක්වා වනු ඇත.
RNA-seq අවකල ප්රකාශනය: පියවරෙන් පියවර
- අමු ගණන්: එක් එක් ජානය සඳහා එක් එක් සාම්පලයේ කියවීම් කීයක් ඇතුළත් වගුව.
- ගුණාත්මකභාවය සහ පෙරීම: ඉතා අඩු ප්රකාශනයක් සහිත ජාන ඉවතලන්න.
- සාමාන්යකරණය: සාම්පල අතර නිවැරදි පුස්තකාල ප්රමාණයේ වෙනස (බ්රූට් අංකය සැසඳිය නොහැක).
- සංඛ්යාන ආකෘතිය: Python හි DESeq2 හෝ edgeR (R libraries) හෝ pyDESeq2 සමඟ කණ්ඩායම් වෙනස පරීක්ෂා කරන්න.
- බහු සංසන්දන නිවැරදි කිරීම: FDR ගණනය කරන්න; සාමාන්යයෙන් FDR හි එළිපත්ත <0.05.
- ප්රයෝග ප්රමාණය: log2 ගුණයකින් වෙනස් වීම සමඟ ඇගයීම: ප්රකාශනය කොපමණ වාර ගණනක් වැඩි වේද/අඩුවේද.
- සටහන: ජීව විද්යාත්මක මාර්ග සමඟ සැලකිය යුතු ජාන සම්බන්ධ කරන්න.
කෘතිම බුද්ධිය 3-6. එය පියවර සංකේත කරයි, සංකල්ප පැහැදිලි කරයි, සහ ප්රතිදානය අර්ථ නිරූපණය කිරීමට ඔබට උපකාරී වේ. කෙසේ වෙතත්, ආකෘතියට ඔබේ අමු දත්ත නොදැක "වෙනස් වූ ජානය" පැවසිය නොහැක; කේතය සහ සංඛ්යාලේඛන ඔබට මෙය කියයි.
පිටපත් කළ හැකි ක්ෂණික සැකිලි
භූමිකාව: ඔබ පිටපත් විශ්ලේෂණ සහායකයා වේ. සන්දර්භය: මා සතුව පාලන 12කින්, ප්රතිකාර සාම්පල 12කින් RNA-seq raw count table (CSV) ඇත. කාර්යය: pyDESeq2 සමඟ අවකල ප්රකාශන විශ්ලේෂණයේ පියවර ලැයිස්තුගත කරන්න, එක් එක් පියවර අවශ්ය වන්නේ මන්දැයි පැහැදිලි කරන්න. පළමුව සැලසුම් කරන්න, දෙවනුව කේතය. බහු සංසන්දන නිවැරදි කිරීම් ඇතුළත් කිරීමට වග බලා ගන්න.
මගේ විශ්ලේෂණ ප්රතිදානය "p<0.05" ලෙස ජාන 4,200ක් පෙන්නුම් කළේය. මෙය සැක සහිත විය හැක්කේ ඇයි? බහු සංසන්දන නිවැරදි කිරීම් (Benjamini-Hochberg FDR) පැහැදිලි කර නිවැරදි පෙරීම සිදු කරන Python කේතය ලබා දෙන්න.
මගේ අවකල ප්රකාශන ප්රතිඵල වගුවෙන් (ජාන, log2FC, padj තීරු) ගිනිකන්ද කුමන්ත්රණයක් අඳින කේතය ලියන්න. FDR<0.05 සහ |log2FC|>1 සමඟ ජාන වර්ණවත් කරන්න, ඉහළම 10 ලේබල් කරන්න.
මාර්ග සුපෝෂණය සඳහා මෙම සැලකිය යුතු ජාන ලැයිස්තුව විශ්ලේෂණය කරන්නේ කෙසේද? gseapy හෝ g:Profiler පියවර පැහැදිලි කරන්න. අදහස් දැක්වීමේදී නිරපේක්ෂ හේතුකාරකත්වය ප්රකාශ නොකරන්න, සහසම්බන්ධ භාෂාව භාවිතා කරන්න. ජාන ලැයිස්තුව: [ලැයිස්තුව]
දුර්වල ක්ෂණික / ශක්තිමත් විමසුම
දුර්වල: "RNA-seq අස්වැන්නෙහි වැදගත් වන ජාන මොනවාදැයි මට කියන්න."
ප්රබලයි: "මට පාලනය 12කින්, ප්රතිකාර සාම්පල 12කින් pyDESeq2 ප්රතිදානය ඇත: ජාන සහිත වගුව, log2FoldChange, padj තීරු. FDR<0.05 සහ |log2FC|>1 හි සීමාවන් සහිත සැලකිය යුතු ජාන පෙරහන් කරන කේතයක් ලබා දෙන්න, ඒවායේ සංඛ්යා වාර්තා කරයි, සහ මෙම ජානය ප්රබලම ප්රමාණයෙන් පැහැදිලි කරන්නේ ඇයි? සාධාරණ."
වෙනස: ප්රබල විමසුමේ සත්ය ප්රතිදාන තීරු, සීමාවන් සහ වලංගු කිරීමේ ඉල්ලීම ඇත. සාදන ලද ජාන නාමයක් උත්පාදනය කිරීම වෙනුවට ආකෘතිය ඔබේ දත්ත සකසයි.
කුඩා නඩු තුනක්
නඩුව 1 — නිවැරදි කිරීමකින් තොරව ආපදා: කණ්ඩායමක් විසින් p<0.05 සහිත “සැලකිය යුතු” ජාන 3,800ක් නිවැරදි කිරීමකින් තොරව සොයාගෙන ප්රකාශනයකට ඉදිරිපත් කරන ලදී. විනිසුරු FDR නිවැරදි කිරීම ඉල්ලා සිටි විට, ලැයිස්තුව ජාන 47 දක්වා පහත වැටුණි. කෘතිම බුද්ධිය මුල සිටම Benjamini-Hochberg කේතය එකතු කළා නම්, මෙම අපහසුතාවයට පත් නොවනු ඇත. පාඩම: නිවැරදි කිරීම සාකච්ඡා කළ නොහැක.
සිද්ධි 2 — කාණ්ඩ ආචරණය: එක් අධ්යයනයක දී, සාම්පල වෙනස් දින දෙකකදී සකස් කරන ලදී. "රෝගියා එදිරිව පාලනය" වෙනසක් ලෙස ඔවුන් සිතුවේ ඇත්ත වශයෙන්ම "පළමු දිනය එදිරිව 2 වන දිනය" වෙනසකි (කණ්ඩායම් බලපෑම: නියැදීම් පාර්ශවය හේතුවෙන් තාක්ෂණික වෙනස). මොඩලයට කාණ්ඩ විචල්යය එක් කිරීමට යෝජනා කිරීමෙන් ව්යාජ සංඥාව ඉවත් කිරීමට AI උදවු කළේය (~ කාණ්ඩය + මාදිලි සූත්රයේ තත්ත්වය).
3 වන අවස්ථාව — නැමීම් වෙනස් කිරීම නොසලකා හැරීම: ශිෂ්යයෙක් "වඩාත්ම වැදගත්" ජානයක් ප්රකාශ කළේය, එහි ප්රකාශනය 2% කින් වෙනස් වූ නමුත් p-අගය දෙස බැලීමෙන් ඉතා ස්ථායී ලෙස මනිනු ලැබේ. බලපෑමේ ප්රමාණය (log2FC) පාහේ ශුන්ය වූ අතර; සංඛ්යානමය වැදගත්කම ජීව විද්යාත්මක වැදගත්කමක් නොවේ. ආකෘතිය මෙම වෙනස පැහැදිලි කළ අතර එය ගිනිකඳු ප්රස්ථාරයකින් දෘශ්යමාන කිරීමට යෝජනා කළේය.
සංසන්දනාත්මක වගුව: සංකල්ප පැහැදිලිකම
සංකල්පය
අර්ථය
එය වැදගත් වන්නේ ඇයි?
p-අගය
වෙනසෙහි සම්භාවිතාව අහඹු සිදුවීමකි
තනියම නොමඟ යවන්න පුළුවන්
FDR (padj)
බහු පරීක්ෂණ වලදී නිවැරදි කරන ලද දෝෂ අනුපාතය
ව්යාජ ධනාත්මක සීමා කරයි
log2 ගුණයකින් වෙනස් කිරීම
බලපෑම ප්රමාණය
ජීව විද්යාත්මක වැදගත්කම පෙන්නුම් කරයි
කණ්ඩායම් බලපෑම
තාක්ෂණික කණ්ඩායම් වෙනස
ව්යාජ සංඥා නිර්මාණය කරයි
සාමාන්යකරණය
අන්තර් සාම්පල පරිමාණ නිවැරදි කිරීම
සැසඳීම සාධාරණ කරයි
පොදු වැරදි
- බහු සංසන්දන නිවැරදි කිරීම මඟ හැරීම: වඩාත් පොදු සහ බරපතලම වැරැද්ද.
- p-අගය දෙස බැලීම: ප්රයෝග ප්රමාණය (log2FC) එකට සලකා බැලීමට වග බලා ගන්න.
- ආකෘතියේ කාණ්ඩ ආචරණය ඇතුළත් නොවේ: ජීව විද්යාත්මක වෙනසක් සඳහා තාක්ෂණික වෙනසක් වරදවා වටහා ගැනීම.
- සාමාන්යකරණය අමතක කිරීම: අමු සංඛ්යා සෘජුවම සංසන්දනය කිරීම.
- හේතුකාරක භාෂාව: "මෙම ජානය රෝග ඇති කරයි" යැයි පැවසීම; Omics දත්ත සහසම්බන්ධය පෙන්නුම් කරයි, හේතුකාරකය අතිරේක අත්හදා බැලීම් අවශ්ය වේ.
අවවාදයයි: ඉහළ-මාන දත්තවල, "සංඛ්යානමය වශයෙන් වැදගත්" සහ "ජීව විද්යාත්මකව වැදගත්" යනු වෙනස් කරුණු දෙකකි. කෘතිම බුද්ධිය මගින් නිපදවන ජාන ලැයිස්තුව ආරම්භක කල්පිතයකි; සෑම අපේක්ෂක ජානයක්ම ස්වාධීන ක්රමයකින් (qPCR, ප්රෝටීන් මැනීම) සත්යාපනය නොකර නිශ්චිත යැයි නොසැලකිය යුතුය.
ප්රමාණය අඩු කිරීම සහ තත්ත්ව පාලනය
ඉහළ-මාන දත්ත වලදී කළ යුතු පළමු දෙය වන්නේ සාම්පලවල සාමාන්ය ව්යුහය බැලීමයි. PCA (ප්රධාන සංරචක විශ්ලේෂණය: විචල්ය දහස් ගණනක් සාරාංශ අක්ෂ කිහිපයකට අඩු කිරීම සහ ඒවා මාන 2 කින් ප්රදර්ශනය කිරීම) මේ සඳහා සම්මත මෙවලම වේ. ඔබ අපේක්ෂා කරන කණ්ඩායම් (පාලනය/ප්රතිකාර) PCA ප්රස්ථාරයේ වෙන් කර ඇත්නම්, එය හොඳයි; නමුත් සාම්පල කණ්ඩායම් වශයෙන් නොව "දින සකසන ලද" මගින් පොකුරු කර ඇත්නම්, මෙය කණ්ඩායම් බලපෑම් අනතුරු ඇඟවීමකි. එම ප්රස්ථාරය වහාම තනි පිටස්තර (අසාර්ථක) උදාහරණයක් පෙන්වයි.
මගේ සාමාන්යකරණය කළ ප්රකාශන වගුවෙන් (පේළි ජානය, තීරු නියැදිය) PCA අඳින්න. කණ්ඩායම අනුව වර්ණ සාම්පල (පාලනය/ප්රතිකාර), පිරිසැකසුම් කිරීම මගින් හැඩය. ප්රස්ථාරයේ කාණ්ඩ ආචරණයක් හෝ පිටස්තර රටාවක් දක්නට ලැබේද යන්න පිළිබඳව අදහස් දක්වන්න.
මෙම හූරිස්ටික් පියවර විශ්ලේෂණයේ ඉතිරි කොටස මෙහෙයවයි: ව්යාජ ප්රතිඵලයක් මත මාස ගණනක් නාස්ති කිරීමට වඩා කලින් පිටස්තරයෙකු අල්ලා ගැනීම වඩා හොඳය.
තනි සෛල දත්ත: නව මානයක්
මෑත වසරවලදී, තනි සෛල RNA අනුක්රමණය (තනි සෛල RNA-seq: තනි සෛල දහස් ගණනක ප්රකාශන පැතිකඩ මැනීම) පුළුල් ලෙස ව්යාප්ත වී ඇත. මෙහි දත්ත තවත් විශාල වේ: සෛල දස දහස් ගණනක්, එක් එක් ජාන දහස් ගණනක්. Scanpy (Python) වැනි මෙවලම් මෙම දත්ත සකසයි; සෛල පොකුරු කොට සෛල වර්ග හඳුනා ගනී. AI මෙම කාර්ය ප්රවාහය සඳහා කේතය ලියයි, නමුත් සෛල වර්ගවල ජීව විද්යාත්මක නාමකරණය (පොකුරක් "T සෛලයක්" හෝ "මැක්රෝෆේජ්" වේවා) සලකුණු ජාන සහ විශේෂඥ දැනුම මත රඳා පවතී. දන්නා සලකුණු සහිත පොකුරකට ආකෘතිය පවරා ඇති සෛල වර්ග ලේබලය තහවුරු කිරීමට වග බලා ගන්න; මෙය තනි සෛල විශ්ලේෂණයේ බහුලවම වරදවා වටහාගත් පියවරකි.
විවෘත දත්ත සහ ප්රතිනිෂ්පාදනය
බොහෝ omics අධ්යයනයන් ඔවුන්ගේ දත්ත පොදු ගබඩාවලට උඩුගත කරයි: GEO (Gene Expression Omnibus) සහ ජාන ප්රකාශනය සඳහා ArrayExpress, raw අනුපිළිවෙල සඳහා SRA (Sequence Read Archive), ප්රෝටෝමික්ස් සඳහා PRIDE. අන් අයට ඔබේ ප්රතිඵල සත්යාපනය කිරීමට සහ ඔබට වෙනත් අධ්යයනවලින් දත්ත නැවත විශ්ලේෂණය කිරීමට හැකි වන පරිදි මෙය ඉතා වැදගත් වේ. AI හට GEO ලියාපදිංචි අංකයකින් (උදා: GSE අංකය) දත්ත බාගත කර සංවිධානය කරන කේතය (GEOparse වැනි මෙවලම් සමඟ) ලිවිය හැක; නමුත් ඔබ බාගත කළ දත්තවල සැලසුම (කණ්ඩායම් කීයක්, පුනරාවර්තන කීයක්, කුමන ක්රියාවලියක්) මුල් වාර්තාවෙන් කියවා තහවුරු කිරීමට වග බලා ගන්න. අධ්යයනයක සැලසුම "මතක තබා ගැනීමට" ආකෘතිය කියා සිටින්නේ නම්, මෙය සෑම විටම පාහේ සත්යාපනය කළ යුතු අනුමානයකි.
සාරාංශයකින්
Omics දත්ත කුඩා නියැදි ප්රමාණයකින් විචල්ය දහස් ගණනක් මනිනු ලබයි; මෙය බහුවිධ සැසඳීම්, කණ්ඩායම් බලපෑම් සහ අධි අර්ථකථනවල උගුල් නිර්මාණය කරයි. කෘතිම බුද්ධිය; එය අවකල ප්රකාශන විශ්ලේෂණය සඳහා කේතය ලියයි, සංකල්ප පැහැදිලි කරයි, සහ ප්රතිඵල අර්ථ නිරූපණය කිරීමට ඔබට උපකාර කරයි. කෙසේ වෙතත්, FDR නිවැරදි කිරීම යෙදීම, බලපෑමේ ප්රමාණය තක්සේරු කිරීම සහ හේතුකාරක භාෂාවෙන් වැළකී සිටීම ඔබේ වගකීමකි. ස්වාධීන ක්රමය මගින් තහවුරු කරන තෙක් අපේක්ෂක ජාන උපකල්පන වේ.
යෙදුම් කාර්යය
නියැදි අවකල ප්රකාශන ප්රතිඵල වගුවක් ලබා ගන්න හෝ සාදන්න (gen, log2FC, padj). FDR<0.05 සහ |log2FC|>1 මගින් පෙරන, සැලකිය යුතු ජාන සංඛ්යාව වාර්තා කරන සහ ගිනිකඳු ප්රස්ථාරයක් සැලසුම් කරන AI ලිවීමේ කේතය සපයා ගන්න. කේතය ධාවනය කරන්න. නිවැරදි කිරීම සිදු නොකළේ නම් "සැලකිය යුතු" ජාන කීයක් දිස්වනු ඇත්දැයි ආකෘතිය ගණනය කර වෙනස අර්ථකථනය කරන්න.
පිරික්සුම් ලැයිස්තුව
- [ ] මම බහු සංසන්දන නිවැරදි කිරීම් (FDR) යෙදුවෙමි.
- මම බලපෑම් ප්රමාණය (log2FC) මෙන්ම [ ] p-අගය ඇගයීමට ලක් කළෙමි.
- [ ] මම කණ්ඩායම/තාක්ෂණික විචල්යයන් පරීක්ෂා කළෙමි.
- [ ] මම සාමාන්යකරණ පියවර මඟ හැරියේ නැත.
- [ ] මම හේතුවාදයට වඩා සහසම්බන්ධතාවයේ භාෂාව භාවිතා කළෙමි.
- [ ] මම අපේක්ෂක ජාන තහවුරු කළ යුතු උපකල්පන ලෙස සලකුණු කළෙමි.