ලාභ:
- අනුක්රමික විශ්ලේෂණයේ තත්ත්ව පාලනය, පෙළගැස්ම, විචල්ය ඇමතුම් සහ විවරණ පියවර තේරුම් ගෙන ප්රතිඵල ලේඛනගත කිරීමේදී සහ සාරාංශ කිරීමේදී කෘත්රිම බුද්ධිය ආරක්ෂිතව භාවිත කිරීමට හැකි වේ.
- ප්රතිශත අනන්යතාවය, ආවරණය සහ විද්යුත් අගය වැනි ප්රමිතිකවලට එක් එක් අනුක්රමික අර්ථ නිරූපණය සම්බන්ධ කිරීමෙන් ව්යාජ ජාන, ප්රෝටීන සහ යොමු තහවුරු කිරීමට සහ ඉවත් කිරීමට ඇති හැකියාව
- ප්රෝටීන් භාෂා ආකෘති අනාවැකි සම්භාවිතාවන් ලෙස අර්ථකථනය කිරීමේ හැකියාව, තෙත් පරීක්ෂාව සමඟ විවේචනාත්මක අපේක්ෂකයින් වලංගු කිරීම සහ සායනික රෝග විනිශ්චය වෙතින් පර්යේෂණ වෙන් කිරීමේ විනය යෙදීම.
ජෛව ඉංජිනේරු විද්යාවේ මූලිකම අමුද්රව්ය වන්නේ අනුපිළිවෙලයි (අනුක්රමය - DNA, RNA හෝ ප්රෝටීන් අකුරු වලින් ලියා ඇති අනුක්රමික නිරූපණය; උදාහරණයක් ලෙස ATGCGT... හෝ ප්රෝටීන් සඳහා MKV...). අනුක්රමික උපාංගයක් එක රැයකින් කෙටි කියවීම් මිලියන සිය ගණනක් නිපදවයි; මෙම අමු දත්ත අර්ථවත් ජීව විද්යාත්මක ප්රතිචාරයක් බවට පරිවර්තනය කිරීම ජෛව තොරතුරු විද්යාවේ (පරිගණක ක්රම සමඟ ජීව විද්යාත්මක දත්ත විශ්ලේෂණය කරන විනය) කාර්යයයි. මෙම ඒකකය තුළ, අනුක්රමික විශ්ලේෂණයේදී AI ආරක්ෂිතව භාවිතා කළ යුත්තේ කොතැනද, කුමන සම්මත මෙවලම් එය වේගවත් කරයිද, සහ ඔබේ විශේෂඥ විනිශ්චය අත්යවශ්ය වන්නේ කොතැනද යන්න ඉගෙන ගනු ඇත.
අනුක්රමික විශ්ලේෂණයේ සාමාන්ය පියවර වනුයේ: අමු කියවීම්වල තත්ත්ව පාලනය (නරක කියවීම් සහ ඇඩැප්ටර අපද්රව්ය ඉවත් කිරීම), යොමු ජෙනෝමයකට පෙළගැස්වීම (පෙළගැස්වීම - ජෙනෝමයෙන් කියවීම් පැමිණෙන්නේ කොතැනින්දැයි සොයා ගැනීම), ප්රභේද ඇමතීම (විකෘති හඳුනා ගැනීම, පුද්ගලයා යොමුවෙන් වෙනස් වන ස්ථාන) සහ සොයාගැනීම් අර්ථ නිරූපණය කිරීම. ස්ක්රිප්ට් ලිවීමෙන්, ප්රතිඵල සාරාංශ කිරීමෙන් හෝ කෙටුම්පත් අදහස් ඉදිරිපත් කිරීමෙන් AI මෙම දාමයේ එක් එක් සබැඳිය සඳහා උපකාර කරයි; නමුත් පෙළගැස්ම සහ විචල්ය ඇමතුම් වැනි තීරණාත්මක පියවර තවමත් වලංගු, සම්මත මෙවලම් සමඟ සිදු කෙරේ.
අනුපිළිවෙල පෙළගැස්වීම: සමානකම සහ අර්ථය
අනුපිළිවෙලවල් දෙකක් කෙතරම් සමානද යන්න මැන බැලීම ජෛව තොරතුරු විද්යාවේ හදවතයි. BLAST (Basic Local Alignment Search Tool — විශාල දත්ත සමුදායන්හි අනුපිළිවෙලවල් වලට අනුපිළිවෙලක් සංසන්දනය කරන සහ වඩාත්ම සමාන ඒවා සොයා ගන්නා සම්භාව්ය මෙවලම) ප්රෝටීනයක් හෝ ජානයක් යනු කුමක්දැයි වටහා ගැනීමේ පළමු පියවරයි. අනුක්රමික පෙළගැස්මක සංකල්ප දෙකක් වෙන්කර හඳුනා ගන්න: අනන්යතාවය (එකම අකුරක් ඇති අනුක්රමික දෙකක අනුපාතය) සහ ඊ-අගය (සමානතාවය අහම්බෙන් සිදු වූ බවට සම්භාවිතාව පෙන්වන සංඛ්යාලේඛනය; එය කුඩා නම්, එය වැදගත් වේ). AI විසින් BLAST ප්රතිදානයක් අර්ථකථනය කර “මෙම අනුක්රමය බොහෝ විට kinase එන්සයිමයක්” වැනි දළ සටහනක් ලබා දිය හැක, නමුත් ඔබ එම අර්ථ නිරූපණය විද්යුත් අගය, ආවරණය සහ දන්නා වසම් තොරතුරු සමඟින් සත්යාපනය කරයි.
ඉඟිය: අදහස් පරාසයක් සඳහා AI වෙතින් විමසන විට, සෑම විටම අමු පෙළගැස්වීමේ ප්රමිතික ද ඉල්ලන්න: සියයට අනන්යතාවය, ආවරණය, විද්යුත් අගය. මෙම ප්රමිතික නොමැතිව, "මෙම ප්රෝටීනය එයයි" යන්නෙහි දී ඇති අර්ථකථනයක් සත්යාපනය කළ නොහැකි අතර එය මායාවක් විය හැකිය.
AI මත පදනම් වූ අරා ආකෘති
මෑත වසරවලදී, අනුපිළිවෙලවල් "භාෂාවක්" ලෙස සලකන ප්රෝටීන් භාෂා ආකෘති (මිලියන ගණනක් ප්රෝටීන් අනුපිළිවෙලකින් පුහුණු කරන ලද සහ අනුක්රමයක ක්රියාකාරී සහ ව්යුහාත්මක ගුණාංග පුරෝකථනය කරන AI ආකෘති; ESM වැනි) මතු වී ඇත. විකෘතියක් ප්රෝටීනයකට බාධා කරයිද, අනුපිළිවෙලක් අයත් වන්නේ කුමන පවුලකටද, නැතහොත් ක්රියාකාරී කලාපවලටද යන්න මේවාට පුරෝකථනය කළ හැකිය. එය ප්රබල පිරික්සුම් මෙවලමකි: එය පරීක්ෂා කිරීමට පෙර ප්රභේද දහස් ගණනක් වර්ග කරන අතර වඩාත්ම පොරොන්දු වූ ඒවා ඉස්මතු කරයි. නමුත් අනාවැකිය සම්භාවිතාවයි; සෑම විවේචනාත්මක අපේක්ෂකයෙකුම පර්යේෂණාත්මකව පරීක්ෂා කරනු ලැබේ.
අවවාදයයි: ප්රෝටීන් භාෂා ආකෘතියක් "මෙම විකෘතිය විනාශකාරී" යැයි පවසන විට, මෙය රෝග විනිශ්චයක් නොව සම්භාවිතා ලකුණු වේ. සායනික අර්ථකථනයක් (උදා: රෝග ප්රභේද වාර්තාවක්) සපයනු ලබන්නේ වලංගු, නියාමනය කරන ලද මෙවලම් සහ විශේෂඥ ජාන උපදේශනය සමඟ පමණි.
කුඩා නඩු තුනක්
නඩුව 1 - විවරණ වේගවත් කරන ලදී. එක් metagenomics ව්යාපෘතියකදී, කණ්ඩායමට පාරිසරික සාම්පල වලින් නොදන්නා ප්රෝටීන් අනුපිළිවෙල 8,400ක් හමු විය. AI-සහායිත මූලික විවරණ (අනුපිළිවෙලට ශ්රිත ලේබල් පැවරීම) ඒවා ක්රියාකාරී පවුල්වලට පොකුරු කර පැය 6 කින් මූලික සිතියමක් නිෂ්පාදනය කළේය. කණ්ඩායම පිළිගත්තේ ඉහළ විශ්වාසය 30% පමණි; BLAST සහ HMM සමඟින් ඉතිරිය අතින් සත්යාපනය කරන ලදී.
නඩුව 2 - මායාව අල්ලා ගැනීම. ශිෂ්යයෙක් AI ගෙන් ඇසුවේ "පිළිවෙලක් පැමිණියේ කුමන ජීවියෙකුගෙන්ද සහ එහි DOI මූලාශ්රය" යනුවෙනි. AI විසින් නිශ්චිත විශේෂ නාමයක් සහ ලිපි යොමුවක් සපයා ඇත. ශිෂ්යයා එය BLAST මත තැබුවේය: ආසන්නතම තරගය වූයේ 41% හැඳුනුම්පත සහ කිසිදු යොමුවක් නොමැති සම්පූර්ණයෙන්ම වෙනස් පන්තියකි. AI චතුර ලෙස නමුත් සකස් කළ පිළිතුරක් නිෂ්පාදනය කළේය.
නඩුව 3 - ප්රභේද පෙරහන. එක් ජාන ව්යාපෘතියක බොරතෙල් ප්රභේද මිලියන 4.7ක් තිබුණි. AI විසින් ගුණාත්මකභාවය, ගැඹුර සහ ජනගහන සංඛ්යාත සීමාවන් ඇතුළත් පෙරහන් ස්ක්රිප්ට් එකක් ලිවීය; සායනිකව අදාළ ප්රභේද 120 දක්වා අඩු වේ. කණ්ඩායම මූලාශ්ර ලිපිය සමඟ එක් එක් පෙරහන සාධාරණීකරණය කර ස්ක්රිප්ට් ස්වාධීනව ධාවනය කළේය; එහි ප්රතිඵලය ප්රතිනිෂ්පාදනය විය හැකි බව පෙනී ගියේය.
පිටපත් කළ හැකි සැකිලි හතරක්
1) FASTQ තත්ත්ව පාලන ස්ක්රිප්ට්:
ඔබේ කාර්යභාරය: ජෛව තොරතුරු ඉංජිනේරු. Python හි ස්ක්රිප්ට් එකක් ලියන්න: ආදානය යනු FASTQ ගොනුවකි, ප්රතිදානය සාමාන්ය කියවීමේ ගුණත්වය, GC අන්තර්ගතය සහ ඇඩැප්ටරයේ අවශේෂ සාරාංශයකි. පුස්තකාලයක් ලෙස Biopython භාවිතා කරන්න. කේතය පැහැදිලි කර එක් එක් සීමාව අගය (උදා: Q30) අදහස් කරන්නේ කුමක්දැයි ලියන්න. නොපවතින කාර්යයක් සවි කිරීම.
2) BLAST ප්රතිදාන අදහස (මූලාශ්රය මත පදනම්ව):
මම ඔබට BLAST වගු ප්රතිදානයක් දෙන්නම් (තීරු: විමසුම, විෂය, % අනන්යතාවය, පෙළගැස්ම_දිග, ඇගයීම, බිට්කෝර්). එක් එක් පහර සඳහා ID, විෂය පථය සහ විද්යුත් අගය වාචිකව ලියන්න. විද්යුත් අගය < 1e-5 සහ ආවරණය > 70% ඇති ඒවා පමණක් "විශ්වාසවන්ත" ලෙස ගණන් කරන්න. මෙම මිතික මත ඔබේ අර්ථ නිරූපණය පාදක කරන්න; වර්ගය/ක්රියාකාරී අනුමානය "සත්යාපනය අවශ්යයි" ලෙස ලකුණු කරන්න.
3) විචල්ය පෙරීමේ තර්කය:
ඔබේ කාර්යභාරය: සායනික නොවන පර්යේෂණ ජෛව තොරතුරුවේදියා. VCF සඳහා පෙරීමේ පියවර යෝජනා කරන්න: අවම කියවීමේ ගැඹුර, ගුණාත්මක ලකුණු, ජනගහන සංඛ්යාත එළිපත්ත. එක් එක් සීමාවේ තාර්කිකත්වය සහ මූලාශ්රය සඳහන් කරන්න. මෙය පර්යේෂණ පෙරහනකි; එය සායනික රෝග විනිශ්චය සඳහා භාවිතා කළ නොහැකි බව මුද්රණයේ ලියන්න.
4) කෝඩෝන ප්රශස්තකරණය පැහැදිලි කිරීම:
[ඉලක්ක ජීවියා] සඳහා ප්රෝටීන් අනුක්රමයක් ප්රකාශ කිරීමට DNA අනුක්රමයක් සැලසුම් කිරීමේදී කෝඩෝන භාවිතය ප්රශස්ත කරන්නේ කෙසේද? සලකා බැලිය යුතු පියවර සහ අවදානම් පැහැදිලි කරන්න (GC ශේෂය, පුනරාවර්තන අනුපිළිවෙල, සීමා කිරීම් අඩවි). කොන්ක්රීට් අරාව නිපදවීමට පෙර භාවිතා කළ යුතු වලංගුකරණ මෙවලම් මොනවාදැයි මට කියන්න.
දුර්වල ක්ෂණික / ශක්තිමත් විමසුම
දුර්වල ක්ෂණික:
මෙම අනුපිළිවෙල විශ්ලේෂණය කරන්න: ATGCGTACGT...
කුමන ආකාරයේ විශ්ලේෂණයක්ද, කුමන නිර්ණායකයද, කුමන ප්රතිඵලයද යන්න අපැහැදිලි ය; AI විසින් ප්රබන්ධ කිරීමට විවෘත නිදහස් අර්ථකථන නිෂ්පාදනය කරයි.
බලවත් විමසුම:
ඔබේ කාර්යභාරය: ජෛව තොරතුරු ඉංජිනේරු. Python/Biopython සමඟ පහත DNA අනුක්රමය සඳහා: (1) දිග සහ GC අන්තර්ගතය ගණනය කරන්න, (2) කියවීමේ රාමු හයක් තුළ විවෘත කියවීම් රාමු (ORFs) සොයා ගන්න, (3) දිගම ORF හි ප්රෝටීන් පරිවර්තනය ප්රතිදානය කරන්න. කේතයෙන් පමණක් ප්රතිඵල වාර්තා කරන්න; ජීව විද්යාත්මක ක්රියා විවරණය කිරීම. මාලාව: [මාලාව]
වෙනස: පැහැදිලි උප කාර්යයන්, සම්මත මෙවලම්, කේතය මත පදනම්ව සත්යාපනය කළ හැකි ප්රතිදානය සහ අදහස් සීමාව.
අනුපිළිවෙල විශ්ලේෂණ කාර්යයන් සහ AI හි කාර්යභාරය
ගවේෂණය
සම්මත වාහනය
AI දායකත්වය
සත්යාපනය
තත්ත්ව පාලනය
FastQC, Trimmomatic
ස්ක්රිප්ට් + සාරාංශය
මෙට්රික් එළිපත්ත
පෙළගැස්ම
BWA, Bowtie2
පරාමිති නිර්දේශය
පෙළගැස්වීමේ අනුපාත පාලනය
ප්රභේද ඇමතීම
GATK, bcftools
කාර්ය ප්රවාහ කෙටුම්පත
දන්නා ප්රභේදයකින් තහවුරු කර ඇත
විවරණ
BLAST, InterProScan
පූර්ව පොකුරු කිරීම
ඊ-අගය + වසම
බලපෑම් ඇස්තමේන්තුව
ESM, SIFT
අපේක්ෂක ශ්රේණිගත කිරීම
තෙත් අත්හදා බැලීම
පොදු වැරදි
- ප්රමිතික නොමැතිව අදහස් පිළිගැනීම. සියයට අනන්යතාවයක්, ආවරණයක් සහ විද්යුත් අගයක් නොමැතිව "මෙම ප්රෝටීනය" යැයි පැවසීම සත්යාපනය කළ නොහැක.
- යොමු/ඛණ්ඩාංක පද්ධතිය ව්යාකූල කිරීම. ජෙනෝම් අනුවාදය (hg38 vs hg19) සහ 0/1-පාදක ඛණ්ඩාංක මිශ්ර වී ඇත්නම්, ප්රභේදන ස්ථාන වැරදි වනු ඇත.
- කණ්ඩායම් බලපෑම නොසලකා හැරීම. විවිධ කාණ්ඩවල අනුක්රමණය කරන ලද සාම්පල ජීව විද්යාව සඳහා තාක්ෂණික වෙනස්කම් වැරදියට ගෙන යයි.
- AI විසින් සාදන ලද ශ්රිත නාමය භාවිතා කිරීම. ආකෘතිය නොපවතින ජාන / ප්රෝටීන් / මෙවලම් නම් ජනනය කළ හැකිය; සැබෑ දත්ත සමුදායට එරෙහිව සෑම නමක්ම තහවුරු කරන්න.
- පර්යේෂණ මෙවලම හරහා සායනික අර්ථකථනය ලබා දීම. රෝගය සමඟ ප්රභේදයක් සම්බන්ධ කිරීම වාර්තා කරනු ලබන්නේ අනුමත, නියාමනය කරන ලද ක්රියාවලීන් හරහා පමණි.
සාරාංශයකින්
අනුක්රමික විශ්ලේෂණය යනු ජෛව ඉංජිනේරු විද්යාවේ අමුද්රව්යය වන අතර, AI මෙම දාමයේ සෑම පියවරක්ම ස්ක්රිප්ට් කිරීම, ප්රතිදානය සාරාංශ කිරීම සහ අපේක්ෂකයින් ශ්රේණිගත කිරීම මගින් වේගවත් කරයි. නමුත් පෙළගැස්ම, විචල්ය ඇමතුම් සහ ක්රියාකාරී පැවරීම වැනි තීරණාත්මක පියවර සම්මත, වලංගු මෙවලම් සමඟ සිදු කරනු ලබන අතර, සෑම ප්රකාශයක්ම ID ප්රතිශතය, ඉ-අගය සහ ප්රභව වැනි ප්රමිතික සමඟ බැඳී ඇත. ප්රෝටීන් භාෂා ආකෘති ප්රබල පිරික්සුම් මෙවලම් වේ; ඒවායේ ප්රතිදානය සම්භාවිතාවක් මිස අත්හදා බැලීමකින් තහවුරු වන තුරු නිගමනයක් නොවේ.
යෙදුම් කාර්යය
ප්රසිද්ධියේ ලබා ගත හැකි නියැදි අනුපිළිවෙලක් තෝරන්න (උදා: යොමු ජානයකින් ජානයක්). AI ප්රථමයෙන් "ශක්තිමත් කඩිනම්" අච්චුව සමඟ මූලික අනුක්රමික විශ්ලේෂණය (GC අන්තර්ගතය, ORF, පරිවර්තනය) සිදු කරන්න. ඉන්පසු Biopython හෝ ඔන්ලයින් මෙවලමක් සමඟින් ප්රතිදානය ස්වාධීනව සත්යාපනය කර වෙනස්කම් සටහන් කරන්න. අවසාන වශයෙන්, AI වෙතින් ප්රභවයන් අසමින් අදහස් ප්රශ්නයක් අසන්න, සහ එය ලබා දෙන ඕනෑම යොමුවක් සත්ය දත්ත ගබඩාවේ බැලීමෙන් ඒවා නිවැරදි දැයි පරීක්ෂා කරන්න.
පිරික්සුම් ලැයිස්තුව
- [ ] මම සෑම තන්තු ප්රකාශයක්ම අනන්යතාවය/ආවරණය/ඉ-අගය ප්රමිතික සමඟින් සත්යාපනය කළෙමි.
- [ ] මම ජෙනෝම අනුවාදය සහ ඛණ්ඩාංක පද්ධතිය පැහැදිලි කළෙමි.
- [ ] මම ප්රභේදය/විශ්ලේෂණ පිටපත ස්වාධීනව ධාවනය කර එය ප්රතිනිෂ්පාදනය කළෙමි.
- [ ] මම ප්රෝටීන් ආකෘති අනාවැකි විග්රහ කළේ ප්රතිඵල නොව සම්භාවිතාව ලෙසයි.
- [ ] මම සත්ය දත්ත ගබඩාවට එරෙහිව AI විසින් ලබා දී ඇති සියලුම ජාන/ප්රෝටීන්/යොමු නම් සත්යාපනය කළෙමි.
- [] මම පර්යේෂණ විශ්ලේෂණය සායනික රෝග විනිශ්චය වලින් වෙන් කළෙමි.