Faida:
- Kuwa na uwezo wa kutofautisha wapi katika biolojia ya molekuli na mlolongo wa jeni (mlolongo, lahaja, muundo, omics, fasihi) akili ya bandia huokoa wakati halisi na ambapo ni hatari kwa sababu haina hifadhidata, kulingana na kiwango cha hatari ya kazi.
- Uwezo wa kutambua mitego mitatu hatari kama vile mfuatano uliobuniwa/jeni/lahaja, mkanganyiko wa neno la kuratibu-toleo na maelezo ya uwongo, na kutumia taaluma inayothibitisha kila jambo la kibiolojia katika chanzo msingi.
- Uwezo wa kupitisha kanuni za kutotoa data ya jeni ya mgonjwa katika fomu inayoweza kutambulika ili kufungua zana na kila mara kuacha tafsiri ya mwisho ya kliniki kwa mtaalamu mwenye uwezo.
Biolojia ya molekuli na genetics ni sayansi ya kusoma na kufasiri viumbe hai katika lugha yao ya msingi - lugha ya DNA, RNA na protini. Katika uga huu, kusoma vibaya herufi (jozi ya msingi), kuchanganya jina la jeni, au kuainisha kimakosa lahaja (hatua katika mfuatano wa kijenetiki wa mtu binafsi ambayo ni tofauti na rejeleo); Inaweza kusababisha utambuzi usio sahihi, matibabu yasiyo ya lazima au matokeo yasiyo sahihi ya utafiti. Ndio maana utumiaji wa akili bandia (AI) katika uwanja huu unahitaji nidhamu sawa na kasi. Katika kitengo hiki, utajifunza mahali ambapo zana tunazoziita modeli ya lugha kubwa (LLM - aina ya akili ya bandia ambayo hutoa maandishi kwa takwimu, kwa mantiki ya "neno linalofuata linalowezekana") kwa kweli huokoa wakati katika biolojia ya molekuli na jenetiki, ambapo ni hatari, na jinsi ya kuthibitisha kila matokeo.
Kwanza, dhana muhimu: ufahamu ni wakati AI inazalisha habari ambayo si kweli, kwa ujasiri kamili, kana kwamba ni kweli. Hii ni katika genetics; Inaweza kuja katika mfumo wa jina la jeni ambalo halipo, msimbo wa kibadala ulioundwa (k.m. "c.1234A>G" isiyopo), hali isiyo sahihi ya urithi, au rejeleo la nakala ambayo haipo. Jambo muhimu ni kwamba LLM sio hifadhidata ya jenomu au zana ya maabara. Ni jenereta ya maandishi ambayo kitakwimu inaiga maandishi ambayo inaona katika data ya mafunzo. Yeye hutoa biolojia sahihi mara nyingi kwa sababu ameona maandishi mengi sahihi ya biolojia; lakini tofauti kati ya "kweli mara nyingi" na "kweli wakati wote" inaweza kuwa maisha ya mtu katika genetics ya kliniki.
Akili ya bandia inafanya kazi wapi katika uwanja huu na haifanyi kazi wapi?
Fikiria AI kama rasimu ya haraka, msimbo, na mshirika wa kutafsiri: muhimu lakini muhimu kuthibitisha. Tofauti ifuatayo ni uti wa mgongo wa moduli hii.
Jitihada
Mchango wa AI
Wajibu wa mtaalam
Uchambuzi wa mlolongo
Huandika msimbo wa ulinganifu/uchanganuzi, hutafsiri matokeo
Endesha msimbo na uthibitishe safu na hifadhidata ya chanzo
Tafsiri tofauti
Vigezo vya rasimu ya ACMG hutoa muhtasari wa fasihi
Kuthibitisha kila uthibitisho katika chanzo asili, kuthibitisha darasa
muundo wa protini
Inatafsiri matokeo ya AlphaFold, inaelezea alama ya kujiamini
Kukagua alama za kujiamini na ushahidi wa kimajaribio
Muundo wa CRISPR
Huzalisha orodha na msimbo wa wagombea wa gRNA
Inathibitisha lengo kwa kutumia zana ya kitaalam
uchambuzi wa omics
Msimbo wa RNA-seq/takwimu hutoa tafsiri ya njia
Kuthibitisha takwimu na maana ya kibiolojia
Fasihi/ uandishi
Hufanya muhtasari, rasimu, masahihisho ya lugha
Kuthibitisha kila kumbukumbu na ukweli kwenye chanzo
Kanuni ya kidole gumba: Usiruhusu AI "ikumbuke" data yenyewe; itumie kuandika msimbo, kusanidi mtiririko wa kazi, rasimu na kuhariri; Thibitisha kila ukweli wa kibayolojia (mfuatano, lahaja, utendaji kazi wa jeni, mara kwa mara) kutoka kwa chanzo msingi kinachotegemewa. Chanzo msingi hapa ni hifadhidata zinazoidhinishwa kama vile NCBI, Ensembl, UniProt, ClinVar, gnomAD, au makala yaliyopitiwa na marika; Sio mfululizo ambao LLM hutoa kutoka kwa mawazo yake.
Mitego mitatu ya mauti ya uwanja huu
1. Mifuatano iliyotengenezwa, jeni na lahaja. AI inaweza "kujaza" mlolongo wa DNA ambayo haikumbuki, kuratibu lahaja, au jina la jeni na kitu kinachoonekana kuwa sawa. Hata kama urefu na herufi za mfuatano zinaonekana kuwa sawa, huenda zisilingane na marejeleo halisi.
2. Kuratibu na kuchanganyikiwa kwa majina. AI; Matoleo ya jenomu (GRCh37/hg19 hadi GRCh38/hg38) yanaweza kubadilisha kimya kimya kati ya viwianishi vyenye msingi 0 na 1, uwakilishi wa HGVS (muundo wa kawaida wa uandishi wa vibadala). Matokeo yanaonekana kuwa "ya busara" lakini yanaelekeza kwenye msimamo usiofaa.
3. Sifa za uwongo na madai ya uwongo ya kimatibabu. AI inaweza kutoa nakala iliyoundwa kabisa katika jarida la kweli, yenye majina ya mwandishi halisi; au inaweza kudai bila ushahidi kwamba lahaja ni "pathogenic." Tutashughulikia haya kwa kina katika vitengo 8 na 9.
Kidokezo: Fikia kila pato la AI ya kibayolojia kwa maswali matatu: (1) Ni chanzo gani cha msingi kinachothibitisha ukweli huu (mfuatano, lahaja, jeni)? (2) Je, toleo la jenomu na mfumo wa kuratibu ni sahihi? (3) Je, ninawezaje kuthibitisha hili kwa kujitegemea? Maswali haya matatu hupata idadi kubwa ya makosa katika bud.
Hatua kwa hatua: salama mtiririko wa kazi wa AI
1. Bainisha kazi na muktadha na toleo. "Jini hili hufanya nini?" badala yake andika kwa uwazi muktadha, nakala, na toleo la jenomu, kama vile "Ninataka kutathmini athari ya utendaji ya lahaja ifuatayo katika toleo la GRCh38, nakala NM_007294.4 ya jeni la BRCA1."
2. Inahitaji chanzo na uthibitishaji. Uliza AI kubainisha ni hifadhidata gani ya kuangalia kwa kila ukweli. Maagizo "Ikiwa hujui, usiifanye, sema 'lazima ithibitishwe'" hupunguza maonyesho lakini haimalizii.
3. Thibitisha msimbo kwa kuendesha au kutumia zana. Thibitisha utendakazi wa safu kwa kutumia msimbo wa Python (Biopython) inayoweza kutekelezeka, viwianishi vya kibadala kwa kigeuzi rasmi, muundo na alama ya hifadhidata ya AlphaFold.
4. Fanya ukaguzi wa kibiolojia. Je, fremu ya kodoni inashikilia? Je, mzunguko wa idadi ya watu wa lahaja (gnomAD) unaendana na ugonjwa? Je, kikoa cha protini kinaathirika? Hitilafu hizi za kukamata ambazo AI inakosa.
5. Fanya ukaguzi wa faragha na maadili. Usibandike kamwe data ya kinasaba ya mgonjwa kwenye zana ya AI inayopatikana kwa umma katika fomu inayoweza kutambulika. Tutashughulikia hili kwa undani katika sehemu ya 10.
kesi tatu ndogo
Kesi ya 1 - Lahaja iliyoundwa. Mshauri wa maumbile aliuliza AI maana ya lahaja ya "CFTR c.1521_1523delCTT" katika ripoti ya mgonjwa na akapokea maelezo wazi. Hata hivyo, wakati YZ pia aliandika hili kwa nukuu tofauti kama "p.Phe508del", aliongeza lahaja iliyoundwa "c.1600A>T" katika swali lingine, ingawa alitoa eneo la lahaja kwa usahihi. Wakati mshauri alitafuta ClinVar, aliona kuwa lahaja ya pili haipatikani kabisa. Muda uliopotea: dakika 4; Hitilafu imezuiwa: kuingiza lahaja ghushi kwenye ripoti.
Kesi 2 - Kuratibu mtego. Mtafiti aliuliza AI kwa uratibu wa jenomu la lahaja. AI ilitoa uratibu wa hg19, lakini mradi wa mtafiti ulikuwa ukitumia hg38. Kuratibu zilikuwa zimebadilishwa kwa takriban besi 3,000. Mtafiti aligundua tofauti hiyo alipokagua picha hiyo na zana ya "liftOver" (inter-version coordinate transformation). Bila uthibitishaji, mpangilio mzima hautakuwa sahihi.
Kesi ya 3 - Uthibitisho umepata. Mwanafunzi aliyehitimu aliuliza AI msimbo wa Python ambao hupata sura wazi ya kusoma (ORF - eneo la kuweka alama za protini) ya mlolongo. Nambari hiyo ilifanya kazi, lakini ilipata protini fupi kwa sababu ilikuwa ikitafuta kodoni ya kuanza kwenye fremu isiyo sahihi. Mwanafunzi alipolinganisha matokeo na protini inayojulikana ya marejeleo, aligundua tofauti ya urefu, akauliza AI ichanganue fremu zote tatu, na akaisahihisha kwa dakika 10.
Violezo vinne vinavyoweza kunakiliwa
1) Chanzo kinahitajika, tafsiri inayoweza kuthibitishwa:
Jukumu lako: msaidizi wa jenetiki ya Masi. Tathmini ukweli ufuatao: [jeni/lahaja/mfuatano]. Taja kwa uwazi toleo la jenomu (GRCh37/38) na manukuu. Kwa kila dai, andika ni chanzo gani msingi (NCBI, Ensembl, UniProt, ClinVar, gnomAD) kinapaswa kuthibitishwa. USITENGE mfuatano/viwianishi/lahaja yoyote ambayo huna uhakika nayo; Andika "lazima ithibitishwe".
2) Thibitisha operesheni ya safu na nambari:
Andika msimbo wa Python (Biopython) unaoweza kutekelezeka ambao unachanganua mfuatano ufuatao: [task].Msimbo; Taja kwa uwazi toleo la jenomu, fremu, na mawazo ya uzi katika mstari wa maoni. Ongeza hatua ya uthibitishaji ili kulinganisha matokeo na rejeleo linalojulikana.
3) Orodhesha hatari kwanza:
Kabla ya kufanya kazi hii ya jeni, orodhesha makosa 5 ya kawaida katika kazi hii na jinsi ya kuepuka kila moja: [kazi]. Lenga mahususi kwenye mfumo wa kuratibu, toleo la jenomu na hitilafu za muundo wa majina.
4) Udhibiti wa faragha:
Kabla ya kutoa maandishi haya kwa zana ya AI, ina habari gani ambayo inaweza kumtambua mgonjwa (jina, nambari ya kitambulisho, tarehe, mchanganyiko adimu wa lahaja)? Ninawezaje kuficha majina haya? Ipe katika orodha.
Mwongozo dhaifu / Mwongozo thabiti
Dhaifu: "Je, mabadiliko haya katika BRCA1 yanadhuru?"
Tatizo: Hakuna toleo la jenomu, hakuna nakala, jina la kibadala haliko wazi, chanzo hakijaombwa. AI inaweza kutengeneza tafsiri kutoka juu ya kichwa chako.
Imara: "Nataka kutathmini lahaja NM_007294.4:c.68_69delAG katika nakala ya GRCh38, BRCA1 (NM_007294.4) kulingana na vigezo vya ACMG. Niambie nini cha kutafuta katika ClinVar na gnomAD kwa kila kipande cha data ambacho kinahitajika, usifanye uainishaji wa data."
Kwa nini ina nguvu: Futa muktadha, toleo, manukuu, nukuu za kawaida na njia ya uthibitishaji; Uga wa uvumbuzi wa AI umepunguzwa.
Makosa ya kawaida
- Bila kubainisha toleo la jenomu. Kuratibu mabadiliko kati ya hg19 na hg38; Kila kiratibu kilichotolewa bila toleo kinatiliwa shaka.
- Moja kwa moja kwa kutumia mlolongo/lahaja iliyotolewa na AI. Kila mfuatano na lahaja lazima zithibitishwe katika chanzo msingi.
- Kuacha uamuzi wa kliniki kwa AI. AI inaweza "kuwaambia" darasa la pathogenicity, lakini tafsiri ya mwisho ya kliniki iko kwa mtaalam mwenye uwezo.
- Kubandika data ya mgonjwa kwenye zana wazi. Data ya kinasaba inayotambulika inajumuisha ukiukaji wa faragha.
- Utata wa majina. c., uk., g. Kuchanganya matoleo na matoleo ya nakala huelekeza kwenye lahaja isiyo sahihi.
Tahadhari: Toni ya "kujiamini" ya AI sio ushahidi wa usahihi. Maoni hatari zaidi huja na sentensi fasaha zaidi na zenye kusadikisha. Unaposikia sauti ya ujasiri, hitaji lako la uthibitisho huongezeka, sio kupungua.
Kwa muhtasari
- AI katika biolojia ya molekuli na genetics; Ni msaidizi madhubuti anayeandika, rasimu, maoni na kubadilisha msimbo - lakini si hifadhidata au zana ya maabara.
- Mitego mitatu hatari: mfuatano wa uwongo/jeni/lahaja, mkanganyiko wa neno la kuratibu-toleo, maelezo ya uongo na madai ya uwongo ya kimatibabu.
- Kila ukweli wa kibayolojia lazima uthibitishwe katika chanzo cha msingi; Kila msimbo lazima uthibitishwe kwa kuiendesha.
- Wajibu wa mwisho wa kiafya na kisayansi, ikijumuisha usiri na maadili, daima huwa chini ya mtaalam stadi.
Jukumu la maombi
Kwa jeni na lahaja uliyo nayo (au sampuli), uliza AI kwa tathmini ukitumia kiolezo cha 1 hapo juu. Kisha angalia kibinafsi kila ukweli ambao AI hurejesha (toleo la jenomu, nakala, uwakilishi lahaja) katika ClinVar na gnomAD. Jaribu kupata tofauti kati ya AI na chanzo katika angalau nukta moja na kumbuka tofauti hii katika sentensi moja.
orodha ya ukaguzi
- [ ] Nilielezea kazi kwa toleo la jenomu, nakala, na muktadha.
- [ ] Niliuliza AI kwa chanzo cha msingi kwa kila ukweli.
- [ ] Mimi binafsi nimethibitisha kila mfuatano/kuratibu/lahaja.
- [ ] Nilithibitisha kwa kuendesha msimbo au kwa zana.
- [ ] Nimekagua usiri wa data ya mgonjwa.
- [ ] Niliidhinisha maoni ya mwisho mwenyewe, sikuiacha kwa AI.