Yunit 10 / 10

End-to-End Project: AI-Assisted Bioengineering Workflow at Validation gamit ang Python

Mga nadagdag:

  • Kakayahang magdisenyo ng pitong hakbang na daloy ng trabaho mula sa tanong hanggang sa na-verify na resulta sa pamamagitan ng paglalagay ng verification gate sa bawat hakbang
  • Kakayahang i-verify ang Python code na isinulat ng artificial intelligence na may kilalang data ng pagsubok at makilala ang pagkakaiba sa pagitan ng 'working code' at 'tamang code'
  • Gawing reproducible ang pagsusuri (bersyon, medium, seed, dokumento) at mag-ulat nang may basang pag-verify, transparency at pag-apruba ng eksperto

Natutunan namin ang mga piraso sa nakaraang siyam na unit: sequence analysis, omics, protein modeling, experimental design, laboratory data, bioprocessing, literature, at ethics. Sa panghuling unit na ito, pagsasama-samahin natin ang mga piraso at bubuo ng isang end-to-end na workflow — isang chain mula sa isang tanong sa pananaliksik hanggang sa isang validated na konklusyon, kung saan ang AI ay tumutulong sa bawat hakbang ngunit ang tao ay gumagawa ng bawat kritikal na desisyon at pag-verify. Tatalakayin din namin ang Python, na siyang gulugod ng kadena na ito, at ang disiplina ng muling paggawa — ang kakayahang ulitin ang pagsusuri ng ibang tao, na may parehong data, upang magbigay ng parehong resulta.

Ang layunin ay hindi upang magbigay ng mga indibidwal na tool, ngunit isang responsableng workflow mindset: malalaman mo kung saan ilalagay ang AI, kung saan maglalagay ng verification gate, at kung paano gagawing masusubaybayan ang buong proseso.

Bakit Python?

Ang lingua franca ng bioinformatics at computational biology ay Python (at R). Dahil maaari mong i-automate at gawing paulit-ulit ang halos bawat hakbang gamit ang mga open source na aklatan (Biopython para sa sequence analysis, pandas para sa mga talahanayan ng data, scikit-learn para sa machine learning, matplotlib para sa visualization). Ang AI ay napakalakas sa pagsulat ng Python code; Ngunit ang pagtanggap sa code na ginagawa nito nang hindi tumatakbo at ang pag-verify nito ay mapanganib — maaaring tahimik na ibalik ng code ang maling resulta (isang unit error, isang maling column, isang napalampas na filter).

Pansin: Kahit na gumagana ang code na isinulat ng AI, maaaring hindi ito tama. "Nagtrabaho ito nang walang mga pagkakamali" at "nagbigay ito ng tamang resulta" ay dalawang magkaibang bagay. Subukan ang bawat code na may maliit, kilalang data ng pagsubok: ang input-output ba ay tulad ng inaasahan mo? Ito ang tanging paraan upang mahuli ang mga tahimik na error.

Anatomy ng daloy ng trabaho

Ang isang responsableng AI-enabled na bioengineering workflow ay sumusunod sa framework na ito:

  1. Tanong at hypothesis. Isang malinaw, masusubok na tanong. (Maaaring magbigay ng inspirasyon ang AI; linawin mo.)
  2. Pagkolekta ng data at kontrol sa privacy. Saan galing ang data, personal o naaprubahang media? (unit 9.)
  3. Pre-processing at quality control. Paglilinis, normalisasyon, kontrol ng batch. (Yunit 2-3.)
  4. Pagsusuri. Mga istatistika, pagmomodelo, pagtataya. (Verification gate sa bawat hakbang.)
  5. Magkomento. Pagpindot sa biyolohikal na pag-iisip, pagkakaiba-iba ng ugnayan-sanhi.
  6. Wet laboratory verification. Ang kritikal na hypothesis ay nasubok sa eksperimento. (Yunit 1, 4, 5.)
  7. Pag-uulat at transparency. Reproducible code, AI statement, pag-apruba ng eksperto. (Yunit 8-9.)

Ang bawat hakbang ay may checkpoint — ang punto kung saan na-verify ang output bago magpatuloy sa susunod na hakbang. Ang AI ay nagpapabilis ng isang hakbang, hindi ka maaaring magpatuloy sa susunod na hakbang nang hindi dumadaan sa pinto.

Tip: I-save ang iyong workflow bilang script at notebook; Hayaang maidokumento ang input, output at desisyon ng bawat hakbang. Ang kakayahang masagot ang tanong na "paano ko nakuha ang resultang ito" sa loob ng ilang minuto pagkatapos ng mga buwan ay nagkakahalaga ng ginto para sa parehong agham at pag-audit.

Reproducibility: insurance ng resulta

Ang isang resulta ay maaasahan lamang kung ito ay maaaring ulitin ng ibang tao. Ang apat na pillars ng reproducibility ay: (1) code ay nasa version control (may git), (2) environment ay fixed (library versions are registered, e.g. requirements.txt o conda environment), (3) data at random seed ay nakarehistro, (4) bawat hakbang ay dokumentado. Tumutulong ang AI sa pagbuo ng imprastraktura na ito, ngunit nasa iyo ang pagpapatupad ng disiplina.

tatlong mini case

Case 1 — Nahuli ang silent code error. Gumamit ang isang koponan ng script ng normalisasyon na isinulat ng AI; Ang code ay gumagana nang walang mga error. Nang sinubukan nila ito gamit ang kilalang data ng pagsubok, nalaman nilang nalipat ang output ng isang factor na 1,000 — ang script ay gumagawa ng hindi tamang conversion ng unit. Ang maliit na data ng pagsubok ay nakakuha ng isang error na makakagambala sa buong pagsusuri.

Case 2 — Nai-save ang reproducibility. Pagkatapos ng isang broadcast, humiling ang referee ng replay ng isang resulta. Ni-reproduce ng team ang analysis verbatim sa loob ng 20 minuto dahil mayroon silang code na bersyon sa Git at isang naka-pin na kapaligiran. Ang isang karibal na grupo na hindi nagtala ng kapaligiran ay hindi nakamit ang parehong kahilingan sa loob ng ilang linggo.

Case 3 — End-to-end na pag-verify. Sa isang proyekto ng enzyme, ang daloy ng trabaho ay gumana tulad nito: Ang AI ay nagmungkahi ng isang hypothesis mula sa literatura (na-validate), ang modelo ng protina ay niraranggo ang mga mutasyon ng kandidato (nasubok sa pamamagitan ng eksperimento), binawasan ng DoE ang bilang ng mga eksperimento, isa sa tatlong mutasyon ang tumaas ng aktibidad ng 1.9-tiklop. Bumibilis ang AI sa bawat hakbang, na-verify ng tao sa bawat pinto; Ang resulta ay parehong mabilis at mapagtatanggol.

Apat na maaaring kopyahin na mga template

1) Pagtatatag ng balangkas ng daloy ng trabaho:

Ang iyong tungkulin: computational biology project consultant. Magdisenyo ng end-to-end na daloy ng trabaho upang sagutin ang sumusunod na tanong: [tanong]. Para sa bawat hakbang, (1) kung ano ang gagawin, (2) kung saan nakakatulong ang AI, (3) kung ano dapat ang validation framework, (4) kung anong tool ang gagamitin. Isama ang wet lab validation at transparency step.

2) Python code + kahilingan sa pagsubok:

Ang iyong tungkulin: developer ng bioinformatics. Sumulat ng isang Python function na gumagawa ng sumusunod na trabaho: [job]. Aklatan: [pandas/Biopython]. Magdagdag din ng isang halimbawa ng pagpapatunay na may kaunting kilalang data ng pagsubok: ano ang input, ano ang inaasahang output. Tatakbuhin ko ang code at suriin ito gamit ang data ng pagsubok. Hindi umiiral na function/parameter fitting.

3) Pagsusuri sa muling paggawa:

Gusto kong gawing reproducible ang aking pagsusuri. Bigyan mo ako ng checklist: version control, environment pinning (requirements/conda), random seed, data source registration, step documentation. Magbigay ng praktikal na paraan ng aplikasyon para sa bawat aytem.

4) Pagsusuri sa pagpapatunay ng resulta:

Gusto kong gumawa ng panghuling pagsusuri sa pagpapatunay bago maglagay ng resulta ng pagsusuri sa isang ulat. Bigyan mo ako ng checklist ng mga tanong na ito: ang resulta ba ay biologically plausible, ang mga istatistika ba ay tumpak (multiple testing, sample), nakumpirma ba ito sa pamamagitan ng mga independiyenteng paraan, ito ba ay nakadepende sa source, kailangan ba ng wet test, may AI statement na ginawa?

Mahinang prompt / Malakas na prompt

Mahinang prompt:

Sumulat sa akin ng Python code na sinusuri ang data na ito.

Malabong misyon, walang pagsubok, walang pagpapatunay; silent error prone.

Napakahusay na prompt:

Ang iyong tungkulin: developer ng bioinformatics. Para sa isang CSV (column: gene, control_mean, treatment_mean, pvalue) na may mga pandas: (1) magdagdag ng log2 fold change column, (2) kalkulahin ang BH corrected p-value, (3) i-filter out ang padj<0.05 at |log2FC|>1. DIN ipakita ang inaasahang output na may 5 mga hilera ng sample ng data upang maaari kong i-verify. Huwag gumamit ng maling pangalan ng column o hindi umiiral na function.

Ang pagkakaiba: malinaw na misyon, malinaw na istatistika, pagpapatunay na may data ng pagsubok at pagbabawal sa katha.

End-to-end workflow validation gateway

hakbang

kontribusyon ng AI

verification gate

hypothesis

inspirasyon, panitikan

Ito ba ay masusubok o hinangin?

Data/privacy

checklist

De-identification, inaprubahang kapaligiran

preprocessing

script

Batch/QC control

Pagsusuri

code, modelo

Data ng pagsubok, independiyenteng sasakyan

Magkomento

burador

Biological isip, ugnayan-sanhi

basang pagpapatunay

Plano ng eksperimento

Tunay na resulta ng eksperimento

Ulat

burador

Reproducibility, transparency, pag-apruba ng eksperto

Mga karaniwang pagkakamali

  • Iniisip na tama ang gumaganang code. "Nagtrabaho nang walang pagkakamali" ≠ "tamang resulta"; dapat subukan gamit ang data ng pagsubok.
  • Pag-bypass sa verification gate. Ang pagpasa sa isang pinto para sa kapakanan ng bilis ay naglalagay sa lahat ng mga susunod na hakbang sa panganib.
  • Pagpapabaya sa reproducibility. Kung walang pagpaparehistro sa kapaligiran/bersyon ang resulta ay hindi maaaring kopyahin.
  • Pag-antala/paglaktaw sa basang pag-verify. Ang isang desisyon ay hindi maaaring gawin hanggang ang hula sa computer ay nakumpirma ng eksperimento.
  • Nakakalimutan ang transparency at pag-apruba ng eksperto. Ang huling lagda at deklarasyon ng AI ay bahagi ng daloy ng trabaho.

Sa buod

Ang responsableng bioengineering ay gumagamit ng AI hindi bilang mga indibidwal na tool, ngunit bilang bahagi ng isang end-to-end na daloy ng trabaho na may mga validation gate. Python at reproducibility ay ang backbone ng daloy na ito; Nagsusulat ng code ang AI ngunit ibe-verify mo ito gamit ang data ng pagsubok, dahil hindi tamang code ang gumaganang code. Bumibilis ang AI sa bawat hakbang, nagve-verify ang tao sa bawat pinto; Ang mga kritikal na hypotheses ay sinusuri sa basang laboratoryo, at ang mga resulta ay iniulat nang malinaw at may pag-apruba ng eksperto. Ang kakanyahan ng modyul na ito ay nasa isang pangungusap: Gawin ang bilis ng AI, panatilihin ang desisyon at responsibilidad sa tao.

Gawain ng aplikasyon

Magdisenyo ng start-to-finish workflow para sa sarili mong tanong sa pananaliksik. Hayaang makabuo ang AI ng isang pitong hakbang na plano na may template na "workflow skeleton" at idagdag ang iyong sariling verification gate sa bawat hakbang. Pagkatapos ay mag-print ng script na may template na "Python code + test request" para sa isa sa mga hakbang sa pagsusuri, patakbuhin ito gamit ang maliit na data ng pagsubok at patunayan na tama ang output. Panghuli, maghanda ng listahan ng "pagsusuri ng pagpapatunay ng resulta" at ihanda ang daloy ng trabaho na ito para sa pag-uulat. I-record ang buong proseso sa isang reproducible (code + media + document) na format.

checklist

  • [ ] Dinisenyo ko ang workflow na may pitong hakbang at verification gate sa bawat hakbang.
  • [ ] Na-verify ko ang code na isinulat ng AI na may kilalang data ng pagsubok.
  • [ ] Ginawa kong reproducible ang pagsusuri (bersyon, kapaligiran, binhi, dokumento).
  • [ ] Iniuugnay ko ang kritikal na hypothesis sa wet lab validation.
  • [ ] Nagtayo ako ng data privacy at mga kontrol sa biosecurity sa workflow.
  • [ ] Nakumpleto ko ang ulat nang may malinaw na pahayag ng AI at pag-apruba ng eksperto.

Pagsusulit sa Module

1. Alin sa mga sumusunod ang pinakatumpak na pagpoposisyon para sa artificial intelligence sa bioengineering?

  • A) AI ay isang screening at drafting tool; Ang responsibilidad para sa mga desisyon na tumutukoy sa biyolohikal na kahulugan at kaligtasan ay nasa mga tao ✔
  • B) Ang artificial intelligence ay maaaring direktang maglagay ng mga molekula ng kandidato sa produksyon nang walang pag-apruba ng tao
  • C) Dahil ang artificial intelligence ay palaging mas layunin kaysa sa mga tao, ang biological na interpretasyon ay dapat na iwan dito.
  • D) Ang artificial intelligence ay kapaki-pakinabang lamang para sa pagbubuod ng teksto, wala itong kinalaman sa data ng laboratoryo

Paglalarawan: Artipisyal na katalinuhan; Ito ay isang katulong na nag-scan ng marami at maingay na data, nagmamarka ng mga pattern at gumagawa ng mga sketch. Ang karampatang eksperto ang gumagawa ng biyolohikal na kahulugan, kaligtasan at panghuling desisyon; ang isang hindi na-verify na printout ay maaaring maglagay sa isang pasyente, isang production batch, o isang publication sa panganib. Sa mga lugar na kritikal sa kaligtasan, ang output ng AI ay hindi kapalit ng pag-apruba ng eksperto.

2. Ano ang layunin ng 'source linking' na hakbang kapag nagpapatunay ng isang output ng AI?

  • A) Pag-aalis ng mga gawa-gawang (hallucinatory) na konklusyon sa pamamagitan ng pagkonekta sa bawat claim sa kongkretong data o sa orihinal na pinagmulan ✔
  • B) Gawing mas tuluy-tuloy at nababasa ang output
  • C) Nilaktawan ang pagpapatunay upang matapos ang pagsusuri nang mas mabilis
  • D) Pagtanggap ng mga sanggunian na ibinigay ng artificial intelligence kung ano ang mga ito

Paglalarawan: Ang AI ay matatas ngunit paminsan-minsan ay gumagawa ng mga guni-guni; maaaring magpakita ng hindi umiiral na gene, landas, o sanggunian bilang totoo. Ang pag-uugnay sa bawat claim sa hard data o sa orihinal na pinagmulan ay pumipigil sa isang gawa-gawang konklusyon na mahanap ang paraan sa ulat o publikasyon.

3. Kapag binibigyang-kahulugan ang isang BLAST o resulta ng pagkakahanay ng pagkakasunud-sunod, alin ang kinakailangan upang masuri ang isang 'kumpiyansa' na tugma?

  • A) Tinitingnan lang ang haba ng string
  • B) Direktang umaasa sa uri ng pangalan na ibinigay ng artificial intelligence
  • C) Pagsusuri ng mga sukatan ng pagkakahanay tulad ng porsyentong pagkakakilanlan, saklaw, at e-value nang magkasama ✔
  • D) Bilangin lamang kung ilang linya ang output

Paglalarawan: Ang mga sukatan tulad ng porsyento ng pagkakakilanlan, saklaw, at e-value ay kinakailangan upang mapatunayan ang isang serye ng interpretasyon. Ang isang maliit na e-value ay nagpapahiwatig na ang pagkakatulad ay hindi nagkataon. Kung wala ang mga sukatan na ito, hindi mabe-verify ang interpretasyong 'this protein is that' at maaaring isang guni-guni.

4. Bakit ginagamit ang 'adjusted p-value' (padj) kapag sinusuri ang 20,000 genes nang sabay-sabay sa RNA-seq differential expression analysis?

  • A) Upang madagdagan ang pagbabago sa sahig
  • B) Upang kontrolin ang mga maling positibo dahil sa maraming pagsubok at limitahan ang maling rate ng pagtuklas ✔
  • C) Upang bawasan ang laki ng sample
  • D) Upang mapabilis ang pagsusuri

Paliwanag: Kapag ang libu-libong mga gene ay sinubukan nang sabay-sabay, daan-daang mga gene ang maaaring maging 'mahalaga' kahit na nagkataon. Nililimitahan ng maramihang pagwawasto sa pagsubok tulad ng Benjamini-Hochberg ang maling rate ng pagtuklas. Gamit ang raw p-value ang listahan ay nagiging mapanlinlang na namamaga; Ang paggamit ng padj ay mahalaga para sa siyentipikong pagtatanggol.

5. Ano ang bitag na nangyayari sa pagsusuri ng omics kapag ang dalawang pangkat ng paggamot ay pinoproseso sa magkaibang mga araw, na humahantong sa pagkakamali ng isang teknikal na pagkakaiba para sa isang biyolohikal na pagkakaiba?

  • A) Error sa pagbabago ng sahig
  • B) Pag-optimize ng Codon
  • C) Batch effect ✔
  • D) Epekto ng gilid

Paliwanag: Ang batch effect ay ang teknikal na pagkakaiba na nagmumula sa pagproseso ng mga sample ng iba't ibang araw, device o tao at ito ang pinakamalaking pinagmumulan ng error sa pagsusuri ng omics. Bago simulan ang pagsusuri, kinakailangang gumuhit ng tsart ng PCA at suriin kung ang mga sample ay naka-cluster ayon sa biological na kondisyon o batch.

6. Ano ang ibig sabihin ng marka ng pLDDT para sa isang hula sa istruktura ng protina na ginawa gamit ang AlphaFold at paano ito dapat gamitin?

  • A) Ipinapakita ang antas ng kumpiyansa ng modelo para sa bawat rehiyon; Dapat iwasan ang mga paghahabol batay sa mga low confidence zone ✔
  • B) Sinusukat nito kung gaano kabilis ang pagtiklop ng protina at maaaring balewalain
  • C) Nagpapatunay na ang protina ay may isang tiyak na istraktura na nalutas nang eksperimento.
  • D) Direktang nagbibigay ng docking affinity

Paglalarawan: Ang pLDDT ay isang marka ng kumpiyansa na nagsasaad kung gaano tiwala ang modelo para sa bawat amino acid. Ang mga mataas na halaga (>90) ay karaniwang maaasahan; ang mga mas mababang halaga (<50) ay kadalasang nagpapahiwatig ng hindi regular o hindi malinaw na mga rehiyon. Ang mga mekanismo ng pag-claim batay sa mga rehiyong mababa ang kumpiyansa ay nakakapanlinlang; ang mga kritikal na istruktura ay dapat na ma-verify sa eksperimentong paraan.

7. Paano dapat bigyang-kahulugan ang mga marka ng molecular docking sa disenyo ng gamot/enzyme?

  • A) Dapat itong ituring bilang ganap na nagbubuklod na pagkakaugnay.
  • B) Tinitiyak nito na ang isang molekula ay hindi kailanman magbubuklod
  • C) Ito ay isang kamag-anak na kasangkapan para sa pag-order ng mga molekula bago ang eksperimento; Ang panghuling desisyon ay ginawa sa pamamagitan ng pang-eksperimentong pagsukat ng affinity ✔
  • D) Ang nag-iisa ay sapat na para sa klinikal na pag-apruba

Komento: Ang mga marka ng docking ay kaugnay at hindi hinuhulaan ang aktwal na pagkakaugnay; Mataas ang false positive rate. Ang tamang paggamit ay ang pagsunud-sunod ng libu-libong molekula bago ang eksperimento at i-highlight ang mga pinaka-maaasahan. Ang panghuling desisyon ay ginagawa sa pamamagitan ng pang-eksperimentong pagsukat ng affinity gaya ng SPR o ITC.

8. Ano ang pangunahing depekto ng 'one variable at a time' (OFAT) na pamamaraan para sa isang bioprocess engineer na naghahanap upang i-optimize ang limang parameter?

  • A) Nakakaligtaan ang mga pakikipag-ugnayan sa pagitan ng mga parameter ✔
  • B) Palaging nangangailangan ng kaunting eksperimento
  • C) Pinapataas ang kapangyarihan sa istatistika
  • D) Awtomatikong inaalis ang batch effect

Paliwanag: Ang paraan ng OFAT ay nakakaligtaan ang mga pakikipag-ugnayan sa pagitan ng mga parameter; siguro ang mataas na temperatura ay mabuti lamang sa mababang pH. Kinukuha ng disenyo ng mga eksperimento (DoE) ang mga pakikipag-ugnayan at binabawasan ang bilang ng mga eksperimento na may mga factorial na disenyo na nag-iiba-iba ng mga parameter nang magkasama at balanse.

9. Ano ang tamang diskarte kapag ang isang modelo ng pag-optimize ay nagrekomenda ng temperatura na papatay sa kultura sa laboratoryo?

  • A) Pagpapatupad ng mungkahi dahil mas matalino ang modelo
  • B) Pagbibigay ng mga limitasyon sa kaligtasan at pisyolohikal bilang mga hadlang sa modelo at pagsuri sa bawat mungkahi na may kaalaman sa laboratoryo ✔
  • C) Pag-abandona sa pag-optimize nang buo
  • D) Subukang huwag pansinin ang limitasyon ng temperatura

Paliwanag: Hindi alam ng modelo ang mga limitasyon sa pisyolohikal at kaligtasan; mathematical optimum ay maaaring mapanganib o imposible. Ang tamang diskarte ay ang pagbibigay ng mga limitasyon sa kaligtasan at pisyolohikal bilang mga hadlang sa modelo at suriin ang bawat mungkahi na may kaalaman sa laboratoryo. Ang pisikal na limitasyon trumps ang mathematical pinakamabuting kalagayan.

10. Alin ang mandatory kapag sinusuri ang resulta ng isang awtomatikong bilang ng cell o pag-uuri ng fluorescence?

  • A) Direktang pagtanggap sa resulta, dahil mas mabilis ang modelo kaysa sa tao
  • B) Pag-uulat lamang ng bilang ng mga larawan
  • C) Tinitingnan lamang ang imahe na may pinakamataas na signal
  • D) Manu-manong i-verify ang output sa isang sample at i-validate gamit ang naaangkop na mga kontrol (kabilang ang negatibo, hindi nabahiran) ✔

Paglalarawan: Ang awtomatikong output ay dapat na manu-manong na-verify sa isang sample at ang bawat pagsukat ay dapat ma-validate gamit ang mga naaangkop na kontrol (positibo, negatibo, blangko, walang mantsa). Halimbawa, kung mayroong signal sa hindi nabahiran na kontrol, ito ay maaaring autofluorescence; Kung walang mga kontrol, hindi matukoy ng awtomatikong pagsusuri ang tunay na signal mula sa artifact.

11. Ano ang dapat gawin kung ang isang panukala sa pag-optimize sa isang bioprocess ay nagpapataas ng ani ngunit nangangailangan ng isang kritikal na katangian ng kalidad (CQA) na wala sa detalye?

  • A) Dahil mahalaga ang kahusayan, mas gusto ang opsyon na may mataas na kahusayan
  • B) Ang kahusayan ay pinananatili sa pamamagitan ng pagrerelaks sa limitasyon ng CQA
  • C) Ang desisyon ay naiwan sa artificial intelligence
  • D) Ang kalidad ay inuuna kaysa sa kahusayan; Ang pagpipiliang kalidad na nasa loob ng espasyo ng disenyo ay mas gusto ✔

Paglalarawan: Sa bioprocessing, ang kalidad ay nagbubunga; Ang mga limitasyon ng CQA (purity, glycosylation, activity) ay dapat mapanatili para maging ligtas at epektibo ang produkto. Kung ang punto na nagpapalaki sa kahusayan ay nagpapahina sa kalidad, ang pagpipiliang kalidad na natitira sa loob ng espasyo ng disenyo ay mas gusto.

12. Ano ang pangunahing panganib kapag sinabihan ang isang modelo ng wika na 'maghanap ng 10 artikulo sa paksang ito at ibuod ang mga ito'?

  • A) Ang modelo ay tumatakbo nang napakabagal
  • B) Ang modelo ay maaaring makabuo ng makatotohanan ngunit hindi umiiral (ginawa) na mga sanggunian nang hindi nagsasagawa ng tunay na paghahanap ✔
  • C) Ang modelo ay palaging nakakahanap ng masyadong maraming mga artikulo
  • D) Ang modelo ay nagbabalik lamang ng mga lumang artikulo

Paliwanag: Ang mga simpleng tool sa chat ay kadalasang hindi nagsasagawa ng mga aktwal na paghahanap; bumubuo ng istatistikal na 'tila malamang' na mga sagot mula sa memorya. Nangangahulugan ito ng makatotohanan ngunit pekeng mga sanggunian (ginawa na may-akda, journal, DOI). Ang bawat sanggunian ay dapat na ma-verify laban sa aktwal na database (PubMed, DOI) at, kung maaari, ang mga tool na nakabatay sa RAG na naka-link sa aktwal na mga dokumento ay dapat gamitin.

13. Ano ang tamang pag-uugali kapag ang isang gumagamit ay nagtanong sa AI ng mga mutasyon na magpapataas sa bisa ng isang bacterial toxin?

  • A) Pagsagot sa kahilingan nang detalyado dahil ito ay siyentipiko
  • B) Pagbabawas ng panganib sa pamamagitan ng pagbibigay lamang ng bahagyang impormasyon
  • C) Tanggihan ang kahilingan, ipaliwanag na ito ay nasa ilalim ng DURC, at iulat ito sa institutional na biosecurity channel ✔
  • D) Huwag pansinin ang kahilingan at lumipat sa ibang paksa

Paliwanag: Ang kahilingang ito ay isang mapaminsalang kahilingan sa ilalim ng dual-use (DURC). Dapat tanggihan ng AI ang mga naturang kahilingan, ipaliwanag kung bakit nagdudulot ito ng panganib na dalawahan ang paggamit, at iulat ang sitwasyon sa corporate biosafety/ethics channel. Walang teknikal na payo ang dapat ibigay na magpapataas ng potensyal para sa pinsala.

14. Anong konklusyon ang tama kapag ang isang script ng pagsusuri sa Python na isinulat ng artificial intelligence ay gumagana nang walang mga pagkakamali?

  • A) Ang resulta ay ganap na tama dahil gumagana ang code
  • B) Hindi na kailangang subukan ang code dahil isinulat ito ng AI
  • C) Ang kawalan ng mga pagkakamali ay ginagarantiyahan din ang muling paggawa.
  • D) Maaaring hindi tama ang tumatakbong code; Ang inaasahang output ay dapat ma-verify laban sa kilalang data ng pagsubok ✔

Paliwanag: 'Nagtrabaho ito nang walang mga pagkakamali' at 'nagbigay ito ng tamang resulta' ay dalawang magkaibang bagay. Maaaring tahimik na ibalik ng code ang maling resulta dahil sa error sa unit, maling column, o hindi nakuhang filter. Ang bawat code ay dapat na masuri gamit ang isang maliit na data ng pagsubok na ang input at output ay kilala; Gayunpaman, dapat itong ituring na maaasahan kapag nagbibigay ito ng inaasahang resulta.