Mga nadagdag:
- Kakayahang protektahan ang sensitibong data ng tao/genetic na data alinsunod sa mga tuntunin ng KVKK, GDPR at komite ng etika at iwasang ibigay ang mga ito sa bukas na modelo
- Kakayahang tanungin ang bisa ng mga resulta sa pamamagitan ng pagtatasa ng mga panganib ng biosecurity/dalawang paggamit at bias ng populasyon
- Ang pag-unawa na ang etikal na responsibilidad ay hindi maaaring italaga sa sasakyan at ang makabuluhang human-in-the-loop ay kinakailangan
Ang malakas na paggamit ng artificial intelligence sa biology ay kinukumpleto ng paggamit nito nang responsable. Ang biology ay isang sensitibong larangan na nakakaapekto sa kalusugan ng tao, genetic privacy, sa kapaligiran at maging sa biosecurity. Sa yunit na ito, tatalakayin natin ang etikal, legal at seguridad na mga responsibilidad na iyong haharapin kapag gumagamit ng artificial intelligence sa biological studies. Ang unit na ito ay isang framework na binuo sa mga prinsipyo ng pag-verify at katapatan sa lahat ng nakaraang unit.
Pangunahing prinsipyo: Ang AI ay isang kasangkapan; Ang etikal na responsibilidad ay laging nasa tao. "Ang iminungkahing modelo" ay hindi isang dahilan.
Apat na lugar ng responsibilidad
1. Pagkapribado ng data at data ng tao
Ang genetic, klinikal o data ng kalusugan mula sa mga kalahok ng tao ay lubhang sensitibo. Ang pagkakasunud-sunod ng DNA ng isang tao ay maaaring magbunyag ng kanilang panganib at pagkakakilanlan sa sakit at pagkakakilanlan ng kanilang mga kamag-anak; Kahit na ang genomic na data na naisip na hindi nagpapakilala ay maaaring muling tukuyin. Ang pag-paste ng data na ito sa isang pampublikong modelo ng AI ay maaaring lumabag sa mga batas sa proteksyon ng data (KVKK sa Türkiye, GDPR sa Europe) at mga pag-apruba ng ethics board (IRB/ethics committee).
- Huwag magbigay ng personal/klinikal na data sa bukas na modelo.
- Iwasan ang paggamit nang lampas sa saklaw ng pahintulot; Ano ang pinahintulutan ng kalahok?
- Mag-opt para sa enterprise/local (on-premise) o mga tool sa kontrata sa pagpoproseso ng data.
2. Biosecurity at dalawahang paggamit
Ang ilang biological na impormasyon ay "dalawang paggamit": maaari itong maging kapaki-pakinabang at nakakapinsala; halimbawa, mga pagkakasunod-sunod ng pathogen (nagdudulot ng sakit), produksyon ng lason. Ang pagtatanong sa AI para sa impormasyon sa pagpapahusay ng mga mapanganib na pathogen o pagdidisenyo ng mga mapaminsalang biological agent ay hindi etikal at ilegal sa karamihan ng mga lugar.
- Huwag gumawa ng mga mapanganib na kahilingan sa dalawahang paggamit.
- Sundin ang mga alituntunin ng biosafety board (IBC) ng iyong institusyon.
3. Siyentipikong integridad
Lahat ng nakita natin sa mga nakaraang unit ay magkakasama dito: walang huwad na pagpapatungkol, walang pagpapaganda ng data, walang p-hacking, walang piling pag-uulat. Ang artificial intelligence ay maaaring gawing mas madali o mas mahirap ang mga ito; Ang pagkakaiba ay nasa iyong katapatan.
- Iulat ang lahat ng mga resulta (kabilang ang mga negatibo).
- Ipahayag ang paggamit ng artificial intelligence.
- Suportahan ang reproducibility sa pamamagitan ng pagbabahagi ng raw data at code (kung maaari).
4. Pagkiling at pagiging patas
Ang mga modelo ng AI ay nagdadala ng mga bias ng data kung saan sila sinanay. Ang mga genomic database ay higit na nagmumula sa mga populasyon na may lahing European; humahantong ito sa mas mahihirap na hula sa ibang mga populasyon. Ang isang modelo ng imahe ay maaaring gumanap nang hindi maganda sa isang kundisyong hindi gaanong kinakatawan sa data ng pagsasanay.
- Tanungin kung saang populasyon/data ang pinagsanayan ng modelo.
- Suriin kung ang mga resulta ay nasa lahat ng pangkat.
Tip: Tanungin ang iyong sarili: "Kung ibibigay ko ang data na ito sa modelo, kanino ito nabibilang at nagbigay ba ng pahintulot ang taong iyon?" Kung malabo ang sagot, huwag ibigay. Ang paglabag sa pagiging kumpidensyal ay hindi maibabalik.
Hakbang-hakbang: responsableng kontrol ng AI
- Uriin ang pinagmumulan ng data: Personal/sensitibo o pampubliko?
- Tingnan ang pahintulot at mga pahintulot: Saklaw ba ang paggamit na ito?
- Piliin ang tamang tool: Secure/katutubong kapaligiran para sa sensitibong data.
- Isaalang-alang ang panganib ng dalawahang paggamit.
- Bias ng tanong: Wasto ba ang resulta sa lahat ng grupo?
- Idokumento at ideklara ang paggamit.
Nakokopya na mga template ng prompt
Suriin ang aking plano sa pagsusuri sa ibaba mula sa isang etikal na pananaw: maglista ng mga babala tungkol sa pagiging kumpidensyal ng data, pahintulot ng kalahok, potensyal na bias, at panganib ng dalawahang paggamit. Plano: [text] (Tandaan: HINDI ako nagbabahagi ng aktwal na data ng pasyente, ang plano lang.)
Anong mga tanong sa privacy at pahintulot ang dapat kong sagutin bago gamitin ang genomic dataset na ito? Ang isang checklist ay inihanda sa mga tuntunin ng KVKK/GDPR at ang komite ng etika.
Paano ko dapat malinaw na idedeklara ang artificial intelligence tool na ginagamit ko sa seksyon ng pamamaraan ng aking artikulo? Sumulat ng isang halimbawa ng pangungusap na paturol; anong impormasyon (tool, bersyon, saklaw ng paggamit) ang dapat nitong taglayin?
Paano ko susuriin kung ang mga resulta ng modelong ito ay may bias sa populasyon? Ilista ang mga tanong na dapat kong itanong tungkol sa data ng pagsasanay at mga hakbang sa pagsusuri.
Mahinang prompt / Malakas na prompt
Mahina: "Suriin ang genetic data ng sumusunod na pasyente: [real data]."
Güçlü: "Nagse-set up ako ng isang plano sa pagsusuri na gumagana sa data ng klinikal na genomic, ngunit hindi ako nagbabahagi ng totoong data ng pasyente. Mula lamang sa isang metodolohikal na pananaw: anong mga hakbang sa pagiging kumpidensyal ang dapat kong gawin, sa anong kapaligiran ko dapat iproseso ang data, anong mga kondisyon ng pag-apruba at komite ng etika ang dapat kong matugunan? Maaari mong ipakita ang daloy gamit ang dummy/sample na data."
Pagkakaiba: Walang aktwal na sensitibong data ang ibinabahagi sa malakas na prompt; Ang pamamaraan lamang ang tinatanong. Pinapanatili ang privacy, nakakatulong pa rin ang modelo.
tatlong mini case
Kaso 1 — Paglabag sa privacy: Na-paste ng isang researcher ang inaakala niyang anonymous na data ng exome ng pasyente sa isang bukas na modelo para masuri ito. Nang malaman ito ng komite ng etika, nasuspinde ang pag-aaral; Walang kasunduan sa pagproseso ng data. Aralin: hindi pumapasok ang sensitibong data sa bukas na modelo.
Kaso 2 — Pagkiling ng populasyon: Isang tool sa marka ng polygenic na panganib ang sinanay sa data na pinagmulang European; Sa ibang populasyon, ang mga pagtatantya sa panganib ay hindi tumpak. Nang iminungkahi ng modelo na tanungin ang komposisyon ng data ng pagsasanay, nagpasya ang koponan na huwag gamitin ang tool sa populasyon na iyon. Aral: ang pagkiling ay nagliligtas o nakakapinsala sa mga buhay.
Kaso 3 — Pagsisiwalat at transparency: Sumulat ang isang team ng data cleaning code gamit ang AI at malinaw na sinabi ito sa seksyon ng pamamaraan; Ibinahagi din niya ang code. Tinanggap ito ng mga reviewer dahil malakas ang repeatability. Aralin: ang transparency ay nagbubunga ng tiwala.
tsart ng paghahambing
lugar
ligtas na pag-uugali
mapanganib na pag-uugali
data ng pasyente
Lokal/secure na kapaligiran
I-paste para buksan ang modelo
pagpayag
Gamitin sa loob ng saklaw
Huwag lumampas sa saklaw
Biosecurity
Pag-iwas sa dalawahang paggamit
mapanganib na pangangailangan
integridad
Iulat ang lahat ng resulta
piling pag-uulat
pagkiling
Itanong ang populasyon
Mag-apply nang bulag
transparency
Ipahayag ang paggamit
nagtatago
Mga karaniwang pagkakamali
- Pagbibigay ng sensitibong data sa bukas na modelo: Hindi maibabalik na paglabag sa privacy.
- Lampas sa saklaw ng pahintulot: Paggamit na hindi pinahintulutan ng kalahok.
- Pagbabalewala sa bias: Pag-generalize ng mga resulta sa lahat ng grupo.
- Pagtatago ng paggamit: Hindi pagdedeklara ng kontribusyon ng AI.
- "Iminungkahi ng modelo" na pagtatanggol: Pag-uugnay ng responsibilidad sa sasakyan.
Pag-iingat: Sa high-consequence biological work (clinical decision, biosafety, human data) AI output ay hindi isang kapalit para sa karampatang pag-verify ng eksperto at etikal na pangangasiwa; pinapabilis lang nito. Ang tunay na pananagutan ay laging nasa tao, kasama ang etikal at siyentipikong mga kahihinatnan ng desisyon.
Kapaligiran, ekolohiya at tradisyonal na kaalaman
Ang etikal na responsibilidad ay hindi limitado sa data ng tao. Kailangan din ang pag-iingat kapag gumagamit ng artificial intelligence sa ecology at conservation biology. Halimbawa, ang tumpak na data ng lokasyon (camera trap coordinates) ng isang endangered species ay sensitibo dahil sa panganib ng poaching; Ang paglalabas ng data na ito sa isang bukas na modelo o publiko ay maaaring makapinsala sa mga species. Katulad nito, lumilitaw ang mga isyu sa etika at legal (tulad ng Nagoya Protocol) kapag ang tradisyunal na biyolohikal na kaalaman ng mga lokal na komunidad (hal. paggamit ng halaman) ay ginamit nang walang pahintulot. Bago gamitin ang data, "kanino nabibilang ang impormasyong ito at sino ang masasaktan sa pagsisiwalat nito?" Laging magtanong.
Ang pangangasiwa ng tao at panghuling desisyon
Ang kakanyahan ng buong modyul na ito ay bumagsak sa isang prinsipyo: makabuluhang pangangasiwa ng tao. Gumagawa ang AI ng mungkahi, nagsusulat ng draft, nagpapakita ng pattern; Ngunit ang isang biyolohikal, klinikal o etikal na desisyon ay hindi kailanman nakabatay nang direkta sa output ng modelo. Lalo na sa mga lugar na may mataas na panganib (diagnosis, paggamot, desisyon sa konserbasyon ng mga species, pagpapalabas), ang papel ng modelo ay hindi upang gumawa ng mga desisyon, ngunit upang mapabilis ang desisyon ng eksperto. Ang "human-in-the-loop" na diskarte ay hindi isang slogan, ngunit isang pangangailangan.
Para gumana ang surveillance na ito, dapat na may kakayahan ang superbisor. Ang bulag na pahintulot ("sabi ng modelo, pagtanggap") ay hindi oversight. Ang tunay na pangangasiwa ay nangangailangan ng kadalubhasaan na maaaring magtanong sa output, mahuli ang error nito, at tanggihan ito kung kinakailangan. Samakatuwid, hindi pinapalitan ng artificial intelligence ang eksperto; Ginagawa nitong mas kailangan ang eksperto. Ang pinakamahusay na gumagamit ng sasakyan ay ang isa na pinakamahusay na makakontrol nito.
Sa buod
Ang responsableng paggamit ng AI sa biology ay sumasaklaw sa apat na bahagi: data privacy (pagprotekta sa sensitibong data ng tao), biosecurity (pag-iwas sa dobleng paggamit), integridad ng siyensya (tapat at kumpletong pag-uulat) at bias awareness (validity ng mga resulta sa lahat ng grupo). Huwag magbigay ng sensitibong data sa bukas na modelo, malinaw na ideklara ang paggamit, tanong ng bias ng populasyon. Ang etikal na responsibilidad ay hindi kailanman maaaring italaga sa ahente; Ito ay palaging nasa tao.
Gawain ng aplikasyon
Isaalang-alang ang isang senaryo mula sa iyong sariling workspace (hal. paggamit ng isang dataset ng tao o isang modelo ng larawan). Ipagawa sa AI ang etikal na checklist ng sitwasyong ito (pagiging kumpidensyal, pahintulot, pagkiling, dalawahang paggamit, transparency) nang hindi nagbabahagi ng totoong data. Para sa bawat aytem, markahan ito bilang "angkop/mapanganib/hindi tiyak" sa iyong sitwasyon at sumulat ng plano ng aksyon para sa mga mapanganib/hindi tiyak. Magkaroon din ng pahayag sa paggamit ng AI na naka-draft para sa iyong artikulo.
checklist
- [ ] Hindi ako nagbigay ng sensitibo/personal na data sa bukas na modelo.
- [ ] Sinuri ko ang saklaw ng komite ng pagpayag at etika.
- [ ] Nasuri ko ang panganib sa dalawahang paggamit/biosecurity.
- [ ] Iniulat ko nang tapat ang lahat ng resulta.
- [ ] Tinanong ko ang bias ng populasyon/data.
- [ ] Malinaw kong idineklara ang paggamit ng artificial intelligence at kinuha ang responsibilidad.
Pagsusulit sa Module
1. Tinanong ng isang mag-aaral ang modelo ng wika 'ilang mga string ang nasa FASTA file na ito?' tanong niya at '48' ang sagot ng modelo. Alin ang pinakatamang diskarte?
- A) Direktang gamit ang numerong 48 na ibinigay ng modelo; Ang modelo ay maaasahan dahil nakikita nito ang file
- B) Itanong muli ang numero at tanggapin ito bilang tama kung ang dalawang sagot ay pareho
- C) Binabasa ang file gamit ang Biopython, binibilang ang bilang ng mga sequence na may code at gamit ang output ✔
- D) Manu-manong pagbubukas ng file at pagbibilang sa pamamagitan ng desisyon ng mata
Paliwanag: Ang mga deterministikong gawain tulad ng pagbibilang at pagsukat ay dapat ipaubaya sa code na iyong pinapatakbo, hindi sa modelo ng wika. Ang modelo ay hindi 'naaalala' ang numero, ito ay gumagawa ng isang probabilistikong halaga at maaaring magkamali; Ang pagbibilang gamit ang isang tool tulad ng Biopython ay nagbibigay ng tumpak at reproducible na mga resulta.
2. Gusto mong bilangin ang mga cell sa isang imahe ng mikroskopyo at sukatin ang lugar ng bawat isa. Ano ang pinakaangkop na diskarte para sa gawaing ito?
- A) Paggamit ng isang expert segmentation tool tulad ng Cellpose/StarDist at manu-manong pag-verify ng resulta ✔
- B) I-paste ang larawan sa pangkalahatang modelo ng wika at itanong 'ilang mga cell ang naroon'
- C) Ilarawan ang larawan sa modelo at humingi ng tinatayang numero
- D) Pagtanggap ng bilang ng mga pixel bilang bilang ng mga cell nang walang anumang pagkakalibrate
Paliwanag: Ang pagse-segment at pagsukat ng cell ay hindi ang domain ng pangkalahatang modelo ng wika, ngunit ng mga espesyal na modelo ng imahe (Cellpose, StarDist) na espesyal na sinanay para sa gawaing ito. Isinulat ng modelo ng wika ang code na tumatawag sa mga tool na ito; Ang dalubhasang modelo ang gumagawa ng pagsukat, at ang biologist ang nagpapatunay sa resulta.
3. Nagdagdag ang isang mag-aaral na nagtapos ng 8 mga mapagkukunan na ginawa ng modelo ng wika sa kanyang panimula sa tesis. Nalaman ng consultant na 3 sa mga ito ay wala sa lahat. Paano mapipigilan ang sitwasyong ito?
- A) Sa pamamagitan ng pagtatanong sa modelo na gumawa muli ng mga mapagkukunan
- B) Sa pamamagitan ng pagpili lamang ng mga pagsipi na may DOI (kung mayroong DOI, ito ay totoo)
- C) Paghiling ng listahan sa pamamagitan ng pagtuturo sa modelo na 'magkasya'
- D) Malayang pag-verify sa bawat pagsipi sa PubMed/doi.org at pagbanggit lamang ng mga artikulong nabasa niya ✔
Paliwanag: Ang mga pangkalahatang modelo ng wika ay hindi isang database ng panitikan; Sa halip na maghanap ng mga totoong record, 'bumubuo' ito ng mga makatotohanang tunog na attribution (fabricated attribution). Ang bawat byline at DOI ay hindi dapat gamitin nang walang independiyenteng pag-verify sa mga mapagkukunan tulad ng PubMed/doi.org at pagbanggit lamang ng mga artikulo na aktwal na nabasa.
4. Ano ang pinakamabisang paraan upang matiyak ang katumpakan ng isang code sa paglilinis ng data na isinulat ng artificial intelligence?
- A) Kung gumagana ang code nang walang mga error, tanggapin ito bilang tama.
- B) Pagsubok sa resulta gamit ang isang maliit na kilalang sample at pag-verify ng inaasahan gamit ang assert ✔
- C) Itanong sa modelo 'tama ba ang code?' nagtatanong at nagtitiwala sa sagot na 'oo'
- D) Patakbuhin ang code nang maraming beses at makakuha ng parehong output sa bawat oras
Puna: Dahil lamang sa gumagana ang code nang walang mga error ay hindi nangangahulugan na ito ay tama; 'Wrong code working without errors' ay ang pinaka-mapanganib na sitwasyon sa biology. Ang pagsubok gamit ang isang maliit na sample na ang resulta ay alam mo nang maaga at ang pag-embed ng inaasahan sa code na may paggiit ay ang pinakamatibay na kalasag laban sa tahimik na mga maling resulta.
5. Sa isang pagsusuri sa RNA-seq, 20,000 genes ang sinubok at 3,800 genes ang napag-alamang 'makabuluhan' na may p<0.05 na walang pagwawasto. Ano ang pangunahing problema sa konklusyong ito?
- A) Ang bilang ng mga sample ay masyadong mataas, dapat itong bawasan
- B) masyadong mataas ang p threshold, 0.10 dapat ang ginamit
- C) Hindi isinagawa ang maramihang pagwawasto ng paghahambing (FDR); Maraming false positive ✔
- D) Dapat ay nasubok ang mga sample sa halip na mga gene
Paliwanag: Kapag sinubukan mo ang libu-libong mga gene nang sabay-sabay, maraming mga gene ang lumilitaw na 'makabuluhan' kapag nagkataon, kahit na walang tunay na pagkakaiba; Ito ay tinatawag na multiple comparison problem. Ang solusyon ay ang paglalapat ng FDR (false discovery rate) na pagwawasto sa isang paraan tulad ng Benjamini-Hochberg; Sa pagwawasto, ang listahan ay karaniwang bumababa sa sampu hanggang ilang daang gene.
6. Ang pinakamahusay na tugma sa isang resulta ng BLAST ay may E-value na 2.0. Ano ang ibig sabihin nito?
- A) Ang tugma ay malamang na random; ✔ hindi isang maaasahang laban
- B) Ang pagkabit ay napakalakas; Kung mas malaki ang e-value, mas mabuti
- C) Ang pagkakasunod-sunod ay tumugma sa rate na 2%
- D) Mayroong 2 base na pagkakaiba sa pagitan ng dalawang sequence
Paliwanag: Ang E-value ay nagpapahiwatig na ang inaasahan ng tugma ay random; Mas mabuting maging maliit. Ang isang e-value na higit sa 1 ay nagpapahiwatig na ang tugma ay malamang na random. Para sa mga maaasahang tugma, ang napakaliit na threshold tulad ng e < 1e-5 ay karaniwang hinahanap.
7. Sa isang AlphaFold na modelo, ang terminal na rehiyon ng protina ay nagpapakita ng mababang marka ng pLDDT (<50). Paano dapat bigyang-kahulugan ang rehiyong ito?
- A) Nagkamali ang AlphaFold sa rehiyong ito, dapat alisin ang rehiyon sa pagsusuri
- B) Ang rehiyong ito ay talagang isang alpha helix
- C) Ang modelo ay ganap na hindi maaasahan, ang istraktura ay hindi dapat gamitin
- D) Ang rehiyon ay malamang na hindi regular/nababanat; dapat bigyang-kahulugan bilang 'hindi malinaw' sa halip na 'false' ✔
Paglalarawan: Ang pLDDT ay ang lokal na marka ng kumpiyansa para sa bawat amino acid; Ang mga halagang mas mababa sa 50 ay kadalasang nagpapakita ng tunay na hindi regular (flexible, non-fixed) na mga rehiyon. Mali na awtomatikong tanggalin ang mga rehiyong ito bilang 'maling hula'; Ang isang mababang marka ay dapat basahin bilang 'hindi tiyak/nababaluktot' at ang biological na kahalagahan nito ay dapat suriin.
8. Ang isang mananaliksik ay nag-uulat ng mga lugar ng cell lamang sa mga pixel at ang mga resulta ay hindi naaayon sa literatura. Ano ang kulang na hakbang?
- A) Higit pang mga cell ang dapat mabilang
- B) Hindi isinagawa ang pag-calibrate ng scale (pixel-to-micrometer conversion), ang mga resulta ay hindi na-convert sa mga pisikal na unit ✔
- C) Maling napili ang tool sa pagse-segment
- D) Masyadong mataas ang resolution ng imahe
Paliwanag: Ang pag-calibrate ng scale (ilang micrometers bawat pixel) ay mahalaga upang kunin ang pisikal na laki mula sa larawan. Kung ang hakbang na ito ay nilaktawan ang mga halaga ay mananatiling hindi maihahambing, depende sa setting ng mikroskopyo. Ang mga lugar ay dapat i-convert sa mga pisikal na yunit tulad ng square micrometers.
9. Ang isang mag-aaral ay kumukuha ng 10 sample ng tissue mula sa isang mouse at gumagamit ng 'n=10' sa mga istatistika. Bakit ito mali?
- A) Masyadong kaunti ang 10 sample para sa mga istatistika, hindi bababa sa 30 ang kailangan
- B) Kailangang kumuha ng mga sample ng tissue mula sa iba't ibang organo
- C) Ang 10 halimbawang ito ay mga teknikal na pag-uulit; 1 pa rin ang biological n, ito ang tinatawag na repetition ✔
- D) Ang mga sample ay hindi wasto dahil kinuha ang mga ito sa parehong araw
Paliwanag: Ang mga paulit-ulit na sukat na kinuha mula sa parehong indibidwal ay mga teknikal na pag-uulit; kung saan ang statistical n ay ang bilang ng mga biological units (dito mice). Isinasaalang-alang ang teknikal na pag-uulit bilang biological (pseudoreplication) ay gumagawa ng maling kabuluhan. Ang wastong disenyo ay nangangahulugan ng pakikipagtulungan sa maraming indibidwal.
10. Isang pagsusuri ang natagpuan p=0.03. Ano ang tamang interpretasyon ng halagang ito?
- A) May 3% na posibilidad na makita ito o mas matinding resulta kapag sa katotohanan ay walang pagkakaiba ✔
- B) Ang posibilidad na maging totoo ang epekto ay 97%
- C) Ang posibilidad na maging totoo ang null hypothesis ay 3%
- D) Ang resulta ay 97% repeatable
Paliwanag: ang p-value ay hindi 'probability na totoo ang hypothesis' o 'probability na totoo ang epekto'. Ang p-value ay ang posibilidad na makita ang isang pagkakaiba bilang o higit na sukdulan kaysa sa naobserbahan kapag talagang walang pagkakaiba. Samakatuwid ang p=0.03 ay hindi nangangahulugang 'ang epekto ay 97% totoo'; ang mga resulta ay dapat ding suriin ayon sa laki ng epekto at pagitan ng kumpiyansa.
11. Sa isang pagtatanghal, ang 3% na pagkakaiba sa pagitan ng dalawang grupo ay ipinapakita bilang napakalaki sa pamamagitan ng pag-compress ng y-axis sa hanay na 95-100. Ano itong halimbawa?
- A) Isang mahusay na visualization technique; itinatampok ang pagkakaiba
- B) Colorblind friendly na palette problema
- C) Isang katanggap-tanggap na pagpili ng istilo
- D) Isang mapanlinlang at hindi tapat na tsart na nagpapalaki ng pagkakaiba sa pinutol na axis ✔
Paliwanag: Ang hindi pagsisimula ng axis mula sa zero (truncated axis) ay nanlilinlang sa manonood sa pamamagitan ng biswal na pagpapalaki ng maliit na pagkakaiba. Ito ay isang paglabag sa prinsipyo ng katapatan; Lalo na sa mga bar chart, ang axis ay dapat magsimula sa zero at ang pagkakaiba ay dapat ipakita sa aktwal na laki nito.
12. Idinidikit ng isang mananaliksik ang sa tingin niya ay anonymous na data ng exome ng pasyente sa isang modelo ng pampublikong wika upang masuri ito. Bakit may problema ang ugali na ito?
- A) Walang problema; maaaring ibahagi ang data kung anonymous
- B) Ang pagbibigay ng sensitibong data ng pasyente sa isang bukas na modelo ay isang paglabag sa privacy at etikal/legal (KVKK/GDPR) at hindi maaaring ibalik ✔
- C) Problema lang dahil magiging mabagal ang pagsusuri
- D) Problema ang modelo dahil hindi nito maintindihan ang data
Paglalarawan: Ang genetic/clinical data ng pasyente ay sobrang sensitibo; Kahit na ang genomic na data na naisip na hindi nagpapakilala ay maaaring muling makilala. Ang pagbibigay ng data na ito sa isang pampublikong modelo ay lumalabag sa mga pag-apruba ng KVKK/GDPR at ethics committee (IRB) at ito ay isang hindi maibabalik na paglabag sa privacy. Dapat iproseso ang sensitibong data sa lokal/secure, kinontratang kapaligiran.
13. Sa isang pag-aaral, ang pagkakaiba na inakala nilang 'patient vs control' ay dahil talaga sa mga sample na pinoproseso sa dalawang magkaibang araw. Ano ang tawag sa sitwasyong ito at paano ito hinahawakan?
- A) Ito ay ang outlier na epekto; dapat tanggalin ang mga tuldok
- B) Ito ay isang kakulangan ng normalisasyon; ang pagwawasto lamang ng sukat ay sapat na
- C) Ito ang batch effect; dapat balanse sa disenyo at idagdag sa modelo bilang batch variable ✔
- D) p-hack; dapat baguhin ang pagsubok
Paliwanag: Ang teknikal na pagkakaiba dahil sa sampling batch/araw ng pagproseso ay tinatawag na batch effect at maaaring malito sa biological difference. Ang tamang diskarte ay balansehin ang mga batch sa disenyo at idagdag ang batch variable sa istatistikal na modelo (hal. '~batch + condition'), kaya naghihiwalay ang teknikal na signal mula sa biological signal.
14. Gusto mong kalkulahin ang GC ratio ng isang DNA sequence. Alin ang tama at nauulit na paraan?
- A) I-print ang code na kinakalkula ang GC rate gamit ang Biopython, patakbuhin ito at gamitin ang output ✔
- B) Ibigay sa modelo ang pagkakasunod-sunod at hilingin dito na sabihin sa salita ang GC rate
- C) Kinukumpirma ang ratio na ibinigay ng modelo ng isa pang modelo
- D) Pagtingin sa unang 100 titik ng serye at paghula sa pamamagitan ng mata
Paliwanag: Ang GC rate ay isang deterministikong kalkulasyon; dapat ay nakabatay sa code na nagpoproseso ng array, hindi sa isang value na 'naaalala' ng modelo ng wika. Sa halip na kalkulahin ito ng modelo, ang pag-print ng code sa pagkalkula gamit ang isang tool tulad ng Biopython at patakbuhin ito mismo ay magbibigay ng tumpak na output na nagbibigay ng parehong resulta sa tuwing pinapatakbo mo ito.