Unit 11 / 11

Etika, Biosekuriti, Kerahsiaan dan Integriti Saintifik

Keuntungan:

  • Keupayaan untuk melindungi data manusia/genetik yang sensitif mengikut peraturan KVKK, GDPR dan jawatankuasa etika dan mengelak daripada memberikannya kepada model terbuka
  • Keupayaan untuk mempersoalkan kesahihan keputusan dengan menilai risiko biosekuriti/penggunaan dwi dan berat sebelah populasi
  • Memahami bahawa tanggungjawab etika tidak boleh diserahkan kepada kenderaan dan bahawa manusia dalam gelung yang bermakna adalah perlu

Menggunakan kecerdasan buatan secara kuat dalam biologi dilengkapkan dengan menggunakannya secara bertanggungjawab. Biologi ialah bidang sensitif yang menyentuh kesihatan manusia, privasi genetik, alam sekitar dan juga biosekuriti. Dalam unit ini, kami akan membincangkan tanggungjawab etika, undang-undang dan keselamatan yang anda akan hadapi apabila menggunakan kecerdasan buatan dalam kajian biologi. Unit ini adalah rangka kerja yang dibina berdasarkan prinsip pengesahan dan kejujuran dalam semua unit sebelumnya.

Prinsip asas: AI ialah alat; Tanggungjawab etika sentiasa terletak pada manusia. "Model yang dicadangkan" bukanlah alasan.

Empat bidang tanggungjawab

1. Privasi data dan data manusia

Data genetik, klinikal atau kesihatan daripada peserta manusia adalah sangat sensitif. Urutan DNA seseorang boleh mendedahkan risiko dan identiti penyakit mereka dan saudara-mara mereka; Malah data genomik yang dianggap tidak dikenali boleh dikenal pasti semula. Menampal data ini ke dalam model AI yang tersedia untuk umum mungkin melanggar undang-undang perlindungan data (KVKK di Türkiye, GDPR di Eropah) dan kelulusan lembaga etika (IRB/jawatankuasa etika).

  • Jangan berikan data peribadi/klinikal kepada model terbuka.
  • Elakkan penggunaan di luar skop persetujuan; Apakah yang dipersetujui oleh peserta?
  • Pilih alat kontrak perusahaan/tempatan (on-premise) atau pemprosesan data.

2. Biosekuriti dan penggunaan dwi

Sesetengah maklumat biologi adalah "penggunaan dwi": ia boleh berguna dan berbahaya; contohnya, urutan patogen (penyebab penyakit), pengeluaran toksin. Meminta AI untuk mendapatkan maklumat tentang meningkatkan patogen berbahaya atau mereka bentuk agen biologi berbahaya adalah tidak beretika dan menyalahi undang-undang di kebanyakan tempat.

  • Jangan buat permintaan dwiguna yang berbahaya.
  • Ikuti garis panduan lembaga biokeselamatan (IBC) institusi anda.

3. Integriti saintifik

Semua yang kami lihat dalam unit sebelumnya disatukan di sini: tiada atribusi palsu, tiada pengindahan data, tiada p-penggodaman, tiada pelaporan terpilih. Kecerdasan buatan boleh menjadikannya lebih mudah atau lebih sukar; Perbezaannya terletak pada kejujuran anda.

  • Laporkan semua keputusan (termasuk keputusan negatif).
  • Mengisytiharkan penggunaan kecerdasan buatan.
  • Sokong kebolehulangan dengan berkongsi data mentah dan kod (jika boleh).

4. Bias dan adil

Model AI membawa bias data di mana mereka dilatih. Pangkalan data genomik kebanyakannya datang daripada populasi keturunan Eropah; ini membawa kepada ramalan yang lebih buruk dalam populasi lain. Model imej mungkin berprestasi buruk dalam keadaan yang kurang diwakili dalam data latihan.

  • Persoalkan tentang populasi/data model yang dilatih.
  • Nilaikan sama ada keputusan berlaku merentas semua kumpulan.
Petua: Tanya diri anda: "Jika saya memberikan data ini kepada model, kepunyaan siapa data itu dan adakah orang itu memberi kebenaran?" Jika jawapannya tidak jelas, jangan berikan. Pelanggaran kerahsiaan tidak dapat dipulihkan.

Langkah demi langkah: kawalan AI yang bertanggungjawab

  1. Kelaskan sumber data: Peribadi/sensitif atau awam?
  2. Semak persetujuan dan kebenaran: Adakah penggunaan ini dilindungi?
  3. Pilih alat yang betul: Persekitaran selamat/asli untuk data sensitif.
  4. Pertimbangkan risiko penggunaan dua kali.
  5. Bias soalan: Adakah keputusan sah dalam semua kumpulan?
  6. Dokumen dan isytiharkan penggunaan.

Templat gesaan yang boleh disalin

Semak pelan analisis saya di bawah dari perspektif etika: senaraikan amaran mengenai kerahsiaan data, persetujuan peserta, potensi berat sebelah dan risiko penggunaan dwi-dua. Pelan: [teks] (Nota: Saya TIDAK berkongsi data pesakit sebenar, hanya pelan.)

Apakah soalan privasi dan persetujuan yang perlu saya jawab sebelum menggunakan set data genomik ini? Senarai semak disediakan dari segi KVKK/GDPR dan jawatankuasa etika.

Bagaimanakah saya harus mengisytiharkan secara telus alat kecerdasan buatan yang saya gunakan dalam bahagian kaedah artikel saya? Tulis contoh ayat deklaratif; apakah maklumat (alat, versi, skop penggunaan) yang harus terkandung di dalamnya?

Bagaimanakah saya menilai sama ada keputusan model ini mempunyai kecenderungan populasi? Senaraikan soalan yang saya patut tanya tentang data latihan dan langkah semak.

Gesaan lemah / Gesaan kuat

Lemah: "Analisis data genetik pesakit berikut: [data sebenar]."

Güçlü: "Saya sedang menyediakan pelan analisis yang berfungsi dengan data genomik klinikal, tetapi saya tidak berkongsi data pesakit sebenar. Hanya dari perspektif metodologi: apakah langkah kerahsiaan yang perlu saya ambil, dalam persekitaran apakah saya harus memproses data, apakah syarat kelulusan dan jawatankuasa etika yang perlu saya patuhi? Anda boleh menunjukkan aliran dengan data palsu/sampel."

Perbezaan: Tiada data sensitif sebenar dikongsi dalam gesaan berkuasa; Hanya kaedah yang ditanya. Privasi dikekalkan, model masih membantu.

tiga kes mini

Kes 1 — Pelanggaran privasi: Seorang penyelidik menampal apa yang dia fikirkan sebagai data exome pesakit tanpa nama ke dalam model terbuka untuk dianalisis. Apabila jawatankuasa etika mengetahui perkara ini, kajian itu digantung; Tiada perjanjian pemprosesan data. Pelajaran: data sensitif tidak pernah memasuki model terbuka.

Kes 2 — Kecondongan populasi: Alat skor risiko poligenik telah dilatih pada data asal Eropah; Dalam populasi lain, anggaran risiko adalah tidak tepat dengan ketara. Apabila model mencadangkan mempersoalkan komposisi data latihan, pasukan memutuskan untuk tidak menggunakan alat dalam populasi itu. Pengajaran: berat sebelah menyelamatkan atau membahayakan nyawa.

Kes 3 — Pendedahan dan ketelusan: Satu pasukan menulis kod pembersihan data dengan AI dan menyatakan ini dengan jelas dalam bahagian kaedah; Dia juga berkongsi kod itu. Pengulas mengalu-alukan ini kerana kebolehulangan adalah kukuh. Pengajaran: ketelusan melahirkan kepercayaan.

carta perbandingan

kawasan

tingkah laku selamat

tingkah laku berisiko

data pesakit

Persekitaran setempat/selamat

Tampal untuk membuka model

persetujuan

Gunakan dalam skop

Jangan melebihi skop

Biosekuriti

Mengelakkan penggunaan dua kali

permintaan berbahaya

integriti

Laporkan semua keputusan

pelaporan terpilih

berat sebelah

Tanya penduduk

Sapukan secara membuta tuli

ketelusan

Isytiharkan penggunaan

bersembunyi

Kesilapan biasa

  • Memberi data sensitif kepada model terbuka: Pelanggaran privasi tidak dapat dipulihkan.
  • Melebihi skop persetujuan: Penggunaan tidak dibenarkan oleh peserta.
  • Mengabaikan berat sebelah: Mengitlak keputusan kepada semua kumpulan.
  • Menyembunyikan penggunaan: Tidak mengisytiharkan sumbangan AI.
  • Pertahanan "Model dicadangkan": Mengaitkan tanggungjawab kepada kenderaan.
Awas: Dalam kerja biologi akibat tinggi (keputusan klinikal, biokeselamatan, data manusia) Output AI bukanlah pengganti untuk pengesahan pakar yang kompeten dan pengawasan etika; ia hanya mempercepatkannya. Tanggungjawab muktamad sentiasa terletak pada manusia, bersama dengan akibat etika dan saintifik daripada keputusan itu.

Alam sekitar, ekologi dan pengetahuan tradisional

Tanggungjawab etika tidak terhad kepada data manusia. Berhati-hati juga diperlukan apabila menggunakan kecerdasan buatan dalam ekologi dan biologi pemuliharaan. Contohnya, data lokasi yang tepat (koordinat perangkap kamera) spesies terancam adalah sensitif kerana risiko pemburuan haram; Mengeluarkan data ini kepada model terbuka atau awam boleh membahayakan spesies. Begitu juga, isu etika dan undang-undang (seperti Protokol Nagoya) timbul apabila pengetahuan biologi tradisional masyarakat tempatan (mis. penggunaan tumbuhan) digunakan tanpa kebenaran. Sebelum menggunakan data, "kepunyaan siapa maklumat ini dan siapa yang akan dirugikan oleh pendedahannya?" Sentiasa bertanya soalan.

Pengawasan manusia dan keputusan muktamad

Intipati keseluruhan modul ini berpunca kepada satu prinsip: pengawasan manusia yang bermakna. AI menghasilkan cadangan, menulis draf, menunjukkan corak; Tetapi keputusan biologi, klinikal atau etika tidak pernah berdasarkan secara langsung pada output model. Terutama di kawasan berisiko tinggi (diagnosis, rawatan, keputusan pemuliharaan spesies, pelepasan), peranan model bukan untuk membuat keputusan, tetapi untuk mempercepatkan keputusan pakar. Pendekatan "human-in-the-loop" bukanlah slogan, tetapi satu keperluan.

Untuk pengawasan ini berfungsi, penyelia mestilah cekap. Persetujuan buta (“kata model, penerimaan”) bukanlah kelalaian. Pengawasan sebenar memerlukan kepakaran yang boleh mempersoalkan output, menangkap kesilapannya dan menolaknya apabila perlu. Oleh itu, kecerdasan buatan tidak menggantikan pakar; Ia menjadikan pakar lebih diperlukan. Orang yang menggunakan kenderaan dengan baik adalah orang yang boleh mengawalnya dengan lebih baik.

Secara ringkasnya

Penggunaan AI yang bertanggungjawab dalam biologi meliputi empat bidang: privasi data (melindungi data manusia yang sensitif), biosekuriti (mengelakkan penggunaan berganda), integriti saintifik (pelaporan yang jujur dan lengkap) dan kesedaran berat sebelah (kesahihan keputusan merentas semua kumpulan). Jangan berikan data sensitif kepada model terbuka, isytiharkan penggunaan secara telus, soal berat sebelah populasi. Tanggungjawab etika tidak boleh diwakilkan kepada ejen; Ia sentiasa ada pada manusia.

Tugasan permohonan

Pertimbangkan senario dari ruang kerja anda sendiri (cth. menggunakan set data manusia atau model imej). Minta AI menghasilkan senarai semak etika senario ini (kerahsiaan, persetujuan, berat sebelah, penggunaan dua kali, ketelusan) tanpa berkongsi data sebenar. Untuk setiap item, tandakannya sebagai "sesuai/berisiko/tidak pasti" dalam situasi anda dan tulis pelan tindakan untuk mereka yang berisiko/tidak pasti. Juga sediakan pernyataan penggunaan AI yang dirangka untuk artikel anda.

senarai semak

  • [ ] Saya tidak memberikan data sensitif/peribadi kepada model terbuka.
  • [ ] Saya menyemak skop persetujuan dan jawatankuasa etika.
  • [ ] Saya telah menilai risiko penggunaan dwi/biosekuriti.
  • [ ] Saya melaporkan semua keputusan dengan jujur.
  • [ ] Saya mempersoalkan kecenderungan populasi/data.
  • [ ] Saya secara telus mengisytiharkan penggunaan kecerdasan buatan dan bertanggungjawab.

Peperiksaan Modul

1. Seorang pelajar bertanya kepada model bahasa 'berapa banyak rentetan dalam fail FASTA ini?' dia bertanya dan model menjawab '48'. Manakah pendekatan yang paling betul?

  • A) Secara langsung menggunakan nombor 48 yang diberikan oleh model; Model ini boleh dipercayai kerana ia melihat fail
  • B) Tanya nombor itu sekali lagi dan terima ia sebagai betul jika kedua-dua jawapan adalah sama
  • C) Membaca fail dengan Biopython, mengira bilangan jujukan dengan kod dan menggunakan output ✔
  • D) Membuka fail secara manual dan mengira dengan keputusan mata

Penjelasan: Tugas penentu seperti mengira dan mengukur harus diserahkan kepada kod yang anda jalankan, bukan kepada model bahasa. Model tidak 'mengingat' nombor, ia menghasilkan nilai kebarangkalian dan mungkin tersilap; Mengira dengan alat seperti Biopython memberikan hasil yang tepat dan boleh dihasilkan semula.

2. Anda ingin mengira sel dalam imej mikroskop dan mengukur luas setiap satu. Apakah pendekatan yang paling sesuai untuk tugasan ini?

  • A) Menggunakan alat segmentasi pakar seperti Cellpose/StarDist dan mengesahkan keputusan secara manual ✔
  • B) Tampal imej ke dalam model bahasa umum dan tanya 'berapa banyak sel yang ada'
  • C) Terangkan imej kepada model dan minta nombor anggaran
  • D) Menerima bilangan piksel sebagai bilangan sel tanpa sebarang penentukuran

Penjelasan: Pembahagian dan pengukuran sel bukanlah domain model bahasa umum, tetapi model imej khusus (Cellpose, StarDist) yang dilatih khas untuk tugas ini. Model bahasa menulis kod yang memanggil alat ini; Model pakar membuat pengukuran, dan ahli biologi mengesahkan hasilnya.

3. Seorang pelajar siswazah menambah 8 sumber yang dihasilkan oleh model bahasa kepada pengenalan tesisnya. Perunding mendapati bahawa 3 daripada ini tidak wujud sama sekali. Bagaimanakah keadaan ini boleh dicegah?

  • A) Dengan meminta model untuk menghasilkan sumber sekali lagi
  • B) Dengan hanya memilih petikan dengan DOI (jika ada DOI, ia adalah nyata)
  • C) Meminta senarai dengan mengarahkan model untuk 'sesuai'
  • D) Mengesahkan secara bebas setiap petikan di PubMed/doi.org dan hanya memetik artikel yang telah dibacanya ✔

Penjelasan: Model bahasa am bukan pangkalan data literatur; Daripada mencari rekod sebenar, ia 'menjana' atribusi yang berbunyi realistik (atribusi rekaan). Setiap byline dan DOI tidak boleh digunakan tanpa pengesahan bebas dalam sumber seperti PubMed/doi.org dan hanya memetik artikel yang sebenarnya telah dibaca.

4. Apakah cara yang paling berkuasa untuk memastikan ketepatan kod pembersihan data yang ditulis oleh kecerdasan buatan?

  • A) Jika kod berfungsi tanpa ralat, terima ia sebagai betul.
  • B) Menguji keputusan dengan sampel kecil yang diketahui dan mengesahkan jangkaan dengan tegas ✔
  • C) Tanya model 'adakah kod itu betul?' bertanya dan mempercayai jawapan 'ya'
  • D) Jalankan kod beberapa kali dan dapatkan output yang sama setiap kali

Catatan: Hanya kerana kod berfungsi tanpa ralat tidak bermakna ia betul; 'Kod salah berfungsi tanpa ralat' adalah situasi paling berbahaya dalam biologi. Menguji dengan sampel kecil yang keputusannya anda ketahui lebih awal dan membenamkan jangkaan dalam kod dengan menegaskan adalah perisai paling kuat terhadap keputusan salah senyap.

5. Dalam analisis RNA-seq, 20,000 gen diuji dan 3,800 gen didapati 'signifikan' dengan p<0.05 tanpa pembetulan. Apakah masalah utama dengan kesimpulan ini?

  • A) Bilangan sampel terlalu tinggi, ia perlu dikurangkan
  • B) ambang p terlalu tinggi, 0.10 sepatutnya digunakan
  • C) Pembetulan perbandingan berbilang (FDR) tidak dilakukan; Terdapat banyak positif palsu ✔
  • D) Sampel sepatutnya telah diuji dan bukannya gen

Penjelasan: Apabila anda menguji beribu-ribu gen secara serentak, banyak gen kelihatan 'ketara' secara kebetulan, walaupun tidak ada perbezaan yang nyata; Ini dipanggil masalah perbandingan berganda. Penyelesaiannya adalah dengan menggunakan pembetulan FDR (kadar penemuan palsu) dengan kaedah seperti Benjamini-Hochberg; Dengan pembetulan, senarai biasanya berkurangan kepada puluhan hingga beberapa ratus gen.

6. Padanan terbaik dalam keputusan BLAST mempunyai nilai E 2.0. Apakah maksud ini?

  • A) Perlawanan kemungkinan besar rawak; ✔ bukan perlawanan yang boleh dipercayai
  • B) Gandingan sangat kuat; Lebih besar e-nilai, lebih baik
  • C) Urutan dipadankan pada kadar 2%
  • D) Terdapat 2 perbezaan asas antara kedua-dua jujukan

Penjelasan: Nilai E menunjukkan jangkaan padanan adalah rawak; Lebih baik menjadi kecil. Nilai-e yang lebih besar daripada 1 menunjukkan bahawa padanan itu berkemungkinan besar rawak. Untuk padanan yang boleh dipercayai, ambang yang sangat kecil seperti e < 1e-5 biasanya dicari.

7. Dalam model AlphaFold, kawasan terminal protein menunjukkan skor pLDDT yang rendah (<50). Bagaimanakah wilayah ini harus ditafsirkan?

  • A) AlphaFold membuat ralat di rantau ini, rantau itu harus dialih keluar daripada analisis
  • B) Kawasan ini pastinya adalah heliks alfa
  • C) Model tidak boleh dipercayai sepenuhnya, strukturnya tidak boleh digunakan
  • D) Rantau ini berkemungkinan tidak teratur/anjal; hendaklah ditafsirkan sebagai 'tidak jelas' dan bukannya 'palsu' ✔

Penerangan: pLDDT ialah skor keyakinan tempatan bagi setiap asid amino; Nilai di bawah 50 selalunya mencerminkan kawasan yang benar-benar tidak teratur (fleksibel, tidak tetap). Adalah salah untuk memadamkan wilayah ini secara automatik sebagai 'tekaan yang salah'; Skor rendah harus dibaca sebagai 'tidak pasti/fleksibel' dan kepentingan biologinya harus dinilai.

8. Seorang penyelidik melaporkan kawasan sel hanya dalam piksel dan hasilnya tidak konsisten dengan literatur. Apakah langkah yang hilang?

  • A) Lebih banyak sel sepatutnya dikira
  • B) Penentukuran skala (penukaran piksel-ke-mikrometer) tidak dilakukan, keputusan tidak ditukar kepada unit fizikal ✔
  • C) Alat pembahagian telah dipilih secara salah
  • D) Resolusi imej terlalu tinggi

Penjelasan: Penentukuran skala (berapa banyak mikrometer setiap piksel) adalah penting untuk mengekstrak saiz fizikal daripada imej. Jika langkah ini dilangkau nilainya kekal tidak dapat dibandingkan, bergantung pada tetapan mikroskop. Kawasan mesti ditukar kepada unit fizikal seperti mikrometer persegi.

9. Seorang pelajar mengambil 10 sampel tisu daripada seekor tikus dan menggunakan 'n=10' dalam statistik. Mengapa ini tidak betul?

  • A) 10 sampel terlalu sedikit untuk statistik, sekurang-kurangnya 30 diperlukan
  • B) Sampel tisu perlu diambil dari organ yang berbeza
  • C) 10 contoh ini adalah pengulangan teknikal; n biologi masih 1, ini adalah pengulangan yang dipanggil ✔
  • D) Sampel tidak sah kerana diambil pada hari yang sama

Penjelasan: Pengukuran berulang yang diambil daripada individu yang sama adalah ulangan teknikal; di mana statistik n ialah bilangan unit biologi (di sini tikus). Mempertimbangkan pengulangan teknikal sebagai biologi (pseudoreplikasi) menghasilkan kepentingan palsu. Reka bentuk yang betul bermakna bekerja dengan berbilang individu.

10. Satu analisis mendapati p=0.03. Apakah tafsiran yang betul bagi nilai ini?

  • A) Terdapat 3% peluang untuk melihat keputusan ini atau lebih ekstrem sedangkan pada hakikatnya tiada perbezaan ✔
  • B) Kebarangkalian kesannya adalah nyata ialah 97%
  • C) Kebarangkalian hipotesis nol adalah benar ialah 3%
  • D) Hasilnya adalah 97% boleh diulang

Penjelasan: nilai-p bukan 'kebarangkalian bahawa hipotesis adalah benar' atau 'kebarangkalian bahawa kesannya adalah benar'. Nilai-p ialah kebarangkalian untuk melihat perbezaan sebagai atau lebih ekstrem daripada yang diperhatikan apabila sebenarnya tiada perbezaan. Oleh itu p=0.03 tidak bermakna 'kesannya adalah 97% nyata'; keputusan juga harus dinilai dengan saiz kesan dan selang keyakinan.

11. Dalam pembentangan, perbezaan 3% antara dua kumpulan ditunjukkan sebagai besar dengan memampatkan paksi-y kepada julat 95-100. Apakah ini contoh?

  • A) Teknik visualisasi yang baik; menyerlahkan perbezaan
  • B) Masalah palet mesra buta warna
  • C) Pilihan gaya yang boleh diterima
  • D) Carta mengelirukan dan tidak jujur yang membesar-besarkan perbezaan dengan paksi terpotong ✔

Penjelasan: Tidak memulakan paksi daripada sifar (paksi terpenggal) mengelirukan penonton dengan membesar-besarkan perbezaan kecil secara visual. Ini adalah pelanggaran prinsip kejujuran; Terutamanya dalam carta bar, paksi harus bermula dari sifar dan perbezaan harus ditunjukkan dengan saiz sebenar.

12. Seorang penyelidik menampal apa yang difikirkannya sebagai data exome pesakit tanpa nama ke dalam model bahasa awam untuk dianalisis. Mengapa tingkah laku ini bermasalah?

  • A) Tiada masalah; data boleh dikongsi jika tanpa nama
  • B) Menyediakan data pesakit yang sensitif kepada model terbuka adalah pelanggaran privasi dan etika/undang-undang (KVKK/GDPR) dan tidak boleh diterbalikkan ✔
  • C) Ia bermasalah hanya kerana analisis akan menjadi perlahan
  • D) Model bermasalah kerana tidak dapat memahami data

Penerangan: Data genetik/klinikal pesakit sangat sensitif; Malah data genomik yang dianggap tanpa nama boleh dikenal pasti semula. Memberi data ini kepada model awam melanggar kelulusan KVKK/GDPR dan jawatankuasa etika (LHDN) dan merupakan pelanggaran privasi yang tidak dapat dipulihkan. Data sensitif harus diproses dalam persekitaran tempatan/selamat dan berkontrak.

13. Dalam satu kajian, perbezaan yang mereka anggap sebagai 'pesakit vs kawalan' sebenarnya disebabkan sampel diproses pada dua hari berbeza. Apakah nama situasi ini dan bagaimana ia dikendalikan?

  • A) Ia adalah kesan terpencil; titik harus dipadamkan
  • B) Ia adalah kekurangan normalisasi; pembetulan skala sahaja sudah memadai
  • C) Ia adalah kesan kelompok; harus seimbang dalam reka bentuk dan ditambah pada model sebagai pembolehubah kelompok ✔
  • D) penggodaman p; ujian harus diubah

Penjelasan: Perbezaan teknikal disebabkan kumpulan persampelan/hari pemprosesan dipanggil kesan kelompok dan boleh dikelirukan dengan perbezaan biologi. Pendekatan yang betul adalah untuk mengimbangi kelompok dalam reka bentuk dan menambah pembolehubah kelompok pada model statistik (cth. '~batch + condition'), dengan itu memisahkan isyarat teknikal daripada isyarat biologi.

14. Anda ingin mengira nisbah GC bagi jujukan DNA. Manakah pendekatan yang betul dan boleh diulang?

  • A) Cetak kod yang mengira kadar GC dengan Biopython, jalankan dan gunakan output ✔
  • B) Berikan model itu urutan dan minta ia memberitahu secara lisan kadar GC
  • C) Mengesahkan nisbah yang diberikan oleh model oleh model lain
  • D) Melihat 100 huruf pertama siri dan meneka dengan mata

Penjelasan: Kadar GC ialah pengiraan deterministik; hendaklah berdasarkan kod yang memproses tatasusunan, bukan pada nilai yang model bahasa 'ingat'. Daripada meminta model mengiranya, mencetak kod pengiraan dengan alat seperti Biopython dan menjalankannya sendiri akan memberikan output yang tepat yang memberikan hasil yang sama setiap kali anda menjalankannya.