Zyski:
- Możliwość ochrony wrażliwych danych ludzkich/genetycznych zgodnie z KVKK, RODO i zasadami komisji etyki oraz unikania udostępniania ich modelowi otwartemu
- Możliwość kwestionowania ważności wyników poprzez ocenę ryzyka bezpieczeństwa biologicznego/podwójnego zastosowania i stronniczości populacji
- Zrozumienie, że odpowiedzialności etycznej nie można przenieść na pojazd i że konieczne jest zaangażowanie człowieka w pętlę
Silne wykorzystanie sztucznej inteligencji w biologii uzupełnia odpowiedzialne korzystanie z niej. Biologia to delikatna dziedzina, która wpływa na zdrowie ludzkie, prywatność genetyczną, środowisko, a nawet bezpieczeństwo biologiczne. W tej części omówimy obowiązki etyczne, prawne i związane z bezpieczeństwem, jakie będziesz musiał ponieść, korzystając ze sztucznej inteligencji w badaniach biologicznych. Jednostka ta stanowi ramy zbudowane na zasadach weryfikacji i uczciwości we wszystkich poprzednich jednostkach.
Podstawowa zasada: sztuczna inteligencja jest narzędziem; Odpowiedzialność etyczna zawsze spoczywa na człowieku. „Proponowany model” nie jest wymówką.
Cztery obszary odpowiedzialności
1. Prywatność danych i dane ludzkie
Dane genetyczne, kliniczne lub zdrowotne uczestników badania są niezwykle wrażliwe. Sekwencja DNA danej osoby może ujawnić ryzyko choroby i tożsamość jej samej oraz jej bliskich; Nawet dane genomowe, które uważa się za anonimowe, można ponownie zidentyfikować. Wklejenie tych danych do publicznie dostępnego modelu sztucznej inteligencji może naruszyć przepisy o ochronie danych (KVKK w Turcji, RODO w Europie) i zgody komisji etyki (IRB/komisji etyki).
- Nie podawaj danych osobowych/klinicznych otwartemu modelowi.
- Unikaj używania wykraczającego poza zakres zgody; Na co uczestnik wyraził zgodę?
- Wybierz narzędzia do obsługi umów korporacyjnych/lokalnych (lokalnych) lub do przetwarzania danych.
2. Bezpieczeństwo biologiczne i podwójne zastosowanie
Niektóre informacje biologiczne mają „podwójne zastosowanie”: mogą być zarówno przydatne, jak i szkodliwe; na przykład sekwencje patogenów (powodujących chorobę), wytwarzanie toksyn. Proszenie sztucznej inteligencji o informacje na temat wzmacniania niebezpiecznych patogenów lub projektowania szkodliwych czynników biologicznych jest w większości miejsc nieetyczne i nielegalne.
- Nie wysyłaj niebezpiecznych żądań podwójnego zastosowania.
- Postępuj zgodnie z wytycznymi Rady ds. Bezpieczeństwa Biologicznego (IBC) swojej instytucji.
3. Uczciwość naukowa
Wszystko, co widzieliśmy w poprzednich rozdziałach, łączy się tutaj: żadnych fałszywych atrybucji, żadnego upiększania danych, żadnego hakowania p, żadnego selektywnego raportowania. Sztuczna inteligencja może to ułatwić lub utrudnić; Różnica polega na twojej uczciwości.
- Raportuj wszystkie wyniki (w tym negatywne).
- Zadeklaruj wykorzystanie sztucznej inteligencji.
- Wspieraj odtwarzalność, udostępniając surowe dane i kod (jeśli to możliwe).
4. Uprzedzenia i uczciwość
Modele sztucznej inteligencji niosą ze sobą błędy w zakresie danych, na których są szkolone. Genomowe bazy danych pochodzą głównie od populacji pochodzenia europejskiego; prowadzi to do gorszych prognoz w innych populacjach. Model obrazu może działać słabo w stanie, który jest niedostatecznie reprezentowany w danych szkoleniowych.
- Zapytaj, na jakiej populacji/danych model został przeszkolony.
- Oceń, czy wyniki potwierdzają się we wszystkich grupach.
Wskazówka: zadaj sobie pytanie: „Jeśli przekażę te dane modelowi, do kogo one należą i czy ta osoba wyraziła na to zgodę?” Jeśli odpowiedź jest niejasna, nie udzielaj jej. Naruszenie poufności jest nieodwracalne.
Krok po kroku: odpowiedzialna kontrola AI
- Sklasyfikuj źródło danych: osobiste/wrażliwe czy publiczne?
- Sprawdź zgodę i uprawnienia: Czy to użycie jest objęte gwarancją?
- Wybierz odpowiednie narzędzie: Bezpieczne/natywne środowisko dla wrażliwych danych.
- Należy wziąć pod uwagę ryzyko podwójnego zastosowania.
- Błędne pytanie: czy wynik jest ważny we wszystkich grupach?
- Dokumentuj i deklaruj użycie.
Kopiowalne szablony podpowiedzi
Przejrzyj mój plan analizy poniżej z punktu widzenia etycznego: wymień ostrzeżenia dotyczące poufności danych, zgody uczestnika, potencjalnej stronniczości i ryzyka podwójnego zastosowania. Plan: [tekst] (Uwaga: NIE udostępniam rzeczywistych danych pacjenta, tylko plan.)
Na jakie pytania dotyczące prywatności i zgody powinienem odpowiedzieć przed użyciem tego zbioru danych genomowych? Przygotowywana jest lista kontrolna pod kątem KVKK/RODO i komisji etyki.
Jak powinienem w przejrzysty sposób zadeklarować narzędzie sztucznej inteligencji, którego używam w części mojego artykułu dotyczącej metod? Napisz przykładowe zdanie oznajmujące; jakie informacje (narzędzie, wersja, zakres zastosowania) powinien zawierać?
Jak ocenić, czy wyniki tego modelu wykazują błąd populacyjny? Wypisz pytania, które powinienem zadać na temat danych szkoleniowych i kroków kontrolnych.
Słaba zachęta/silna zachęta
Słabe: „Przeanalizuj następujące dane genetyczne pacjenta: [prawdziwe dane]”.
Güçlü: „Przygotowuję plan analizy, który działa na klinicznych danych genomicznych, ale nie udostępniam prawdziwych danych pacjentów. Tylko z metodologicznego punktu widzenia: jakie środki zachowania poufności powinienem podjąć, w jakim środowisku powinienem przetwarzać dane, jakie warunki zatwierdzenia i komisji etyki powinienem spełnić? Możesz pokazać przepływ za pomocą danych fikcyjnych/próbkowych”.
Różnica: w potężnym monicie nie są udostępniane żadne wrażliwe dane; Pytanie dotyczy tylko metody. Prywatność zachowana, model nadal pomaga.
trzy mini etui
Przypadek 1 — Naruszenie prywatności: Badacz wkleił do otwartego modelu coś, co uważał za anonimowe dane z egzonu pacjenta, w celu ich analizy. Kiedy dowiedziała się o tym komisja etyczna, badanie zawieszono; Nie było umowy powierzenia przetwarzania danych. Lekcja: wrażliwe dane nigdy nie trafiają do otwartego modelu.
Przypadek 2 – Błąd populacyjny: narzędzie oceny ryzyka wielogenowego zostało przeszkolone w oparciu o dane pochodzenia europejskiego; W innej populacji szacunki ryzyka były znacząco niedokładne. Kiedy model zasugerował zakwestionowanie składu danych uczących, zespół zdecydował się nie używać tego narzędzia w tej populacji. Lekcja: uprzedzenia ratują lub szkodzą życiu.
Przypadek 3 – Ujawnianie i przejrzystość: Zespół napisał kod czyszczenia danych za pomocą sztucznej inteligencji i wyraźnie to określił w sekcji dotyczącej metody; Udostępnił także kod. Recenzenci z zadowoleniem przyjęli to, ponieważ powtarzalność była duża. Lekcja: przejrzystość rodzi zaufanie.
tabela porównawcza
obszar
bezpieczne zachowanie
ryzykowne zachowanie
dane pacjenta
Lokalne/bezpieczne środowisko
Wklej do otwartego modelu
zgoda
Używaj w zakresie
Nie przekraczaj zakresu
Bezpieczeństwo biologiczne
Unikanie podwójnego zastosowania
niebezpieczne żądanie
integralność
Zgłaszaj wszystkie wyniki
raportowanie selektywne
stronniczość
Zapytaj populację
Aplikuj na ślepo
przejrzystość
Zadeklaruj użycie
ukrywanie się
Typowe błędy
- Przekazanie wrażliwych danych modelowi otwartemu: Nieodwracalne naruszenie prywatności.
- Przekroczenie zakresu zgody: Wykorzystanie nieautoryzowane przez uczestnika.
- Ignorowanie uprzedzeń: Uogólnianie wyników na wszystkie grupy.
- Ukrywanie użycia: brak deklaracji wkładu AI.
- Obrona „sugerowany model”: przypisanie odpowiedzialności pojazdowi.
Przestroga: W pracach biologicznych o poważnych konsekwencjach (decyzja kliniczna, bezpieczeństwo biologiczne, dane ludzkie) wyniki sztucznej inteligencji nie zastępują kompetentnej weryfikacji eksperckiej ani nadzoru etycznego; to tylko przyspiesza. Ostateczna odpowiedzialność zawsze spoczywa na człowieku, wraz z etycznymi i naukowymi konsekwencjami decyzji.
Środowisko, ekologia i wiedza tradycyjna
Odpowiedzialność etyczna nie ogranicza się do danych ludzkich. Ostrożność należy zachować także przy stosowaniu sztucznej inteligencji w ekologii i biologii konserwatorskiej. Na przykład dokładne dane o lokalizacji (współrzędne fotopułapki) zagrożonego gatunku są wrażliwe ze względu na ryzyko kłusownictwa; Ujawnienie tych danych otwartemu modelowi lub opinii publicznej może zaszkodzić gatunkowi. Podobnie kwestie etyczne i prawne (takie jak Protokół z Nagoi) pojawiają się, gdy tradycyjna wiedza biologiczna społeczności lokalnych (np. wykorzystanie rośliny) jest wykorzystywana bez pozwolenia. Przed wykorzystaniem danych „do kogo należą te informacje i komu mogłoby zaszkodzić ich ujawnienie?” Zawsze zadawaj pytanie.
Nadzór człowieka i ostateczna decyzja
Istota całego modułu sprowadza się do jednej zasady: znaczącego nadzoru człowieka. AI przedstawia sugestię, pisze wersję roboczą, pokazuje wzór; Jednak decyzja biologiczna, kliniczna czy etyczna nigdy nie opiera się bezpośrednio na wynikach modelu. Szczególnie w obszarach wysokiego ryzyka (diagnoza, leczenie, decyzja o ochronie gatunku, wypuszczenie) rolą modelu nie jest podejmowanie decyzji, ale przyspieszenie decyzji eksperta. Podejście „human-in-the-loop” nie jest sloganem, ale koniecznością.
Aby nadzór był skuteczny, przełożony musi być kompetentny. Ślepa zgoda („modelka powiedziała, akceptacja”) nie jest przeoczeniem. Prawdziwy nadzór wymaga wiedzy specjalistycznej, która potrafi zakwestionować wyniki, wychwycić błędy i w razie potrzeby odrzucić je. Dlatego sztuczna inteligencja nie zastępuje eksperta; Dzięki temu ekspert staje się jeszcze bardziej niezbędny. Ten, kto najlepiej korzysta z pojazdu, to ten, który potrafi go najlepiej kontrolować.
Podsumowując
Odpowiedzialne wykorzystanie sztucznej inteligencji w biologii obejmuje cztery obszary: prywatność danych (ochrona wrażliwych danych ludzkich), bezpieczeństwo biologiczne (unikanie podwójnego użycia), rzetelność naukową (uczciwe i pełne raportowanie) oraz świadomość stronniczości (ważność wyników we wszystkich grupach). Nie dostarczaj wrażliwych danych do otwartego modelu, deklaruj użycie w sposób przejrzysty, kwestionuj stronniczość populacji. Odpowiedzialność etyczna nie może być nigdy delegowana na agenta; Zawsze jest u ludzi.
Zadanie aplikacji
Rozważ scenariusz z własnego obszaru roboczego (np. przy użyciu zbioru danych ludzkich lub modelu obrazu). Niech sztuczna inteligencja sporządzi listę kontrolną etyczną dla tego scenariusza (poufność, zgoda, stronniczość, podwójne zastosowanie, przejrzystość) bez udostępniania prawdziwych danych. Dla każdej pozycji oznacz ją jako „właściwą/ryzykowną/niepewną” w Twojej sytuacji i napisz plan działania dla tych, które są ryzykowne/niepewne. Przygotuj także oświadczenie dotyczące wykorzystania sztucznej inteligencji dla swojego artykułu.
lista kontrolna
- [ ] Nie przekazałem modelowi otwartemu danych wrażliwych/osobowych.
- [ ] Sprawdziłem zakres zgody i komisji etyki.
- [ ] Oceniłem ryzyko podwójnego zastosowania/bezpieczeństwa biologicznego.
- [ ] Wszystkie wyniki raportowałem rzetelnie.
- [ ] Kwestionowałem stronniczość populacji/danych.
- [ ] W przejrzysty sposób zadeklarowałem wykorzystanie sztucznej inteligencji i wziąłem na siebie odpowiedzialność.
Egzamin modułowy
1. Uczeń zapytał model języka „ile ciągów znaków znajduje się w tym pliku FASTA?” – pyta, a modelka odpowiada „48”. Które podejście jest najwłaściwsze?
- A) Bezpośrednio używając liczby 48 podanej przez model; Model jest niezawodny, ponieważ widzi plik
- B) Zapytaj numer jeszcze raz i zaakceptuj go jako poprawny, jeśli obie odpowiedzi są takie same
- C) Odczyt pliku za pomocą Biopythona, zliczenie liczby sekwencji z kodem i wykorzystanie wyniku ✔
- D) Otwieranie pliku ręcznie i liczenie na podstawie decyzji wzrokowej
Objaśnienie: Zadania deterministyczne, takie jak liczenie i mierzenie, należy pozostawić uruchamianemu kodowi, a nie modelowi języka. Model nie „pamięta” liczby, podaje wartość probabilistyczną i może się mylić; Liczenie za pomocą narzędzia takiego jak Biopython daje dokładne i powtarzalne wyniki.
2. Chcesz policzyć komórki na obrazie mikroskopowym i zmierzyć powierzchnię każdej z nich. Jakie jest najwłaściwsze podejście do tego zadania?
- A) Korzystanie z eksperckiego narzędzia do segmentacji, takiego jak Cellpose/StarDist i ręczna weryfikacja wyniku ✔
- B) Wklej obraz do ogólnego modelu języka i zapytaj „ile jest komórek”
- C) Opisz obraz modelowi i poproś o szacunkową liczbę
- D) Przyjmowanie liczby pikseli jako liczby komórek bez jakiejkolwiek kalibracji
Wyjaśnienie: Segmentacja i pomiary komórek nie są domeną ogólnego modelu językowego, ale wyspecjalizowanych modeli obrazu (Cellpose, StarDist) specjalnie przeszkolonych do tego zadania. Model językowy zapisuje kod wywołujący te narzędzia; Model ekspercki dokonuje pomiaru, a biolog weryfikuje wynik.
3. Doktorant dodaje do wstępu swojej pracy 8 źródeł wytworzonych przez model językowy. Konsultant stwierdza, że 3 z nich w ogóle nie istnieją. Jak można zapobiec tej sytuacji?
- A) Poproś model o ponowne wyprodukowanie zasobów
- B) Wybierając tylko cytaty z DOI (jeśli jest DOI, to jest ono prawdziwe)
- C) Zażądanie listy poprzez polecenie modelowi, aby „pasował”
- D) Samodzielna weryfikacja każdego cytatu na PubMed/doi.org i cytowanie tylko tych artykułów, które przeczytał ✔
Wyjaśnienie: Ogólne modele języka nie są bazą danych literatury; Zamiast szukać prawdziwych zapisów, „generuje” realistycznie brzmiące atrybucje (atrybucje sfabrykowane). Nie należy używać każdego Byline i DOI bez niezależnej weryfikacji w źródłach takich jak PubMed/doi.org i cytując jedynie artykuły, które zostały faktycznie przeczytane.
4. Jaki jest najskuteczniejszy sposób zapewnienia dokładności kodu czyszczącego dane napisanego przez sztuczną inteligencję?
- A) Jeśli kod działa bez błędów, zaakceptuj go jako poprawny.
- B) Testowanie wyniku na małej znanej próbie i weryfikacja oczekiwań za pomocą potwierdzenia ✔
- C) Zapytaj modela: „Czy kod jest poprawny?” pytać i ufać odpowiedzi „tak”
- D) Uruchom kod kilka razy i za każdym razem uzyskaj ten sam wynik
Uwaga: To, że kod działa bez błędów, nie znaczy, że jest poprawny; „zły kod działający bez błędów” to najniebezpieczniejsza sytuacja w biologii. Testowanie na małej próbce, której wynik znasz z góry i osadzanie oczekiwań w kodzie za pomocą potwierdzenia, jest najsilniejszą ochroną przed cichymi błędnymi wynikami.
5. W analizie seq RNA testuje się 20 000 genów i okazuje się, że 3800 genów jest „istotnych” z p < 0,05 bez korekty. Jaki jest główny problem związany z tą konkluzją?
- A) Liczba próbek jest zbyt duża, należy ją zmniejszyć
- B) Próg p jest zbyt wysoki, należało zastosować wartość 0,10
- C) Nie wykonano korekty przez wielokrotne porównanie (FDR); Istnieje wiele fałszywych alarmów ✔
- D) Zamiast genów należało zbadać próbki
Wyjaśnienie: Kiedy testujesz tysiące genów jednocześnie, wiele z nich przez przypadek wydaje się „istotnych”, nawet jeśli nie ma między nimi żadnej rzeczywistej różnicy; Nazywa się to problemem wielokrotnego porównania. Rozwiązaniem jest zastosowanie korekcji FDR (false Discovery) metodą taką jak Benjamini-Hochberg; Po korekcie lista zwykle zmniejsza się do kilkudziesięciu do kilkuset genów.
6. Najlepsze dopasowanie w wyniku BLAST ma wartość E 2,0. Co to oznacza?
- A) Dopasowanie jest najprawdopodobniej losowe; ✔ nie jest to wiarygodne dopasowanie
- B) Sprzężenie jest bardzo mocne; Im większa wartość e, tym lepiej
- C) Sekwencja dopasowana z szybkością 2%
- D) Różnica pomiędzy tymi dwiema sekwencjami wynosi 2 zasady
Objaśnienie: Wartość E wskazuje, że dopasowanie będzie losowe; Lepiej być małym. Wartość e większa niż 1 wskazuje, że dopasowanie jest najprawdopodobniej losowe. W przypadku niezawodnych dopasowań na ogół poszukuje się bardzo małych progów, takich jak e <1e-5.
7. W modelu AlphaFold region końcowy białka wykazuje niski wynik pLDDT (<50). Jak należy interpretować ten region?
- A) AlphaFold popełnił błąd w tym obszarze, region należy usunąć z analizy
- B) Ten region jest zdecydowanie helisą alfa
- C) Model jest całkowicie zawodny, nie należy stosować konstrukcji
- D) Region jest prawdopodobnie nieregularny/elastyczny; należy interpretować raczej jako „niejasne” niż „fałszywe” ✔
Opis: pLDDT to lokalny wynik pewności dla każdego aminokwasu; Wartości poniżej 50 często odzwierciedlają naprawdę nieregularne (elastyczne, niestałe) obszary. Automatyczne usuwanie tych regionów ze względu na „błędne domysły” jest błędne; Niski wynik należy rozumieć jako „niepewny/elastyczny” i należy ocenić jego znaczenie biologiczne.
8. Badacz podaje obszary komórek tylko w pikselach, a wyniki są niezgodne z literaturą. Jakiego brakuje kroku?
- A) Należy policzyć więcej komórek
- B) Nie przeprowadzono kalibracji skali (konwersji pikseli na mikrometry), wyników nie przeliczono na jednostki fizyczne ✔
- C) Narzędzie do segmentacji zostało wybrane nieprawidłowo
- D) Rozdzielczość obrazu jest zbyt wysoka
Objaśnienie: Kalibracja skali (ile mikrometrów na piksel) jest niezbędna do wyodrębnienia rozmiaru fizycznego z obrazu. Jeśli pominiemy ten krok, wartości pozostaną nieporównywalne, w zależności od ustawienia mikroskopu. Powierzchnie należy przeliczyć na jednostki fizyczne, takie jak mikrometry kwadratowe.
9. Uczeń pobiera 10 próbek tkanek od jednej myszy i wykorzystuje w statystykach liczbę n=10. Dlaczego jest to nieprawidłowe?
- A) 10 próbek to za mało do celów statystycznych, potrzeba co najmniej 30
- B) Należało pobrać próbki tkanek z różnych narządów
- C) Te 10 przykładów to powtórzenia techniczne; biologiczne n nadal wynosi 1, jest to tak zwane powtórzenie ✔
- D) Próbki są nieważne, ponieważ zostały pobrane tego samego dnia
Wyjaśnienie: Powtarzające się pomiary wykonane u tej samej osoby są powtórzeniami technicznymi; gdzie statystyczne n to liczba jednostek biologicznych (tutaj myszy). Uznanie technicznego powtórzenia za biologiczne (pseudoreplikacja) daje fałszywe znaczenie. Właściwy projekt oznacza pracę z wieloma osobami.
10. Jedna analiza wykazała p=0,03. Jaka jest prawidłowa interpretacja tej wartości?
- A) Istnieje 3% szans na zobaczenie tego lub bardziej ekstremalnego wyniku, podczas gdy w rzeczywistości nie ma różnicy ✔
- B) Prawdopodobieństwo, że efekt będzie rzeczywisty wynosi 97%
- C) Prawdopodobieństwo, że hipoteza zerowa jest prawdziwa wynosi 3%
- D) Wynik jest powtarzalny w 97%.
Wyjaśnienie: Wartość p nie oznacza „prawdopodobieństwa, że hipoteza jest prawdziwa” ani „prawdopodobieństwa, że efekt jest prawdziwy”. Wartość p to prawdopodobieństwo zobaczenia różnicy jako takiej lub bardziej ekstremalnej niż obserwowana, gdy w rzeczywistości nie ma żadnej różnicy. Zatem p=0,03 nie oznacza, że „efekt jest w 97% rzeczywisty”; wyniki należy również oceniać według wielkości efektu i przedziału ufności.
11. W prezentacji 3% różnica między dwiema grupami jest pokazana jako ogromna poprzez skompresowanie osi Y do zakresu 95-100. Czego to jest przykład?
- A) Dobra technika wizualizacji; podkreśla różnicę
- B) Problem z paletą przyjazną dla daltonistów
- C) Akceptowalny wybór stylu
- D) Wprowadzający w błąd i nieuczciwy wykres, który wyolbrzymia różnicę za pomocą ściętej osi ✔
Objaśnienie: Brak inicjowania osi od zera (oś skrócona) wprowadza widza w błąd poprzez wizualne wyolbrzymianie niewielkiej różnicy. Jest to naruszenie zasady uczciwości; Zwłaszcza na wykresach słupkowych oś powinna zaczynać się od zera, a różnicę należy pokazać w jej rzeczywistej wielkości.
12. Badacz wkleja, jego zdaniem, anonimowe dane z badania egzomologicznego pacjenta do modelu języka publicznego w celu ich analizy. Dlaczego to zachowanie jest problematyczne?
- A) Nie ma problemu; dane można udostępniać, jeśli są anonimowe
- B) Udostępnienie wrażliwych danych pacjenta modelowi otwartemu stanowi naruszenie prywatności oraz etyki/prawa (KVKK/RODO) i nie można tego cofnąć ✔
- C) Jest to problematyczne tylko dlatego, że analiza będzie powolna
- D) Model jest problematyczny, ponieważ nie jest w stanie zrozumieć danych
Opis: Dane genetyczne/kliniczne pacjenta są niezwykle wrażliwe; Nawet dane genomowe, które uważa się za anonimowe, można ponownie zidentyfikować. Udostępnianie tych danych modelowi publicznemu narusza zgodę KVKK/RODO i zgodę komisji etyki (IRB) i stanowi nieodwracalne naruszenie prywatności. Dane wrażliwe powinny być przetwarzane w lokalnych/bezpiecznych, zakontraktowanych środowiskach.
13. W jednym badaniu różnica, którą uznali za „pacjent vs grupa kontrolna”, w rzeczywistości wynikała z przetwarzania próbek w dwa różne dni. Jak nazywa się taka sytuacja i jak sobie z nią radzić?
- A) Jest to efekt odstający; kropki należy usunąć
- B) Jest to brak normalizacji; wystarczy korekta skali
- C) Jest to efekt wsadowy; należy zbilansować w projekcie i dodać do modelu jako zmienną wsadową ✔
- D) p-hakowanie; należy zmienić test
Wyjaśnienie: Różnica techniczna wynikająca z partii pobierania próbek/dnia przetwarzania nazywana jest efektem partii i może być mylona z różnicą biologiczną. Prawidłowe podejście polega na zbilansowaniu partii w projekcie i dodaniu zmiennej partii do modelu statystycznego (np. „~partia + stan”), oddzielając w ten sposób sygnał techniczny od sygnału biologicznego.
14. Chcesz obliczyć współczynnik GC sekwencji DNA. Które podejście jest prawidłowe i powtarzalne?
- A) Wydrukuj kod obliczający współczynnik GC za pomocą Biopythona, uruchom go i użyj wyniku ✔
- B) Podaj modelowi sekwencję i poproś, aby ustnie podał szybkość GC
- C) Potwierdzenie stosunku podanego przez model przez inny model
- D) Patrząc na pierwsze 100 liter serii i zgadując na oko
Wyjaśnienie: Szybkość GC jest obliczeniem deterministycznym; powinien opierać się na kodzie przetwarzającym tablicę, a nie na wartości, którą „pamięta” model języka. Zamiast zlecać obliczanie modelu, wydrukowanie kodu obliczeniowego za pomocą narzędzia takiego jak Biopython i uruchomienie go samodzielnie zapewni dokładne dane wyjściowe, które dadzą ten sam wynik za każdym razem, gdy go uruchomisz.