Jednotka 11 / 11

Etika, biologická bezpečnost, důvěrnost a vědecká integrita

zisky:

  • Schopnost chránit citlivá lidská/genetická data v souladu s KVKK, GDPR a pravidly etické komise a vyhnout se jejich poskytování otevřenému modelu
  • Schopnost zpochybnit platnost výsledků posouzením rizik biologické bezpečnosti/dvojího použití a zkreslení populace
  • Pochopení, že etickou odpovědnost nelze delegovat na vozidlo a že je nezbytný smysluplný člověk ve smyčce

Silné využívání umělé inteligence v biologii doplňuje její zodpovědné používání. Biologie je citlivý obor, který se dotýká lidského zdraví, genetického soukromí, životního prostředí a dokonce i biologické bezpečnosti. V tomto bloku probereme etické, právní a bezpečnostní povinnosti, kterým budete čelit při používání umělé inteligence v biologických studiích. Tato jednotka je rámcem postaveným na principech ověřování a poctivosti ve všech předchozích jednotkách.

Základní princip: AI je nástroj; Etická odpovědnost je vždy na lidech. "Navrhovaný model" není omluva.

Čtyři oblasti odpovědnosti

1. Ochrana osobních údajů a lidská data

Genetické, klinické nebo zdravotní údaje od lidských účastníků jsou extrémně citlivé. Sekvence DNA člověka může odhalit riziko a identitu onemocnění jejich a jejich příbuzných; I genomická data, která jsou považována za anonymizovaná, lze znovu identifikovat. Vložením těchto dat do veřejně dostupného modelu umělé inteligence může dojít k porušení zákonů o ochraně dat (KVKK v Turecku, GDPR v Evropě) a schválení etického výboru (IRB/etická komise).

  • Otevřenému modelu neposkytujte osobní/klinická data.
  • Vyhněte se použití nad rámec souhlasu; S čím dal účastník souhlas?
  • Zvolte podnikové/místní (on-premise) nebo smluvní nástroje pro zpracování dat.

2. Biologická bezpečnost a dvojí použití

Některé biologické informace mají „dvojí použití“: mohou být užitečné i škodlivé; například sekvence patogenů (způsobujících onemocnění), produkce toxinů. Žádat AI o informace o vylepšování nebezpečných patogenů nebo navrhování škodlivých biologických činitelů je na většině míst neetické a nezákonné.

  • Nevytvářejte nebezpečné požadavky na dvojí použití.
  • Postupujte podle pokynů rady pro biologickou bezpečnost vaší instituce (IBC).

3. Vědecká integrita

Vše, co jsme viděli v předchozích jednotkách, se zde sešlo: žádné falešné připisování, žádné zkrášlování dat, žádné p-hackování, žádné selektivní hlášení. Umělá inteligence je může usnadnit nebo ztížit; Rozdíl je ve vaší upřímnosti.

  • Nahlaste všechny výsledky (včetně negativních).
  • Deklarovat použití umělé inteligence.
  • Podporujte reprodukovatelnost sdílením nezpracovaných dat a kódu (pokud je to možné).

4. Předpojatost a spravedlnost

Modely umělé inteligence nesou zkreslení dat, na kterých jsou trénovány. Genomické databáze pocházejí převážně z populací evropského původu; to vede k horším předpovědím v jiných populacích. Obrazový model může fungovat špatně ve stavu, který je v trénovacích datech nedostatečně zastoupen.

  • Zeptejte se, na jaké populaci/datech byl model trénován.
  • Vyhodnoťte, zda výsledky platí ve všech skupinách.
Tip: Zeptejte se sami sebe: "Pokud dám tato data modelu, komu patří a dala tato osoba povolení?" Pokud je odpověď nejasná, nedávejte ji. Porušení důvěrnosti je nevratné.

Krok za krokem: zodpovědné ovládání AI

  1. Klasifikujte zdroj dat: osobní/citlivý nebo veřejný?
  2. Zkontrolujte souhlas a oprávnění: Je toto použití zahrnuto?
  3. Vyberte si správný nástroj: Bezpečné/nativní prostředí pro citlivá data.
  4. Zvažte riziko dvojího použití.
  5. Zkreslení otázky: Platí výsledek ve všech skupinách?
  6. Dokumentujte a deklarujte použití.

Kopírovatelné šablony výzev

Zkontrolujte můj plán analýzy níže z etického hlediska: uveďte upozornění týkající se důvěrnosti údajů, souhlasu účastníků, potenciální předpojatosti a rizika dvojího použití. Plán: [text] (Poznámka: NESdílím skutečná data pacientů, pouze plán.)

Jaké otázky týkající se soukromí a souhlasu bych si měl zodpovědět před použitím této sady genomických dat? Je zpracován kontrolní seznam ve smyslu KVKK/GDPR a etické komise.

Jak mám transparentně deklarovat nástroj umělé inteligence, který používám v části metody mého článku? Napište příklad oznamovací věty; jaké informace (nástroj, verze, rozsah použití) by měl obsahovat?

Jak vyhodnotím, zda výsledky tohoto modelu mají populační zkreslení? Uveďte otázky, které bych se měl zeptat ohledně tréninkových dat a kontrolních kroků.

Slabá výzva / Silná výzva

Slabé: "Analyzujte následující genetická data pacienta: [skutečné údaje]."

Güçlü: "Nastavuji plán analýzy, který pracuje s klinickými genomickými daty, ale nesdílím skutečná data pacientů. Pouze z metodologického hlediska: jaká opatření pro zachování důvěrnosti bych měl přijmout, v jakém prostředí bych měl data zpracovávat, jaké podmínky schválení a etické komise bych měl splnit? Tok můžete ukázat pomocí fiktivních/vzorkových dat."

Rozdíl: Ve výkonné výzvě nejsou sdílena žádná skutečná citlivá data; Je dotázána pouze metoda. Soukromí je zachováno, model stále pomáhá.

tři mini pouzdra

Případ 1 – Porušení soukromí: Výzkumník vložil to, co považoval za anonymní data exomu pacienta, do otevřeného modelu, aby je mohl analyzovat. Když se to etická komise dozvěděla, studie byla pozastavena; Nebyla uzavřena žádná smlouva o zpracování údajů. Poučení: citlivá data nikdy nevstupují do otevřeného modelu.

Případ 2 – Populační zkreslení: Nástroj pro hodnocení polygenního rizika byl vyškolen na údajích evropského původu; V jiné populaci byly odhady rizik výrazně nepřesné. Když model navrhl zpochybnit složení tréninkových dat, tým se rozhodl tento nástroj v této populaci nepoužívat. Ponaučení: zaujatost zachraňuje nebo poškozuje životy.

Případ 3 – Zveřejnění a transparentnost: Tým napsal kód pro čištění dat pomocí AI a jasně to uvedl v části metody; Sdílel také kód. Recenzenti to uvítali, protože opakovatelnost byla silná. Poučení: transparentnost plodí důvěru.

srovnávací graf

oblast

bezpečné chování

rizikové chování

údaje o pacientech

Lokální/zabezpečené prostředí

Vložením otevřete model

souhlas

Použití v rámci rozsahu

Nepřekračujte rozsah

Biologická bezpečnost

Vyhněte se dvojímu použití

nebezpečná poptávka

bezúhonnost

Nahlásit všechny výsledky

selektivní hlášení

zaujatost

Zeptejte se populace

Aplikujte naslepo

transparentnost

Deklarujte použití

skrývání

Časté chyby

  • Poskytování citlivých dat otevřenému modelu: Nevratné porušení soukromí.
  • Překročení rozsahu souhlasu: Použití neautorizované účastníkem.
  • Ignorování zkreslení: Zobecnění výsledků na všechny skupiny.
  • Skrytí použití: Nedeklarování příspěvku AI.
  • Obrana „navržený model“: Připsání odpovědnosti vozidlu.
Upozornění: Při biologické práci s vysokými důsledky (klinické rozhodnutí, biologická bezpečnost, údaje o lidech) není výstup AI náhradou za kompetentní odborné ověření a etický dohled; jen to zrychluje. Konečná odpovědnost je vždy na lidské bytosti spolu s etickými a vědeckými důsledky rozhodnutí.

Životní prostředí, ekologie a tradiční znalosti

Etická odpovědnost se neomezuje na údaje o lidech. Opatrnosti je také potřeba při využívání umělé inteligence v ekologii a ochranářské biologii. Například přesné údaje o poloze (souřadnice kamerové pasti) ohroženého druhu jsou citlivé kvůli riziku pytláctví; Zveřejnění těchto dat otevřenému modelu nebo veřejnosti by mohlo tento druh poškodit. Podobně etické a právní problémy (jako je Nagojský protokol) vyvstávají, když se tradiční biologické znalosti místních komunit (např. používání rostliny) používají bez povolení. Před použitím dat "komu tyto informace patří a kdo by byl poškozen jejich zveřejněním?" Vždy položte otázku.

Lidský dohled a konečné rozhodnutí

Podstata celého tohoto modulu se scvrkává na jeden princip: smysluplný lidský dohled. AI vytvoří návrh, napíše koncept, ukáže vzor; Biologické, klinické nebo etické rozhodnutí však nikdy není založeno přímo na výstupu modelu. Zejména ve vysoce rizikových oblastech (diagnostika, léčba, rozhodnutí o zachování druhu, vypuštění) není úlohou modelu rozhodovat, ale urychlit rozhodnutí odborníka. Přístup „human-in-the-loop“ není slogan, ale nutnost.

Aby tento dohled fungoval, musí být nadřízený kompetentní. Slepý souhlas („model řekl, přijetí“) není přehlédnutí. Skutečný dohled vyžaduje odborné znalosti, které dokážou výstup zpochybnit, zachytit jeho chybu a v případě potřeby jej odmítnout. Umělá inteligence tedy nenahrazuje odborníka; To dělá odborníka ještě nepostradatelnějším. Ten, kdo používá vozidlo nejlépe, je ten, kdo jej umí nejlépe ovládat.

V souhrnu

Zodpovědné používání umělé inteligence v biologii pokrývá čtyři oblasti: soukromí dat (ochrana citlivých lidských dat), biologická bezpečnost (zabránění dvojímu použití), vědecká integrita (čestné a úplné podávání zpráv) a povědomí o zkreslení (platnost výsledků napříč všemi skupinami). Neposkytujte citlivá data otevřenému modelu, transparentně deklarujte použití, zpochybňujte populační zaujatost. Etická odpovědnost nemůže být nikdy delegována na agenta; Je to vždy v lidech.

Aplikační úkol

Zvažte scénář z vašeho vlastního pracovního prostoru (např. pomocí lidské datové sady nebo obrazového modelu). Nechte AI přijít s etickým kontrolním seznamem tohoto scénáře (důvěrnost, souhlas, zkreslení, dvojí použití, transparentnost) bez sdílení skutečných dat. U každé položky ji označte jako „vhodnou/rizikovou/nejistou“ ve vaší situaci a sepište akční plán pro ty, které jsou rizikové/nejisté. Pro svůj článek si také nechte vypracovat prohlášení o použití AI.

kontrolní seznam

  • [ ] Otevřenému modelu jsem neposkytl citlivá/osobní data.
  • [ ] Kontroloval jsem rozsah souhlasu a etické komise.
  • [ ] Posoudil jsem riziko dvojího použití/biologické bezpečnosti.
  • [ ] Všechny výsledky jsem poctivě nahlásil.
  • [ ] Zpochybnil jsem zkreslení populace/dat.
  • [ ] Transparentně jsem deklaroval použití umělé inteligence a převzal odpovědnost.

Modulová zkouška

1. Student se zeptal jazykového modelu 'kolik řetězců je v tomto souboru FASTA?' zeptá se a model odpoví '48'. Jaký je nejsprávnější přístup?

  • A) Přímo pomocí čísla 48 daného modelem; Model je spolehlivý, protože vidí soubor
  • B) Zeptejte se na číslo ještě jednou a přijměte je jako správné, pokud jsou obě odpovědi stejné
  • C) Čtení souboru pomocí Biopythonu, počítání počtu sekvencí s kódem a použití výstupu ✔
  • D) Ruční otevření souboru a počítání podle oka

Vysvětlení: Deterministické úlohy, jako je počítání a měření, by měly být ponechány na kódu, který spustíte, nikoli na jazykovém modelu. Model si „nepamatuje“ číslo, vytváří pravděpodobnostní hodnotu a může se mýlit; Počítání pomocí nástroje jako Biopython poskytuje přesné a reprodukovatelné výsledky.

2. Chcete spočítat buňky na mikroskopickém snímku a změřit plochu každého z nich. Jaký je nejvhodnější přístup k tomuto úkolu?

  • A) Pomocí expertního segmentačního nástroje, jako je Cellpose/StarDist, a ověření výsledku ručně ✔
  • B) Vložte obrázek do obecného jazykového modelu a zeptejte se „kolik je tam buněk“
  • C) Popište obrázek modelu a zeptejte se na odhadované číslo
  • D) Přijetí počtu pixelů jako počtu buněk bez jakékoli kalibrace

Vysvětlení: Segmentace a měření buněk není doménou obecného jazykového modelu, ale specializovaných obrazových modelů (Cellpose, StarDist) speciálně vyškolených pro tento úkol. Jazykový model píše kód, který volá tyto nástroje; Expertní model provede měření a biolog ověří výsledek.

3. Postgraduální student přidá k úvodu své práce 8 zdrojů vytvořených jazykovým modelem. Poradce zjistí, že 3 z nich vůbec neexistují. Jak by se dalo této situaci předejít?

  • A) Opětovným požádáním modelu, aby produkoval zdroje
  • B) Výběrem pouze citací s DOI (pokud existuje DOI, je skutečné)
  • C) Vyžádání seznamu zadáním pokynu modelu, aby „seděl“
  • D) Nezávisle ověřovat každou citaci na PubMed/doi.org a citovat pouze články, které četl ✔

Vysvětlení: Obecné jazykové modely nejsou databází literatury; Namísto hledání skutečných záznamů „generuje“ realisticky znějící připsání (vymyšlené připsání). Každý vedlejší řádek a DOI by neměly být používány bez nezávislého ověření ve zdrojích, jako je PubMed/doi.org, a pouze s citováním článků, které byly skutečně přečteny.

4. Jaký je nejúčinnější způsob, jak zajistit přesnost kódu pro čištění dat napsaného umělou inteligencí?

  • A) Pokud kód funguje bez chyb, přijměte jej jako správný.
  • B) Otestování výsledku na malém známém vzorku a ověření očekávání pomocí ✔
  • C) Zeptejte se modelu 'je kód správný?' ptát se a důvěřovat odpovědi „ano“
  • D) Spusťte kód několikrát a pokaždé získejte stejný výstup

Poznámka: To, že kód funguje bez chyb, neznamená, že je správný; „Špatný kód fungující bez chyb“ je nejnebezpečnější situací v biologii. Testování s malým vzorkem, jehož výsledek znáte předem, a začlenění očekávání do kódu pomocí statement je nejsilnější štít proti tichým chybným výsledkům.

5. Při analýze RNA-seq bylo testováno 20 000 genů a bylo zjištěno, že 3 800 genů je „významných“ s p<0,05 bez korekce. Jaký je hlavní problém tohoto závěru?

  • A) Počet vzorků je příliš vysoký, měl by být snížen
  • B) práh p je příliš vysoký, měla být použita hodnota 0,10
  • C) Nebyla provedena korekce vícenásobného srovnání (FDR); Existuje mnoho falešných poplachů ✔
  • D) Místo genů měly být testovány vzorky

Vysvětlení: Když testujete tisíce genů současně, mnoho genů se jeví jako „významných“ náhodou, i když mezi nimi není žádný skutečný rozdíl; Tomu se říká problém vícenásobného srovnání. Řešením je použít korekci FDR (false discovery rate) metodou, jako je Benjamini-Hochberg; S opravou se seznam obvykle zmenší na desítky až několik stovek genů.

6. Nejlepší shoda ve výsledku BLAST má E-hodnotu 2,0. Co to znamená?

  • A) Shoda je s největší pravděpodobností náhodná; ✔ není spolehlivá shoda
  • B) Spojka je velmi pevná; Čím větší e-hodnota, tím lépe
  • C) Sekvence se shodovala v poměru 2 %
  • D) Mezi těmito dvěma sekvencemi je rozdíl 2 bází

Vysvětlení: E-hodnota označuje očekávání, že shoda bude náhodná; Je lepší být malý. E-hodnota větší než 1 znamená, že shoda je s největší pravděpodobností náhodná. Pro spolehlivé shody se obecně hledají velmi malé prahové hodnoty, jako je e < 1e-5.

7. V modelu AlphaFold vykazuje koncová oblast proteinu nízké skóre pLDDT (<50). Jak by měl být tento region interpretován?

  • A) AlphaFold udělal v této oblasti chybu, oblast by měla být z analýzy odstraněna
  • B) Tato oblast je rozhodně alfa šroubovice
  • C) Model je zcela nespolehlivý, konstrukce by se neměla používat
  • D) Oblast je pravděpodobně nepravidelná/elastická; by měl být interpretován jako „nejasný“ spíše než „nepravdivý“ ✔

Popis: pLDDT je skóre lokální spolehlivosti pro každou aminokyselinu; Hodnoty pod 50 často odrážejí skutečně nepravidelné (flexibilní, nepevné) oblasti. Je nesprávné automaticky mazat tyto oblasti jako „nesprávné odhady“; Nízké skóre by mělo být chápáno jako „nejisté/flexibilní“ a měl by být vyhodnocen jeho biologický význam.

8. Výzkumník uvádí oblasti buněk pouze v pixelech a výsledky nejsou v souladu s literaturou. Jaký je chybějící krok?

  • A) Mělo být spočítáno více buněk
  • B) Nebyla provedena kalibrace měřítka (převod pixelů na mikrometr), výsledky nebyly převedeny na fyzikální jednotky ✔
  • C) Segmentační nástroj byl zvolen nesprávně
  • D) Rozlišení obrázku je příliš vysoké

Vysvětlení: Kalibrace měřítka (kolik mikrometrů na pixel) je nezbytná pro extrakci fyzické velikosti z obrazu. Pokud tento krok přeskočíte, hodnoty zůstanou nesrovnatelné v závislosti na nastavení mikroskopu. Plochy musí být převedeny na fyzické jednotky, jako jsou čtvereční mikrometry.

9. Student odebere 10 vzorků tkáně jedné myši a ve statistice použije 'n=10'. Proč je to nesprávné?

  • A) 10 vzorků je pro statistiku příliš málo, je potřeba alespoň 30
  • B) Vzorky tkání musely být odebrány z různých orgánů
  • C) Těchto 10 příkladů jsou technická opakování; biologické n je stále 1, jedná se o tzv. opakování ✔
  • D) Vzorky jsou neplatné, protože byly odebrány ve stejný den

Vysvětlení: Opakovaná měření od stejného jedince jsou technickým opakováním; kde statistické n je počet biologických jednotek (zde myší). Považovat technické opakování za biologické (pseudoreplikace) vytváří falešný význam. Správný design znamená pracovat s více jednotlivci.

10. Jedna analýza zjistila p=0,03. Jaký je správný výklad této hodnoty?

  • A) Existuje 3% šance, že uvidíte tento nebo extrémnější výsledek, když ve skutečnosti není žádný rozdíl ✔
  • B) Pravděpodobnost skutečného účinku je 97 %
  • C) Pravděpodobnost, že nulová hypotéza bude pravdivá, je 3 %
  • D) Výsledek je z 97 % opakovatelný

Vysvětlení: p-hodnota není „pravděpodobnost, že hypotéza je pravdivá“ nebo „pravděpodobnost, že účinek je pravdivý“. Hodnota p je pravděpodobnost, že rozdíl bude takový nebo extrémnější, než jaký byl pozorován, když ve skutečnosti žádný rozdíl neexistuje. Proto p=0,03 neznamená „účinek je z 97 % skutečný“; výsledky by měly být také hodnoceny podle velikosti účinku a intervalu spolehlivosti.

11. V prezentaci je 3% rozdíl mezi dvěma skupinami zobrazen jako obrovský při stlačení osy y na rozsah 95-100. Co je to příklad?

  • A) Dobrá vizualizační technika; zdůrazňuje rozdíl
  • B) Problém palety přátelské k barvoslepým
  • C) Přijatelný výběr stylu
  • D) Zavádějící a nečestný graf, který zveličuje rozdíl oproti zkrácené ose ✔

Vysvětlení: Neinicializace osy od nuly (zkrácená osa) uvádí diváka v omyl tím, že vizuálně zveličuje malý rozdíl. To je porušení zásady poctivosti; Zejména ve sloupcových grafech by osa měla začínat od nuly a rozdíl by měl být zobrazen s její skutečnou velikostí.

12. Výzkumník vloží to, co považuje za anonymní data exomu pacienta, do veřejného jazykového modelu, aby je mohl analyzovat. Proč je toto chování problematické?

  • A) Není žádný problém; data mohou být sdílena, pokud jsou anonymní
  • B) Poskytování citlivých údajů o pacientech otevřenému modelu je porušením soukromí a etických/právních (KVKK/GDPR) a nelze jej vrátit zpět ✔
  • C) Je to problematické pouze proto, že analýza bude pomalá
  • D) Model je problematický, protože nerozumí datům

Popis: Genetická/klinická data pacienta jsou extrémně citlivá; I genomická data považovaná za anonymní lze znovu identifikovat. Poskytnutí těchto údajů veřejnému modelu porušuje souhlasy KVKK/GDPR a etické komise (IRB) a je nevratným porušením soukromí. Citlivá data by měla být zpracována v místním/zabezpečeném, smluvním prostředí.

13. V jedné studii byl rozdíl, který považovali za „pacient versus kontrola“, ve skutečnosti způsoben tím, že vzorky byly zpracovávány ve dvou různých dnech. Jak se tato situace nazývá a jak se řeší?

  • A) Je to odlehlý efekt; tečky by měly být smazány
  • B) Je to nedostatek normalizace; stačí pouze korekce měřítka
  • C) Je to dávkový efekt; by měly být v návrhu vyvážené a přidány do modelu jako proměnná šarže ✔
  • D) p-hacking; test by se měl změnit

Vysvětlení: Technický rozdíl v důsledku šarže odběru/den zpracování se nazývá efekt šarže a lze jej zaměnit s biologickým rozdílem. Správný přístup je vyvážit šarže v návrhu a přidat proměnnou šarže do statistického modelu (např. '~dávka + podmínka'), čímž se oddělí technický signál od biologického signálu.

14. Chcete vypočítat poměr GC sekvence DNA. Jaký je správný a opakovatelný přístup?

  • A) Vytiskněte kód, který počítá rychlost GC pomocí Biopythonu, spusťte jej a použijte výstup ✔
  • B) Dejte modelu sekvenci a požádejte ho, aby slovně řekl rychlost GC
  • C) Potvrzení poměru daného modelem jiným modelem
  • D) Podívejte se na prvních 100 písmen série a hádejte očima

Vysvětlení: Rychlost GC je deterministický výpočet; by měl být založen na kódu, který zpracovává pole, nikoli na hodnotě, kterou si jazykový model „pamatuje“. Namísto toho, abyste si jej nechali vypočítat modelem, vytiskněte si výpočetní kód pomocí nástroje, jako je Biopython a spusťte jej sami, poskytne přesný výstup, který poskytne stejný výsledek pokaždé, když jej spustíte.