Enota 9 / 11

Znanstvena vizualizacija: Iskreno in razumljivo prikazovanje podatkov

Dobički:

  • Sposobnost izbire osnovnih grafičnih vrst biologije, kot so graf vulkana, toplotni zemljevid, graf škatle/violine in PCA za ta namen.
  • Sposobnost uporabe načel poštenosti, kot so os, ki se začne od nič, definicija vrstice napak, n informacij in dostopna paleta
  • Sposobnost izogibanja zavajajočim grafom, ki skrivajo porazdelitev, odrežejo os in polepšajo podatke

Biološke najdbe, ne glede na to, kako pomembna je, ni mogoče razumeti, če ni dobro vizualizirana. Hkrati lahko slab ali zavajajoč graf napačno predstavi podatke; To je hkrati etični problem in znanstvena napaka. V tej enoti bomo obravnavali vrste grafov, ki se najpogosteje uporabljajo v biologiji, kako jih hitro izdelati z umetno inteligenco in na kaj moramo biti pozorni, da zagotovimo, da je graf pošten.

Umetna inteligenca s kodo matplotlib/seaborn v nekaj sekundah ustvari izrise kakovosti predvajanja; vaša naloga pa je, da se odločite, ali graf pravilno predstavlja podatke.

Osnovne vrste grafov v biologiji

  • Graf vulkana: Primerjava velikosti učinka (log2FC) in pomembnosti (-log10 p) v diferencialnem izrazu. Na prvi pogled prikaže spremenjene gene.
  • Toplotni zemljevid: vzorec izražanja več genov/vzorcev v barvah. Z združevanjem v skupine razkriva vzorce.
  • Zaplet škatle/violine: Primerjava porazdelitve skupin. Je bolj pošten kot povprečna vrstica, ker prikazuje razpon.
  • Diagram PCA: Zmanjšanje visokodimenzionalnih podatkov na 2 dimenziji in prikaz združevanja vzorcev v skupine (analiza glavnih komponent).
  • Filogenetsko drevo: prikazuje evolucijski odnos vrst/zaporedij skozi razvejanje.
  • Krivulja preživetja (Kaplan-Meier): prikazuje verjetnost dogodka (npr. smrti) skozi čas.
Namig: Preprosti palični grafikoni, narisani na srednjo vrednost, so v biologiji pogosto zavajajoči, ker zakrijejo posamezne podatkovne točke in porazdelitev. Če je mogoče, se odločite za škatlasto risbo ali »čebelji roj«, ki prikazuje tudi pike. Če je podatkovnih točk malo, jih pokažite vse.

Iskrena grafična načela

  • Naj se os začne od nič (zlasti pri paličnih grafikonih); prisekana os poveča razliko.
  • Določite, kaj je vrstica napak: standardni odklon, standardna napaka ali interval zaupanja? Te so zelo različne.
  • Pokaži n: Koliko vzorcev je bilo pridobljenih, naj bo v grafu ali v naslovu.
  • Uporabite barvno slepoto prijazno paleto (npr. viridis); Ne zanašajte se na rdeče-zeleno razliko.
  • Podatkov ne olepšujte: brisanje izstopajoče vrednosti, premikanje osi ali samo prikazovanje lepega ponavljanja je znanstveno napačno ravnanje.

Korak za korakom: izdelava karte vulkanov

  1. Pripravite podatke: tabelo s stolpci gen, log2FC, padj.
  2. Transformacija: Izračunajte -log10(padj) za os y.
  3. Nastavite pragove: |log2FC|>1 in padj<0,05.
  4. Pobarvaj: gor, dol, nesmiselne tri kategorije.
  5. Oznaka: Navedite nekaj (ne vseh) najmočnejših genov.
  6. Naslov in os: jasna oznaka, informacije n, opis praga.

Kopirane predloge pozivov

Vloga: Ste asistent znanstvene vizualizacije. Naloga: Narišite graf vulkana iz moje tabele diferencialnih izrazov (gen, log2FC, padj). Prag: padj<0,05 in |log2FC|>1. Pobarvaj tri kategorije in označi 10 najpomembnejših genov. Barvno slepi prijazna paleta, jasna oznaka osi, dodajte n informacij v glavo. matplotlib, kakovost oddajanja. Komentirana koda.

Narišite toplotni zemljevid: vrstice so 50 najbolj spremenljivih genov, stolpci so vzorci. Izvedite normalizacijo vrstice z Z-rezultatom, dodajte hierarhično združevanje v gruče, uporabite paleto Viridis. Pokažite vzorčne skupine z barvnim trakom.

Pojasnite, ali naj bo vrstica napak v mojem grafu standardna deviacija ali standardna napaka, odvisno od namena poskusa. Pojasnite razliko med obema in posledice izbire napačnega.

Naredite ta palični grafikon bolj pošten: dodajte posamezne podatkovne točke na vrh, začnite os pri nič, pokažite n. Razpoložljiva koda: [koda]

Šibek poziv/močan poziv

Šibko: "Načrtujte donos."

Močno: "Imate podatke o encimski aktivnosti za 4 skupine (vsaka n=8). Narišite violinsko tabelo s primerjavo skupin; prekrijte posamezne podatkovne točke za vsako skupino; pokažite srednjo črto; začnite os y pri nič; dodajte enoto oznakam osi (nmol/min); uporabite barvno slepoto prijazno paleto. Poskrbite, da grafikon pošteno predstavlja porazdelitev."

Razlika: zmogljiv poziv ima vrsto grafikona, n, politike poštenosti in enoto. Model ustvari grafiko, ki je informativna in ne zavajajoča.

trije mini kovčki

1. primer – prirezana os: V eni predstavitvi je bila 3-odstotna razlika med dvema skupinama videti velika s stiskanjem osi med 95–100. Ko je AI zagnal os iz nič, se je izkazalo, da je razlika pravzaprav majhna. Nauk: manipulacija osi zavaja gledalca.

Primer 2 – Skrita porazdelitev: stolpčni grafikon je pokazal dve skupini, ki sta se »pomembno različni«; toda ko so bile točke seštete, je bilo razvidno, da se skupine v veliki meri prekrivajo, razlika pa je nastala zaradi nekaj izstopajočih točk. Ko je model predlagal dodajanje točk, se je pokazala prava zgodba. Lekcija: grafikon, ki skriva distribucijske laži.

Primer 3 – problem barvne slepote: toplotni zemljevid je bil narisan z rdeče-zeleno paleto; Približno 8 % občinstva (moški z barvno slepoto) ni moglo videti razlike. Ko sem preklopil na paleto Viridis, je grafikon postal berljiv vsem. Lekcija: dostopna paleta mora biti standardna.

primerjalna tabela

Namen

primerna grafika

Izogibati se

diferencialni izraz

karta vulkana

surov p seznam

Skupinska distribucija

škatla/violina+pike

navadna palica

multi genski vzorec

Toplotni zemljevid (v gruči)

dolga miza

Vzorčno združevanje

PCA

čas-dogodek

Kaplan-Meier

povprečna vrstica

Pogoste napake

  • Prirezana os: pretiravanje razlike.
  • Skrij porazdelitev: Prikaži samo povprečno vrstico.
  • Vrstica napak ni določena: zmeda SD/SE/GA.
  • Brez navedbe n: Bralec ne more oceniti zanesljivosti.
  • Nedostopna barva: Izjema barvno slepih z rdeče-zeleno paleto.
  • Olepševanje podatkov: Selektivno predstavljanje je znanstveno napačno ravnanje.
Pozor: Kakršna koli ureditev grafa, zaradi katere so podatki videti drugačni, kot so (prerez osi, skrivanje izstopa, selektivno ponavljanje), je kršitev znanstvene integritete. AI lahko tehnično ustvari "lep" grafikon; vendar je vaša odgovornost zagotoviti, da grafikon pošteno predstavlja podatke.

Filogenetsko drevo in grafi odnosov

Vizualizacija, specifična za biologijo, je filogenetsko drevo, ki prikazuje evolucijski odnos vrst ali zaporedij. Vzorec razvejanja kaže na sorodnost, dolžine vej pa kažejo na količino spremembe. Umetna inteligenca napiše kodo, ki zgradi drevo iz poravnanih zaporedij (npr. z Biopython Phylo ali ete3) in nariše drevo v berljivi obliki. Vendar pa obstajata dve pasti pri interpretaciji drevesa: ignoriranje dolžine veje in gledanje samo na razvejanje ter nenavedba zagonske vrednosti (vrednost, ki kaže, kako zanesljiva je veja). Veja z nizko podporo ne zadostuje za trditev o dokončnem sorodstvu.

Narišite filogenetsko drevo iz poravnanih zaporedij. Prikažite dolžine vej v merilu, dodajte vrednosti podpore za zagon vozliščem, označite veje z nizko podporo pod 70 %. Pri interpretaciji drevesa se previdno približajte vejam z nizko podporo.

Tabela z grafom: kateri kdaj

Vsak podatek ne zahteva grafike. Kjer so pomembne natančne številke (npr. točne vrednosti več skupin, statistični rezultati), je dobro organizirana tabela boljša od grafa. Graf prikazuje vzorec in primerjavo; Tabela podaja točno vrednost. Ko je umetna inteligenca vprašana, "ali naj se ti podatki prikažejo kot graf ali tabela?" in spraševanje po utemeljitvi okrepi vašo predstavitev.

Nazadnje, grafikon mora biti samoumeven. Bralec mora biti sposoben razumeti prikazano samo s pogledom na graf in njegov naslov, ne da bi prebral besedilo: osi morajo biti označene in z enotami, definirane skupine, določen n, označena statistična pomembnost. Vprašajte AI vaš grafikon "ali je samostojen s svojim naslovom in oznakami?" Pregled je dober končni pregled.

Grafikon, pripravljen za objavo: tehnične podrobnosti

Obstaja nekaj tehničnih podrobnosti, ki spremenijo grafiko iz dobrega videza na zaslonu v uporabno v oddaji, AI pa jih lahko doda kodi. Prvič, ločljivost: revije pogosto zahtevajo visoko ločljivost (300 DPI in več) ali vektorsko obliko (PDF, SVG); To zagotavlja, da se grafika med tiskanjem ne zamegli. Druga je velikost pisave: oznaka, ki jo je mogoče prebrati na zaslonu, morda ne bo prebrana, ko je na strani članka pomanjšana; osi in točke oznake je treba ustrezno prilagoditi. Tretjič, doslednost: uporaba istega barvnega kodiranja (npr. kontrola vedno siva, obdelava vedno modra) na vseh grafih v isti študiji preprečuje bralcu, da bi ponovno kodiral vsak graf. Te podrobnosti lahko dodate v enem koraku, tako da umetni inteligenci rečete "pripravi to grafiko za objavo: 300 DPI, vektorski izpis, velika velikost pisave, dosledna barvna paleta".

Pripravite moj grafikon za objavo: 300 DPI in shranite tudi kot vektor (PDF), povečajte velikost osi in nalepk na velikost, ki je berljiva za tiskanje, uporabite dosledno barvno paleto v celotnem nizu (nadzor=siva, obdelava=modra). Podajte komentirano kodo z matplotlib.

Če povzamem

Dober znanstveni graf prikazuje podatke jasno in pošteno. Graf vulkana, toplotni zemljevid, graf škatle/violine in PCA so osnovna orodja biologije. Umetna inteligenca hitro napiše kodo za te grafe, vendar je vaša naloga, da upoštevate načela poštenosti, kot je začetek osi pri nič, prikaz porazdelitve, definiranje vrstice napak, določanje n in dostopna paleta. Lepa grafika ni poštena grafika.

Aplikacijska naloga

Z naborom podatkov, ki ga imate (ali vzorcem), naj umetna inteligenca izdela dva grafikona: graf violino/škatlo s podatkovnimi točkami, ki prikazujejo skupinsko porazdelitev, in graf vulkana iz tabele diferencialnih izrazov. V obeh začnite os od nič (če je primerno), naslovu dodajte n in uporabite barvno slepoto prijazno paleto. Nato prosite model, naj ustvari "zavajajočo" in "pošteno" različico istega paličnega grafikona in razloži razliko.

kontrolni seznam

  • [ ] Vrsto grafikona sem izbral glede na podatke in namen.
  • [ ] Os sem pravilno inicializiral od začetka.
  • [ ] Prikazal sem distribucijo/podatkovne točke, ne le povprečje.
  • [ ] Določil sem, kaj je vrstica napak (SD/SE/GA).
  • Grafikonu sem dodal [ ] n informacij.
  • [ ] Uporabil sem barvno slepoto prijazno paleto in podatkov nisem polepšal.