Jednotka 9 / 11

Vedecká vizualizácia: Zobrazovanie údajov čestne a zrozumiteľne

zisky:

  • Možnosť výberu základných grafických typov biológie, ako je sopečný graf, tepelná mapa, krabicový/husľový graf a PCA pre tento účel.
  • Schopnosť aplikovať princípy poctivosti, ako je os začínajúca od nuly, definícia chybovej lišty, n informácií a dostupná paleta
  • Schopnosť vyhnúť sa zavádzajúcim grafom, ktoré skrývajú rozdelenie, orezávajú os a skrášľujú údaje

Biologický nález, akokoľvek dôležitý, nemožno pochopiť, ak nie je dobre vizualizovaný. Zároveň môže zlý alebo zavádzajúci graf skresľovať údaje; Je to etický problém aj vedecký omyl. V tejto lekcii si rozoberieme typy grafov, ktoré sa v biológii najčastejšie používajú, ako ich rýchlo vyrobiť pomocou umelej inteligencie a na čo si dať pozor, aby bol graf pravdivý.

AI vytvára grafy v kvalite vysielania v priebehu niekoľkých sekúnd s kódom matplotlib/seaborn; ale je vašou úlohou rozhodnúť, či graf presne zobrazuje údaje.

Základné typy grafov v biológii

  • Graf sopky: Porovnanie veľkosti účinku (log2FC) a významnosti (-log10 p) v diferenciálnom vyjadrení. Na prvý pohľad ukazuje zmenené gény.
  • Heatmap: Vzor výrazu viacerých génov/vzoriek vo farbách. Odhaľuje vzory prostredníctvom zhlukovania.
  • Debna/husle: Porovnanie rozloženia skupín. Je úprimnejšia ako priemerná tyčinka, pretože ukazuje šírenie.
  • PCA graf: Redukcia vysokorozmerných údajov na 2 dimenzie a zobrazenie zhlukovania vzoriek (analýza hlavných komponentov).
  • Fylogenetický strom: Ukazuje evolučný vzťah druhov/sekvencií prostredníctvom vetvenia.
  • Krivka prežitia (Kaplan-Meier): Ukazuje pravdepodobnosť udalosti (napr. smrti) v priebehu času.
Tip: Jednoduché stĺpcové grafy vykreslené na strednej hodnote sú v biológii často zavádzajúce, pretože zakrývajú jednotlivé dátové body a distribúciu. Ak je to možné, rozhodnite sa pre krabicový graf alebo „včelí roj“, ktorý zobrazuje aj bodky. Ak existuje málo údajových bodov, zobrazte ich všetky.

Poctivé princípy grafiky

  • Nechajte os začať od nuly (najmä v stĺpcových grafoch); skrátená os zveličuje rozdiel.
  • Uveďte, čo je chybový pruh: štandardná odchýlka, štandardná chyba alebo interval spoľahlivosti? Tieto sú veľmi odlišné.
  • Zobraziť n: Počet získaných vzoriek by mal byť uvedený v grafe alebo v názve.
  • Použite farboslepú priateľskú paletu (napr. viridis); Nespoliehajte sa na červeno-zelené rozlíšenie.
  • Neprikrášľujte údaje: Vymazanie odľahlých hodnôt, posunutie osi alebo len zobrazenie krásneho opakovania je vedecký omyl.

Krok za krokom: vytvorenie mapy sopky

  1. Pripravte si údaje: tabuľka so stĺpcami gen, log2FC, padj.
  2. Transformácia: Vypočítajte -log10(padj) pre os y.
  3. Nastavte prahové hodnoty: |log2FC|>1 a padj<0,05.
  4. Vyfarbite to: Hore, dole, nezmyselné tri kategórie.
  5. Označenie: Vymenujte niekoľko (nie všetky) najsilnejších génov.
  6. Názov a os: Jasný štítok, n informácií, popis prahu.

Kopírovateľné šablóny výziev

Úloha: Ste vedecký asistent vizualizácie. Úloha: Nakreslite graf sopky z mojej tabuľky diferenciálnych výrazov (gen, log2FC, padj). Prah: padj<0,05 a |log2FC|>1. Vyfarbite tri kategórie a označte 10 najvýznamnejších génov. Paleta priateľská pre farboslepých, jasné označenie osi, pridanie n informácií do hlavičky. matplotlib, kvalita vysielania. Komentovaný kód.

Nakreslite tepelnú mapu: riadky sú 50 najvariabilnejších génov, stĺpce sú vzorky. Vykonajte normalizáciu riadkov pomocou Z-skóre, pridajte hierarchické zoskupovanie, použite paletu viridis. Zobrazte skupiny vzoriek s farebným pruhom.

Vysvetlite, či chybový stĺpec v mojom grafe má byť štandardná odchýlka alebo štandardná chyba v závislosti od účelu experimentu. Vysvetlite rozdiel medzi nimi a dôsledky nesprávneho výberu.

Urobte tento stĺpcový graf úprimnejším: pridajte jednotlivé dátové body navrch, začnite os na nule, ukážte n. Dostupný kód: [kód]

Slabá výzva / Silná výzva

Slabý: "Nakresli výnos."

Silný: „Majte údaje o enzýmovej aktivite pre 4 skupiny (n=8 každej). Nakreslite husľový graf porovnávajúci skupiny; prekryte jednotlivé dátové body pre každú skupinu; zobrazte strednú čiaru; začnite os y na nule; pridajte jednotku k označeniam osi (nmol/min); použite paletu vhodnú pre farboslepých. Uistite sa, že graf zobrazuje rozdelenie spravodlivo.“

Rozdiel: Výkonná výzva má typ grafu, n, zásady poctivosti a jednotku. Model vytvára grafiku, ktorá je informatívna, nie zavádzajúca.

tri mini prípady

Prípad 1 – Skrátená os: V jednej prezentácii sa 3% rozdiel medzi dvoma skupinami ukázal ako obrovský stlačením osi medzi 95-100. Keď AI spustila os od nuly, ukázalo sa, že rozdiel bol v skutočnosti malý. Ponaučenie: manipulácia s osou zavádza diváka.

Prípad 2 – Skrytá distribúcia: Stĺpcový graf ukázal dve skupiny „výrazne odlišné“; ale po sčítaní bodov bolo vidieť, že skupiny sa do značnej miery prekrývali a rozdiel pochádzal z niekoľkých odľahlých bodov. Keď modelka navrhla pridať body, vyšiel na povrch skutočný príbeh. Lekcia: graf, ktorý skrýva distribučné lži.

Prípad 3 – Problém farbosleposti: Bola nakreslená tepelná mapa s červeno-zelenou paletou; Približne 8 % publika (farboslepí muži) nevidelo rozdiel. Keď som prešiel na paletu Viridis, graf sa stal čitateľným pre každého. Ponaučenie: prístupná paleta by mala byť štandardom.

porovnávacia tabuľka

Účel

vhodná grafika

Aby sa tomu zabránilo

diferenciálny výraz

graf sopky

surový p zoznam

Skupinová distribúcia

krabica/husle+bodky

obyčajná palica

multigénový vzor

Tepelná mapa (zoskupená)

dlhý stôl

Klastrovanie vzoriek

PCA

časová udalosť

Kaplan-Meier

priemerný bar

Časté chyby

  • Skrátená os: Zveličovanie rozdielu.
  • Skryť distribúciu: Zobraziť iba priemerný pruh.
  • Chybová lišta nie je definovaná: zmätok SD/SE/GA.
  • Nešpecifikované n: Čitateľ nemôže vyhodnotiť spoľahlivosť.
  • Neprístupná farba: Okrem farboslepých ľudí s červeno-zelenou paletou.
  • Skrášľovanie údajov: Selektívna reprezentácia je vedecký omyl.
Upozornenie: Akékoľvek usporiadanie grafu, ktoré spôsobuje, že údaje vyzerajú inak, ako sú (prerezanie osi, skrytie odľahlých hodnôt, selektívne opakovanie) je porušením vedeckej integrity. AI dokáže technicky vytvoriť „pekný“ graf; ale je vašou zodpovednosťou zabezpečiť, aby graf zobrazoval údaje spravodlivo.

Fylogenetický strom a grafy vzťahov

Vizualizáciou špecifickou pre biológiu je fylogenetický strom, ktorý ukazuje evolučný vzťah druhov alebo sekvencií. Vzor vetvenia označuje príbuznosť a dĺžka vetvy označuje množstvo zmeny. Umelá inteligencia napíše kód, ktorý vytvorí strom zo zarovnaných sekvencií (napr. pomocou Biopython Phylo alebo ete3) a nakreslí strom v čitateľnom formáte. Pri interpretácii stromu však existujú dve úskalia: ignorovanie dĺžky vetvy a pozeranie sa len na vetvenie a nešpecifikovanie bootstrapu (hodnota, ktorá udáva spoľahlivosť vetvy). Pobočka s nízkou podporou nestačí na uplatnenie definitívneho príbuzenstva.

Nakreslite fylogenetický strom zo zoradených sekvencií. Zobrazte dĺžky vetiev v mierke, pridajte hodnoty podpory bootstrap do uzlov, označte vetvy s nízkou podporou pod 70 %. Pri výklade stromu pristupujte opatrne k nízkym podporným vetvám.

Tabuľka s grafom: ktorý kedy

Nie všetky dáta vyžadujú grafiku. Tam, kde sú dôležité presné čísla (napr. presné hodnoty niekoľkých skupín, štatistické výsledky), je dobre usporiadaná tabuľka lepšia ako graf. Graf ukazuje vzor a porovnanie; Tabuľka uvádza presnú hodnotu. Na otázku umelej inteligencie: „majú byť tieto údaje zobrazené ako graf alebo tabuľka?“ a žiadanie zdôvodnenia posilní vašu prezentáciu.

Nakoniec musí byť graf samovysvetľujúci. Čitateľ by mal byť schopný porozumieť tomu, čo je zobrazené, keď sa pozrie na graf a jeho názov bez čítania textu: osi by mali byť označené a jednotkami, skupiny by mali byť definované, n by malo byť špecifikované, štatistická významnosť by mala byť označená. Opýtajte sa AI ​​svoj graf „je samostatný s názvom a značkami?“ Jeho kontrola je dobrá posledná kontrola.

Tabuľka pripravená na zverejnenie: technické detaily

Existuje niekoľko technických detailov, ktoré menia grafiku z dobrého vzhľadu na obrazovke na použiteľnú vo vysielaní, a AI ich môže pridať do kódu. Po prvé, rozlíšenie: časopisy často vyžadujú vysoké rozlíšenie (300 DPI a vyššie) alebo vektorový formát (PDF, SVG); Tým sa zabezpečí, že sa grafika pri tlači nerozmaže. Druhým je veľkosť písma: štítok, ktorý je možné prečítať na obrazovke, sa nemusí čítať, keď je zmenšený na stránke článku; body osi a štítkov by sa mali zodpovedajúcim spôsobom upraviť. Po tretie, konzistentnosť: použitie rovnakého farebného kódovania (napr. kontrola vždy sivá, liečba vždy modrá) vo všetkých grafoch v tej istej štúdii zabraňuje čitateľovi prekódovať každý graf. Tieto detaily môžete pridať v jednom kroku tak, že umelej inteligencii poviete „pripravte túto grafiku na zverejnenie: 300 DPI, vektorový výstup, veľká veľkosť písma, konzistentná paleta farieb“.

Pripravte môj graf na publikáciu: 300 DPI a tiež ho uložte ako vektor (PDF), zväčšite veľkosť osí a štítkov na veľkosť čitateľnú pre tlač, aplikujte konzistentnú paletu farieb na celý cyklus (kontrola=sivá, úprava=modrá). Zadajte komentovaný kód pomocou matplotlib.

V súhrne

Dobrý vedecký graf zobrazuje údaje jasne a úprimne. Sopečný graf, tepelná mapa, krabicový/husľový graf a PCA sú základné nástroje biológie. AI ​​rýchlo napíše kód pre tieto grafy, ale vašou úlohou je dodržiavať princípy poctivosti, ako je začatie osi na nule, zobrazenie distribúcie, definovanie chybovej lišty, určenie n a dostupnú paletu. Krásna grafika nie je úprimná grafika.

Aplikačná úloha

So súborom údajov, ktorý máte (alebo vzorkou), nechajte AI vytvoriť dva grafy: husľový/krabicový graf s údajovými bodmi zobrazujúcimi rozdelenie skupín a graf sopky z tabuľky diferenciálnych výrazov. V oboch začnite os od nuly (ak je to vhodné), pridajte n do nadpisu, použite paletu priateľskú pre farboslepých. Potom požiadajte model, aby vytvoril „zavádzajúcu“ a „čestnú“ verziu toho istého stĺpcového grafu a vysvetlil rozdiel.

kontrolný zoznam

  • [ ] Typ grafu som zvolil podľa údajov a účelu.
  • [ ] Osu som správne inicializoval od začiatku.
  • [ ] Ukázal som distribučné/údajové body, nielen priemer.
  • [ ] Uviedol som, čo je chybová lišta (SD/SE/GA).
  • Do grafu som pridal [ ] n informácie.
  • [ ] Použil som farboslepú priateľskú paletu a údaje som neskrášlil.