Печалби:
- Възможност за избор на основни графични видове биология като графика на вулкан, топлинна карта, графика на кутия/цигулка и PCA за целта.
- Възможност за прилагане на принципи на честност като ос, започваща от нула, дефиниране на лента за грешки, n информация и достъпна палитра
- Възможност за избягване на подвеждащи графики, които скриват разпределението, изрязват оста и разкрасяват данните
Една биологична находка, колкото и важна да е, не може да бъде разбрана, ако не се визуализира добре. В същото време една лоша или подвеждаща графика може да представи погрешно данните; Това е както етичен проблем, така и научна грешка. В тази част ще обсъдим типовете графики, които се използват най-често в биологията, как да ги произвеждаме бързо с изкуствен интелект и на какво да обърнем внимание, за да сме сигурни, че графиката е честна.
AI създава графики с качество на излъчване за секунди с matplotlib/seaborn код; но ваша работа е да решите дали графиката представя точно данните.
Основни видове графики в биологията
- Диаграма на вулкана: Сравнение на размера на ефекта (log2FC) и значимостта (-log10 p) в диференциално изразяване. Показва променени гени с един поглед.
- Heatmap: Модел на експресия на множество гени/проби в цветове. Той разкрива модели чрез групиране.
- График на кутия/цигулка: Сравняване на разпределението на групите. Той е по-честен от средния бар, защото показва разпространението.
- PCA диаграма: Намаляване на високоразмерните данни до 2 измерения и показване на групиране на проби (анализ на главните компоненти).
- Филогенетично дърво: Показване на еволюционната връзка на видове/последователности чрез разклоняване.
- Крива на оцеляване (Каплан-Майер): Показва вероятността от събитие (напр. смърт) във времето.
Съвет: Простите стълбовидни диаграми, начертани върху средната стойност, често са подвеждащи в биологията, защото затъмняват отделните точки от данни и разпределението. Ако е възможно, изберете графика в кутия или „пчелен рояк“, който също показва точки. Ако има малко точки от данни, покажете ги всички.
Честни графични принципи
- Нека оста започва от нула (особено в стълбовидни диаграми); пресечената ос преувеличава разликата.
- Посочете какво представлява лентата за грешка: стандартно отклонение, стандартна грешка или доверителен интервал? Тези са много различни.
- Покажи n: Колко проби са получени трябва да бъде в графиката или в заглавието.
- Използвайте подходяща за далтонисти палитра (напр. viridis); Не разчитайте на разграничението червено-зелено.
- Не разкрасявайте данните: Изтриването на отклонението, преместването на оста или показването само на красивото повторение е научно нарушение.
Стъпка по стъпка: създаване на карта на вулкана
- Подгответе данните: таблица с колони gen, log2FC, padj.
- Трансформация: Изчислете -log10(padj) за оста y.
- Задайте прагове: |log2FC|>1 и padj<0,05.
- Оцветете го: нагоре, надолу, безсмислени три категории.
- Етикет: Назовете няколко (не всички) от най-силните гени.
- Заглавие и ос: Ясен етикет, n информация, описание на прага.
Копируеми шаблони за подкана
Роля: Вие сте асистент по научна визуализация. Задача: Начертайте диаграма на вулкан от моята таблица с диференциални изрази (gen, log2FC, padj). Праг: padj<0,05 и |log2FC|>1. Оцветете трите категории и маркирайте 10-те най-значими гена. Удобна за далтонисти палитра, ясен етикет на оста, добавете n информация към заглавката. matplotlib, качество на излъчване. Коментиран код.
Начертайте топлинна карта: редовете са 50-те най-променливи гена, колоните са проби. Извършете нормализиране на редове със Z-резултат, добавете йерархично групиране, използвайте палитра viridis. Покажете примерни групи с цветна ивица.
Обяснете дали лентата за грешки в моята графика трябва да бъде стандартно отклонение или стандартна грешка, в зависимост от целта на експеримента. Обяснете разликата между двете и последствията от избора на грешния.
Направете тази стълбовидна диаграма по-честна: добавете отделни точки от данни отгоре, започнете оста от нула, покажете n. Наличен код: [код]
Слаба подкана / Силна подкана
Слаб: "Начертайте добива."
Силно: „Имайте данни за ензимната активност за 4 групи (n=8 всяка). Начертайте цигулкова диаграма, сравнявайки групите; наслагвайте отделни точки от данни за всяка група; покажете средната линия; започнете у-оста от нула; добавете единица към етикетите на оста (nmol/min); използвайте подходяща за далтонисти палитра. Уверете се, че диаграмата представя справедливо разпределението.“
Разлика: Мощната подкана има тип диаграма, n, политики за честност и единица. Моделът създава графика, която е информативна, а не подвеждаща.
три мини калъфа
Случай 1 — Скъсена ос: В едно представяне разликата от 3% между две групи изглежда огромна чрез притискане на оста между 95-100. Когато AI стартира оста от нулата, се оказа, че разликата всъщност е малка. Урок: манипулирането на оста подвежда зрителя.
Случай 2 — Скрито разпределение: Стълбовата диаграма показва две групи „значително различни“; но когато точките бяха добавени, се видя, че групите се припокриват до голяма степен и разликата идва от няколко извънредни точки. Когато моделът предложи добавяне на точки, истинската история излезе наяве. Урок: диаграма, която крие лъжите за разпределение.
Случай 3 — Проблем с далтонизма: Начертана е топлинна карта с червено-зелена палитра; Приблизително 8% от публиката (мъже с далтонисти) не можаха да видят разликата. Когато преминах към палитрата Viridis, диаграмата стана четима за всички. Урок: достъпният палет трябва да е стандартен.
сравнителна диаграма
Цел
подходяща графика
Да се избягва
диференциален израз
карта на вулкана
суров p списък
Групово разпределение
кутия/цигулка+точки
обикновена пръчка
мултигенен модел
Топлинна карта (групирана)
дълга маса
Примерно групиране
PCA
—
време-събитие
Каплан-Майер
средна лента
Често срещани грешки
- Скъсена ос: Преувеличаване на разликата.
- Скриване на разпределението: Показване само на средната лента.
- Недефиниране на лентата за грешки: объркване на SD/SE/GA.
- Без уточняване на n: Читателят не може да оцени надеждността.
- Недостъпен цвят: С изключение на далтонисти с червено-зелена палитра.
- Разкрасяване на данни: Селективното представяне е научно нарушение.
Внимание: Всяко подреждане на графиката, което кара данните да изглеждат различни, отколкото са (изрязване на оста, скриване на отклонението, селективно повторение) е нарушение на научната почтеност. AI технически може да създаде „хубава“ диаграма; но ваша отговорност е да се уверите, че диаграмата представя данните справедливо.
Филогенетично дърво и графики на връзките
Визуализация, специфична за биологията, е филогенетичното дърво, което показва еволюционната връзка на видовете или последователностите. Моделът на разклоняване показва свързаност, а дължините на разклоненията показват количеството на промяната. AI пише код, който изгражда дърво от подравнени последователности (напр. с Biopython Phylo или ete3) и рисува дървото в четим формат. Въпреки това, има две клопки в интерпретацията на дървото: игнориране на дължината на разклонението и гледане само на разклоняването и неуказване на първоначалното зареждане (стойността, която показва колко надежден е разклонението). Клон с ниска подкрепа не е достатъчен, за да се претендира за окончателно родство.
Начертайте филогенетично дърво от подредени последователности. Показване на дължини на клонове за мащабиране, добавяне на стойности за поддръжка на първоначално зареждане към възли, маркиране на клонове с ниска поддръжка под 70%. Подхождайте внимателно към клоните с ниска опора, когато интерпретирате дървото.
Таблица с графика: кое кога
Не всички данни изискват графики. Когато точните числа са важни (напр. точни стойности на няколко групи, статистически резултати), добре организираната таблица е по-добра от графиката. Диаграмата показва модела и сравнението; Таблицата дава точната стойност. Когато бъде попитан изкуственият интелект, "трябва ли тези данни да се показват като графика или таблица?" и искането за обосновка укрепва вашето представяне.
И накрая, диаграмата трябва да е разбираема. Читателят трябва да може да разбере какво е показано само като погледне графиката и нейното заглавие, без да чете текста: осите трябва да бъдат обозначени и с единици, групите трябва да бъдат дефинирани, n трябва да бъде посочено, статистическата значимост трябва да бъде маркирана. Попитайте AI за вашата диаграма „самостоятелна ли е със заглавието и етикетите си?“ Проверката му е добра последна проверка.
Готова за публикуване диаграма: технически подробности
Има някои технически подробности, които превръщат графиката от добра на екрана в използваема при излъчване, и AI може да ги добави към кода. Първо, резолюция: дневниците често изискват висока разделителна способност (300 DPI и повече) или векторен формат (PDF, SVG); Това гарантира, че графиката няма да се замъгли при печат. Второ е размерът на шрифта: таг, който може да бъде прочетен на екрана, може да не бъде прочетен, когато е намален на страницата на статията; осите и точките на етикета трябва да се коригират съответно. Трето, последователност: използването на едно и също цветово кодиране (напр. контрола винаги сиво, лечението винаги синьо) във всички графики в едно и също изследване не позволява на читателя да прекодира всяка графика. Можете да добавите тези подробности в една стъпка, като кажете на изкуствения интелект „направете тази графика готова за публикуване: 300 DPI, векторен изход, голям размер на шрифта, последователна цветова палитра“.
Подгответе диаграмата ми за публикуване: 300 DPI и също така запазете като вектор (PDF), увеличете размерите на осите и етикетите до четим размер, приложете последователна цветова палитра в цялата серия (контрол = сиво, лечение = синьо). Дайте коментиран код с matplotlib.
В обобщение
Добрата научна графика показва данните както ясно, така и честно. График на вулкана, топлинна карта, графика на кутия/цигулка и PCA са основни инструменти на биологията. AI бързо пише кода за тези графики, но вашата работа е да следвате принципите на честност като стартиране на оста от нула, показване на разпределението, дефиниране на лентата за грешки, указване на n и достъпната палитра. Красивите графики не са честни графики.
Задача за приложение
С набор от данни, който имате (или извадка), накарайте AI да създаде две диаграми: диаграма на цигулка/кутия с точки от данни, показващи груповото разпределение, и диаграма на вулкан от таблица с диференциални изрази. И в двете, започнете оста от нула (ако е подходящо), добавете n към заглавието, използвайте удобна за далтонисти палитра. След това помолете модела да създаде „подвеждаща“ и „честна“ версия на същата стълбовидна диаграма и обяснете разликата.
контролен списък
- [ ] Избрах типа диаграма според данните и целта.
- [ ] Инициализирах правилно оста от нулата.
- [ ] Показах разпределението/точките с данни, а не само средната стойност.
- [ ] Посочих каква е лентата за грешки (SD/SE/GA).
- Добавих [ ] n информация към диаграмата.
- [ ] Използвах подходяща за далтонисти палитра и не разкрасих данните.