Јединица 1 / 11

Увод у вештачку интелигенцију у биологији: улоге, границе, валидација и етика

Добици:

  • Бити у стању да разликује где вештачка интелигенција штеди време у биолошком току рада (питање, дизајн, лабораторија, анализа, извештавање) и где су редослед, број, извор и етичке одлуке препуштени човеку, у зависности од нивоа ризика.
  • Способност разликовања општег језичког модела и специјализованих биолошких модела (АлпхаФолд, Целлпосе) обучених за одређени проблем и коришћење сваког од њих у одговарајућем задатку.
  • Способност примене дисциплине верификације која независно проверава сваки излаз са четири корака низ/податак–број–извор–етика

биологија; То је огромна наука о подацима која се протеже од ћелије до екосистема, од секвенце ДНК до савијања протеина, од једног експеримента до стотина хиљада мерења гена. Последњих година, обим ових података је толико порастао да једна студија секвенцирања РНК (РНА-сек: метода која мери који ген у ћелији се чита и колико) може да произведе довољно података за лабораторију годинама. Овде долази у обзир вештачка интелигенција: као асистент који пише код, организује податке, производи нацрте, сумира литературу и гради оквир за анализу. Наш циљ у овом модулу је да вас научимо да користите АИ не као „магичну кутију“ већ као алат који убрзава свакодневни рад биолога, али чији сваки резултат мора бити верификован од стране биолога.

У овој првој целини разговараћемо о томе где вештачка интелигенција штеди време у биолошком току рада, где је одлука препуштена човеку и које грешке у овој професији треба узети у обзир од самог почетка. Постоји изрека коју ћемо понављати током целог модула: АИ убрзава, биолог одлучује и сноси одговорност.

Шта тачно ради вештачка интелигенција у биологији?

Модел великог језика (ЛЛМ) није микроскоп, није ДНК секвенцер, није статистичка машина. Он је продуцент текста који одлично познаје језичке и кодне обрасце. Унутарњивање ове разлике од почетка је основа све будуће дисциплине верификације.

Биолошки задаци у којима је АИ заиста јак укључују:

  • Кодирање: филтрирање табеле панда (оквир података: табеларна структура података у формату ред-колона), цртање графикона, читање ФАСТА датотеке (стандардни текстуални формат који чува ДНК/протеинске секвенце) са Питхон-ом.
  • Објашњавање и подучавање: „Шта је Харди-Вајнбергова равнотежа?“ Да објасним овакав концепт тако што ћемо га поједноставити.
  • Израда нацрта: Први нацрт одељка о методама, оквир е-поште, план презентације.
  • Резимирање и уређивање: Свођење дугачког чланка на чланке, прикупљање разбацаних белешки.
  • Конверзија: код изградње за мапирање листе гена у други облик идентификације (ИД).

Задаци у којима је АИ непоуздан су: стварање прецизне нумеричке вредности („сећање“ вредности експресије гена), цитирање стварног чланка, прецизно извештавање о правој биолошкој функцији секвенце, доношење клиничких одлука са подацима о пацијенту.

Савет: Усвојите једноставно правило. Нека АИ „размишља и организује“, али нека се „бројање, мерење и верификација“ обавља помоћу кода који покрећете или верификујете ручно.

Две различите „вештачке интелигенције“: језички модел и специфични биолошки модели

Када кажемо "вештачка интелигенција" у биологији, заправо говоримо о две веома различите ствари, а њихово бркање може довести до озбиљних грешака. Први је општи језички модел који ћете највише користити у овом модулу: пише код, генерише текст, објашњава. Други су стручни модели обучени посебно за одређени биолошки проблем: АлпхаФолд који предвиђа облик протеина, Целлпосе који броји ћелије на слици микроскопа, класификатори који препознају звукове врста. Експертски модели су много поузданији од језичких модела у свом уском домену јер су обучени на стварним биолошким подацима и тестирани у том домену. Језички модел, с друге стране, зна „о свему по мало“, али ни у једном од њих не гарантује тачност мерења. Робустан ток посла комбинује то двоје: језички модел поставља код и ток, стручњак врши мерење модела, биолог потврђује резултат.

Подела дужности према нивоу ризика

Не носи сваки задатак исти ризик. Колико би требало да доведете у питање излаз АИ зависи од штете која ће настати ако је тај излаз погрешан. Табела у наставку представља ову разлику.

Куест

Ниво ризика

улога човека

Тражите појашњење да бисте научили концепт

ниско

Потврда са извором, провера логике

Одштампајте Питхон код за анализу

средње

Покретање кода и тестирање са познатом ситуацијом

Мапирање имена/ИД гена

Средње-високо

Потврда са званичном базом података (НЦБИ, Енсембл)

Тумачење функције низа

висока

Експериментални докази и база података су обавезни

Клиничка/дијагностичка одлука

веома високо

Вештачка интелигенција никада не би требало да се користи сама

три мини кофера

Случај 1 — Уштеда времена: студент докторских студија је сваки пут ручно очистио табелу бројања РНА-сек од 24 узорка; Трајало је око 40 минута. Написао је код панде вештачкој интелигенцији и сам га покренуо; Посао се смањио на 3 минута. Критична тачка: једном тестирао код са малим узорком и потврдио да је укупан број линија (18.542 гена) очуван.

Случај 2 — Замка лажних цитата: Истраживач је од АИ затражио „5 извора о употреби ЦРИСПР-а у оплемењивању биљака“ за увод. Модел је произвео 5 ознака реалног изгледа; али ДОИ (идентификатор дигиталног објекта: стална адреса чланка) њих 3 није био доступан ни у једној публикацији. Да га је истраживач користио а да то није потврдио, његов чланак би одбио судија.

Случај 3 — Нумеричка халуцинација: Учитељ пита: „Колико гена има у људском геному?“ питао је и у клипборд уписао вредност коју даје модел „око 46.000”. Тренутна процена је отприлике 19.000-20.000 гена који кодирају протеине. Модел је произвео погрешан број самоувереним тоном. Лекција: увек потврдите број са ажурираним извором (Енсембл, ГЕНЦОДЕ).

Корак по корак: сигуран ток рада АИ

  1. Дефинишите задатак: Напишите шта желите у једној реченици („Код за филтрирање гена са ниском експресијом из табеле бројања од 24 узорка“).
  2. Дајте контекст: Наведите формат података, називе колона, број узорака.
  3. Затражите излазни формат: „Дајте радни Питхон код, коментаришите ред по ред.“
  4. Покрените га сами: Испробајте код у свом окружењу; Пријавите се ако дође до грешке.
  5. Тест са познатом ситуацијом: Проверите са малим примером чији резултат знате.
  6. Независна провера чињеница: Наведите критичне бројеве и тврдње путем званичне базе података или секундарног метода.

Шаблони упита који се могу копирати

Улога: Ви сте искусан биоинформатичар. Задатак: Напишите Питхон код за [податке/анализу]. Контекст: Подаци [формат], колоне [име], број узорака [Н]. Ограничење: Дајте само радни код, додајте кратке коментаре у сваки ред, наведите библиотеке.

Поједноставите овај концепт као да га објашњавате студенту основних студија: [концепт]. Дефинишите га у 3 реченице, дајте 1 аналогију о свакодневном животу, исправите 1 уобичајену заблуду.

Прегледајте мој план анализе у наставку и реците ми његове слабе тачке. Конкретно: контролна група, број понављања, избор статистичког теста. План: [текст]

Смањите резиме овог чланка на 5 ставки: (1) питање, (2) метод, (3) главни налаз и проблем, (4) ограничење, (5) закључак који мени одговара. Текст: [сажетак]

Слаби промпт / Јаки промпт

Слабо: "Дај ми анализу експресије гена."

Гуцлу: „Имам табелу сировог броја РНА-сек из 12 контролних, 12 узорака пацијената (ЦСВ, редови ген, узорак колона). Наведите кораке анализе диференцијалне експресије; објасните који сам Питхон/Р алат користио у сваком кораку и зашто; оправдајте метод нормализације. Прво дајте план, а не код.“

Разлика: У моћном промпту, структура података, број узорака, тип излаза и захтев за оправдање су јасни. У слабој брзини, модел је приморан да погађа и често наставља са нетачним претпоставкама.

Уобичајене грешке

  • Учините модел да се броји/мери: Питајте ЛЛМ „колико је редова у овој табели?“ питати. Нека код то уради.
  • Коришћење атрибуција без верификације: Модел може да креира реалистичне атрибуције. Проверите сваки ДОИ.
  • Ослањајући се на самоуверен тон: АИ говори самоуверено чак и када греши; Тон није доказ тачности.
  • Без давања контекста: Захтевање кода без навођења формата података производи код који не функционише.
  • Лепљење поверљивих/пацијентских података: Извоз личних здравствених података у јавни модел представља етичко и законско кршење (Јединица 11).
  • Мешање две врсте модела: пуштање језичког модела да обави посао који захтева мерење (структура, бројање ћелија) и заобилажење експертског модела.
Опрез: У биолошком раду са високим последицама (клинички, биолошка безбедност, анализа која води до објављивања), излаз вештачке интелигенције није замена за компетентну експертску верификацију; то само убрзава. Коначна одговорност увек лежи на људском бићу.

Граница знања вештачке интелигенције: сегмент образовања и актуелност

Све што језички модел „зна“ потиче из текстова до датума када је обучен (сегмент обуке: последњи пут када је модел видео податке). Биологија се, с друге стране, брзо мења: нове напомене гена, ажуриране верзије генома (нпр. транзиција људског референтног генома са ГРЦх37 на ГРЦх38), нове класификације се стално објављују. Модел не може знати налаз након граничног датума или ажурирано име гена; Можда чак представља старе, застареле информације као да су актуелне. Стога, имена врста, ИД гена, верзије базе података и тренутне статистике увек треба да буду потврђени из званичног извора (НЦБИ, Енсембл, УниПрот).

Друга граница је слепило на двосмисленост: без обзира да ли модел познаје тему добро или уопште не, он одговара истим самоувереним тоном. Људи оклевају када кажу „нисам сигуран“; Модел не оклева. Зато је коришћење тона као мере поверења опасно. У критичком одговору, модел је упитан „колико сте сигурни и како то знате?“ Питање понекад открива недоследност; Али коначна потврда је опет независни извор.

Чувајте се контекстног прозора и великих података

Модел може истовремено да обрађује само одређену дужину текста (контекстни прозор: количина текста коју модел може да обради одједном). Лепљење датотеке генома или табеле од десетина хиљада редова директно у модел би премашило ограничење и представљало би ризик за приватност. Исправан приступ је да се подаци дају коду, а не моделу: модел пише код, код обрађује податке. Када радите са великим подацима, ова разлика је фундаментална и за безбедност и за тачност.

Путоказ овог модула

У следећим јединицама, ове принципе ћемо ставити у конкретне токове рада: основе Питхона (У2), анализа секвенце (У3), омика и високодимензионални подаци (У4), структура протеина и АлпхаФолд (У5), детекција слике и врста/ћелија (У6), експериментални дизајн (У7), статистичка анализа (У9), статистичка анализа (У9), литература о биографији и писање (У9), визуелизација и писање (У9). (У11). Иста дисциплина се понавља у свакој јединици: вештачка интелигенција производи, биолог верификује.

Укратко

Вештачка интелигенција је моћан асистент у биологији који кодира, објашњава, генерише обрисе и резимира; али то није калкулатор, база података или доносилац одлука. Разликовати општи језички модел и специфичне експертске моделе. Раздвојите задатке према нивоу ризика: брзо пређите на откривања ниског ризика, обавезно извршите независну верификацију високоризичног броја, атрибуције и захтева о функцији. Биолог који дисциплину верификације чини саставним делом тока посла добија највећу вредност од АИ.

Задатак апликације

Изаберите 3 типична задатка из ваше области студија (нпр. писање кода, учење концепта, сажетак литературе). Класификујте сваки као низак/средњи/високи ризик према горњој табели. За онај са високим ризиком, напишите у 2 реченице како бисте независно верификовали излаз. Затим користите шаблон „Стронг промпт“ да доделите задатак АИ и тестирате излаз са познатом ситуацијом.

контролна листа

  • [ ] Свој задатак сам класификовао према нивоу ризика.
  • [ ] Додао сам формат података и контекст у промпт.
  • [ ] Препустио сам бројање/мерење коду или себи, а не моделу.
  • [ ] Проверио сам сваку нумеричку тврдњу и атрибуцију са независним изворима.
  • [ ] Делегирао сам мерење одговарајућем експертском моделу, а ток језичком моделу.
  • [ ] Нисам дао поверљиве/личне податке отвореном моделу.
  • [ ] Прихватио сам да је коначна одлука и одговорност на мени.