Јединица 11 / 11

Етика, биобезбедност, поверљивост и научни интегритет

Добици:

  • Способност заштите осетљивих људских/генетских података у складу са правилима КВКК, ГДПР-а и етичког комитета и избегавање њиховог давања отвореном моделу
  • Способност да се доведе у питање валидност резултата проценом ризика биолошке безбедности/двоструке употребе и пристрасности становништва
  • Разумевање да се етичка одговорност не може пренети на возило и да је неопходан смислен човек у петљи

Снажно коришћење вештачке интелигенције у биологији допуњује се одговорним коришћењем. Биологија је осетљива област која дотиче људско здравље, генетску приватност, животну средину, па чак и биобезбедност. У овој јединици ћемо разговарати о етичким, правним и безбедносним одговорностима са којима ћете се суочити када користите вештачку интелигенцију у биолошким студијама. Ова јединица је оквир изграђен на принципима провере и поштења у свим претходним јединицама.

Основни принцип: АИ је алат; Етичка одговорност увек лежи на људима. „Предложен модел“ није изговор.

Четири области одговорности

1. Приватност података и људски подаци

Генетски, клинички или здравствени подаци људских учесника су изузетно осетљиви. ДНК секвенца особе може открити ризик од болести и идентитет њихове и њених рођака; Чак се и геномски подаци за које се сматра да су анонимни могу поново идентификовати. Лепљење ових података у јавно доступан АИ модел може да прекрши законе о заштити података (КВКК у Турској, ГДПР у Европи) и одобрења етичког одбора (ИРБ/етичког комитета).

  • Немојте давати личне/клиничке податке отвореном моделу.
  • Избегавајте употребу ван оквира сагласности; На шта је учесник пристао?
  • Одлучите се за предузећа/локалне (он-премисе) или уговорне алате за обраду података.

2. Биосигурност и двострука употреба

Неке биолошке информације су „двоструке употребе“: могу бити и корисне и штетне; на пример, секвенце патогена (које изазивају болест), производња токсина. Тражити од АИ информације о побољшању опасних патогена или дизајнирању штетних биолошких агенаса је неетично и незаконито на већини места.

  • Не постављајте опасне захтеве за двоструку употребу.
  • Пратите смернице одбора за биолошку безбедност (ИБЦ) ваше институције.

3. Научни интегритет

Овде се спаја све што смо видели у претходним јединицама: без лажног приписивања, без улепшавања података, без п-хаковања, без селективног извештавања. Вештачка интелигенција их може учинити лакшим или тежим; Разлика је у вашој искрености.

  • Пријавите све резултате (укључујући негативне).
  • Прогласити употребу вештачке интелигенције.
  • Подржите поновљивост дељењем сирових података и кода (ако је могуће).

4. Пристрасност и правичност

АИ модели носе пристрасност података на којима су обучени. Геномске базе података углавном потичу од популација европског порекла; ово доводи до лошијих предвиђања у другим популацијама. Модел слике може бити лош у стању које је недовољно заступљено у подацима о обуци.

  • Поставите питање на којој популацији/подацима је модел обучен.
  • Процијените да ли се резултати примјењују у свим групама.
Савет: Запитајте се: „Ако дам ове податке моделу, коме они припадају и да ли је та особа дала дозволу?“ Ако је одговор нејасан, немојте га давати. Кршење поверљивости је неповратно.

Корак по корак: одговорна контрола вештачке интелигенције

  1. Класификовати извор података: лични/осетљиви или јавни?
  2. Проверите сагласност и дозволе: Да ли је ова употреба покривена?
  3. Изаберите прави алат: безбедно/природно окружење за осетљиве податке.
  4. Узмите у обзир ризик од двоструке употребе.
  5. Пристрасност питања: Да ли је резултат валидан у свим групама?
  6. Документујте и декларишите употребу.

Шаблони упита који се могу копирати

Прегледајте мој план анализе у наставку из етичке перспективе: наведите упозорења у вези са поверљивошћу података, пристанком учесника, потенцијалном пристрасношћу и ризиком од двоструке употребе. План: [текст] (Напомена: НЕ делим стварне податке о пацијенту, само план.)

На која питања о приватности и сагласности треба да одговорим пре употребе овог скупа геномских података? Контролна листа је припремљена у смислу КВКК/ГДПР и етичког комитета.

Како да транспарентно прогласим алатку вештачке интелигенције коју користим у одељку о методама у свом чланку? Напиши пример изјавне реченице; које информације (алатка, верзија, обим употребе) треба да садржи?

Како да проценим да ли резултати овог модела имају пристрасност становништва? Наведите питања која треба да поставим о подацима о обуци и корацима провере.

Слаби промпт / Јаки промпт

Слабо: „Анализирајте генетске податке следећег пацијента: [стварни подаци].“

Гуцлу: „Постављам план анализе који ради са клиничким геномским подацима, али не делим стварне податке о пацијентима. Само из методолошке перспективе: које мере поверљивости треба да предузмем, у ком окружењу треба да обрађујем податке, које услове одобрења и етичког комитета треба да испуним? Можете приказати ток помоћу лажних података/узорака."

Разлика: У моћном одзивнику не деле се стварни осетљиви подаци; Пита се само метода. Приватност се одржава, модел и даље помаже.

три мини кофера

Случај 1 — Кршење приватности: Истраживач је залепио оно што је мислио да су анонимни подаци о егзому пацијената у отворени модел како би га анализирали. Када је етички комитет сазнао за ово, студија је обустављена; Није било споразума о обради података. Поука: осетљиви подаци никада не улазе у отворени модел.

Случај 2 — Популациона пристрасност: Алат за оцену полигенског ризика је обучен на подацима европског порекла; У другој популацији, процене ризика су биле значајно нетачне. Када је модел предложио испитивање састава података о обуци, тим је одлучио да не користи алат у тој популацији. Поука: пристрасност спашава или штети животима.

Случај 3 — Откривање и транспарентност: Тим је написао код за чишћење података помоћу вештачке интелигенције и то јасно навео у одељку о методама; Такође је поделио шифру. Рецензенти су ово поздравили јер је поновљивост била јака. Поука: транспарентност рађа поверење.

упоредни графикон

области

безбедно понашање

ризично понашање

подаци о пацијентима

Локално/безбедно окружење

Залепите да бисте отворили модел

сагласност

Користите у оквиру обима

Не прекорачујте обим

Биосигурност

Избегавање двоструке употребе

опасна потражња

интегритет

Пријавите све резултате

селективно извештавање

пристрасност

Испитајте становништво

Нанесите на слепо

транспарентност

Декларирајте употребу

скривајући се

Уобичајене грешке

  • Давање осетљивих података отвореном моделу: неповратно кршење приватности.
  • Прекорачење обима сагласности: Употреба није одобрена од стране учесника.
  • Игнорисање пристрасности: Уопштавање резултата за све групе.
  • Прикривање употребе: Не пријављује се допринос АИ.
  • Одбрана "предложен модел": Приписивање одговорности возилу.
Опрез: У биолошком раду са високим последицама (клиничка одлука, биолошка безбедност, подаци о људима) излаз вештачке интелигенције није замена за компетентну експертску верификацију и етички надзор; то само убрзава. Коначна одговорност увек лежи на људском бићу, заједно са етичким и научним последицама одлуке.

Животна средина, екологија и традиционално знање

Етичка одговорност није ограничена на људске податке. Такође је потребан опрез када се вештачка интелигенција користи у екологији и биологији очувања. На пример, прецизни подаци о локацији (координате замке камере) угрожене врсте су осетљиви због ризика од криволова; Објављивање ових података отвореном моделу или јавности могло би наштетити врсти. Слично томе, етичка и правна питања (као што је Протокол из Нагоје) настају када се традиционално биолошко знање локалних заједница (нпр. употреба биљке) користи без дозволе. Пре употребе података, „коме ове информације припадају и ко би био оштећен њиховим откривањем?“ Увек постављајте питање.

Људски надзор и коначна одлука

Суштина целог овог модула се своди на један принцип: смислен људски надзор. АИ производи предлог, пише нацрт, показује образац; Али биолошка, клиничка или етичка одлука никада се не заснива директно на резултату модела. Посебно у областима високог ризика (дијагноза, лечење, одлука о очувању врсте, ослобађање), улога модела није да доноси одлуке, већ да убрза одлуку стручњака. Приступ „људи у петљи” није слоган, већ неопходност.

Да би овај надзор функционисао, надзорник мора бити компетентан. Слепи пристанак („речен модел, прихватање“) није надзор. Прави надзор захтева стручност која може довести у питање резултат, ухватити његову грешку и одбацити га када је то потребно. Дакле, вештачка интелигенција не замењује стручњака; То чини стручњака још незаменљивијим. Онај ко најбоље користи возило је онај који га најбоље може контролисати.

Укратко

Одговорно коришћење вештачке интелигенције у биологији покрива четири области: приватност података (заштита осетљивих људских података), биобезбедност (избегавање двоструке употребе), научни интегритет (искрено и потпуно извештавање) и свест о пристрасности (важност резултата у свим групама). Не пружајте осетљиве податке отвореном моделу, транспарентно декларишите употребу, доводе у питање пристрасност становништва. Етичка одговорност се никада не може пренети на агента; Увек је у људима.

Задатак апликације

Размотрите сценарио из сопственог радног простора (нпр. помоћу скупа података за људе или модела слике). Нека АИ направи етичку контролну листу овог сценарија (поверљивост, сагласност, пристрасност, двострука употреба, транспарентност) без дељења стварних података. За сваку ставку означите је као „прикладну/ризично/неизвесну” у вашој ситуацији и напишите акциони план за оне који су ризични/неизвесни. Такође припремите изјаву о употреби вештачке интелигенције за ваш чланак.

контролна листа

  • [ ] Нисам дао осетљиве/личне податке отвореном моделу.
  • [ ] Проверио сам обим сагласности и етичку комисију.
  • [ ] Проценио сам ризик двоструке употребе/биобезбедности.
  • [ ] Искрено сам пријавио све резултате.
  • [ ] Довео сам у питање пристрасност становништва/података.
  • [ ] Ја сам транспарентно прогласио употребу вештачке интелигенције и преузео одговорност.

Модул Екам

1. Ученик је питао језички модел „колико низова има овај ФАСТА фајл?“ пита он а модел одговара '48'. Који је најисправнији приступ?

  • А) Директно користећи број 48 дат моделом; Модел је поуздан јер види датотеку
  • Б) Питајте број још једном и прихватите га као тачан ако су два одговора иста
  • Ц) Читање датотеке помоћу Биопитхон-а, бројање секвенци са кодом и коришћење излаза ✔
  • Д) Отварање фајла ручно и бројање на основу одлуке ока

Објашњење: Детерминистички задаци као што су бројање и мерење треба да буду препуштени коду који покрећете, а не језичком моделу. Модел не 'памти' број, он даје вероватноћу вредности и може бити погрешио; Бројање помоћу алата као што је Биопитхон даје тачне и поновљиве резултате.

2. Желите да пребројите ћелије у микроскопској слици и измерите површину сваке. Који је најприкладнији приступ за овај задатак?

  • А) Коришћење стручног алата за сегментацију као што је Целлпосе/СтарДист и ручна провера резултата ✔
  • Б) Налепите слику у општи језички модел и питајте 'колико ћелија има'
  • Ц) Опишите слику моделу и затражите процењени број
  • Д) Прихватање броја пиксела као броја ћелија без икакве калибрације

Објашњење: Сегментација и мерење ћелије није домен општег језичког модела, већ специјализованих модела слике (Целлпосе, СтарДист) специјално обучених за овај задатак. Модел језика пише код који позива ове алате; Стручни модел врши мерење, а биолог верификује резултат.

3. Дипломирани студент додаје 8 извора произведених у језичком моделу у свој увод у тезу. Консултант налази да 3 од њих уопште не постоје. Како се ова ситуација може спречити?

  • А) Тражећи од модела да још једном произведе ресурсе
  • Б) Одабиром само цитата са ДОИ (ако постоји ДОИ, прави је)
  • Ц) Захтевање листе упућивањем модела да се „уклопи“
  • Д) Независно проверава сваки цитат на ПубМед/дои.орг и цитира само чланке које је прочитао ✔

Објашњење: Општи језички модели нису база података литературе; Уместо да тражи стварне записе, он „генерише“ атрибуције које звуче реално (фабрицирано приписивање). Сваки ауторски ред и ДОИ не би требало да се користе без независне провере у изворима као што је ПубМед/дои.орг и само цитирајући чланке који су стварно прочитани.

4. Који је најмоћнији начин да се осигура тачност кода за чишћење података који је написала вештачка интелигенција?

  • А) Ако код ради без грешака, прихватите га као исправан.
  • Б) Тестирање резултата са малим познатим узорком и верификација очекивања са ассерт ✔
  • Ц) Питајте модел 'да ли је код тачан?' питати и веровати одговору 'да'
  • Д) Покрените код неколико пута и сваки пут добијете исти излаз

Напомена: Само зато што код ради без грешака не значи да је исправан; 'погрешан код који ради без грешака' је најопаснија ситуација у биологији. Тестирање са малим узорком чији резултат знате унапред и уграђивање очекивања у код са ассерт-ом је најјачи штит од тихих погрешних резултата.

5. У РНА-сек анализи, 20.000 гена је тестирано и за 3.800 гена је утврђено да су 'значајни' са п<0,05 без корекције. Шта је главни проблем овог закључка?

  • А) Број узорака је превелик, треба га смањити
  • Б) п праг је превисок, требало је користити 0,10
  • Ц) Корекција вишеструког поређења (ФДР) није извршена; Постоји много лажних позитивних резултата ✔
  • Д) Требало је да се тестирају узорци уместо гена

Објашњење: Када тестирате хиљаде гена истовремено, многи гени се случајно појављују 'значајни', чак и ако нема стварне разлике; Ово се зове проблем вишеструког поређења. Решење је применити корекцију ФДР (стопа лажног откривања) методом као што је Бењамини-Хохберг; Уз корекцију, листа се обично смањује на десетине до неколико стотина гена.

6. Најбољи меч у БЛАСТ резултату има Е-вредност 2,0. Шта ово значи?

  • А) Подударање је највероватније насумично; ✔ није поуздано подударање
  • Б) Спој је веома јак; Што је већа е-вредност, то боље
  • Ц) Секвенца се подудара са стопом од 2%
  • Д) Постоје 2 базне разлике између две секвенце

Објашњење: Е-вредност указује на очекивање да ће подударање бити насумично; Боље је бити мали. Е-вредност већа од 1 указује да је подударање највероватније насумично. За поуздана подударања генерално се траже веома мали прагови као што је е < 1е-5.

7. У АлпхаФолд моделу, крајњи регион протеина показује низак пЛДДТ скор (<50). Како треба тумачити овај регион?

  • А) АлпхаФолд је направио грешку у овом региону, регион треба уклонити из анализе
  • Б) Овај регион је дефинитивно алфа хеликс
  • Ц) Модел је потпуно непоуздан, структура не би требало да се користи
  • Д) Регион је вероватно неправилан/еластичан; треба тумачити као 'нејасно', а не 'нетачно' ✔

Опис: пЛДДТ је локални резултат поузданости за сваку аминокиселину; Вредности испод 50 често одражавају заиста неправилне (флексибилне, нефиксне) регионе. Погрешно је аутоматски брисати ове регионе као 'погрешне претпоставке'; Низак резултат треба читати као „неизвестан/флексибилан“ и проценити његов биолошки значај.

8. Истраживач извештава о површини ћелија само у пикселима и резултати нису у складу са литературом. Који корак недостаје?

  • А) Требало је избројати више ћелија
  • Б) Калибрација скале (конверзија пиксел-микрометар) није извршена, резултати нису конвертовани у физичке јединице ✔
  • Ц) Алат за сегментирање је погрешно изабран
  • Д) Резолуција слике је превисока

Објашњење: Калибрација скале (колико микрометара по пикселу) је неопходна за издвајање физичке величине из слике. Ако се овај корак прескочи, вредности остају неупоредиве, у зависности од подешавања микроскопа. Површине се морају претворити у физичке јединице као што су квадратни микрометри.

9. Ученик узима 10 узорака ткива од једног миша и користи 'н=10' у статистици. Зашто је ово нетачно?

  • А) 10 узорака је премало за статистику, потребно је најмање 30 узорака
  • Б) Требало је узети узорке ткива из различитих органа
  • Ц) Ових 10 примера су техничка понављања; биолошко н је и даље 1, ово је такозвано понављање ✔
  • Д) Узорци су неважећи јер су узети истог дана

Објашњење: Поновљена мерења узета од исте особе су техничка понављања; где је статистичко н број биолошких јединица (овде мишеви). Сматрати техничко понављање биолошким (псеудорепликација) производи лажни значај. Правилан дизајн подразумева рад са више појединаца.

10. Једном анализом утврђено је п=0,03. Које је исправно тумачење ове вредности?

  • А) Постоји 3% шансе да видите овај или екстремнији резултат када у стварности нема разлике ✔
  • Б) Вероватноћа да је ефекат стваран је 97%
  • Ц) Вероватноћа да је нулта хипотеза тачна је 3%
  • Д) Резултат је 97% поновљив

Објашњење: п-вредност није 'вероватноћа да је хипотеза тачна' или 'вероватноћа да је ефекат тачан'. П-вредност је вероватноћа да се разлика види као или екстремнија од оне уочене када разлика заправо и нема. Стога п=0,03 не значи 'ефекат је 97% стваран'; резултате такође треба проценити по величини ефекта и интервалу поверења.

11. У презентацији, разлика од 3% између две групе је приказана као огромна компресијом и-осе на опсег 95-100. Шта је ово пример?

  • А) Добра техника визуелизације; наглашава разлику
  • Б) Проблем палете прилагођене далтонистима
  • Ц) Прихватљив избор стила
  • Д) Обмањујући и непоштен графикон који преувеличава разлику са скраћеном осом ✔

Објашњење: Неиницијализација осе од нуле (окрњена оса) доводи у заблуду гледаоца визуелно преувеличавајући малу разлику. Ово је кршење принципа поштења; Нарочито у тракастим дијаграмима, оса треба да почиње од нуле, а разлика треба да буде приказана њеном стварном величином.

12. Истраживач налепи оно што мисли да су анонимни подаци о егзому пацијената у модел јавног језика да би га анализирали. Зашто је ово понашање проблематично?

  • А) Нема проблема; подаци се могу делити ако су анонимни
  • Б) Пружање осетљивих података о пацијентима у отвореном моделу представља кршење приватности и етичких/правних (КВКК/ГДПР) и не може се поништити ✔
  • Ц) Проблематично је само зато што ће анализа бити спора
  • Д) Модел је проблематичан јер не може да разуме податке

Опис: генетски/клинички подаци о пацијенту су изузетно осетљиви; Чак се и геномски подаци за које се сматра да су анонимни могу поново идентификовати. Достављање ових података јавном моделу крши одобрења КВКК/ГДПР и етичког комитета (ИРБ) и представља неповратну повреду приватности. Осетљиви подаци треба да се обрађују у локалном/безбедном, уговореном окружењу.

13. У једној студији, разлика за коју су мислили да је 'пацијент у односу на контролу' је заправо била због узорака који су обрађени два различита дана. Како се зове ова ситуација и како се решава?

  • А) То је ефекат ван граница; тачке треба обрисати
  • Б) То је недостатак нормализације; довољна је само корекција размера
  • Ц) То је ефекат серије; треба да буде балансиран у дизајну и додати моделу као батцх варијабла ✔
  • Д) п-хаковање; тест треба променити

Објашњење: Техничка разлика због узорковања серије/дана обраде назива се ефекат серије и може се помешати са биолошком разликом. Исправан приступ је балансирање серија у дизајну и додавање променљиве серије у статистички модел (нпр. '~серија + стање'), чиме се одваја технички сигнал од биолошког сигнала.

14. Желите да израчунате ГЦ однос ДНК секвенце. Који је исправан и поновљив приступ?

  • А) Одштампајте код који израчунава ГЦ стопу помоћу Биопитхон-а, покрените га и користите излаз ✔
  • Б) Дајте моделу секвенцу и замолите га да усмено каже брзину ГЦ
  • Ц) Потврђивање односа датог моделом другим моделом
  • Г) Гледајући у првих 100 слова серије и погађајући на око

Објашњење: ГЦ стопа је детерминистички прорачун; треба да се заснива на коду који обрађује низ, а не на вредности коју језички модел 'памти'. Уместо да га модел израчуна, штампање кода за израчунавање помоћу алата као што је Биопитхон и покретање самог њега ће обезбедити тачан излаз који даје исти резултат сваки пут када га покренете.