Единица 11 / 11

Етика, биосигурност, доверливост и научен интегритет

Добивки:

  • Способност да се заштитат чувствителните човечки/генетски податоци во согласност со правилата на KVKK, GDPR и етичкиот комитет и да се избегне давање на отворен модел
  • Способност да се доведе во прашање валидноста на резултатите преку проценка на ризиците од биосигурност/двојна употреба и пристрасност на населението
  • Разбирање дека етичката одговорност не може да се делегира на возилото и дека е неопходна значајна личност во јамката

Силно користење на вештачката интелигенција во биологијата се надополнува со нејзино одговорно користење. Биологијата е чувствително поле кое го допира човековото здравје, генетската приватност, животната средина, па дури и биосигурноста. Во оваа единица, ќе разговараме за етичките, правните и безбедносните одговорности со кои ќе се соочите кога користите вештачка интелигенција во биолошките студии. Оваа единица е рамка изградена врз принципите на верификација и чесност во сите претходни единици.

Основен принцип: ВИ е алатка; Етичката одговорност секогаш лежи кај луѓето. „Моделот предложи“ не е изговор.

Четири области на одговорност

1. Приватност на податоците и човечки податоци

Генетските, клиничките или здравствените податоци од човечки учесници се исклучително чувствителни. ДНК секвенцата на една личност може да го открие ризикот и идентитетот од болеста на нивниот и на нивните роднини; Дури и геномските податоци за кои се смета дека се анонимизирани може повторно да се идентификуваат. Вметнувањето на овие податоци во јавно достапен модел на вештачка интелигенција може да ги прекрши законите за заштита на податоците (KVKK во Турција, GDPR во Европа) и одобренијата од етичкиот одбор (IRB/етичкиот комитет).

  • Не давајте лични/клинички податоци на отворениот модел.
  • Избегнувајте употреба надвор од опсегот на согласност; На што се согласи учесникот?
  • Одлучете се за алатки за договор за претпријатие/локални (во простории) или за обработка на податоци.

2. Биосигурност и двојна употреба

Некои биолошки информации се „двојна употреба“: може да бидат и корисни и штетни; на пример, секвенци на патогени (предизвикувачки болести), производство на токсини. Барањето информации од вештачката интелигенција за зајакнување на опасните патогени или дизајнирање на штетни биолошки агенси е неетички и незаконски на повеќето места.

  • Не поставувајте опасни барања за двојна употреба.
  • Следете ги упатствата на одборот за биосигурност (IBC) на вашата институција.

3. Научен интегритет

Сè што видовме во претходните единици се спојува овде: нема лажна атрибуција, без разубавување на податоците, без хакирање p, без селективно известување. Вештачката интелигенција може да ги направи овие полесни или потешки; Разликата е во вашата искреност.

  • Пријавете ги сите резултати (вклучувајќи ги и негативните).
  • Објави употреба на вештачка интелигенција.
  • Поддржете ја репродуктивноста со споделување необработени податоци и код (ако е можно).

4. Пристрасност и правичност

Моделите со вештачка интелигенција носат пристрасност на податоците за кои се обучени. Геномските бази на податоци претежно доаѓаат од популации со европско потекло; ова води до послаби предвидувања кај другите популации. Моделот на слика може да работи лошо во состојба која е недоволно претставена во податоците за обуката.

  • Прашајте за која популација/податоци беше обучен моделот.
  • Оценете дали резултатите стојат во сите групи.
Совет: Запрашајте се: „Ако му ги дадам овие податоци на моделот, кому му припаѓаат и дали тоа лице даде дозвола?“ Ако одговорот е нејасен, не го давајте. Прекршувањето на доверливоста е неповратно.

Чекор по чекор: одговорна контрола на вештачката интелигенција

  1. Класифицирајте го изворот на податоци: Личен/чувствителен или јавен?
  2. Проверете ја согласноста и дозволите: Дали е покриена оваа употреба?
  3. Изберете ја вистинската алатка: Безбедна/матична средина за чувствителни податоци.
  4. Размислете за ризикот од двојна употреба.
  5. Пристрасност на прашањето: Дали резултатот важи во сите групи?
  6. Документирајте и прогласете за употреба.

Шаблони за копирање на брзините

Прегледајте го мојот план за анализа подолу од етичка перспектива: наведете предупредувања во врска со доверливоста на податоците, согласноста на учесниците, потенцијалната пристрасност и ризикот од двојна употреба. План: [текст] (Забелешка: НЕ споделувам вистински податоци за пациентот, само план.)

На кои прашања за приватност и согласност треба да одговорам пред да ја користам оваа геномска база на податоци? Се подготвува листа за проверка во однос на KVKK/GDPR и етичкиот комитет.

Како треба транспарентно да ја пријавам алатката за вештачка интелигенција што ја користам во делот за методи на мојата статија? Напиши пример декларативна реченица; какви информации (алатка, верзија, опсег на употреба) треба да содржи?

Како да проценам дали резултатите од овој модел имаат пристрасност на населението? Наведете ги прашањата што треба да ги поставам за податоците за обуката и чекорите за проверка.

Слаб промпт / Силен промпт

Слаб: „Анализирај ги следните генетски податоци на пациентот: [вистински податоци]“.

Ѓучлу: „Поставувам план за анализа што работи со клинички геномски податоци, но не споделувам вистински податоци за пациентите. Само од методолошка перспектива: какви мерки за доверливост треба да преземам, во кое опкружување треба да ги обработувам податоците, кои услови на одобрување и етички комитет треба да ги исполнувам? Можете да го прикажете протокот со лажни/примерок податоци“.

Разлика: Во моќниот промпт не се споделуваат вистински чувствителни податоци; Се прашува само методот. Приватноста се одржува, моделот сè уште помага.

три мини футроли

Случај 1 - Прекршување на приватноста: Истражувач ги залепи, според него, анонимните податоци од егзомот на пациентот во отворен модел за да ги анализира. Кога етичкиот комитет дознал за ова, студијата била суспендирана; Немаше договор за обработка на податоци. Поука: чувствителните податоци никогаш не влегуваат во отворениот модел.

Случај 2 - Пристрасност на населението: Алатката за резултат за полигенски ризик беше обучена за податоци од европско потекло; Кај друга популација, проценките за ризик беа значително неточни. Кога моделот предложи да се преиспита составот на податоците за обуката, тимот одлучи да не ја користи алатката во таа популација. Поука: пристрасноста спасува или штети животи.

Случај 3 - Обелоденување и транспарентност: Тим напиша код за чистење на податоците со вештачка интелигенција и јасно го наведе ова во делот за методи; Ја сподели и шифрата. Рецензентите го поздравија ова бидејќи повторливоста беше силна. Поука: транспарентноста раѓа доверба.

споредбена табела

област

безбедно однесување

ризично однесување

податоци за пациентот

Локална/безбедна средина

Залепете за да го отворите моделот

согласност

Користете во рамките на опсегот

Не го надминувајте опсегот

Биосигурност

Избегнување на двојна употреба

опасна побарувачка

интегритет

Пријавете ги сите резултати

селективно известување

пристрасност

Прашајте ја популацијата

Нанесете слепо

транспарентност

Декларирајте за употреба

криење

Вообичаени грешки

  • Давање чувствителни податоци на отворениот модел: Неповратно нарушување на приватноста.
  • Надминување на опсегот на согласност: Употребата не е овластена од учесникот.
  • Игнорирање на пристрасност: Генерализирање на резултатите за сите групи.
  • Прикривање на употреба: Не пријавување придонес за вештачка интелигенција.
  • Одбрана „предложен модел“: Припишување одговорност на возилото.
Внимание: во биолошката работа со високи последици (клиничка одлука, биосигурност, податоци за луѓето) излезот од вештачката интелигенција не е замена за компетентна стручна проверка и етички надзор; само го забрзува. Крајната одговорност секогаш лежи на човечкото суштество, заедно со етичките и научните последици од одлуката.

Животна средина, екологија и традиционално знаење

Етичката одговорност не е ограничена на човечки податоци. Потребна е претпазливост и при користење на вештачка интелигенција во екологијата и биологијата за зачувување. На пример, прецизните податоци за локација (координати на стапицата на камерата) на загрозен вид се чувствителни поради ризикот од ловокрадство; Објавувањето на овие податоци на отворен модел или јавност може да му наштети на видот. Слично на тоа, етичките и правните прашања (како што е Протоколот од Нагоја) се јавуваат кога традиционалното биолошко знаење на локалните заедници (на пр. употребата на растение) се користи без дозвола. Пред да ги користите податоците, „кому му припаѓаат овие информации и кој би бил оштетен од нивното објавување?“ Секогаш поставувајте го прашањето.

Човечки надзор и конечна одлука

Суштината на целиот овој модул се сведува на еден принцип: значаен човечки надзор. ВИ произведува предлог, пишува нацрт, покажува шема; Но, биолошката, клиничката или етичката одлука никогаш не се заснова директно на излезот од моделот. Особено во областите со висок ризик (дијагноза, третман, одлука за зачувување на видовите, ослободување), улогата на моделот не е да донесува одлуки, туку да ја забрза одлуката на експертот. Пристапот „човек-во-јамка“ не е слоган, туку неопходност.

За да функционира овој надзор, надзорникот мора да биде компетентен. Слепата согласност („рече модел, прифаќање“) не е превид. Вистинскиот надзор бара експертиза која може да го доведе во прашање резултатот, да ја открие неговата грешка и да ја отфрли кога е потребно. Затоа, вештачката интелигенција не го заменува експертот; Тоа го прави експертот уште понезаменлив. Оној кој најдобро го користи возилото е оној кој најдобро може да го контролира.

Сумирано

Одговорната употреба на вештачката интелигенција во биологијата опфаќа четири области: приватност на податоците (заштита на чувствителни човечки податоци), биосигурност (избегнување двојна употреба), научен интегритет (чесно и целосно известување) и свесност за пристрасност (валидност на резултатите кај сите групи). Не давајте чувствителни податоци на отворениот модел, прогласете ја употребата транспарентно, доведувајте во прашање пристрасноста на населението. Етичката одговорност никогаш не може да се делегира на агентот; Секогаш е кај луѓето.

Задача за апликација

Размислете за сценарио од вашиот сопствен работен простор (на пр., користење на човечка база на податоци или модел на слика). Нека вештачката интелигенција излезе со етичкиот список за проверка на ова сценарио (доверливост, согласност, пристрасност, двојна употреба, транспарентност) без споделување вистински податоци. За секоја ставка, означете ја како „соодветна/ризична/неизвесна“ во вашата ситуација и напишете акционен план за оние кои се ризични/неизвесни. Исто така, изгответе изјава за употреба на вештачка интелигенција за вашата статија.

листа за проверка

  • [ ] Не дадов чувствителни/лични податоци на отворениот модел.
  • [ ] Го проверив опсегот на согласноста и етичкиот комитет.
  • [ ] Го проценив ризикот од двојна употреба/биосигурност.
  • [ ] Искрено ги пријавив сите резултати.
  • [ ] Се сомневав во пристрасноста на населението/податоците.
  • [ ] Транспарентно се изјаснив за употреба на вештачка интелигенција и презедов одговорност.

Модул испит

1. Еден студент го праша јазичниот модел „колку жици има во оваа датотека FASTA?“ прашува тој и манекенката одговара „48“. Кој е најправилниот пристап?

  • А) Директно користејќи го бројот 48 даден од моделот; Моделот е сигурен затоа што ја гледа датотеката
  • Б) Побарајте го бројот уште еднаш и прифатете го како точен ако двата одговори се исти
  • В) Читање на датотеката со Biopython, броење на бројот на секвенци со код и користење на излезот ✔
  • Г) Рачно отворање на датотеката и броење со очна одлука

Објаснување: Детерминистичките задачи како што се броење и мерење треба да се препуштат на кодот што го извршувате, а не на јазичниот модел. Моделот не го „памти“ бројот, тој произведува веројатна вредност и може да биде погрешен; Броењето со алатка како Biopython дава точни и репродуктивни резултати.

2. Сакате да броите ќелии во микроскопска слика и да ја измерите површината на секоја од нив. Кој е најсоодветниот пристап за оваа задача?

  • А) Користење на експертска алатка за сегментација како Cellpose/StarDist и рачно потврдување на резултатот ✔
  • Б) Залепете ја сликата во општиот јазичен модел и прашајте „колку ќелии има“
  • В) Опишете ја сликата на моделот и побарајте проценет број
  • Г) Прифаќање на бројот на пиксели како број на ќелии без калибрација

Објаснување: Сегментацијата и мерењето на клетките не се домен на општиот јазичен модел, туку на специјализирани модели на слики (Cellpose, StarDist) специјално обучени за оваа задача. Јазичниот модел го пишува кодот што ги повикува овие алатки; Експертскиот модел го прави мерењето, а биологот го потврдува резултатот.

3. Еден дипломиран студент додава 8 извори произведени од јазичниот модел во воведот на неговата теза. Консултантот открива дека 3 од нив воопшто не постојат. Како можеше да се спречи оваа ситуација?

  • А) Со барање од моделот уште еднаш да произведе ресурси
  • Б) Со избирање само на наводите со DOI (ако има DOI, тоа е реално)
  • В) Барање на списокот со инструкции на моделот да „се вклопи“
  • Г) Независно потврдување на секој цитат на PubMed/doi.org и наведување само на написите што ги прочитал ✔

Објаснување: Општите јазични модели не се база на податоци за литература; Наместо да бара вистински записи, тој „генерира“ атрибуции со реалистичен звук (фабрикувана атрибуција). Секоја линија и DOI не треба да се користат без независна потврда во извори како што се PubMed/doi.org и само со цитирање на написи што се навистина прочитани.

4. Кој е најмоќниот начин да се обезбеди точност на кодот за чистење на податоците напишан од вештачката интелигенција?

  • А) Ако кодот работи без грешки, прифатете го како точен.
  • Б) Тестирање на резултатот со мал познат примерок и потврдување на очекувањата со тврдење ✔
  • В) Прашајте го моделот „дали кодот е точен?“ прашувајќи и верувајќи во одговорот „да“
  • Г) Стартувај го кодот неколку пати и добивај го истиот излез секој пат

Забелешка: Само затоа што кодот работи без грешки не значи дека е точен; „погрешен код кој работи без грешки“ е најопасната ситуација во биологијата. Тестирањето со мал примерок чиј резултат однапред го знаете и вметнувањето на очекувањата во кодот со тврдење е најсилниот штит од тивки погрешни резултати.

5. Во анализата на RNA-seq, 20.000 гени се тестирани и 3.800 гени се откриени дека се „значајни“ со p<0,05 без корекција. Кој е главниот проблем со овој заклучок?

  • А) Бројот на примероци е превисок, треба да се намали
  • Б) прагот на p е превисок, требаше да се користи 0,10
  • В) Корекција на повеќекратна споредба (FDR) не беше извршена; Има многу лажни позитиви ✔
  • Г) Требаше да се тестираат примероци наместо гени

Објаснување: Кога тестирате илјадници гени истовремено, многу гени случајно изгледаат „значајни“, дури и ако нема вистинска разлика; Ова се нарекува проблем со повеќекратна споредба. Решението е да се примени FDR (стапка на лажни откритија) корекција со метод како што е Бенџамини-Хохберг; Со корекција, списокот обично се намалува на десетици до неколку стотици гени.

6. Најдобриот натпревар во резултатот BLAST има Е-вредност од 2,0. Што значи ова?

  • А) Натпреварот е најверојатно случаен; ✔ не е сигурен натпревар
  • Б) Спојката е многу силна; Колку е поголема е-вредноста, толку подобро
  • В) Секвенцата се совпаѓа со стапка од 2%
  • Г) Има 2 бази разлика помеѓу двете секвенци

Објаснување: Е-вредноста означува очекување совпаѓањето да биде случајно; Подобро е да си мал. Е-вредноста поголема од 1 покажува дека совпаѓањето е најверојатно случајно. За сигурни натпревари, генерално се бараат многу мали прагови како e < 1e-5.

7. Во моделот AlphaFold, терминалниот регион на протеинот покажува низок резултат на pLDDT (<50). Како треба да се толкува овој регион?

  • А) AlphaFold направи грешка во овој регион, регионот треба да се отстрани од анализата
  • Б) Овој регион е дефинитивно алфа спирала
  • В) Моделот е целосно несигурен, структурата не треба да се користи
  • Г) Регионот е веројатно неправилен/еластичен; треба да се толкува како „нејасно“ наместо „неточно“ ✔

Опис: pLDDT е локален резултат на доверба за секоја амино киселина; Вредностите под 50 често одразуваат навистина неправилни (флексибилни, нефиксни) региони. Погрешно е автоматски да се бришат овие региони како „погрешни претпоставки“; Ниската оценка треба да се чита како „неизвесна/флексибилна“ и треба да се оцени неговото биолошко значење.

8. Истражувач ги пријавува областите на клетките само во пиксели и резултатите не се во согласност со литературата. Кој е чекорот што недостасува?

  • А) Требаше да се избројат повеќе клетки
  • Б) Калибрацијата на скалата (конверзија од пиксел во микрометар) не беше извршена, резултатите не беа претворени во физички единици ✔
  • В) Алатката за сегментирање е погрешно избрана
  • Г) Резолуцијата на сликата е превисока

Објаснување: Калибрацијата на скалата (колку микрометри по пиксел) е од суштинско значење за да се извлече физичката големина од сликата. Ако овој чекор се прескокне, вредностите остануваат неспоредливи, во зависност од поставката на микроскопот. Областите мора да се претворат во физички единици како што се квадратни микрометри.

9. Ученик зема 10 примероци од ткиво од еден глушец и користи 'n=10' во статистиката. Зошто е ова неточно?

  • А) 10 примероци се премалку за статистика, потребни се најмалку 30
  • Б) Требаше да се земат примероци од ткиво од различни органи
  • В) Овие 10 примери се технички повторувања; биолошкото n е сè уште 1, ова е таканареченото повторување ✔
  • Г) Мострите се невалидни бидејќи се земени истиот ден

Објаснување: Повторените мерења земени од ист поединец се технички повторувања; каде што статистичкото n е бројот на биолошки единици (тука глувци). Сметањето на техничкото повторување како биолошко (псевдорепликација) произведува лажно значење. Правилниот дизајн значи работа со повеќе поединци.

10. Една анализа е пронајдена p=0,03. Кое е правилното толкување на оваа вредност?

  • А) Постои 3% шанса да се види овој или поекстремен резултат кога во реалноста нема разлика ✔
  • Б) Веројатноста ефектот да биде реален е 97%
  • В) Веројатноста нултата хипотеза да биде вистинита е 3%
  • Г) Резултатот е 97% повторлив

Објаснување: p-вредноста не е „веројатност дека хипотезата е вистинита“ или „веројатност дека ефектот е вистинит“. P-вредноста е веројатноста да се види разлика како или поекстремна од онаа што се забележува кога всушност нема разлика. Затоа, p=0,03 не значи „ефектот е 97% реален“; резултатите исто така треба да се проценат според големината на ефектот и интервалот на доверба.

11. Во презентација, разликата од 3% помеѓу две групи е прикажана како огромна со компресирање на y-оската до опсегот 95-100. За што е ова пример?

  • А) Добра техника на визуелизација; ја истакнува разликата
  • Б) Проблем со палета на пријателски слепи за боја
  • В) Прифатлив стилски избор
  • Г) погрешна и нечесна табела што ја преувеличува разликата со скратената оска ✔

Објаснување: Не иницијализирањето на оската од нула (скратената оска) го доведува гледачот во заблуда со визуелно преувеличување на мала разлика. Ова е кршење на принципот на чесност; Особено во столбест дијаграмите, оската треба да започне од нула и разликата треба да се прикаже со нејзината вистинска големина.

12. Истражувач ги залепува оние што мисли дека се анонимни податоци од егзомот на пациентот во модел на јавен јазик за да се анализираат. Зошто ова однесување е проблематично?

  • А) Нема проблем; податоците може да се споделат ако се анонимни
  • Б) Обезбедувањето чувствителни податоци за пациентот на отворен модел е кршење на приватноста и етичко/правно (KVKK/GDPR) и не може да се поништи ✔
  • В) Тоа е проблематично само затоа што анализата ќе биде бавна
  • Г) Моделот е проблематичен бидејќи не може да ги разбере податоците

Опис: Генетските/клиничките податоци на пациентот се исклучително чувствителни; Дури и геномските податоци за кои се смета дека се анонимни може повторно да се идентификуваат. Давањето на овие податоци на јавен модел ги прекршува одобренијата на KVKK/GDPR и етичкиот комитет (IRB) и претставува неповратно нарушување на приватноста. Чувствителните податоци треба да се обработуваат во локални/безбедни, договорени средини.

13. Во една студија, разликата што тие мислеа дека е „пациент наспроти контрола“ всушност се должи на обработувањето на примероците во два различни дена. Како се нарекува оваа ситуација и како се справува?

  • А) Тоа е надворешен ефект; точките треба да се избришат
  • Б) Тоа е недостаток на нормализација; доволна е само корекција на скалата
  • В) Тоа е сериски ефект; треба да биде избалансиран во дизајнот и да се додаде на моделот како сериска променлива ✔
  • Г) p-хакирање; тестот треба да се смени

Објаснување: Техничката разлика поради земање примероци/ден на обработка се нарекува сериски ефект и може да се помеша со биолошката разлика. Точниот пристап е да се избалансираат сериите во дизајнот и да се додаде променливата на сериите на статистичкиот модел (на пр. '~серија + состојба'), со што се одвојува техничкиот сигнал од биолошкиот сигнал.

14. Сакате да го пресметате односот GC на ДНК секвенца. Кој е правилен и повторлив пристап?

  • А) Испечатете го кодот што ја пресметува стапката на GC со Biopython, стартувајте го и користете го излезот ✔
  • Б) Дајте му на моделот низата и замолете го вербално да ја каже стапката на GC
  • В) Потврдување на односот даден од моделот од друг модел
  • Г) Гледање на првите 100 букви од серијата и погодување со око

Објаснување: стапката на GC е детерминистичка пресметка; треба да се заснова на кодот што ја обработува низата, а не на вредност што јазичниот модел „ја памети“. Наместо моделот да го пресметува, печатењето на пресметковниот код со алатка како Biopython и извршувањето на истиот ќе обезбеди точен излез што го дава истиот резултат секогаш кога ќе го извршите.