единица 11 / 11

Етика, биосигурност, поверителност и научна почтеност

Печалби:

  • Възможност за защита на чувствителни човешки/генетични данни в съответствие с KVKK, GDPR и правилата на комисията по етика и избягване на предоставянето им на отворения модел
  • Способност да се постави под въпрос валидността на резултатите чрез оценка на рисковете от биосигурност/двойна употреба и пристрастност на населението
  • Разбиране, че етичната отговорност не може да бъде делегирана на превозното средство и че е необходим смислен човек в цикъла

Силното използване на изкуствения интелект в биологията се допълва от отговорното му използване. Биологията е чувствителна област, която засяга човешкото здраве, генетичната поверителност, околната среда и дори биосигурността. В този раздел ще обсъдим етичните, правните и свързаните със сигурността отговорности, с които ще се сблъскате, когато използвате изкуствен интелект в биологични изследвания. Тази част е рамка, изградена на принципите на проверка и честност във всички предишни части.

Основен принцип: AI е инструмент; Етичната отговорност винаги е на хората. „Предложеният модел“ не е оправдание.

Четири области на отговорност

1. Поверителност на данните и човешки данни

Генетичните, клиничните или здравните данни от човешки участници са изключително чувствителни. ДНК последователността на дадено лице може да разкрие риска от заболяването и самоличността на него и на неговите роднини; Дори геномни данни, смятани за анонимни, могат да бъдат повторно идентифицирани. Поставянето на тези данни в публично достъпен AI модел може да наруши законите за защита на данните (KVKK в Турция, GDPR в Европа) и одобренията на борда по етика (IRB/комитет по етика).

  • Не предоставяйте лични/клинични данни на отворения модел.
  • Избягвайте използването извън обхвата на съгласието; С какво се е съгласил участникът?
  • Изберете корпоративни/локални (локални) или договорни инструменти за обработка на данни.

2. Биозащита и двойна употреба

Част от биологичната информация е с „двойна употреба“: тя може да бъде както полезна, така и вредна; например патогенни (причиняващи заболяване) последователности, производство на токсини. Искането на AI за информация за подобряване на опасни патогени или проектиране на вредни биологични агенти е неетично и незаконно на повечето места.

  • Не правете опасни заявки за двойна употреба.
  • Следвайте указанията на съвета по биобезопасност (IBC) на вашата институция.

3. Научна почтеност

Всичко, което видяхме в предишните модули, се събира тук: без фалшиво приписване, без разкрасяване на данни, без p-хакване, без селективно отчитане. Изкуственият интелект може да ги направи по-лесни или по-трудни; Разликата е във вашата честност.

  • Докладвайте всички резултати (включително отрицателните).
  • Декларирайте използването на изкуствен интелект.
  • Поддържайте възпроизводимост чрез споделяне на необработени данни и код (ако е възможно).

4. Пристрастност и справедливост

AI моделите носят отклонения на данните, върху които са обучени. Геномните бази данни идват предимно от популации от европейски произход; това води до по-лоши прогнози в други популации. Модел на изображение може да работи лошо в състояние, което е недостатъчно представено в данните за обучение.

  • Попитайте върху каква популация/данни е обучен моделът.
  • Оценете дали резултатите са валидни за всички групи.
Съвет: Запитайте се: „Ако дам тези данни на модела, на кого принадлежат и дали този човек е дал разрешение?“ Ако отговорът е неясен, не го давайте. Нарушаването на поверителността е необратимо.

Стъпка по стъпка: отговорен AI контрол

  1. Класифицирайте източника на данни: личен/чувствителен или обществен?
  2. Проверете съгласието и разрешенията: Покрито ли е това използване?
  3. Изберете правилния инструмент: Сигурна/родна среда за чувствителни данни.
  4. Помислете за риска от двойна употреба.
  5. Пристрастност на въпроса: Резултатът валиден ли е във всички групи?
  6. Документирайте и декларирайте употребата.

Копируеми шаблони за подкана

Прегледайте моя план за анализ по-долу от етична гледна точка: избройте предупрежденията по отношение на поверителността на данните, съгласието на участниците, потенциалните пристрастия и риска от двойна употреба. План: [текст] (Забележка: НЕ споделям действителни данни за пациентите, а само плана.)

На какви въпроси за поверителност и съгласие трябва да отговоря, преди да използвам този набор от геномни данни? Изготвя се контролен лист по отношение на KVKK/GDPR и комисията по етика.

Как трябва прозрачно да декларирам инструмента за изкуствен интелект, който използвам в раздела за методите на моята статия? Напишете примерно декларативно изречение; каква информация (инструмент, версия, обхват на използване) трябва да съдържа?

Как да преценя дали резултатите от този модел имат пристрастие към населението? Избройте въпросите, които трябва да задам относно данните за обучението и стъпките за проверка.

Слаба подкана / Силна подкана

Слаб: „Анализиране на следните генетични данни на пациента: [реални данни].“

Güçlü: „Създавам план за анализ, който работи с клинични геномни данни, но не споделям реални данни за пациенти. Само от методологична гледна точка: какви мерки за поверителност трябва да взема, в каква среда трябва да обработвам данните, на какво одобрение и на условията на комитета по етика трябва да отговарям? Можете да покажете потока с фиктивни/пробни данни.“

Разлика: В мощната подкана не се споделят действителни чувствителни данни; Пита се само методът. Поверителността се запазва, моделът все още помага.

три мини калъфа

Случай 1 — Нарушаване на поверителността: Изследовател постави това, което смяташе за анонимни данни от екзома на пациента, в отворен модел, за да бъде анализиран. Когато комисията по етика научи за това, проучването беше спряно; Нямаше споразумение за обработка на данни. Урок: чувствителните данни никога не влизат в отворения модел.

Случай 2 — Пристрастност на популацията: Инструмент за оценка на полигенен риск беше обучен на данни от европейски произход; В друга популация оценките на риска са значително неточни. Когато моделът предложи да се постави под въпрос съставът на данните за обучението, екипът реши да не използва инструмента в тази популация. Урок: предубеждението спасява или вреди на живота.

Случай 3 — Разкриване и прозрачност: Екип написа код за почистване на данни с AI и посочи това ясно в раздела за метода; Той също сподели кода. Рецензентите приветстваха това, защото повторяемостта беше силна. Урок: прозрачността поражда доверие.

сравнителна диаграма

площ

безопасно поведение

рисково поведение

данни за пациента

Локална/сигурна среда

Поставете, за да отворите модела

съгласие

Използвайте в обхвата

Не превишавайте обхвата

Биозащита

Избягване на двойна употреба

опасно търсене

почтеност

Докладвайте всички резултати

селективно отчитане

пристрастие

Запитайте населението

Нанесете на сляпо

прозрачност

Декларирайте употреба

криейки се

Често срещани грешки

  • Предоставяне на чувствителни данни на отворения модел: Необратимо нарушение на поверителността.
  • Превишаване на обхвата на съгласието: Използването не е разрешено от участника.
  • Пренебрегване на пристрастия: Обобщаване на резултатите за всички групи.
  • Скриване на употреба: Не се декларира принос на AI.
  • Защита „предложен модел“: приписване на отговорност на превозното средство.
Внимание: При биологична работа с големи последствия (клинично решение, биобезопасност, данни за хора) резултатите от ИИ не са заместител на компетентна експертна проверка и етичен надзор; само го ускорява. Крайната отговорност винаги е на човешкото същество, заедно с етичните и научни последици от решението.

Околна среда, екология и традиционни знания

Етичната отговорност не се ограничава до човешки данни. Необходимо е също така повишено внимание при използването на изкуствен интелект в екологията и консервационната биология. Например точните данни за местоположението (координати на камерата) на застрашен вид са чувствителни поради риска от бракониерство; Пускането на тези данни на отворен модел или общественост може да навреди на вида. По подобен начин възникват етични и правни (като Протокола от Нагоя) проблеми, когато традиционните биологични познания на местните общности (напр. използването на растение) се използват без разрешение. Преди да използвате данните, "на кого принадлежи тази информация и кой би бил ощетен от нейното разкриване?" Винаги задавайте въпроса.

Човешки контрол и окончателно решение

Същността на целия този модул се свежда до един принцип: смислен човешки надзор. AI произвежда предложение, пише чернова, показва модел; Но едно биологично, клинично или етично решение никога не се основава директно на резултата от модела. Особено в зони с висок риск (диагностика, лечение, решение за опазване на вида, освобождаване), ролята на модела не е да взема решения, а да ускорява решението на експерта. Подходът "човек в цикъла" не е лозунг, а необходимост.

За да работи това наблюдение, ръководителят трябва да е компетентен. Сляпото съгласие („модел каза, приемане“) не е надзор. Истинският надзор изисква експертни познания, които могат да поставят под съмнение резултата, да уловят грешката му и да го отхвърлят, когато е необходимо. Следователно изкуственият интелект не замества експерта; Това прави експерта още по-незаменим. Този, който използва превозното средство най-добре, е този, който може да го контролира най-добре.

В обобщение

Отговорното използване на AI в биологията обхваща четири области: поверителност на данните (защита на чувствителни човешки данни), биосигурност (избягване на двойна употреба), научна почтеност (честно и пълно докладване) и предубеденост (валидност на резултатите във всички групи). Не предоставяйте чувствителни данни на отворения модел, декларирайте употребата прозрачно, поставяйте под въпрос пристрастията на населението. Етичната отговорност никога не може да бъде делегирана на агента; Винаги е в хората.

Задача за приложение

Обмислете сценарий от собственото си работно пространство (напр. използване на човешки набор от данни или модел на изображение). Накарайте AI да изготви етичния списък за този сценарий (поверителност, съгласие, пристрастия, двойна употреба, прозрачност), без да споделяте реални данни. За всеки елемент го маркирайте като „подходящ/рисков/несигурен“ във вашата ситуация и напишете план за действие за тези, които са рискови/несигурни. Също така направете декларация за използване на AI за вашата статия.

контролен списък

  • [ ] Не предоставих чувствителни/лични данни на отворения модел.
  • [ ] Проверих обхвата на съгласието и комисията по етика.
  • [ ] Направих оценка на риска за двойна употреба/биологична сигурност.
  • [ ] Докладвах всички резултати честно.
  • [ ] Поставих под въпрос пристрастието на населението/данните.
  • [ ] Декларирах прозрачно използването на изкуствен интелект и поех отговорност.

Изпит по модул

1. Студент попита езиковия модел „колко низа има в този FASTA файл?“ пита той и моделът отговаря „48“. Кой е най-правилният подход?

  • A) Директно използване на номер 48, даден от модела; Моделът е надежден, защото вижда файла
  • Б) Попитайте още веднъж числото и го приемете за правилно, ако двата отговора са еднакви
  • C) Четене на файла с Biopython, преброяване на броя на последователностите с код и използване на изхода ✔
  • Г) Отваряне на файла ръчно и броене с решение на око

Обяснение: Детерминистичните задачи като броене и измерване трябва да бъдат оставени на кода, който изпълнявате, а не на езиковия модел. Моделът не „помни“ числото, той произвежда вероятностна стойност и може да бъде сгрешен; Преброяването с инструмент като Biopython дава точни и възпроизводими резултати.

2. Искате да преброите клетките в микроскопско изображение и да измерите площта на всяка. Какъв е най-подходящият подход за тази задача?

  • A) Използване на експертен инструмент за сегментиране като Cellpose/StarDist и ръчна проверка на резултата ✔
  • B) Поставете изображението в общия езиков модел и попитайте „колко клетки има“
  • C) Опишете изображението на модела и поискайте приблизителен брой
  • D) Приемане на броя на пикселите като броя на клетките без никакво калибриране

Обяснение: Сегментирането и измерването на клетки не е домейн на общия езиков модел, а на специализирани модели на изображения (Cellpose, StarDist), специално обучени за тази задача. Езиковият модел пише кода, който извиква тези инструменти; Експертният модел прави измерването, а биологът проверява резултата.

3. Завършил студент добавя 8 източника, създадени от езиковия модел, към въведението на дипломната си работа. Консултантът установява, че 3 от тях изобщо не съществуват. Как може да се предотврати тази ситуация?

  • A) Като поискате от модела да произведе ресурси отново
  • B) Като изберете само цитатите с DOI (ако има DOI, той е реален)
  • C) Изискване на списъка чрез инструктиране на модела да „пасне“
  • Г) Независима проверка на всеки цитат в PubMed/doi.org и цитиране само на статиите, които е прочел ✔

Обяснение: Общите езикови модели не са литературна база данни; Вместо да търси реални записи, той „генерира“ реалистично звучащи приписвания (измислено приписване). Всеки авторски ред и DOI не трябва да се използват без независима проверка в източници като PubMed/doi.org и само цитиране на статии, които действително са били прочетени.

4. Кой е най-мощният начин да се гарантира точността на код за почистване на данни, написан от изкуствен интелект?

  • A) Ако кодът работи без грешки, приемете го за правилен.
  • B) Тестване на резултата с малка известна извадка и проверка на очакването с assert ✔
  • C) Попитайте модела „правилен ли е кодът?“ питам и се доверявам на отговора "да"
  • Г) Стартирайте кода няколко пъти и всеки път получавайте един и същ резултат

Забележка: Това, че кодът работи без грешки, не означава, че е правилен; „грешен код, работещ без грешки“ е най-опасната ситуация в биологията. Тестването с малка извадка, чийто резултат знаете предварително, и вграждането на очакванията в кода с assert е най-силният щит срещу мълчаливите грешни резултати.

5. При RNA-seq анализ се тестват 20 000 гена и се установява, че 3 800 гена са „значими“ с p<0,05 без корекция. Какъв е основният проблем с това заключение?

  • A) Броят на пробите е твърде голям, трябва да бъде намален
  • B) p прагът е твърде висок, трябваше да се използва 0,10
  • C) Не е извършена корекция на множество сравнения (FDR); Има много фалшиви положителни резултати ✔
  • Г) Трябваше да се изследват проби вместо гени

Обяснение: Когато тествате хиляди гени едновременно, много гени изглеждат „значими“ случайно, дори и да няма реална разлика; Това се нарича проблем с множество сравнения. Решението е да се приложи FDR (коефициент на фалшиво откриване) корекция с метод като Benjamini-Hochberg; С корекция списъкът обикновено намалява до десетки до няколкостотин гени.

6. Най-доброто съвпадение в резултат на BLAST има E-стойност 2.0. какво значи това

  • A) Най-вероятно съвпадението е случайно; ✔ не е надеждно съвпадение
  • B) Съединителят е много силен; Колкото по-голяма е е-стойността, толкова по-добре
  • C) Последователността съвпада при процент от 2%
  • Г) Има 2 базови разлика между двете последователности

Обяснение: E-стойността показва очакването съвпадението да е случайно; По-добре е да си малък. e-стойност, по-голяма от 1, показва, че съвпадението най-вероятно е произволно. За надеждни съвпадения обикновено се търсят много малки прагове като e < 1e-5.

7. В модел AlphaFold, крайната област на протеина показва нисък pLDDT резултат (<50). Как трябва да се тълкува този регион?

  • A) AlphaFold направи грешка в този регион, регионът трябва да бъде премахнат от анализа
  • B) Този регион определено е алфа спирала
  • В) Моделът е напълно ненадежден, структурата не трябва да се използва
  • D) Регионът вероятно е неправилен/еластичен; трябва да се тълкува като „неясно“, а не като „невярно“ ✔

Описание: pLDDT е резултатът за локална достоверност за всяка аминокиселина; Стойностите под 50 често отразяват наистина неправилни (гъвкави, нефиксирани) региони. Погрешно е тези региони да се изтриват автоматично като „грешни предположения“; Ниският резултат трябва да се тълкува като „несигурен/гъвкав“ и трябва да се оцени биологичното му значение.

8. Изследовател отчита клетъчните площи само в пиксели и резултатите не са в съответствие с литературата. Коя е липсващата стъпка?

  • А) Трябваше да се преброят повече клетки
  • B) Калибрирането на мащаба (преобразуване от пиксел към микрометър) не е извършено, резултатите не са преобразувани във физически единици ✔
  • C) Инструментът за сегментиране е избран неправилно
  • D) Разделителната способност на изображението е твърде висока

Обяснение: Калибрирането на мащаба (колко микрометра на пиксел) е от съществено значение за извличане на физически размер от изображението. Ако тази стъпка се пропусне, стойностите остават несравними в зависимост от настройката на микроскопа. Площите трябва да бъдат преобразувани във физически единици като квадратни микрометри.

9. Студент взема 10 тъканни проби от една мишка и използва 'n=10' в статистиката. Защо това е неправилно?

  • А) 10 проби са твърде малко за статистика, необходими са поне 30
  • Б) Трябваше да се вземат тъканни проби от различни органи
  • В) Тези 10 примера са технически повторения; биологичното n все още е 1, това е така нареченото повторение ✔
  • Г) Пробите са невалидни, защото са взети в същия ден

Обяснение: Повтарящите се измервания, взети от едно и също лице, са технически повторения; където статистически n е броят на биологичните единици (тук мишки). Разглеждането на техническото повторение като биологично (псевдорепликация) произвежда фалшиво значение. Правилният дизайн означава работа с множество индивиди.

10. Един анализ установи р=0,03. Каква е правилната интерпретация на тази стойност?

  • A) Има 3% шанс да видите този или по-краен резултат, когато в действителност няма разлика ✔
  • B) Вероятността ефектът да е реален е 97%
  • В) Вероятността нулевата хипотеза да е вярна е 3%
  • D) Резултатът е 97% повторяем

Обяснение: p-стойността не е „вероятност, че хипотезата е вярна“ или „вероятност, че ефектът е верен“. P-стойността е вероятността разликата да бъде толкова голяма или по-голяма от наблюдаваната, когато всъщност няма разлика. Следователно p=0,03 не означава, че „ефектът е 97% реален“; резултатите също трябва да бъдат оценени по размер на ефекта и доверителен интервал.

11. В презентация разликата от 3% между две групи се показва като огромна чрез компресиране на оста y до диапазона 95-100. За какво е това пример?

  • A) Добра техника за визуализация; подчертава разликата
  • B) Проблем с палитрата, подходяща за далтонисти
  • В) Приемлив избор на стил
  • Г) Подвеждаща и нечестна диаграма, която преувеличава разликата с пресечената ос ✔

Обяснение: Неинициализиране на оста от нула (скъсена ос) подвежда зрителя чрез визуално преувеличаване на малка разлика. Това е нарушение на принципа на честността; Особено в лентовите диаграми оста трябва да започва от нула и разликата трябва да се показва с действителния й размер.

12. Изследовател поставя това, което смята за анонимни данни от екзома на пациента, в публичен езиков модел, за да бъдат анализирани. Защо това поведение е проблематично?

  • А) Няма проблем; данните могат да се споделят, ако са анонимни
  • B) Предоставянето на чувствителни данни за пациенти на отворен модел е нарушение на поверителността и етично/законово (KVKK/GDPR) и не може да бъде отменено ✔
  • В) Проблемно е само защото анализът ще бъде бавен
  • Г) Моделът е проблематичен, защото не може да разбере данните

Описание: Генетичните/клиничните данни на пациента са изключително чувствителни; Дори геномни данни, смятани за анонимни, могат да бъдат повторно идентифицирани. Предоставянето на тези данни на публичен модел нарушава KVKK/GDPR и одобренията на комитета по етика (IRB) и е необратимо нарушение на поверителността. Чувствителните данни трябва да се обработват в локални/сигурни, договорени среди.

13. В едно проучване разликата, която смятат за „пациент срещу контрола“, всъщност се дължи на това, че пробите се обработват в два различни дни. Как се нарича тази ситуация и как се процедира?

  • A) Това е ефектът на извънредните стойности; точките трябва да бъдат изтрити
  • Б) Това е липса на нормализация; достатъчна е само корекция на мащаба
  • C) Това е пакетният ефект; трябва да бъде балансиран в дизайна и добавен към модела като партидна променлива ✔
  • D) p-хакване; тестът трябва да се промени

Обяснение: Техническата разлика, дължаща се на партида за вземане на проби/ден на обработка, се нарича партиден ефект и може да бъде объркана с биологична разлика. Правилният подход е да се балансират партидите в дизайна и да се добави партидната променлива към статистическия модел (напр. „~ партида + условие“), като по този начин се отдели техническият сигнал от биологичния сигнал.

14. Искате да изчислите GC отношението на ДНК последователност. Кой е правилният и повторяем подход?

  • A) Отпечатайте кода, който изчислява скоростта на GC с Biopython, стартирайте го и използвайте изхода ✔
  • B) Дайте на модела последователността и го помолете да каже устно скоростта на GC
  • C) Потвърждаване на съотношението, дадено от модела, чрез друг модел
  • Г) Разглеждане на първите 100 букви от серията и отгатване по око

Обяснение: скоростта на GC е детерминистично изчисление; трябва да се базира на кода, който обработва масива, а не на стойност, която езиковият модел „помни“. Вместо моделът да го изчислява, отпечатването на изчислителния код с инструмент като Biopython и стартирането му сами ще осигури точен изход, който дава същия резултат всеки път, когато го стартирате.