одиниця 11 / 11

Етика, біозахист, конфіденційність і наукова чесність

Прибуток:

  • Можливість захищати конфіденційні людські/генетичні дані відповідно до KVKK, GDPR і правил комітету з етики та уникати їх передачі у відкриту модель
  • Здатність поставити під сумнів достовірність результатів шляхом оцінки ризиків біозахисту/подвійного використання та упередженості населення
  • Розуміння того, що етична відповідальність не може бути делегована транспортному засобу, і що необхідна значуща людина в циклі

Активне використання штучного інтелекту в біології доповнюється його відповідальним використанням. Біологія є чутливою сферою, яка стосується здоров’я людини, генетичної конфіденційності, навколишнього середовища та навіть біозахисту. У цьому розділі ми обговоримо етичні, правові та безпекові обов’язки, з якими ви зіткнетеся під час використання штучного інтелекту в біологічних дослідженнях. Цей підрозділ є структурою, побудованою на принципах перевірки та чесності у всіх попередніх підрозділах.

Основний принцип: AI — це інструмент; Етична відповідальність завжди лежить на людях. «Запропонована модель» — не виправдання.

Чотири зони відповідальності

1. Конфіденційність даних і людських даних

Генетичні, клінічні дані чи дані про стан здоров’я людей є надзвичайно чутливими. Послідовність ДНК людини може виявити ризик захворювання та особу людини та її родичів; Навіть геномні дані, які вважаються анонімними, можна повторно ідентифікувати. Вставлення цих даних у загальнодоступну модель штучного інтелекту може порушити закони про захист даних (KVKK у Туреччині, GDPR у Європі) та схвалення ради з етики (IRB/комітету з етики).

  • Не надавайте особисті/клінічні дані для відкритої моделі.
  • Уникайте використання поза межами згоди; На що дав згоду учасник?
  • Вибирайте корпоративні/локальні (локальні) або контрактні інструменти обробки даних.

2. Біозахист і подвійне використання

Деяка біологічна інформація має «подвійне використання»: вона може бути як корисною, так і шкідливою; наприклад, послідовності патогенів (хвороботворних), виробництво токсинів. Вимагати від штучного інтелекту інформацію про посилення небезпечних патогенів або розробку шкідливих біологічних агентів у більшості місць є неетичним і незаконним.

  • Не робіть небезпечні запити подвійного використання.
  • Дотримуйтеся вказівок ради з біобезпеки (IBC) вашої установи.

3. Наукова доброчесність

Усе, що ми бачили в попередніх розділах, поєднується тут: жодного фальшивого атрибуції, жодного прикрашання даних, жодного p-hacking, жодного вибіркового звітування. Штучний інтелект може зробити це легше чи складніше; Різниця у вашій чесності.

  • Повідомити про всі результати (включно з негативними).
  • Заяви про використання штучного інтелекту.
  • Підтримка відтворюваності шляхом обміну необробленими даними та кодом (якщо можливо).

4. Упередженість і справедливість

Моделі ШІ несуть упередження щодо даних, на яких вони навчаються. Геномні бази даних переважно походять від популяцій європейського походження; це призводить до гірших прогнозів в інших популяціях. Модель зображення може працювати погано в умовах, які недостатньо представлені в навчальних даних.

  • Запитайте, на якій сукупності/даних була навчена модель.
  • Оцініть, чи справедливі результати для всіх груп.
Порада. Запитайте себе: «Якщо я передам ці дані моделі, кому вони належать і чи дала ця особа дозвіл?» Якщо відповідь нечітка, не давайте її. Порушення конфіденційності є незворотним.

Крок за кроком: відповідальний контроль ШІ

  1. Класифікуйте джерело даних: особисте/конфіденційне чи публічне?
  2. Перевірте згоду та дозволи: чи це використання охоплено?
  3. Виберіть правильний інструмент: безпечне/власне середовище для конфіденційних даних.
  4. Враховуйте ризик подвійного використання.
  5. Упереджене запитання: Чи дійсний результат у всіх групах?
  6. Задокументуйте та задекларуйте використання.

Шаблони підказок, які можна копіювати

Перегляньте мій наведений нижче план аналізу з етичної точки зору: перелічіть застереження щодо конфіденційності даних, згоди учасників, потенційної упередженості та ризику подвійного використання. План: [текст] (Примітка: я НЕ ділюся фактичними даними пацієнтів, лише планом.)

На які запитання щодо конфіденційності та згоди я маю відповісти перед використанням цього набору геномних даних? Контрольний список підготовлено відповідно до KVKK/GDPR та комітету з етики.

Як мені прозоро оголосити інструмент штучного інтелекту, який я використовую, у розділі методів моєї статті? Напишіть приклад оповідального речення; яку інформацію (інструмент, версія, область використання) він повинен містити?

Як я можу оцінити, чи результати цієї моделі мають похибку сукупності? Перелічіть запитання, які я маю поставити щодо даних навчання та етапів перевірки.

Слабка підказка / Сильна підказка

Слабкий: «Проаналізуйте наступні генетичні дані пацієнта: [справжні дані]».

Гючлю: «Я створюю план аналізу, який працює з клінічними геномними даними, але я не передаю реальні дані пацієнтів. Лише з методологічної точки зору: яких заходів щодо конфіденційності я маю вжити, у якому середовищі я маю обробляти дані, яких умов схвалення та комітету з етики я маю виконати? Ви можете показати потік за допомогою фіктивних даних/даних зразків».

Відмінність: у потужному запиті фактичні конфіденційні дані не надаються; Запитується тільки метод. Конфіденційність зберігається, модель все ще допомагає.

три міні-чохла

Випадок 1. Порушення конфіденційності: дослідник вставив те, що він вважав анонімними даними екзома пацієнта, у відкриту модель для її аналізу. Коли комітет з етики дізнався про це, дослідження було призупинено; Угоди про обробку даних не було. Урок: конфіденційні дані ніколи не потрапляють у відкриту модель.

Випадок 2 — Популяційне зміщення: інструмент оцінки полігенного ризику був навчений на даних європейського походження; В іншій популяції оцінки ризику були значно неточними. Коли модель запропонувала поставити під сумнів склад навчальних даних, команда вирішила не використовувати інструмент у цій популяції. Урок: упередженість рятує або шкодить життям.

Випадок 3 — Розкриття інформації та прозорість: команда написала код очищення даних за допомогою ШІ та чітко заявила про це в розділі методів; Він також поділився кодом. Рецензенти вітали це, оскільки повторюваність була високою. Урок: прозорість породжує довіру.

порівняльна таблиця

область

безпечна поведінка

ризикована поведінка

дані пацієнта

Місцеве/безпечне середовище

Вставити, щоб відкрити модель

згода

Використовувати в рамках

Не виходьте за рамки

Біозахист

Уникнення подвійного використання

небезпечний попит

цілісність

Повідомити про всі результати

вибіркова звітність

упередженість

Опитуйте населення

Застосовувати наосліп

прозорість

Задекларувати використання

ховаючись

Поширені помилки

  • Надання конфіденційних даних відкритій моделі: необоротне порушення конфіденційності.
  • Перевищення обсягу згоди: використання не дозволене учасником.
  • Ігнорування упередженості: узагальнення результатів для всіх груп.
  • Приховане використання: внесок ШІ не декларується.
  • Захист «запропонована модель»: приписування відповідальності транспортному засобу.
Застереження: у біологічній роботі з великими наслідками (клінічне рішення, біобезпека, дані про людину) результат ШІ не замінює компетентну експертну перевірку та етичний нагляд; це тільки прискорює його. Основна відповідальність завжди лежить на людині разом з етичними та науковими наслідками рішення.

Довкілля, екологія та традиційні знання

Етична відповідальність не обмежується даними про людину. Обережність також потрібна при використанні штучного інтелекту в екології та природоохоронній біології. Наприклад, точні дані про місцезнаходження (координати фотопастки) виду, що перебуває під загрозою зникнення, є чутливими через ризик браконьєрства; Оприлюднення цих даних для відкритої моделі чи громадськості може завдати шкоди виду. Подібним чином етичні та правові (такі як Нагойський протокол) проблеми виникають, коли традиційні біологічні знання місцевих громад (наприклад, використання рослин) використовуються без дозволу. Перш ніж використовувати дані, «кому належить ця інформація і кому буде завдано шкоди її розкриттям?» Завжди ставте запитання.

Людський нагляд і остаточне рішення

Суть усього цього модуля зводиться до одного принципу: значущого людського контролю. ШІ створює пропозицію, пише чернетку, показує шаблон; Але біологічне, клінічне чи етичне рішення ніколи не ґрунтується безпосередньо на результатах моделі. Особливо в сферах високого ризику (діагностика, лікування, рішення про збереження видів, випуск), роль моделі полягає не в ухваленні рішень, а в прискоренні рішення експерта. Підхід «human-in-the-loop» — це не гасло, а необхідність.

Щоб це спостереження спрацювало, керівник має бути компетентним. Сліпа згода («модель сказана, прийняття») не є недоглядом. Справжній контроль вимагає досвіду, який може поставити під сумнів результат, виявити його помилку та відхилити його, якщо це необхідно. Тому штучний інтелект не замінює експерта; Це робить експерта ще більш незамінним. Той, хто найкраще використовує транспортний засіб, той може найкраще ним керувати.

Підсумовуючи

Відповідальне використання штучного інтелекту в біології охоплює чотири сфери: конфіденційність даних (захист конфіденційних даних людини), біозахист (уникнення подвійного використання), наукова чесність (чесне та повне звітування) та упередженість (валідність результатів для всіх груп). Не надавайте конфіденційні дані для відкритої моделі, прозоро декларуйте використання, ставте під сумнів упередженість населення. Етична відповідальність ніколи не може бути делегована агенту; Це завжди в людях.

Аплікаційне завдання

Розгляньте сценарій із власного робочого простору (наприклад, використовуючи набір даних людини або модель зображення). Нехай штучний інтелект розробить етичний контрольний список для цього сценарію (конфіденційність, згода, упередженість, подвійне використання, прозорість) без надання реальних даних. Для кожного пункту позначте його як «відповідний/ризикований/невизначений» у вашій ситуації та напишіть план дій для тих, які є ризикованими/невизначеними. Також підготуйте заяву про використання ШІ для вашої статті.

контрольний список

  • [ ] Я не надавав конфіденційні/особисті дані для відкритої моделі.
  • [ ] Я перевірив сферу дії комітету з питань згоди та етики.
  • [ ] Я оцінив подвійне використання/ризик біозахисту.
  • [ ] Я чесно повідомив про всі результати.
  • [ ] Я ставив під сумнів упередженість населення/даних.
  • [ ] Я прозоро заявив про використання штучного інтелекту та взяв на себе відповідальність.

Модульний екзамен

1. Студент запитав мовну модель «скільки рядків у цьому файлі FASTA?» запитує він, а модель відповідає «48». Який підхід найбільш правильний?

  • А) Безпосередньо використовуючи число 48, задане моделлю; Модель надійна, тому що бачить файл
  • B) Запитайте число ще раз і визнайте його правильним, якщо дві відповіді однакові
  • C) Читання файлу за допомогою Biopython, підрахунок кількості послідовностей із кодом і використання результату ✔
  • D) Відкриття файлу вручну та підрахунок на око

Пояснення: детерміновані завдання, такі як підрахунок і вимірювання, слід залишити коду, який ви запускаєте, а не мовній моделі. Модель не «запам’ятовує» число, вона виробляє ймовірнісне значення та може бути помилковою; Підрахунок за допомогою такого інструменту, як Biopython, дає точні та відтворювані результати.

2. Ви хочете порахувати клітини на зображенні під мікроскопом і виміряти площу кожної. Який підхід є найбільш прийнятним для цього завдання?

  • A) Використання експертного інструменту сегментації, наприклад Cellpose/StarDist, і перевірка результату вручну ✔
  • Б) Вставте зображення в загальну мовну модель і запитайте «скільки там комірок»
  • C) Опишіть зображення моделі та попросіть приблизну кількість
  • D) Прийняття кількості пікселів як кількості комірок без будь-якого калібрування

Пояснення: Сегментація та вимірювання клітин не є областю загальної мовної моделі, а спеціалізованих моделей зображень (Cellpose, StarDist), спеціально навчених для цього завдання. Модель мови пише код, який викликає ці інструменти; Експертна модель проводить вимірювання, а біолог перевіряє результат.

3. До вступу до дипломної роботи аспірант додає 8 джерел, створених мовною моделлю. Консультант виявляє, що 3 з них взагалі не існують. Як можна запобігти цій ситуації?

  • А) Попросивши модель ще раз створити ресурси
  • B) Вибираючи лише цитати з DOI (якщо DOI є, то це реально)
  • C) Запит списку шляхом вказівки моделі «відповідати»
  • D) Незалежно перевіряти кожне цитування на PubMed/doi.org і цитувати лише статті, які він прочитав ✔

Пояснення: загальні мовні моделі не є базою даних літератури; Замість того, щоб шукати справжні записи, він «генерує» реалістично звучачі атрибуції (сфабрикована атрибуція). Кожен рядок автора та DOI не слід використовувати без незалежної перевірки в таких джерелах, як PubMed/doi.org, і лише цитувати статті, які були фактично прочитані.

4. Який найпотужніший спосіб забезпечити точність коду очищення даних, написаного штучним інтелектом?

  • A) Якщо код працює без помилок, прийміть його як правильний.
  • B) Перевірка результату на невеликій відомій вибірці та перевірка очікування за допомогою assert ✔
  • C) Запитайте модель "чи правильний код?" запитувати та довіряти відповіді "так"
  • D) Запустіть код кілька разів і кожного разу отримуйте однаковий результат

Примітка: те, що код працює без помилок, не означає, що він правильний; "неправильний код працює без помилок" - це найнебезпечніша ситуація в біології. Тестування з невеликою вибіркою, результат якої ви знаєте заздалегідь, і вбудовування очікування в код за допомогою assert є найсильнішим захистом від мовчазних неправильних результатів.

5. Під час аналізу RNA-seq тестується 20 000 генів, і 3 800 генів виявляються «значущими» з p<0,05 без корекції. У чому головна проблема цього висновку?

  • А) Кількість зразків занадто велика, її слід зменшити
  • Б) поріг р занадто високий, слід було використовувати 0,10
  • C) Корекція множинного порівняння (FDR) не проводилася; Є багато помилкових спрацьовувань ✔
  • D) Замість генів слід перевіряти зразки

Пояснення: коли ви тестуєте тисячі генів одночасно, багато генів випадково виявляються «значущими», навіть якщо реальної різниці немає; Це називається проблемою множинного порівняння. Рішення полягає в тому, щоб застосувати корекцію FDR (швидкість помилкових відкриттів) за допомогою методу Бенджаміні-Хохберга; З виправленням список зазвичай скорочується до десятків-кількох сотень генів.

6. Найкращий збіг результату BLAST має E-value 2,0. Що це означає?

  • А) Збіг швидше за все випадковий; ✔ ненадійний збіг
  • Б) Зчеплення дуже міцне; Чим більше e-value, тим краще
  • C) Послідовність збігається зі швидкістю 2%
  • D) Між двома послідовностями існує різниця в 2 основи

Пояснення: E-значення вказує на те, що збіг буде випадковим; Краще бути маленьким. Електронне значення більше 1 означає, що відповідність, швидше за все, випадкова. Для надійних збігів зазвичай шукають дуже малі пороги, такі як e < 1e-5.

7. У моделі AlphaFold кінцева область білка має низький показник pLDDT (<50). Як інтерпретувати цей регіон?

  • A) AlphaFold зробив помилку в цій області, область має бути вилучена з аналізу
  • B) Ця область, безумовно, є альфа-спіраллю
  • В) Модель абсолютно ненадійна, конструкцію використовувати не слід
  • D) Область, ймовірно, нерівномірна/еластична; слід інтерпретувати як «незрозуміле», а не як «хибне» ✔

Опис: pLDDT є локальним достовірним показником для кожної амінокислоти; Значення нижче 50 часто відображають дійсно нерегулярні (гнучкі, нефіксовані) регіони. Неправильно автоматично видаляти ці регіони як «неправильні припущення»; Низький бал слід розглядати як «невизначений/гнучкий», і його біологічне значення слід оцінити.

8. Дослідник повідомляє про площі клітинок лише в пікселях, і результати не відповідають літературі. Якого кроку не вистачає?

  • А) Треба було порахувати більше клітинок
  • B) Калібрування масштабу (перетворення пікселів у мікрометри) не було виконано, результати не були перетворені у фізичні одиниці ✔
  • В) Інструмент сегментації вибрано неправильно
  • D) Роздільна здатність зображення занадто висока

Пояснення: калібрування масштабу (кількість мікрометрів на піксель) є важливою для виділення фізичного розміру із зображення. Якщо цей крок пропустити, значення залишаться непорівнянними, залежно від налаштувань мікроскопа. Площі необхідно конвертувати у фізичні одиниці, наприклад квадратні мікрометри.

9. Студент бере 10 зразків тканин від однієї миші та використовує «n=10» у статистиці. Чому це неправильно?

  • А) 10 зразків замало для статистики, потрібно щонайменше 30
  • Б) Треба було взяти зразки тканин з різних органів
  • C) Ці 10 прикладів є технічними повтореннями; біологічне n дорівнює 1, це так зване повторення ✔
  • D) Зразки недійсні, оскільки вони були взяті в той самий день

Пояснення: повторні вимірювання, зроблені в однієї особи, є технічними повторами; де статистичне n – кількість біологічних одиниць (тут мишей). Розгляд технічного повторення як біологічного (псевдореплікація) створює хибне значення. Правильний дизайн означає роботу з кількома людьми.

10. Один аналіз виявив р=0,03. Яка правильна інтерпретація цього значення?

  • A) Існує 3% ймовірності побачити цей чи більш екстремальний результат, хоча насправді немає різниці ✔
  • B) Імовірність реального ефекту становить 97%
  • В) Імовірність того, що нульова гіпотеза є істинною, становить 3%
  • D) Результат повторюється на 97%.

Пояснення: p-value не є «ймовірністю того, що гіпотеза є істинною» або «ймовірністю того, що ефект є істинним». P-значення – це ймовірність побачити різницю настільки ж або більш екстремальною, ніж спостерігається, коли різниці фактично немає. Тому р=0,03 не означає, що «ефект реальний на 97%»; результати також слід оцінювати за розміром ефекту та довірчим інтервалом.

11. У презентації різниця в 3% між двома групами показана як величезна, стиснувши вісь ординат до діапазону 95-100. Що це за приклад?

  • A) хороша техніка візуалізації; підкреслює різницю
  • B) Проблема дружньої палітри для дальтоніків
  • В) Прийнятний вибір стилю
  • D) Оманлива та нечесна діаграма, яка перебільшує різницю з усіченою віссю ✔

Пояснення: неініціалізація осі з нуля (урізана вісь) вводить глядача в оману, візуально перебільшуючи невелику різницю. Це є порушенням принципу чесності; Особливо на стовпчастих діаграмах вісь має починатися з нуля, а різницю слід відображати з її фактичним розміром.

12. Дослідник вставляє те, що він вважає анонімними даними екзоми пацієнта, у загальнодоступну мовну модель для аналізу. Чому ця поведінка проблематична?

  • А) Проблеми немає; даними можна поділитися, якщо вони анонімні
  • B) Надання конфіденційних даних пацієнта для відкритої моделі є порушенням конфіденційності та етичних/юридичних норм (KVKK/GDPR), і не може бути скасовано ✔
  • В) Це проблематично лише тому, що аналіз буде повільним
  • D) Модель проблематична, оскільки вона не може зрозуміти дані

Опис: генетичні/клінічні дані пацієнта надзвичайно чутливі; Навіть геномні дані, які вважаються анонімними, можна повторно ідентифікувати. Надання цих даних загальнодоступній моделі порушує дозволи KVKK/GDPR і комітету з етики (IRB) і є необоротним порушенням конфіденційності. Конфіденційні дані слід обробляти в локальних/захищених умовах за контрактом.

13. В одному дослідженні різниця, яку вони вважали «пацієнт проти контролю», насправді була пов’язана з тим, що зразки оброблялися в два різні дні. Як називається ця ситуація і як її вирішити?

  • A) Це ефект викиду; крапки слід видалити
  • B) Це відсутність нормалізації; достатньо лише корекції масштабу
  • C) це пакетний ефект; мають бути збалансовані в дизайні та додані до моделі як пакетна змінна ✔
  • Г) р-злом; тест слід змінити

Пояснення: Технічна різниця через партію відбору проб/день обробки називається ефектом партії, і її можна сплутати з біологічною різницею. Правильний підхід полягає в тому, щоб збалансувати партії в дизайні та додати змінну партії до статистичної моделі (наприклад, «~партія + умова»), таким чином відокремлюючи технічний сигнал від біологічного.

14. Ви хочете обчислити коефіцієнт GC послідовності ДНК. Який підхід є правильним і повторюваним?

  • A) Роздрукуйте код, який розраховує швидкість GC за допомогою Biopython, запустіть його та використайте результат ✔
  • B) Дайте моделі послідовність і попросіть її усно повідомити швидкість GC
  • C) Підтвердження співвідношення, заданого моделлю, іншою моделлю
  • Г) Розглядаючи перші 100 літер серії та вгадуючи їх на око

Пояснення: швидкість GC є детермінованим розрахунком; має базуватися на коді, який обробляє масив, а не на значенні, яке «запам’ятовує» модель мови. Замість того, щоб модель розраховувала його, роздрукуйте обчислювальний код за допомогою такого інструменту, як Biopython, і запустіть його самостійно, що забезпечить точний вихід, який дає той самий результат кожного разу, коли ви його запускаєте.