одиниця 3 / 11

Аналіз послідовностей і біоінформатика: ДНК, РНК і білки

Прибуток:

  • Можливість друку коду основних операцій аналізу послідовності, таких як читання FASTA, трансляція, вирівнювання та BLAST, і інтерпретація результатів
  • Здатність уникати неправильних висновків шляхом правильного тлумачення таких понять, як е-цінність, коефіцієнт охоплення та рамка зчитування
  • Здатність розуміти необхідність підтвердження функції послідовності офіційними базами даних (NCBI, UniProt, Ensembl).

Найбільш основними даними біології є послідовність: послідовність ДНК, що складається з літер A, T, G, C; A, U, G, C послідовність РНК; ланцюжок із 20 букв амінокислот білка. Ми розуміємо, що таке ген, наскільки споріднені два види та зв’язок між мутацією (зміною послідовності) та хворобою через ці послідовності. У цьому розділі ми навчимося використовувати штучний інтелект як помічника коду та інтерпретації для аналізу послідовностей: читання файлів FASTA, переклад послідовностей, вирівнювання (вирівнювання: порівняння двох послідовностей буква за літерою та визначення їх подібності) та інструменти розуміння, такі як BLAST.

Важливе застереження з самого початку: ШІ не «знає» фактичної функції послідовності; Про це говорять лише офіційні бази даних (NCBI, UniProt, Ensembl) та емпіричні дані.

Основні поняття та засоби

  • FASTA: текстовий формат, який зберігає рядки; Кожен масив складається з рядка заголовка, який починається з >, і рядків підмасиву під ним.
  • BLAST (базовий інструмент пошуку локального вирівнювання): інструмент, який порівнює вашу послідовність із мільйонами послідовностей у гігантській базі даних і знаходить найбільш схожі. «Як виглядає ця серія?» стандартна відповідь на запитання.
  • Вирівнювання: упорядкування двох або більше масивів так, щоб подібні області розміщувалися одна під одною. Це може бути попарне або множинне вирівнювання послідовностей (MSA).
  • Переклад: перетворення кодуючої послідовності ДНК/РНК в амінокислотну послідовність за допомогою потрійних літерних груп (кодонов).
  • Мотив: короткий повторюваний шаблон у послідовності, який має функціональне значення (наприклад, сайт зв’язування).
Порада: ви не можете сказати штучному інтелекту «ВИДУВАТИ цю серію»; Модель не може отримати доступ до бази даних BLAST. Але "Як я інтерпретую свій результат BLAST, що означає е-значення (E-value)?" Ви можете запитати та навіть написати код, який програмно викликає BLAST за допомогою Biopython.

Крок за кроком: дослідження ідентичності масиву

  1. Отримати послідовність: зберегти у файл як FASTA.
  2. Основна перевірка: довжина, вміст літери (це лише A/T/G/C чи є невідоме «N»), співвідношення GC (відсоток гуаніну-цитозину: залежить від виду та регіону).
  3. BLAST: шукайте у веб-інтерфейсі NCBI або програмно.
  4. Коментар: подивіться на електронне значення найкращого збігу (чим воно менше, тим менша ймовірність збігу) і покриття запиту.
  5. Підтвердження: відкрийте відповідний ген/білок у UniProt або NCBI та переконайтеся, що він дійсно відповідає функції, яку ви шукаєте.

AI допомагає вам кодувати на кроці 2 і коментувати на кроці 4; але реальні дані на кроках 3 і 5 надаються самими інструментами та вами.

Шаблони підказок, які можна копіювати

Посада: Ви асистент з біоінформатики. Завдання: прочитати файл FASTA (sequences.fasta) за допомогою Biopython. Я хочу: записати ім'я, довжину та коефіцієнт GC для кожної послідовності в таблицю; зберегти результат у форматі CSV. Надайте робочий код Python з коментарями.

Переведіть послідовність ДНК, яку я маю, у послідовність білка. Використовуйте Biopython Seq.translate; показати стоп-кодон (*); вказувати рамку зчитування. Надайте код, поясніть. Послідовність: [FASTA]

Інтерпретуйте мій результат BLAST. Нижче наведено цінність, відсоток ідентичності та рівень охоплення 5 найкращих збігів. Поясніть мені, який збіг надійний і чому, не робіть точних претензій щодо функції, скажіть мені кроки, які мені потрібно перевірити. Таблиця: [дані]

Вирівняйте дві білкові послідовності попарно та знайдіть відсоток подібності. Використовуйте Biopython pairwise2 або Bio.Align; надрукуйте вирівнювання зрозумілим. Наведіть код і поясніть схему нарахування балів.

Слабка підказка / Сильна підказка

Слабкий: "Яка послідовність гена?"

Сильний: «У мене є послідовність ДНК людини з 1140 пар основ (FASTA нижче). Я сам перевірив цю послідовність; найкраще відповідає TP53, e-value 0,0, ідентичність 99,8%, охоплення 100%. Поясніть, чому цей результат є вагомим доказом; однак скажіть мені, які 2 перевірки мені потрібно зробити, перш ніж з’ясувати її функцію».

Відмінність: у сильному запиті фактичні дані (довжина, результат BLAST) надаються моделі; Ви просите модель інтерпретувати надані вами докази, а не «запам’ятовувати» їх. Він змушений складати модель за слабкою підказкою.

три міні-чохла

Випадок 1 — Неправильна рамка зчитування: студент перевів послідовність ДНК у білок, але з самого початку, не знайшовши правильного стартового кодону (ATG). Результатом був безглуздий білок, який рано зупинявся. Коли модель випробувала всі три рамки зчитування та написала код, який знаходив найдовшу відкриту рамку зчитування (ORF), починаючи з ATG, вийшов правильний білок із 380 амінокислот.

Випадок 2 — помилка E-value: технік повідомив про відповідність BLAST із e-value 2,0 як «знайдено». Тоді як e-значення більше 1 вказує на те, що збіг, швидше за все, є випадковим. Модель пояснила це та нагадала, що e < 1e-5 зазвичай використовується як надійний поріг.

Випадок 3 — Зараження: ВИБУХ бактеріальної послідовності в лабораторії виявив, що ДНК людини найкраще відповідає. Це було ознакою забруднення зразка. ШІ викликав правильну підозру, заявивши, що «несподіваний тип збігу може свідчити про зараження»; Технік повторив приклад.

Порівняння: роль штучного інтелекту

Квест

штучний інтелект

Інструмент/база даних

людини

FASTA читання, GC/довжина

пише код

Контролює вихід

Переклад, знахідка ORF

пише код

Запускає Biopython

Перевіряє кадр

ідентифікатор масиву

Коментарі

Знахідки BLAST/NCBI

підтверджує

Претензія на функцію

пропонує пропозиції

UniProt надає докази

вирішує

Поширені помилки

  • Запит моделі «запам’ятати» ідентифікатор рядка: модель не запам’ятовує рядки; Використовуйте BLAST.
  • Неправильне тлумачення е-вартості: маленьке – добре, велике – погано; Пам'ятайте про поріг.
  • Не перевіряється рамка зчитування: неправильна рамка створює безглуздий білок.
  • Ігнорування покриття: висока ідентичність, але низьке покриття означає частковий збіг.
  • Відсутнє забруднення: неочікувана відповідність видів є серйозним попередженням.
Застереження: те, що послідовність «99% схожа на TP53», не доводить, що ця послідовність виконує функцію TP53; Це сильна гіпотеза. Функція має бути підтверджена емпіричними доказами та описом бази даних. Для штучного інтелекту недостатньо просто сказати «це супресор пухлини».

Множинне вирівнювання послідовностей і основа філогенезу

Вирівнювання десятків послідовностей разом, а не лише двох, називається вирівнюванням множинних послідовностей (MSA) і є основою багатьох аналізів: пошуку збережених ділянок (частин, які залишилися незмінними в еволюції та, отже, функціонально важливими), побудови філогенетичних дерев, ідентифікації родин білків. З цією роботою справляються такі інструменти, як MAFFT, MUSCLE і Clustal. AI пише код, який викликає ці інструменти з Python (через Biopython, наприклад) і допомагає вам інтерпретувати результат; але саме центрування робить інструмент, а не модель "напам'ять".

Інтерпретуючи MSA, зверніть увагу на консервативні стовпці: амінокислота, яка залишається незмінною в усіх послідовностях, швидше за все, є критичною для функції білка (наприклад, активного центру ферменту). Це дає чітку підказку щодо того, чому мутація може бути шкідливою. Але «збережений = значний» — це гіпотеза; вимагає експериментальної перевірки.

Прочитайте мій файл множинного вирівнювання (aligned.fasta), який є виходом MAFFT, за допомогою Biopython. Розрахувати коефіцієнт утримання для кожного стовпця; Список понад 90% захищених посад. Поясніть, чому ці посади можуть мати функціональне значення, а не претендувати на остаточну функцію.

Пастка мутації та варіантної інтерпретації

Коли ви бачите зміну літери (варіант) у рядку, це великий стрибок сказати, що це "шкідливо". Більшість варіантів нейтральні (неефективні). Інтерпретуючи вплив варіанту, потрібно дивитися на спеціальні бази даних варіантів (наприклад, ClinVar) і дані про частоту популяції (наприклад, gnomAD), а не на слова ШІ. Якщо модель стверджує, що варіант є «патогенним», ніколи не записуйте це в клінічний або дослідницький висновок, не підтвердивши це цими джерелами.

Бази даних для перевірки

Знання офіційних джерел для підтвердження кожного твердження в аналізі серіалу є вашим найсильнішим захистом від вигадок штучного інтелекту. Найчастіше використовуються:

бази даних

для чого

Типове підтвердження

NCBI GenBank/RefSeq

Послідовності ДНК/РНК, записи генів

ID рядка, довжина

UniProt

Послідовності та функції білків

Функція, число амінокислот

ансамбль

Анотація геному, розташування генів

Генно-хромосомне картування

ClinVar

Клінічне значення варіантів

Патогенне/нейтральне рішення

gnomAD

Частота варіантів у популяції

рідкісний/поширений варіант

ШІ може підказати, на яку з цих баз варто звернути увагу; Але ви робите запит і читаєте результат. «Модель сказала, що це те, що говорить UniProt» не є підтвердженням; Підтвердженням є самостійне відкриття сторінки UniProt.

Підсумовуючи

Аналіз послідовностей є серцевиною біоінформатики; FASTA, BLAST, вирівнювання та переклад є основними операціями. ШІ пише код для цих операцій і допомагає вам інтерпретувати їх результати, але інструменти (BLAST) і бази даних (NCBI, UniProt) забезпечують фактичну ідентифікацію послідовності. Правильне розуміння таких понять, як е-вартість, охоплення та рамка зчитування, є ключовим для того, щоб уникнути неправильних висновків. Твердження про функцію завжди вимагає незалежних доказів.

Аплікаційне завдання

Візьміть зразок послідовності ДНК (або ген, який ви завантажили з NCBI). Попросіть штучний інтелект обчислити довжину та GC-коефіцієнт за допомогою Biopython, а потім перевести його в усіх трьох кадрах зчитування та надрукувати код, який знаходить найдовший ORF. Запустіть результат. Потім знайдіть цю послідовність самостійно в NCBI BLAST і попросіть модель інтерпретувати е-значення та рівень охоплення найкращого збігу. Підтвердьте функціональність моделі в UniProt.

контрольний список

  • [ ] Я перевірив довжину та вміст літер перед обробкою рядка.
  • [ ] Я використав правильну рамку читання в перекладі.
  • [ ] Я сам запускав BLAST, я не "нагадував" модель.
  • [ ] Я правильно інтерпретував електронну вартість і коефіцієнт покриття.
  • [ ] Я оцінив неочікуваний збіг видів на забруднення.
  • [ ] Я підтвердив вимогу функції за допомогою офіційної бази даних.