одиниці
1. Вступ до штучного інтелекту в молекулярній біології та генетиці: ролі, межі, перевірка, етика та конфіденційність 2. Аналіз послідовності ДНК/РНК: вирівнювання, мотив, відкрита рамка зчитування та базова біоінформатика 3. Інтерпретація варіантів: патогенність за VCF, позначенням HGVS та критеріями ACMG 4. Структура білка та AlphaFold: прогнозування структури зчитування, оцінки достовірності та перевірка 5. Підтримка дизайну CRISPR: вибір гРНК, нецільовий ефект та експериментальна перевірка 6. Аналіз даних Omics: RNA-seq, експресія, статистика та збагачення шляхів 7. Огляд літератури та наукове написання: Перевірка джерела та ризик фальшивих цитат 8. Клінічна інтерпретація: звітність, схвалення експертів, підтвердження та обмеження 9. Дисципліна галюцинацій та автентифікації: вигадані гени, послідовності, варіанти та атрибути 10. Етика, конфіденційність і захист даних: особлива відповідальність за генетичні дані 11. Наскрізний випадок: шлях варіанта від відкриття до клінічного звіту
одиниця 2 / 11

Аналіз послідовності ДНК/РНК: вирівнювання, мотив, відкрита рамка зчитування та базова біоінформатика

Прибуток:

  • Зрозумійте концепції вирівнювання послідовностей, пошуку мотивів і відкритої рамки зчитування (ORF) і дозвольте штучному інтелекту створити виконуваний код Biopython/аналізу, який можна перевірити.
  • Можливість перевірити припущення версії фрейму, ланцюга та генома в послідовності та коді, створеному штучним інтелектом, і порівняти результат із відомим посиланням
  • Здатність застосовувати дисципліну не використовувати будь-які послідовності, надані штучним інтелектом із голови, і підтверджувати кожну послідовність з первинного джерела, такого як NCBI / Ensembl

Аналіз послідовностей є найбільш фундаментальним завданням молекулярної біології: читання ланцюга ДНК (або U в РНК), що складається з літер A, T, G, C, його порівняння та знаходження в ньому значущих ділянок (генів, мотивів, регуляторних послідовностей). У цьому розділі ви дізнаєтеся, як використовувати штучний інтелект (ШІ) як партнера з написання та інтерпретації коду в цих роботах; але ви дізнаєтесь, чому ви завжди повинні перевіряти результат за допомогою виконуваного коду та первинного джерела. Наш основний набір інструментів буде Biopython (бібліотека Python, написана для роботи з біологічними послідовностями) та офіційні інструменти вирівнювання.

Спочатку попередження: LLM може створювати помилки з пам’яті, навіть у короткій послідовності. Він може переплутати літеру, якщо його попросять обчислити зворотне доповнення послідовності прямо. Тому ніколи не виконуйте рядкові операції, покладаючись на текстову відповідь ШІ, а за допомогою коду, який пише ШІ, а ви виконуєте.

Базові поняття: з чим ми працюємо?

  • Пара основ (bp): Бутерна одиниця ДНК. Геном людини становить приблизно 3,2 мільярда п.н.
  • Нитка: ДНК являє собою подвійну спіраль; Два ланцюги є антикомплементом один одного. Має значення, в якому потоці оголошено варіант.
  • Кодон: Група з трьох основ; кожен кодон відповідає амінокислоті (цеглинка білка). Наприклад, ATG зазвичай є стартовим кодоном (метіонін).
  • Відкрита рамка зчитування (ORF): ділянка послідовності, яка може кодувати білок, простягаючись від стартового кодону до стоп-кодону (TAA, TAG, TGA).
  • Мотив: коротка послідовність, що повторюється, має певну функцію; наприклад, область, з якою зв'язується фактор транскрипції.
  • Вирівнювання: розташування двох або більше послідовностей одна під одною, щоб побачити їхню схожість.

Крок за кроком: робочий процес аналізу послідовності

1. Отримайте серію з надійного джерела. Не змушуйте ШІ говорити «нагадати» послідовність; Завантажте його як FASTA (стандартний текстовий формат, який зберігає послідовності) з джерела, такого як NCBI, Ensembl тощо, і надайте цю послідовність ШІ.

2. Виконайте транзакцію за допомогою коду. Виконайте такі операції, як зворотний комплемент, транскрипція (ДНК→РНК), трансляція (РНК→білок), співвідношення GC за допомогою коду Biopython, і запустіть код самостійно.

3. Перевірте припущення про структуру та потоки. Попросіть його/її чітко вказати в рядку коментаря, у якому потоці та в якому кадрі зчитування виконується код.

4. Порівняйте результат з відомим еталоном. Зіставте отриманий білок або ORF із відомим записом у базі даних. Довжина та початкова невідповідність фіксують найпоширеніші помилки.

5. Підтвердьте узгодження за допомогою офіційного інструменту. Не дозволяйте штучному інтелекту «закривати» схожість двох серій; Отримайте числову оцінку за допомогою BLAST (інструмент пошуку схожості послідовностей) або бібліотеки вирівнювання.

Порада: завжди нехай першою перевіркою буде довжина рядка. Кількість амінокислот білка становить приблизно одну третину числа основ кодуючої послідовності (без урахування стоп-кодону). Якщо довжина не підходить, рама або нитка неправильна.

три міні-чохла

Випадок 1 — помилка зворотного доповнення. Студент запитав ШІ про зворотний комплемент послідовності 5'-GATTACA-3'; AI видав "TGTAATC" (правильно). Однак у довшій послідовності з 20 баз штучний інтелект пропустив основу, і в результаті вийшло 19 баз. Коли студент запустив його за допомогою Seq("...").reverse_complement() у Biopython, знадобилося 20 баз і виявилася помилка. Втрачений час: 2 хвилини.

Випадок 2 — Зсув кадру. Дослідник транслював кодуючу послідовність із 900 основ у білок; ШІ «прочитав» білок з 280 амінокислот по тексту. Очікувалося 299 амінокислот (900/3 − 1 зупинка). Різниця полягала в тому, що ШІ починався з другого нуклеотиду. Правильну довжину було отримано, коли код було запущено з першого кадру.

Випадок 3 — Отримано підтвердження. Лаборант досліджував послідовності 16S рРНК двох штамів бактерій, запитуючи «чи вони однакові?» запитав він ШІ; "Швидше за все те саме", - сказав ШІ. Коли технік запустив BLAST, він побачив 97,8% подібності та 12 базових відмінностей — критичну різницю для розрізнення видового рівня. Якби числової оцінки не було, у звіт було б внесено неправильний «однаковий» результат.

Приклад: потік Biopython, який можна перевірити

from Bio.Seq import Seq# Імпортуйте послідовність із FASTA, яку ви завантажили з NCBI; Не змушуйте штучний інтелект говорити «нагадати мені». dna = Seq("ATGGCCATTGTAATGGGCCGCTGAAAGGGTGCCCGATAG")print("Довжина (bp):", len(dna))print("Швидкість GC (%):", round(100 * (dna.count("G") + dna.count("C")) / len(dna), 1))print("Зворотне доповнення:", dna.reverse_complement())# Переклад кадру 1; до зупинки codonprotein = dna.translate(to_stop=True)print("Білок:", білок, "| Довжина (мм):", len(білок))

Незважаючи на те, що ШІ пише цей код, ви бачите точність результату, запустивши його. Довжина, GC коефіцієнт і білок порівняні з відомим стандартом.

Чотири шаблони, які можна копіювати

1) Операція верифікованого масиву:

Напишіть виконуваний код Biopython для такої послідовності FASTA: [послідовність/завдання]. Обчисліть довжину, коефіцієнт GC, зворотне доповнення та трансляцію з кадру 1. Закоментуйте, який потік і кадр передбачається. Не створюйте послідовність; Просто використовуйте послідовність, яку я вам дав.

2) Скринінг ORF:

Напишіть код Python, який знаходить усі відкриті кадри зчитування в заданій послідовності (і всі три на необов’язковій зворотній нитці). Повідомте початкову позицію, довжину та трансльований білок для кожної ORF. Також позначте найдовший ORF.

3) Підтвердження вирівнювання:

Я хочу порівняти два масиви. "Схожі?" Не судіть на око; напишіть код попарного вирівнювання та повідомте про відсоток схожості та число відмінності. Джерело: [серія 1], [серія 2].

4) Пошук мотивів:

Знайдіть наступний мотив (також як регулярний вираз) у вказаному рядку: [motif]. Перелічіть розташування (на основі 1) усіх збігів. Напишіть і вкажіть збіги, що збігаються.

Слабка підказка / Сильна підказка

Слабкий: "Напишіть білок цієї послідовності: ATGGCC..."

Проблема: штучний інтелект перекладає текст, може сплутати кадр/потік, не може перевірити довжину.

Сильно: «Напишіть виконуваний код Biopython, який перекладає наступну послідовність із кадру 1, повідомляє довжину та стоп-кодон; не змінюйте послідовність, просто використовуйте ту, яку я надав: ATGGCC...»

Чому це потужно: обробка виконується в коді, структура зрозуміла, вихід можна перевірити чисельно.

Квест

неправильний підхід

правильний підхід

зворотне доповнення

Нехай ШІ пише текстом

Biopython reverse_complement()

переклад

Нехай ШІ перекладає з пам’яті

Код із зазначенням рамки

схожість

"Схожі?" око рішення

Оцінка BLAST/вирівнювання

мотив

Нехай ШІ порахує вручну

Код зі списком місць

Джерело масиву

Нехай ШІ пам’ятає

FASTA від NCBI/Ensembl

Поширені помилки

  • Без уточнення рамок. Трансляція з неправильного кадру дає короткий або несправний білок.
  • Плутання пряжі. Варіант або мотив може бути виворітним; має бути написано припущення потоку.
  • Змусити ШІ запам’ятати послідовність. LLM не може створити довгий рядок без помилок; Ви завжди надаєте серію.
  • Судя на око на схожість. Не кажіть «таке ж/схоже» без числової оцінки.
  • Суміш РНК/ДНК. Змішування U з T порушує переклад; уточнити тип введення.
Застереження: навіть високий відсоток схожості в BLAST і подібних інструментах не обов’язково означає біологічну «ідентичність»; Електронне значення (ймовірність шансу) і довжину вирівняної області слід оцінювати разом.

Глибина: правильно читати вихідні дані BLAST

Інтерпретація ШІ результату BLAST економить час; Але не приймайте жодних рішень, поки самі не прочитаєте ці три випуски. По-перше, це e-value (очікуване значення): очікувана кількість разів, коли ця оцінка може виникнути випадково; Дуже маленьке значення, як-от 1e-50, означає сильний, значення, як-от 0,1, майже шум. По-друге, охоплення запиту: який відсоток послідовності запиту покриває збіг; 98% подібності, але лише 20% охоплення означає, що невелика частина послідовності схожа і вводить в оману. Третє – відсоткова ідентичність. Без урахування цих трьох разом один високий відсоток нічого не доводить.

Конкретний приклад: дослідник BLAST зробив фрагмент гена, який він щойно секвенував; «99% збігаються з людським BRCA2, той самий ген», — сказав AI. Коли дослідник подивився на результат, він побачив, що охоплення становило лише 15% — відповідна частина була лише коротким повторюваним регіоном із тисяч баз BRCA2. Правильною інтерпретацією було не «той самий ген», а «спільний повторюваний мотив». Зчитування прицілу запобігло повній помилковій ідентифікації.

колонка BLAST

що це говорить

пастка

Е-вартість

ймовірність збігу

Якщо він високий, збіг може бути безглуздим

Покриття запиту

Покритий рівень запитів

Якщо він низький, відсоток є оманливим

відсоток ідентичності

Відповідна базова ставка

одного недостатньо

bitscore

Нормована міцність вирівнювання

Розшифровується відповідно до довжини

5) Шаблон інтерпретації вихідних даних BLAST:

Інтерпретуйте наведену нижче таблицю BLAST, але не вирішуйте: узагальніть електронне значення, охоплення запиту та відсоток ідентичності для кожного рядка окремо та вкажіть, які порогові значення мають бути досягнуті, перш ніж дійти висновку, як-от «той самий ген». Таблиця: [вклейка].

Підсумовуючи

  • Операції послідовності (зворотне доповнення, трансляція, ORF, коефіцієнт GC) слід виконувати за допомогою коду, який пише ШІ, а ви виконуєте, а не за допомогою текстової відповіді ШІ.
  • Припущення фреймворку та потоку завжди мають бути чітко визначені; Перевірка довжини є найшвидшим інструментом виявлення помилок.
  • Завжди отримуйте послідовність із надійного джерела (NCBI, Ensembl); Не змушуйте ШІ запам’ятовувати це.
  • Схожість і узгодженість оцінюються офіційними інструментами та числовими балами, а не на око.

Аплікаційне завдання

Завантажте коротку послідовність кодування з надійного джерела (наприклад, NCBI). З шаблонами 1 і 2 вище попросіть ШІ код Biopython, запустіть код; Порівняйте довжину та послідовність виробленого білка з відомим записом у базі даних. Якщо ви виявили невідповідність, спробуйте виправити це, змінивши припущення фреймворку/потоку, і запам’ятайте процес.

контрольний список

  • [ ] Я отримав послідовність із надійного джерела, я не запам’ятав її ШІ.
  • [ ] Я виконував операції з масивами з виконуваним кодом.
  • [ ] Я чітко вказав структуру та припущення потоку.
  • [ ] Я порівняв довжину білка/ORF з еталонним.
  • [ ] Я оцінив схожість з офіційним інструментом і числову оцінку.
  • [ ] Я перевірив розділення РНК/ДНК і U/T.