Добивки:
- Да се биде во можност да се разбере работата на AlphaFold, оценките за доверба како pLDDT и PAE и дека структурата е „предвидување“ и правилно да се интерпретира структурата со вештачка интелигенција
- Способност да се препознаат областите со ниски оценки за доверба (флексибилни/неправилни) и да се избегне претерано толкување и споредување со експериментални докази
- Способност да се примени дисциплината за третирање на предвидувањето на структурата како хипотеза и поврзување на функционалните тврдења со експерименталната верификација.
За да се разбере што прави протеинот, често е неопходно да се знае неговата тридимензионална преклопена структура; бидејќи функцијата произлегува од структурата. Со децении, определувањето на структурата на протеинот експериментално (кристалографија со рендген, крио-електронска микроскопија) ќе трае со месеци до години. AlphaFold (систем за вештачка интелигенција развиен од DeepMind кој ја предвидува протеинската структура од секвенци на аминокиселини) го намали ова на неколку минути и ги објави предвидените структури на стотици милиони протеини. Во оваа единица ќе научите како да го читате излезот AlphaFold, како да ги толкувате оценките за доверба и како безбедно да користите LLM во ова толкување.
Критична разлика: AlphaFold е алатка за предвидување структура и нејзиниот излез е предвидување, а не експериментална вистина. LLM (модел за разговор како ChatGPT) не е самиот AlphaFold; Не може да ги „запомни“ координатите на протеинот. Користете LLM за толкување и објаснување на излезот AlphaFold; преземете ја самата структура од базата или алатката AlphaFold.
Основни концепти
- Примарна структура: Аминокиселинска низа (синџир на букви на протеинот).
- Секундарна/терцијарна структура: Хеликс (алфа-спирала), лист (бета-лист) и тридимензионално преклопување на синџирот.
- pLDDT: Локален резултат на доверба на AlphaFold за секоја амино киселина, кој се движи од 0 до 100. 90+ значи многу висока доверба, 70-90 значи добро, 50-70 значи ниска, а под 50 значи многу ниска доверба. Регионите со низок pLDDT се генерално „нарушени“ региони (без посебен преклоп).
- PAE (Predicted Aligned Error): Предвидена грешка во релативната позиција на два региони; Покажува колку е веродостојно поставувањето на домените едни на други.
- PDB: База на податоци и формат на датотека во кој се зачувани експериментални протеински структури.
Читање на излезот AlphaFold: чекор по чекор
1. Изберете го точниот протеин и секвенца. Идентификувајте го протеинот со бројот UniProt (протеинска информативна база на податоци); Најдете ја структурата со овој број во базата на податоци AlphaFold.
2. Погледнете ја мапата pLDDT. Погледнете кои делови од структурата се предвидуваат со голема сигурност (сина), а кои се предвидуваат со мала сигурност (портокалова/жолта). Бидете внимателни за коментарите во области со ниска доверба.
3. Прочитајте ја табелата PAE. PAE покажува дали релативниот распоред на домени во протеин со повеќе домени е сигурен. Високиот PAE значи дека релативната позиција на полињата е неизвесна.
4. Споредете со експерименталната структура. Поврзете ја експерименталната структура во PDB доколку е достапна. Ако предвидувањето AlphaFold е блиску до експериментално, вашата доверба се зголемува.
5. Интерпретирај го ефектот на варијантата. Кога го толкувате ефектот на промената на аминокиселината врз структурата, земете ги во предвид pLDDT и функционалното значење на тој регион заедно (активно место, врзувачки џеб).
Совет: Нискиот pLDDT не секогаш значи „погрешна претпоставка“; Често е знак дека областа е всушност суштински нарушена. Толку ниската самодоверба понекогаш одразува точен биолошки факт. Исто така, проверете ја низата со алатки за предвидување неправилности за да го разликувате ова.
три мини футроли
Случај 1 - Претерано толкување на зоната со ниска доверба. Еден студент тврдеше дека „јамка“ во структурата AlphaFold се вклопува во одреден џеб, а вештачката интелигенција го потврди тоа. Меѓутоа, кога студентот погледнал во pLDDT, видел дека резултатот на тој бод е 42 (многу низок); така што неговата позиција беше несигурна. Барањето беше повлечено. Поука: секогаш проверувајте ја локалната доверба пред да коментирате.
Случај 2 - Составена координата. Истражувач побара од LLM 3D координатата на одредена амино киселина на протеин; LLM даде убедливи бројки до три децимални места. Кога истражувачот ги споредил со вистинските координати во датотеката AlphaFold PDB, видел дека се целосно измислени. LLM не може да ја „запомни“ координатата; мора да се прочитаат координатите од датотеката.
Случај 3 - Добиена е потврда. Еден докторант се прашуваше дали една варијанта (p.Gly12Val) е блиску до активното место на протеинот. YZ потсети дека остатоците од активните локации се наведени во UniProt; Студентот го отвори UniProt и го најде активното место, а потоа измери со прегледувач на структура (PyMOL) дека Gly12 е оддалечен 8 ангстроми од оваа локација во структурата AlphaFold. Нумеричкото мерење го отелотвори тврдењето „блиску“.
Пример: читање pLDDT од датотека со структура
# Во датотеката AlphaFold PDB, pLDDT е зачувана во колоната B-фактор. од Bio.PDB увоз PDBParserimport numpy како npyapi = PDBParser(QUIET=True).get_structure("AF", "AF-P04637-F1.pdb")plddt = [atom.bfactor за атом во структурата.get_atoms() if "Atom",(LD="Atom."]name. круг(np.mean(plddt), 1))print("Ниска самодоверба (<70) стапка на остаток (%):", круг(100 * np.mean(np.array(plddt) < 70), 1))
Ова ви овозможува нумерички да ја видите целокупната веродостојност на структурата пред да коментирате.
Четири шаблони за копирање
1) Толкување на структурата (со резултат на доверба):
Вашата улога: асистент по структурна биологија. Помогнете ми да ја протолкувам структурата AlphaFold на протеинот UniProt [број]. Одговорете на овие прашања, но координирајте/оценете ПОСТАВУВАЊЕ: кои региони очекуваме висок/низок pLDDT, што покажува PAE, дали има експериментална структура (ПДБ), како да споредам? Ќе ги прочитам вредностите од датотеката.
2) Ефект на структура на варијанта:
Помогни ми да го протолкувам можниот ефект на следната варијанта врз структурата на протеините: [стр. Дајте ми какви докази да барам наместо целосното „деструктивно“ тврдење.
3) pLDDT/PAE опис:
Објаснете ја со пример разликата помеѓу pLDDT и PAE, кој треба да го погледнам и кога во анализа на варијанта. Разгледајте ги протеинските случаи со еден домен и повеќе домени.
4) План за споредба на структурата:
Сакам да го споредам предвидувањето AlphaFold со експерименталната структура на PDB. Како да се пресмета RMSD (средно отстапување помеѓу структурите), со која алатка да го направам тоа (PyMOL, Biopython), кој праг се брои како „добро преклопување“? Дајте чекор по чекор план.
Слаб промпт / Силен промпт
Слаб: „Нацртајте ја структурата на овој протеин и кажете го ефектот на p.Arg273His“.
Проблем: LLM не може да нацрта структура/фит координати; резултатот на доверба не се зема предвид; Тврдењето за дефинитивен ефект би било неосновано.
Силно: „Сам ја преземав верзијата AlphaFold за UniProt P04637. Гледајќи го pLDDT на p.Arg273His и неговата функционална прибелешка во UniProt, кажете ми чекор по чекор како треба да го протолкувам неговиот ефект; дајте ми какви докази да барам наместо дефинитивното тврдење“.
Зошто е моќен: Структурата е преземена од изворот, оценката за доверба е ставена во центарот, тврдењето е поврзано со докази.
Прашање
Дали AlphaFold испорачува?
Каде/како да потврдите
3D предвидување на превиткување
Да
AlphaFold DB / датотека
локална доверба
Да (pLDDT)
Колона Б-фактор
Локација на интердомен
Да (PAE)
Табела PAE
Експериментална реална структура
бр
PDB (експериментална)
Точно функционално влијание на варијантата
бр
Функционална студија + експерт
Вообичаени грешки
- Прескокнување на резултатот за доверба. Толкувањето во регионот со низок pLDDT е несигурно.
- Погрешно предвидување за емпириски факт. Излезот AlphaFold е проценка; Критичните одлуки бараат емпириски докази.
- Барање за координати од LLM. Координатите се читаат од датотеката, а не се меморираат.
- Игнорирање на PAE. Во мултидоменските протеини, релативната позиција на домените може да биде неизвесна.
- Веднаш сметајќи ја ниската доверба како „грешка“. Понекогаш таа област е навистина нерамна.
Внимание: AlphaFold градбите претставуваат „статична“ слика; Запомнете дека протеините се всушност мобилни молекули кои можат да влезат во повеќе конформации. Ниту една структура не го одразува целосно динамичното однесување.
Длабочина: каде што AlphaFold е структурно тивок
AlphaFold е моќен, но знаејќи што не може да направи е половина од битката за безбедно користење. Прво, стандардниот AlphaFold преклопува еден протеин во вселената; Не моделира лиганди, јони, кофактори и молекули на лекови. Цинк јонот во активното место на ензимот или супстратот не се појавува во структурата; Затоа, коментарот како „овој џеб е празен, нефункционален“ може да биде погрешен. Второ, не го моделира директно ефектот на мутација: дури и ако воведете две варијанти блиски до истата низа, AlphaFold обично произведува речиси иста структура; Не можете да го докажете тврдењето „оваа варијанта ја крши структурата“ со споредување на две предвидувања од AlphaFold. Трето, не ги зема предвид пост-преведувачките модификации (како фосфорилација, гликозилација) и вистинската средина на мембранските протеини во мембраната.
Случај во точка: еден тим тврдеше од слика на AlphaFold дека варијанта блиску до џебот за врзување на АТП во киназа ензимот „го затвора џебот“; вештачката интелигенција исто така потврди. Кога беше отворена експериментална кристална структура (PDB), се чинеше дека кофактор во тој регион што AlphaFold не го моделираше веќе го обликуваше џебот - ефектот на варијантата беше од сосема поинаков механизам. Втор случај: истражувач претпоставил дека „јамката“ помеѓу две полиња ги поврзува двете полиња; Картата на PAE покажа висока грешка (нејасна релативна позиција) помеѓу тие две области, така што тврдењето за поврзување беше неосновано. Читањето на PAE спречи неисправна приказна за механизмот.
5) Шаблон за контрола на границите AlphaFold:
Пред да го разгледате следното структурно тврдење, наведете кои ограничувања на AlphaFold влегуваат во игра во ова прашање: [тврдење]. Кажете ми кои дополнителни докази (експериментална структура, функционална студија) ми требаат, особено во однос на дефицит на лиганд/јон/кофактор, недостаток на моделирање на мутации и несигурност на PAE.
Сумирано
- AlphaFold е моќна алатка која предвидува структура од низа, но нејзиниот излез е претпоставка; треба да се читаат заедно со оценките за доверба.
- pLDDT означува локална доверба, PAE означува доверба за локација меѓу домени; Погледнете ги и двете пред да коментирате.
- LLM не може да „запомни“ координати или структура; Земете ја структурата од AlphaFold/PDB, користете LLM во коментар.
- Емпириските докази и стручното расудување се неопходни во критичните одлуки.
Задача за апликација
Преземете ја структурата AlphaFold на протеинот (на пр., добро проучен супресор на тумор) според бројот UniProt. Пресметајте го просечниот pLDDT и нискиот сооднос на безбеден остаток со горенаведениот фрагмент од код. Потоа изберете варијанта и побарајте од вештачката интелигенција план за толкување со вториот шаблон; Проверете ја функционалната прибелешка на pLDDT и UniProt на тој остаток сами. Поврзете го вашето барање со нумеричка вредност на доверба.
листа за проверка
- [ ] Ја добив структурата од AlphaFold/PDB со UniProt број.
- [ ] Ги прочитав pLDDT и PAE пред да коментирам.
- [ ] Не побарав од LLM да состави координати/оценки.
- [ ] Го поврзав толкувањето на варијантата со резултатот на доверба на соодветниот остаток.
- [ ] Го споредив со експерименталната структура, доколку е достапна.
- [ ] Ја поддржав критичката одлука со стручно расудување и емпириски докази.