Κέρδη:
- Ικανότητα διάκρισης μεταξύ ντετερμινιστικά υπολογισμένων χαρακτηριστικών και στατιστικά εκτιμώμενων χαρακτηριστικών και προσδιορισμού των επιπέδων εμπιστοσύνης
- Δυνατότητα αξιολόγησης της περιοχής στην οποία το μοντέλο είναι αξιόπιστο χρησιμοποιώντας την έννοια του πεδίου εφαρμογής
- Ικανότητα κατανόησης ότι κάποιος πρέπει να χρησιμοποιεί προβλέψεις χαρακτηριστικών για την κατάταξη των υποψηφίων και τη λήψη της τελικής απόφασης μέσω πειραματισμού.
Πριν συνθέσουμε ένα μόριο, ρωτάμε συχνά: "Είναι υδατοδιαλυτό; Πόσο όξινο είναι; Διασχίζει την κυτταρική μεμβράνη; Είναι εύλογο ως υποψήφιο φάρμακο;" Η πρόβλεψη των απαντήσεων σε αυτές τις ερωτήσεις πριν από το πείραμα εξοικονομεί πολύ χρόνο. Το AI και τα εξειδικευμένα μοντέλα του (ειδικά το QSAR — Ποσοτική σχέση δομής-δραστηριότητας, δηλαδή στατιστικό μοντέλο που προβλέπει μια ιδιότητα από τους δομικούς περιγραφείς του μορίου) είναι ισχυρά σε αυτές τις προβλέψεις. Αλλά αυτές οι προβλέψεις είναι προβλέψεις πιθανοτήτων, όχι μετρήσεις. Σε αυτή την ενότητα, θα μάθουμε για την πρόβλεψη χαρακτηριστικών, τα δυνατά της σημεία και την πιο κρίσιμη ιδέα, τη ζώνη εφαρμογής (η περιοχή όπου το μοντέλο είναι αξιόπιστο).
Ποια χαρακτηριστικά προβλέπονται;
- logP: Συντελεστής κατανομής λαδιού/νερού του μορίου. Δείχνει λιποφιλία (λίπος αρέσκειας). Κρίσιμο στην απορρόφηση φαρμάκων.
- Διαλυτότητα (logS): Πόσο διαλυτό είναι στο νερό.
- pKa: Οξύτητα/αλκαλικότητα. Το pH στο οποίο μια ομάδα ιονίζεται.
- TPSA: Τοπολογική πολική επιφάνεια. Χρησιμοποιείται στην εκτίμηση της διαπερατότητας.
- Lipinski «κανόνας πέντε»: Πρακτικά κατώφλια για μοριακό βάρος, logP, αριθμός δοτών/δεκτών δεσμών Η υποψήφιων φαρμάκων από το στόμα.
Ορισμένες από αυτές τις τιμές υπολογίζονται ντετερμινιστικά (π.χ. TPSA, αριθμοί δεσμών H) με εργαλεία όπως το RDKit. Ορισμένες από αυτές είναι στατιστικές εκτιμήσεις (logS, βιολογική δραστηριότητα). Η γνώση αυτής της διάκρισης καθορίζει πόσο εμπιστεύεστε.
Συμβουλή: Διακρίνετε εάν ένα χαρακτηριστικό είναι "υπολογισμένο" (βασισμένο σε κανόνες, επαναλαμβανόμενο) ή "προβλεπόμενο" (από μοντέλο, αβέβαιο). Έχετε υψηλή εμπιστοσύνη στους υπολογισμούς, επιφυλακτική εμπιστοσύνη στις προβλέψεις και επαληθεύστε τις προβλέψεις με πείραμα.
Πεδίο εφαρμογής: η πιο σημαντική έννοια
Ένα μοντέλο QSAR λειτουργεί καλά σε μόρια που είναι παρόμοια με τα μόρια στα οποία εκπαιδεύτηκε. Εάν δώσετε ένα μόριο που είναι πολύ διαφορετικό από τα δεδομένα εκπαίδευσης (για παράδειγμα, έναν πολύ μεγάλο, ασυνήθιστο σκελετό), το μοντέλο θα εξακολουθεί να παράγει έναν αριθμό, αλλά αυτός ο αριθμός θα είναι αναξιόπιστος. Αυτό ονομάζεται "να είσαι εκτός του πεδίου εφαρμογής". Το μοντέλο δίνει πάντα μια απάντηση. Είναι δική σας δουλειά να πείτε εάν η απάντηση είναι αξιόπιστη ή όχι.
Είναι ακόμη πιο επικίνδυνο όταν το μοντέλο γλώσσας δίνει μια τιμή χαρακτηριστικού: παράγει τον αριθμό ως τιμή "πιθανής εμφάνισης", χωρίς υποκείμενο υπολογισμό. Επομένως, εάν είναι δυνατόν, λάβετε τιμές χαρακτηριστικών από ένα ντετερμινιστικό εργαλείο (RDKit) ή ένα μοντέλο QSAR που δίνει αβεβαιότητα, όχι από το μοντέλο γλώσσας.
Βήμα προς βήμα: ασφαλής πρόβλεψη χαρακτηριστικών
- Επαλήθευση μορίου: Ανάλυση SMILES με RDKit (μονάδα 2).
- Υπολογίστε ντετερμινιστικούς: MA, logP (υπολογισμένο), TPSA, αριθμούς δεσμών H από το RDKit.
- Επισήμανση προβλέψεων ξεχωριστά: Διατηρήστε προβλέψεις μοντέλων όπως logS, δραστηριότητα κ.λπ. με την ετικέτα "πρόβλεψη".
- Ελέγξτε τον τομέα εφαρμογής: Μοιάζει το μόριο με τα δεδομένα εκπαίδευσης; Είναι εξαιρετικά μεγάλο/ασυνήθιστο;
- Χρήση για κατάταξη, όχι απόφαση: Χρησιμοποιήστε προβλέψεις για την κατάταξη των υποψηφίων. Η απόλυτη επιλογή είναι το πείραμα.
- Κλείσιμο με πείραμα: Επαληθεύστε τις κρίσιμες ιδιότητες (διαλυτότητα, pKa) με μέτρηση.
Τέσσερα πρότυπα με δυνατότητα αντιγραφής
1) Ντετερμινιστικά χαρακτηριστικά με το RDKit:
από rdkit εισαγωγή Chemfrom rdkit.Chem import Descriptors, rdMolDescriptorsmol = Chem.MolFromSmiles("CC(=O)Oc1ccccc1C(=O)O") # aspirinprint("MA:", round(Descriptors.MolWt(mol),2))υπολογισμένο("log") round(Descriptors.MolLogP(mol),2))print("TPSA:", round(Descriptors.TPSA(mol),1))print("H-bond donator:", rdMolDescriptors.CalcNumHBD(mol))print("H-bond αποδέκτης:", rdMolDescriptors.Calc(mol)NumH
2) Αξιολόγηση του κανόνα Lipinski:
Μόριο (SMILES): [SMILES]Εργασία: Αξιολογήστε τη συμμόρφωση με τον κανόνα των πέντε Lipinski με τιμές MA, logP, HBD, HBA που θα υπολογιστούν από το RDKit. Επισημάνετε κάθε κριτήριο ξεχωριστά ως επιτυχία/αποτυχία. Κανόνας: ΜΗΝ κάνετε τους αριθμούς. Θα το πάρω από το RDKit, σχολίασε εσύ.
3) Εκτίμηση χαρακτηριστικών + αίτημα αβεβαιότητας:
Μόριο (SMILES): [SMILES]Εργασία: Δώστε μια ποιοτική εκτίμηση της υδατοδιαλυτότητας (logS) (υψηλή/μέτρια/χαμηλή) και εξηγήστε τη λογική με τα δομικά χαρακτηριστικά. Μην δώσετε έναν ακριβή αριθμό. Δηλώστε ότι πρόκειται για ΠΡΟΒΛΕΨΗ και πρέπει να επιβεβαιωθεί με πείραμα. Προειδοποιήστε εάν το μόριο έχει ασυνήθιστη δομή (κίνδυνος εφαρμογής).
4) Κατάταξη υποψηφίων (προτεραιότητα βάσει πρόβλεψης):
Παρακάτω είναι SMILES 5 μορίων. Εργασία: Ταξινομήστε τα ως προς τη διαλυτότητα στο νερό (το πιο διαλυτό έως το λιγότερο) με βάση τα δομικά χαρακτηριστικά (αριθμός πολικών ομάδων, δακτύλιοι, λιποφιλία). Γράψτε την αιτιολόγηση για κάθε απόφαση κατάταξης. Σημείωση: Αυτή είναι μια ΠΡΟΚΑΤΑΡΚΤΙΚΗ ταξινόμηση. Η τελική επιλογή θα γίνει με μέτρηση.
Αδύναμη προτροπή / Ισχυρή προτροπή
Αδύναμο:
Ποια είναι η διαλυτότητα αυτού του μορίου;
Το AI αποτελείται από έναν αριθμό που δεν υπάρχει στον υπολογισμό (π.χ. "12 mg/mL"). Δίνει αυτοπεποίθηση αλλά μπορεί να είναι λάθος.
Δυνατό:
Μόριο (SMILES): [SMILES]. Εργασία: 1) Θα δώσω τα logP, TPSA, HBD/HBA που θα υπολογιστούν με το RDKit: [τιμές].2) Με βάση αυτές τις τιμές, ερμηνεύστε εάν η ανάλυση είναι υψηλή/μεσαία/χαμηλή.3) Δίνοντας τον ακριβή αριθμό. Δηλώστε ότι είναι εικασία και απαιτούνται πειράματα.
Η διαφορά: πήραμε τις ντετερμινιστικές τιμές από το όχημα και κάναμε το AI να τις ερμηνεύει. Ζητήσαμε ρητά την αβεβαιότητα και την ανάγκη πειραματισμού.
Τύποι χαρακτηριστικών και επίπεδο εμπιστοσύνης
χαρακτηριστικό
Πώς να αποκτήσετε
εμπιστοσύνη
σημείωση
μοριακό βάρος
RDKit (ντετερμινιστικό)
πολύ ψηλά
Κόψτε από τον τύπο
TPSA, HBD/HBA
RDKit (ντετερμινιστικό)
ψηλά
βάσει κανόνων
logP (υπολογισμένο)
Μοντέλο RDKit
μέτρια-υψηλή
Μπορεί να παρεκκλίνει από το πειραματικό
logS (ανάλυση)
Εκτίμηση QSAR
μεσαίο
Εξαρτάται από την περιοχή εφαρμογής
pKa
ειδικό μοντέλο
μεσαίο
Εμπίπτει σε μια πολύπλοκη δομή
βιολογική δραστηριότητα
QSAR/ML
Μεταβλητή
Φροντίστε να δοκιμάσετε και να επαληθεύσετε
μίνι θήκες
Περίπτωση 1 — Αριθμός προσαρμοσμένων αναλύσεων. Ένας μαθητής ρώτησε το AI για τη διαλυτότητα μιας ένωσης. Έλαβε την απάντηση «25 mg/mL» και έστησε τον πειραματικό σχεδιασμό ανάλογα. Η πραγματική τιμή στη μέτρηση ήταν ~2 mg/mL, μια διαφορά 10 φορές. Το AI είχε φτιάξει τον αριθμό. Μάθημα: μην λαμβάνετε ιδιότητες όπως η ανάλυση ως αριθμούς από το μοντέλο γλώσσας. ποιοτική πρόβλεψη + μέτρηση.
Περίπτωση 2 — Εκτός του πεδίου εφαρμογής. Ένα μοντέλο QSAR είπε ότι "η δραστηριότητα είναι υψηλή" για ένα μεγάλο μακρομόριο που ήταν πολύ διαφορετικό από το σετ εκπαίδευσης. Ο χρήστης παρατήρησε ότι το μόριο δεν έμοιαζε με τα δεδομένα εκπαίδευσης και θεώρησε την πρόβλεψη αναξιόπιστη. Το πείραμα έδωσε πολύ χαμηλή δραστηριότητα. Μάθημα: το μοντέλο πάντα ανταποκρίνεται. Αν είναι εκτός πεδίου, η απάντηση είναι άχρηστη.
Περίπτωση 3 — Σωστή χρήση του Lipinski. Σε ένα υποψήφιο μόριο, η τεχνητή νοημοσύνη αξιολόγησε τον Lipinski με τιμές από το RDKit: MA 512 (>500, οριακή γραμμή), logP 4.8 (ευνοϊκό), HBD 2, HBA 7. Ο χρήστης ερμήνευσε σωστά "ένα κριτήριο παραμένει αλλά ο κανόνας δεν είναι απόλυτος" και δεν εξάλειψε τελείως το μόριο. Μάθημα: οι κανόνες είναι κατευθυντήριες γραμμές, όχι κατώφλια. Ερμηνεία με πλαίσιο.
Συνήθη λάθη
- Λήψη του αριθμού χαρακτηριστικών από το μοντέλο γλώσσας. Οι τιμές που δεν υπολογίζονται κατασκευάζονται. Χρησιμοποιήστε ντετερμινιστικό εργαλείο ή μοντέλο με αβεβαιότητα.
- Αγνοώντας το πεδίο εφαρμογής. Το μοντέλο δημιουργεί αριθμούς για κάθε μόριο. αναξιόπιστος εκτός γηπέδου.
- Λαμβάνοντας υπόψη μια εκτιμώμενη μέτρηση. Το logS είναι μια εκτίμηση. Δεν υποκαθιστά την πειραματική ανάλυση.
- Θεωρώντας τον Lipinski τον απόλυτο κανόνα. Ο υποψήφιος που βρίσκεται στα σύνορα δεν αποκλείεται αυτόματα. Πολλά φάρμακα παραβιάζουν τον κανόνα.
- Μπερδεύουμε το "υπολογισμένο" με το "εκτιμώμενο". Υπολογίζεται η TPSA (αξιόπιστη), η δραστηριότητα εκτιμάται (αβέβαιη).
Προσοχή: Οι προβλέψεις χαρακτηριστικών είναι εξαιρετικές για την κατάταξη και την ιεράρχηση των υποψηφίων. αλλά όχι για να καθορίσει μόνο μια απόφαση. "Το μοντέλο είπε διαλυτό" είναι μια υπόθεση. «Μέτρησα, διαλύεται» είναι αποτέλεσμα.
Συνοπτικά
- Οι μοριακές ιδιότητες μπορούν να προβλεφθούν πριν από το πείραμα και εξοικονομεί πολύ χρόνο.
- Ορισμένα χαρακτηριστικά υπολογίζονται ντετερμινιστικά (MA, TPSA, HBD/HBA), μερικά είναι στατιστικές εκτιμήσεις (logS, δραστηριότητα).
- Ο τομέας εφαρμογής είναι η πιο κρίσιμη έννοια: το μοντέλο απαντά πάντα, αλλά είναι αναξιόπιστο εκτός του τομέα.
- Λάβετε τις μετρήσεις χαρακτηριστικών από το RDKit ή το μοντέλο ασάφειας και όχι από το μοντέλο γλώσσας.
- Χρησιμοποιήστε προβλέψεις για την κατάταξη των υποψηφίων. Πάρτε την τελική απόφαση πειραματιζόμενοι.
Εργασία εφαρμογής
Επιλέξτε πέντε μόρια (π.χ. μια σειρά φαρμάκων). Υπολογίστε MA, logP, TPSA, HBD, HBA για καθένα με το RDKit και αξιολογήστε το Lipinski. Ξεχωριστά, ζητήστε από το AI μια ποιοτική εκτίμηση (όχι έναν αριθμό) της διαλυτότητας κάθε μορίου και μια προειδοποίηση πεδίου εφαρμογής. Συλλέξτε ντετερμινιστικές τιμές και προβλέψεις AI σε έναν πίνακα. Ποιο μόριο έδωσε το περισσότερο προφίλ που μοιάζει με φάρμακο; Πού είναι η μεγαλύτερη αβεβαιότητα;
λίστα ελέγχου
- [ ] Διακρίνω μεταξύ ντετερμινιστικών υπολογισμένων και προβλεπόμενων ιδιοτήτων.
- [ ] Λαμβάνω τις τιμές ιδιοτήτων από το RDKit/μοντέλο, όχι από το μοντέλο γλώσσας.
- [ ] Παρατηρώ μόρια εκτός του πεδίου εφαρμογής.
- [ ] Χρησιμοποιώ το Lipinski ως οδηγό, όχι ως απόλυτο κανόνα.
- [ ] Χρησιμοποιώ προβλέψεις για κατάταξη και απόφαση για πειραματισμό.
- [ ] Έχω ένα σχέδιο επαλήθευσης κρίσιμων χαρακτηριστικών με μέτρηση.