Gewinne:
- Fähigkeit, Moleküle nicht anhand des Namens, sondern anhand der Strukturdarstellung zu identifizieren (SMILES beim Menschen, InChI/InChIKey bei der Datenbank)
- Fähigkeit, ungültige oder falsche Strukturen zu erkennen, indem jedes durch künstliche Intelligenz mit RDKit bereitgestellte SMILES analysiert, validiert und kanonisiert wird
- In der Lage sein zu verstehen, dass deterministische Größen wie Molekulargewicht und Formel aus dem regelbasierten Tool und nicht aus dem Sprachmodell ermittelt werden sollten.
Die erste Voraussetzung für den sicheren Einsatz von KI in der Chemie besteht darin, das Molekül in einer Sprache zu schreiben, die sowohl die Maschine als auch der Mensch verstehen können. Sie sagen „Phenol“, die KI macht es richtig; aber wenn man „Säure“ sagt, gibt es tausende Möglichkeiten. Die Namen sind mehrdeutig; Strukturdarstellungen sind präzise. In dieser Einheit lernen wir die beiden grundlegenden Notationen kennen, die das Molekül in Text übersetzen (SMILES und InChI), und das Tool, das sie deterministisch verifiziert (RDKit). Unser Ziel: Das Molekül der KI so zu übergeben, dass es nie missverstanden wird, und die von der KI erzeugte Struktur mit einem Werkzeug zu bestätigen.
Was ist LÄCHELN?
SMILES (Simplified Molecular-Input Line-Entry System) ist ein Format zum Schreiben eines Moleküls in eine einzelne Textzeile. Atome werden durch Buchstaben, Bindungen durch Symbole und Ringe durch Zahlen dargestellt. Beispiele:
- Ethanol: CCO (Kohlenstoff-Kohlenstoff-Sauerstoff; Wasserstoff implizit).
- Benzol: c1ccccc1 (Kleinbuchstabe „c“ steht für aromatischen Kohlenstoff; Einsen schließen den Ring).
- Aspirin: CC(=O)Oc1ccccc1C(=O)O.
- Koffein: Cn1cnc2c1c(=O)n(C)c(=O)n2C.
Die Stärke von SMILES besteht darin, dass es die gesamte Linkstruktur in einer einzigen Zeile überträgt; Seine Schwäche besteht darin, dass dasselbe Molekül mehrere gültige SMILES haben kann (dies wird als Nichtkanonizität bezeichnet). Wir werden das gleich mit RDKit lösen.
Hinweis: Das „kanonische SMILES“ für ein Molekül ist die einzige Standardschreibweise für dieses Molekül. Um zu sehen, ob zwei SMILES dasselbe Molekül sind, kanonisieren und vergleichen Sie sie; Sie sollten textlich nicht gleich sein, aber sie sollten gleiche Moleküle sein.
Was ist InChI?
InChI (International Chemical Identifier) ist ein von der IUPAC entwickelter Standardidentifikator. Der Unterschied zu SMILES besteht darin, dass das gleiche Molekül immer das gleiche InChI ergibt; das heißt, es ist kanonischer Natur. Es ist lang und schwer zu lesen, eignet sich jedoch ideal für den Datenbankabgleich. Für die Suche wird die Abkürzung „InChIKey“ (27-Zeichen-Digest) verwendet.
- Aspirin InChIKey: BSYNRYMUTXBXSQ-UHFFFAOYSA-N.
Regel: Menschen sprechen LÄCHELN (Lesen), Maschinen und Datenbanken stimmen mit InChI/InChIKey überein (exakt). Gib der KI ein LÄCHELN; Bestätigen Sie in der Datenbank mit InChIKey.
RDKit: Deterministische Verifizierungs-Engine
RDKit ist eine Open-Source-Bibliothek für Chemieinformatik. Im Gegensatz zum Sprachmodell basiert es auf Regeln: Analysiert SMILES, berechnet das Molekulargewicht, generiert kanonische SMILES, gibt InChI/InChIKey zurück und zeichnet das Molekül. RDKit „berechnet“ also, was die KI „vorhersagt“. Dies ist das Herzstück des Workflows: KI generiert, RDKit überprüft.
Ein grundlegender Verifizierungsablauf:
from rdkit import Chemfrom rdkit.Chem import Descriptors, Drawsmiles = "CC(=O)Oc1ccccc1C(=O)O" Chem.MolToSmiles(mol)) print("Molekulare Formel:", Chem.rdMolDescriptors.CalcMolFormula(mol)) print("Molekulargewicht:", Round(Descriptors.MolWt(mol), 2), "g/mol") print("InChIKey:", Chem.MolToInchiKey(mol))
Wenn MolFromSmiles None zurückgibt, hat Ihnen die KI ein ungültiges Molekül gegeben; Dies allein ist eine sehr wertvolle Warnung. Wenn es gültig ist, müssen Sie das Sprachmodell nicht mehr nach dem Molekulargewicht fragen; Es liegt deterministisch in Ihren Händen.
Schritt für Schritt: AI + RDKit-Interaktion
- Identifizieren Sie das Molekül: Geben Sie der KI den Namen und fragen Sie nach LÄCHELN. Beispiel: „Überprüfen Sie kanonische SMILES für Paracetamol.“
- Überprüfen: Eingehende SMILES mit MolFromSmiles analysieren. Wenn keine, ablehnen.
- Kanonisieren: Kanonische Rechtschreibung mit MolToSmiles abrufen; Verwenden Sie dies von nun an immer.
- Zahlen berechnen: Erhalten Sie Molekulargewicht, Formel, Anzahl der Ringe, Anzahl der Wasserstoffbrückenbindungsdonoren/-akzeptoren usw. von RDKit, nicht von AI.
- ID korrigieren: InChIKey generieren, in der Datenbank (PubChem) suchen und bestätigen, dass das Molekül tatsächlich die gewünschte Verbindung ist.
Vier kopierbare Vorlagen
1) SMILES anfordern (vom Substantiv zur Struktur):
Aufgabe: Geben Sie das kanonische LÄCHELN für die folgende Verbindung an. Verbindung: Paracetamol (Paracetamol). Regel: Geben Sie nur die SMILES-Zeichenfolge und InChIKey an, fügen Sie keine weitere Erklärung hinzu. Wenn Sie sich nicht sicher sind, schreiben Sie „UNSICHER“ und erfinden Sie nichts.
2) SMILES-Validierungsanforderung (von der Struktur zur Steuerung):
Untersuchen Sie die SMILES unten: CC(=O)Nc1ccc(O)cc1Fragen:1) Ist dies ein gültiges SMILES?2) Welcher Verbindung entspricht es (gebräuchlicher Name)?3) Wie lautet die Summenformel?Hinweis: Ich werde das genaue Molekulargewicht mit RDKit berechnen; Sie geben einfach Ihre Strukturinterpretation ab.
3) Vergleich zweier Darstellungen:
Ich habe zwei LÄCHELN:A) OCCB) CCOAufgabe: Sind das die gleichen Moleküle oder unterschiedlich? Schreiben Sie Ihre Begründung auf. Hinweis: Ich werde Ihre Antwort überprüfen, indem ich sie in RDKit kanonisiert.
4) Strukturerklärung (zu Lernzwecken):
SMILES: Cn1cnc2c1c(=O)n(C)c(=O)n2CAufgabe: Lesen Sie dieses SMILES Stück für Stück und erklären Sie auf Türkisch, was jedes Symbol bedeutet (Atom, Bindung, Ring, Aromatizität). Sagen Sie auch, um welche Verbindung es sich handelt.
Schwache Eingabeaufforderung / Starke Eingabeaufforderung
Schwach:
Geben Sie die Eigenschaften von Paracetamol an.
„Feature“ ist vage; KI generiert Zufallszahlen vom Molekulargewicht bis zum Schmelzpunkt, von denen einige falsch sein werden.
Stark:
Verbindung: Paracetamol.1) Canonical SMILES und InChIKey Version.2) Geben Sie die Summenformel an.Regel: Geben Sie KEINE NUMERISCHEN Werte wie Molekulargewicht, Schmelzpunkt usw. an; Ich werde sie mit RDKit/PubChem bekommen. Geben Sie einfach die Build-ID an.
Unterschied: Wir haben die KI auf das gerichtet, worin sie stark ist (Strukturidentität) und weg von dem, worin sie schwach ist (experimentelle Zahlen).
Vergleich der Eindrücke
Funktion
LÄCHELT
InChI / InChIKey
Lesbarkeit
Hoch (menschenfreundlich)
Niedrig (maschinenfreundlich)
Kanonizität
Änderungen vorbehalten (Heiligsprechung erforderlich)
natürlich Single
Nutzung
menschliche Kommunikation, Zeichnen, Input
Datenbankübereinstimmung, Identität
Stereochemie
Unterstützt (@-Symbole)
Stützen (geschichtet)
der KI geben
ideal
Ideal zur Konfirmation
Mini-Hüllen
Fall 1 – Zwei Namen, ein Molekül. Ein Student dachte, dass „N-Acetyl-Para-Aminophenol“ und „Paracetamol“ unterschiedliche Verbindungen seien und plante zwei getrennte Experimente. Als ihre SMILES in RDKit kanonisiert wurden, stellte sich heraus, dass beide CC(=O)Nc1ccc(O)cc1; Es war das gleiche Molekül. Verloren: ein halber Tag Planung; Gewinn: hätte mit einer 2-minütigen Kanonisierungsprüfung vermieden werden können.
Fall 2 – Ungültige SMILES-Erfassung. Die KI hat CC(=O)Nc1ccc(O)cc1C( für eine Variante zurückgegeben (Klammern nicht geschlossen). Der Student hat MolFromSmiles ausgeführt, es hat None zurückgegeben, den Fehler sofort gesehen und korrigierte SMILES angefordert. Ohne Überprüfung hätte sich die fehlerhafte Struktur auf alle Konten ausgeweitet.
Fall 3 – Falsches Molekulargewicht. YZ gab für Ibuprofen (C13H18O2) „Molekulargewicht 214,3 g/mol“ an. Die RDKit-Berechnung ergab 206,28 g/mol. Differenz für 0,1 Mol: 21,43 g mit YZ, tatsächlich 20,63 g. Dieser Unterschied von 3,9 % würde die Stöchiometrie- und Ausbeuteberechnung stören. Es brachte deterministische Analysis.
Häufige Fehler
- Geben Sie dem Molekül einen Namen. Synonyme/Handelsnamen sind verwechselt. Fügen Sie immer SMILES oder InChI hinzu.
- SMILES vergleichen, ohne es zu kanonisieren. OCC und CCO unterscheiden sich im Text, sind aber in den Molekülen gleich.
- Abfrage des Molekulargewichts zum Zungenmodell. Dies ist eine deterministische Berechnung; Dies erfolgt über RDKit oder manuell über die Formel.
- Ungültiges LÄCHELN nicht bemerkend. Die Rückgabe von MolFromSmiles None wird nicht überprüft und mit der falschen Struktur fortgefahren.
- Vernachlässigung der Stereochemie. Die beiden Enantiomere (Spiegelbildisomere) können unterschiedliche biologische Wirkungen aufweisen; Überspringen von @/@@-Zeichen beim LÄCHELN.
Achtung: Die gleiche Summenformel bedeutet nicht, dass es sich um unterschiedliche Moleküle handelt. C2H6O ist sowohl Ethanol (CCO) als auch Dimethylether (COC). Gleichheit der Formel ist nicht Gleichheit der Identität; Verwenden Sie zur Identifizierung InChIKey.
Zusammenfassend
- Identifizieren Sie Moleküle anhand der Strukturnotation, nicht anhand des Namens: SMILES mit Mensch, InChI/InChIKey mit Datenbank.
- RDKit ist deterministisch; KI prognostiziert, RDKit berechnet und überprüft.
- Analysieren Sie jedes AI SMILES mit MolFromSmiles und prüfen Sie, ob None vorliegt, und kanonisieren Sie es dann.
- Erhalten Sie Zahlen wie Molekulargewicht und Formel von RDKit, nicht vom Sprachmodell.
- Formelgleichheit bedeutet nicht molekulare Identität; Verwenden Sie zur Identifizierung InChIKey.
Anwendungsaufgabe
Wählen Sie drei Verbindungen (z. B. Koffein, Ibuprofen, Glycin). Bitten Sie die KI um kanonische LÄCHELN für jeden. Schreiben Sie dann ein RDKit-Skript (verwenden Sie die obige Vorlage) und generieren Sie: kanonisches SMILES, Summenformel, Molekulargewicht, InChIKey. Wie viele der von der KI gegebenen SMILES waren gültig? Wenn YZ auch das Molekulargewicht angegeben hat, berechnen Sie die Differenz als Prozentsatz mit dem RDKit-Wert. Tragen Sie Ihre Erkenntnisse in eine kleine Tabelle ein.
Checkliste
- [ ] Ich weiß, was SMILES und InChI/InChIKey sind und wann man sie verwendet.
- [ ] Ich verifiziere jedes von AI bereitgestellte SMILES mit MolFromSmiles.
- [ ] Ich kanonisiere SMILES, bevor ich sie vergleiche.
- [ ] Ich erhalte das Molekulargewicht und die Formel von RDKit, nicht vom Sprachmodell.
- [ ] Ich bestätige die Molekülidentität in der Datenbank mit InChIKey.
- [ ] Ich kenne Situationen, in denen Stereochemie wichtig ist.