Gewinne:
- Möglichkeit, numerische Ergebnisse auf ausgeführtem Python-Code zu basieren, statt verbale Vermutungen über das Sprachmodell anzustellen
- Fähigkeit, den Stöchiometrie-, Kalibrierungs- und Datenbereinigungscode für künstliche Intelligenz zu schreiben und ihn mit Proben mit bekannten Antworten zu testen
- Möglichkeit, Fehler bei der Datenanalyse zu vermeiden, indem immer Einheiten angegeben und deren Reihenfolge überprüft werden
Die Chemie ist voller Zahlen: Wägungen, Volumina, Absorptionswerte, Ausbeuten, Konzentrationen. Die manuelle Verarbeitung dieser Daten ist langsam und fehleranfällig. KI bietet hier zwei Hauptdienste: (1) schreibt Python-Code, der die Daten verarbeitet, (2) führt diesen Code aus (in einer Umgebung, die den Code ausführen kann) und liefert ein deterministisches Ergebnis. Das entscheidende Prinzip ist folgendes: Überlassen Sie die Berechnung der Ausgabe des ausgeführten Codes und nicht der „verbalen Vorhersage“ des Sprachmodells. Sprachmodell „Was ist 142 × 0,05?“ kann die Frage manchmal falsch beantworten; aber die Python-Zeile, die er schreibt, berechnet immer korrekt. In dieser Einheit lernen wir anhand dieser Philosophie die chemische Datenanalyse mit KI.
Warum ist Code besser als verbale Vermutungen?
Ein Sprachmodell führt Arithmetik durch, indem es „das mögliche Ergebnis vorhersagt“; Daher kann es bei großen Zahlen oder mehrstufigen Berechnungen falsch sein. Während in Python der Ausdruck 142 * 0,05 deterministisch ist: Er gibt immer 7,1 zurück. Also Strategie: Lassen Sie die KI nicht die Berechnung durchführen, drucken Sie den CODE der Berechnung aus und führen Sie den Code aus. Sie nutzen also die Kreativität der KI (Erstellung des Codes) und deaktivieren die unzuverlässige Seite (Kopfarithmetik).
Tipp: Wenn Sie ein numerisches Ergebnis von einer KI erhalten, sagen Sie „Stellen Sie dies mit einer Python-Zeile dar.“ Der Code selbst verifiziert sowohl das Konto als auch ermöglicht es Ihnen, es auszuführen und zu bestätigen. Wenn Sie keinen Code sehen, vertrauen Sie der Nummer nicht.
Typische Datenanalyseaufgaben in der Chemie
- Stöchiometrie: Mol, Masse, limitierendes Reagens, theoretische Ausbeute, Berechnung der prozentualen Ausbeute.
- Konzentration: Molarität, Verdünnung (M1V1 = M2V2), ppm-Umrechnungen.
- Kalibrierung: Zeichnen einer Kalibrierungslinie mit dem Lambert-Beerschen Gesetz (Absorption ∝ Konzentration) und Berechnen der Unbekannten.
- Datenbereinigung: Messtabellen mit Pandas lesen, Ausreißer markieren, Mittelwert/Standardabweichung.
- Visualisierung: Kalibrierungskurve, Kinetikdiagramm, Titrationskurve zeichnen.
Schritt für Schritt: Sichere Datenanalyse mit KI
- Daten definieren: Geben Sie Spalten, Einheiten und Beispielzeilen klar an. Wenn keine Einheit vorhanden ist, trifft die KI Annahmen.
- Fragen Sie nach Code, nicht nach Ergebnissen: Sagen Sie „Schreiben Sie Pandas/NumPy-Code, der dies berechnet“.
- Führen Sie den Code aus: Führen Sie ihn selbst oder in einer Umgebung aus, in der Code ausgeführt werden kann.
- Test mit einfachem Fall: Testen Sie den Code anhand eines kleinen Beispiels, bei dem Sie die Antwort kennen.
- Einheiten- und Ordnungsprüfung: Sind Einheit und Größe des Ergebnisses physikalisch sinnvoll?
- Dokumentieren: Fügen Sie den Code und die Ausgabe zum Experimentiernotizbuch hinzu (Einheit 8).
Vier kopierbare Vorlagen
1) Stöchiometrie und prozentuale Ausbeute:
Reaktion: Salicylsäure (MA 138.12) + Essigsäureanhydrid -> Aspirin (MA 180.16). Daten: 2,00 g Salicylsäure wurden verwendet, Essigsäureanhydrid war im Überschuss. Erhaltenes Aspirin: 2,15 g. Aufgabe: Python-Code schreiben, der die theoretische Ausbeute und die prozentuale Ausbeute berechnet. Molekulargewichte als Variablen definieren, das Ergebnis in Einheiten ausdrucken. Nicht im Kopf berechnen; Geben Sie einfach ausführbaren Code an.
2) Beer-Lambert-Kalibrierung:
Kalibrierungsdaten (Konzentration mol/L -> Absorption): 0,00->0,02, 0,02->0,21, 0,04->0,40, 0,06->0,62, 0,08->0,79. Unbekannte Probenabsorption: 0,50. Aufgabe: Führen Sie eine lineare Kalibrierung mit numpy.polyfit durch, Steigung/Achsenabschnitt und berechnen Sie R^2, ermitteln Sie die unbekannte Konzentration. Zeichnen Sie die Daten + Anpassungslinie mit matplotlib.
3) Maßtabelle mit Pandas:
Ich habe eine CSV-Datei: Spalten = Probe, Gewicht_g, Volumen_ml, Absorption. Aufgabe: Mit Pandas lesen, Konzentration (g/L) für jede Probe berechnen, Zeilen mit Absorption < 0 als falsch markieren, Code zum Ausdrucken des Mittelwerts und der Standardabweichung der Gruppen eingeben. Geben Sie die Einheiten mit einer Kommentarzeile an.
4) Überprüfung des Verwässerungskontos:
Ich möchte 100 ml einer 0,05 M Lösung aus einer 0,5 M Stammlösung herstellen. Aufgabe: Schreiben Sie die Python-Zeile, die das erforderliche Lagervolumen mit M1V1=M2V2 berechnet. Drucken Sie das Ergebnis in ml aus und bestätigen Sie als Kommentar, dass für eine Logikprüfung eine 10-fache Verdünnung erwartet wird.
Schwache Eingabeaufforderung / Starke Eingabeaufforderung
Schwach:
Wie viel Aspirin enthält 2 Gramm Salicylsäure?
Die KI gibt eine Zahl aus dem Kopf; Wenn es sich die Molekulargewichte falsch merkt, wird das Ergebnis verfälscht und es ist nicht sichtbar, wie es berechnet wurde.
Stark:
Angenommen, Salicylsäure MA=138,12, Aspirin MA=180,16, Masse=2,00 g, Ausbeute 100 %. Aufgabe: Schreiben Sie Python-Code, der die theoretische Masse von Aspirin berechnet; Kommentieren Sie jeden Schritt (Mol -> Mol -> Masse) und geben Sie das Ergebnis in g aus.
Unterschied: angegebene Molekulargewichte, angeforderter Code, kommentierte Schritte, angegebene Einheit. Das Ergebnis ist sowohl genau als auch überprüfbar.
Verbale Vorhersage usw. ausgeführter Code
Größe
Sprachmodell zur verbalen Vorhersage
Python-Ausführung
Arithmetische Genauigkeit
Variabel, Fehler können auftreten
Deterministisch, sicher
Überprüfbarkeit
Fehlgeburt (es ist unklar, wie es dazu kam)
Hoch (Code sichtbar)
Wiederholbarkeit
niedrig
hoch
Einheitenverfolgung
schwach
Kann im Code offen gehalten werden
Richtige Verwendung
Idee, Gebäudestruktur
Endgültiges numerisches Ergebnis
Mini-Hüllen
Fall 1 – Verbaler Rechenfehler. Ein Student fragt AI „0,0145 mol × 180,16 g/mol?“ er fragte; „2,72 g“, sagte die KI. Tatsächlich sind es 2,61g. Als der Student sagte: „Zeige dies in Python“, schrieb YZ 0,0145 * 180,16 und es kam 2.612 heraus; Die erste mündliche Antwort war falsch. Lektion: Bevorzugen Sie Code auch für sehr einfache Multiplikationen.
Fall 2 – R²-Prüfung bei der Kalibrierung. Ein Benutzer ließ eine Beer-Lambert-Kalibrierung durchführen; Es stellt sich heraus, dass R² = 0,981 ist. Die KI sagte „linear, zuverlässig“, aber der Punkt mit der höchsten Konzentration lag unterhalb der Linie (Sättigung). Als der Benutzer das Diagramm sah, verschob es den höchsten Punkt aus dem linearen Bereich, R² stieg auf 0,999. Lektion: R² allein reicht nicht aus; siehe Residuen/Diagramm.
Fall 3 – Einheitenverwirrung. Bei einer Analyse war unklar, ob die Konzentration mg/L oder g/L betrug; Die KI ging von g/L aus und die Ergebnisse waren 1000-mal falsch. Es wurde behoben, als der Benutzer die Spalteneinheit explizit angab. Lektion: Tauschen Sie die Einheit immer zu kurz aus, vorausgesetzt, KI ist teuer.
Häufige Fehler
- Verlassen Sie sich auf die verbale Zahl. Fordern Sie immer Code an und führen Sie ihn aus, anstatt Kopfrechnen zu betreiben.
- Keine Angabe der Einheit. Das Mischen von mg/L mit g/L, mL mit L führt zu einem 1000-fachen Fehler.
- Der Code wird nicht getestet. Anwendung auf Big Data ohne Tests mit einem kleinen Beispiel, bei dem die Antwort bekannt ist.
- Betrachtet man R² als einziges Kriterium. Den Nichtlinearitätspunkten vertrauen, ohne sie grafisch zu sehen.
- Überspringen Sie das Testreagenz. Berechnung der theoretischen Ausbeute ohne Bestimmung des limitierenden Reagens in der Stöchiometrie.
- Bedeutender Schrittausguss. Angabe des Ergebnisses auf 8 Ziffern, wenn die Messung 3 signifikante Ziffern umfasst.
Achtung: Auch der Code, den die KI schreibt, kann fehlerhaft sein (falscher Spaltenname, falsche Formel). Durch das Ausführen des Codes wird das Ergebnis deterministisch, Sie müssen jedoch anhand eines bekannten Beispiels bestätigen, dass der Code das Richtige berechnet.
Zusammenfassend
- Überlassen Sie die numerischen Ergebnisse dem ausgeführten Python-Code und nicht der verbalen Vermutung des Sprachmodells.
- KI schreibt schnell Code für Stöchiometrie, Kalibrierung, Datenbereinigung und Visualisierung in der chemischen Datenanalyse.
- Setzen Sie immer Einheiten auf; Einheitenverwechslung ist der teuerste Fehler.
- Untersuchen Sie die Residuen und das Diagramm zusätzlich zu R² in der Kalibrierung.
- Testen Sie den Code anhand eines einfachen Beispiels mit einer bekannten Antwort. Der Mensch überprüft die Richtigkeit des Codes.
Anwendungsaufgabe
Halten Sie einen Kalibrierungs- oder Stöchiometriedatensatz bereit (falls nicht, verwenden Sie die oben genannten Beer-Lambert-Daten). Fragen Sie die KI nach dem Python-Code, der die Analyse durchführt (dem Code, nicht dem Ergebnis). Führen Sie den Code aus. Testen Sie es dann mit einer kleinen Auswahl bekannter Antworten. Bitten Sie die KI mündlich um die gleiche Berechnung und vergleichen Sie die beiden Ergebnisse: Gibt es einen Unterschied? Interpretieren Sie die Darstellung von R² und Residuum bei der Kalibrierung. Fügen Sie den Code, die Ausgabe und den kurzen Kommentar in ein Dokument ein.
Checkliste
- [ ] Ich erhalte die numerischen Ergebnisse aus dem Code, nicht aus der verbalen Vermutung.
- [ ] Ich gebe die Einheit jeder Datenspalte deutlich an.
- [ ] Ich teste den Code mit einer kleinen Stichprobe, deren Antwort bekannt ist.
- [ ] Ich führe bei der Kalibrierung neben R² eine Residuen-/Graphenanalyse durch.
- [ ] Ich bestimme das limitierende Reagens in der Stöchiometrie.
- [ ] Ich gebe die Ergebnisse mit der entsprechenden signifikanten Ziffer an.