Gewinne:
- Fähigkeit, robusten SQL- und Pandas-Code zu verwenden und ihn Zeile für Zeile zu lesen und zu überprüfen, indem der künstlichen Intelligenz ein klares Schema und ein klarer Zweck gegeben wird
- Möglichkeit, stille Fehler wie Zeilenanzahl, Anpassungsfunktion und Durchsatz nach Zusammenführung/JOIN abzufangen
- Möglichkeit, das Problem beim Debuggen zu lösen, ohne es zum Schweigen zu bringen, und die Ausführung des Codes zu vermeiden, ohne ihn in der Produktionsumgebung zu testen
Data Science hat zwei Hauptsprachen: SQL (Structured Query Language – die Sprache zum Abfragen von Daten aus Datenbanken) und Python (insbesondere die Pandas-Bibliothek – das Standardtool für die programmgesteuerte Bearbeitung von Tabellen). In dieser Einheit lernen wir, KI als Codepartner zu nutzen: daraus mit den richtigen Fragen soliden SQL- und Pandas-Code zu erhalten, diesen Code zu lesen und zu validieren, ihn zu debuggen und ihn niemals blind auszuführen. KI schreibt sich wiederholenden Code in Sekunden statt in Minuten; Es ist jedoch Ihre Aufgabe, sicherzustellen, dass der von ihm erzeugte Code die richtige Spalte mit der richtigen Logik verarbeitet. Funktionierender Code bedeutet nicht, dass der Code korrekt ist.
Warum das Erstellen von Code mit KI leistungsstark, aber riskant ist
KI bietet drei große Vorteile bei der Codegenerierung: Geschwindigkeit (schreibt eine 30-zeilige Group-by-Pivot-Operation in Sekunden), Erinnerung (erinnert Sie an eine Pandas-Funktion, die Sie vergessen haben) und Lehren (erklärt den Code Zeile für Zeile). Aber es birgt drei Risiken: stiller Logikfehler (Code, der die falsche Spalte summiert, läuft ohne Fehler), angepasste Funktion (schlägt eine Methode vor, die nicht existiert) und Yield Trap (Code, der bei kleinen Datenmengen funktioniert, aber bei 10 Millionen Zeilen abstürzt). Deshalb gilt die goldene Regel: Lesen Sie den Code der KI, als ob Sie ihn selbst geschrieben hätten. Geben Sie nicht die Zeile ein, die Sie nicht verstehen.
SQL: Daten an der Quelle verarbeiten
Mit SQL können Sie Daten aus der Datenbank abrufen und dort verarbeiten; Sie können Millionen von Zeilen zusammenfassen, ohne sie in Python zu ziehen. Grundbausteine: SELECT (welche Spalten), WHERE (welche Zeilen), GROUP BY (gruppieren und zusammenfassen), JOIN (Tabellen verbinden), HAVING (Post-Group-Filter). KI ist beim Schreiben komplexer JOINs und Fensterfunktionen sehr hilfreich. Überprüfen Sie jedoch unbedingt zwei Dinge: ob der JOIN über den richtigen Schlüssel erfolgt (der falsche Schlüssel dupliziert Zeilen) und ob die Filterlogik korrekt ist (insbesondere NULL-Verhalten und Datumsbereiche).
Achtung: Führen Sie keine KI-generierte SQL-Abfrage direkt für die Produktionsdatenbank aus. Testen Sie zunächst mit einer kleinen Kopie oder LIMIT. Führen Sie niemals eine UPDATE/DELETE-Abfrage aus, ohne die WHERE-Bedingung zu validieren. Ein falsches WHERE kann die gesamte Tabelle löschen.
Python/Pandas: flexible Analyse
Pandas ist die Standardmethode zum Bearbeiten von Tabellen (DataFrame) in Python. Der effizienteste Einsatz von KI besteht darin, ihr ein klares Schema und einen klaren Zweck zu geben. Am häufigsten verwendete Operationen: Filter, Groupby, Merge, Pivot_Table, Apply. AI schreibt diese schnell; Was Sie überprüfen möchten, ist die Logik: Ist die Gruppierung in der richtigen Spalte, hat die Zusammenführung die Anzahl der Zeilen unerwartet geändert (überprüfen Sie immer die Anzahl der Zeilen nach der Zusammenführung), ändern die Kettenoperationen das Original?
Transaktion
SQL
Pandas
Kontrollpunkt
Filtern
WO
df[df.x > 5]
NULL/NaN-Verhalten
Gruppierung
GRUPPE NACH
df.groupby()
Ist es die richtige Spalte?
verschmelzen
TRETEN SIE MIT
df.merge()
Änderung der Zeilenanzahl
Zusammenfassung
AVG(), SUM()
.mean(), .sum()
Welche Spalte wurde gesammelt?
Sortieren nach
BESTELLEN NACH
.sort_values()
Richtung (aufsteigend/absteigend)
Deduplizierung
UNTERSCHIEDLICH
.drop_duplicates()
In welchen Spalten?
Debuggen: mit KI
Wenn Code fehlschlägt, ist KI ein hervorragender Debugging-Partner. Geben Sie die vollständige Fehlermeldung und den entsprechenden Codeausschnitt an. Aber Vorsicht vor zwei Fallen. Erstens schlägt die KI möglicherweise eine Lösung vor, die den Fehler „zum Schweigen bringt“ (z. B. durch Ausblenden von Warnungen) – dadurch wird der Fehler nicht behoben, sondern ausgeblendet. Zweitens ändert KI manchmal stillschweigend ein anderes Verhalten, während sie ein Problem „löst“. Regel: Verstehen Sie den Fix, beheben Sie ihn nicht und stellen Sie sicher, dass die Ausgabe nach dem Fix immer noch korrekt ist.
Möchten Sie interpretierbaren und wartbaren Code?
Wenn Sie Code von AI kaufen, fragen Sie nach Code, der lesbar und wartbar ist, und nicht nur nach Code, der „funktioniert“. Wenn Sie oder ein Kollege diesen Code Monate später öffnen, sollte er verstehen, was er tut. Um dies zu erreichen, machen Sie es sich zur Gewohnheit, dass die KI drei Dinge einschließt: aussagekräftige Variablennamen (orders_temiz, nicht df2), kurze Kommentarzeilen bei kritischen Schritten (die erklären, warum, nicht was getan wird) und eine benannte Konstante anstelle einer magischen Zahl (ACCEPT_ESIGI = 0,85 statt 0,85 im Code vergraben). Vermeiden Sie außerdem lange einzeilige Ketten (die fünf Aktionen in einer Zeile verbinden); Diese erschweren das Debuggen. Standardmäßig erzeugt KI oft prägnanten und „intelligenten“ Code; Wenn Sie klar sagen: „schreibbar, interpretierbar, wartbar“, erhalten Sie eine wesentlich wartbarere Ausgabe. Dies ist auch die Grundlage der Reproduzierbarkeit (Einheit 10): Code, der nicht verstanden wird, ist Code, der nicht sicher erneut ausgeführt werden kann.
drei Mini-Koffer
Fall 1 – JOIN-Replikation. Ein Analyst kombinierte die Bestellungen mit der Produkttabelle und stellte fest, dass der Gesamtumsatz dreimal höher war. Ursache: Jedes Produkt hatte mehrere Zeilen (verschiedene Farben) in der Produkttabelle; JOIN hat jede Bestellung dupliziert. Der Code der KI „funktionierte“, aber die Anzahl der Zeilen war von 240.000 auf 690.000 gestiegen. Lektion: Überprüfen Sie nach dem Zusammenführen/JOIN immer die Anzahl der Zeilen.
Fall 2 – Anpassungsfunktion. Er schlug einem Praktikanten AI df.groupby('x').summarize() vor; In Pandas gibt es keine solche Methode (es gibt .agg()). Der Code funktionierte nicht, der Praktikant war 20 Minuten lang verloren. Lektion: Überprüfen Sie eine Funktion, die Sie im Dokument nicht kennen; KI kann Methoden erfinden.
Fall 3 – Renditeeinbruch. Ein Code fragte die Datenbank in „Apply“ für jede Zeile ab; Es verkehrte auf 5.000 Leitungen, dauerte 9 Stunden auf 4 Millionen Leitungen und blieb stehen. Als die KI eine vektorisierte (Batch-)Lösung vorschlug, wurde die Zeit auf 40 Sekunden verkürzt. Lektion: Code, der mit kleinen Datenmengen funktioniert, kann bei großen Datenmengen abstürzen; Berücksichtigen Sie die Effizienz.
Vier kopierbare Vorlagen
1) SQL mit Schema anfordern:
Ihre Rolle: SQL-Assistent (PostgreSQL). Tabellen: – Bestellungen (ID, Kunden-ID, Datumszeitstempel, Betrag numerisch) – Kunden (ID, Stadttext) Aufgabe: Ermitteln Sie den Gesamtumsatz und die Anzahl der Bestellungen pro Stadt im Jahr 2024, sortiert nach Umsatz in absteigender Reihenfolge. Erklären Sie, wie Sie mit NULL-Städten umgehen. Ich werde die Abfrage zunächst mit LIMIT testen; UPDATE/DELETE-Generierung.
2) Pandas-Prozess mit Checkpoint:
Ich habe DataFrames df (Bestellungen) und df_customers (Kunden). Berechnen Sie den durchschnittlichen Betrag pro Stadt. WICHTIG: Drucken Sie die Anzahl der Zeilen vor und nach der Zusammenführung aus, damit ich sehen kann, ob Duplikate vorliegen. Erklären Sie, in welcher Spalte Sie zusammengeführt haben und warum Sie sich für innen/links entschieden haben.
3) Erklärung und Überprüfung des Codes:
Erklären Sie den folgenden Pandas-Code Zeile für Zeile: Was macht jede Zeile, welche Annahmen trifft sie, in welchen Fällen könnte sie zu falschen Ergebnissen führen? Lassen Sie mich wissen, ob ich eine Fudge-Funktion verwendet habe. Code: [einfügen]
4) Debuggen:
Dieser Code gibt diesen Fehler aus. Vollständige Fehlermeldung: [Einfügen]. Code: [Einfügen]. Erklären Sie die Hauptursache des Fehlers und beheben Sie ihn. Beheben Sie das Problem, indem Sie das Problem tatsächlich lösen, nicht indem Sie die Warnung stummschalten. Geben Sie außerdem an, ob der Fix die Ausgabe geändert hat.
Schwache Eingabeaufforderung / Starke Eingabeaufforderung
Schwache Eingabeaufforderung:
Schreiben Sie eine Abfrage, die mir Umsätze pro Stadt liefert.
Tabellennamen, Spalten, Datenbanktyp und NULL-Verhalten sind unklar. Die KI ist häufig, sie wird wahrscheinlich eine Abfrage erzeugen, die nicht zu Ihrer Tabelle passt.
Kraftvolle Aufforderung:
Ihre Rolle: SQL-Assistent (MySQL 8). Tabelle: Verkäufe (ID, Stadt Varchar, Betrag Dezimalzahl, Datum Datum). Aufgabe: Ermitteln Sie den Gesamt- und Durchschnittsbetrag sowie die Anzahl der Bestellungen pro Stadt für das Jahr 2024. Absteigend nach Gesamtmenge sortieren; Nur Städte mit mehr als 100 Bestellungen anzeigen (HAVING).NULL Stadt ausschließen. Erklären Sie die Anfrage. Ich werde mit LIMIT testen.
Hier sind Datenbank, Schema, Filter, Sortierung und NULL-Regel selbstverständlich.
Häufige Fehler
- Den Code ausführen, ohne ihn zu lesen. Der funktionierende Code ist kein korrekter Code. Auch der Code, der die falsche Spalte manipuliert, läuft fehlerfrei.
- Die Anzahl der Zeilen wird nach dem Zusammenführen/JOIN nicht überprüft. Der falsche Schlüssel dupliziert stillschweigend Zeilen und erhöht die Gesamtsummen.
- Die Anpassungsfunktion wird nicht überprüft. KI schlägt möglicherweise Methoden vor, die es nicht gibt; Bestätigen Sie anhand des Dokuments, dass Sie es nicht kennen.
- Ich denke nicht an Effizienz. Apply/Loop-Arbeit bei kleinen Datenmengen stürzt bei Millionen von Zeilen ab; vektorisieren.
- Direkt auf der Produktionsdatenbank ausführen. Insbesondere das Ausführen von UPDATE/DELETE ohne WHERE oder Tests ist katastrophal.
Tipp: Gewöhnen Sie sich an, jedem Codestück, das Sie von der KI erhalten, eine „Validierungszeile“ hinzuzufügen: eine Anzahl von Zeilen vor und nach der Verarbeitung, ein paar Beispielzeilen und eine kritische Summe von Hand. Diese drei Prüfungen erkennen die meisten stillen Logikfehler.
Zusammenfassend
AI ist ein leistungsstarker Partner, der schnell SQL- und Pandas-Code erstellt, aber keine blinde Autorität. Geben Sie ihm klar den Plan und den Zweck; Lesen Sie den erzeugten Code, als ob Sie ihn selbst geschrieben hätten. Überprüfen Sie die Anzahl der Zeilen, die Anpassungsfunktionen und den Durchsatz nach dem Zusammenführen/JOIN. Führen Sie es nicht aus, ohne es in der Produktionsdatenbank zu testen. Versuchen Sie beim Debuggen, das Problem zu lösen und nicht, es zum Schweigen zu bringen. Der Code, der funktioniert, ist nicht der richtige Code. Nur Sie können die Genauigkeit garantieren.
Anwendungsaufgabe
Wählen Sie eine Analysefrage (z. B. „Monatlicher Umsatz pro Kanal“) und fordern Sie Code von der KI mit SQL und Pandas an. Lesen Sie beide Codes Zeile für Zeile, überprüfen Sie die Anzahl der Zeilen nach dem Zusammenführen/JOIN und überprüfen Sie manuell mindestens eine kritische Summe. Vergleichen Sie, ob die beiden Codes das gleiche Ergebnis liefern. Wenn anders, finden Sie heraus, warum.
Checkliste
- [ ] Habe ich der KI die Tabelle/das Schema und den Zweck klar mitgeteilt?
- [ ] Habe ich den Code gelesen und verstanden, der Zeile für Zeile erzeugt wurde?
- [ ] Habe ich die Anzahl der Zeilen nach dem Zusammenführen/JOIN überprüft?
- [ ] Habe ich die Funktionen überprüft, die ich aus der Dokumentation nicht erkenne?
- [ ] Habe ich den Code zuerst auf sicheren/kleinen Datenmengen und nicht in der Produktionsumgebung getestet?