Gewinne:
- Fähigkeit, den sechsstufigen Arbeitsablauf der Datenwissenschaft (Problemdefinition, Sammlung, Bereinigung, Entdeckung, Modellierung, Kommunikation) und die Autorität, unter der künstliche Intelligenz in jeder Phase arbeitet, entsprechend der Aufgabenrisikostufe zu unterscheiden
- Fähigkeit, eine Disziplin anzuwenden, die jede Ausgabe künstlicher Intelligenz überprüft, indem sie sie mit der Quelle verbindet, ausführt, vergleicht und einer Expertenfilterung unterzieht.
- Fähigkeit, Reproduzierbarkeits- und Datenschutzprinzipien (Schreiben in Code, Anonymisierung) vom ersten Tag an in Analysegewohnheiten umzuwandeln
Täglich landen rohe, unordentliche und oft „verlogene“ Daten auf dem Schreibtisch eines Datenwissenschaftlers. In der Verkaufstabelle wird die Datumsspalte in drei verschiedenen Formaten geschrieben; Kundennummern sind in einigen Zeilen leer; Der Name einer Spalte lautet „Einkommen“, sie enthält jedoch sowohl TL- als auch USD-Werte. Die Aufgabe der Datenwissenschaft besteht darin, aus diesem Chaos eine verlässliche Entscheidung zu treffen: Daten sammeln, bereinigen, untersuchen, ein Modell erstellen, das Ergebnis validieren und daraus eine Geschichte machen. Künstliche Intelligenz (KI oder kurz KI – Computersysteme, die Text und Code generieren, Muster erkennen, zusammenfassen und Vorhersagen treffen können) kann jedes Glied in dieser Kette berühren: Bereinigungscode in Minuten schreiben, Diagramme für explorative Analysen empfehlen, die Metrik eines Modells interpretieren, eine SQL-Abfrage korrigieren. Aber dieselbe KI kann Ihnen auch eine sichere Erfindung wie „Korrelation 0,72“ für Daten liefern, die sie noch nie gesehen hat.
Diese erste Einheit ist keine Einführung in die Bibliothek. Sein Zweck besteht darin, klarzustellen, wo KI in den Data-Science-Workflow eingesetzt werden sollte und wo nie. Lassen Sie uns das Grundprinzip von Anfang an darlegen: KI ist ein Assistent, kein Datenwissenschaftler. Die Entscheidung darüber, welche Daten gesammelt werden sollen, welche Metrik verwendet werden soll, ob ein Modell in Produktion geht und wo ethische Grenzen gezogen werden sollen, liegt beim kompetenten Experten. Eine nicht verifizierte KI-Ausgabe ist riskant, ebenso wie ein nicht signierter Analysebericht.
Data-Science-Workflow: End-to-End-Karte
Um ein Datenprojekt zu verstehen, ist es hilfreich, es in sechs Phasen zu unterteilen. Das gesamte Modul folgt dieser Karte.
1. Problemstellung: Was messen wir, warum, um welche Entscheidung zu unterstützen? Diese Phase wird nicht an die KI delegiert; Es ist die Person, die den Job definiert.
2. Datenerfassung: Quellen identifizieren, Daten extrahieren, Stichproben entnehmen. (Einheit 2)
3. Datenbereinigung und Vorverarbeitung: Fehlender Wert, Ausreißer, Typkonvertierung. (Einheit 3)
4. Explorative Datenanalyse (EDA – Exploratory Data Analysis, die Phase des Erkennens der Verteilung und Beziehungen der Daten „mit dem Auge“): (Einheit 4)
5. Feature Engineering und Modellierung: Variablengenerierung, Algorithmusauswahl, Training, Bewertung. (Einheit 5, 6, 7)
6. Kommunikation und Produktion: Visualisierung, Story, MLOps (Disziplin, das Modell live zu nehmen und zu überwachen). (Einheit 8, 11)
In jeder dieser sechs Phasen operiert die KI mit einer anderen Autorität. Die folgende Tabelle fasst diese Verteilung der Befugnisse zusammen. Dies ist die wichtigste Tabelle des Moduls.
Bühne
Rolle der KI
Risikostufe
Wer stimmt zu
Problemdefinition
Brainstorming-Partner
niedrig
Datenwissenschaftler + Stakeholder
Schreiben Sie einen Bereinigungscode
Code-Skizzengenerator
mittel
Datenwissenschaftler (liest Code)
EDA-Kommentar
Mustervorschlag
mittel
Datenwissenschaftler
Feature-Generierung
Ideen- und Codegenerator
mittelhoch
Leckagekontrolle ist ein Muss
Modellauswahl/Metrik
Berater
hoch
Datenwissenschaftler
Entscheidung zur Produktion
Hilfseingang
sehr hoch
Team + Geschäftsinhaber
Ethik-/Datenschutzgenehmigung
Stimulans
sehr hoch
menschlich, immer
Denken Sie an den einen Satz aus dieser Tabelle: Je höher der Einsatz, desto kleiner wird die Rolle der KI und desto größer die Zustimmung der Menschen.
Warum die Verifizierung das Herzstück dieses Geschäfts ist
KI-Sprachmodelle sehen sicher aus, sind es aber möglicherweise nicht. In der Fachsprache nennt man das Halluzination: Dabei handelt es sich um die Erfindung nichtexistenter Informationen durch das Modell in einem fließenden Satz, als ob diese wahr wären. In der Datenwissenschaft gibt es drei Formen davon. Die erste ist eine gefälschte Zahl: Wenn Sie das Modell fragen, „Wie hoch ist die durchschnittliche Bestellmenge“, ohne irgendwelche Daten anzugeben, wird es Ihnen selbstbewusst eine Zahl nennen, obwohl es Ihre Daten nie gesehen hat. Die zweite ist eine Funktion, die nicht existiert: Das Modell schlägt möglicherweise eine Funktion vor, die überhaupt nicht existiert, wie etwa pandas.read_excel_fast(). Drittens, falsche statistische Interpretation: Das Modell kann einen klassischen statistischen Fehler wie „Der p-Wert beträgt 0,04, die Hypothese ist also zu 96 % korrekt“ problemlos wiederholen.
Die Verifizierungsdisziplin besteht aus drei Schritten:
- Link zur Quelle: Jede Zahl, Rate und jeder Trend sollte aus Ihren Daten stammen, nicht aus dem Speicher der KI. Verwenden Sie KI für Code, der mit Daten arbeitet, nicht für die Speicherung von Daten.
- Ausführen und vergleichen: Führen Sie jeden von der KI bereitgestellten Code selbst aus. Vergleichen Sie jede erzeugte Metrik mit einer unabhängigen Basislinie.
- Expertenfilter: Testen Sie selbst, ob die Ausgabe im Widerspruch zu Statistiken und Domänenwissen steht.
Achtung: Eine von der KI geschriebene Analyse in eine Präsentation einzufügen, ohne sie auszuführen und zu lesen, ist wie die Präsentation eines nicht signierten Berichts. Nur weil der Code funktioniert, heißt das nicht, dass er korrekt ist. Auch ein Code, der die falsche Spalte summiert, funktioniert fehlerfrei.
Reproduzierbarkeit: das gleiche Ergebnis zweimal erzielen zu können
Das stille, aber entscheidende Prinzip der Datenwissenschaft ist die Reproduzierbarkeit: Wenn Sie eine Analyse sechs Monate später oder auf einem anderen Computer erneut durchführen, erhalten Sie das gleiche Ergebnis. Dieses Risiko erhöht sich bei der Arbeit mit KI, denn wenn man der KI sagt, sie solle „dieses Diagramm erstellen“ und es manuell abspielen, verschwinden die Schritte. Regel: Jeder Schritt muss in der Code- und Versionskontrolle (wie Git) registriert werden; In Schritten mit Zufälligkeit sollte der Zufallsstartwert (der Anfangswert des Zufallszahlengenerators; wenn er festgelegt ist, ist das Ergebnis wiederholbar) festgelegt sein. Wir werden dieses Thema in Einheit 10 vertiefen; Machen Sie es sich vorerst zur Gewohnheit: „Klicken Sie nicht mit der Hand, sondern schreiben Sie im Code.“
drei Mini-Koffer
Fall 1 – Sichere Beschleunigung. Ein E-Commerce-Analyst würde normalerweise einen halben Tag damit verbringen, eine Bestelltabelle mit 240.000 Zeilen zu löschen. Er gab der KI die Spaltennamen und die ersten 5 Zeilen (ohne persönliche Daten) und fragte nach dem Pandas-Reinigungscode. Die KI erzeugte einen Entwurf in 8 Sekunden. Der Analyst las den Code Zeile für Zeile, behob einen Fehler bei der Datumsanalyse und führte ihn aus. Dauer: 35 Minuten statt 4 Stunden. Die KI lieferte den Code, die Verifizierung blieb dem Menschen überlassen.
Fall 2 – Die erfundene Metrikfalle. Ein Praktikant fragte die KI: „Wie genau ist Random Forest auf diesen Daten?“ ohne das Modell überhaupt zu trainieren. „Etwa 89 %“, sagte AI. Der Praktikant brachte dies in die Präsentation ein; Beim Training des realen Modells betrug die Genauigkeit 71 %. Fehler: Auf Metriken warten, ohne Daten und Modelle an die KI weiterzugeben.
Fall 3 – Stilles Leck. Ein Team setzte die von der KI vorgeschlagene Idee „Füge den Mittelwert der Zielvariablen als Merkmal hinzu“ um, ohne sie in Frage zu stellen. Das Modell erbrachte im Testsatz eine Leistung von 98 %, stürzte jedoch in der Produktion ab, weil die Funktion zukünftige Informationen preisgab (Datenleck, Einheit 10). Fehler: Keine statistische Filterung der KI-Empfehlung.
Schwache Eingabeaufforderung / Starke Eingabeaufforderung
Schwache Eingabeaufforderung:
Analysieren Sie diese Verkaufsdaten und teilen Sie mir den durchschnittlichen Umsatz mit.
Diese Behauptung ist fehlerhaft: Der KI wurden keine Daten übermittelt, sodass das „Durchschnittseinkommen“ nur erfunden werden kann. Weder die Spalten, noch der Zeitraum, noch die Währung sind eindeutig.
Kraftvolle Aufforderung:
Ihre Rolle: Assistent, der einem Datenwissenschaftler hilft. Ich habe einen Pandas DataFrame: df. Spalten: – order_date (Text, im Format „2024-03-01“) – amount_tl (dezimal, NaN in einigen Zeilen) – customer_id (Ganzzahl) Aufgabe: (1) Pandas-Code schreiben, der den durchschnittlichen Betrag berechnet, (2) erklären, wie NaN-Werte verarbeitet werden, (3) die Annahmen auflisten, die der Code trifft. Erfinden Sie den Dateninhalt nicht; Generieren Sie einfach Code und ich werde das Ergebnis ausführen und überprüfen.
In diesem Antrag werden die Vorgehensweise, die Erwartung und das „Fabrikationsverbot“ deutlich. Sie führen die Ausgabe weiterhin selbst aus und überprüfen sie.
Die Anfänge von Ethik und Privatsphäre
Data Science arbeitet häufig mit personenbezogenen Daten: Kunden-, Patienten- und Mitarbeiterdaten. KVKK (Gesetz zum Schutz personenbezogener Daten) in der Türkei und DSGVO in Europa schützen diese Daten. Das Einfügen Ihres richtigen Namens, Ihrer ID, Ihrer E-Mail-Adresse oder Ihrer Adresse in ein öffentliches KI-Tool stellt einen Verstoß dar. Regel: Daten vor der Freigabe anonymisieren, nur Schema (Spaltennamen, Typen) und bei Bedarf eine Dummy-Beispielzeile bereitstellen. Das Thema Ethik werden wir in Einheit 11 vertiefen; Fassen wir das Prinzip von Anfang an zusammen: Um die Daten zu verstehen, reicht es oft aus, ihre Struktur und nicht ihren Inhalt zu teilen.
Häufige Fehler
- Warten auf Zahlen/Metriken, ohne Daten an die KI weiterzugeben. Das Modell kann nicht auf die Daten zugreifen; Die von ihm angegebene Nummer ist gefälscht. Lassen Sie das Ergebnis immer berechnen und ausführen.
- Ich denke, dass der Arbeitscode korrekt ist. Der Code, der die falsche Spalte manipuliert, läuft ebenfalls fehlerfrei; Vertrauen Sie nicht, ohne die Logik zu lesen.
- Einfügen echter personenbezogener Daten in das geöffnete Tool. Name, ID-Nummer und E-Mail werden niemals weitergegeben; Das Diagramm reicht aus.
- Die Schritte manuell ausführen und nicht in den Code schreiben. Eine nicht reproduzierbare Analyse ist unzuverlässig.
- Ich akzeptiere die Interpretation von Statistiken durch die KI ohne Frage. KI kann klassische Fehler in Konzepten wie p-Wert und Korrelation wiederholen.
Tipp: Fügen Sie in jede Ihrer KI-Sitzungen eine kurze „Regellinie“ ein: „Erfinden Sie den Dateninhalt nicht; generieren Sie einfach Code/Analyse und ich führe das Ergebnis aus und verifiziere es; geben Sie ‚nicht sicher‘ an, wenn Sie unsicher sind.“ Dieser einzelne Satz reduziert das Risiko von Halluzinationen erheblich.
Zusammenfassend
KI ist ein leistungsstarker Assistent in der Datenwissenschaft: Sie beschleunigt die Bereinigung von Code, die EDA-Interpretation, Modellempfehlung und Visualisierung. Aber Problemdefinition, metrische Auswahl, Produktionsentscheidung und ethische Grenzen gehören zum Menschen. Der Arbeitsablauf besteht aus sechs Phasen und die Rolle der KI wird mit zunehmendem Risiko kleiner. Drei Gewohnheiten sind die Grundlage von allem: Quellenverknüpfung (Validierung), Reproduzierbarkeit (Kodierung) und Anonymisierung (Vertraulichkeit). Sobald Sie diese drei verinnerlicht haben, wird jedes Werkzeug im Rest des Moduls zu einem sicheren Beschleuniger für Sie.
Anwendungsaufgabe
Erstellen Sie einfach ein Schema einer kleinen Tabelle, die Sie haben (oder einer hypothetischen): Spaltennamen, Typen und 2-3 Dummy-Beispielzeilen (ohne echte persönliche Daten). Bitten Sie die KI um einen zusammenfassenden Statistikcode, indem Sie die Vorlage „Leistungsstarke Eingabeaufforderung“ oben verwenden. Führen Sie den Code aus, vergleichen Sie die Ausgabe mit einem manuellen Wert, prüfen Sie, ob falsche Annahmen vorliegen, und notieren Sie Ihre Ergebnisse in fünf Aufzählungspunkten.
Checkliste
- [ ] Habe ich der KI nur ein Schema und ein gefälschtes Beispiel anstelle echter persönlicher Daten gegeben?
- [ ] Habe ich den erzeugten Code Zeile für Zeile gelesen und ausgeführt?
- [ ] Habe ich jede Zahl in der Ausgabe unabhängig überprüft?
- [ ] Habe ich jeden Schritt der Analyse in den Code geschrieben und ihn wiederholbar gemacht?
- [ ] Habe ich den Risikograd der Mission ermittelt und die endgültige Entscheidung einem Menschen übertragen?