Gewinne:
- Fähigkeit, verschiedene Datenquellen (Datenbank, API, Datei, Web-Scraping) und deren Fallstricke zu erkennen und das Schema richtig zu verstehen
- Fähigkeit, wiederholbare Stichproben durchzuführen, indem bewertet wird, ob die Stichprobe die Grundgesamtheit und den Selektionsbias repräsentiert
- Möglichkeit, Datenlecks in der Erfassungsphase zu verhindern und rechtliche/ethische Grenzen einzuhalten, indem in jeder Spalte die Frage „Werde ich sie zum Zeitpunkt der Vorhersage haben“ gestellt wird?
Jede Analyse ist so gut wie die Qualität der Daten, die Sie sammeln. Selbst das fortschrittlichste Modell der Welt wird unzuverlässige Ergebnisse liefern, wenn es mit Daten arbeitet, die falsch erfasst oder voreingenommen erfasst wurden oder Informationen über die Zukunft enthalten. In der Informatik wird dieses Prinzip als „Garbage in, Garbage out“ (Müll rein, Müll raus) zusammengefasst. In dieser Einheit behandeln wir die Phase der Datenerfassung: Verstehen der Quelle, Probenahme, Stellen von Qualitätsfragen und Wachsamkeit gegenüber dem Risiko von Datenlecks vom ersten Tag an. Künstliche Intelligenz ist in dieser Phase eine leistungsstarke Hilfe; Schreibt SQL-Abfragen, fasst API-Dokumente zusammen und entwirft Datenverträge. Aber es ist der Mensch, der entscheidet, welche Daten Sie sammeln und ob diese Daten Sie repräsentieren.
Datenquellen kennenlernen
Daten stammen von verschiedenen Orten und jede Quelle hat ihre eigenen Fallstricke. Datenbanken (strukturierte Daten, die in Tabellen gespeichert sind und normalerweise mit SQL abgefragt werden) sind die häufigste Quelle. Es ist zuverlässig, aber man muss sein Schema gut verstehen. API (Application Programming Interface) stellt Live-Daten bereit, birgt jedoch das Risiko von Geschwindigkeitsbegrenzungen und Formatänderungen. Dateien (CSV, Excel, JSON) sind flexibel, aber anfällig für Formatinkonsistenzen. Web Scraping ist leistungsstark, hat jedoch rechtliche und ethische Grenzen; Nicht jede Site kann gescrapt werden.
Achtung: Beachten Sie beim Web Scraping und der automatischen Datenerfassung die Nutzungsbedingungen der Website, die robots.txt-Datei und KVKK/DSGVO. Die unbefugte Datenerfassung führt zu einer rechtlichen Haftung. Verwenden Sie im Rahmen der Informationssicherheit Datenerfassungstools nur auf Systemen, für die Sie autorisiert sind, und zu Verteidigungs-/Analysezwecken; Unbefugter Zugriff oder Scraping ist verboten.
Das Schema verstehen: Sich mit den Daten vertraut machen
Bevor Sie einen Datensatz erfassen, müssen Sie sein Schema verstehen (die Namen der Spalten, ihre Datentypen, ihre Bedeutungen und ihre Beziehungen untereinander). KI ist hier sehr nützlich bei der Erstellung eines „Datenwörterbuchs“ – einer Tabelle, die erklärt, was jede Spalte bedeutet. Aber die Erklärungen, die KI liefert, sind Vorhersagen; Bestätigen Sie die wahre Bedeutung jeder Spalte mit dem Team, das die Daten erstellt hat. Beispielsweise könnte eine Spalte mit dem Namen „status“ 0/1/2 enthalten; Nur das ursprüngliche Team weiß, ob diese „ausstehend/genehmigt/storniert“ oder etwas anderes sind.
Die folgende Tabelle fasst die grundlegenden Ressourcentypen und Vorsichtsmaßnahmen zusammen:
Quelle
Stärke
Falle
Wie KI hilft
SQL-Datenbank
Strukturell, zuverlässig
Komplexe JOINs
Schreibt einen Abfrageentwurf
API
Live-Daten
Geschwindigkeitsbegrenzung, Formänderung
Dokumentzusammenfassungen, Pull-Code
CSV/Excel
Flexibel, schnell
Formatinkonsistenz
Code lesen/analysieren
Web-Scraping
Große Reichweite
Rechtliche/ethische Grenze
Parsing-Entwurf (innerhalb der Autorität)
Protokoll-/Ereignisdaten
detailliert
riesiges Volumen
Filterabfrage
Veranschaulichung: Stellt der Teil das Ganze dar?
Meistens arbeiten Sie mit einer Stichprobe (einer aus der Grundgesamtheit ausgewählten Teilmenge) und nicht mit den gesamten Daten. Die entscheidende Frage ist: Repräsentiert diese Stichprobe die Bevölkerung? Selektionsbias ist die häufigste Falle. Wenn Sie beispielsweise nur Benutzer aus der mobilen App befragen, werden Sie keine Webbenutzer sehen und Ihre Ergebnisse werden irreführend sein. In den meisten Fällen ist eine Zufallsstichprobe (jeder Datensatz hat die gleiche Wahrscheinlichkeit, ausgewählt zu werden) die sicherste Methode. Bei Zeitreihendaten erfolgt die Aufteilung jedoch chronologisch und nicht zufällig (wir werden dies in den Einheiten 7 und 10 sehen).
Leak-Bewusstsein vom ersten Tag an
Datenlecks sind die Ursache der meisten Katastrophen und treten normalerweise während der Datenerfassungsphase auf. Beispiel: Wenn Sie bei der Vorhersage „Wurde die Stornierung storniert“ die Spalte „Stornierungsdatum“ zu den Daten hinzufügen, blickt das Modell in die Zukunft. Stellen Sie während der Erfassungsphase für jede Spalte eine Frage: „Verfüge ich tatsächlich über diese Informationen, wenn ich die Vorhersage treffe?“ Wenn die Antwort „Nein“ lautet, ist diese Spalte undicht. Wir werden dieses Thema in Einheit 10 ausführlich behandeln; Aber das Bewusstsein sollte vom ersten Tag an beginnen.
drei Mini-Koffer
Fall 1 – Das Problem der Repräsentation. Eine Bank hat für ihr Kreditrisikomodell nur Daten zu genehmigten Krediten erhoben (18.500 Datensätze). Ablehnungen waren in den Daten nicht enthalten. Das Modell war in der realen Welt falsch, weil es nie sah, wie sich Ausschussmitglieder verhalten würden. Lektion: Die Stichprobe sollte repräsentativ für die gesamte Bevölkerung sein, aus der Sie Ihre Entscheidung treffen.
Fall 2 – Stille Formänderung. Ein Team hat jeden Tag Preisdaten von einer API abgerufen. Eines Tages änderte der API-Anbieter die Währung von USD in EUR, der Domainname blieb jedoch derselbe. Die Daten wurden 12 Tage lang in der falschen Einheit erfasst; 3.200 Leitungen waren beschädigt. Lektion: Überprüfen Sie regelmäßig die Volumen- und Formatkonsistenz in API-Daten.
Fall 3 – Frühe Leckage. Ein Analyst hat die Spalte „Grund für die Kontoschließung“ einbezogen, als er Daten für eine „Abwanderungs“-Schätzung sammelte. Diese Spalte wurde erst gefüllt, nachdem der Kunde gegangen war. Das Modell ergab im Testsatz eine Genauigkeit von 97 %; In der Produktion funktionierte es nicht, da diese Spalte zum Vorhersagezeitpunkt leer war. Lektion: Stellen Sie jeder Spalte die Frage: „Habe ich sie zum Zeitpunkt der Vorhersage?“
Vier kopierbare Vorlagen
1) Extraktion des Datenwörterbuchs:
Ihre Rolle: Assistent eines Datenwissenschaftlers. Nachfolgend sind die Spaltennamen und Beispielwerte (anonym) einer Tabelle aufgeführt. Listen Sie für jede Spalte ihre geschätzte Bedeutung, ihren Datentyp und potenzielle Qualitätsrisiken in einer Tabelle auf. Markieren Sie die Spalten, bei denen Sie sich nicht sicher sind, als „Bestätigung erforderlich“; Bedeutung machen.Spalten: [hier einfügen]
2) Sampling-Code (zufällig, wiederholbar):
Ich habe Pandas df. Schreiben Sie Code, der eine repräsentative 5 %-Zufallsstichprobe aus 200.000 Zeilen extrahiert. Verwenden Sie random_state=42 (zur Reproduzierbarkeit). Fügen Sie Code hinzu, um zu überprüfen, ob die Klassenverteilung der Stichprobe der Grundgesamtheit ähnelt.
3) Frage zur Lecksuche:
Ich gebe Ihnen diese Liste von Spalten. Mein Ziel ist es, vorherzusagen, ob es abgesagt wird (0/1). Bewerten Sie für jede Spalte, ob ich sie zum Zeitpunkt der Vorhersage tatsächlich haben werde, und markieren Sie sie als „sicher / verdächtig / Leck“. Formulieren Sie Ihre Begründung in einem Satz. Spalten: [Liste]
4) SQL-Pull-Abfrageentwurf:
Ich habe Tabellen „Bestellungen“ und „Kunden“ in PostgreSQL. Schreiben Sie eine JOIN-Abfrage, die die Bestellungen der letzten 90 Tage mit der Kundenstadt kombiniert und den Gesamtbetrag und die Anzahl der Bestellungen pro Stadt zurückgibt. Erklären Sie den Datumsfilter und den Umgang mit NULL-Städten. Ich werde die Abfrage ausführen und überprüfen.
Schwache Eingabeaufforderung / Starke Eingabeaufforderung
Schwache Eingabeaufforderung:
Holen Sie mir gute Beispieldaten aus dieser Datenbank.
„Gut“ ist mehrdeutig; Welches Gemälde, welche Zeit, welche Größe, welcher Zweck, ist nicht klar. KI wird nur eine generische, möglicherweise falsche Abfrage erzeugen.
Kraftvolle Aufforderung:
Ihre Rolle: SQL-Assistent. Ich habe eine „Transaktionen“-Tabelle: Spalten-ID, Kunden-ID, Datum (Zeitstempel), Betrag (numerisch), Kanal (Text: „Web“/„Mobil“). Aufgabe: Schreiben Sie eine wiederholbare (deterministische mit ORDER BY) Abfrage, die 10.000 repräsentative Zeilen von jedem Kanal für das Jahr 2024 zurückgibt. Zweck: Kanalvergleichsanalyse. Listen Sie die Annahmen Ihrer Abfrage auf.
Hier sind Tabelle, Zweck, Größe und Wiederholbarkeit klar.
Häufige Fehler
- Die Repräsentativität der Stichprobe wird nicht in Frage gestellt. Leicht zugängliche Daten sind keine genauen Daten; Auswahlverzerrungen verzerren das Ergebnis.
- Spaltenbedeutungen an KI anpassen. Das Quellenteam kennt die Bedeutung; Verwenden Sie die KI-Vorhersage nicht, ohne sie zu bestätigen.
- API-Format-/Einheitsänderung wird nicht verfolgt. Die stille Änderung sammelt tagelang beschädigte Daten.
- Ignorieren des Lecks bei der Sammlung. Wenn die Frage „Habe ich es zum Zeitpunkt der Vorhersage?“ nicht frühzeitig gestellt wird, liefert das Modell einen falschen Erfolg.
- Sammeln nicht autorisierter oder illegaler Daten. Ein Verstoß gegen robots.txt, Nutzungsbedingungen und KVKK stellt ein ernstes Risiko dar.
Tipp: Bewahren Sie für jede neue Datenquelle eine einseitige „Datenkarte“ auf: Quelle, Abrufdatum, Anzahl der Zeilen, bekannte Grenzen und Spalten, bei denen das Risiko eines Lecks besteht. Diese Karte speichert die Frage „Was waren das für Daten?“ und ermöglicht die Reproduzierbarkeit Monate später.
Zusammenfassend
Die Qualität der Analyse wird durch die Qualität der erhobenen Daten begrenzt. Kennen Sie die Quelle (Datenbank, API, Datei, Scrape) und das Schema gut; Stellen Sie sicher, dass die Stichprobe für die Bevölkerung repräsentativ ist. Beseitigen Sie Lecks vom ersten Tag an, indem Sie jede Spalte fragen: „Habe ich sie zum Zeitpunkt der Vorhersage?“ KI ist ein großartiger Beschleuniger für die Abfrage- und Dokumentenarbeit, aber der Mensch entscheidet, welche Daten gesammelt werden und wie repräsentativ sie sind. Grenzen von Autorität, Gesetz und Vertraulichkeit stehen immer an erster Stelle.
Anwendungsaufgabe
Wählen Sie eine Datenquelle (aus Ihrem eigenen Unternehmen oder hypothetisch). Erhalten Sie einen Entwurf eines Datenwörterbuchs von AI mit der oben genannten Vorlage „Datenwörterbuch-Extraktion“. Bewerten Sie dann jede Spalte manuell, um festzustellen, ob sie durchgesickert ist. Versuchen Sie, mindestens eine verdächtige/undichte Spalte zu finden und schreiben Sie in einem Satz, warum dies riskant ist.
Checkliste
- [ ] Habe ich die Datenquelle und das Schema mit dem Quellteam bestätigt?
- [ ] Habe ich überprüft, ob die Stichprobe repräsentativ für die Bevölkerung ist?
- [ ] Habe ich jeder Spalte die Frage gestellt: „Werde ich sie zum Zeitpunkt der Schätzung haben?“
- [ ] Habe ich die Probenahme wiederholbar gemacht (fester Seed)?
- [ ] Habe ich die rechtlichen/ethischen (Behörde, robots.txt, KVKK) Sammelgrenzen überprüft?