Einheit 2 / 11

Datenbereinigung und -vorbereitung: Fehlende Daten, Ausreißer und Codierung

Gewinne:

  • Fähigkeit, fehlende Datentypen (MCAR/MAR/MNAR), Ausreißer und Codierungsfehler zu erkennen und KI mit den richtigen Daten zu verwenden, um Bereinigungscode und Diagnosen zu erstellen
  • Möglichkeit zu sehen, wie sich jeder von der künstlichen Intelligenz vorgeschlagene Reinigungsschritt (Löschung, Zuweisung, Transformation) auf das Analyseergebnis auswirkt und einen umkehrbaren und dokumentierten Arbeitsablauf etabliert
  • Die Behauptung, dass Bereinigungsentscheidungen auf der Kenntnis des Prozesses basieren, der Daten generiert, und dass künstliche Intelligenz ein überwachter Assistent und kein blinder Automat ist

Jeder erfahrene Analyst kennt eine Wahrheit: Die meiste Zeit eines empirischen Projekts ist nicht die Modellierung, sondern die Datenbereinigung (die Arbeit, Fehler, Auslassungen und Inkonsistenzen in den Daten zu korrigieren und sie für die Analyse vorzubereiten). Als grobe Faustregel gilt, dass etwa 70–80 % der Zeit für das Verstehen, Bereinigen und Transformieren von Daten aufgewendet werden; Für die eigentliche Analyse bleiben nur noch 20-30 % übrig. In dieser Einheit erfahren wir Schritt für Schritt, wie künstliche Intelligenz (KI) Ihnen diese schwere Last abnimmt, welche Entscheidungen Ihnen aber dennoch überlassen bleiben sollten und warum.

Lassen Sie uns zunächst zwei grundlegende Fakten hervorheben. Erstens basieren Bereinigungsentscheidungen auf Ihrem Wissen über den Prozess, der die Daten erzeugt: Nur Sie wissen, warum ein Wert fehlt oder warum eine Zahl zu groß ist. KI sieht die Daten nicht, kennt den Kontext nicht; Schreibt Code, trifft keine Entscheidungen. Zweitens kann jeder Reinigungsschritt das Analyseergebnis verändern. Das Löschen eines Ausreißers kann den Koeffizienten umkehren; Durch das Auffüllen der fehlenden Werte mit dem Mittelwert kann die Varianz künstlich verringert werden. Daher sollte die Bereinigung umkehrbar und dokumentiert sein: Berühren Sie niemals die Rohdaten, führen Sie jeden Schritt im Code aus und zeichnen Sie die Auswirkungen jedes Schritts auf.

Schritt-für-Schritt-Reinigungsablauf

1. Kennen Sie die Daten. Sehen Sie sich zunächst die Struktur an: Anzahl der Zeilen (Beobachtungen) und Spalten (Variablen), Typ jeder Variablen (numerisch, kategorisch, Datum), zusammenfassende Statistiken, Anzahl der fehlenden Variablen. Sie können die KI nach diesem „Datenprofil“-Code fragen; Aber Sie lesen die Ausgabe und stellen Fragen wie „Warum kam diese Variable als Text?“

2. Fehlende Daten verstehen und klassifizieren. Fehlende Daten werden in drei Typen unterteilt. MCAR (Missing Completely At Random): Das Fehlen ist nicht darauf zurückzuführen, dass beispielsweise ein Sensor zufällig ausgefallen ist. MAR (Missing At Random): Das Fehlen hängt von anderen beobachteten Variablen ab, zum Beispiel lassen ältere Menschen eine Frage häufiger leer, aber Sie wissen, wie alt sie sind. MNAR (Missing Not At Random): Das Fehlen hängt vom unbeobachteten Wert selbst ab, beispielsweise melden Gutverdiener ihr Einkommen nicht. Diese Unterscheidung ist entscheidend, da sie die Lösungsmethode bestimmt und die KI dies nicht für Sie entscheiden kann.

3. Behandeln Sie den Mangel. Optionen: Listenweises Löschen, Mittelwert-/Median-Imputation, modellbasierte Mehrfachimputation. Das Löschen in MCAR ist relativ sicher, verringert jedoch die Stichprobengröße. In MAR ist eine Mehrfachzuweisung sinnvoller. Keine einfache Methode garantiert Unvoreingenommenheit in MNAR; Der Mangelmechanismus sollte modelliert oder zumindest eine Sensitivitätsanalyse durchgeführt werden. Das Auffüllen mit Mittelwerten ist einfach, aber gefährlich: Es verringert die Varianz, schwächt Beziehungen und verbirgt Unsicherheit.

4. Untersuchen Sie Ausreißer. Ein Ausreißer ist eine Beobachtung, die sehr weit von den anderen entfernt ist. Trennen Sie die beiden Fragen: Handelt es sich um einen Fehler (in der Dateneingabe wurde das Alter 999 angegeben) oder handelt es sich um einen realen, aber abweichenden Wert (Einkommen eines Milliardärs)? Fehler beheben; Löschen Sie keine echten Ausreißer, da sie Daten darstellen. Wenn Sie den Ausreißer löschen, „weil er Sie stört“, verzerren Sie die Daten in Richtung des Ergebnisses.

5. Codierung und Konsistenz. Standardisieren Sie Kategorien („Männlich“, „männlich“, „E“ alle in einem Code), bringen Sie Daten in ein Format, Einheiten in eine Skala, erkennen Sie doppelte Zeilen. Dies ist die Phase mit dem geringsten Risiko, in der KI am besten hilft.

6. Dokumentieren und einfrieren. Zeichnen Sie jeden Schritt mit Code und einer Kommentarzeile auf und halten Sie Rohdaten und bereinigte Daten getrennt. Wenn also ein Schiedsrichter fragt: „Warum wurden diese Beobachtungen verworfen?“ Sie haben Ihre Antwort parat.

Achtung: Treffen Sie Reinigungsentscheidungen nicht auf der Grundlage von Ergebnissen. Das Löschen einer Zeile mit der Aufschrift „Wenn Sie diese Zeile löschen, wird der Koeffizient signifikant“ ist die heimtückischste Form des P-Hackings, die wir in der nächsten Einheit sehen werden.

Vergleichstabelle: fehlende Datenmethoden

Methode

Wann ist es angemessen?

Risiko

Rolle der KI

Eine Zeile löschen

MCAR, niedrige Fehlquote

Stichprobe wird kleiner, Verzerrung bei MAR/MNAR

Schreibt den Code; Sie entscheiden

Mittelwert/Median-Zuordnung

Schnelle Voranalyse

Reduziert die Varianz, verbirgt Beziehungen

Es ist einfach, wird aber nicht empfohlen. sollte warnen

Mehrfachbelegung (MI)

MAR, wichtige Variablen

Bei unsachgemäßer Installation ist es irreführend

Empfiehlt Code und Paket (Mäuse)

Mechanismusmodellierung

MNAR

Komplex, annahmeintensiv

Nur Entwurf; Experte ist erforderlich

Vier kopierbare Eingabeaufforderungen

1. Datenprofilierung:

Ihre Rolle: Datenbereinigungsassistent. Ich gebe die Daten nicht weiter, ich möchte den R-Code. Ich habe einen data.frame namens „digit“; Variablen: ID, Alter (numerisch), Einkommen (numerisch), Bildung (kategorisch), Region (kategorisch), Datum (Datum). Aufgabe: Schreiben Sie Code, der Typ, fehlende Zahl und Rate für jede Variable, zusammenfassende Statistiken für numerische Variablen und eine Häufigkeitstabelle für kategoriale Variablen erstellt. Kommentarzeile hinzufügen.

2. Diagnose fehlender Daten:

Schreiben Sie Code, der das fehlende Muster für die oben genannten Zifferndaten untersucht: - die fehlende Rate jeder Variablen, - eine einfache Tabelle/Grafik, die die Beziehung des Fehlens zu anderen Variablen zeigt. Ich werde mir die Ausgabe des Codes ansehen und die Unterscheidung zwischen MCAR/MAR/MNAR treffen. Sie erstellen lediglich das Diagnosetool und entscheiden NICHT über die Zuweisungsmethode.

3. Ausreißerprüfung (keine Löschung):

Schreiben Sie Code für die Variable „Einkommen“, der Ausreißer untersucht, OHNE LÖSCHEN: Boxplot, IQR-basierte Grenzen und eine Tabelle mit Ausreißerbeobachtungen + Werten. Ich werde sehen, ob das Fehler sind oder echt sind. Automatisches Löschen hinzufügen.

4. Codierungsstandardisierung:

In der Variable „Bildung“ werden die Werte gemischt geschrieben: „Grundschule“, „Grundschule“, „PRIMÄR“, „Gymnasium“, „Gymnasium“, „Universität“, „univ“. Schreiben Sie R-Code, der diese in konsistente Kategorien umkodiert; Zeigen Sie die Zuordnungstabelle deutlich an, damit ich jede Konvertierung bestätigen kann. Setzen Sie den Wert, den Sie nicht kennen, auf „UNBEKANNT“.

Schwache Eingabeaufforderung / Starke Eingabeaufforderung

Schwache Eingabeaufforderung:

Bereinigen Sie die Daten, füllen Sie die Lücken und verwerfen Sie die Ausreißer.

Diese Forderung ist gefährlich: Sie gibt der KI blinde Autorität. Welche Art von Fehlen, welche Art von Füllung, welche widersprüchliche Wahrheit – nichts davon ist klar. Das Ergebnis kann ein insgeheim voreingenommener Datensatz sein.

Kraftvolle Aufforderung:

Ihre Rolle: Reinigungsassistent, Sie sind nicht der Entscheidungsträger. Gehen Sie Schritt für Schritt vor und schreiben Sie Code, der die Auswirkungen JEDES Schritts meldet: 1) das fehlende Muster anzeigen (NICHT löschen/ausfüllen), 2) Ausreißerkandidaten auflisten (NICHT löschen), 3) Kategorieinkonsistenzen mit der Zuordnungstabelle beheben. Drucken Sie nach jedem Schritt die Zeilenanzahl und die zusammenfassende Statistik aus, damit ich die Änderung sehen und bestätigen kann. Automatisches Einfügen von Zuweisungen/Löschungen.

Der Unterschied ist klar: Ein starker Wille positioniert die KI als überwachten Assistenten, der umkehrbare und dokumentierte Schritte ausführt.

drei Mini-Koffer

Fall 1 – Durchschnittliche Zuweisungsfalle. In den Einkommensdaten eines Analysten für 5.000 Personen fehlten 18 %. Er sagte der KI, sie solle „die Lücken schließen“; Die KI hat sie alle gemittelt. Ergebnis: Die Einkommensvarianz verringerte sich um 22 %, und der Koeffizient der Beziehung zwischen Bildung und Einkommen fiel schwächer aus als er war. Richtig: Der Mangel war MAR (erziehungsbedingt), musste durch Mehrfachbelegung (Mäuse) ausgeglichen werden. Lektion: Die Füllmethode hängt vom Mechanismus ab.

Fall 2 – Die Ausreißerbereinigung kehrt den Befund um. In den Daten eines Unternehmens befanden sich drei sehr große Unternehmen (0,6 % der Gesamtbeobachtung). Diese wurden durch den „Reinigungs“-Vorschlag der KI gelöscht; Der Skaleneffektkoeffizient änderte sich von positiv zu negativ. Diese drei Unternehmen waren jedoch real und ein wichtiger Teil der Branche. Der richtige Weg bestand darin, sowohl mit einer vollständigen als auch mit einer robusten Schätzung zu berichten, anstatt sie zu löschen. Lektion: Echte Ausreißer sind Daten, kein Rauschen.

Fall 3 – Stiller Codierungsfehler. In einem Panel gab es die Datumsvariable in zwei verschiedenen Formaten („01.03.2020“ und „01.03.2020“). Als der von der KI erzeugte Kombinationscode sie mit unterschiedlichen Werten verwechselte, stimmten 1.400 Beobachtungen nicht überein und die Wachstumsraten wurden lächerlich. Es wäre egal, wenn der Analyst die Zeilenanzahl nicht überprüfen würde. Lektion: Beobachtungszählungen und Plausibilitätsprüfungen nach jedem Schritt sind ein Muss.

Häufige Fehler

  • Die Lücke blind mit dem Durchschnitt füllen. Es reduziert die Varianz, verbirgt Unsicherheiten und erzeugt Verzerrungen bei MAR/MNAR. Klassifizieren Sie zunächst den Mechanismus.
  • Den Ausreißer löschen, „weil er stört“. Echte Ausreißer stellen die Daten dar; Durch das Löschen wird das Ergebnis verfälscht. Korrigieren Sie, was falsch ist, und behalten Sie, was wahr ist.
  • Rohdaten abgreifen. Ändern Sie niemals Rohdaten; Führen Sie die gesamte Bereinigung mit dem Code in einer separaten Kopie durch, damit er wiederhergestellt werden kann.
  • Die Auswirkungen von Schritten werden nicht gemessen. Wenn die Zeilenanzahl und die Zusammenfassungsstatistik nicht nach jedem Schritt überprüft werden, häufen sich stille Fehler.
  • Aufräumen als Ergebnis. Die Logik von „Wenn Sie diese Zeile hinzufügen, wird das Ergebnis besser“ ist P-Hacking; Die Reinigung sollte vor und unabhängig vom Analyseergebnis geplant werden.
Tipp: Führen Sie eine „Vorher/Nachher“-Tabelle, in der die gleichen grundlegenden Statistiken (Mittelwert, Median, Anzahl der Beobachtungen, einige Korrelationen) vor und nach der Bereinigung nebeneinander angezeigt werden. Ein unerwarteter Sprung ist der beste Vorbote eines versteckten Fehlers.

Zusammenfassend

Die Datenbereinigung ist die zeitaufwändigste und entscheidungsintensivste Phase der empirischen Arbeit. Die KI ist hierbei ein leistungsstarker Codegenerator, kann aber nicht das Sagen haben: Sie klassifizieren den fehlenden Datentyp (MCAR/MAR/MNAR), bestimmen, ob der Ausreißer ein Fehler oder real ist, halten jeden Schritt reversibel und dokumentieren ihn. Anstatt der KI blind „klare“ Autorität zu erteilen, etablieren Sie einen schrittweisen Arbeitsablauf, dessen Wirkung gemessen und validiert wird. Die Überprüfung der Anzahl der Beobachtungen und zusammenfassender Statistiken nach jedem Schritt ist das beste Gegenmittel gegen stille Fehler.

Anwendungsaufgabe

Wählen Sie mindestens zwei Variablen aus, die in einem Datensatz (Ihren eigenen Daten oder einem Beispielsatz) fehlende Variablen und Ausreißer enthalten. Fordern Sie über die Eingabeaufforderung „Schritt für Schritt, nicht löschen/ausfüllen“ oben einen Diagnosecode von der KI an und führen Sie ihn aus. Klassifizieren Sie den Mangel als MCAR/MAR/MNAR und begründen Sie dies in einem Satz. Untersuchen Sie die widersprüchlichen Kandidaten einen nach dem anderen und entscheiden Sie, welcher ein Fehler und welcher echt ist. Erstellen Sie abschließend eine „Vorher-Nachher“-Tabelle vor/nach der Reinigung und melden Sie unerwartete Änderungen.

Checkliste

  • [ ] Ich habe die Rohdaten in einer separaten Kopie bereinigt, ohne sie zu ändern.
  • [ ] Ich habe den Mangel als MCAR/MAR/MNAR klassifiziert und die Methode entsprechend gewählt.
  • [ ] Ich habe die Ausreißer einzeln untersucht, ob es sich um Fehler handelte oder ob sie real waren; Ich habe es nicht blind gelöscht.
  • [ ] Ich habe die Anzahl der Beobachtungen und zusammenfassenden Statistiken nach jedem Reinigungsschritt überprüft.
  • [ ] Ich habe alle Schritte mit Code und einer Kommentarzeile dokumentiert; reversibel.
  • [ ] Ich habe die Bereinigung auf der Kenntnis des Prozesses, der die Daten erzeugt, basiert, nicht auf dem Analyseergebnis.