Gewinne:
- In der Lage zu unterscheiden, wo im empirischen Arbeitsablauf (Datenbereinigung, Code, Visualisierung, Entwurfsinterpretation) künstliche Intelligenz Echtzeit spart und wo Entscheidungen wie Modellauswahl, Kausalitätsbehauptung und Veröffentlichungsentscheidung je nach Aufgabenrisikostufe dem Experten überlassen werden
- Fähigkeit, eine Disziplin anzuwenden, die jede Ausgabe der künstlichen Intelligenz (Zahl, Koeffizient, Code, Kommentar) durch die Schritte Neuberechnung, Verknüpfung mit der Quelle und statistische Filterung überprüft.
- Fähigkeit, Mikrodaten und vertrauliche/lizenzierte Datensätze im Rahmen von KVKK/DSGVO und Datennutzungsverträgen sicher zu verarbeiten und sich die Auswahl geeigneter Tools anzueignen.
Auf dem Schreibtisch eines Ökonomen oder angewandten Statistikers tauchen jeden Tag dieselben Fragen auf: Ist dieser Datensatz zuverlässig? Was tun mit diesen fehlenden Werten? Was sagt der Koeffizient dieser Regression wirklich aus? Ist dieser Zusammenhang kausal oder lediglich korrelativ? Da dieser p-Wert signifikant ist, kann ich ihn in den Artikel oder das Policy Brief schreiben? Einige dieser Fragen sind repetitiv, codeintensiv und zeitaufwändig: Bereinigen von Daten, zehnmaliges Zeichnen desselben Diagramms, Debuggen von R- oder Python-Code, Aneinanderreihen der Ergebnisse in einer Tabelle. Andere bestimmen direkt die Gültigkeit einer Feststellung, die Ehrlichkeit einer Veröffentlichung oder die Richtigkeit einer politischen Entscheidung.
Künstliche Intelligenz (kurz KI, KI – Computersysteme, die wie Menschen Text und Code erzeugen, Muster erkennen, Daten zusammenfassen und Kommentare schreiben können; die heute am häufigsten verwendete Form sind große Sprachmodelle, also Systeme, die auf großen Text trainiert werden und Sätze bilden, indem sie das nächste Wort vorhersagen) steht genau in der Mitte dieser Tabelle. Bei korrekter Verwendung reduziert es Stunden an Datenbereinigungscode auf Minuten, erinnert Sie an die Syntax eines komplexen statistischen Tests oder entwirft die Interpretation eines Koeffizienten. Bei falscher Verwendung stellt es eine scheinbar sichere, aber völlig erfundene Zahl, eine falsche Bedeutung oder einen nicht-kausalen Zusammenhang als „Befund“ dar.
Diese erste Einheit ist keine Softwareeinführung. Sein Zweck besteht darin, zu klären, wo KI in Ihrem empirischen Arbeitsablauf eingesetzt werden sollte und wo nie. Ökonometrie ist sowohl ein „methodenkritisches“ als auch indirekt „entscheidungskritisches“ Feld: Der Koeffizient eines von Ihnen erstellten Modells kann der Input für die Zinsentscheidung einer Zentralbank, die Politikänderung einer Regulierungsbehörde oder die Millioneninvestition eines Unternehmens sein. Lassen Sie uns das Grundprinzip von Anfang an darlegen: Künstliche Intelligenz ist ein Analyseassistent, kein Forscher. Die Verantwortung und endgültige Genehmigung der Modellauswahl, der Identifikationsstrategie, der Kausalitätsbehauptung, der Veröffentlichung und der politischen Entscheidungen liegt beim zuständigen Experten.
Schichten des empirischen Arbeitsablaufs und der Platz der KI
Es ist sinnvoll, eine empirische Studie in drei Schichten zu unterteilen. Die Ausführungsschicht ist die alltägliche technische Arbeit: Datenbereinigungscode, Diagrammzeichnung, Tabellenformatierung, Syntax-Debugging. Die Methodenebene ist die analytische Entscheidung: welches Modell, welche Identifikationsstrategie, welcher Test, welche Annahmenprüfung. Die Interpretations- und Entscheidungsebene ist die Bedeutung der Ergebnisse: Was sagt der Koeffizient aus, ist er kausal, was bedeutet er für die Politik, sollte er veröffentlicht werden. KI berührt alle drei Ebenen, verfügt jedoch in jeder über unterschiedliche Autoritäten. Auf der Ausführungsebene entwirft und generiert die KI schnell Code; Auf der Interpretations- und Entscheidungsebene werden nur Eingaben gemacht und der Experte trifft die Entscheidung.
Lassen Sie uns von Anfang an ein paar Grundbegriffe definieren. Ökonometrie ist der Zweig, der Wirtschafts- und Sozialdaten mit statistischen Methoden analysiert und Zusammenhänge misst. Regression ist eine Methode, die die Beziehung einer Ergebnisvariablen (abhängigen Variablen) zu einer oder mehreren erklärenden Variablen (unabhängigen Variablen) numerisch modelliert. Der Koeffizient ist die Zahl, die angibt, mit wie vielen Änderungseinheiten im Durchschnitt eine Änderung einer erklärenden Variablen um eine Einheit in der Ergebnisvariablen verbunden ist. Der p-Wert ist die Wahrscheinlichkeit, dass das beobachtete Ergebnis (oder ein extremeres Ergebnis) zufällig eintreten würde, wenn tatsächlich kein Effekt vorliegt. Wir werden diese Konzepte in den folgenden Einheiten einzeln erklären; Vorerst sollten Sie Folgendes wissen: In all diesen Fällen liefert Ihnen die KI den Bauplan, den Code und die Erklärung, trifft jedoch keine wissenschaftlichen Entscheidungen.
Die folgende Tabelle fasst die Rolle und das Risikoniveau der KI nach Mission zusammen:
Suche
Rolle der KI
Risikostufe
Wer stimmt zu
Schreiben eines Datenbereinigungscodes
Codegenerator
niedrig
Analyst selbst (mit Code-Tests)
Diagramm-/Tabellenentwurf
Skizzengenerator
niedrig
Analyst
Erinnerung an die Test-/Modellsyntax
Referenzassistent
niedrig-mittel
Analyst
Interpretation des Entwurfskoeffizienten
Entwurfsautor
mittel
Ökonometriker
Auswahl der Modell-/Identifikationsstrategie
Hilfseingang
hoch
Fachforscher
Kausalitätsanspruch
Nur ein Entwurf, nie das letzte Wort
sehr hoch
Experten- und Peer-Review
Veröffentlichung/politische Entscheidung
Nur Eingabe
sehr hoch
Verantwortlicher Ermittler/Institution
Bedenken Sie die eine Zeile in dieser Tabelle: Mit steigendem Risiko schrumpft die Rolle der KI und die Zustimmung der Experten wächst.
Warum „Verifizierung“ das Herzstück dieses Geschäfts ist
Sprachmodelle scheinen von ihrer Antwort überzeugt zu sein, sind sich aber möglicherweise nicht sicher. In der Fachsprache nennt man das Halluzination: Dabei handelt es sich um die Erfindung nichtexistenter Informationen durch das Modell in einem fließenden Satz, als ob diese wahr wären. Für einen Ökonomen ist das eine tödliche Falle. Das Modell kann Ihnen eine genaue Zahl liefern, z. B. „Die Korrelation zwischen Arbeitslosigkeit und Inflation in der Türkei zwischen 2015 und 2020 beträgt 0,62“; Allerdings hat er Ihre Daten nie gesehen und diese Zahl ist komplett erfunden. Oder es könnte heißen: „Der p-Wert des Weißtests betrug 0,03“; wohingegen keine Tests durchgeführt wurden. Es kann eine R-Funktion mit einem Argument aufrufen, das eigentlich nicht existiert. Er singt alle drei mit der gleichen Geläufigkeit; Das Einzige, was Richtig und Falsch unterscheidet, ist Ihr Wissen und Ihre Gewohnheit, es zu überprüfen.
Die Verifizierungsdisziplin besteht aus drei Schritten:
- Neu berechnen/in Ihrer eigenen Umgebung ausführen: Berechnen Sie jede Zahl, jedes Verhältnis, jedes Testergebnis und jeden Koeffizienten, die von der KI in R/Python angegeben werden, mit Ihren eigenen Daten, nicht aus dem Speicher der KI. Verwenden Sie die KI, um den Code zu schreiben, nicht um sich an das Ergebnis zu erinnern. Führen Sie den Code aus, Sie erzeugen die Ausgabe.
- Link zur Quelle: Verlassen Sie sich bei Methodenregeln, Formeln und Definitionen auf Lehrbücher, Methodenartikel und offizielle Dokumente. Bestätigen Sie die Aussage der KI „Die Annahme dieses Tests ist“ mit einer zuverlässigen Quelle.
- Statistischer Filter: Testen Sie mit Expertenaugen, ob die Ausgabe der statistischen Logik widerspricht (Annahmen, Stichprobe, Effektgröße, Unsicherheit). Lehnen Sie ein „bedeutungsvolles, aber absurdes“ Ergebnis ab.
Achtung: Das Einfügen eines von der KI generierten Koeffizienten, Tests oder einer Interpretation in einen Artikel, eine These oder eine Grundsatzerklärung ohne Validierung ist wie die Veröffentlichung eines nicht überprüften Ergebnisses. Nur weil die Ausgabe flüssig ist, ist das nicht wahr; Nur weil die Zahl sicher scheint, ist sie nicht real.
Datenschutz: Mikrodaten und lizenzierte Daten sind privat geschützt
In der Ökonometrie werden häufig Mikrodaten (Einzeldaten auf Einzel-, Haushalts-, Firmen- oder Patientenebene) verwendet. Bei den meisten dieser Daten handelt es sich um personenbezogene Daten, die in der Türkei durch das KVKK (Gesetz zum Schutz personenbezogener Daten) und in Europa durch die DSGVO geschützt sind. Darüber hinaus stellen TurkStat, Zentralbanken, Paneldatenanbieter und kommerzielle Quellen häufig Daten im Rahmen einer Datennutzungsvereinbarung zur Verfügung; Diese Vereinbarungen verbieten die Weitergabe von Daten an Dritte. Das Einfügen einer Tabelle mit Informationen zu Identität, Einkommen, Gesundheit oder Firmengeheimnissen in ein öffentliches KI-Chat-Tool stellt sowohl einen KVKK/DSGVO-Verstoß als auch einen Vertragsverstoß dar; weil die Daten an einen externen Server gehen und in einigen Tools für das Modelltraining verwendet werden können.
Die Regel ist einfach: Bewahren Sie die Daten in ihrer eigenen sicheren Umgebung auf und fragen Sie die KI nur nach Code und Methoden. Der ideale Arbeitsablauf ist folgender: Fragen Sie die KI nach dem Analysecode, Sie führen den Code mit den echten Daten auf Ihrem eigenen Computer/Unternehmensserver aus. Wenn Sie Daten wirklich teilen müssen, anonymisieren Sie sie (ID-Felder entfernen), aggregieren Sie sie (Durchschnitt/Zählung statt individuell) und wählen Sie institutionelle Tools aus, haben Sie eine Datenverarbeitungsvereinbarung und verwenden Sie Ihre Daten nicht im Bildungsbereich.
drei Mini-Koffer
Fall 1 – Sichere und effiziente Nutzung. Ein Forscher verbrachte zunächst sechs Stunden damit, 40.000 Zeilen Haushaltsbudgetdaten manuell zu bereinigen. Ohne die Daten überhaupt weiterzugeben, beschrieb er der KI lediglich die Variablennamen und die Struktur und fragte nach einem Reinigungscode. Die KI hat ein R-Skript generiert; Der Forscher führte den Code in seiner eigenen Umgebung aus, überprüfte die Anzahl der Zeilen und die zusammenfassenden Statistiken jedes Schritts und behob zwei Logikfehler. Dauer: 70 Minuten statt 6 Stunden. Die Daten gingen nie raus; Die Verantwortung blieb beim Forscher.
Fall 2 – Nicht verifizierte Nummernfalle. „Wie hoch ist die Elastizität zwischen BIP-Wachstum und ausländischen Direktinvestitionen“, fragte ein Doktorand AI. Die KI gab selbstbewusst eine Zahl von „ungefähr 0,34“ an, obwohl sie keinen Zugriff auf irgendwelche Daten hatte. Der Student hat dies in der Literaturzusammenfassung geschrieben; Als sein Berater nach der Quelle fragte, stellte sich heraus, dass die Zahl jeder Grundlage entbehrte und völlig erfunden war. Fehler: Von der KI konkrete Statistiken erwarten, ohne ihr Daten und Ressourcen zur Verfügung zu stellen.
Fall 3 – Vertraulichkeit und Vertragsbruch. Ein Analyst lud Excel, das er von einem lizenzierten Unternehmenspanel erhalten hatte und das den Firmennamen und den Umsatz enthielt, in ein öffentlich verfügbares KI-Tool hoch und sagte: „Führen Sie eine Panel-Regression durch.“ Der Vertrag des Datenanbieters verbot die Weitergabe von Daten an Drittsysteme; Der Vorfall führte zu einer Compliance-Überprüfung. Der richtige Weg bestand darin, die Firmennamen durch anonyme Codes zu ersetzen oder keine Daten weiterzugeben und nur den Panel-Regressionscode anzufordern und ihn in seiner eigenen Umgebung auszuführen.
Schwache Eingabeaufforderung / Starke Eingabeaufforderung
Schwache Eingabeaufforderung:
Analysieren Sie den Zusammenhang zwischen Inflation und Arbeitslosigkeit und geben Sie den Koeffizienten an.
Diese Behauptung ist falsch: Der KI wurden keine Daten übergeben, es ist nicht klar, welches Land, welcher Zeitraum, welches Modell. KI kann nur mit einem erfundenen Koeffizienten antworten.
Kraftvolle Aufforderung:
Ihre Rolle: Sie sind Analyseassistent und unterstützen den Ökonometrieforscher. Ich teile die Daten NICHT mit Ihnen; Ich möchte nur RUNNABLE R-Code. Ich habe ein jährliches Panel: Variablen Land, Jahr, Arbeitslosigkeit, Inflation (alle numerisch). Aufgabe: 1) Schreiben Sie einen Panel-Regressionscode mit festen Effekten für Arbeitslosigkeit ~ Inflation (PLM-Paket), 2) Erläutern Sie jeden Schritt im Code mit einer Kommentarzeile, 3) Beachten Sie, dass der Koeffizient als relational und nicht als KAUSAL interpretiert werden sollte, 4) bilden Sie das Funktionsargument, bei dem Sie sich nicht sicher sind; Ich werde das Ergebnis in meiner eigenen Umgebung ausführen und überprüfen.
In dieser Anfrage werden keine Daten weitergegeben, die Rolle, die Pakete, die Erwartung von Kommentaren und das Verbot der „Fabrikation“ sind klar. Sie führen die Ausgabe weiterhin selbst aus und überprüfen sie.
Die folgende Tabelle fasst die Ein-Satz-Regeln in dieser Lektion zusammen:
Prinzip
Was bedeutet es?
KI ist ein Assistent
Die wissenschaftliche Entscheidung und Verantwortung liegt beim Experten
Fordern Sie den Code an und produzieren Sie das Ergebnis
Die KI merkt sich die Nummer nicht; Sie führen es aus und berechnen
Daten aufbewahren
Mikro-/lizenzierte Daten verlassen die sichere Umgebung nicht
verifizieren
Jedes Problem, jeder Code und jeder Kommentar wird überprüft. Fabrikation wird abgelehnt
Häufige Fehler
- Erwarten Sie konkrete Statistiken von der KI, ohne Daten anzugeben. Das Modell kann nicht auf die Daten zugreifen; Der darin angegebene Koeffizient, die Korrelation und der p-Wert sind falsch. Fordern Sie immer den Code an und erstellen Sie das Ergebnis selbst.
- Sich auf halluzinatorische Funktionen verlassen. KI schlägt möglicherweise eine R/Python-Funktion oder ein R/Python-Argument vor, das nicht existiert. Akzeptieren Sie den Code nicht, ohne ihn auszuführen und zu überprüfen.
- Hochladen von Mikrodaten in ein öffentliches Tool. Es handelt sich um einen Verstoß gegen KVKK/DSGVO und die Datennutzungsvereinbarung. Daten anonymisieren oder gar nicht weitergeben.
- Geläufigkeit mit Genauigkeit verwechseln. Eine gut geschriebene Rezension kann ungenau sein. Die Schönheit des Satzes ist kein Beweis.
- Kausale Sprache ohne Kontrolle akzeptieren. YZ sagt oft „X erhöht Y“; wohingegen die meisten Regressionen nur Beziehungen zeigen. Verteidigen Sie den Kausalanspruch mit Design.
Tipp: Wenn Sie mit KI arbeiten, stellen Sie sich diese Frage: „Wenn ein Gutachter oder Prüfer nach dieser Ausgabe fragt, kann ich dann die Quelle und das Konto zeigen?“ Lautet die Antwort „Nein“, ist die Ausgabe noch nicht einsatzbereit.
Zusammenfassend
KI sorgt für eine echte und massive Beschleunigung der Ausführungsebene (Code, Bereinigung, Grafik, Entwurf) des Ökonometrie- und Statistik-Workflows; Modellauswahl, Kausalität, Interpretation, Veröffentlichung und politische Entscheidungen liegen jedoch in der Verantwortung des Experten. Drei Grunddisziplinen: Erinnern Sie die KI nicht an die Zahl, fragen Sie nach dem Code und generieren und überprüfen Sie das Ergebnis selbst; Entfernen Sie keine Mikro-/lizenzierten Daten aus der sicheren Umgebung. Statistischer Filter für jede Ausgabe. Eine ungeprüfte KI-Ausgabe ist ebenso riskant wie ein ungeprüfter Befund.
Anwendungsaufgabe
Betrachten Sie Ihren eigenen Datensatz (oder einen Beispieldatensatz). Bitten Sie die KI um R- oder Python-Code, der beschreibende Statistiken und ein einfaches Diagramm erstellt, indem er einfach die Variablenstruktur beschreibt, ohne die Daten weiterzugeben. Führen Sie den eingehenden Code in Ihrer eigenen Umgebung aus. Führen Sie dann eine Checkliste: (1) Ist der Code fehlerfrei ausgeführt, (2) entspricht die Anzahl der Zeilen/Beobachtungen Ihren Erwartungen, (3) Welcher der Kommentarsätze der KI verwendet eine kausale Sprache und sollte behoben werden? Schreiben Sie in einem Absatz über die Zeit, die Ihnen die KI erspart hat, und über mindestens einen Fehler, den Sie entdeckt haben.
Checkliste
- [ ] Ich habe die KI nicht dazu gebracht, nach konkreten Statistiken zu fragen; Ich habe den Code angefordert und das Ergebnis selbst erstellt.
- [ ] Ich habe jede Zahl und jedes Testergebnis, das es in meiner eigenen Umgebung ergab, neu berechnet.
- [ ] Ich habe überprüft, dass die verwendeten Funktionen/Argumente tatsächlich existieren.
- [ ] Ich habe keine Mikro-/persönlichen/lizenzierten Daten in ein öffentliches Tool hochgeladen.
- [ ] Ich habe die Kommentare mit kausaler Sprache markiert und sie in die relationale Sprache verschoben.
- [ ] Ich bin in der Lage, einem Wirtschaftsprüfer die Quelle und Abrechnung der Ergebnisse vorzulegen.