Guadagni:
- Capacità di leggere accuratamente l'output della regressione (coefficiente, errore standard, valore p, R quadrato) e valutare criticamente l'interpretazione dell'intelligenza artificiale
- Capacità di riconoscere trappole come la distinzione correlazione-causalità, l'endogeneità, le variabili omesse e la regressione spuria, e di frenare l'eccessivo linguaggio causale dell'intelligenza artificiale
- Capacità di utilizzare l'intelligenza artificiale per l'impostazione del modello, la stesura del codice e dei test diagnostici, lasciando agli esseri umani la responsabilità della selezione e dell'interpretazione del modello
L’econometria è la disciplina che testa la teoria economica con i dati e la regressione è il suo strumento di base. "Quanto aumenta il consumo all'aumentare del reddito?", "Qual è il rapporto tra interesse e investimento?" Domande come queste sono quantificate dalla regressione. L’intelligenza artificiale è molto utile e molto pericolosa in questo ambito: scrive codice modello e test diagnostici in pochi secondi, ma è spesso eccessivamente causale ed eccessivamente precisa nell’interpretazione dell’output. Pronuncia fluentemente la frase "X aumenta Y"; mentre la maggior parte delle regressioni misura solo una relazione. L'essenza di questa unità è: utilizzare l'intelligenza artificiale per l'impostazione del modello, il codice e i test diagnostici; ma lascia all’essere umano la responsabilità della selezione del modello, del giudizio di causalità e dell’interpretazione.
Lettura dell'output della regressione
L'output di una semplice regressione cerca quattro cose:
- Coefficiente. Una stima di quanto cambia la variabile dipendente quando la variabile esplicativa aumenta di un'unità. Il segno (più/meno) e la grandezza devono avere un significato economico.
- Errore standard. L'incertezza della stima del coefficiente; Se è inferiore, la stima è più accurata.
- valore p. La probabilità che il coefficiente appaia così grande presupponendo che sia "effettivamente zero". Si dice che un p piccolo (<0,05) sia “statisticamente significativo” – ma ciò non implica significato economico o causalità.
- R-quadrato. Quanto del cambiamento nella variabile dipendente spiega il modello. Un R quadrato elevato non significa il "modello corretto"; Potrebbe anche contenere un elevato numero di regressioni spurie.
Suggerimento: non confondere la significatività statistica con la significatività economica. Anche un effetto molto piccolo, praticamente insignificante, può rivelarsi "significativo" (p piccolo) in un campione ampio. Innanzitutto: "L'entità di questo coefficiente è economicamente importante?" ', quindi cerca il significato.
La correlazione non è causalità: le classiche trappole
Questo è l’avvertimento al centro dell’econometria. La relazione trovata dalla regressione spesso non è causalità. Principali insidie:
- Variabile omessa. Un terzo fattore che influenza sia X che Y ma non è presente nel modello crea una relazione spuria tra X e Y. (Esempio: se l'"abilità" viene omessa nella relazione tra istruzione e reddito, il coefficiente sarà fuorviante).
- Causalità inversa (endogeneità). Mentre si pensa che X influenzi Y, forse Y influenza X o i due sono reciproci. (Numeri di polizia e criminalità: la polizia è aumentata perché è aumentata la criminalità?)
- Pseudoregressione. Due serie non stazionarie (di tendenza) possono produrre coefficienti R quadrati elevati e significativi anche se non esiste una relazione reale tra loro. Solo perché entrambi crescono nel tempo.
- Bias di selezione. Se il campione non è casuale, la relazione viene misurata in modo distorto.
L'affermazione della causalità può essere stabilita solo con una progettazione adeguata (metodi come esperimento controllato, esperimento naturale, variabile strumentale, differenza nella differenza) e presupposti chiari. L’intelligenza artificiale spesso non coglie questa sottigliezza.
Attenzione: se l'IA dice "questa variabile aumenta/diminuisce quella", frena immediatamente. Problema: ci sono variabili omesse? È possibile la causalità inversa? Le serie sono stazionarie? Nessuna frase causale entra nel rapporto finché non vengono poste queste tre domande.
Test diagnostici
Affinché una regressione sia affidabile, vengono testate le sue ipotesi: modello di residui (termini di errore) (autocorrelazione), eteroschedasticità (eteroschedasticità), multicollinearità (le variabili esplicative sono molto simili tra loro), distribuzione normale. L'intelligenza artificiale scrive il codice per questi test; ma è compito dell'economista interpretare i risultati e adattare il modello di conseguenza.
tre mini custodie
Caso 1 — Regressione spuria. Un ricercatore ha fatto regredire due serie di tendenze (una di spesa nominale, un'altra di quantità nominale); R quadrato era 0,98, il coefficiente era altamente significativo. L’intelligenza artificiale “è una relazione forte”, ha detto. Il ricercatore ha testato la stazionarietà: entrambe le serie erano non stazionarie. Una volta separati, il rapporto scomparve in gran parte. L'R quadrato alto era semplicemente dovuto al fatto che entrambi sono cresciuti nel tempo. Rilevata regressione spuria.
Caso 2 — Variabile omessa. Un’analisi ha rilevato che “la spesa pubblicitaria aumenta le vendite”. L'economista si è chiesto: c'è un effetto stagionale nel modello? Non c'era. Sia la pubblicità che le vendite erano in aumento prima delle vacanze; Parte della relazione era la stagionalità. Quando sono state aggiunte le variabili fittizie stagionali, il coefficiente di pubblicità è diventato più piccolo. L'affermazione causale è stata attenuata.
Caso 3: significativo ma insignificante. In un ampio set di microdati, un coefficiente era p<0,001; L’intelligenza artificiale “forte impatto”, ha detto. Ma l’entità del coefficiente era praticamente trascurabile (una grande variazione del reddito spostava il risultato di un millesimo). L’economista lo ha correttamente definito “statisticamente significativo ma economicamente insignificante”. Il significato non era un sostituto dell’importanza.
Tabella di moderazione dei commenti
dice l'intelligenza artificiale
Si chiede l'economista
"X aumenta Y"
Variabile omessa? Causalità inversa?
"R-quadro è alto, il modello è buono"
Le serie sono stazionarie? Falsa regressione?
"p<0,05, significativo"
Le dimensioni contano economicamente?
"Coefficiente 0,3"
Il suo segno e la sua unità sono compatibili con la teoria?
"Il rapporto è forte"
La selezione del campione è parziale?
Quattro modelli copiabili
1) Schizzo di installazione del modello:
Esaminerò la seguente questione economica: [domanda]. Variabile dipendente: [Y].Descrittori candidati: [X's]. Suggeriscimi un'impostazione di regressione iniziale adatta (codice statsmodels). Spiegare quali variabili di controllo sono necessarie e perché. NON rivendicare la causalità; Usa il linguaggio relazionale.
2) Test diagnostici:
Scrivi nel codice i test diagnostici per la regressione che ho impostato: autocorrelazione, eteroschedasticità, multicollinearità, dispersione dei residui e stazionarietà (se si tratta di una serie temporale). Scrivi brevemente come interpretare ciascun risultato del test e cosa fare in caso di problemi.
3) Controllo della causalità:
Interpretare questo risultato di regressione, ma prima verificare queste tre trappole: (1) potrebbe esserci una variabile omessa e quale, (2) è possibile la causalità inversa, (3) la serie è stazionaria / esiste il rischio di regressione spuria? Indicare chiaramente se il risultato deve essere interpretato come causale o semplicemente relazionale.
4) Distinzione di importanza-importanza:
Interpretare il seguente coefficiente: valore [x], errore standard [y], valore p [z]. Valutare separatamente la significatività statistica, separatamente la significatività economica: l’entità di questo coefficiente è un effetto praticamente significativo? Concretizzare l'entità dell'impatto in uno scenario di esempio.
Prompt debole / Prompt forte
Suggerimento debole:
Esegui una regressione con queste variabili e interpreta il risultato.
L’intelligenza artificiale lo interpreta in un linguaggio causale, senza eseguire test diagnostici o verificarne la stazionarietà; viene persa la regressione spuria o la variabile omessa.
Suggerimento potente:
La variabile dipendente è il consumo, il reddito esplicativo; serie mensili di tendenza. Testare prima la stazionarietà; ottenere la differenza se necessario. Impostare la regressione, eseguire test diagnostici (autocorrelazione, eteroschedasticità). Discutere esplicitamente i rischi delle variabili omesse e della causalità inversa durante l'interpretazione del risultato; Utilizzare un linguaggio relazionale piuttosto che causale. Valutare separatamente il significato e il significato economico e fornire il codice per ogni passaggio.
Errori comuni
- Confondere la correlazione con la causalità. L'errore più comune e più costoso.
- Confondere un R-quadrato elevato per qualità. È anche ricco di regressioni spurie.
- Superare il controllo della stasi. Le serie con trend producono relazioni spurie.
- Confondere significatività con significato. Una p piccola non significa un grande effetto.
- Saltare i test diagnostici. L’ipotesi violata vanifica l’intera inferenza.
- Accettare il linguaggio causale dell’IA così com’è. Il giudizio appartiene all'uomo.
In sintesi
La regressione è uno strumento potente ma insidioso. Leggere correttamente coefficiente, errore standard, valore p e R quadrato; distinguere tra correlazione e causalità; verifica delle variabili omesse, della causalità inversa e delle insidie della regressione spuria; È necessario distinguere tra significato e importanza economica. L’intelligenza artificiale sta accelerando nella generazione di codici e diagnosi, ma parla in modo troppo causale; La scelta del modello e il giudizio di causalità spetta all’economista.
Compito dell'applicazione
Imposta una semplice regressione con i dati a tua disposizione (ad esempio reddito-consumo). Far produrre la configurazione con il primo modello e i test diagnostici con il secondo modello. Quindi verificare la causalità con il modello 3, nominando almeno una possibile variabile omessa e uno scenario di causalità inversa. Traduci una frase causale dall'interpretazione iniziale dell'IA in un linguaggio relazionale e nota il cambiamento.
lista di controllo
- [ ] Ho letto correttamente il coefficiente, l'errore standard, il valore p e l'R quadrato.
- [ ] Ho verificato la stazionarietà della serie ed eliminato il rischio di regressione spuria.
- [ ] Ho chiamato la variabile omessa e le possibilità di causalità inversa.
- [] Ho eseguito test diagnostici e valutato le violazioni.
- [ ] Ho valutato separatamente la significatività statistica e la significatività economica.
- [ ] Ho trascinato il linguaggio causale dell'intelligenza artificiale nel linguaggio relazionale.
- [ ] Ho sostenuto che la scelta del modello e il giudizio di causalità spettava a me.