Единица 7 / 11

Поддршка на економетриски модел: регресија, причинска и интерпретација

Добивки:

  • Способност за прецизно читање на излезот од регресија (коефициент, стандардна грешка, p-вредност, R-квадрат) и критичко оценување на интерпретацијата на вештачката интелигенција
  • Способност да се препознаат стапици како што се дистинкцијата корелација-причина, ендогеност, испуштени променливи и лажна регресија и да се ограничи прекумерниот причински јазик на вештачката интелигенција
  • Способност да се користи вештачка интелигенција за поставување модел, код и дијагностички тестови, препуштајќи ја одговорноста за изборот и интерпретацијата на моделот на луѓето

Економетријата е дисциплина на тестирање на економската теорија со податоци, а регресијата е нејзината основна алатка. „Колку се зголемува потрошувачката како што се зголемува приходот?“, „Каква е врската помеѓу каматата и инвестициите?“ Прашањата како овие се квантифицирани со регресија. Вештачката интелигенција е и многу корисна и многу опасна во оваа област: пишува код на моделот и дијагностички тестови за секунди, но често е премногу причинска и прецизна кога се толкува излезот. Течно ја зборува реченицата „X го зголемува Y“; додека повеќето регресии мерат само една врска. Суштината на оваа единица е: Користете вештачка интелигенција за поставување модел, код и дијагностичко тестирање; но чувајте ја одговорноста за изборот на моделот, расудувањето на каузалноста и толкувањето на човекот.

Читање на излез од регресија

Излезот од едноставна регресија бара четири работи:

  • Коефициент. Проценка за тоа колку зависната променлива се менува кога објаснувачката променлива се зголемува за една единица. Знакот (плус/минус) и големината мора да имаат економско значење.
  • Стандардна грешка. Несигурноста на проценката на коефициентот; Ако е помала, проценката е попрецизна.
  • p-вредност. Веројатноста коефициентот да се појави толку голем под претпоставка дека е „всушност нула“. Малото p (< 0,05) се вели дека е „статистички значајно“ - но тоа не имплицира економска значајност или каузалност.
  • R-квадрат. Колку од промената на зависната променлива објаснува моделот. Високиот R-квадрат не значи „точен модел“; Исто така, може да биде високо во лажни регресии.
Совет: Не мешајте ја статистичката со економската значајност. Дури и многу мал, практично незначаен ефект може да испадне како „значаен“ (мал p) во голем примерок. Прво, "Дали големината на овој коефициент е економски важна?" “, тогаш побарајте значење.

Корелацијата не е причинска врска: класични стапици

Ова е предупредувањето во срцето на економетријата. Врската пронајдена со регресија често не е каузалност. Главните стапици:

  • Испуштена променлива. Трет фактор кој влијае и на X и на Y, но не е во моделот, создава лажна врска помеѓу X и Y. (Пример: ако „способноста“ е испуштена во односот помеѓу образованието и приходот, коефициентот ќе биде погрешен.)
  • Обратна каузалност (ендогеност). Додека се смета дека X влијае на Y, можеби Y влијае на X или двете се взаемни. (Број на полицијата и криминал: дали полицијата се зголеми затоа што се зголеми криминалот?)
  • Псевдо регресија. Две нестационарни (трендинг) серии можат да дадат високи R-квадратни и значајни коефициенти иако не постои вистинска врска меѓу нив. Само затоа што и двајцата растат со текот на времето.
  • Пристрасност во изборот. Ако примерокот не е случаен, односот се мери искривен.

Тврдењето за каузалност може да се утврди само со соодветен дизајн (методи како што се контролиран експеримент, природен експеримент, инструментална променлива, разлика-во-разлика) и јасни претпоставки. Вештачката интелигенција често ја пропушта оваа суптилност.

Внимание: Ако вештачката интелигенција вели „оваа променлива го зголемува/намалува тоа“, сопирајте веднаш. Проблем: Дали има некои променливи испуштени? Дали е можна обратна каузалност? Дали серијата е стационарна? Ниту една причинска реченица не влегува во извештајот додека не се постават овие три прашања.

Дијагностички тестови

За регресијата да биде веродостојна, се тестираат нејзините претпоставки: шема на резидуали (термини за грешка) (автокорелација), хетероскедастичност (хетероскедастичност), мултиколинеарност (објаснувачките променливи се многу слични една на друга), нормална дистрибуција. Вештачката интелигенција го пишува кодот за овие тестови; но работа на економистот е да ги толкува резултатите и соодветно да го прилагоди моделот.

три мини футроли

Случај 1 - Лажна регресија. Истражувач уназади две тренд серии (една номинална потрошувачка, една номинална друга количина); R-квадрат беше 0,98, коефициентот беше многу значаен. Вештачката интелигенција „е силна врска“, рече тој. Истражувачот тестираше за стационарност: двете серии беа нестационарни. Откако беа разделени, врската во голема мера исчезна. Високиот R-квадрат беше едноставно затоа што и двајцата растеа со текот на времето. Фатена е лажна регресија.

Случај 2 - Испуштена променлива. Една анализа покажа дека „трошењето за реклами ја зголемува продажбата“. Економистот праша: дали има сезонски ефект во моделот? Немаше. И рекламирањето и продажбата се зголемуваа пред празникот; Дел од врската беше сезонската. Кога се додадоа лажни променливи за сезоната, коефициентот на рекламирање стана помал. Причинското барање е ублажено.

Случај 3 - Значајно, но незначително. Во голем сет на микроподатоци, коефициентот беше p<0,001; Вештачката интелигенција „силно влијание“, рече тој. Но, големината на коефициентот беше практично занемарлива (големата промена во приходот го помести резултатот за една илјадити дел). Економистот правилно го постави како „статистички значајно, но економски незначајно“. Значењето не беше замена за важноста.

Табела за модерација на коментари

вели вештачката интелигенција

Прашува економистот

„X го зголемува Y“

Испуштена променлива? Обратна каузалност?

„Р-квадратот е висок, моделот е добар“

Дали серијата е стационарна? Лажна регресија?

"p<0,05, значајно"

Дали големината е важна економски?

„Коефициент 0,3“

Дали неговиот знак и единица се компатибилни со теоријата?

„Врската е силна“

Дали изборот на примерок е пристрасен?

Четири шаблони за копирање

1) Скица за инсталација на модел:

Ќе го испитам следното економско прашање: [прашање]. Зависна променлива: [Y].Описори на кандидати: [X's]. Предложете ми соодветна почетна поставка за регресија (statsmodels code). Објаснете кои контролни променливи се потребни и зошто. НЕ барајте каузалност; Користете јазик за односи.

2) Дијагностички тестови:

Напишете ги во шифра дијагностичките тестови за регресијата што ја поставив: автокорелација, хетероскедастичност, мултиколинеарност, дисперзија на резидуали и стационарност (ако е временска серија). Напишете накратко како да го толкувате секој резултат од тестот и што да направите ако има проблеми.

3) Контрола на каузалноста:

Толкувајте го овој резултат на регресија, но прво проверете ги овие три замки: (1) дали може да има испуштена променлива и која, (2) е можна обратна каузалност, (3) дали серијата е стационарна / дали постои ризик од лажна регресија? Наведете јасно дали резултатот треба да се толкува како причински или само релациски.

4) Разлика значење-важност:

Толкувајте го следниов коефициент: вредност [x], стандардна грешка [y], p-вредност [z]. Оценете ја статистичката значајност одделно, економската значајност одделно: дали големината на овој коефициент е практично значаен ефект? Конкретирајте ја големината на влијанието во примерно сценарио.

Слаб промпт / Силен промпт

Слаба навестување:

Направете регресија со овие променливи и толкувајте го резултатот.

Вештачката интелигенција ја толкува на причински јазик, без да врши дијагностички тестови или да ја провери стационарноста; е пропуштена лажна регресија или испуштена променлива.

Моќен потсетник:

Зависна променлива е потрошувачката, објаснувачкиот приход; месечни, трендовски серии. Прво тестирајте ја стационарноста; добие разлика ако е потребно. Поставете ја регресијата, извршете дијагностички тестови (автокорелација, хетероскедастичност). Експлицитно дискутирајте за ризиците од испуштените променливи и обратна каузалност при толкување на резултатот; Користете релациски наместо причински јазик. Оценете го значењето и економското значење одделно и дајте ја шифрата за секој чекор.

Вообичаени грешки

  • Погрешна корелација за каузалност. Најчеста и најскапа грешка.
  • Грешка на висок R-квадрат за квалитет. Тоа е исто така високо во лажни регресии.
  • Заобиколувајќи ја проверката на стаза. Трендираните серии создаваат лажни врски.
  • Збунувајќи ја значајноста со значајноста. Малото p не значи голем ефект.
  • Прескокнување на дијагностички тестови. Нарушената претпоставка го поразува целиот заклучок.
  • Прифаќање на причинскиот јазик на ВИ каков што е. Судот му припаѓа на човекот.

Сумирано

Регресијата е моќна, но во замка алатка. Коефициент на читање, стандардна грешка, p-вредност и R-квадрат правилно; правење разлика помеѓу корелација и каузалност; проверка на испуштени променливи, обратна каузалност и лажни стапици на регресија; Неопходно е да се направи разлика помеѓу значењето и економската важност. Вештачката интелигенција забрзува во генерирањето код и дијагноза, но зборува премногу каузално; Изборот на моделот и проценката на каузалноста зависи од економистот.

Задача за апликација

Поставете едноставна регресија со податоците што ги имате (на пр. потрошувачка-приход). Поставувањето нека биде произведено со првиот шаблон, а дијагностичките тестови произведени со вториот шаблон. Потоа проверете ја каузалноста со шаблонот 3, именувајќи барем една можна испуштена променлива и едно обратно сценарио за каузалност. Преведете каузална реченица од првичното толкување на вештачката интелигенција во релациски јазик и забележете ја промената.

листа за проверка

  • [ ] Правилно ги прочитав коефициентот, стандардната грешка, p-вредноста и R-квадратот.
  • [ ] Ја проверив стационарноста на серијата и го елиминирав ризикот од лажна регресија.
  • [ ] Ја именував испуштената променлива и можности за обратна каузалност.
  • [ ] Направив дијагностички тестови и оценував прекршувања.
  • [ ] Одделно ја проценив статистичката и економската значајност.
  • [ ] Го привлеков каузалниот јазик на вештачката интелигенција во релацискиот јазик.
  • [ ] Тврдев дека изборот на моделот и судот за каузалноста е мој.