Единици
1. Вештачка интелигенција во економетријата и статистиката: улоги, граници, автентикација и приватност 2. Чистење и подготовка на податоци: Недостасуваат податоци, оддалечени и кодирање 3. Истражувачка анализа и визуелизација на податоци: графика и интерпретација со вештачка интелигенција 4. Линеарна регресија: Изградба на модел, толкување на коефициентот и претпоставки 5. Регресиска дијагностика и прекршувања: колинеарност, хетероскедастичност, автокорелација 6. Тестирање на хипотези и p-вредност: Значење, моќ и повеќекратни споредби 7. p-хакирање, HARKing и статистички интегритет: стапици во ерата на вештачката интелигенција 8. Анализа на временски серии: стационарност, ARIMA и предвидување 9. Причина и анализа на политики: DiD, IV, RDD и вештачка интелигенција 10. Генерирање и репродуктивност на кодови: R/Python, верзии и репродуктивност 11. Пишување извештаи, комуникација и етика: презентирање резултати и граници на комуникација
Единица 4 / 11

Линеарна регресија: Изградба на модел, толкување на коефициентот и претпоставки

Добивки:

  • Способност да се изгради линеарен регресивен модел со поддршка на вештачка интелигенција и интерпретација на коефициенти, стандардни грешки и R-квадрат на точен и непричински јазик
  • Способност да се разберат основните претпоставки на кои се заснова моделот (линеарност, егзогеност, константна варијанса) и што се случува кога тие се прекршуваат и да се користи вештачка интелигенција за контрола на претпоставките.
  • Способност да се препознаат и коригираат прекумерните причински тврдења и занемарените променливи проблеми во толкувањата на коефициентот произведени од вештачката интелигенција

Линеарната регресија е столбот на економетријата и применетата статистика. Во својата наједноставна форма, проценува како зависната променлива (исходот што сакате да го објасните, како што е приходот) варира преку линеарна врска со една или повеќе независни променливи (објаснувачки фактори, како што се години на образование, искуство). Моделот има форма: приход = β0 + β1· образование + β2· искуство + u. Овде β (бета) коефициентите ја покажуваат големината на врската, а u го покажува терминот за грешка (сите незабележани ефекти) што моделот не може да го објасни. Во оваа единица, ќе видиме како вештачката интелигенција (AI) ја забрзува изградбата и интерпретацијата на регресијата, но зошто толкувањето на коефициентот е местото каде што најчесто се прават грешки.

Да ја ставиме основната цел од почеток: AI го пишува кодот за регресија, ја организира излезната табела, произведува нацрт за толкување на коефициентот. Но, ваша одлука е кои променливи влегуваат во моделот (спецификација на моделот), дали коефициентот се толкува како причински или релациски и дали има променлива занемарена. Најопасната навика на вештачката интелигенција е да ги прикаже обичните коефициенти на регресија во каузален јазик како што е „X го зголемува Y“; додека повеќето регресии покажуваат само врска (корелација).

Работен тек на регресија во чекор

1. Изградете го моделот со теорија. Кои варијабли ќе бидат зависни, а кои независни доаѓа од теренското знаење и теорија, а не од статистиката. Логиката на "Кои фактори логично влијаат на овој резултат?" не е логиката „што и да ставам во податоците, коефициентот ќе биде значаен“.

2. Погоди. Најчестиот метод е OLS (Обични најмали квадрати): ги избира коефициентите на начин што го минимизира збирот на квадратните разлики помеѓу набљудуваните и предвидените вредности. AI го генерира кодот за ова (lm() во R, statsmodels во Python) во лет.

3. Прочитајте го излезот. Барајте четири работи во излезот на регресија: коефициент (насока и големина на врската), стандардна грешка (проценка несигурност на коефициентот), t-статистичка и p-вредност (јачина на доказ дека коефициентот е различен од нула), R-квадрат (колку од варијацијата во зависната променлива моделот објаснува од 0 до ran1). Високиот R-квадрат не значи „добар модел“; Воопшто нема каузалност.

4. Толкувајте го коефициентот правилно. Ако коефициентот на образование е 1.200, точната интерпретација е: „Другите варијабли се константни, едногодишното зголемување на образованието е поврзано со просечно 1.200 единици повисок приход“. Погрешно толкување: „Уште една година образование ги зголемува приходите за 1200“. Второто е тврдењето за каузалност и може да се брани само со соодветен дизајн (единица 9).

5. Проверете ги претпоставките. Валидноста на регресијата зависи од одредени претпоставки (подолу). ВИ генерира дијагностички код; Вие направете го коментарот.

Основни претпоставки за линеарна регресија

Претпоставките на кои се заснова класичниот линеарен модел се неопходни за коефициентите да бидат непристрасни (центрирани во линија), а стандардните грешки да бидат сигурни:

  • Линеарност: Односот е линеарен по параметри (потребно е развлечен во лог/квадрат).
  • Егзогеност (нула условна средина): Терминот за грешка е неповрзан со објаснувачките променливи. Ова е најкритичната и најчесто прекршената претпоставка; прекршувањето создава испуштена пристрасност на променливата.
  • Постојана варијанса (хомоскедастичност): Варијансата на терминот за грешка е иста кај сите набљудувања (прекршување: хетероскедастичност — единица 5).
  • Отсуство на автокорелација: Грешките се независни една од друга (чести прекршувања во временските серии - единици 5 и 8).
  • Отсуство на екстремна мултиколинеарност: Објаснувачките променливи не се ни приближно идентични една со друга (единица 5).
Внимание: Најопасниот проблем е занемарената променлива пристрасност. Ако изоставите фактор од вашиот модел кој е поврзан и со приходот и со образованието (на пр. семејно потекло, способност), коефициентот на образование го презема ефектот на овој фактор што недостасува и станува надуен. ВИ не може да ја знае променливата што недостасува; Само вашето знаење од областа може да го долови.

Споредбена табела: точно наспроти погрешно толкување на коефициентот

излез

Неправилно (каузално) толкување

Правилно (релационо) толкување

коефициент на образование = 1.200

„Образованието ги зголеми приходите за 1.200“

„Една година повеќе образование, ceteris paribus, е поврзано со 1.200 повисоки приходи“.

R² = 0,68

„Манекенката ја фати реалноста“

„68% од промената е објаснета; не покажува каузалност“

стр <0,01

„Влијанието е огромно“

„Силен доказ дека коефициентот е различен од нула; големината е дискретна“

негативен коефициент

„X го намалува Y“

„Како што X се зголемува, Y просекот се намалува; зошто е друг проблем?

Четири потсетници за копирање

1. Генерирање на регресивен код:

Вашата улога: асистент за економетриски кодови. Не ги споделувам податоците, сакам Р код. Во податокот.рамка 'податоци', приходи (зависни), образование, искуство, пол (категорично). Задача: напишете регресивен код со lm() за приход ~ образование + искуство + пол, прикажете го збирниот излез и интервалот на доверливост (конфинт) на коефициентите. Објаснете го секој дел со линија за коментари. Ќе трчам и ќе го потврдам резултатот.

2. Скица на интерпретација на коефициентот (на релациски јазик):

Толкувајте го излезот на регресија подолу, но ПРАВИЛА: - пишувајте коефициенти на РЕЛАЦИОНАЛЕН јазик („поврзан со“), НЕ користете причински јазик, - додадете „константа на други променливи“, - презентирајте го R-квадрат како „каузалност“, - не мешајте ја значајноста со големината на ефектот. Излез: [залепете табела]

3. Шифра за проверка на претпоставка:

Напишете претпоставен дијагностички код за моделот на приход ~ образование + искуство (R): графикони со резидуално фитинг (преостанати), графикон за QQ, дистрибуција на остатоци. Објаснете во линијата за коментар која претпоставка ја тестира секој график. Предложете корекција; Само направи дијагноза и јас ќе донесам одлука.

4. Пропуштено барање за променлива:

Помогнете ми да го разгледам ризикот од занемарена променлива пристрасност во моделот на приход ~ образование. Наведете ги можните варијабли кои се поврзани и со приходот и со образованието, но НЕ се во моделот (на пример, семејно потекло, регион, способност) и објаснете во која насока секоја може да го пристрасува коефициентот на образование. Ова не е сигурност, нека биде листа на размислувања; Јас ќе ја донесам одлуката.

Слаб промпт / Силен промпт

Слаба навестување:

Толкувајте го овој излез од регресија и објаснете ги резултатите.

Овој потсетник ја ослободува вештачката интелигенција; најверојатно произведува каузални и претерани реченици како „тренингот го зголемува приходот“ и „моделот е многу успешен“.

Моќен потсетник:

Вашата улога: внимателен асистент по економетрија. Толкувајте го излезот, но: (1) напишете ги сите коефициенти на релациски јазик, (2) користете ја шемата „all other ceteris paribus“, (3) не погрешно R-квадрат за каузалност, (4) одделете го значењето од големината на ефектот, (5) забележете неуспех да ја тестирате претпоставката за егзогеност на моделот и ризикот од занемарени променливи. Излез: [табела]

Разликата: силната волја го забранува причинскиот јазик, правејќи ги видливи двосмисленоста и границите на претпоставките.

три мини футроли

Случај 1 — Каузална јазична замка. Еден аналитичар откри дека коефициентот на рекламирање е 2,4 во неговата регресија за рекламирање ~ продажба и го искористи планот за вештачка интелигенција како што е: „Секоја единица потрошена за рекламирање ја зголемува продажбата за 2,4 единици“. Менаџментот соодветно го надува буџетот; додека за време на периоди на висока продажба веќе имало повеќе рекламирање (обратна каузалност) и коефициентот го одразува тоа. Поука: обичната регресија не е доказ за каузалноста; насоката е нејасна.

Случај 2 - Занемарена променлива. Во една студија, коефициентот на приход ~ образование беше 1.900. Кога на моделот беа додадени образованието на родителите и регионот, коефициентот падна на 1.150. Во првиот модел, образованието всушност презеде дел од влијанието на семејното потекло. Лекција: променливата што недостасува, но во корелација го надува коефициентот; Размислете за можните недостатоци со знаењето за доменот.

Случај 3 - илузија со висок R-квадрат. Еден студент видел R²=0,94 и рекол „мојот модел е совршен“. Но, една од независните променливи беше речиси идентична со зависната променлива (артикал веќе вклучен во продажбата). Моделот не ја објаснуваше реалноста, туку самата се објаснуваше. Лекција: високиот R-квадрат не гарантира квалитет на моделот; Потребна е логичка проверка.

Вообичаени грешки

  • Причинска интерпретација на коефициентот. Јазикот „зголемува/намалува“ е лажен, освен ако не се брани со дизајн; Кажете „поврзан со“.
  • Игнорирање на занемарената променлива. Факторот што недостасува поврзан со X и Y го пристрасува коефициентот; Размислете за можните недостатоци.
  • Грешка R-квадрат како мерка за успех. Високиот R-квадрат не значи каузалност или правилен модел; Тоа дури може да биде знак за променливо истекување.
  • Збунувачки значење со големина. p<0,05 не покажува дека ефектот е голем; Видете ја и практичната големина на коефициентот.
  • Толкување на претпоставките без нивно проверување. Прекршувањата ги искривуваат стандардните грешки и толкувањето; дијагнозата не може да се пропушти.
Совет: За секој коефициент, прашајте „Можам ли да ја објаснам оваа врска во спротивна насока? Или постои трет фактор што влијае и на двете?“ Овие две прашања престануваат со каузалното претолкување уште пред пенкалото да ја допре хартијата.

Сумирано

Линеарната регресија е основна алатка за мерење на односот на исходот со објаснувачките фактори. AI брзо го произведува кодот на моделот, изгледот на излезот и прегледот на интерпретацијата; но спецификацијата на моделот, релациската интерпретација на коефициентот и ризикот од занемарени променливи се одговорност на експертот. Најчеста грешка е да се прикаже коефициентот како каузален („се зголемува“); правилниот јазик е релациски („се однесува на, сè друго е постојано“). Високиот R-квадрат не е успех или каузалност; Ниту едно толкување не е безбедно без проверка на претпоставките (особено егзогеноста).

Задача за апликација

Поставете регресија со една зависна и најмалку две независни променливи на множество податоци. Побарајте го кодот од вештачката интелигенција и стартувајте го. Прво, вештачката интелигенција нека ги протолкува коефициентите на релациски јазик, а потоа ќе ја прегледате и поправите секоја причинска изјава. Додадете потенцијално поврзана променлива на моделот и набљудувајте како се менува главниот коефициент и толкујте го ова во параграф во рамките на испуштената пристрасност на променливата. Конечно, изгответе дијагностички заговори за претпоставки и забележете која претпоставка изгледа солидна, а која сомнителна.

листа за проверка

  • [ ] Моделот го изградив врз основа на теорија и теренско знаење, а не на податоци.
  • [ ] Коефициентите ги толкував во релациски јазик („се однесува на, ceteris paribus“).
  • [ ] Забележав дека каузалните барања бараат посебен дизајн.
  • [ ] Ја тестирав чувствителноста на главниот коефициент со разгледување на можните занемарени променливи.
  • [ ] Не го претставив R-квадратот како мерка за успех/каузалност.
  • [ ] Произведени и интерпретирани хипотетички дијагностички заговори; Проценив дали има прекршок.