Добивки:
- Способност да се изгради линеарен регресивен модел со поддршка на вештачка интелигенција и интерпретација на коефициенти, стандардни грешки и R-квадрат на точен и непричински јазик
- Способност да се разберат основните претпоставки на кои се заснова моделот (линеарност, егзогеност, константна варијанса) и што се случува кога тие се прекршуваат и да се користи вештачка интелигенција за контрола на претпоставките.
- Способност да се препознаат и коригираат прекумерните причински тврдења и занемарените променливи проблеми во толкувањата на коефициентот произведени од вештачката интелигенција
Линеарната регресија е столбот на економетријата и применетата статистика. Во својата наједноставна форма, проценува како зависната променлива (исходот што сакате да го објасните, како што е приходот) варира преку линеарна врска со една или повеќе независни променливи (објаснувачки фактори, како што се години на образование, искуство). Моделот има форма: приход = β0 + β1· образование + β2· искуство + u. Овде β (бета) коефициентите ја покажуваат големината на врската, а u го покажува терминот за грешка (сите незабележани ефекти) што моделот не може да го објасни. Во оваа единица, ќе видиме како вештачката интелигенција (AI) ја забрзува изградбата и интерпретацијата на регресијата, но зошто толкувањето на коефициентот е местото каде што најчесто се прават грешки.
Да ја ставиме основната цел од почеток: AI го пишува кодот за регресија, ја организира излезната табела, произведува нацрт за толкување на коефициентот. Но, ваша одлука е кои променливи влегуваат во моделот (спецификација на моделот), дали коефициентот се толкува како причински или релациски и дали има променлива занемарена. Најопасната навика на вештачката интелигенција е да ги прикаже обичните коефициенти на регресија во каузален јазик како што е „X го зголемува Y“; додека повеќето регресии покажуваат само врска (корелација).
Работен тек на регресија во чекор
1. Изградете го моделот со теорија. Кои варијабли ќе бидат зависни, а кои независни доаѓа од теренското знаење и теорија, а не од статистиката. Логиката на "Кои фактори логично влијаат на овој резултат?" не е логиката „што и да ставам во податоците, коефициентот ќе биде значаен“.
2. Погоди. Најчестиот метод е OLS (Обични најмали квадрати): ги избира коефициентите на начин што го минимизира збирот на квадратните разлики помеѓу набљудуваните и предвидените вредности. AI го генерира кодот за ова (lm() во R, statsmodels во Python) во лет.
3. Прочитајте го излезот. Барајте четири работи во излезот на регресија: коефициент (насока и големина на врската), стандардна грешка (проценка несигурност на коефициентот), t-статистичка и p-вредност (јачина на доказ дека коефициентот е различен од нула), R-квадрат (колку од варијацијата во зависната променлива моделот објаснува од 0 до ran1). Високиот R-квадрат не значи „добар модел“; Воопшто нема каузалност.
4. Толкувајте го коефициентот правилно. Ако коефициентот на образование е 1.200, точната интерпретација е: „Другите варијабли се константни, едногодишното зголемување на образованието е поврзано со просечно 1.200 единици повисок приход“. Погрешно толкување: „Уште една година образование ги зголемува приходите за 1200“. Второто е тврдењето за каузалност и може да се брани само со соодветен дизајн (единица 9).
5. Проверете ги претпоставките. Валидноста на регресијата зависи од одредени претпоставки (подолу). ВИ генерира дијагностички код; Вие направете го коментарот.
Основни претпоставки за линеарна регресија
Претпоставките на кои се заснова класичниот линеарен модел се неопходни за коефициентите да бидат непристрасни (центрирани во линија), а стандардните грешки да бидат сигурни:
- Линеарност: Односот е линеарен по параметри (потребно е развлечен во лог/квадрат).
- Егзогеност (нула условна средина): Терминот за грешка е неповрзан со објаснувачките променливи. Ова е најкритичната и најчесто прекршената претпоставка; прекршувањето создава испуштена пристрасност на променливата.
- Постојана варијанса (хомоскедастичност): Варијансата на терминот за грешка е иста кај сите набљудувања (прекршување: хетероскедастичност — единица 5).
- Отсуство на автокорелација: Грешките се независни една од друга (чести прекршувања во временските серии - единици 5 и 8).
- Отсуство на екстремна мултиколинеарност: Објаснувачките променливи не се ни приближно идентични една со друга (единица 5).
Внимание: Најопасниот проблем е занемарената променлива пристрасност. Ако изоставите фактор од вашиот модел кој е поврзан и со приходот и со образованието (на пр. семејно потекло, способност), коефициентот на образование го презема ефектот на овој фактор што недостасува и станува надуен. ВИ не може да ја знае променливата што недостасува; Само вашето знаење од областа може да го долови.
Споредбена табела: точно наспроти погрешно толкување на коефициентот
излез
Неправилно (каузално) толкување
Правилно (релационо) толкување
коефициент на образование = 1.200
„Образованието ги зголеми приходите за 1.200“
„Една година повеќе образование, ceteris paribus, е поврзано со 1.200 повисоки приходи“.
R² = 0,68
„Манекенката ја фати реалноста“
„68% од промената е објаснета; не покажува каузалност“
стр <0,01
„Влијанието е огромно“
„Силен доказ дека коефициентот е различен од нула; големината е дискретна“
негативен коефициент
„X го намалува Y“
„Како што X се зголемува, Y просекот се намалува; зошто е друг проблем?
Четири потсетници за копирање
1. Генерирање на регресивен код:
Вашата улога: асистент за економетриски кодови. Не ги споделувам податоците, сакам Р код. Во податокот.рамка 'податоци', приходи (зависни), образование, искуство, пол (категорично). Задача: напишете регресивен код со lm() за приход ~ образование + искуство + пол, прикажете го збирниот излез и интервалот на доверливост (конфинт) на коефициентите. Објаснете го секој дел со линија за коментари. Ќе трчам и ќе го потврдам резултатот.
2. Скица на интерпретација на коефициентот (на релациски јазик):
Толкувајте го излезот на регресија подолу, но ПРАВИЛА: - пишувајте коефициенти на РЕЛАЦИОНАЛЕН јазик („поврзан со“), НЕ користете причински јазик, - додадете „константа на други променливи“, - презентирајте го R-квадрат како „каузалност“, - не мешајте ја значајноста со големината на ефектот. Излез: [залепете табела]
3. Шифра за проверка на претпоставка:
Напишете претпоставен дијагностички код за моделот на приход ~ образование + искуство (R): графикони со резидуално фитинг (преостанати), графикон за QQ, дистрибуција на остатоци. Објаснете во линијата за коментар која претпоставка ја тестира секој график. Предложете корекција; Само направи дијагноза и јас ќе донесам одлука.
4. Пропуштено барање за променлива:
Помогнете ми да го разгледам ризикот од занемарена променлива пристрасност во моделот на приход ~ образование. Наведете ги можните варијабли кои се поврзани и со приходот и со образованието, но НЕ се во моделот (на пример, семејно потекло, регион, способност) и објаснете во која насока секоја може да го пристрасува коефициентот на образование. Ова не е сигурност, нека биде листа на размислувања; Јас ќе ја донесам одлуката.
Слаб промпт / Силен промпт
Слаба навестување:
Толкувајте го овој излез од регресија и објаснете ги резултатите.
Овој потсетник ја ослободува вештачката интелигенција; најверојатно произведува каузални и претерани реченици како „тренингот го зголемува приходот“ и „моделот е многу успешен“.
Моќен потсетник:
Вашата улога: внимателен асистент по економетрија. Толкувајте го излезот, но: (1) напишете ги сите коефициенти на релациски јазик, (2) користете ја шемата „all other ceteris paribus“, (3) не погрешно R-квадрат за каузалност, (4) одделете го значењето од големината на ефектот, (5) забележете неуспех да ја тестирате претпоставката за егзогеност на моделот и ризикот од занемарени променливи. Излез: [табела]
Разликата: силната волја го забранува причинскиот јазик, правејќи ги видливи двосмисленоста и границите на претпоставките.
три мини футроли
Случај 1 — Каузална јазична замка. Еден аналитичар откри дека коефициентот на рекламирање е 2,4 во неговата регресија за рекламирање ~ продажба и го искористи планот за вештачка интелигенција како што е: „Секоја единица потрошена за рекламирање ја зголемува продажбата за 2,4 единици“. Менаџментот соодветно го надува буџетот; додека за време на периоди на висока продажба веќе имало повеќе рекламирање (обратна каузалност) и коефициентот го одразува тоа. Поука: обичната регресија не е доказ за каузалноста; насоката е нејасна.
Случај 2 - Занемарена променлива. Во една студија, коефициентот на приход ~ образование беше 1.900. Кога на моделот беа додадени образованието на родителите и регионот, коефициентот падна на 1.150. Во првиот модел, образованието всушност презеде дел од влијанието на семејното потекло. Лекција: променливата што недостасува, но во корелација го надува коефициентот; Размислете за можните недостатоци со знаењето за доменот.
Случај 3 - илузија со висок R-квадрат. Еден студент видел R²=0,94 и рекол „мојот модел е совршен“. Но, една од независните променливи беше речиси идентична со зависната променлива (артикал веќе вклучен во продажбата). Моделот не ја објаснуваше реалноста, туку самата се објаснуваше. Лекција: високиот R-квадрат не гарантира квалитет на моделот; Потребна е логичка проверка.
Вообичаени грешки
- Причинска интерпретација на коефициентот. Јазикот „зголемува/намалува“ е лажен, освен ако не се брани со дизајн; Кажете „поврзан со“.
- Игнорирање на занемарената променлива. Факторот што недостасува поврзан со X и Y го пристрасува коефициентот; Размислете за можните недостатоци.
- Грешка R-квадрат како мерка за успех. Високиот R-квадрат не значи каузалност или правилен модел; Тоа дури може да биде знак за променливо истекување.
- Збунувачки значење со големина. p<0,05 не покажува дека ефектот е голем; Видете ја и практичната големина на коефициентот.
- Толкување на претпоставките без нивно проверување. Прекршувањата ги искривуваат стандардните грешки и толкувањето; дијагнозата не може да се пропушти.
Совет: За секој коефициент, прашајте „Можам ли да ја објаснам оваа врска во спротивна насока? Или постои трет фактор што влијае и на двете?“ Овие две прашања престануваат со каузалното претолкување уште пред пенкалото да ја допре хартијата.
Сумирано
Линеарната регресија е основна алатка за мерење на односот на исходот со објаснувачките фактори. AI брзо го произведува кодот на моделот, изгледот на излезот и прегледот на интерпретацијата; но спецификацијата на моделот, релациската интерпретација на коефициентот и ризикот од занемарени променливи се одговорност на експертот. Најчеста грешка е да се прикаже коефициентот како каузален („се зголемува“); правилниот јазик е релациски („се однесува на, сè друго е постојано“). Високиот R-квадрат не е успех или каузалност; Ниту едно толкување не е безбедно без проверка на претпоставките (особено егзогеноста).
Задача за апликација
Поставете регресија со една зависна и најмалку две независни променливи на множество податоци. Побарајте го кодот од вештачката интелигенција и стартувајте го. Прво, вештачката интелигенција нека ги протолкува коефициентите на релациски јазик, а потоа ќе ја прегледате и поправите секоја причинска изјава. Додадете потенцијално поврзана променлива на моделот и набљудувајте како се менува главниот коефициент и толкујте го ова во параграф во рамките на испуштената пристрасност на променливата. Конечно, изгответе дијагностички заговори за претпоставки и забележете која претпоставка изгледа солидна, а која сомнителна.
листа за проверка
- [ ] Моделот го изградив врз основа на теорија и теренско знаење, а не на податоци.
- [ ] Коефициентите ги толкував во релациски јазик („се однесува на, ceteris paribus“).
- [ ] Забележав дека каузалните барања бараат посебен дизајн.
- [ ] Ја тестирав чувствителноста на главниот коефициент со разгледување на можните занемарени променливи.
- [ ] Не го претставив R-квадратот како мерка за успех/каузалност.
- [ ] Произведени и интерпретирани хипотетички дијагностички заговори; Проценив дали има прекршок.