Добици:
- Способност изградње модела линеарне регресије са подршком за вештачку интелигенцију и тумачење коефицијената, стандардних грешака и Р-квадрата на тачном и не-каузалном језику
- Способност разумевања основних претпоставки на којима се модел заснива (линеарност, егзогеност, константна варијанса) и шта се дешава када се оне наруше, као и коришћење вештачке интелигенције за контролу претпоставки.
- Способност препознавања и исправљања прекомерних узрочно-последичних тврдњи и занемарених варијабилних проблема у тумачењима коефицијената које производи вештачка интелигенција
Линеарна регресија је окосница економетрије и примењене статистике. У свом најједноставнијем облику, процењује како зависна варијабла (исход који желите да објасните, као што је приход) варира кроз линеарну везу са једном или више независних варијабли (објашњавајући фактори, као што су године образовања, искуство). Модел има облик: приход = β0 + β1·образовање + β2·искуство + у. Овде β (бета) коефицијенти показују величину односа, а у показује термин грешке (сви неопажени ефекти) који модел не може да објасни. У овој јединици ћемо видети како вештачка интелигенција (АИ) убрзава конструкцију и интерпретацију регресије, али зашто је интерпретација коефицијената место где се најчешће праве грешке.
Поставимо основну сврху од почетка: АИ пише регресијски код, организује излазну табелу, производи нацрт за интерпретацију коефицијената. Али ваша је одлука које варијабле улазе у модел (спецификација модела), да ли се коефицијент тумачи као узрочни или релациони, и да ли постоји занемарена варијабла. Најопаснија навика вештачке интелигенције је да представи обичне регресијске коефицијенте каузалним језиком као што је „Кс повећава И“; док већина регресија показује само однос (корелацију).
Постепени ток рада регресије
1. Изградите модел са теоријом. Које ће варијабле бити зависне, а које независне произилази из теренског знања и теорије, а не из статистике. Логика "Који фактори логично утичу на овај резултат?" није логика "шта год да унесем у податке, коефицијент ће бити значајан".
2. Погоди. Најчешћи метод је ОЛС (Ординари Леаст Скуарес): он бира коефицијенте на начин који минимизира збир квадрата разлика између посматраних и предвиђених вредности. АИ генерише код за ово (лм() у Р, статсмоделс у Питхон-у) у ходу.
3. Прочитајте излаз. Потражите четири ствари у излазу регресије: коефицијент (смер и величина везе), стандардну грешку (неизвесност процене коефицијента), т-статистику и п-вредност (јачина доказа да се коефицијент разликује од нуле), Р-квадрат (колики је део варијације зависне варијабле коју модел објашњава, у распону од 0 до 1). Висок Р-квадрат не значи "добар модел"; Узрочности уопште нема.
4. Правилно протумачити коефицијент. Ако је коефицијент образовања 1.200, исправно тумачење је: „С обзиром на то да су остале варијабле константне, једногодишњи пораст образовања повезан је са просечно 1.200 јединица већег прихода. Погрешно тумачење: „Још једна година школовања повећава приходе за 1.200. Други је тврдња о узрочности и може се бранити само одговарајућим дизајном (јединица 9).
5. Проверите претпоставке. Ваљаност регресије зависи од одређених претпоставки (доле). АИ генерише дијагностички код; Ви дајте коментар.
Основне претпоставке линеарне регресије
Претпоставке на којима се заснива класични линеарни модел су неопходне да би коефицијенти били непристрасни (центрирани на линији) и да би стандардне грешке биле поуздане:
- Линеарност: Однос је линеаран у параметрима (по потреби растегнут у терминима лог/квадрат).
- Егзогеност (нулта условна средња вредност): Термин грешке није у корелацији са објашњавајућим варијаблама. Ово је најкритичнија и најчешће кршена претпоставка; кршење ствара пристрасност изостављене променљиве.
- Константна варијанса (хомоскедастичност): варијанса термина грешке је иста у свим запажањима (кршење: хетероскедастичност — јединица 5).
- Одсуство аутокорелације: Грешке су независне једна од друге (честа кршења у временској серији — јединице 5 и 8).
- Одсуство екстремне мултиколинеарности: Објашњавајуће варијабле нису ни приближно идентичне једна другој (јединица 5).
Опрез: Најопаснији проблем је занемарена променљива пристрасност. Ако изоставите фактор из вашег модела који је повезан и са приходима и образовањем (нпр. породично порекло, способност), коефицијент образовања преузима ефекат овог фактора који недостаје и постаје надуван. АИ не може знати променљиву која недостаје; Само ваше знање на терену може то да ухвати.
Табела поређења: тачна вс. погрешна интерпретација коефицијента
излаз
Нетачно (узрочно) тумачење
Исправно (релационо) тумачење
коефицијент образовања = 1.200
„Образовање повећава приходе за 1.200“
„Једну годину више образовања, цетерис парибус, повезано је са 1.200 виших прихода.
Р² = 0,68
"Манекенка је ухватила стварност"
„68% промене је објашњено; не показује узрочност“
п < 0,01
"Утицај је огроман"
„Јаки доказ да се коефицијент разликује од нуле; величина је дискретна“
негативан коефицијент
"Кс смањује И"
"Како се Кс повећава, просек И опада; зашто је још један проблем?"
Четири упита за копирање
1. Генерисање регресијског кода:
Ваша улога: помоћник код економетрије. Не делим податке, желим Р код. У оквиру података 'подаци' приходи (зависни), образовање, искуство, пол (категорички). Задатак: напишите регресијски код са лм() за приход ~ образовање + искуство + пол, покажите збирни резултат и интервал поверења (ограничење) коефицијената. Објасните сваки део редом за коментаре. Трчаћу и проверити резултат.
2. Скица интерпретације коефицијената (на релационом језику):
Протумачите излаз регресије у наставку, али ПРАВИЛА:- пишите коефицијенте на РЕЛАЦИОНОМ језику („повезани са“), НЕ користите каузални језик,- додајте „константу других променљивих“,- представите Р-квадрат као „узрочност“,- немојте бркати значај са величином ефекта. Излаз: [пасте табле]
3. Код за проверу претпоставке:
Напишите код за дијагнозу претпоставке за приход ~ образовање + модел искуства (Р): резидуални (резидуални) графови, КК граф, дистрибуција резидуала. Објасните у реду за коментаре коју претпоставку сваки графикон тестира. Предложите исправку; Само поставите дијагнозу и ја ћу донети одлуку.
4. Пропуштени упит променљиве:
Помозите ми да размотрим ризик од занемарене променљиве пристрасности у моделу прихода ~ образовања. Наведите могуће варијабле које су повезане и са приходима и са образовањем, али НИСУ у моделу (нпр. породично порекло, регион, способност) и објасните у ком правцу свака може да утиче на коефицијент образовања. Ово није извесност, нека то буде листа разматрања; Ја ћу донети одлуку.
Слаби промпт / Јаки промпт
Слабо обавештење:
Протумачите овај излаз регресије и објасните резултате.
Овај одзив ослобађа АИ; највероватније производи узрочне и преувеличане реченице као што су „тренинг повећава приход” и „модел је веома успешан”.
Снажан упит:
Ваша улога: пажљив помоћник економетрије. Интерпретирајте излаз, али: (1) напишите све коефицијенте релационим језиком, (2) користите образац „све остало цетерис парибус“, (3) немојте погрешно узети Р-квадрат за узрочност, (4) одвојите значај од величине ефекта, (5) обратите пажњу на неуспех да се тестира претпоставка егзогености модела и ризик од преокрета. Излаз: [табела]
Разлика: јака воља забрањује каузални језик, чинећи двосмисленост и границе претпоставке видљивим.
три мини кофера
Случај 1 — Узрочна језичка замка. Један аналитичар је открио да је коефицијент оглашавања 2,4 у његовој регресији продаје и рекламирања и користио је АИ план као што је: „Свака јединица потрошена на оглашавање повећава продају за 2,4 јединице.“ Управа је у складу с тим надувала буџет; док је током периода високе продаје већ било више реклама (обрнута узрочност) и коефицијент је то одражавао. Поука: обична регресија није доказ узрочности; правац је нејасан.
Случај 2 — Превиђена варијабла. У једној студији, коефицијент прихода ~ образовања био је 1.900. Када се у модел додају образовање родитеља и регион, коефицијент је пао на 1.150. У првом моделу, образовање је заправо преузело део утицаја породичног порекла. Лекција: променљива која недостаје, али је корелирана, надувава коефицијент; Размотрите могуће недостатке са познавањем домена.
Случај 3 — Илузија високог Р-квадрата. Студент је видео Р²=0,94 и рекао „мој модел је савршен“. Али једна од независних варијабли била је скоро идентична зависној варијабли (ставка која је већ укључена у продају). Модел није објашњавао стварност, он је објашњавао себе. Лекција: висок Р-квадрат не гарантује квалитет модела; Потребна је провера логике.
Уобичајене грешке
- Тумачење коефицијента узрочно. Језик „повећава/смањује“ је лажан осим ако није заштићен дизајном; Реците "повезан са".
- Игнорисање занемарене променљиве. Фактор који недостаје повезан са Кс и И утиче на коефицијент; Размотрите могуће недостатке.
- Погрешан Р-квадрат као мера успеха. Висок Р-квадрат не значи узрочност или исправан модел; То чак може бити знак променљивог цурења.
- Бркање значаја са величином. п<0,05 не указује да је ефекат велики; Види и практичну величину коефицијента.
- Тумачење претпоставки без њихове провере. Кршења искривљују стандардне грешке и тумачење; дијагноза се не може пропустити.
Савет: За сваки коефицијент питајте „Могу ли да објасним овај однос у супротном смеру? Или постоји трећи фактор који утиче на оба?“ Ова два питања заустављају узрочну претерану интерпретацију пре него што оловка дотакне папир.
Укратко
Линеарна регресија је основно средство за мерење односа исхода и фактора који објашњавају. АИ брзо производи код модела, изглед излаза и нацрт интерпретације; али спецификација модела, релационо тумачење коефицијента и ризик од занемарених варијабли су одговорност стручњака. Најчешћа грешка је да се коефицијент прикаже као каузални („повећава“); исправан језик је релациони („односи се на, све остало је константно“). Висок Р-квадрат није успех или узрочност; Ниједна интерпретација није безбедна без провере претпоставки (посебно егзогености).
Задатак апликације
Подесите регресију са једном зависном и најмање две независне променљиве на скупу података. Затражите код од АИ и покрените га. Прво, нека АИ тумачи коефицијенте релационим језиком, а затим прегледајте и исправите сваку узрочну изјаву. Додајте потенцијално сродну променљиву у модел и посматрајте како се мења главни коефицијент и интерпретирајте ово у параграфу у оквиру изостављене пристрасности варијабли. На крају, направите дијагностичке дијаграме претпоставки и забележите која претпоставка изгледа чврсто, а која сумњива.
контролна листа
- [ ] Изградио сам модел на основу теорије и теренског знања, а не података.
- [ ] Коефицијенте сам тумачио релационим језиком („односи се на, цетерис парибус“).
- [ ] Приметио сам да узрочне тврдње захтевају посебан дизајн.
- [ ] Тестирао сам осетљивост главног коефицијента разматрајући могуће занемарене варијабле.
- [ ] Нисам представио Р-квадрат као меру успеха/узрочности.
- [ ] Произведена и интерпретирана хипотетичка дијагноза; Процењивао сам да ли је било прекршаја.