Добици:
- Бити у стању да разликује где у емпиријском току рада (чишћење података, код, визуелизација, тумачење нацрта) вештачка интелигенција штеди реално време и где су одлуке као што су избор модела, тврдња о узрочности и одлука о објављивању препуштене стручњаку, у складу са нивоом ризика задатка
- Способност примене дисциплине која верификује сваки излаз вештачке интелигенције (број, коефицијент, шифра, коментар) кроз кораке поновног израчунавања, повезивања са извором и статистичког филтрирања.
- Способност безбедне обраде микро података и поверљивих/лиценцираних скупова података у оквиру КВКК/ГДПР и уговора о коришћењу података и стицање навике избора одговарајућих алата.
Иста питања се понављају сваког дана на столу економетричара или примењеног статистичара: Да ли је овај скуп података поуздан; Шта учинити са овим недостајућим вредностима? Шта заправо говори коефицијент ове регресије? Да ли је ова веза узрочна или само корелација? Пошто је ова п-вредност значајна, могу ли је написати у чланку или сажетку политике? Нека од ових питања се понављају, захтевају много кода и одузимају време: чишћење података, цртање истог графикона десет пута, отклањање грешака у Р или Питхон коду, стринговање резултата у табелу. Други директно одређују валидност налаза, поштење публикације или тачност политичке одлуке.
Вештачка интелигенција (укратко АИ – компјутерски системи који могу да производе текст и код попут људи, препознају обрасце, сумирају податке и пишу коментаре; данас се најчешће користи велики језички модели, односно системи који се обучавају на огромном тексту и граде реченице предвиђајући следећу реч) налази се тачно у средини ове табеле. Када се правилно користи, смањује сате кода за чишћење података на минуте, подсећа вас на синтаксу сложеног статистичког теста или прави нацрт интерпретације коефицијента. Када се користи погрешно, представља наизглед сигуран, али потпуно измишљен број, лажни значај или не-узрочну везу као „налаз“.
Ова прва јединица није увод у софтвер. Његова сврха је да разјасни где да ставите вештачку интелигенцију у свој емпиријски ток посла, а где да је никада не смете. Економетрија је и поље „критично за методу“ и индиректно „критично за одлучивање“: коефицијент модела који градите може бити инпут за одлуку централне банке о каматној стопи, промену политике регулатора или милионска инвестиција фирме. Хајде да изложимо основни принцип од почетка: Вештачка интелигенција је помоћник у анализи, а не истраживач. Одговорност за и коначно одобрење избора модела, стратегије идентификације, утврђивања узрочности, објављивања и одлука о политици лежи на компетентном стручњаку.
Слојеви емпиријског тока рада и место АИ
Корисно је поделити емпиријску студију у три слоја. Извршни слој је свакодневни технички посао: код за чишћење података, цртање графикона, форматирање табеле, отклањање грешака у синтакси. Слој методе је аналитичка одлука: који модел, која стратегија идентификације, који тест, која провера претпоставке. Слој тумачења и одлучивања је значење налаза: шта коефицијент каже, да ли је узрочно, шта значи за политику, ако се објави. АИ додирује сва три слоја, али са различитим ауторитетом у сваком. На извршном слоју, АИ брзо израђује и генерише код; На слоју тумачења и одлучивања, даје се само инпут и експерт доноси одлуку.
Хајде да од почетка дефинишемо неколико основних појмова. Економетрија је грана која анализира економске и друштвене податке статистичким методама и мери односе. Регресија је метода која нумерички моделује однос варијабле исхода (зависне варијабле) са једном или више објашњавајућих варијабли (независних варијабли). Коефицијент је број који показује са колико јединица промене у просеку је повезана промена од једне јединице у променљивој која објашњава исход. П-вредност је вероватноћа да ће се посматрани исход (или екстремнији исход) десити случајно када никакав ефекат заправо не постоји. Објаснићемо ове концепте један по један у следећим јединицама; За сада, знајте ово: у свему томе, АИ вам даје нацрт, код и објашњење, али не доноси научне одлуке.
Следећа табела резимира улогу и ниво ризика АИ по мисији:
Куест
Улога АИ
Ниво ризика
Ко одобрава
Писање кода за санирање података
генератор кода
ниско
Сам аналитичар (са тестирањем кода)
Нацрт графикона/табеле
генератор скица
ниско
аналитичар
Подсетник за синтаксу теста/модела
Референтни асистент
ниско-средње
аналитичар
Нацрт тумачења коефицијента
писац нацрта
средње
економетричар
Избор модела/стратегије идентификације
помоћни улаз
висока
стручни истраживач
Тужба о узрочности
Само нацрт, никад коначна реч
веома високо
Експерт + рецензија колега
Публикација/одлука о политици
само унос
веома високо
Одговорни истражитељ/институција
Имајте на уму једну линију у овој табели: како ризик расте, улога АИ се смањује, а одобравање стручњака расте.
Зашто је „верификација“ срце овог посла
Језички модели изгледају сигурни у свој одговор, али можда нису сигурни. Техничким језиком, ово се зове халуцинација: то је моделова измишљотина непостојећих информација у течној реченици, баш као да је истинита. За економетричара ово је смртоносна замка. Модел вам може дати тачан број као што је „Корелација између незапослености и инфлације у Турској између 2015-2020 је 0,62“; Међутим, он никада није видео ваше податке и овај број је потпуно измишљен. Или може да каже: „П-вредност белог теста била је 0,03“; док није извршио никакве тестове. Може позвати Р функцију са аргументом који заправо не постоји. Он пева све три са истом течношћу; Једина ствар која раздваја исправно од погрешног је ваше знање и ваша навика да проверавате.
Дисциплина верификације се састоји од три корака:
- Поново израчунајте / покрените у свом окружењу: Израчунајте сваки број, однос, резултат теста и коефицијент који даје АИ у Р/Питхон-у са својим подацима, а не из меморије АИ. Користите АИ да напишете код, а не да запамтите резултат. Покрените код, производите излаз.
- Линк ка извору: Ослоните се на уџбенике, чланке о методама и званичне документе за правила, формуле и дефиниције метода. Потврдите изјаву АИ „претпоставка овог теста је“ са поузданим извором.
- Статистички филтер: Тестирајте очима стручњака да ли је резултат у супротности са статистичком логиком (претпоставке, узорак, величина ефекта, неизвесност). Одбаците „смислен, али апсурдан“ резултат.
Опрез: Стављање коефицијента, теста или тумачења генерисаног вештачком интелигенцијом у чланак, тезу или напомену о политици без потврђивања је као објављивање непрегледаног налаза. Само зато што је излаз течан није тачно; Само зато што број изгледа сигуран, није стваран.
Приватност: микро подаци и лиценцирани подаци су приватно заштићени
Микроподаци (појединачни записи на нивоу појединца, домаћинства, предузећа или пацијента) се често користе у економетрији. Већина ових података су лични подаци и заштићени су КВКК (Закон о заштити личних података) у Турској и ГДПР у Европи. Поред тога, ТуркСтат, централне банке, добављачи панел података и комерцијални извори често дају податке уз уговор о коришћењу података; Ови уговори забрањују пренос података трећим лицима. Лепљење табеле која садржи информације о идентитету, приходу, здравственим тајнама или тајнама компаније у јавни АИ алат за ћаскање је и кршење КВКК/ГДПР и кршење уговора; јер подаци иду на екстерни сервер и могу се користити у обуци модела у неким алатима.
Правило је једноставно: чувајте податке у сопственом безбедном окружењу, питајте АИ само за код и методе. Идеалан ток посла је следећи: питајте АИ за код за анализу, а ви покрећете код са стварним подацима на сопственом рачунару/серверу предузећа. Ако заиста морате да делите податке, анонимизујте (уклоните ИД поља), агрегирајте (просек/број уместо појединачних) и изаберите алатке које су институционалне, имају уговор о обради података и не користите своје податке у образовању.
три мини кофера
Случај 1 — Безбедна и ефикасна употреба. Један истраживач је прво провео 6 сати ручно чистећи 40.000 редова података о буџету домаћинства. Без да уопште дели податке, само је описао имена променљивих и структуру АИ и затражио код за чишћење. АИ је генерисао Р скрипту; Истраживач је покренуо код у свом окружењу, проверио број редова и збирну статистику сваког корака и поправио две логичке грешке. Трајање: 70 минута уместо 6 сати. Подаци никада нису изашли; Одговорност је остала на истраживачу.
Случај 2 — Замка непровереног броја. „Која је еластичност између раста БДП-а и страних директних инвестиција“, питао је дипломирани студент АИ. АИ је самоуверено дао број "око 0,34" иако није имао приступ никаквим подацима. Ученик је ово написао у сажетку литературе; Када је његов саветник питао за извор, испоставило се да број нема никакву основу и да је потпуно измишљен. Грешка: Очекивати конкретне статистике од АИ без давања података и ресурса.
Случај 3 — Поверљивост и кршење уговора. Аналитичар је отпремио Екцел, који је добио од панела лиценциране компаније, који садржи назив компаније и промет, у јавно доступан алат за вештачку интелигенцију и рекао „урадите регресију панела“. Уговор са добављачем података забрањивао је пренос података на системе трећих страна; Инцидент је подстакао ревизију усклађености. Прави начин је био да се називи компанија замене анонимним кодовима или да се не деле подаци и да се само захтева регресијски код панела и покрене у сопственом окружењу.
Слаби промпт / Јаки промпт
Слабо обавештење:
Анализирати однос инфлације и незапослености и навести коефицијент.
Ова тврдња је погрешна: АИ нису дати подаци, није јасно која земља, који период, који модел. АИ може одговорити само са измишљеним коефицијентом.
Снажан упит:
Ваша улога: ви сте помоћник у анализи који помаже истраживачу економетрије. НЕ делим податке са вама; Само желим РУННАБЛЕ Р код. Имам годишњи панел: варијабле земља, година, незапосленост, инфлација (све нумерички). Задатак: 1) напишите регресијски код панела фиксних ефеката за незапосленост ~ инфлацију (плм пакет), 2) објасните сваки корак у коду линијом за коментаре, 3) приметите да коефицијент треба да се тумачи као релациони, а не УЗРОЧНИ, 4) направите аргумент функције за који нисте сигурни; Ја ћу покренути и проверити резултат у свом окружењу.
У овом захтеву се не деле никакви подаци, јасни су улога, пакети, очекивање коментара и забрана „фабрикације“. И даље покрећете и сами верификујете излаз.
Следећа табела резимира правила од једне реченице у овој лекцији:
принцип
Шта то значи
АИ је помоћник
Научна одлука и одговорност припада стручњаку
Затражите код, дајте резултат
АИ не памти број; покренеш га и израчунаш
чувати податке
Микро/лиценцирани подаци не напуштају безбедно окружење
верифи
Сваки проблем, код, коментар се проверава; измишљотина се одбацује
Уобичајене грешке
- Очекивање конкретне статистике од АИ без давања података. Модел не може приступити подацима; Коефицијент, корелација и п-вредност које даје су лажни. Увек захтевајте код и сами произведите резултат.
- Ослањајући се на халуцинаторне функције. АИ може предложити Р/Питхон функцију или аргумент који не постоји. Не прихватајте код без покретања и провере.
- Отпремање микроподатака у јавни алат. То је кршење КВКК/ГДПР и уговора о коришћењу података. Анонимизујте податке или их немојте уопште делити.
- Грешка течност за тачност. Добро написана рецензија може бити нетачна. Лепота реченице није доказ.
- Прихватање каузалног језика без контроле. ИЗ често каже „Кс повећава И“; док већина регресија показује само односе. Одбраните узрочну тврдњу дизајном.
Савет: Када радите са вештачком интелигенцијом, поставите себи ово питање: „Ако судија или ревизор затражи овај резултат, могу ли да покажем извор и рачун?“ Ако је одговор не, излаз још није спреман за употребу.
Укратко
АИ обезбеђује стварно и огромно убрзање у слоју извршавања (код, чишћење, графикон, нацрт) економетрије и статистике; међутим, избор модела, узрочност, тумачење, објављивање и политичке одлуке припадају експерту. Три основне дисциплине: не подсећајте АИ на број, тражите код и сами генеришите и проверите резултат; не уклањајте микро/лиценциране податке из безбедног окружења; статистички филтрирати сваки излаз. Непроверени излаз вештачке интелигенције је једнако ризичан као и непроверени налаз.
Задатак апликације
Размотрите свој (или пример) скуп података. Питајте АИ за Р или Питхон код који производи дескриптивну статистику и једноставан графикон једноставним описивањем променљиве структуре, без дељења података. Покрените долазни код у свом окружењу. Затим задржите контролну листу: (1) да ли је код радио без грешака, (2) је број редова/запажања како сте очекивали, (3) која од реченица коментара АИ користи узрочни језик и треба да буде исправљена. У једном пасусу напишите о времену које вас је АИ спасио и о најмање једној грешци коју сте ухватили.
контролна листа
- [ ] Нисам натерао АИ да тражи конкретну статистику; Затражио сам код и сам направио резултат.
- [ ] Поново сам израчунао сваки број и резултат теста које је дао у свом окружењу.
- [ ] Проверио сам да функције/аргументи које користи заиста постоје.
- [ ] Нисам отпремио микро/личне/лиценциране податке на јавни алат.
- [ ] Означио сам коментаре који садрже узрочни језик и преместио их у релациони језик.
- [ ] У стању сам да покажем извор и рачуноводство резултата ревизору.