Добивки:
- Способноста да разликува каде во емпирискиот работен тек (чистење податоци, код, визуелизација, толкување нацрт) вештачката интелигенција заштедува реално време и каде одлуките како што се изборот на модел, тврдењето за каузалност и одлуката за објавување се препуштени на експертот, според нивото на ризик од задачата
- Способност да се примени дисциплина која го потврдува секој излез од вештачка интелигенција (број, коефициент, код, коментар) преку чекорите на повторна пресметка, поврзување со изворот и статистичко филтрирање.
- Способност за безбедно обработување на микро податоци и доверливи/лиценцирани збирки на податоци во опсегот на KVKK/GDPR и договорите за користење податоци и стекнување навика за избор на соодветни алатки.
Истите прашања се повторуваат секој ден на бирото на економетричар или применет статистичар: Дали овој сет на податоци е сигурен; Што да се прави со овие вредности што недостасуваат? Што навистина кажува коефициентот на оваа регресија? Дали оваа врска е причинска или само корелациска? Бидејќи оваа p-вредност е значајна, дали можам да ја напишам во написот или брифот за политиката? Некои од овие прашања се повторливи, интензивни за кодови и одземаат многу време: чистење на податоци, исцртување на истиот график десет пати, дебагирање на R или Python код, стрингирање на резултатите во табела. Други директно ја одредуваат валидноста на наодот, чесноста на публикацијата или точноста на одлуката за политика.
Вештачката интелигенција (накратко, вештачка интелигенција - компјутерски системи кои можат да произведуваат текст и код како луѓето, да препознаваат шаблони, да резимираат податоци и да пишуваат коментари; најкористената форма денес се големи јазични модели, односно системи кои се обучуваат на огромен текст и градат реченици со предвидување на следниот збор) се наоѓа точно на средината на оваа табела. Кога се користи правилно, тој ги намалува часовите на кодот за чистење податоци на минути, ве потсетува на синтаксата на сложен статистички тест или нацрта толкување на коефициент. Кога се користи неправилно, тој претставува навидум сигурна, но целосно измислена бројка, лажно значење или непричинска врска како „наод“.
Оваа прва единица не е вовед во софтвер. Неговата цел е да разјасни каде да ја ставите вештачката интелигенција во вашиот емпириски работен тек и каде никогаш да не ја ставите. Економетријата е и поле „критично за методот“ и индиректно „критично за одлучување“: коефициентот на моделот што ќе го изградите може да биде влез во одлуката за каматната стапка на централната банка, промената на политиката на регулаторот или инвестицијата од милион долари на фирмата. Ајде да го поставиме основниот принцип од почеток: Вештачката интелигенција е асистент за анализа, а не истражувач. Одговорноста за и конечното одобрување на изборот на моделот, стратегијата за идентификација, потврдувањето на каузалноста, објавувањето и одлуките за политиката е на надлежниот експерт.
Слоеви на емпирискиот работен тек и местото на ВИ
Корисно е да се подели емпириската студија на три слоја. Слојот за извршување е секојдневната техничка работа: код за чистење податоци, цртање графикони, форматирање табели, дебагирање на синтаксата. Слојот на методот е аналитичка одлука: кој модел, која стратегија за идентификација, кој тест, која проверка на претпоставки. Слојот за толкување и одлучување е значењето на наодите: што вели коефициентот, дали е каузален, што значи за политиката, дали треба да се објави. ВИ ги допира сите три слоја, но со различен авторитет во секој. На слојот за извршување, вештачката интелигенција брзо подготвува и генерира код; На слојот за толкување и одлучување се дава само влез и експертот ја донесува одлуката.
Ајде да дефинираме неколку основни поими од почеток. Економетријата е гранка која ги анализира економските и социјалните податоци со статистички методи и ги мери односите. Регресијата е метод кој нумерички ја моделира врската на променливата на исходот (зависна променлива) со една или повеќе објаснувачки променливи (независни променливи). Коефициентот е бројот што покажува со колку единици на промена во просек е поврзана промената од една единица во објаснувачка променлива во променливата на исходот. P-вредноста е веројатноста дека набљудуваниот исход (или поекстремен исход) ќе се случи случајно кога всушност нема ефект. Овие концепти ќе ги објасниме еден по еден во следните целини; Засега, знајте го ова: во сите овие, вештачката интелигенција ви дава план, код и објаснување, но не носи научни одлуки.
Следната табела ја сумира улогата и нивото на ризик на ВИ по мисија:
Потрага
Улогата на вештачката интелигенција
Ниво на ризик
Кој одобрува
Пишување код за санација на податоци
генератор на код
низок
Самиот аналитичар (со тестирање на код)
Нацрт графикон/табела
генератор на скици
низок
аналитичар
Потсетник за синтакса за тестирање/модел
Референтен асистент
ниско-средно
аналитичар
Нацрт толкување коефициент
нацрт-писател
средно
економетричар
Избор на модел/идентификациона стратегија
помошен влез
високо
стручен истражувач
Причинско барање
Само нацрт, никогаш последниот збор
многу високо
Експерт + рецензија
Објавување/политичка одлука
само внесување
многу високо
Одговорен истражител/институција
Имајте ја на ум едната линија во оваа табела: како што се зголемува ризикот, улогата на вештачката интелигенција се намалува и одобрувањето од експерти расте.
Зошто „верификацијата“ е срцето на овој бизнис
Јазичните модели изгледаат сигурни во својот одговор, но можеби не се сигурни. На технички јазик, тоа се нарекува халуцинација: тоа е измислување на непостоечки информации од моделот во течна реченица, исто како да е вистина. За економетричар ова е смртоносна замка. Моделот може да ви даде точна бројка како што е „Корелацијата помеѓу невработеноста и инфлацијата во Турција помеѓу 2015-2020 година е 0,62“; Сепак, тој никогаш не ги видел вашите податоци и оваа бројка е целосно измислена. Или може да каже: „Белиот тест p-вредност беше 0,03“; додека не изврши никакви тестови. Може да повика функција R со аргумент кој всушност не постои. Сите три ги пее со иста флуентност; Единственото нешто што го одвојува доброто од погрешното е вашето знаење и вашата навика за проверка.
Дисциплината за верификација се состои од три чекори:
- Пресметајте / стартувајте во вашата сопствена околина: пресметајте го секој број, однос, резултат од тестот и коефициент дадени од AI во R/Python со вашите сопствени податоци, а не од меморијата на AI. Користете ја вештачката интелигенција за да го напишете кодот, а не да се сеќавате на резултатот. Стартувај го кодот, го произведуваш излезот.
- Врска до изворот: Потпрете се на учебници, статии за методи и официјални документи за правила, формули и дефиниции за методи. Потврдете ја изјавата на вештачката интелигенција „претпоставката за овој тест е“ со сигурен извор.
- Статистички филтер: Тестирајте со стручни очи дали излезот е во спротивност со статистичката логика (претпоставки, примерок, големина на ефектот, несигурност). Отфрлете „смислен, но апсурден“ резултат.
Внимание: Ставањето коефициент, тест или толкување генериран со вештачка интелигенција во статија, теза или белешка за политика без да се потврди, е како објавување непрегледан наод. Само затоа што излезот е течен не е точно; Само затоа што бројката изгледа сигурна, таа не е реална.
Приватност: микро податоците и лиценцираните податоци се приватно заштитени
Микроподатоците (единечни записи на ниво на поединец, домаќинство, фирма или пациент) често се користат во економетријата. Повеќето од овие податоци се лични податоци и се заштитени според KVKK (Закон за заштита на лични податоци) во Турција и GDPR во Европа. Дополнително, ТуркСтат, централните банки, давателите на панел податоци и комерцијалните извори честопати обезбедуваат податоци со договор за користење податоци; Овие договори забрануваат пренос на податоци на трети страни. Вметнувањето табела што содржи информации за идентитетот, приходите, здравјето или тајните на компанијата во јавна алатка за разговор со вештачка интелигенција е и прекршување на KVKK/GDPR и прекршување на договорот; бидејќи податоците одат на надворешен сервер и може да се користат при обука на модели во некои алатки.
Правилото е едноставно: чувајте ги податоците во сопствената безбедна средина, побарајте од вештачката интелигенција само код и методи. Идеалниот работен тек е следниов: прашајте ја ВИ за кодот за анализа, го извршувате кодот со вистинските податоци на вашиот сопствен компјутер/претпријатие сервер. Ако навистина морате да споделувате податоци, анонимизирајте (отстранете ги полињата за ID), агрегирајте (просечно/броено наместо индивидуално) и изберете алатки кои се институционални, имаат договор за обработка на податоци и не ги користат вашите податоци во образованието.
три мини футроли
Случај 1 — Безбедна и ефикасна употреба. Еден истражувач најпрво потрошил 6 часа рачно исчистувајќи 40.000 редови податоци за буџетот на домаќинството. Без да ги сподели податоците воопшто, тој само ги опиша имињата на променливите и структурата на вештачката интелигенција и побара код за чистење. AI генерира скрипта R; Истражувачот го изврши кодот во сопственото опкружување, го провери бројот на линии и сумарната статистика на секој чекор и поправи две логички грешки. Времетраење: 70 минути наместо 6 часа. Податоците никогаш не излегоа; Одговорноста остана кај истражувачот.
Случај 2 - Замка за непроверени броеви. „Која е еластичноста помеѓу растот на БДП и странските директни инвестиции“, праша АИ на дипломиран студент. Вештачката интелигенција самоуверено даде бројка од „околу 0,34“ иако немаше пристап до никакви податоци. Ученикот го напиша ова во резимето за литература; Кога неговиот советник прашал за изворот, се испоставило дека бројката нема основа и е целосно измислена. Грешка: Очекување конкретни статистички податоци од вештачката интелигенција без давање податоци и ресурси за неа.
Случај 3 - Доверливост и прекршување на договорот. Еден аналитичар го поставил Excel, кој го добил од лиценциран панел на компанијата, со името на компанијата и прометот, на јавно достапна алатка за вештачка интелигенција и рекол „направи регресија на панелот“. Договорот на давателот на податоци забранува пренос на податоци на системи на трети страни; Инцидентот поттикна преглед на усогласеноста. Вистинскиот начин беше да се заменат имињата на компаниите со анонимни кодови или да не се споделуваат никакви податоци и само да се побара кодот за регресија на панелот и да се изврши во сопствената околина.
Слаб промпт / Силен промпт
Слаба навестување:
Анализирајте го односот помеѓу инфлацијата и невработеноста и наведете го коефициентот.
Ова тврдење е погрешно: Нема податоци за вештачката интелигенција, не е јасно која земја, кој период, кој модел. ВИ може да одговори само со измислен коефициент.
Моќен потсетник:
Вашата улога: вие сте асистент за анализа што му помага на истражувачот по економетријата. ЈАС НЕ ги споделувам податоците со вас; Сакам само RUNNABLE R код. Имам годишен панел: променливи земја, година, невработеност, инфлација (сите нумерички). Задача: 1) напишете регресивен код на панелот со фиксни ефекти за невработеност ~ инфлација (plm пакет), 2) објаснете го секој чекор во кодот со линија за коментари, 3) забележете дека коефициентот треба да се толкува како релациски, а не како КАУЗАЛЕН, 4) составете го аргументот на функцијата за кој не сте сигурни; Ќе трчам и ќе го проверам резултатот во моето опкружување.
Во ова барање не се споделуваат податоци, јасни се улогата, пакетите, очекувањата за коментари и забраната за „измислување“. Сè уште трчате и сами го потврдувате излезот.
Следната табела ги сумира правилата со една реченица во оваа лекција:
принцип
Што значи тоа
АИ е асистент
Научната одлука и одговорност му припаѓа на експертот
Побарајте го кодот, произведете го резултатот
ВИ не се сеќава на бројот; го пушташ и пресметуваш
чувај податоци
Микро/лиценцираните податоци не ја напуштаат безбедната средина
потврди
Се проверува секое прашање, код, коментар; измислицата се отфрла
Вообичаени грешки
- Очекуваме конкретни статистички податоци од вештачката интелигенција без да даваме податоци. Моделот не може да пристапи до податоците; Коефициентот, корелацијата и p-вредноста што ги дава се лажни. Секогаш барајте ја шифрата и сами произведувајте го резултатот.
- Потпирајќи се на халуцинаторните функции. AI може да предложи R/Python функција или аргумент што не постои. Не прифаќајте го кодот без да го извршите и да го потврдите.
- Поставување микроподатоци на јавна алатка. Тоа е прекршување на KVKK/GDPR и договорот за користење податоци. Анонимизирајте ги податоците или воопшто не ги споделувајте.
- Погрешно флуентност со точност. Добро напишаниот преглед може да биде неточен. Убавината на реченицата не е доказ.
- Прифаќање на причински јазик без контрола. YZ често вели „X го зголемува Y“; додека повеќето регресии покажуваат само врски. Одбрани го каузалното тврдење со дизајн.
Совет: Кога работите со вештачка интелигенција, поставете си го ова прашање: „Ако судијата или ревизорот го побара овој резултат, дали можам да ги покажам изворот и сметката?“ Ако одговорот е не, излезот сè уште не е подготвен за употреба.
Сумирано
Вештачката интелигенција обезбедува вистинско и масивно забрзување во слојот за извршување (код, чистење, графикон, нацрт) на работниот тек на економетријата и статистиката; сепак, изборот на модел, каузалноста, толкувањето, објавувањето и одлуките за политиките му припаѓаат на експертот. Три основни дисциплини: не потсетувајте ја вештачката интелигенција на бројот, побарајте ја шифрата и сами генерирајте и проверете го резултатот; не отстранувајте микро/лиценцирани податоци од безбедно опкружување; статистички филтрира секој излез. Непроверениот излез на вештачката интелигенција е подеднакво ризичен како и непроверениот наод.
Задача за апликација
Размислете за вашиот сопствен (или пример) сет на податоци. Прашајте ја вештачката интелигенција за R или Python код кој произведува описна статистика и едноставен график со едноставно опишување на структурата на променливата, без споделување на податоците. Извршете го дојдовниот код во вашата сопствена околина. Потоа чувајте листа за проверка: (1) дали кодот работи без грешки, (2) е бројот на линии/набљудувања како што очекувавте, (3) која од речениците за коментари на вештачката интелигенција користи причински јазик и треба да се поправи. Во еден пасус, напишете за времето кога ве спасила вештачката интелигенција и барем една грешка што сте ја фатиле.
листа за проверка
- [ ] Не ја натерав вештачката интелигенција да бара конкретни статистики; Го побарав кодот и сам го произведов резултатот.
- [ ] Повторно го пресметав секој број и резултат од тестот што ги даде во мојата сопствена околина.
- [ ] Потврдив дека функциите/аргументите што ги користи всушност постојат.
- [ ] Не поставив микро/лични/лиценцирани податоци на јавна алатка.
- [ ] Ги означив коментарите што содржат причински јазик и ги префрлив на релациски јазик.
- [ ] Можам да му го покажам изворот и сметководството на излезот на ревизор.