Birlik 1 / 11

Ekonometrika va statistikada sun'iy intellekt: rollar, chegaralar, autentifikatsiya va maxfiylik

Daromadlar:

  • Empirik ish jarayonining qayerda (ma'lumotlarni tozalash, kod, vizualizatsiya, qoralama talqini) sun'iy intellekt real vaqtni tejashini va model tanlash, sabab-oqibat da'vosi va nashr qarori kabi qarorlar topshiriqning xavf darajasiga ko'ra mutaxassisga qoldirilishini ajrata olish.
  • Har bir sun'iy intellekt natijasini (raqam, koeffitsient, kod, sharh) qayta hisoblash, manbaga bog'lash va statistik filtrlash bosqichlari orqali tekshiradigan intizomni qo'llash qobiliyati.
  • KVKK/GDPR va ma'lumotlardan foydalanish shartnomalari doirasida mikro ma'lumotlar va maxfiy/litsenziyalangan ma'lumotlar to'plamlarini xavfsiz qayta ishlash va tegishli vositalarni tanlash odatiga ega bo'lish.

Ekonometr yoki amaliy statistik stolda bir xil savollar har kuni takrorlanadi: Bu ma'lumotlar to'plami ishonchlimi? Ushbu etishmayotgan qiymatlar bilan nima qilish kerak? Ushbu regressiya koeffitsienti aslida nimani anglatadi? Bu munosabat sababmi yoki shunchaki korrelyatsiyami? Ushbu p-qiymati muhim bo'lganligi sababli, uni maqolada yoki siyosat bayonida yozishim mumkinmi? Ushbu savollarning ba'zilari takroriy, kodni talab qiladi va ko'p vaqt talab qiladi: ma'lumotlarni tozalash, bir xil grafikni o'n marta chizish, R yoki Python kodini tuzatish, natijalarni jadvalga kiritish. Boshqalar esa topilmaning to'g'riligini, nashrning halolligini yoki siyosat qarorining to'g'riligini bevosita belgilaydi.

Sun'iy intellekt (qisqasi, AI - odamlar kabi matn va kod ishlab chiqaradigan, naqshlarni taniydigan, ma'lumotlarni umumlashtiradigan va sharhlar yozadigan kompyuter tizimlari; bugungi kunda eng ko'p foydalaniladigan shakl katta til modellari, ya'ni ulkan matn ustida o'qitilgan va keyingi so'zni bashorat qilish orqali jumlalar tuzadigan tizimlar) ushbu jadvalning o'rtasida joylashgan. To'g'ri ishlatilsa, u ma'lumotlarni tozalash kodining soatlarini daqiqalarga qisqartiradi, murakkab statistik testning sintaksisini eslatadi yoki koeffitsientning talqinini tuzadi. Noto'g'ri qo'llanilganda, u "topilma" sifatida ko'rinadigan ishonchli, ammo butunlay uydirma son, noto'g'ri ahamiyatga ega yoki sababsiz munosabatni taqdim etadi.

Bu birinchi birlik dasturiy ta'minot bilan tanishish emas. Uning maqsadi AIni empirik ish jarayoniga qaerga qo'yish kerakligini va uni hech qachon qaerga qo'ymaslik kerakligini aniqlashdir. Ekonometrika ham "usul-tanqidiy", ham bilvosita "qaror qabul qilish uchun muhim" sohadir: siz yaratgan modelning koeffitsienti markaziy bankning foiz stavkasi bo'yicha qaroriga, regulyatorning siyosatini o'zgartirishga yoki firmaning million dollarlik sarmoyasiga kirish bo'lishi mumkin. Keling, asosiy tamoyilni boshidan aytib o'tamiz: Sun'iy intellekt tadqiqotchi emas, balki tahlil yordamchisi. Modelni tanlash, identifikatsiya qilish strategiyasi, sababiy bog'liqlikni tasdiqlash, nashr etish va siyosiy qarorlar uchun javobgarlik va yakuniy tasdiqlash vakolatli ekspert zimmasiga tushadi.

Empirik ish oqimining qatlamlari va AIning o'rni

Empirik tadqiqotni uch qatlamga bo'lish foydalidir. Bajarish qatlami kundalik texnik ishdir: ma'lumotlarni tozalash kodi, grafik chizish, jadvalni formatlash, sintaksisni tuzatish. Usul qatlami analitik qaror: qaysi model, qaysi identifikatsiya strategiyasi, qaysi test, qaysi taxminni tekshirish. Sharh va qaror qatlami topilmalarning ma'nosidir: koeffitsient nima deydi, u sababmi, siyosat uchun nimani anglatadi, nashr etilishi kerak. AI barcha uchta qatlamga tegadi, lekin har birida turli vakolatlarga ega. Ijro etuvchi qatlamda AI tezda kod tuzadi va yaratadi; Sharhlash va qaror qabul qilish darajasida faqat ma'lumotlar beriladi va ekspert qaror qabul qiladi.

Keling, boshidan bir nechta asosiy atamalarni aniqlaymiz. Ekonometrika - bu iqtisodiy va ijtimoiy ma'lumotlarni statistik usullar bilan tahlil qiladigan va munosabatlarni o'lchaydigan soha. Regressiya - natija o'zgaruvchisining (bog'liq o'zgaruvchining) bir yoki bir nechta tushuntirish o'zgaruvchilari (mustaqil o'zgaruvchilar) bilan munosabatlarini raqamli modellash usuli. Koeffitsient - bu tushuntiruvchi o'zgaruvchining bir birlik o'zgarishi natija o'zgaruvchisida o'rtacha necha o'zgarish birligi bilan bog'liqligini ko'rsatadigan raqam. P-qiymati - kuzatilgan natijaning (yoki undan ko'p ekstremal natijaning) hech qanday ta'sir mavjud bo'lmaganda tasodifan paydo bo'lish ehtimoli. Bu tushunchalarni quyidagi birliklarda birma-bir tushuntiramiz; Hozircha shuni biling: bularning barchasida AI sizga loyihani, kodni va tushuntirishni beradi, lekin u ilmiy qarorlar qabul qilmaydi.

Quyidagi jadval missiya bo'yicha AIning roli va xavf darajasini umumlashtiradi:

Kvest

AIning roli

Xavf darajasi

Kim tasdiqlaydi

Ma'lumotlarni tozalash kodini yozish

kod generatori

past

Tahlilchining o'zi (kod testi bilan)

Grafik/jadval loyihasi

eskiz generatori

past

tahlilchi

Sintaksis/model sintaksisi eslatmasi

Malumot yordamchisi

past-o'rta

tahlilchi

Koeffitsient loyihasini talqin qilish

qoralama yozuvchi

o'rta

iqtisodchi

Model/identifikatsiya strategiyasini tanlash

yordamchi kirish

yuqori

mutaxassis tadqiqotchi

Sabab da'vosi

Faqat qoralama, hech qachon yakuniy so'z emas

juda yuqori

Mutaxassis + tengdoshlarni ko'rib chiqish

Nashr/siyosat qarori

faqat kiritish

juda yuqori

Mas'ul tergovchi/muassasa

Ushbu jadvaldagi bitta qatorni yodda tuting: xavf ortishi bilan AI roli qisqaradi va mutaxassislarning roziligi oshadi.

Nima uchun "tekshirish" bu biznesning yuragi

Til modellari o'z javoblarida ishonchli ko'rinadi, lekin ular ishonchsiz bo'lishi mumkin. Texnik tilda bu gallyutsinatsiya deb ataladi: bu modelning mavjud bo'lmagan ma'lumotni ravon jumlada to'qib chiqarishi, xuddi haqiqat kabi. Ekonometr uchun bu halokatli tuzoq. Model sizga "2015-2020 yillar oralig'ida Turkiyada ishsizlik va inflyatsiya o'rtasidagi korrelyatsiya 0,62" kabi aniq raqamni berishi mumkin; Biroq, u sizning ma'lumotlaringizni hech qachon ko'rmagan va bu raqam to'liq tuzilgan. Yoki "Oq test p-qiymati 0,03 edi" deb aytishi mumkin; Holbuki u hech qanday sinovlarni o'tkazmagan. U R funktsiyasini aslida mavjud bo'lmagan argument bilan chaqirishi mumkin. Uchalasini ham bir xil ravon kuylaydi; To'g'rini noto'g'ridan ajratib turadigan yagona narsa - bu sizning bilimingiz va tekshirish odatingizdir.

Tekshirish intizomi uch bosqichdan iborat:

  1. O'zingizning muhitingizda qayta hisoblang / ishga tushiring: R/Python-da AI tomonidan berilgan har bir raqam, nisbat, test natijasi va koeffitsientni AI xotirasidan emas, o'z ma'lumotlaringiz bilan hisoblang. Natijani eslab qolish uchun emas, balki kodni yozish uchun AIdan foydalaning. Kodni ishga tushiring, siz chiqishni ishlab chiqarasiz.
  2. Manbaga havola: Usul qoidalari, formulalari va ta'riflari uchun darsliklar, metodik maqolalar va rasmiy hujjatlarga tayaning. Ishonchli manba bilan sun'iy intellektning "bu testning taxmini" degan gapini tasdiqlang.
  3. Statistik filtr: Natija statistik mantiqqa zid keladimi yoki yo'qligini ekspert ko'zlari bilan sinab ko'ring (taxminlar, namuna, ta'sir hajmi, noaniqlik). "Ma'noli, ammo bema'ni" natijani rad eting.
Diqqat: AI tomonidan yaratilgan koeffitsient, test yoki sharhni maqola, tezis yoki siyosat eslatmasiga uni tasdiqlamasdan qo'yish ko'rib chiqilmagan topilmani nashr qilish bilan barobar. Chiqish ravon bo'lganligi sababli, bu haqiqat emas; Raqam aniq bo'lgani uchun u haqiqiy emas.

Maxfiylik: mikro ma'lumotlar va litsenziyalangan ma'lumotlar shaxsiy himoyalangan

Mikroma'lumotlar (individual, uy xo'jaligi, firma yoki bemor darajasidagi yagona yozuvlar) tez-tez ekonometriyada qo'llaniladi. Ushbu ma'lumotlarning aksariyati shaxsiy ma'lumotlar bo'lib, Turkiyada KVKK (Shaxsiy ma'lumotlarni himoya qilish qonuni) va Evropada GDPR bilan himoyalangan. Bundan tashqari, TurkStat, markaziy banklar, panel ma'lumotlar provayderlari va tijorat manbalari ko'pincha ma'lumotlardan foydalanish shartnomasi bilan ma'lumotlarni taqdim etadilar; Ushbu shartnomalar ma'lumotlarni uchinchi shaxslarga o'tkazishni taqiqlaydi. Shaxs ma’lumotlari, daromadlari, sog‘lig‘i yoki kompaniya sirlarini o‘z ichiga olgan jadvalni AI chat vositasiga joylashtirish ham KVKK/GDPR, ham shartnoma buzilishi hisoblanadi; chunki ma'lumotlar tashqi serverga ketadi va ba'zi vositalarda modelni o'qitishda foydalanish mumkin.

Qoida oddiy: ma'lumotlarni o'zining xavfsiz muhitida saqlang, AIdan faqat kod va usullarni so'rang. Ideal ish jarayoni quyidagicha: AIdan tahlil kodini so'rang, siz o'zingizning kompyuteringiz/korxona serveringizdagi haqiqiy ma'lumotlar bilan kodni ishga tushirasiz. Agar haqiqatan ham maʼlumotlarni almashish kerak boʻlsa, anonimlashtiring (identifikator maydonlarini olib tashlang), jamlang (individual emas, oʻrtacha/hisoblash) va institutsional vositalarni tanlang, maʼlumotlarni qayta ishlash boʻyicha kelishuvga ega boʻling va maʼlumotlaringizdan taʼlimda foydalanmang.

uchta mini holat

1-holat - Xavfsiz va samarali foydalanish. Bir tadqiqotchi dastlab 40 000 qator uy xo'jaliklari byudjeti ma'lumotlarini qo'lda tozalash uchun 6 soat vaqt sarfladi. Ma'lumotni umuman baham ko'rmay, u shunchaki o'zgaruvchilar nomlari va tuzilishini AIga tasvirlab berdi va tozalash kodini so'radi. AI R skriptini yaratdi; Tadqiqotchi kodni o'z muhitida ishlatdi, satrlar sonini va har bir qadamning umumiy statistikasini tekshirdi va ikkita mantiqiy xatoni tuzatdi. Davomiyligi: 6 soat o'rniga 70 daqiqa. Ma'lumotlar hech qachon tashqariga chiqmaydi; Mas'uliyat tadqiqotchida qoldi.

2-holat - tasdiqlanmagan raqamlar tuzog'i. "YaIM o'sishi va to'g'ridan-to'g'ri xorijiy investitsiyalar o'rtasidagi elastiklik nima", deb so'radi aspirantlardan biri AIdan. AI hech qanday ma'lumotga kirish imkoniga ega bo'lmasa ham, ishonchli tarzda "taxminan 0,34" sonini berdi. Talaba buni adabiyot xulosasida yozgan; Maslahatchisi manba haqida so‘raganida, bu raqamning asosi yo‘qligi va butunlay uydirma ekanligi ma’lum bo‘ldi. Xato: AIdan ma'lumot va resurslarni bermasdan aniq statistikani kutish.

3-holat - Maxfiylik va shartnomani buzish. Tahlilchi kompaniya nomi va aylanmasini o'z ichiga olgan litsenziyaga ega kompaniya panelidan olgan Excelni hammaga ochiq sun'iy intellekt vositasiga yukladi va "panel regressiyasini amalga oshiring" dedi. Ma'lumotlar provayderining shartnomasida ma'lumotlarni uchinchi tomon tizimlariga o'tkazish taqiqlangan; Ushbu hodisa muvofiqlikni tekshirishga sabab bo'ldi. To'g'ri yo'l kompaniya nomlarini anonim kodlar bilan almashtirish yoki hech qanday ma'lumot almashish va faqat panel regressiya kodini so'rash va uni o'z muhitida ishga tushirish edi.

Zaif taklif / Kuchli taklif

Zaif taklif:

Inflyatsiya va ishsizlik o'rtasidagi bog'liqlikni tahlil qiling va koeffitsientni ayting.

Bu da'vo noto'g'ri: AIga hech qanday ma'lumot berilmagan, qaysi mamlakat, qaysi davr, qaysi model aniq emas. AI faqat tuzilgan koeffitsient bilan javob berishi mumkin.

Kuchli so'rov:

Sizning rolingiz: siz ekonometrika tadqiqotchisiga yordam beruvchi tahlil yordamchisisiz. MEN siz bilan ma'lumotni baham ko'rmayman; Men faqat RUNNABLE R kodini xohlayman. Menda yillik panel bor: o'zgaruvchilar mamlakat, yil, ishsizlik, inflyatsiya (barcha raqamli). Vazifa: 1) ishsizlik ~ inflyatsiya (plm to'plami) uchun belgilangan effektlar paneli regressiya kodini yozing, 2) koddagi har bir qadamni izoh qatori bilan tushuntiring, 3) koeffitsientni CAUSAL emas, munosabat sifatida talqin qilish kerakligini unutmang, 4) siz ishonchingiz komil bo'lmagan funktsiya argumentini tuzing; Men o'z muhitimda ishlayman va natijani tekshiraman.

Ushbu so'rovda hech qanday ma'lumot bo'linmaydi, roli, paketlari, sharhlarni kutish va "to'qimachilik" ning taqiqlanishi aniq. Siz hali ham ishga tushasiz va chiqishni o'zingiz tekshirasiz.

Quyidagi jadvalda ushbu darsdagi bir jumla qoidalari jamlangan:

tamoyil

Bu nimani anglatadi

AI - bu yordamchi

Ilmiy qaror va mas'uliyat mutaxassisga tegishli

Kodni so'rang, natijani chiqaring

AI raqamni eslamaydi; Siz uni boshqarasiz va hisoblaysiz

ma'lumotlarni saqlash

Mikro/litsenziyalangan ma'lumotlar xavfsiz muhitni tark etmaydi

tekshirish

Har bir masala, kod, sharh tekshiriladi; uydirma rad etiladi

Umumiy xatolar

  • Ma'lumot bermasdan AIdan aniq statistikani kutish. Model ma'lumotlarga kira olmaydi; U beradigan koeffitsient, korrelyatsiya va p-qiymati soxta. Har doim kodni so'rang va natijani o'zingiz ishlab chiqaring.
  • Gallyutsinatsion funktsiyalarga tayanish. AI R/Python funktsiyasi yoki mavjud bo'lmagan argumentni taklif qilishi mumkin. Kodni ishga tushirmasdan va tekshirmasdan qabul qilmang.
  • Mikroma'lumotlar umumiy vositaga yuklanmoqda. Bu KVKK/GDPR va maʼlumotlardan foydalanish shartnomasini buzish hisoblanadi. Ma'lumotlarni anonimlashtiring yoki ularni umuman baham ko'rmang.
  • Ravonlikni aniqlik bilan adashtirish. Yaxshi yozilgan sharh noto'g'ri bo'lishi mumkin. Gapning go'zalligi dalil emas.
  • Kauzal tilni nazoratsiz qabul qilish. YZ ko'pincha "X Y ni oshiradi" deb aytadi; holbuki, aksariyat regressiyalar faqat munosabatlarni ko'rsatadi. Dizayn bilan sababiy da'voni himoya qiling.
Maslahat: AI bilan ishlayotganda o'zingizga quyidagi savolni bering: "Agar hakam yoki auditor ushbu natijani so'rasa, manba va hisobni ko'rsata olamanmi?" Agar javob yo'q bo'lsa, chiqish hali foydalanishga tayyor emas.

qisqa bayoni; yakunida

AI ekonometrika va statistika ish oqimining bajarilish qatlamida (kod, tozalash, grafik, qoralama) haqiqiy va massiv tezlashuvni ta'minlaydi; ammo, model tanlash, nedensellik, izohlash, nashr va siyosat qarorlari ekspertga tegishli. Uchta asosiy fan: AIga raqamni eslatmang, kodni so'rang va natijani o'zingiz yarating va tekshiring; mikro/litsenziyalangan ma'lumotlarni xavfsiz muhitdan olib tashlamang; Har bir chiqish uchun statistik filtr. Tasdiqlanmagan AI chiqishi ko'rib chiqilmagan topilma kabi xavflidir.

Ilova vazifasi

O'zingizning (yoki misol) ma'lumotlar to'plamini ko'rib chiqing. AIdan R yoki Python kodini so'rang, bu ma'lumotlarni almashmasdan, o'zgaruvchan tuzilmani oddiygina tavsiflash orqali tavsiflovchi statistika va oddiy grafik ishlab chiqaradi. O'zingizning muhitingizda kiruvchi kodni ishga tushiring. Keyin nazorat roʻyxatini tuzing: (1) kod xatosiz ishladimi, (2) siz kutganingizdek satrlar/kuzatishlar soni, (3) AIning sharh jumlalaridan qaysi biri sabab tilidan foydalanadi va tuzatilishi kerak. Bir xatboshida AI sizni qutqargan vaqt va kamida bitta xato haqida yozing.

nazorat ro'yxati

  • [ ] Men sun'iy intellektni aniq statistikani so'rashga majburlamadim; Men kodni so'radim va natijani o'zim ishlab chiqardim.
  • [ ] Men o'z muhitimda bergan har bir raqam va test natijasini qayta hisoblab chiqdim.
  • [ ] U foydalanadigan funksiyalar/argumentlar haqiqatda mavjudligini tasdiqladim.
  • [ ] Men umumiy vositaga mikro/shaxsiy/litsenziyalangan maʼlumotlarni yuklamadim.
  • [ ] Men sabab tilini oʻz ichiga olgan izohlarni belgilab qoʻydim va ularni munosabat tiliga oʻtkazdim.
  • [ ] Men auditorga mahsulotning manbasini va hisobini ko'rsata olaman.