سود:
- توانایی تشخیص اینکه در جریان کار تجربی (پاکسازی داده ها، کد، تجسم، تفسیر پیش نویس) هوش مصنوعی در زمان واقعی صرفه جویی می کند و تصمیماتی مانند انتخاب مدل، ادعای علیت و تصمیم انتشار با توجه به سطح ریسک کار به متخصص واگذار می شود.
- امکان اعمال رشته ای که هر خروجی هوش مصنوعی (عدد، ضریب، کد، نظر) را از طریق مراحل محاسبه مجدد، لینک دادن به منبع و فیلتر آماری تایید می کند.
- توانایی پردازش ایمن داده های خرد و مجموعه داده های محرمانه/مجوز در محدوده قراردادهای KVKK/GDPR و استفاده از داده و کسب عادت انتخاب ابزارهای مناسب.
سوالات یکسانی هر روز بر روی میز یک اقتصاددان یا آماردان کاربردی تکرار می شود: آیا این مجموعه داده قابل اعتماد است؟ با این مقادیر از دست رفته چه باید کرد؟ واقعاً ضریب این رگرسیون چه می گوید؟ آیا این رابطه علّی است یا صرفاً همبستگی؟ چون این مقدار p قابل توجه است، آیا می توانم آن را در مقاله یا خلاصه سیاست بنویسم؟ برخی از این سوالات تکراری، فشرده و زمان بر هستند: پاک کردن داده ها، ده بار رسم نمودار یکسان، اشکال زدایی کد R یا Python، رشته کردن نتایج در یک جدول. برخی دیگر مستقیماً اعتبار یک یافته، صداقت یک نشریه یا صحت یک تصمیم سیاستی را تعیین می کنند.
هوش مصنوعی (به طور خلاصه، هوش مصنوعی - سیستمهای کامپیوتری که میتوانند متن و کد را مانند انسان تولید کنند، الگوها را تشخیص دهند، دادهها را خلاصه کنند و نظرات بنویسند؛ رایجترین شکلی که امروزه استفاده میشود، مدلهای زبان بزرگ هستند، یعنی سیستمهایی که روی متنهای عظیم آموزش داده میشوند و با پیشبینی کلمه بعدی جملاتی را میسازند) درست در وسط این جدول قرار دارد. هنگامی که به درستی استفاده می شود، ساعت ها کد پاکسازی داده ها را به دقیقه کاهش می دهد، نحو یک آزمون آماری پیچیده را به شما یادآوری می کند، یا تفسیر یک ضریب را پیش نویس می کند. در صورت استفاده نادرست، عددی به ظاهر مطمئن اما کاملاً ساختگی، معناداری کاذب یا یک رابطه غیر علت و معلولی را به عنوان "یافته" ارائه می دهد.
این واحد اول یک معرفی نرم افزار نیست. هدف آن این است که مشخص کند هوش مصنوعی را کجا در گردش کار تجربی خود قرار دهید و هرگز آن را در کجا قرار ندهید. اقتصاد سنجی هم یک زمینه «روش بحرانی» و هم به طور غیرمستقیم «تصمیم گیری بحرانی» است: ضریب مدلی که میسازید میتواند ورودی تصمیم بانک مرکزی برای نرخ بهره، تغییر سیاست تنظیمکننده یا سرمایهگذاری میلیون دلاری یک شرکت باشد. بیایید اصل اساسی را از ابتدا بیان کنیم: هوش مصنوعی یک دستیار تجزیه و تحلیل است، نه یک محقق. مسئولیت و تایید نهایی انتخاب مدل، استراتژی شناسایی، اثبات علیت، انتشار و تصمیمات خط مشی بر عهده کارشناس ذیصلاح است.
لایه های گردش کار تجربی و مکان هوش مصنوعی
تقسیم یک مطالعه تجربی به سه لایه مفید است. لایه اجرا کار فنی روزانه است: کد پاکسازی داده ها، ترسیم نمودار، قالب بندی جدول، اشکال زدایی نحو. لایه روش تصمیم تحلیلی است: کدام مدل، کدام استراتژی شناسایی، کدام آزمون، کدام بررسی فرضی. لایه تفسیر و تصمیم معنای یافتهها است: ضریب چه میگوید، آیا علت آن است، چه معنایی برای سیاست دارد، باید منتشر شود. هوش مصنوعی هر سه لایه را لمس می کند، اما با قدرت متفاوت در هر یک. در لایه اجرا، هوش مصنوعی به سرعت کد را پیش نویس و تولید می کند. در لایه تفسیر و تصمیم، فقط ورودی داده می شود و کارشناس تصمیم می گیرد.
بیایید از ابتدا چند اصطلاح اساسی را تعریف کنیم. اقتصاد سنجی شاخه ای است که داده های اقتصادی و اجتماعی را با روش های آماری تجزیه و تحلیل می کند و روابط را اندازه گیری می کند. رگرسیون روشی است که به صورت عددی رابطه یک متغیر نتیجه (متغیر وابسته) را با یک یا چند متغیر توضیحی (متغیرهای مستقل) مدل می کند. ضریب عددی است که نشان می دهد یک تغییر یک واحدی در متغیر توضیحی به طور متوسط با چند واحد تغییر در متغیر نتیجه مرتبط است. مقدار p احتمال این است که نتیجه مشاهده شده (یا یک نتیجه شدیدتر) به طور تصادفی اتفاق بیفتد، زمانی که هیچ اثری واقعاً وجود نداشته باشد. این مفاهیم را یکی یکی در واحدهای زیر توضیح خواهیم داد. در حال حاضر، این را بدانید: در همه این موارد، هوش مصنوعی طرح، کد و توضیح را به شما می دهد، اما تصمیمات علمی نمی گیرد.
جدول زیر نقش و سطح خطر هوش مصنوعی را بر اساس ماموریت خلاصه می کند:
تلاش
نقش هوش مصنوعی
سطح ریسک
کی تایید میکنه
نوشتن کد پاکسازی داده ها
مولد کد
پایین
خود تحلیلگر (با تست کد)
پیش نویس نمودار/جدول
مولد طرح
پایین
تحلیلگر
یادآوری نحو تست/مدل
دستیار مرجع
کم متوسط
تحلیلگر
پیش نویس تفسیر ضریب
نویسنده پیش نویس
متوسط
اقتصاد دان
انتخاب استراتژی مدل/شناسایی
ورودی کمکی
بالا
محقق خبره
ادعای علیت
فقط یک پیش نویس، هرگز کلمه پایانی
بسیار بالا
کارشناس + بررسی همتا
انتشار/تصمیم سیاست
فقط ورودی
بسیار بالا
بازپرس/موسسه مسئول
یک خط در این جدول را به خاطر داشته باشید: با افزایش ریسک، نقش هوش مصنوعی کاهش مییابد و تایید کارشناسان نیز افزایش مییابد.
چرا "تأیید" قلب این تجارت است
به نظر می رسد مدل های زبان در پاسخ خود مطمئن هستند، اما ممکن است مطمئن نباشند. در زبان فنی، این توهم نامیده میشود: این ساخت مدل از اطلاعات غیر موجود در یک جمله روان است، درست مثل اینکه درست باشد. برای یک اقتصاددان، این یک تله مرگبار است. این مدل می تواند عدد دقیقی مانند "همبستگی بین بیکاری و تورم در ترکیه بین سال های 2015-2020 0.62" را به شما بدهد. با این حال، او هرگز داده های شما را ندیده است و این عدد کاملا ساخته شده است. یا ممکن است بگوید: "P-value تست سفید 0.03 بود". در حالی که هیچ آزمایشی انجام نداد. می تواند یک تابع R را با آرگومانی که در واقع وجود ندارد فراخوانی کند. او هر سه را با یک روان می خواند. تنها چیزی که حق را از باطل جدا می کند دانش و عادت شما به راستی آزمایی است.
رشته تأیید شامل سه مرحله است:
- محاسبه مجدد / اجرا در محیط خود: هر عدد، نسبت، نتیجه آزمایش و ضریب داده شده توسط هوش مصنوعی در R/Python را با داده های خود، نه از حافظه هوش مصنوعی، محاسبه کنید. از هوش مصنوعی برای نوشتن کد استفاده کنید نه اینکه نتیجه را به خاطر بسپارید. کد را اجرا کنید، خروجی را تولید می کنید.
- پیوند به منبع: برای قوانین روش، فرمول ها و تعاریف به کتاب های درسی، مقالات روش ها و اسناد رسمی تکیه کنید. بیانیه هوش مصنوعی "فرض این تست است" را با یک منبع موثق تأیید کنید.
- فیلتر آماری: با چشمان متخصص آزمایش کنید که آیا خروجی با منطق آماری (فرض، نمونه، اندازه اثر، عدم قطعیت) در تضاد است یا خیر. نتیجه "معنی اما پوچ" را رد کنید.
احتیاط: قرار دادن یک ضریب، آزمون یا تفسیر ایجاد شده توسط هوش مصنوعی در مقاله، پایان نامه یا یادداشت خط مشی بدون تأیید اعتبار، مانند انتشار یافته ای است که بررسی نشده است. فقط به این دلیل که خروجی روان است درست نیست. فقط به این دلیل که عدد قطعی به نظر می رسد، واقعی نیست.
حریم خصوصی: داده های خرد و داده های دارای مجوز به صورت خصوصی محافظت می شوند
میکروداده (سوابق واحد در سطح فرد، خانواده، شرکت یا بیمار) اغلب در اقتصاد سنجی استفاده می شود. بیشتر این داده ها داده های شخصی هستند و تحت KVKK (قانون حفاظت از داده های شخصی) در ترکیه و GDPR در اروپا محافظت می شوند. علاوه بر این، ترک استات، بانکهای مرکزی، ارائهدهندگان دادههای تابلویی و منابع تجاری اغلب دادهها را با قرارداد استفاده از داده ارائه میکنند. این قراردادها انتقال داده ها به اشخاص ثالث را ممنوع می کند. چسباندن جدولی حاوی اطلاعات هویتی، درآمد، سلامت یا اسرار شرکت در ابزار چت عمومی هوش مصنوعی هم نقض KVKK/GDPR است و هم نقض قرارداد. زیرا داده ها به سرور خارجی می رود و می توان از آنها در آموزش مدل در برخی ابزارها استفاده کرد.
قانون ساده است: داده ها را در محیط امن خود نگه دارید، از هوش مصنوعی فقط کد و روش بخواهید. گردش کار ایده آل این است: از هوش مصنوعی کد تجزیه و تحلیل را بخواهید، شما کد را با داده های واقعی روی رایانه/سرور سازمانی خود اجرا می کنید. اگر واقعاً باید داده ها را به اشتراک بگذارید، ناشناس کنید (حذف فیلدهای شناسه)، جمع آوری کنید (متوسط/تعداد به جای فردی)، و ابزارهایی را انتخاب کنید که نهادی هستند، توافقنامه پردازش داده دارند و از داده های شما در آموزش استفاده نمی کنند.
سه کیف کوچک
مورد 1 - استفاده ایمن و کارآمد. یک محقق ابتدا 6 ساعت را صرف پاکسازی دستی 40000 ردیف داده بودجه خانوار کرد. بدون به اشتراک گذاشتن داده ها، او فقط نام و ساختار متغیرها را برای هوش مصنوعی توصیف کرد و درخواست یک کد پاکسازی کرد. هوش مصنوعی یک اسکریپت R ایجاد کرد. محقق کد را در محیط خود اجرا کرد، تعداد خطوط و آمار خلاصه هر مرحله را بررسی کرد و دو خطای منطقی را برطرف کرد. مدت زمان: 70 دقیقه به جای 6 ساعت. داده ها هرگز از بین نرفتند. مسئولیت بر عهده محقق بود.
مورد 2 - تله اعداد تایید نشده. یک دانشجوی فارغ التحصیل از هوش مصنوعی پرسید: "کشش بین رشد تولید ناخالص داخلی و سرمایه گذاری مستقیم خارجی چقدر است." هوش مصنوعی با اطمینان تعدادی "حدود 0.34" را داد، حتی اگر به هیچ داده ای دسترسی نداشت. دانش آموز این را در خلاصه ادبیات نوشت. وقتی مشاورش در مورد منبع سوال کرد، معلوم شد که این شماره هیچ مبنایی ندارد و کاملا ساختگی است. اشتباه: انتظار آمار مشخص از هوش مصنوعی بدون ارائه داده ها و منابع به آن.
مورد 3 - محرمانه بودن و نقض قرارداد. یک تحلیلگر اکسل را که از پنل شرکت دارای مجوز دریافت کرده بود، حاوی نام شرکت و گردش مالی، در ابزار هوش مصنوعی در دسترس عموم آپلود کرد و گفت: "regression پانل را انجام دهید". قرارداد ارائهدهنده داده، انتقال دادهها به سیستمهای شخص ثالث را ممنوع میکند. این حادثه باعث بررسی انطباق شد. راه درست این بود که نام شرکت ها را با کدهای ناشناس جایگزین کنیم یا هیچ داده ای را به اشتراک نگذاریم و فقط کد رگرسیون پنل را درخواست کنیم و در محیط خودش اجرا کنیم.
اعلان ضعیف / اعلان قوی
اعلان ضعیف:
رابطه بین تورم و بیکاری را تجزیه و تحلیل کنید و ضریب را بیان کنید.
این ادعا اشتباه است: هیچ داده ای به هوش مصنوعی داده نشده است، مشخص نیست کدام کشور، کدام دوره، کدام مدل. هوش مصنوعی فقط با یک ضریب ساخته شده پاسخ می دهد.
اعلان قدرتمند:
نقش شما: شما یک دستیار تحلیل هستید که به محقق اقتصاد سنجی کمک می کند. من داده ها را با شما به اشتراک نمی گذارم. من فقط کد RUNNABLE R را می خواهم. پانل سالانه دارم: متغیرهای کشور، سال، بیکاری، تورم (همه عددی). وظیفه: 1) یک کد رگرسیون پانل اثرات ثابت برای بیکاری ~ تورم (بسته plm) بنویسید، 2) هر مرحله از کد را با یک خط نظر توضیح دهید، 3) توجه داشته باشید که ضریب باید به عنوان رابطه ای تفسیر شود، نه علّی، 4) آرگومان تابعی را ایجاد کنید که در مورد آن مطمئن نیستید. من اجرا می کنم و نتیجه را در محیط خودم تأیید می کنم.
در این درخواست، هیچ داده ای به اشتراک گذاشته نشده است، نقش، بسته ها، انتظار نظرات و ممنوعیت «ساخت» مشخص است. شما هنوز هم اجرا می کنید و خودتان خروجی را تأیید می کنید.
جدول زیر قوانین تک جمله ای این درس را خلاصه می کند:
اصل
به چه معناست
هوش مصنوعی یک دستیار است
تصمیم و مسئولیت علمی بر عهده متخصص است
کد را درخواست کنید، نتیجه را تولید کنید
هوش مصنوعی شماره را به خاطر نمی آورد. شما آن را اجرا کنید و محاسبه کنید
داده ها را نگه دارید
داده های میکرو/مجوز از محیط امن خارج نمی شوند
تایید کنید
هر موضوع، کد، نظر بررسی می شود. ساختگی رد می شود
اشتباهات رایج
- انتظار آمار مشخص از هوش مصنوعی بدون ارائه داده. مدل نمی تواند به داده ها دسترسی داشته باشد. ضریب، همبستگی و p-value که می دهد جعلی هستند. همیشه کد را درخواست کنید و نتیجه را خودتان تولید کنید.
- تکیه بر عملکردهای توهم. هوش مصنوعی ممکن است یک تابع یا آرگومان R/Python را پیشنهاد کند که وجود ندارد. کد را بدون اجرا و تایید آن قبول نکنید.
- آپلود ریزداده در ابزار عمومی این نقض KVKK/GDPR و قرارداد استفاده از داده است. داده ها را ناشناس کنید یا اصلا به اشتراک نگذارید.
- اشتباه گرفتن تسلط با دقت یک بررسی خوب نوشته شده ممکن است نادرست باشد. زیبایی جمله دلیل نیست.
- پذیرش زبان علی بدون کنترل YZ اغلب می گوید "X Y را افزایش می دهد". در حالی که اکثر رگرسیون ها فقط روابط را نشان می دهند. از ادعای علی با طراحی دفاع کنید.
نکته: هنگام کار با هوش مصنوعی، این سوال را از خود بپرسید: "اگر داور یا حسابرس این خروجی را بخواهد، آیا می توانم منبع و حساب کاربری را نشان دهم؟" اگر پاسخ منفی است، خروجی هنوز برای استفاده آماده نیست.
به طور خلاصه
هوش مصنوعی شتاب واقعی و عظیمی را در لایه اجرا (کد، پاکسازی، نمودار، پیش نویس) گردش کار اقتصاد سنجی و آمار فراهم می کند. با این حال، انتخاب مدل، علیت، تفسیر، انتشار و تصمیمات خط مشی متعلق به متخصص است. سه اصل اساسی: شماره را به هوش مصنوعی یادآوری نکنید، کد را بخواهید و خودتان نتیجه را تولید و تأیید کنید. داده های میکرو/مجوز را از محیط امن حذف نکنید. فیلتر آماری هر خروجی یک خروجی AI تایید نشده به اندازه یک یافته بررسی نشده خطرناک است.
وظیفه کاربردی
مجموعه داده های خود (یا نمونه ای) را در نظر بگیرید. کد R یا Python را از هوش مصنوعی بخواهید که آمار توصیفی و یک نمودار ساده را با توصیف ساختار متغیر، بدون به اشتراک گذاری داده، تولید کند. کد ورودی را در محیط خود اجرا کنید. سپس یک چک لیست داشته باشید: (1) آیا کد بدون خطا اجرا شد، (2) تعداد خطوط/مشاهدات همانطور که انتظار داشتید، (3) کدام یک از جملات نظر هوش مصنوعی از زبان علّی استفاده می کند و باید اصلاح شود. در یک پاراگراف، در مورد زمانی که هوش مصنوعی شما را نجات داد و حداقل یک باگ که گرفتار شد، بنویسید.
چک لیست
- [ ] من هوش مصنوعی را وادار به درخواست آمار دقیق نکردم. من کد را درخواست کردم و نتیجه را خودم تهیه کردم.
- [ ] من هر عدد و نتیجه آزمایشی را که در محیط خودم داد دوباره محاسبه کردم.
- [ ] من تأیید کردم که توابع/آگومان هایی که استفاده می کند واقعا وجود دارند.
- [ ] من داده های میکرو/شخصی/مجوز را در یک ابزار عمومی آپلود نکردم.
- [ ] نظرات حاوی زبان علی را علامت گذاری کردم و آنها را به زبان رابطه ای منتقل کردم.
- [ ] من می توانم منبع و حسابداری خروجی را به حسابرس نشان دهم.