سود:
- امکان تولید آمار توصیفی و نمودارهای توزیع/رابطه با پشتیبانی هوش مصنوعی و انتخاب نوع نمودار مناسب با توجه به داده ها و سوال
- توانایی تشخیص انتخاب های گمراه کننده (محور خط تیره، مقیاس نامناسب، هموارسازی بیش از حد) در تصاویر تولید شده توسط هوش مصنوعی و اعمال اصول تجسم صادقانه
- توانایی تشخیص این که تحلیل اکتشافی برای ایجاد فرضیه و دام کشف و تأیید با همان داده ها است (که در را برای هک p باز می کند).
پس از پاکسازی داده ها، اولین کار محقق تجربی، شناخت آن است. به این مرحله آنالیز داده های اکتشافی (EDA - Exploratory Data Analysis) می گویند: فرآیند بررسی داده ها با نمودارها و آمار خلاصه و مشاهده ساختار، الگوها و شگفتی های آن است. هدف هنوز آزمودن یک فرضیه نیست، بلکه آشنایی با دادهها، ایجاد سؤال و بسترسازی برای مدلی است که در آینده خواهید ساخت. در این بخش، خواهیم دید که هوش مصنوعی (AI) چگونه EDA و تجسم را تسریع میکند، اما اینکه چرا گرافیکهایی که تولید میکند باید به دقت بررسی شوند.
اجازه دهید ابتدا دو تمایز اساسی قائل شویم. اول، آمار توصیفی (اعدادی که دادههایی مانند میانگین، میانه، انحراف معیار، چارکها را خلاصه میکنند) و تجسم (نمایش اطلاعات یکسان به صورت گرافیکی) مکمل یکدیگر هستند. آنها با هم داده ها را توصیف می کنند. دوم، و مهم ترین: کشف و تایید باید از هم متمایز شوند. تحلیل اکتشافی برای ایجاد فرضیه است. بررسی فرضیه با همان داده ها و گفتن «آن را آزمایش کردم و آن را مهم یافتم» راه را برای هک p باز می کند که در قسمت بعدی خواهیم دید. نگاه کردن به داده ها و دیدن یک الگو رایگان است. اما اعلام این الگو به عنوان یک "یافته اثبات شده" در همان داده ها گمراه کننده است.
تحلیل اکتشافی گام به گام
1. نمای تک متغیره. هر متغیر را جداگانه بررسی کنید: آیا توزیع آن متقارن است یا اریب. چند تپه وجود دارد نقاط پرت کجا هستند؟ برای متغیرهای عددی، هیستوگرام (نمودار که فرکانس را با تقسیم مقادیر به محدوده نشان می دهد) و باکس پلات (باکس پلات - نموداری که مقادیر میانه، چارک و شدید را نشان می دهد). برای متغیرهای طبقه بندی شده، از جداول فراوانی و نمودارهای میله ای استفاده کنید.
2. نمای دو متغیره. رابطه بین دو متغیر را ببینید: نمودار پراکنده برای دو متغیر عددی (هر مشاهده را به عنوان یک نقطه در صفحه x-y نشان میدهد)، نمودار کادر گروهبندی شده برای عددی-مقوله، جدول متقاطع برای دو دستهبندی. قبل از اینکه به ضریب همبستگی نگاه کنید، حتما به نمودار پراکندگی نگاه کنید: همبستگی یکسان می تواند الگوهای بسیار متفاوتی را نشان دهد (کوارتت معروف Anscombe این را نشان می دهد؛ چهار مجموعه داده آمار تقریباً یکسانی دارند، اما وقتی رسم می شوند کاملاً متفاوت هستند).
3. نوع نمودار درست را انتخاب کنید. نوع نمودار بستگی به سوال و نوع داده شما دارد. هیستوگرام برای توزیع؛ پراکندگی برای رابطه؛ نمودار خطی برای تغییر در طول زمان. نمودار میله ای برای مقایسه دسته بندی؛ (با دقت) نوار انباشته شده برای نسبت قطعات به کل. هوش مصنوعی به سرعت برای شما کد تولید می کند، اما تصمیم «کدام نمودار برای کدام سؤال» با شماست.
4. به الگو توجه کنید، نتایج را اعلام نکنید. هر الگوی جالبی را که می بینید به عنوان "یادداشت کشف" ثبت کنید، اما آن را یک یافته تایید شده تلقی نکنید. تایید در یک مرحله جداگانه، ترجیحا با داده های جداگانه یا یک برنامه از پیش تعیین شده انجام می شود.
اصول تجسم صادقانه
گرافیک متقاعد می کند؛ بنابراین قدرت گمراهی آن نیز بالاست. هوش مصنوعی می تواند انتخاب های زیبایی شناختی اما گاهی گمراه کننده داشته باشد. این سیاست ها را بررسی کنید:
- در نمودارهای میله ای، محور y باید از صفر شروع شود. محور نقطه چین تفاوت های کوچک را به اندازه بزرگ نشان می دهد.
- مقیاس باید سازگار باشد. اگر دو نمودار با هم مقایسه می شوند، از یک محدوده محوری استفاده کنید.
- صاف کردن بیش از حد می تواند الگوی واقعی را پنهان کند. یک خط روند خوب به نظر می رسد، اما اگر داده ها را بیش از حد "صاف" کند، می تواند گمراه کننده باشد.
- رنگ و دکوراسیون سه بعدی توجه را مخدوش می کند، نه داده ها را. سادگی را انتخاب کنید
- داده های از دست رفته و اندازه نمونه باید قابل مشاهده باشد. "n=12" و "n=12000" نباید یکسان به نظر برسند.
توجه: فقط به دلیل زیبا بودن گرافیک های تولید شده توسط هوش مصنوعی، درست نیست. رایج ترین اشتباهی که او مرتکب می شود این است که محور را از صفر در نمودار میله ای شروع نمی کند و تفاوت بین دو گروه را اغراق می کند. همیشه محور را بررسی کنید.
نمودار مقایسه: سوال → نمودار
بپرسید
نمودار صحیح
اشتباه رایج
این متغیر چگونه توزیع می شود؟
نمودار هیستوگرام/جعبه
از نمودار دایره ای استفاده کنید
آیا دو متغیر عددی به هم مرتبط هستند؟
طرح پراکنده
فقط به تعداد همبستگی ها نگاه می کنیم
چگونه در طول زمان تغییر کرده است؟
نمودار خطی
بیان روند با نمودار میله ای
تفاوت بین گروه ها چیست؟
جعبه/نوار گروه بندی شده (از ابتدا)
میله محور کوتاه
نسبت جزء به کل؟
نوار انباشته (با احتیاط)
نمودار دایره ای چند تکه
چهار فرمان قابل کپی
1. کد کشف خودکار:
نقش شما: دستیار EDA. من داده ها را به اشتراک نمی گذارم، من کد R (ggplot2) را می خواهم. متغیرهای عددی (درآمد، سن، هزینه) و طبقه بندی (منطقه، تحصیلات) در data.frame 'داده' وجود دارد. وظیفه: کدی بنویسید که یک هیستوگرام برای هر عدد، یک نمودار میله ای برای هر دسته و یک نمودار پراکندگی برای درآمد ~ سن تولید کند. در نمودارهای میله ای، اجازه دهید محور y از صفر شروع شود. افزودن خط نظر
2. بررسی همبستگی (همبستگی + بصری با هم):
کدی بنویسید که هم همبستگی پیرسون را برای درآمد و هزینه محاسبه کند و هم نمودار پراکندگی + روند خطی را ترسیم کند. یک خط نظر اضافه کنید تا به من یادآوری کند که نمودار را قبل از اعتماد به تعداد همبستگی بررسی کنم (هشدار Anscombe). خط روند را بیش از حد صاف نکنید.
3. حسابرسی درستکاری:
کد ggplot زیر را برای تجسم صادقانه بررسی کنید:[code]. موارد زیر را بررسی و تصحیح کنید: آیا محور y از صفر شروع می شود، آیا مقیاس سازگار است، آیا اندازه نمونه قابل مشاهده است، آیا هموارسازی بیش از حد وجود دارد؟ توجیه هر اصلاحی که انجام دادید را توضیح دهید.
4. تهیه یادداشت کشف (نه یک یافته):
بر اساس نمودارهایی که تولید می کنم، OBSERVATIONS را به عنوان "یادداشت کشف" فهرست کنید. هر مورد را به زبان «فرضیهای که باید آزمایش شود»، نه «یافتههای قطعی» بنویسید. مثال: «درآمد در آموزش عالی گسترده تر به نظر می رسد. باید با داده های جداگانه آزمایش شود. از اظهارات علّی و قطعی خودداری کنید.
اعلان ضعیف / اعلان قوی
اعلان ضعیف:
نمودارهای خوبی از بازده تهیه کنید و به من بگویید معنی آنها چیست.
این درخواست خروجی گمراه کننده را دعوت می کند: «زیبا» بر زیبایی شناسی تمرکز می کند، در حالی که «معنی آن» هوش مصنوعی را به جهش از کشف به نتیجه قطعی سوق می دهد. نظرات علّی و اغراق آمیز دنبال می شود.
اعلان قدرتمند:
نقش شما: دستیار صادق EDA. وظیفه: (1) نوع نموداری را انتخاب کنید که مناسب سؤال من باشد و توجیه آن را بنویسید، (2) محور را از صفر در نمودارهای میله ای شروع کنید، (3) خروجی را به زبان DISCOVERY NOTE تفسیر کنید: هیچ ادعای قطعی/علّی فرضیه ای را در زبان "باید آزمایش کرد" پیشنهاد نمی کند، (4) به من هشدار می دهد که محیط من کوچک است (نمونه را در محیط من اجرا می کنم<0). آن را
تفاوت: اراده قوی نوع نمودار را توجیه می کند، قوانین صداقت را تحمیل می کند و کشف را با تایید اشتباه نمی گیرد.
سه کیف کوچک
مورد 1 - اغراق محور گسسته. یک تحلیلگر نمرات رضایت دو شاخه (7.8 و 8.0؛ از 10) را در نمودار میله ای نشان داد. هنگام شروع محور YZ از 7.5، شاخه دوم تقریباً دو برابر اولی بلندتر ظاهر شد. در حالی که این تفاوت تنها 2.5٪ بود. مدیریت قصد داشت به شعبه ای که تصور اشتباهی داشت پاداش دهد. وقتی محور را از ابتدا شروع کردم، تفاوت تقریباً نامرئی بود. درس: انتخاب محور به تنهایی ادراک را تغییر می دهد.
مورد 2 - اعتماد به همبستگی و پرش از نمودار. یک محقق بین دو متغیر r = 0.81 را دید و "رابطه خطی قوی" نوشت. وقتی مشاور او طرح پراکندگی را درخواست کرد، مشاهده شد که این رابطه در واقع ناشی از یک مشاهده شدید است و وقتی آن نقطه حذف شد، همبستگی به 0.12 کاهش یافت. درس: شمارش همبستگی جایگزین نمودار نیست. همیشه به پراکندگی نگاه کنید
مورد 3 - کشف اشتباه با تأیید. یک دانش آموز تمام همبستگی های زوجی را در یک مجموعه داده 40 متغیری بررسی کرد، بالاترین (r=0.52) را انتخاب کرد و نوشت: "ما رابطه معنی داری بین تحصیلات و پس انداز پیدا کردیم (p=0.004). با این حال، صدها جفت در 40 متغیر وجود دارد. انتخاب بالاترین یک یافته نادرست به دلیل شانس بود. درس: الگوی کشف شده را نمی توان در همان داده ها "آزمایش کرد و معنی دار" اعلام کرد. تایید جداگانه لازم است.
اشتباهات رایج
- در نمودار میله ای محور را از صفر شروع نکنید. این تفاوت کوچک را اغراق می کند. رایج ترین دروغ بصری همیشه بررسی کنید.
- نگاه کردن به همبستگی و پرش از نمودار. همبستگی یکسان از الگوهای بسیار متفاوت ناشی می شود. می تواند با یک رابطه پرت تناسب داشته باشد. اول، پراکندگی.
- در نظر گرفتن الگوی یافت شده در کشف به عنوان "شواهد" در همان داده ها. این دروازه هک p است. تایید به صورت جداگانه انجام می شود.
- نوع نمودار اشتباه است. مسابقاتی مانند نوار برای روند و پای برای توزیع گمراه کننده هستند. یک ژانر را بر اساس سوال انتخاب کنید.
- مخفی کردن حجم نمونه n=8 و n=8000 نباید در یک نمودار یکسان به نظر برسند. عدم قطعیت باید نشان داده شود.
نکته: قبل از انتشار نمودار، از خود بپرسید: "آیا اگر محور را تغییر دهم، داستان تغییر می کند؟" اگر پاسخ مثبت است، احتمالاً شما pivot را از یک مکان غیر صادقانه شروع کرده اید.
به طور خلاصه
تجزیه و تحلیل داده های اکتشافی مرحله ملاقات با داده ها، مشاهده الگوها و ایجاد فرضیه است. تایید نیست. هوش مصنوعی به سرعت آمار توصیفی و کد نمودار تولید می کند، اما شما نوع نمودار را بر اساس سوال خود انتخاب می کنید و اصول انصاف را کنترل می کنید (محور صفر، مقیاس سازگار، عدم قطعیت ظاهری). قبل از اعتماد به عدد همبستگی به پراکندگی نگاه کنید. الگویی را که در کشف پیدا کردید به عنوان "شواهد" در همان داده ها اعلام نکنید. یک نمودار زیبا از هوش مصنوعی به معنای یک نمودار صحیح نیست.
وظیفه کاربردی
حداقل سه متغیر را در یک مجموعه داده انتخاب کنید. از هوش مصنوعی بخواهید و کدی را اجرا کنید که نمودارهای اکتشافی (هیستوگرام، پراکنده، جعبهدار) را با اعلانی که قوانین صداقت را اجرا میکند تولید میکند. برای هر نمودار: (1) تناسب نوع نمودار با سؤال، (2) صداقت محور، (3) قابل مشاهده بودن حجم نمونه را بررسی کنید. حداقل یک "یادداشت کشف" به زبان فرضیه بنویسید ("...به نظر می رسد جداگانه آزمایش شود"). همبستگی را با تعداد و پراکندگی بررسی کنید و در صورت وجود اختلاف بین آنها گزارش دهید.
چک لیست
- [ ] من نوع نمودار را بر اساس سوال و نوع داده خود انتخاب کردم.
- [ ] در نمودارهای میله ای، محور y را از صفر شروع می کنم. صداقت محور را بررسی کردم.
- [ ] من قبل از اعتماد به همبستگی به نمودار پراکنده نگاه کردم.
- [ ] من حجم نمونه و عدم قطعیت را روی نمودار منعکس کردم.
- [ ] من الگوهایی را که در کاوش یافتم به عنوان «فرضیه ای که باید آزمایش شود» به جای «شواهد» نوشتم.
- [ ] اشاره کردم که از همان داده ها برای تأیید استفاده نمی کنم و یک مرحله جداگانه لازم است.