سود:
- امکان بررسی توزیع، مرکز، گسترش و ناهنجاری های متغیرها با نمودارهای مناسب (هیستوگرام، نمودار جعبه، نمودار پراکندگی).
- توانایی تفسیر صحیح همبستگی و خواندن آن همراه با نمودار پراکندگی، بدون اشتباه گرفتن آن با علیت
- توانایی درک اینکه آمار خلاصه می تواند گمراه کننده باشد (درس Anscombe) و ایجاد فرضیه هایی که جهت مدل سازی را تعیین می کند.
قبل از ساخت یک مدل، شناخت داده ها ضروری است. همانطور که یک پزشک بدون معاینه بیمار دارو تجویز نمی کند، دانشمند داده مدلی را بدون "بررسی" داده ها نمی سازد. این بررسی را تجزیه و تحلیل داده های اکتشافی (به اختصار EDA) می نامند: مرحله کشف توزیع، روابط، شگفتی ها و تله های داده ها به صورت بصری و گرافیکی است. هدف EDA ایجاد فرضیه ها، گرفتن خطاها و تعیین جهت مدل سازی است. هوش مصنوعی در این مرحله دستیار بسیار قدرتمندی است: نشان می دهد که کدام نمودار مناسب است، کد آن را می نویسد، یک توزیع را تفسیر می کند. اما یک فرد با دانش میدانی خود تصمیم می گیرد که آیا الگویی که می بیند واقعی است یا تصادفی.
EDA به دنبال چه چیزی است؟
EDA به دنبال پاسخ به چهار سوال است. توزیع: هر متغیر چگونه توزیع می شود - آیا متقارن، اریب یا دو قله است؟ گرایش و گسترش مرکزی: میانگین، میانه، انحراف معیار چیست؟ روابط: متغیرها چگونه با یکدیگر مرتبط هستند؟ ناهنجاری ها: آیا مقادیر، شکاف ها، گروه بندی های غیرمنتظره ای وجود دارد؟ این چهار سوال تعیین می کند که کدام ویژگی کار می کند و کدام مدل مناسب است.
بیایید چند مفهوم اساسی را تعریف کنیم. هیستوگرام نموداری است که مقادیر یک متغیر عددی را به فواصل تقسیم می کند و نشان می دهد که در هر بازه چند مشاهدات وجود دارد. این سریعترین راه برای مشاهده توزیع است. چولگی تغییر توزیع در یک جهت است. متغیرهایی مانند درآمد به سمت راست متمایل می شوند (اکثریت کم، تعداد کمی بسیار زیاد). نمودار جعبه ای میانه، چارک ها و نقاط پرت را در یک نگاه نشان می دهد. نمودار پراکندگی رابطه دو متغیر عددی را با ابری از نقاط نشان می دهد.
همبستگی: رابطه وجود دارد اما مراقب باشید
همبستگی - اندازه گیری نحوه حرکت دو متغیر با هم. عددی بین -1 و +1 - پرکاربردترین و اشتباهترین ابزار EDA است. +1 به معنای افزایش همزمان کامل، -1 به معنای رابطه معکوس کامل، 0 به معنای عدم وجود رابطه خطی است. دو تله بزرگ وجود دارد. اول، قاعده معروف: همبستگی علیت نیست. موارد خفگی با فروش بستنی افزایش می یابد. نه به این دلیل که یکی به دیگری منتهی می شود، بلکه به این دلیل که تابستان (متغیر سوم پنهان) هر دو را تحریک می کند. Second, correlation only measures linear relationship; ممکن است نشان دهنده یک رابطه قوی اما منحنی نزدیک به 0 باشد. بنابراین هنگام مشاهده همبستگی، حتما به نمودار پراکندگی نیز توجه کنید.
احتیاط: وقتی هوش مصنوعی یک عدد همبستگی می دهد، ممکن است به زبان علی مانند "A، B را افزایش می دهد." این خطرناک است. همبستگی فقط حرکت با هم را نشان می دهد. تنها تجربه، دانش حوزه و استنتاج دقیق دلیل را مشخص می کند.
کوارتت Anscombe: چرا فقط به عدد نگاه نکنید
مثال معروفی در آمار وجود دارد: کوارتت Anscombe. چهار مجموعه داده مختلف تقریباً میانگین یکسان، واریانس یکسان و همبستگی یکسان دارند (0.82). اما وقتی نمودار می شوند، کاملاً متفاوت به نظر می رسند - یک خط مستقیم، یکی منحنی، یکی ابری که توسط یک نقطه پرت کشیده شده است. درس واضح است: آمار خلاصه گمراه کننده است، نگاه کردن به نمودار ضروری است. هوش مصنوعی میتواند میانگینها و همبستگیها را به شما بدهد، اما اعتماد به این اعداد بدون دیدن نمودار، در دام آنسکوم افتادن است.
جدول زیر به طور خلاصه نشان می دهد که کدام نمودار متناسب با کدام سوال است:
سوال
گرافیک مناسب
آنچه نشان می دهد
توزیع یک متغیر
هیستوگرام / KDE
شکل، چولگی، تعداد رئوس
مرکز و نقاط پرت
طرح جعبه
میانه، چارک ها، نقاط پرت
رابطه دو عدد
نمودار پراکندگی
جهت، قدرت، انحنا
مقایسه رده ها
نمودار میله ای
تفاوت بین گروه ها
در طول زمان تغییر کند
نمودار خطی
روند، فصلی
رابطه چند متغیره
نقشه حرارتی همبستگی
ماتریس روابط عمومی
پارادوکس سیمپسون: داده های انباشته می تواند دروغ باشد
یک تله یواشکی در EDA که باید از آن آگاه بود، پارادوکس سیمپسون است: زمانی که همه داده ها با هم بررسی می شوند، یک الگو ممکن است یک جهت را نشان دهد، اما زمانی که داده ها به زیر گروه های معنی دار تقسیم شوند، معکوس شود. مثال کلاسیک: به نظر می رسد که نرخ پذیرش کلی برای متقاضیان زن در یک دانشگاه کمتر از مردان باشد. اما وقتی به دپارتمان به دپارتمان نگاه میکنیم، میزان پذیرش زنان در بیشتر بخشها بیشتر از مردان است. از کجا؟ زنان برای دپارتمان های رقابتی تر (نرخ پذیرش پایین تر) درخواست دادند. عدد ترکیبی این متغیر پنهان را ذخیره می کند. درس واضح است: وقتی به یک کل یا میانگین نگاه می کنید، مطمئن شوید که بررسی کنید که آیا آن عدد در صورت تقسیم به زیرگروه های معنی دار (بخش، دوره، کانال) همان داستان را بیان می کند. وقتی هوش مصنوعی یک نرخ ترکیبی به شما میدهد، پرسیدن «آیا وقتی آن را تقسیمبندی میکنید هنوز معتبر است؟» در اوایل بیشترین نتایج گمراهکننده را دریافت میکند.
سه کیف کوچک
مورد 1 - دو تپه پنهان. یک تحلیلگر میانگین سنی مشتری را 41 سال دریافت کرد و آن را به عنوان "جمعیت میانسال" گزارش کرد. اما هیستوگرام دو پیک را نشان داد: گروه سنی 22-28 و 55-62. میانگین 41 در واقع نماینده کسی نبود. درس: قبل از اعتماد به میانگین، توزیع را رسم کنید.
مورد 2 - همبستگی کاذب. یک تیم همبستگی 0.78 بین «خرج آگهی» و «فروش» پیدا کرد و بودجه را دو برابر کرد. با این حال، آنچه باعث هر دو شد، کمپین های فصلی بود. در طول دوره خارج از کمپین، این رابطه به 0.10 کاهش یافت. 340 هزار لیر تبلیغات اضافی بازده مورد انتظار را به همراه نداشت. درس: اشتباه گرفتن همبستگی برای علیت گران است.
مورد 3 - خط ترسیم شده توسط مخالف تنها. تجزیه و تحلیل املاک و مستغلات رابطه قوی بین متراژ مربع و قیمت را نشان داد (r=0.80). وقتی طرح پراکندگی ترسیم شد، تقریباً کل رابطه توسط یک ویلای مجلل 12 میلیون لیره ایجاد شد. وقتی این نقطه حذف شد، همبستگی به 0.31 کاهش یافت. درس: همیشه همبستگی را همراه با نمودار پراکندگی بخوانید.
چهار قالب قابل کپی
1) خلاصه خودکار EDA:
من پاندا df دارم. کدی را بنویسید که تولید کند: (1) df.info() و df.describe()، (2) هیستوگرام برای هر ستون عددی، (3) تعداد برای هر ستون طبقه بندی شده. نظر ندهید، فقط کد کشف را ایجاد کنید. من الگوها را تفسیر می کنم.
2) همبستگی + بصری (با اخطار علیت):
کدی بنویسید که یک ماتریس همبستگی و یک نقشه حرارتی برای ستون های عددی ترسیم کند. همچنین یک نمودار پراکندگی از 3 جفت بالاترین همبستگی را رسم کنید. یک خط نظر به خروجی اضافه کنید تا به شما یادآوری کند که همبستگی به معنای علیت نیست. ادعای علت و معلولی نکنید.
3) تشخیص توزیع:
برای ستون "income_tl": کدی بنویسید که هیستوگرام، نمودار کادر، مقدار چولگی و مقایسه میانگین/میانگین را تولید می کند. من تعبیر می کنم که آیا توزیع کج است یا خیر. فقط کد رو بدید
4) مقایسه بخش ها:
مشتریان را بر اساس «کانال» (وب/موبایل) مقایسه کنید: کدی بنویسید که نموداری از میانگین مقدار، مقدار متوسط، تعداد سفارشها و توزیع مقدار را برای هر کانال ایجاد میکند. پیشنهاد کنید کدام آزمون برای معناداری آماری تفاوت بین دو کانال مناسب است، اما تصمیم با من است.
اعلان ضعیف / اعلان قوی
اعلان ضعیف:
چیز جالبی را در این داده ها پیدا کنید.
"جالب" تعریف نشده است. هوش مصنوعی دادهها را نمیبیند، بنابراین یا آنها را میسازد یا اظهارات کلی میکند. هیچ جهت، هیچ متغیر، هیچ هدفی وجود ندارد.
اعلان قدرتمند:
نقش شما: دستیار EDA. ستونهای df: سن (int)، درآمد_tl (شناور)، شهر (رده)، کانال (وب/موبایل)، مقدار (شناور). هدف: کشف عوامل مؤثر بر «مقدار». وظیفه: (1) کد رسم توزیع مقدار، (2) نمودارهای توزیع بین مقدار و سن و درآمد_tl، (3) نمودار جعبه مقدار در تفکیک کانال. اقامه دعوی سببی؛ فقط کد کشف را ایجاد کنید و من الگو را تفسیر می کنم.
در اینجا هدف، متغیرها و حد «ادعای علیت» مشخص است.
اشتباهات رایج
- تنها با تکیه بر آمار خلاصه. همانطور که کوارتت Anscombe نشان می دهد، همان میانگین توزیع های بسیار متفاوتی را پنهان می کند. نمودار را ببینید
- اشتباه همبستگی برای علیت کنش مشترک نشان نمی دهد که یکی به دیگری منتهی می شود. مراقب متغیرهای پنهان باشید.
- نگاهی به همبستگی بدون طرح پراکندگی. یک نقطه پرت یا منحنی، عدد را گمراه می کند.
- خلاصه کردن یک توزیع دو قله / اریب با میانگین. میانگین ممکن است نشان دهنده کسی نباشد.
- از EDA صرف نظر کرده و مستقیماً به مدل می رویم. داده های ناشناخته به معنای مدل کور است.
نکته: با هر مجموعه داده جدید، 30 دقیقه اول را صرف ترسیم نمودارها کنید: هیستوگرام هر عدد، نمودار پراکندگی جفت های قابل توجه، نمودار میله ای دسته ها. این 30 دقیقه از خطاهای مدل سازی آینده برای روزهای آینده جلوگیری می کند.
به طور خلاصه
EDA مرحله شناخت داده ها قبل از ساختن یک مدل است و به دنبال پاسخ به چهار سؤال است: توزیع، گسترش مرکز، روابط و ناهنجاری ها. آمار خلاصه می تواند گمراه کننده باشد. نگاه کردن به نمودار ضروری است (سخنرانی Anscombe). همبستگی ابزار قدرتمندی است، اما علیت نیست و قطعاً باید همراه با نمودار پراکنده خوانده شود. هوش مصنوعی یک شتاب دهنده عالی برای پیشنهاد گرافیک و نوشتن کد است. اما مردم با دانش میدانی خود تفسیر می کنند که آیا الگویی که می بینند واقعی است یا تصادفی.
وظیفه کاربردی
یک مجموعه داده را انتخاب کنید و فقط EDA را انجام دهید: یک هیستوگرام از حداقل سه متغیر عددی، یک نمودار پراکندگی از دو جفت متغیر و یک نقشه حرارتی همبستگی استخراج کنید. حداقل یک «سورپرایز» (مانند توزیعی با دو قله، کاندیدای همبستگی کاذب، رابطه ای که توسط یک نقطه پرت جذب می شود) پیدا کنید و آن را در یک جمله توضیح دهید. بدون هیچ ادعای علت و معلولی بنویسید.
چک لیست
- [ ] آیا من نمودار توزیع هر متغیر عددی را ترسیم کرده ام؟
- [ ] آیا من به همبستگی ها با نمودار پراکندگی نگاه کردم؟
- [ ] آیا علیت و همبستگی را جدا نگه داشته ام؟
- [ ] آیا من متوجه توزیع های اریب یا دو قله نشدم و کورکورانه به میانگین اعتماد نکردم؟
- [ ] آیا حداقل یک جنبه/فرضیه مدلسازی را از یافته های EDA خود استخراج کرده ام؟