وحدة 3 / 11

تحليل البيانات الاستكشافية وتصورها: الرسوم البيانية والتفسير باستخدام الذكاء الاصطناعي

المكاسب:

  • القدرة على إنتاج إحصائيات وصفية ومخططات التوزيع/العلاقة بدعم من الذكاء الاصطناعي واختيار نوع المخطط المناسب وفقًا للبيانات والسؤال
  • القدرة على التعرف على الاختيارات المضللة (المحور المتقطع، المقياس غير المناسب، التجانس المفرط) في الصور التي ينتجها الذكاء الاصطناعي وتطبيق مبادئ التصور الصادق
  • القدرة على تمييز أن التحليل الاستكشافي هو لتوليد الفرضيات وفخ الاكتشاف والتأكيد بنفس البيانات (مما يفتح الباب أمام الاختراق).

بعد تنظيف البيانات، فإن المهمة الأولى للباحث التجريبي هي التعرف عليها. تسمى هذه المرحلة بتحليل البيانات الاستكشافية (EDA - تحليل البيانات الاستكشافية): وهي عملية فحص البيانات بالرسوم البيانية والإحصائيات الموجزة ورؤية بنيتها وأنماطها ومفاجآتها. الهدف ليس اختبار فرضية بعد، ولكن التعرف على البيانات، وطرح الأسئلة، ووضع الأساس للنموذج الذي ستبنيه في المستقبل. في هذه الوحدة، سنرى كيف يعمل الذكاء الاصطناعي (AI) على تسريع عملية EDA والتصور، ولكن لماذا يجب تدقيق الرسومات التي ينتجها بعناية.

دعونا أولا نجعل التمييزين الأساسيين. أولاً، الإحصائيات الوصفية (الأرقام التي تلخص البيانات مثل المتوسط، والوسيط، والانحراف المعياري، والأرباع) والتصور (التي تظهر نفس المعلومات بيانياً) يكمل كل منهما الآخر؛ يصفون معًا البيانات. ثانياً، وهو الأهم: يجب التمييز بين الاكتشاف والتأكيد. التحليل الاستكشافي مخصص لتوليد الفرضيات. إن استكشاف الفرضية بنفس البيانات والقول "لقد اختبرتها ووجدتها مهمة" يفتح الباب أمام الاختراق p، وهو ما سنراه في الوحدة التالية. يمكنك إلقاء نظرة على البيانات ورؤية النمط مجانًا؛ لكن الإعلان عن هذا النمط على أنه "اكتشاف مثبت" في نفس البيانات هو أمر مضلل.

خطوة بخطوة التحليل الاستكشافي

1. عرض أحادي المتغير. فحص كل متغير على حدة: هل توزيعه متماثل أم منحرف؟ كم عدد التلال هناك؟ أين القيم المتطرفة؟ بالنسبة للمتغيرات الرقمية، الرسم البياني (مخطط يوضح التردد عن طريق تقسيم القيم إلى نطاقات) وboxplot (boxplot - مخطط يوضح القيم المتوسطة والربيعية والمتطرفة)؛ بالنسبة للمتغيرات الفئوية، استخدم الجداول التكرارية والمخططات الشريطية.

2. عرض ثنائي المتغير. انظر العلاقة بين متغيرين: مخطط مبعثر لمتغيرين عدديين (يظهر كل ملاحظة كنقطة على المستوى xy)، مخطط مربع مجمع لمتغيرين رقميين، جدول ترافقي لمتغيرين فئويين. قبل النظر إلى معامل الارتباط، تأكد من إلقاء نظرة على المخطط المبعثر: نفس الارتباط يمكن أن يظهر أنماطًا مختلفة جدًا (توضح رباعية أنسكومب الشهيرة ذلك؛ أربع مجموعات بيانات تحتوي على إحصائيات متطابقة تقريبًا، ولكن عندما يتم رسمها يتبين أنها مختلفة تمامًا).

3. اختر نوع المخطط الصحيح. يعتمد نوع المخطط على سؤالك ونوع البيانات. رسم بياني للتوزيع؛ نثر للعلاقة. مخطط خطي للتغيير مع مرور الوقت؛ مخطط شريطي لمقارنة الفئات؛ (بعناية) شريط مكدس لنسبة الأجزاء إلى الكل. يقوم الذكاء الاصطناعي بإنشاء التعليمات البرمجية لك بسرعة، ولكن القرار بشأن "أي رسم بياني لأي سؤال" يعود إليك.

4. لاحظ النمط، ولا تعلن النتائج. سجل أي نمط مثير للاهتمام تراه بمثابة "مذكرة اكتشاف"، لكن لا تعتبره نتيجة مؤكدة. يتم التأكيد في خطوة منفصلة، ​​ويفضل أن يكون ذلك باستخدام بيانات منفصلة أو جدول زمني محدد مسبقًا.

مبادئ التصور الصادق

الرسم يقنع؛ ولذلك فإن قوتها المضللة عالية أيضًا. يمكن للذكاء الاصطناعي أن يتخذ خيارات جمالية ولكنها مضللة في بعض الأحيان. تحقق من هذه السياسات:

  • في المخططات الشريطية، يجب أن يبدأ المحور y عند الصفر. يُظهر المحور المتقطع اختلافات صغيرة وكبيرة.
  • يجب أن يكون المقياس متسقًا. في حالة مقارنة مخططين، استخدم نفس نطاق المحور.
  • التجانس المفرط يمكن أن يخفي النمط الحقيقي. يبدو خط الاتجاه جميلًا، ولكن إذا كان "يسهل" البيانات أكثر من اللازم، فقد يكون مضللاً.
  • اللون والزخرفة ثلاثية الأبعاد تشوه الانتباه وليس البيانات. اختر البساطة.
  • ينبغي أن تكون البيانات المفقودة وحجم العينة مرئيين. يجب ألا يبدو "n=12" و"n=12,000" متماثلين.
تنبيه: مجرد أن الرسومات التي ينتجها الذكاء الاصطناعي جميلة، فهذا غير صحيح. الخطأ الأكثر شيوعًا الذي يرتكبه هو عدم بدء المحور من الصفر في المخطط الشريطي والمبالغة في الفرق بين المجموعتين. تحقق دائمًا من المحور.

مخطط المقارنة: سؤال → الرسم البياني

اسأل

الرسم البياني الصحيح

خطأ شائع

كيف يتم توزيع هذا المتغير؟

الرسم البياني / مؤامرة مربع

استخدام الرسم البياني الدائري

هل هناك متغيرين رقميين مرتبطين؟

مؤامرة مبعثر

مجرد النظر في عدد الارتباطات

كيف تغيرت مع مرور الوقت؟

مخطط خطي

معرفة الاتجاه باستخدام الرسم البياني الشريطي

ما هو الفرق بين المجموعات؟

المربع/الشريط المُجمَّع (من البداية)

قضيب المحور المقطوع

نسبة الجزء إلى الكل؟

شريط مكدس (مع الحذر)

رسم بياني متعدد الشرائح

أربع مطالبات قابلة للنسخ

1. رمز الاكتشاف التلقائي:

دورك: مساعد EDA. أنا لا أشارك البيانات، أريد رمز R (ggplot2). هناك متغيرات عددية (الدخل، العمر، الإنفاق) ومتغيرات فئوية (المنطقة، التعليم) في إطار بيانات "البيانات". المهمة: اكتب رمزًا يُنتج رسمًا بيانيًا لكل رقم رقمي، ومخططًا شريطيًا لكل فئة، ومخططًا مبعثرًا للدخل~العمر. في المخططات الشريطية، دع المحور y يبدأ من الصفر. أضف سطر التعليق.

2. مراجعة الارتباط (الارتباط + البصري معًا):

اكتب التعليمات البرمجية التي تحسب ارتباط بيرسون للدخل والإنفاق وترسم مخططًا مبعثرًا + اتجاه خطي. أضف سطر تعليق يذكرني بفحص المخطط قبل الوثوق في عدد الارتباط (تحذير أنسكومب). لا تبالغ في سلاسة خط الاتجاه.

3. تدقيق النزاهة:

تحقق من كود ggplot التالي للحصول على تصور صادق:[code]. تحقق من ما يلي وصححه: هل يبدأ المحور الصادي من الصفر، وهل المقياس ثابت، وهل حجم العينة مرئي، وهل هناك تجانس مفرط؟ اشرح مبرر كل تصحيح قمت به.

4. إنتاج مذكرة اكتشاف (وليس نتيجة):

بناءً على الرسوم البيانية التي أقوم بإنتاجها، قم بإدراج الملاحظات باعتبارها "مذكرة اكتشاف"؛ اكتب كل عنصر بلغة "الفرضية التي سيتم اختبارها"، وليس "النتيجة النهائية". مثال: "يبدو أن الدخل في التعليم العالي منتشر بشكل أكبر؛ يجب اختبارها ببيانات منفصلة. تجنب العبارات السببية والنهائية.

موجه ضعيف / موجه قوي

حث ضعيف:

قم بعمل رسوم بيانية جميلة من العائد وأخبرني ماذا تعني.

تدعو هذه المطالبة إلى نتائج مضللة: يركز مصطلح "الجميل" على الجماليات، في حين أن "ما يعنيه" يدفع الذكاء الاصطناعي إلى القفز من الاكتشاف إلى الاستنتاج النهائي. وتتبع ذلك تعليقات سببية ومبالغ فيها.

مطالبة قوية:

دورك: مساعد صادق في EDA. المهمة: (1) اختيار نوع الرسم البياني الذي يناسب سؤالي وكتابة المبررات، (2) بدء المحور من الصفر في المخططات الشريطية، (3) تفسير المخرجات بلغة ملاحظة الاكتشاف: لا يوجد ادعاء نهائي/سببي يقترح فرضية باللغة "يجب اختبارها"، (4) حذرني إذا كانت العينة صغيرة (n<30). سأقوم بتشغيل المخطط في بيئتي الخاصة وأتحقق منه.

الفرق: الإرادة القوية تبرر نوع المخطط، وتفرض قواعد الصدق ولا تخلط بين الاكتشاف والتأكيد.

ثلاث حالات صغيرة

الحالة 1 - المبالغة في المحور المنفصل. أظهر أحد المحللين درجات الرضا لفرعين (7.8 و8.0؛ من أصل 10) في رسم بياني شريطي. عند بدء المحور YZ من 7.5، ظهر الفرع الثاني ضعف ارتفاع الأول تقريبًا؛ بينما كان الفارق 2.5% فقط. كانت الإدارة على وشك مكافأة فرع تحت انطباع خاطئ. عندما بدأت المحور من الصفر كان الفرق غير مرئي تقريبًا. الدرس المستفاد: اختيار المحور وحده يغير الإدراك.

الحالة 2 - الثقة في الارتباط وتخطي المخطط. رأى أحد الباحثين r = 0.81 بين متغيرين وكتب "علاقة خطية قوية". عندما طلب مستشاره مخطط التشتت، تبين أن العلاقة كانت في الواقع نتيجة لملاحظة متطرفة واحدة، وعندما تمت إزالة تلك النقطة، انخفض الارتباط إلى 0.12. الدرس المستفاد: عدد الارتباطات ليس بديلاً عن الرسم البياني؛ ننظر دائما إلى مبعثر.

الحالة 3 - الخلط بين الاكتشاف والتأكيد. نظر أحد الطلاب إلى جميع الارتباطات الزوجية في مجموعة بيانات مكونة من 40 متغيرًا، واختار أعلى واحد (r = 0.52) وكتب، "لقد وجدنا علاقة مهمة بين التعليم والادخار (p = 0.004)." ومع ذلك، كان هناك مئات الأزواج في 40 متغيرًا؛ كان اختيار الأعلى نتيجة خاطئة بسبب الصدفة. الدرس المستفاد: لا يمكن "اختبار النمط المكتشف والإعلان عن أهميته" في نفس البيانات؛ مطلوب تأكيد منفصل.

الأخطاء الشائعة

  • عدم بدء المحور من الصفر في المخطط الشريطي. إنه يبالغ في الفارق البسيط. الكذبة البصرية الأكثر شيوعاً. تحقق دائما.
  • النظر في الارتباط وتخطي الرسم البياني. نفس الارتباط يأتي من أنماط مختلفة للغاية. يمكن أن تناسب علاقة خارجية. أولا، التشتت.
  • معتبرا النمط الموجود في الاكتشاف بمثابة "دليل" في نفس البيانات. هذه هي البوابة إلى القرصنة؛ يتم التأكيد بشكل منفصل.
  • نوع مخطط خاطئ. تعتبر المطابقات مثل شريط الاتجاه والفطيرة للتوزيع مضللة. اختر النوع بناءً على السؤال.
  • إخفاء حجم العينة. يجب ألا يبدو n=8 وn=8,000 متماثلين على نفس الرسم البياني؛ يجب إظهار عدم اليقين.
نصيحة: قبل نشر المخطط، اسأل نفسك: "هل ستتغير القصة إذا قمت بتغيير المحور؟" إذا كانت الإجابة بنعم، فمن المحتمل أنك بدأت المحور من مكان غير أمين.

في ملخص

تحليل البيانات الاستكشافية هو مرحلة تلبية البيانات ورؤية الأنماط وتوليد الفرضيات؛ إنه ليس تأكيدًا. يقوم الذكاء الاصطناعي بإنشاء إحصائيات وصفية ورمز رسم بياني بسرعة، لكنك تختار نوع الرسم البياني بناءً على سؤالك وتتحكم في مبادئ العدالة (محور الصفر، المقياس الثابت، عدم اليقين الواضح). انظر إلى التشتت قبل الوثوق برقم الارتباط؛ لا تعلن عن النمط الذي وجدته في الاكتشاف على أنه "دليل" في نفس البيانات. الرسم البياني الجميل للذكاء الاصطناعي لا يعني رسمًا بيانيًا صحيحًا.

مهمة التطبيق

حدد ثلاثة متغيرات على الأقل في مجموعة البيانات. اطلب من الذكاء الاصطناعي تشغيل التعليمات البرمجية التي تنتج رسومًا بيانية استكشافية (رسم بياني، مبعثر، محاصر) مع موجه يفرض قواعد الصدق. لكل مخطط: تحقق من (1) مدى ملاءمة نوع المخطط للسؤال، (2) صدق المحور، (3) رؤية حجم العينة. اكتب "مذكرة اكتشاف" واحدة على الأقل بلغة الفرضية ("...يبدو أنه تم اختبارها بشكل منفصل"). افحص الارتباط مع كل من العد والتشتت وأبلغ إذا كان هناك تناقض بينهما.

قائمة مرجعية

  • [ ] لقد اخترت نوع المخطط بناءً على سؤالي ونوع البيانات.
  • [ ] في المخططات الشريطية، أبدأ المحور الصادي من الصفر؛ لقد تأكدت من صدق المحور.
  • [ ] لقد نظرت إلى مخطط التشتت قبل أن أثق في الارتباط.
  • [ ] لقد عكست حجم العينة وعدم اليقين على الرسم البياني.
  • [ ] كتبت الأنماط التي وجدتها في الاستكشاف على أنها "فرضية ليتم اختبارها" بدلاً من "الدليل".
  • [ ] لاحظت أنني لن أستخدم نفس البيانات للتأكيد وأن هناك حاجة إلى خطوة منفصلة.