واحد 5 / 11

پشتیبانی از تجزیه و تحلیل داده ها: کد، تفسیر آماری و کدگذاری کیفی

سود:

  • امکان استفاده از هوش مصنوعی برای تولید طرح تحلیل، انتخاب آزمون آماری مناسب و پیش نویس کد R/Python/SPSS و اعتبار سنجی دستی خروجی
  • امکان دریافت موضوع و کد پیشنهادی در داده های کیفی، اتصال و تایید تفسیر هوش مصنوعی به داده های خام
  • توانایی درک خطر حریم خصوصی به اشتراک گذاری داده های خام، خطر آمار جعلی و هک p و ترسیم مرزهای تجزیه و تحلیل مسئولانه

هنگامی که داده ها جمع آوری می شوند، زمان آن است که آن را درک کنیم. تجزیه و تحلیل داده ها فرآیند تبدیل اعداد یا متن خام به یافته هایی است که به سؤال تحقیق پاسخ می دهد. در این مرحله، هوش مصنوعی سه کار مشخص را تسریع می‌کند: تولید کد پیش‌نویس (R، Python، نحو SPSS)، کمک به تفسیر خروجی آماری، و ارائه پیشنهادات موضوع/کد در داده‌های کیفی. اما تجزیه و تحلیل حساس ترین حوزه دقت و محرمانه بودن در دانشگاه است. قانون اصلی این واحد دو مورد است: داده های خام محرمانه باقی می مانند، هر نتیجه عددی به صورت دستی تأیید می شود. هوش مصنوعی همچنین می تواند آمار جعلی تولید کند. یک مقدار p تایید نشده به همان اندازه یک انتساب تایید نشده خطرناک است.

ایجاد پیش نویس کد

هوش مصنوعی در تبدیل طرح تجزیه و تحلیل به کد کاری بسیار قدرتمند است. گفتن "یک تست t-test مستقل بین این متغیرها انجام دهید و فرضیات را بررسی کنید" یک طرح کلی R یا Python به شما می دهد. این یک راحتی عالی است، به ویژه برای محققانی که در برنامه نویسی متخصص نیستند. اما دو قانون وجود دارد. اول: کد را در محیط شخصی خود با داده های خود اجرا کنید. داده های خام را در ابزار آپلود نکنید. You describe the structure of your data to the AI ​​(variable names, types, a few sample lines — no IDs), it writes the code, and you execute it on the local machine. دوم: خواندن و درک کد. کپی کور یک خطای خاموش (متغیر اشتباه، تست اشتباه) را بدون توجه به آن به گزارش منتقل می کند.

انتخاب یک آزمون آماری یک تصمیم حیاتی است: نوع داده ها (پیوسته/مقوله ای)، تعداد گروه ها، مفروضات توزیعی تعیین کننده آزمون هستند. مانند درخت تصمیم، هوش مصنوعی می‌گوید «در این مورد، آزمایش زیر ممکن است مناسب باشد» و استدلال خود را توضیح می‌دهد. این آموزنده است. اما شما انتخاب را با بررسی مفروضات داده های خود تأیید می کنید. آزمون اشتباه نتیجه ای را ایجاد می کند که معتبر به نظر می رسد اما بی معنی است.

احتیاط: هنگامی که از شما برای یک عدد پرسیده می شود ("میانگین در این نمونه چقدر است")، هوش مصنوعی ممکن است بدون انجام محاسبات واقعی عددی را ایجاد کند که منطقی به نظر برسد. هرگز هوش مصنوعی خلاصه داده ها را "محاسبه" نکند و از نتیجه استفاده کند. نرم افزار آماری محاسبات را انجام می دهد، هوش مصنوعی فقط کد و تفسیر را تولید می کند.

تفسیر آماری و کدگذاری کیفی

هنگامی که نرم افزار شما یک خروجی تولید می کند (به عنوان مثال t(48) = 2.31، p = 0.025)، هوش مصنوعی به شما کمک می کند تا آن را به زبان ساده تفسیر کنید: معنی آن، اهمیت اندازه افکت، نحوه گزارش آن (در قالب APA). شما این تفسیر را با نگاه کردن به خروجی خود تأیید می کنید. شما خروجی را به هوش مصنوعی می دهید، آن را تفسیر می کند، می دانید که این عدد در واقع از تجزیه و تحلیل شما آمده است.

در تحلیل کیفی، هوش مصنوعی می‌تواند کدهای ممکن (واحدهای معنی تکرارشونده) و مضامین را از متن مصاحبه استخراج کند. این به عنوان نقطه شروع در کدگذاری استقرایی ارزشمند است. هوش مصنوعی ممکن است الگویی را به شما پیشنهاد دهد که از دست داده اید. اما قلب تحلیل کیفی، خوانش عمیق محقق است; شما هر کدی را که هوش مصنوعی پیشنهاد می‌کند به داده‌های خام (نقل قول واقعی) پیوند می‌دهید، زمینه آن را بررسی می‌کنید و آن را با چارچوب تفسیری خود فیلتر می‌کنید. هوش مصنوعی داده های کیفی را «تفسیر» نمی کند، الگوهایی را پیشنهاد می کند. شما معنا را ایجاد می کنید.

هک p (دستکاری داده‌ها به روش‌های مختلف تا رسیدن به نتایج معنادار) یک نقض جدی اخلاقی است. اینکه هوش مصنوعی بگوید "تست های مختلف را امتحان کنید تا نتیجه معنی دار پیدا کنید" دقیقاً همین است و ممنوع است. قبل از مشاهده داده ها، طرح تحلیل خود را تعیین کنید (در صورت امکان با پیش ثبت نام) و از هوش مصنوعی برای اجرای آن طرح استفاده کنید، نه برای "شکار" نتیجه.

تکرارپذیری و مستندات کد

در دانشگاه های مدرن، تکرارپذیری به طور فزاینده ای مهم است: توانایی یک محقق دیگر برای رسیدن به همان نتیجه با داده ها و کد شما. هوش مصنوعی در اینجا یک کمک دو طرفه است. ابتدا می‌توانید از آن بخواهید تا کدی را که تولید می‌کند با خطوط نظر مستند کند. کدی که توضیح می‌دهد هر مرحله چه کاری انجام می‌دهد، درک آن را برای شما شش ماه بعد و برای حسابرس آسان‌تر می‌کند. دوم، هوش مصنوعی تحلیل شما را به جای کلیک تصادفی دستی (مثلاً در منوهای SPSS) بر اساس اسکریپت سوق می دهد. اسکریپت رکورد کامل تحلیل شماست و با یک کلیک قابل تکرار است. این عدم قطعیت "با چه تنظیماتی به این نتیجه رسیدم؟" را از بین می برد.

بخشی از تکرارپذیری، جدا نگه‌داشتن داده‌های خام و داده‌های پردازش‌شده است: شما هرگز داده‌های خام را با دست لمس نمی‌کنید، بلکه همه تبدیل‌ها (تمیز کردن، کدگذاری، حذف) را در کد انجام می‌دهید. به این ترتیب وقتی خطایی پیدا کردید، می توانید به ابتدا برگردید و دوباره آن را اجرا کنید. هوش مصنوعی می تواند یک چارچوب گردش کار پیشنهاد کند که این تمایز را حفظ کند. اما تصمیماتی مانند اینکه کدام شرکت کننده حذف شد و چرا قضاوت های علمی است که باید بگیرید و ثبت کنید.

سه کیف کوچک

مورد 1 - شتاب کد، تأیید دستی. یک محقق نمی دانست که چگونه ANOVA اندازه گیری های مکرر را در R انجام دهد. او ساختار داده (ناشناس) را برای هوش مصنوعی توصیف کرد، پیش نویس کد را گرفت و آن را روی دستگاه خود اجرا کرد. او همچنین خروجی را در SPSS تکرار کرد. دو نتیجه توافق کردند. کد درست بود، اما محقق تنها زمانی به آن اطمینان پیدا کرد که آن را با ابزار دوم تأیید کرد.

مورد 2 - آمار خلاصه ساختگی. دانش آموزی جدول داده ها را در هوش مصنوعی چسباند و گفت: "میانگین ها و انحرافات استاندارد را محاسبه کنید." هوش مصنوعی اعدادی را برگرداند که معقول به نظر می رسید. وقتی دانش آموز آن را در نرم افزار بررسی کرد، دید که چندین میانگین اشتباه است. هوش مصنوعی در واقع جدول را محاسبه نکرد، آن را حدس زد. درس: نرم افزار محاسبه را انجام می دهد، شما نتیجه را از هوش مصنوعی دریافت نمی کنید.

مورد 3 - پیشنهاد کد کیفی. یک دانشمند علوم اجتماعی 30 مصاحبه را خودش کدگذاری کرد، سپس زیرمجموعه‌ای ناشناس به هوش مصنوعی داد و پرسید: «چه موضوعات اضافی ظاهر می‌شوند». هوش مصنوعی موضوعی از "اعتماد نهادی" را پیشنهاد کرد که او به طور جداگانه در نظر نگرفت. محقق به نقل قول های خام بازگشت، متوجه شد که موضوع واقعاً پشتیبانی می شود و آن را به تحلیل خود اضافه کرد. AI چشم انداز اضافه کرد. محقق تصمیم و تأیید را گرفت.

قالب های قابل کپی

1) مشاوره انتخاب آزمون:

بازده: [نوع متغیر وابسته]، [تعداد گروه ها]، [مستقل/جفت شده]، [آنچه در مورد توزیع می دانم]. سوال من: آیا بین گروه ها تفاوت وجود دارد؟ آزمون های آماری مناسب را همراه با توجیه آنها فهرست کنید و فرضیات هر یک را بنویسید. من انتخاب می کنم.

2) پیش نویس کد (بدون شناسه):

من از R استفاده می کنم. دیتافریم من دارای ستون های زیر است: [نام و انواع ستون ها، مثال UNIDENTIFIED 2 ردیف]. کدی را با تفسیر بنویسید که یک آزمون t نمونه مستقل را انجام دهد و مفروضات (نرمال بودن، همگنی واریانس) را بررسی کند. من کد را روی دستگاه خودم اجرا خواهم کرد.

3) تفسیر خروجی (APA):

نرم افزار آمار من خروجی زیر را تولید کرد: [خروجی چسباندن]. چگونه می توانم این را در قالب APA 7 گزارش کنم؟ اندازه اثر و معنای کاربردی آن را به زبان ساده توضیح دهید. اعداد را از خروجی من بگیرید، عدد جدیدی تولید نکنید.

4) پیشنهاد تم کیفی (ناشناس):

در زیر گزیده‌های مصاحبه ناشناس آمده است. به صورت استقرایی کد و موضوع ممکن را به نامزدها پیشنهاد دهید. نشان دهید که هر نامزد بر اساس کدام نقل قول است. اینها پیشنهادات هستند. من آن را از روی داده های خام تأیید خواهم کرد. نقل قول: [متن ناشناس]

اعلان ضعیف / اعلان قوی

اعلان ضعیف:

این داده ها را تجزیه و تحلیل کنید و نتیجه را به من بگویید. [چسباندن جدول]

هوش مصنوعی محاسبه را تشکیل می دهد. علاوه بر این، داده های خام به ابزار باز خروجی می شوند. ریسک مضاعف

اعلان قدرتمند:

من از پایتون (پانداها + scipy) استفاده می کنم. چارچوب داده من: [unidentifiedcolumndefinition]. من می خواهم دو گروه را با هم مقایسه کنم. کد INTERPRETED را بنویسید که (1) مفروضات را بررسی می کند، (2) آزمون مناسب را اعمال می کند، (3) اندازه اثر را محاسبه می کند. من آن را با داده های خودم اجرا می کنم و نتیجه را گزارش می کنم. شما عدد را تشکیل نمی دهید. فقط کد و نظر بدهید

کسب و کار

هوش مصنوعی انجام می دهد

شما انجام می دهید

انتخاب آزمون

گزینه + توجیه

بررسی مفروضات، تصمیم گیری

کد آنالیز

پیش نویس کد

دویدن و خواندن به صورت محلی

محاسبه عددی

نباید

محاسبه با نرم افزار

نظر خروجی

طرح کلی زبان ساده

با پرینت خود تأیید کنید

کدگذاری کیفی

نامزد تم

اعتبارسنجی با داده های خام

اشتباهات رایج

  • آپلود داده های خام/شناسایی شده در ابزار باز. محرمانه بودن شرکت کنندگان نقض می شود. بزرگ ترین اشتباه
  • ساخت اعداد برای محاسبه هوش مصنوعی آمار ساختگی را تولید می کند. نرم افزار محاسبات را انجام می دهد.
  • اجرای کد بدون خواندن آن خطای بی صدا به گزارش نشت می کند.
  • p-هک کردن تلاش برای آزمایش‌ها برای یافتن نتایج معنی‌دار، یک نقض اخلاقی است.
  • تفسیر کیفی را به هوش مصنوعی بسپاریم. محقق معنا را می سازد; هوش مصنوعی فقط الگوها را پیشنهاد می کند.
نکته: طرح تحلیل و توجیه خود را برای هر آزمونی که به صورت کتبی استفاده می کنید حفظ کنید. این هم در برابر هک p محافظت می کند و هم یک رکورد آماده در هنگام نوشتن بخش روش ارائه می دهد.

به طور خلاصه

هوش مصنوعی تجزیه و تحلیل داده ها را با پیش نویس کد، مشاوره انتخاب آزمون، تفسیر خروجی و پیشنهاد موضوع کیفی تسریع می کند. اما تجزیه و تحلیل حساس ترین حوزه دقت آکادمی است: داده های خام مخفی نگه داشته می شوند، محاسبات در نرم افزار انجام می شود، هر نتیجه عددی با دست تأیید می شود، تفسیر کیفی به داده های خام گره خورده است، و از هک p اجتناب می شود. کوتاه ترین قانون: کد و تفسیر از هوش مصنوعی است، محاسبه و تصمیم از شماست.

وظیفه کاربردی

ساختار داده های خود (یا نمونه) را به صورت ناشناس توصیف کنید و از هوش مصنوعی یک توصیه آزمایشی مناسب و یک کد تجزیه و تحلیل نظر داده شده بخواهید. کد را بخوانید و در یک جمله بنویسید که هر خط چه کاری انجام می دهد. کد را اجرا کنید و خروجی را دریافت کنید و در صورت امکان حداقل یک نتیجه را به روش دوم (با دست یا ابزار دیگر) تأیید کنید. اگر به صورت کیفی کار می کنید، موضوعی را به مجموعه ای ناشناس از نقل قول ها پیشنهاد کنید و آنها را با داده های خام مقایسه کنید.

چک لیست

  • [ ] آیا من داده های خام/شناسایی شده را در هیچ ابزار باز بارگذاری نکرده ام؟
  • [ ] آیا انتخاب آزمون را با بررسی مفروضات تأیید کرده ام؟
  • [ ] آیا کد را خوانده و فهمیده ام و آن را به صورت محلی اجرا کرده ام؟
  • [ ] آیا هر نرم افزار نتیجه عددی/ثانویه را تأیید کرده ام؟
  • [ ] آیا مضامین کیفی را به نقل قول های خام گره زده ام؟