লাভ:
- ডেটার ধরন এবং বিতরণের জন্য উপযুক্ত পরীক্ষা বেছে নেওয়ার ক্ষমতা এবং অনুমানগুলি পরীক্ষা করার ক্ষমতা (স্বাভাবিকতা, বৈচিত্র)
- পি-মানের প্রকৃত অর্থ বোঝার ক্ষমতা এবং প্রভাবের আকার এবং আত্মবিশ্বাসের ব্যবধান সহ ফলাফলগুলি রিপোর্ট করার ক্ষমতা
- আবিষ্কার-যাচাই বিচ্ছেদ, একাধিক তুলনা সংশোধন এবং সম্পূর্ণ রিপোর্টিং সহ পি-হ্যাকিং থেকে সুরক্ষা
পরীক্ষা শেষ হয়েছে, তথ্য আছে৷ এখন আমরা সবচেয়ে জটিল এবং সবচেয়ে ভুল পর্যায়ে আছি: সঠিকভাবে ডেটা বিশ্লেষণ করা এবং ফলাফলগুলি সততার সাথে ব্যাখ্যা করা৷ জৈবিক তথ্য প্রায়ই কোলাহলপূর্ণ, অস্থির এবং বহুমুখী হয়। ভুল পরীক্ষা নির্বাচন, অন্তর্নিহিত অনুমান লঙ্ঘন, এবং অজ্ঞান পি-হ্যাকিং (এটি পছন্দসই ফলাফল না দেওয়া পর্যন্ত একটি বিশ্লেষণের চেষ্টা করা) প্রকাশিত জৈবিক সাহিত্যে প্রজননযোগ্যতা সংকটের প্রাথমিক কারণ। AI আপনাকে সঠিক পরীক্ষা বেছে নিতে, অনুমান পরীক্ষা করতে এবং বিশ্লেষণ কোড লিখতে সাহায্য করে; কিন্তু পরিসংখ্যানগত অখণ্ডতা আপনার দায়িত্ব।
এই ইউনিটে, আমরা সাধারণ পরিসংখ্যান পরীক্ষা, অনুমান পরীক্ষা এবং পি-হ্যাকিং থেকে নিজেকে রক্ষা করার উপায়গুলি কভার করব।
সঠিক পরীক্ষা নির্বাচন
পরীক্ষার পছন্দ ডেটার ধরণ এবং বিতরণের উপর নির্ভর করে। কৃত্রিম বুদ্ধিমত্তা আপনাকে এই পছন্দ করতে সাহায্য করবে, কিন্তু আপনার এটি অন্ধভাবে প্রয়োগ করা উচিত নয়:
- দুটি গ্রুপ, ক্রমাগত ডেটা, স্বাভাবিক বিতরণ: স্বাধীন টি-পরীক্ষা।
- দুটি গ্রুপ, অ-স্বাভাবিক: মান-হুইটনি ইউ (অ-প্যারামেট্রিক: বিতরণ অনুমান প্রয়োজন নেই)।
- দুটির বেশি গ্রুপ: ANOVA (ভ্যারিয়েন্সের বিশ্লেষণ) + পোস্ট-হক পরীক্ষা।
- শ্রেণীগত তথ্য (গণনা): চি-স্কয়ার বা ফিশার সঠিক পরীক্ষা।
- সম্পর্ক: পারস্পরিক সম্পর্ক (পিয়ারসন/স্পিয়ারম্যান) বা রিগ্রেশন।
টিপ: পরীক্ষা নির্বাচন করার আগে ডেটা ভিজ্যুয়ালাইজ করুন। একটি হিস্টোগ্রাম বা বক্সপ্লট তাত্ক্ষণিকভাবে স্বাভাবিকতা এবং বহিঃপ্রকাশ দেখায় যা একটি টি-পরীক্ষার প্রয়োজন। "আগে গ্রাফ, পরে পরীক্ষা" একটি ভাল অভ্যাস।
অনুমান পরীক্ষা করা হচ্ছে
প্রতিটি পরীক্ষার গোপন অনুমান আছে। টি-পরীক্ষা স্বাভাবিক বন্টন এবং বৈচিত্র্যের সমতা অনুমান করে; এগুলি লঙ্ঘন করা হলে, ফলাফল বিভ্রান্তিকর হবে। এআই কোড লিখে যা এই অনুমানগুলি পরীক্ষা করে:
ভূমিকা: আপনি একজন জীব পরিসংখ্যান সহকারী। টাস্ক: কোড লিখুন যা দুটি গোষ্ঠীর ডেটা তুলনা করার আগে একটি টি-পরীক্ষার অনুমান পরীক্ষা করে: স্বাভাবিকতা (শাপিরো-উইল্ক), বৈচিত্র্যের সমতা (লেভেন)। যদি অনুমান লঙ্ঘন করা হয়, আমাকে বলুন কোন বিকল্প পরীক্ষায় আমার এগিয়ে যাওয়া উচিত। কমেন্ট সহ পাইথন কোড দিন।
স্বাভাবিকতা ভেঙে গেলে কোডটি আপনাকে মান-হুইটনিতে পুনঃনির্দেশ করে। এই "আগে পরীক্ষা করুন, পরে সিদ্ধান্ত নিন" প্রবাহ আপনাকে ভুল পরীক্ষা করা থেকে বিরত রাখে।
পি-হ্যাকিং এবং কীভাবে নিজেকে রক্ষা করবেন
পি-হ্যাকিং হল p <0.05 পর্যন্ত বিভিন্ন উপায়ে ডেটা বিশ্লেষণ করা: বিভিন্ন পরীক্ষার চেষ্টা করা, বেছে বেছে আউটলায়ারদের বাদ দেওয়া, গ্রুপ যোগ করা/মুছে ফেলা, বিপুল সংখ্যক ভেরিয়েবলের মধ্যে কী "গুরুত্বপূর্ণ" তা রিপোর্ট করা। এটি জাল আবিষ্কারের প্রধান উত্স। সুরক্ষার উপায়:
- আগে থেকে বিশ্লেষণ পরিকল্পনা ঠিক করুন (ইউনিট 7)।
- সমস্ত পরীক্ষার রিপোর্ট করুন, শুধুমাত্র যেগুলি তাত্পর্য দেখায় তা নয়।
- একাধিক তুলনা ঠিক করুন (FDR/Bonferroni)।
- p-মানের পাশে প্রভাবের আকার এবং আত্মবিশ্বাসের ব্যবধান দিন।
- পৃথক আবিষ্কার এবং বৈধতা: আপনি একটি স্বাধীন সেটে আবিষ্কার সেটে যা পান তা পরীক্ষা করুন।
ধাপে ধাপে: একটি সৎ বিশ্লেষণ
- ডেটা ভিজ্যুয়ালাইজ করুন (স্ক্যাটার, আউটলায়ার)।
- অনুমান পরীক্ষা করুন.
- আপনার পূর্বনির্ধারিত পরীক্ষাটি সম্পাদন করুন।
- একাধিক তুলনা ঠিক করুন।
- প্রতিবেদন প্রভাবের আকার + আত্মবিশ্বাসের ব্যবধান।
- সীমাবদ্ধতা স্পষ্টভাবে লিখুন।
অনুলিপিযোগ্য প্রম্পট টেমপ্লেট
ভিজ্যুয়ালাইজ থ্রুপুট: প্লট হিস্টোগ্রাম এবং প্রতিটি গ্রুপের জন্য বক্সপ্লট, ফ্ল্যাগ আউটলার। তারপর স্বাভাবিকতা ব্যাখ্যা করুন। ডেটা কলাম: [নাম]। কমেন্ট সহ পাইথন কোড দিন।
আমি আমার দুটি গ্রুপ তুলনা করতে চাই. ডেটার বৈশিষ্ট্য: [টাইপ, এন, ডিস্ট্রিবিউশন]। কোন পরীক্ষাটি উপযুক্ত? অনুমান চেক করুন, পরীক্ষা করুন, প্রতিবেদনের প্রভাবের আকার এবং p-মানের সাথে 95% আত্মবিশ্বাসের ব্যবধান।
আমি আমার বিশ্লেষণে 15 টি ভিন্ন জিনের জন্য পরীক্ষা করেছি। বনফেরোনি এবং বেঞ্জামিনি-হচবার্গ সংশোধন প্রযোজ্য কোড দিন এবং দুটি পদ্ধতির মধ্যে পার্থক্য ব্যাখ্যা করুন।
দুর্বল প্রম্পট / শক্তিশালী প্রম্পট
দুর্বল: "এই দুটি গ্রুপ কি আলাদা, একটি টি-পরীক্ষা করুন।"
শক্তিশালী: "আমার দুটি গ্রুপ আছে (নিয়ন্ত্রণ n=18, চিকিত্সা n=20), নির্ভরশীল পরিবর্তনশীল হল এনজাইম কার্যকলাপ (নিরবিচ্ছিন্ন)। প্রথমে শপিরো-উইল্কের সাথে বিতরণ এবং পরীক্ষা স্বাভাবিকতা কল্পনা করুন। স্বাভাবিক হলে, টি-টেস্ট প্রয়োগ করুন, যদি না হয়, মান-হুইটনি। p-মান, প্রভাবের আকার এবং 5% র্যাঙ্ক বা হেন-এর সাথে ফলাফল রিপোর্ট করুন। আত্মবিশ্বাসের ব্যবধান ব্যাখ্যা করুন আপনি কোন পরীক্ষাটি বেছে নিয়েছেন এবং কেন।"
পার্থক্য: শক্তিশালী প্রম্পটে ডেটা টাইপ, নমুনা নম্বর, অনুমান পরীক্ষা এবং সম্পূর্ণ প্রতিবেদনের অনুরোধ রয়েছে। মডেলটি অন্ধভাবে টি-টেস্ট প্রয়োগ করার পরিবর্তে সঠিক পথ অনুসরণ করে।
তিনটি মিনি কেস
কেস 1 — ভুল পরীক্ষা: একজন ছাত্র উল্লেখযোগ্যভাবে তির্যক (অ-স্বাভাবিক) ডেটাতে একটি টি-টেস্ট প্রয়োগ করেছে এবং p=0.048 পেয়েছে। কৃত্রিম বুদ্ধিমত্তা যখন স্বাভাবিকতা পরীক্ষা যোগ করে, তখন ডেটা স্বাভাবিকভাবে আসেনি; মান-হুইটনির সাথে, p=0.11। প্রকৃত ফলাফল অর্থহীন ছিল। পাঠ: অনুমান পরীক্ষা না করে পরীক্ষা করা বিভ্রান্তিকর।
কেস 2 - নির্বাচনী আউটলার বাতিল: একজন গবেষক ফলাফলটিকে অর্থবহ করার জন্য দুটি "আউটলার" পয়েন্ট মুছে দিয়েছেন। মডেল জোর দিয়েছিল যে আউটলিয়ার বাতিল করা উচিত একটি পূর্বনির্ধারিত নিয়মের উপর ভিত্তি করে (যেমন, IQR পদ্ধতি) এবং রিপোর্ট করা; নির্বিচারে মুছে ফেলা হয় পি-হ্যাকিং। পাঠ: আগে থেকে বহির্মুখী নিয়ম সেট করুন।
কেস 3 — প্রভাবের আকার পুনরুদ্ধার: একটি গবেষণায় p=0.001 ছিল কিন্তু প্রভাবের আকার (d=0.1) প্রায় শূন্য ছিল; বড় নমুনা তাৎপর্যপূর্ণ হতে নগণ্য পার্থক্য দেখিয়েছে. যখন কৃত্রিম বুদ্ধিমত্তা প্রভাবের আকারের রিপোর্ট করেছিল, তখন অনুসন্ধানের কোন ব্যবহারিক মূল্য নেই। পাঠ: শুধু p ছোট হওয়ার কারণে কিছু যায় আসে না।
তুলনা চার্ট
স্ট্যাটাস
সঠিক পদ্ধতি
এড়ানোর জন্য
অস্বাভাবিক তথ্য
ননপ্যারামেট্রিক পরীক্ষা
জোর করে টি-পরীক্ষা
বহু পরীক্ষা
সংশোধন প্রয়োগ করুন
অপরিশোধিত p <0.05
outlier
পূর্বনির্ধারিত নিয়ম
নির্বিচারে মুছে ফেলা
উল্লেখযোগ্য ফলাফল
প্রভাবের আকার + CI
শুধু পি
আবিষ্কার অনুসন্ধান
স্বাধীন সেটে যাচাই করুন
এক সেটে চূড়ান্ত করুন
সাধারণ ভুল
- হাইপোথিসিস অনিয়ন্ত্রিত পরীক্ষা: মিথ্যা পরীক্ষার সাথে মিথ্যা তাত্পর্য।
- পি-হ্যাকিং: বিশ্লেষণের চেষ্টা করা যতক্ষণ না এটি পছন্দসই ফলাফল দেয়।
- শুধুমাত্র পি-মান রিপোর্ট করা: প্রভাবের আকার এবং আত্মবিশ্বাসের ব্যবধান বাদ দেওয়া।
- একাধিক তুলনার জন্য সংশোধন করা হচ্ছে না: মিথ্যা ইতিবাচক।
- কার্যকারণ জাম্পিং: পারস্পরিক সম্পর্ক থেকে কার্যকারণ অনুমান করা।
সতর্কতা: AI আপনি যে ফলাফল চান তা "উৎপাদন" করবে না, তবে ভুল পরীক্ষার জন্য কোডটি বিভ্রান্ত হলে আনন্দের সাথে লিখবে। আপনার পরিসংখ্যানগত অখণ্ডতা রয়েছে: সমস্ত পরীক্ষার রিপোর্ট করুন, বিশ্লেষণের আগে থেকেই পরিকল্পনা করুন, প্রভাবের আকার কখনই মিস করবেন না। প্রকাশনার দিকে নিয়ে যাওয়া বিশ্লেষণের জন্য একজন বায়োস্ট্যাটিস্টিয়ানের সাথে কাজ করুন।
পি-মানের প্রকৃত অর্থ
জীববিজ্ঞানের সবচেয়ে ভুল ধারণা হল পি-মান। পি-মান "অনুমান সত্য হওয়ার সম্ভাবনা" নয়; এটি হল "যখন বাস্তবে কোন পার্থক্য নেই তখন আপনি যা পর্যবেক্ষণ করেন তার চেয়ে বড় বা বেশি চরম হিসাবে একটি পার্থক্য দেখার সম্ভাবনা।" এই সূক্ষ্ম কিন্তু সমালোচনামূলক পার্থক্য ফলাফল অতিরঞ্জিত না চাবিকাঠি. p=0.03 এর অর্থ এই নয় যে "প্রভাবটি 97% বাস্তব"। যখন AI একটি ফলাফল ব্যাখ্যা করে, তখন পরীক্ষা করুন যে এটি এই সংজ্ঞাটি সঠিকভাবে ব্যবহার করে; মডেল কখনও কখনও সাধারণ ভুল ব্যাখ্যা পুনরাবৃত্তি করতে পারে.
আত্মবিশ্বাসের ব্যবধান (CI) প্রায়শই p-মানের চেয়ে বেশি তথ্যপূর্ণ কারণ এটি একসাথে প্রভাবের মাত্রা এবং অনিশ্চয়তা দেখায়। "পার্থক্য 2.4-গুণ (95% CI: 1.8-3.1)" "p<0.05" এর চেয়ে অনেক বেশি বলে: প্রভাবের দিক, এর মাত্রা এবং এটি কতটা সঠিকভাবে পরিমাপ করা হয়েছিল উভয়ই। আপনার প্রতিবেদনে GA হাইলাইট করুন।
আমার ফলাফল ব্যাখ্যা করার সময় পি-মানের সঠিক সংজ্ঞা ব্যবহার করুন। ভুল বিবৃতি যেমন "প্রভাব সত্য হওয়ার সম্ভাবনা" এড়িয়ে চলুন। পরিবর্তে, প্রভাবের আকার এবং 95% আত্মবিশ্বাসের ব্যবধানের পরিপ্রেক্ষিতে ব্যবহারিক অর্থ ব্যাখ্যা করুন। ফলাফল: [ডেটা]
পারস্পরিক সম্পর্ক, কার্যকারণ এবং পর্যবেক্ষণ তথ্য
বেশিরভাগ জৈবিক ডেটা পর্যবেক্ষণমূলক: আপনি অন্য কিছুর সাথে কিছু পরিবর্তন করতে দেখেন, কিন্তু আপনি দেখতে পাচ্ছেন না যে কী কারণে হয়। "জিন X এর অভিব্যক্তি রোগের সাথে সম্পর্কযুক্ত" বাক্যটি ইঙ্গিত করে না যে X রোগ সৃষ্টি করে; রোগটি এক্স বাড়তে পারে বা তৃতীয় কোনো কারণ উভয়কেই প্রভাবিত করতে পারে। কার্যকারণ শুধুমাত্র হস্তক্ষেপমূলক পরীক্ষার মাধ্যমে প্রতিষ্ঠিত করা যেতে পারে (এক্স পরিবর্তন করা এবং ফলাফল পরিমাপ করা)। AI আপনার লেখায় অজান্তেই কার্যকারণ ভাষা ("কারণ," "বাড়ে") ব্যবহার করতে পারে; এই দৃষ্টিকোণ থেকে প্রতিটি উপসংহার বাক্য পর্যালোচনা করুন, পারস্পরিক সম্পর্কযুক্ত ভাষায় পর্যবেক্ষণমূলক ফলাফল প্রকাশ করে ("সম্পর্কিত," "একত্রে পরিবর্তিত")।
জোড়া এবং স্বাধীন ডেটা আলাদা করা
পরীক্ষা নির্বাচনের ক্ষেত্রে সবচেয়ে ঘন ঘন উপেক্ষিত পার্থক্য হল নমুনাগুলি স্বাধীন বা জোড়াযুক্ত কিনা। আপনি যদি একই ব্যক্তির থেকে পরিমাপের আগে এবং পরে গ্রহণ করেন (উদাহরণস্বরূপ, চিকিত্সার আগে এবং পরে একই রোগীদের রক্তের মান), এই পরিমাপগুলি স্বাধীন নয়; একটি জোড়া পরীক্ষা প্রয়োজন. এখানে স্বতন্ত্র দুই-নমুনা টি-পরীক্ষা ব্যবহার করা ডেটাতে মিল তথ্য বাতিল করে এবং শক্তি হ্রাস করে; এটা এমনকি ফলাফল বিপরীত হতে পারে. নিয়মটি সহজ: "এই দুটি পরিমাপ কি একই জৈবিক ইউনিট থেকে আসে?" যদি উত্তর হ্যাঁ হয়, পেয়ারড টেস্ট (পেয়ারড টি-টেস্ট বা উইলকক্সন সাইনড র্যাঙ্ক টেস্ট) ব্যবহার করা হয়, যদি না হয়, স্বাধীন পরীক্ষা ব্যবহার করা হয়। আপনি পরীক্ষার জন্য কৃত্রিম বুদ্ধিমত্তা জিজ্ঞাসা করার সময়, আপনার ডেটার মিল কাঠামো নির্দিষ্ট করতে ভুলবেন না; আপনি যদি নির্দিষ্ট না করেন, মডেলটি প্রায়শই স্বাধীনতা ধরে নেয় এবং ভুল পরীক্ষার সুপারিশ করে।
আমার পরিমাপের দুটি সেট আছে। গুরুত্বপূর্ণ: এই পরিমাপগুলি একই ব্যক্তিদের (জোড়া) আগে/পরে নেওয়া হয়েছিল। সঠিক পরীক্ষাটি চয়ন করুন যা এই ম্যাচটিকে বিবেচনা করে (পেয়ার করা টি-টেস্ট বা উইলকক্সন), আপনার অনুমান পরীক্ষা করুন এবং প্রভাবের আকার সহ রিপোর্ট করুন। স্বাধীনতা অনুমান করবেন না।
সংক্ষেপে
সঠিক তথ্য বিশ্লেষণ; ডেটার প্রকারের জন্য উপযুক্ত পরীক্ষা নির্বাচন করা, অনুমান পরীক্ষা করা, একাধিক তুলনা সংশোধন করা এবং পি-মান ছাড়াও প্রভাবের আকার এবং আত্মবিশ্বাসের ব্যবধানের প্রতিবেদন করা। সবচেয়ে বড় বিপদ হল পি-হ্যাকিং; প্রতিষেধক হল একটি অগ্রিম বিশ্লেষণ পরিকল্পনা, সম্পূর্ণ রিপোর্টিং এবং আবিষ্কার-যাচাই বিচ্ছেদ। কৃত্রিম বুদ্ধিমত্তা পরীক্ষা নির্বাচন এবং অনুমান যাচাইয়ের একটি শক্তিশালী সহায়তা, তবে পরিসংখ্যানগত অখণ্ডতা মানুষের সাথে জড়িত।
আবেদন টাস্ক
দুটি গ্রুপের সাথে একটি ডেটা সেট (আপনার নিজস্ব ডেটা বা একটি নমুনা) নিন। প্রথমে AI রাইট কোড আছে যা ডেটা ভিজ্যুয়ালাইজ করে এবং স্বাভাবিকতার জন্য পরীক্ষা করে। ফলাফলের উপর নির্ভর করে, উপযুক্ত পরীক্ষা (টি-টেস্ট বা মান-হুইটনি) প্রয়োগ করুন এবং পি-মান সহ প্রভাবের আকার এবং আত্মবিশ্বাসের ব্যবধানের প্রতিবেদন করুন। তারপরে সংশোধন ছাড়াই একাধিক তুলনার প্রভাব এবং ফলাফলে সংশোধনের সাথে তুলনা করুন।
চেকলিস্ট
- [ ] আমি পরীক্ষার আগে ডেটা ভিজ্যুয়ালাইজ করেছি।
- [ ] আমি পরীক্ষার অনুমান (স্বাভাবিকতা, বৈচিত্র) পরীক্ষা করেছি।
- [] আমি উপযুক্ত পরীক্ষা বেছে নিয়েছি, আমি অন্ধভাবে টি-টেস্ট প্রয়োগ করিনি।
- আমি একাধিক তুলনা ঠিক করেছি।
- আমি [ ] p- মান এবং সেইসাথে প্রভাবের আকার এবং আত্মবিশ্বাসের ব্যবধান রিপোর্ট করেছি।
- [ ] আমি আগে থেকেই বিশ্লেষণ পরিকল্পনা ঠিক করেছিলাম এবং পি-হ্যাকিং এড়িয়ে গিয়েছিলাম৷