লাভ:
- বুঝুন যে পি-হ্যাকিং, হার্কিং, সিলেক্টিভ রিপোর্টিং, এবং কাঁটাচামচ পথের বাগান মিথ্যা অনুসন্ধান তৈরি করে এবং দেখুন কিভাবে কৃত্রিম বুদ্ধিমত্তা এই ফাঁদগুলিকে ত্বরান্বিত করতে পারে
- প্রাক-নিবন্ধন, বিশ্লেষণ পরিকল্পনা, একাধিক তুলনামূলক শৃঙ্খলা এবং কৃত্রিম বুদ্ধিমত্তা সমর্থন সহ সংবেদনশীলতা বিশ্লেষণের মতো প্রতিরক্ষা স্থাপন করার ক্ষমতা
- সৎ অনুরোধের নকশাকে অভ্যন্তরীণ করতে সক্ষম হওয়া যা কৃত্রিম বুদ্ধিমত্তাকে 'অর্থপূর্ণ ফলাফল খুঁজুন' টাইপের অনুরোধগুলি প্রত্যাখ্যান করতে সক্ষম করবে এবং চূড়ান্ত দায়িত্ব গবেষকের।
আগের ইউনিটে আমরা দেখেছি p-value কী আর কী নয়। এই ইউনিটে আমরা একটি অন্ধকার বিষয় দেখব, পদ্ধতিগত ফাঁদ যা পরিসংখ্যানগত অখণ্ডতাকে হুমকি দেয়। এগুলোর অধিকাংশই ইচ্ছাকৃত প্রতারণা নয়; এগুলি এমন ছলনাময় প্রক্রিয়া যা এমনকি সৎ উদ্দেশ্যপ্রণোদিত গবেষকরাও এটি উপলব্ধি না করেই পড়ে। এবং কৃত্রিম বুদ্ধিমত্তা (AI) এই সমস্যাগুলিকে সহজ এবং দ্রুত করে তোলে, কারণ এটি কয়েক সেকেন্ডে কয়েক ডজন বিশ্লেষণ চালানো সম্ভব করে। এই ইউনিটের লক্ষ্য হল সেই শৃঙ্খলা প্রতিষ্ঠা করা যা AI কে একটি "অর্থপূর্ণ ফলাফল ফাইন্ডিং মেশিন" থেকে একজন সৎ সহকারীতে রূপান্তরিত করবে।
মৌলিক ত্রুটি
p-hacking (p-value hunting): একটি উল্লেখযোগ্য ফলাফল (p <0.05) না পাওয়া পর্যন্ত এটি বিভিন্ন উপায়ে বিশ্লেষণের চেষ্টা করছে। ভেরিয়েবল যোগ করা এবং অপসারণ করা, সাবস্যাম্পল নির্বাচন করা, আউটলারের সংজ্ঞা পরিবর্তন করা, বিভিন্ন রূপান্তরের চেষ্টা করা, বিভিন্ন ফলাফলের ভেরিয়েবল ব্যবহার করা, ডেটা সংগ্রহ বন্ধ করা যখন এটি অর্থপূর্ণ হয়ে ওঠে... প্রতিটি প্রচেষ্টা একটি নতুন "সুযোগ" দেয়; আপনি যদি যথেষ্ট কঠোর পরিশ্রম করেন, তবে তাদের মধ্যে একটি অর্থবহ হয়ে উঠবে, এমনকি যদি এটি আসলে কোন প্রভাব না ফেলে। ফলাফল: মিথ্যা অনুসন্ধান যা প্রকাশিত হয়েছিল কিন্তু পুনরুত্পাদনযোগ্য নয়।
হার্কিং (ফলাফল জানার পরে অনুমান করা): ফলাফলগুলি দেখার পরে একটি অনুমান তৈরি করা এবং "আমি শুরু থেকেই এটির মতো ভবিষ্যদ্বাণী করেছি" হিসাবে উপস্থাপন করা। আপনি ডেটা দেখেন এবং সবচেয়ে আকর্ষণীয় সম্পর্ক খুঁজে পান, তারপর কাগজটি এমনভাবে লিখুন যেন এটি সেই অনুমান পরীক্ষা করার জন্য ডিজাইন করা হয়েছিল। এটি আবিষ্কারটিকে নিশ্চিত করার মতো মনে করে পাঠককে বিভ্রান্ত করে।
সিলেক্টিভ রিপোর্টিং (চেরি-পিকিং): কয়েক ডজন বিশ্লেষণ থেকে শুধুমাত্র "ভাল" রিপোর্ট করা এবং বাকিগুলোকে নীরবে কবর দেওয়া। এটি "ফাইল ড্রয়ার সমস্যা" নামেও পরিচিত: অর্থহীন ফলাফল ড্রয়ারে থেকে যায়, সাহিত্যকে পদ্ধতিগতভাবে পক্ষপাতদুষ্ট করে তোলে।
কাঁটা পথের বাগান: অ্যান্ড্রু গেলম্যানের পদ। এমনকি একটি ইচ্ছাকৃত পি-হ্যাকিং ছাড়াই, গবেষক ডেটার উপর ভিত্তি করে অনেক যুক্তিসঙ্গত পছন্দ করেন (কোন পরিবর্তনশীল, কোন থ্রেশহোল্ড, কোন উপগোষ্ঠী, কোন রূপান্তর)। স্বাধীনতার এই অনুসন্ধানী ডিগ্রীগুলি এত বেশি যে আপনি কার্যকরভাবে অনেকগুলি বিশ্লেষণ থেকে অর্থপূর্ণ একটি বেছে নিচ্ছেন-এমনকি কোনো খারাপ উদ্দেশ্য ছাড়াই। ফলাফল আবার একটি ক্রমবর্ধমান মিথ্যা ইতিবাচক হার.
সতর্কতা: এই ফাঁদের বেশিরভাগই ইচ্ছাকৃত কৌশল নয়। আপাতদৃষ্টিতে নির্দোষ পদক্ষেপের সমষ্টি যেমন "আমি আরও কয়েকটি মডেল চেষ্টা করেছি", "আমি যখন আউটলিয়ারটি সরিয়ে দিয়েছি তখন এটি পরিষ্কার ছিল", "এই উপগোষ্ঠীতে প্রভাবটি আরও পরিষ্কার" একটি মিথ্যা আবিষ্কার তৈরি করতে পারে। সততা পদ্ধতির বিষয়, উদ্দেশ্য নয়।
কেন AI এই ফাঁদগুলিকে বড় করে?
হাত দিয়ে 3টি মডেল চেষ্টা করতে সময় লাগে; YZ মিনিটে 50টি মডেল ভেরিয়েন্ট, 10টি ভিন্ন রূপান্তর, 8টি সাবগ্রুপ তৈরি করে। এই শক্তিটি একটি সৎ পরিকল্পনা ছাড়াই বিপর্যয়কর: "এই ডেটাতে একটি অর্থপূর্ণ সম্পর্ক খুঁজুন" বা "এই অনুমানকে সমর্থন করে এমন একটি মডেল তৈরি করুন" এর মতো একটি অনুরোধ এআইকে সরাসরি একটি পি-হ্যাকিং ইঞ্জিনে পরিণত করে। এআইও সহায়ক হতে চায়; একটি "অর্থপূর্ণ" ফলাফল খুঁজে পেতে থাকে যা আপনাকে সন্তুষ্ট করবে। এই কারণেই আপনার প্রম্পট ডিজাইনটি সততার প্রথম প্রতিরক্ষার লাইন।
প্রতিরক্ষা: ব্যবসার ন্যায্য কোর্স
1. প্রাক-নিবন্ধন: এর অর্থ বিশ্লেষণ করার আগে আপনার অনুমান, ভেরিয়েবল, মডেল এবং পরীক্ষাগুলি লিখিতভাবে রেকর্ড করা (সম্ভবত একটি সময়-স্ট্যাম্পড প্ল্যাটফর্মে)। এইভাবে, আবিষ্কার নিশ্চিতকরণ থেকে পৃথক করা হয়; আপনি যা কিছু পরিবর্তন করেন তা "অন্বেষণকারী" হিসাবে ট্যাগ করা হয়।
2. বিশ্লেষণ পরিকল্পনা: আপনি প্রাক-রেকর্ড করতে না পারলেও, ডেটাতে ডুব দেওয়ার আগে একটি বিশ্লেষণ পরিকল্পনা লিখুন: প্রাথমিক অনুমান, প্রাথমিক ফলাফল পরিবর্তনশীল, প্রধান মডেল। শুরু থেকেই "প্রধান বিশ্লেষণ" এবং "অতিরিক্ত/অন্বেষণমূলক বিশ্লেষণ" এর মধ্যে পার্থক্য স্থাপন করুন এবং প্রতিবেদনে এটি বজায় রাখুন।
3. সবকিছু রিপোর্ট করুন: আপনি চেষ্টা করেছেন মডেল লুকান না. "সংবেদনশীলতা বিশ্লেষণ" (দৃঢ়তা পরীক্ষা) বিভাগে, দেখান কিভাবে বিভিন্ন স্পেসিফিকেশন ফলাফল পরিবর্তন করে। অনুসন্ধানটি কেবল তখনই শক্তিশালী হয় যদি এটি অনেকগুলি যুক্তিযুক্ত পছন্দের অধীনে ধরে রাখে।
4. একাধিক তুলনা শৃঙ্খলা: আপনি যদি অনেকগুলি পরীক্ষা করে থাকেন তবে সেগুলি সংশোধন করুন (ইউনিট 6)। প্রশ্নের উত্তর দিন "আমি কতগুলি পরীক্ষা করেছি?" সৎভাবে
5. সংবেদনশীলতা বিশ্লেষণ: একটি ভিন্ন নমুনা, ভিন্ন নিয়ন্ত্রণ সেট, এবং ভিন্ন রূপান্তরের সাথে আপনার প্রধান অনুসন্ধানের পুনরাবৃত্তি করুন। ফলাফল পরিবর্তন হলে, এটি লুকাবেন না, এটি রিপোর্ট করুন।
তুলনা চার্ট: সৎ বনাম ফাঁদ
আবেদন
ফাঁদ আকৃতি
সৎ সমতুল্য
মডেল নির্বাচন
যতক্ষণ না এটি বোঝা যায় ততক্ষণ চেষ্টা করা (পি-হ্যাকিং)
পূর্ব পরিকল্পিত মাস্টার মডেল
অনুমান
সত্যের পরে ফিটিং (হার্কিং)
প্রাক-রেকর্ড করা, ডেটার আগে
রিপোর্টিং
শুধু সুন্দরগুলো দেখাবেন না
সমস্ত নির্দিষ্টকরণ + সংবেদনশীলতা
উপগোষ্ঠী
সবচেয়ে আকর্ষণীয় নির্বাচন
পূর্বনির্ধারিত, সংশোধনযোগ্য
তথ্য সংগ্রহ
যখন এটি বোধগম্য হয় তখন থামুন
পূর্বনির্ধারিত নমুনা
চারটি অনুলিপিযোগ্য প্রম্পট
1. সৎ দাবি কাঠামো:
আপনার ভূমিকা: সৎ পরিসংখ্যান সহকারী। আমার লক্ষ্য একটি অর্থপূর্ণ ফলাফল খুঁজে না, কিন্তু সঠিক ফলাফল খুঁজে. নিয়মাবলী:- আমাকে "মডেল চেষ্টা করে দেখুন না যতক্ষণ না এটি বোধগম্য হয়" টাইপ পরামর্শ দেবেন না, - আপনি যদি একাধিক স্পেসিফিকেশন সাজেস্ট করেন তবে আমাকে বলুন সেগুলিকে রিপোর্ট করতে হবে, - পি-হ্যাকিং হতে পারে এমন যেকোনো পদক্ষেপ সম্পর্কে আমাকে সতর্ক করুন৷ আমাকে প্রথমে আমার প্রধান মডেল স্পষ্ট করতে সাহায্য করুন, নিশ্চিতকরণ থেকে আলাদা আবিষ্কার।
2. বিশ্লেষণ পরিকল্পনা খসড়া:
একটি অধ্যয়নের জন্য একটি প্রাথমিক বিশ্লেষণ পরিকল্পনা তৈরি করতে আমাকে সাহায্য করুন: প্রাথমিক অনুমান, প্রাথমিক ফলাফল পরিবর্তনশীল, প্রধান মডেল স্পেসিফিকেশন, পূর্বনির্ধারিত উপগোষ্ঠী, একাধিক তুলনা কৌশল। পৃথক শিরোনামে "অন্বেষণমূলক" এবং "নিশ্চিত" বিশ্লেষণগুলি রাখুন। তথ্য না দেখেই এটি পূরণ করতে আমাকে মনে করিয়ে দিন।
3. সংবেদনশীলতা বিশ্লেষণ:
আমার প্রধান অনুসন্ধান হল সংবেদনশীলতা বিশ্লেষণ কোড (R) লেখার জন্য আমার লক্ষ্য হল ফলাফল কতটা কঠিন তা দেখা, সেরাটি বেছে নেওয়া নয়; সমস্ত ফলাফল দেখান।
4. স্ব-পর্যবেক্ষণ:
আমি আমার বিশ্লেষণ প্রক্রিয়া ব্যাখ্যা করব; আমাকে পি-হ্যাকিং/হার্কিং/সিলেক্টিভ রিপোর্টিং এর জন্য একটি চেকলিস্ট দিন এবং আমার কোন ধাপগুলো ঝুঁকিপূর্ণ তা চিহ্নিত করুন। আমাকে জিজ্ঞাসা করুন আমি কতগুলি মডেল/পরীক্ষা চেষ্টা করেছি এবং কোনটি আমি রিপোর্ট করার পরিকল্পনা করেছি৷
দুর্বল প্রম্পট / শক্তিশালী প্রম্পট
দুর্বল প্রম্পট:
কোন ভেরিয়েবলগুলি এই ডেটাতে উল্লেখযোগ্য সম্পর্ক দেখায়, সেরা মডেল খুঁজুন।
এই প্রম্পটটি একটি সরাসরি পি-হ্যাকিং নির্দেশনা: এআই কয়েক ডজন সংমিশ্রণ চেষ্টা করে এবং "সবচেয়ে বেশি অর্থবহ" উপস্থাপন করে। ফলাফলটি প্রায় নিশ্চিতভাবেই একটি মিথ্যা আবিষ্কার যা প্রতিলিপি করা যায় না।
শক্তিশালী প্রম্পট:
আপনার ভূমিকা: সৎ সহকারী। আমি যে প্রধান মডেলটি পূর্বনির্ধারিত করেছি তা হল: Y ~ X + নিয়ন্ত্রণ। এই মডেলের ভবিষ্যদ্বাণী করে এমন কোড লিখুন। অন্য "আরো অর্থবহ" মডেলের সন্ধান করবেন না। এছাড়াও একটি সংবেদনশীলতা বিশ্লেষণের পরামর্শ দিন যাতে আমি ফলাফলের দৃঢ়তা দেখতে পারি, কিন্তু জানি যে আমি সমস্ত ফলাফলের রিপোর্ট করব, সেরাটি বেছে নেব না। আমাকে 'নিশ্চিত' হিসাবে কোনো অনুসন্ধানমূলক ফলাফল লিখতে দেবেন না।
পার্থক্য: দৃঢ় ইচ্ছা প্রধান মডেল ঠিক করে, অনুসন্ধান নিষিদ্ধ করে, এবং সমস্ত ফলাফল রিপোর্ট করা প্রয়োজন।
তিনটি মিনি কেস
কেস 1 — সাবগ্রুপ হান্টিং। একজন গবেষক সামগ্রিক নমুনায় কোনো প্রভাব খুঁজে পাননি; তিনি এআইকে জিজ্ঞাসা করেছিলেন "কোন সাবগ্রুপে এটি উল্লেখযোগ্য?" YZ বয়স, লিঙ্গ এবং অঞ্চলের সংমিশ্রণ স্ক্যান করেছে এবং "35-44 বছর বয়সী শহুরে মহিলাদের মধ্যে p = 0.03" পাওয়া গেছে। নিবন্ধটি এই উপগোষ্ঠীর উপর ভিত্তি করে ছিল। তার প্রতিলিপি কোন প্রভাব খুঁজে পাওয়া যায় নি: এটি কয়েক ডজন উপগোষ্ঠীর সুযোগের ফলাফল ছিল। পাঠ: ডেটার পরে নির্বাচিত সাবগ্রুপ হার্কিং, নিশ্চিত নয়।
কেস 2 — রূপান্তর শিকার. যে সম্পর্ক ছাত্র পর্যায়ে অর্থহীন হয়ে ওঠে; এটি লগ, বর্গমূল, বর্গক্ষেত্র এবং ল্যাগ আকারে চেষ্টা করেছে; তিনি লগ-লগ ফর্মে p=0.048 খুঁজে পেয়েছিলেন এবং শুধুমাত্র এটিই রিপোর্ট করেছিলেন। ভাগ্যক্রমে, 5টি ফর্মের মধ্যে একটি থ্রেশহোল্ড অতিক্রম করেছে৷ সঠিক উপায়টি ছিল: তত্ত্বের সাথে ফর্মটি প্রাক-নির্বাচন করা এবং সংবেদনশীলতা টেবিলে সমস্ত ফর্মের ফলাফল দেখানো। পাঠ: নির্বাচনী প্রতিবেদন মিথ্যা তাৎপর্য তৈরি করে।
কেস 3 — কীভাবে সৎ ফ্রেমিং কাজ করে। বিশ্লেষণের আগে একটি দল পূর্ব-নিবন্ধিত: একক প্রাথমিক অনুমান, একক প্রধান মডেল, দুটি পূর্বনির্ধারিত উপগোষ্ঠী, বনফেরোনি সংশোধন। মূল প্রভাবটি উল্লেখযোগ্য ছিল না, তবে দলটি সততার সাথে এটি রিপোর্ট করেছে; অনুসন্ধানকারী ব্যক্তি একটি অনুসন্ধানকে "ভবিষ্যতে পরীক্ষা করা প্রয়োজন" হিসাবে চিহ্নিত করেছেন। গবেষণাটি পুনরুত্পাদনযোগ্য এবং নির্ভরযোগ্য ছিল। পাঠ: সৎ পরিকল্পনা এমনকি "ব্যর্থ" ফলাফলকেও সার্থক করে তোলে।
সাধারণ ভুল
- এআইকে "অর্থপূর্ণ ফলাফল খুঁজে বের করতে" বলা। এটি সরাসরি পি-হ্যাকিং; AI কে একটি সৎ ফ্রেমে রাখুন, নির্ভুলতার জন্য জিজ্ঞাসা করুন, ফলাফল নয়।
- নিশ্চিতকরণ হিসাবে আবিষ্কার উপস্থাপন (HARKing)। তথ্যের পরে প্রতিষ্ঠিত হাইপোথিসিসটিকে "প্রথম থেকেই আমি ভবিষ্যদ্বাণী করেছি" বলে লেখাটি বিভ্রান্তিকর; অনুসন্ধানমূলক অনুসন্ধান লেবেল করুন।
- শুধু ভাল ফলাফল রিপোর্ট. পরীক্ষিত সব স্পেসিফিকেশন দেখান; লুকানো অনুভূতি বিশ্লেষণ অখণ্ডতা আপস.
- উপগোষ্ঠী/রূপান্তর স্ক্রীনিং। কয়েক ডজন সাবগ্রুপ বা রূপান্তরগুলির মধ্যে সবচেয়ে উল্লেখযোগ্য বাছাই করা জালিয়াতি ফলাফল তৈরি করে; আগে থেকে চিহ্নিত করুন এবং ঠিক করুন।
- আপনি কত পরীক্ষা করেছেন ভুলে যাচ্ছেন। প্রচেষ্টার মোট সংখ্যা ট্র্যাক রাখুন; এই সংখ্যা না জেনে কোনো p-value সৎভাবে ব্যাখ্যা করা যায় না।
টিপ: একটি অনুসন্ধান লেখার আগে, নিজেকে জিজ্ঞাসা করুন: "আমি এই ফলাফলটি না পাওয়া পর্যন্ত আমি কত উপায়ে নীরবে চেষ্টা করেছি, এবং আমি কি সেগুলি সব রিপোর্ট করছি?" কিছু রচনা ড্রয়ারে থাকলে, আপনার প্রতিবেদনটি তার চেয়ে শক্তিশালী দেখায়।
সংক্ষেপে
পি-হ্যাকিং, হার্কিং, সিলেক্টিভ রিপোর্টিং এবং কাঁটাচামচ পথের বাগান; অনেকগুলি ফাঁদ যা অনিচ্ছাকৃতভাবে কাজ করে কিন্তু জাল, অপ্রজননযোগ্য ফলাফল তৈরি করে। AI এই অসুবিধাগুলিকে ত্বরান্বিত করে কারণ এটি তাত্ক্ষণিকভাবে কয়েক ডজন বিশ্লেষণ চেষ্টা করতে পারে; "অর্থপূর্ণ ফলাফল খুঁজুন" টাইপের অনুরোধ এআইকে একটি পি-হ্যাকিং ইঞ্জিনে পরিণত করে। প্রতিরক্ষা; একটি প্রাক-নিবন্ধন এবং বিশ্লেষণ পরিকল্পনার সাথে নিশ্চিতকরণ থেকে আবিষ্কারকে পৃথক করা, সমস্ত নির্দিষ্টকরণ এবং সংবেদনশীলতা বিশ্লেষণের প্রতিবেদন করা, একাধিক তুলনা সংশোধন করা এবং AI-কে একটি সৎ কাঠামোর মধ্যে রাখা যা "সঠিক ফলাফল" দাবি করে। চূড়ান্ত দায়িত্ব সবসময়ই গবেষকের।
আবেদন টাস্ক
একটি গবেষণা প্রশ্ন চয়ন করুন এবং ডেটা দেখার আগে একটি সংক্ষিপ্ত বিশ্লেষণ পরিকল্পনা লিখুন: প্রাথমিক অনুমান, প্রধান মডেল, প্রাথমিক ফলাফল পরিবর্তনশীল, পূর্বনির্ধারিত উপগোষ্ঠী, একাধিক তুলনা কৌশল। তারপর মূল মডেল অনুমান। তারপর একটি সংবেদনশীলতা বিশ্লেষণ করুন (বিভিন্ন নিয়ন্ত্রণ, আউটলিয়ার অন্তর্ভুক্ত/বাদ দেওয়া, বিভিন্ন ফাংশন ফর্ম) এবং একটি একক টেবিলে সমস্ত ফলাফল দেখান৷ একটি অনুচ্ছেদে, কোন পদক্ষেপগুলি পি-হ্যাকিংয়ের ঝুঁকি তৈরি করে এবং কীভাবে আপনার সৎ কাঠামো তাদের সীমাবদ্ধ করে তা মূল্যায়ন করুন।
চেকলিস্ট
- [ ] আমি ডেটাতে ডুব দেওয়ার আগে বিশ্লেষণ পরিকল্পনা/মাস্টার মডেল লিখেছিলাম।
- [ ] আমি আলাদাভাবে অনুসন্ধানমূলক এবং নিশ্চিত বিশ্লেষণের লেবেল দিয়েছি; আমি হার্কিং ছিল না.
- [ ] আমি চেষ্টা করেছি সব স্পেসিফিকেশন রিপোর্ট করেছি; আমি শুধু সুন্দরটা বেছে নিইনি।
- [ ] আমি আগে থেকেই সাবগ্রুপ এবং ট্রান্সফরমেশন সংজ্ঞায়িত করেছিলাম, আমি ডেটার পরে সেগুলি স্ক্যান করিনি।
- [ ] আমি কতগুলি পরীক্ষা চালিয়েছি তার ট্র্যাক রেখেছি এবং প্রয়োজনীয় সংশোধন প্রয়োগ করেছি৷
- [ ] আমি AI ব্যবহার করেছি "সত্য খুঁজুন" এর প্রেক্ষাপটে "এটিকে অর্থপূর্ণ খুঁজে" এর পরিবর্তে; দায়িত্ব নিলাম।