فائدہ:
- گمشدہ ڈیٹا کی اقسام (MCAR/MAR/MNAR)، آؤٹ لیرز، اور کوڈنگ کی غلطیوں کو پہچاننے کی صلاحیت اور کلین اپ کوڈ اور ڈائیگناسٹک تیار کرنے کے لیے درست ڈیٹا کے ساتھ AI کا استعمال
- یہ دیکھنے کی صلاحیت کہ کس طرح مصنوعی ذہانت کے ذریعہ تجویز کردہ ہر صفائی کا مرحلہ (حذف کرنا، تفویض، تبدیلی) تجزیہ کے نتائج کو متاثر کرے گا اور ایک الٹ اور دستاویزی ورک فلو قائم کرے گا۔
- اس بات کو برقرار رکھنا کہ صفائی کے فیصلے اس عمل کے علم پر مبنی ہوتے ہیں جو ڈیٹا تیار کرتا ہے، اور یہ کہ مصنوعی ذہانت ایک زیر نگرانی معاون ہے، نابینا آٹومیٹن نہیں۔
ہر تجربہ کار تجزیہ کار ایک سچائی جانتا ہے: تجرباتی منصوبے کا زیادہ تر وقت ماڈلنگ نہیں ہوتا، بلکہ ڈیٹا کی صفائی (ڈیٹا میں غلطیوں، کوتاہیوں اور عدم مطابقتوں کو درست کرنے اور اسے تجزیہ کے لیے تیار کرنے کا کام)۔ انگوٹھے کے کسی نہ کسی اصول کے طور پر، تقریباً 70-80% وقت ڈیٹا کو سمجھنے، صاف کرنے اور تبدیل کرنے میں گزرتا ہے۔ اصل تجزیہ کے لیے صرف 20-30% باقی ہے۔ اس یونٹ میں، ہم قدم بہ قدم دیکھیں گے کہ مصنوعی ذہانت (AI) کس طرح اس بھاری بوجھ کو کم کرتی ہے، لیکن کون سے فیصلے پھر بھی آپ کے پاس رہنے چاہئیں اور کیوں۔
آئیے پہلے دو بنیادی حقائق رکھتے ہیں۔ سب سے پہلے، صفائی کے فیصلے اس عمل کے بارے میں آپ کے علم پر مبنی ہوتے ہیں جو ڈیٹا تیار کرتا ہے: صرف آپ جانتے ہیں کہ کوئی قدر کیوں غائب ہے، کیوں کوئی تعداد بہت زیادہ ہے۔ AI ڈیٹا نہیں دیکھتا، سیاق و سباق کو نہیں جانتا؛ کوڈ لکھتا ہے، فیصلے نہیں کرتا۔ دوسرا، ہر صفائی کا مرحلہ تجزیہ کا نتیجہ بدل سکتا ہے۔ آؤٹ لیئر کو حذف کرنے سے گتانک الٹ سکتا ہے۔ لاپتہ کو وسط کے ساتھ بھرنا مصنوعی طور پر فرق کو کم کر سکتا ہے۔ لہذا صفائی کو الٹ اور دستاویزی ہونا چاہئے: خام ڈیٹا کو کبھی بھی ہاتھ نہ لگائیں، ہر قدم کوڈ میں کریں، ہر قدم کے اثرات کو ریکارڈ کریں۔
مرحلہ وار صفائی کا ورک فلو
1. ڈیٹا جانیں۔ پہلے ڈھانچہ دیکھیں: قطاروں کی تعداد (مشاہدات) اور کالم (متغیرات)، ہر متغیر کی قسم (عددی، درجہ بندی، تاریخ)، خلاصہ کے اعداد و شمار، لاپتہ کی تعداد۔ آپ AI سے اس "ڈیٹا پروفائل" کوڈ کے لیے پوچھ سکتے ہیں۔ لیکن آپ آؤٹ پٹ پڑھتے ہیں اور سوالات پوچھتے ہیں جیسے "یہ متغیر متن کے طور پر کیوں آیا؟"
2. گمشدہ ڈیٹا کو سمجھیں اور درجہ بندی کریں۔ گمشدہ ڈیٹا کو تین اقسام میں تقسیم کیا گیا ہے۔ MCAR (رینڈم میں مکمل طور پر غائب): لاپتہ کسی بھی چیز کی وجہ سے نہیں ہے، مثال کے طور پر ایک سینسر تصادفی طور پر ناکام ہو گیا ہے۔ MAR (رینڈم پر غائب): لاپتہ ہونے کا انحصار دوسرے مشاہدہ شدہ متغیرات پر ہوتا ہے، مثال کے طور پر بوڑھے لوگ ایک سوال کو زیادہ کثرت سے خالی چھوڑ دیتے ہیں، لیکن آپ عمر جانتے ہیں۔ MNAR (لاپتہ نہیں بے ترتیب): لاپتہ ہونا خود غیر مشاہدہ شدہ قدر پر منحصر ہے، مثال کے طور پر زیادہ کمانے والے اپنی آمدنی کی اطلاع نہیں دیتے ہیں۔ یہ فرق اہم ہے کیونکہ یہ حل کے طریقہ کار کا تعین کرتا ہے اور AI آپ کے لیے اس کا فیصلہ نہیں کر سکتا۔
3. کمی سے نمٹنا۔ اختیارات: فہرست کے لحاظ سے حذف کرنا، وسط/میڈین امپیوٹیشن، ماڈل پر مبنی ایک سے زیادہ نقائص۔ MCAR میں حذف کرنا نسبتاً محفوظ ہے لیکن نمونے کا سائز کم کر دیتا ہے۔ ایک سے زیادہ اسائنمنٹ MAR میں زیادہ مناسب ہے۔ کوئی آسان طریقہ MNAR میں غیر جانبداری کی ضمانت نہیں دیتا۔ کمی کے طریقہ کار کو ماڈل بنایا جانا چاہیے یا کم از کم ایک حساسیت کا تجزیہ کیا جانا چاہیے۔ مطلب بھرنا آسان لیکن خطرناک ہے: یہ فرق کو کم کرتا ہے، تعلقات کو کمزور کرتا ہے، اور غیر یقینی کو چھپاتا ہے۔
4. باہر جانے والوں کی جانچ کریں۔ آؤٹ لیئر ایک ایسا مشاہدہ ہے جو دوسروں سے بہت دور کھڑا ہوتا ہے۔ دو سوالوں کو الگ کریں: کیا یہ ایک غلطی ہے (ڈیٹا انٹری میں عمر 999 لکھی گئی تھی) یا یہ ایک حقیقی لیکن زیادہ قیمت ہے (ایک ارب پتی کی آمدنی)؟ کیڑے درست کریں؛ حقیقی آؤٹ لیرز کو حذف نہ کریں کیونکہ وہ ڈیٹا کی نمائندگی کرتے ہیں۔ آؤٹ لیئر کو حذف کرنا "کیونکہ یہ پریشان کرتا ہے" آپ ڈیٹا کو نتائج کی طرف متوجہ کر رہے ہیں۔
5. کوڈنگ اور مستقل مزاجی۔ زمرہ جات کو معیاری بنائیں ("مرد"، "مرد"، "E" سبھی کو ایک کوڈ میں)، تاریخوں کو ایک فارمیٹ میں، اکائیوں کو ایک پیمانے میں، نقلی قطاروں کا پتہ لگائیں۔ یہ سب سے کم خطرناک مرحلہ ہے جہاں AI بہترین مدد کرتا ہے۔
6. دستاویز اور منجمد کریں۔ خام اور صاف ڈیٹا کو الگ رکھتے ہوئے ہر قدم کو کوڈ اور کمنٹ لائن کے ساتھ ریکارڈ کریں۔ تو جب ایک ریفری پوچھتا ہے کہ "یہ مشاہدات کیوں چھوڑے گئے؟" آپ کا جواب تیار ہے۔
احتیاط: نتائج کی بنیاد پر صفائی کے فیصلے نہ کریں۔ ایک لائن کو حذف کرنا کہ "جب آپ اس لائن کو حذف کرتے ہیں، تو قابلیت اہم ہو جاتا ہے" پی-ہیکنگ کی سب سے کپٹی شکل ہے، جسے ہم اگلی اکائی میں دیکھیں گے۔
موازنہ کی میز: ڈیٹا کے طریقے غائب ہیں۔
طریقہ
یہ کب مناسب ہے؟
خطرہ
AI کا کردار
ایک قطار کو حذف کریں۔
MCAR، کم گمشدہ شرح
نمونہ چھوٹا ہو جاتا ہے، MAR/MNAR میں تعصب
کوڈ لکھتا ہے؛ آپ فیصلہ کریں۔
اوسط/میڈین تفویض
فوری ابتدائی تجزیہ
فرق کو کم کرتا ہے، تعلق کو چھپاتا ہے۔
یہ آسان ہے لیکن اس کی سفارش نہیں کرتا ہے۔ خبردار کرنا چاہئے
متعدد تفویض (MI)
MAR، اہم متغیرات
اگر صحیح طریقے سے انسٹال نہیں کیا گیا تو یہ گمراہ کن ہوگا۔
تجویز کردہ کوڈ اور پیکیج (چوہے)
میکانزم ماڈلنگ
MNAR
پیچیدہ، مفروضہ پر مبنی
صرف مسودہ؛ ماہر کی ضرورت ہے
چار کاپی کرنے کے قابل اشارے
1. ڈیٹا پروفائلنگ:
آپ کا کردار: ڈیٹا صاف کرنے والا معاون۔ میں ڈیٹا شیئر نہیں کرتا، مجھے آر کوڈ چاہیے۔ میرے پاس ڈیٹا فریم ہے جسے 'ڈیجٹ' کہتے ہیں۔ متغیرات: id، عمر (عددی)، آمدنی (عددی)، تعلیم (درمیانی)، علاقہ (درجہ)، تاریخ (تاریخ)۔ ٹاسک: کوڈ لکھیں جو ہر متغیر کے لیے قسم، گمشدہ نمبر اور شرح پیدا کرتا ہے، عددی اعداد و شمار کے خلاصے، اور درجہ بندی کے لیے تعدد جدول۔ تبصرہ لائن شامل کریں۔
2. گمشدہ ڈیٹا کی تشخیص:
کوڈ لکھیں جو اوپر کے 'ڈیجٹ' ڈیٹا کے لیے گمشدہ پیٹرن کی جانچ کرتا ہے: - ہر متغیر کی گمشدہ شرح، - ایک سادہ ٹیبل/گراف دیگر متغیرات سے لاپتہ ہونے کا تعلق ظاہر کرتا ہے۔ میں کوڈ کے آؤٹ پٹ کو دیکھوں گا اور MCAR/MAR/MNAR میں فرق کروں گا۔ آپ صرف تشخیصی آلہ تیار کرتے ہیں، تفویض کے طریقہ کار پر فیصلہ نہ کریں۔
3. بیرونی معائنہ (حذف نہیں):
متغیر 'آمدنی' کے لیے کوڈ لکھیں جو بغیر حذف کیے آؤٹ لیرز کی جانچ کرتا ہے: باکس پلاٹ، IQR پر مبنی حدود، اور جدول کی فہرست آؤٹ لیئر مشاہدات + اقدار۔ میں دیکھوں گا کہ یہ غلطیاں ہیں یا حقیقی۔ خودکار حذف شامل کریں۔
4. کوڈنگ معیاری کاری:
'تعلیم' متغیر میں، اقدار کو ملا کر لکھا جاتا ہے: "پرائمری اسکول","پرائمری اسکول"،"پرائمری"،"ہائی اسکول"،"ہائی اسکول"،"یونیورسٹی"،"یونیو"۔ R کوڈ لکھیں جو ان کو مستقل زمروں میں دوبارہ کوڈ کرتا ہے۔ نقشہ سازی کی میز کو واضح طور پر دکھائیں تاکہ میں ہر تبدیلی کی تصدیق کر سکوں۔ جس قدر کو آپ نہیں پہچانتے اسے "UNKNOWN" پر سیٹ کریں۔
کمزور فوری / مضبوط اشارہ
کمزور اشارہ:
ڈیٹا کو صاف کریں، خالی جگہوں کو پُر کریں، آؤٹ لیرز کو ضائع کریں۔
یہ مطالبہ خطرناک ہے: یہ AI کو اندھا اختیار دیتا ہے۔ کس قسم کی گمشدگی، کیسی فلنگ، کون سی متضاد سچائی - اس میں سے کچھ بھی واضح نہیں ہے۔ نتیجہ خفیہ طور پر متعصب ڈیٹا سیٹ ہو سکتا ہے۔
طاقتور اشارہ:
آپ کا کردار: صفائی کا معاون، آپ فیصلہ ساز نہیں ہیں۔ قدم بہ قدم آگے بڑھیں اور کوڈ لکھیں جو ہر مرحلے کے اثرات کی اطلاع دیتا ہے: 1) گمشدہ پیٹرن دکھائیں (ڈیلیٹ نہ کریں/پُر کریں)، 2) آؤٹ لیئر امیدواروں کی فہرست (ڈیلیٹ نہ کریں)، 3) میپنگ ٹیبل کے ساتھ زمرہ کی تضادات کو ٹھیک کریں۔ ہر قدم کے بعد قطار کی گنتی اور خلاصہ کے اعدادوشمار پرنٹ کریں تاکہ میں تبدیلی کو دیکھ اور تصدیق کر سکوں۔ خودکار تفویض/حذف کرنے کا اندراج۔
فرق واضح ہے: مضبوط مرضی AI کو ایک زیر نگرانی اسسٹنٹ کے طور پر رکھتی ہے، الٹ اور دستاویزی اقدامات تیار کرتی ہے۔
تین چھوٹے مقدمات
کیس 1 - اوسط اسائنمنٹ ٹریپ۔ ایک تجزیہ کار کے 5,000 لوگوں کی آمدنی کا ڈیٹا 18% غائب تھا۔ اس نے AI سے کہا کہ "خالی جگہوں کو پُر کریں"۔ AI نے ان سب کو اوسط کیا۔ نتیجہ: آمدنی کے فرق میں 22% کمی واقع ہوئی، اور تعلیم اور آمدنی کے رشتے کا گتانک اس سے کمزور نکلا۔ درست طریقہ: کمی MAR (تعلیم کی وجہ سے) تھی، اسے متعدد اسائنمنٹ (چوہوں) سے پُر کرنا پڑا۔ سبق: بھرنے کا طریقہ طریقہ کار پر منحصر ہے۔
کیس 2 - باہر کی صفائی تلاش کو پلٹ دیتی ہے۔ ایک فرم کے اعداد و شمار میں 3 بہت بڑی فرمیں (کل مشاہدے کا 0.6%) تھیں۔ یہ AI کی "صفائی" تجویز کے ذریعہ حذف کردیئے گئے تھے۔ پیمانے کے گتانک کی معیشتیں مثبت سے منفی میں بدل گئیں۔ تاہم، وہ 3 کمپنیاں حقیقی اور صنعت کا ایک اہم حصہ تھیں۔ درست طریقہ یہ تھا کہ حذف کرنے کے بجائے پورے اور مضبوط اندازے کے ساتھ رپورٹ کی جائے۔ سبق: اصلی آؤٹ لیرز ڈیٹا ہوتے ہیں، شور نہیں۔
کیس 3 - خاموش کوڈنگ کی غلطی۔ ایک پینل میں، تاریخ کا متغیر دو مختلف فارمیٹس میں آیا ("2020-03-01" اور "01/03/2020")۔ جب AI کی طرف سے تیار کردہ مجموعہ کوڈ نے انہیں مختلف اقدار کے لیے غلط سمجھا تو 1,400 مشاہدات مماثل نہیں ہوئے اور شرح نمو مضحکہ خیز بن گئی۔ اس سے کوئی فرق نہیں پڑے گا اگر تجزیہ کار قطار کی گنتی کو چیک نہیں کرتا ہے۔ سبق: ہر قدم کے بعد مشاہدے کی گنتی اور عقل کی جانچ ضروری ہے۔
عام غلطیاں
- آنکھ بند کرکے اوسط سے خلا کو پُر کرنا۔ یہ تغیر کو کم کرتا ہے، غیر یقینی کو چھپاتا ہے، اور MAR/MNAR میں تعصب پیدا کرتا ہے۔ پہلے میکانزم کی درجہ بندی کریں۔
- آؤٹ لیئر کو حذف کرنا "کیونکہ یہ پریشان کرتا ہے"۔ حقیقی آؤٹ لیرز ڈیٹا کی نمائندگی کرتے ہیں۔ حذف کرنا نتیجہ کو موڑ رہا ہے۔ جو غلط ہے اسے درست کریں، جو اصلی ہے اسے برقرار رکھیں۔
- خام ڈیٹا کو ٹیپ کرنا۔ کبھی بھی خام ڈیٹا میں ترمیم نہ کریں؛ کوڈ کے ساتھ تمام صفائی ایک علیحدہ کاپی میں کریں تاکہ اسے واپس کیا جا سکے۔
- اقدامات کے اثرات کی پیمائش نہیں کرنا۔ اگر ہر قدم کے بعد قطار کی گنتی اور خلاصہ کے اعدادوشمار کی جانچ نہیں کی جاتی ہے تو خاموش غلطیاں جمع ہو جائیں گی۔
- اس کے نتیجے میں صفائی۔ "جب آپ اس لائن کو شامل کرتے ہیں تو نتیجہ بہتر ہو جاتا ہے" کی منطق پی ہیکنگ ہے۔ تجزیہ کے نتائج سے پہلے اور آزادانہ طور پر صفائی کی منصوبہ بندی کی جانی چاہیے۔
مشورہ: ایک "پہلے/بعد" جدول رکھیں جو صفائی سے پہلے اور بعد میں ایک جیسے بنیادی اعدادوشمار (مطلب، اوسط، مشاہدات کی تعداد، چند ارتباط) کو ساتھ ساتھ رکھے۔ ایک غیر متوقع چھلانگ ایک چھپی ہوئی غلطی کا سب سے بہترین نشان ہے.
خلاصہ میں
ڈیٹا کی صفائی تجرباتی کام کا سب سے زیادہ وقت طلب اور فیصلہ کرنے والا مرحلہ ہے۔ AI اس میں ایک طاقتور کوڈ جنریٹر ہے، لیکن یہ شاٹس کو کال نہیں کر سکتا: آپ گمشدہ ڈیٹا کی قسم (MCAR/MAR/MNAR) کی درجہ بندی کرتے ہیں، اس بات کا تعین کرتے ہیں کہ آؤٹ لیئر ایک غلطی ہے یا اصلی، ہر قدم کو الٹ اور دستاویزی رکھیں۔ AI بلائنڈ کو "واضح" اختیار دینے کے بجائے، قدم بہ قدم ورک فلو قائم کریں جس کے اثرات کی پیمائش اور توثیق کی جائے۔ ہر قدم کے بعد مشاہدات اور خلاصہ کے اعدادوشمار کی تعداد کو چیک کرنا خاموش غلطیوں کا بہترین تریاق ہے۔
درخواست کا کام
کم از کم دو متغیرات کو منتخب کریں جن میں ڈیٹا سیٹ (آپ کا اپنا ڈیٹا یا نمونہ سیٹ) میں غائب اور آؤٹ لیرز شامل ہوں۔ AI سے ایک تشخیصی کوڈ کی درخواست کریں "مرحلہ بہ قدم، نہ حذف/پُر کریں" پرامپٹ کے ذریعے اور اسے چلائیں۔ کمی کو MCAR/MAR/MNAR کے طور پر درجہ بندی کریں اور اپنے جواز کو ایک جملے میں لکھیں۔ ایک ایک کر کے متضاد امیدواروں کا جائزہ لیں اور فیصلہ کریں کہ کون سا غلط ہے اور کون سا حقیقی۔ آخر میں، صفائی سے پہلے/بعد میں "پہلے کے بعد" جدول بنائیں اور اگر کوئی غیر متوقع تبدیلیاں ہوں تو رپورٹ کریں۔
چیک لسٹ
- میں نے خام ڈیٹا کو تبدیل کیے بغیر ایک علیحدہ کاپی میں صاف کیا۔
- میں نے کمی کو MCAR/MAR/MNAR کے طور پر درجہ بندی کیا اور اس کے مطابق طریقہ منتخب کیا۔
- میں نے ایک ایک کر کے باہر والوں کا جائزہ لیا کہ آیا وہ غلط تھے یا حقیقی۔ میں نے آنکھیں بند کرکے اسے حذف نہیں کیا۔
- میں نے صفائی کے ہر قدم کے بعد مشاہدات کی تعداد اور خلاصہ کے اعدادوشمار کو چیک کیا۔
- [ ] میں نے تمام مراحل کو کوڈ اور ایک تبصرہ لائن کے ساتھ دستاویز کیا ہے۔ الٹنے والا
- میں نے صفائی کو اس عمل کے علم پر مبنی بنایا جو ڈیٹا تیار کرتا ہے، تجزیہ کے نتائج پر نہیں۔