লাভ:
- তথ্য (ঐতিহাসিক, প্রতিনিধিত্বমূলক, পরিমাপ, একত্রীকরণ) এবং উপগোষ্ঠীর ভিত্তিতে মডেলের মূল্যায়ন করে পক্ষপাতিত্ব আসে তা বোঝার মাধ্যমে লুকানো বৈষম্য সনাক্ত করার ক্ষমতা
- একটি মডেল কার্ডের সাথে উচ্চ-প্রভাবিত সিদ্ধান্তে ব্যাখ্যাযোগ্যতা, মানব তদারকি এবং জবাবদিহিতা এবং নথির স্বচ্ছতা প্রদানের ক্ষমতা
- ক্ষুদ্রতম পর্যাপ্ত মডেল, প্রম্পট শর্টনিং, ক্যাশে এবং ব্যাচের সাথে গুণমানের সাথে আপস না করে আর্থিক এবং পরিবেশগত খরচ পরিচালনা করার ক্ষমতা
একটি মডেল প্রযুক্তিগতভাবে নিখুঁতভাবে কাজ করতে পারে কিন্তু তবুও ভুল হতে পারে - যদি এটি কিছু লোকের জন্য অন্যায্য হয়, ব্যাখ্যা করা যায় না, বা টেকসই খরচ তৈরি করে। এই ইউনিটে, আমরা ML ইঞ্জিনিয়ারিংয়ের তিনটি "অদৃশ্য" কিন্তু সিদ্ধান্তমূলক মাত্রা কভার করি: পক্ষপাত এবং ন্যায্যতা, নীতিশাস্ত্র এবং স্বচ্ছতা, খরচ এবং স্থায়িত্ব। এগুলি পরে যোগ করা অলঙ্কার নয়, তবে প্রকৌশল মানের অবিচ্ছেদ্য অংশ।
কুসংস্কার কোথা থেকে আসে?
মডেলের পক্ষপাতিত্ব (নির্দিষ্ট কিছু গোষ্ঠীর ভিন্ন/অন্যায়ভাবে মডেলের পদ্ধতিগত আচরণ) সাধারণত ডেটা থেকে আসে, মডেল নয়। সূত্র:
- ঐতিহাসিক পক্ষপাত: ডেটা অতীতের অবিচার প্রতিফলিত করে। যদি অতীতে একটি নির্দিষ্ট গোষ্ঠীকে কম ক্রেডিট দেওয়া হয়, তবে সেই ডেটার উপর প্রশিক্ষিত মডেল এই বৈষম্য শিখবে এবং স্থায়ী করবে।
- প্রতিনিধিত্বের পক্ষপাত: কিছু গোষ্ঠীকে উপাত্তে উপস্থাপিত করা হয় না; মডেলটি তাদের জন্য খারাপভাবে কাজ করে (যেমন একটি ছোট নমুনা জনসংখ্যায় কম নির্ভুলতা)।
- পরিমাপের পক্ষপাত: লেবেলগুলি নিজেরাই পক্ষপাতদুষ্ট (যেমন, যদি একজন "ভাল কর্মচারী" এর সংজ্ঞা অতীতের পদোন্নতির সিদ্ধান্তের উপর ভিত্তি করে হয়)।
- সমষ্টিগত পক্ষপাত: যেহেতু ডেটা একটি নির্দিষ্ট চ্যানেল থেকে আসে, তাই এটি মহাবিশ্বের প্রতিনিধি নয়।
মডেল শুধু এই পক্ষপাত শিখে না; এটা স্বয়ংক্রিয় দ্বারা স্কেল আপ. একজন ব্যক্তির পক্ষপাতমূলক সিদ্ধান্ত অন্য ব্যক্তিকে প্রভাবিত করে; এক পক্ষপাতদুষ্ট মডেলের রায় লাখ লাখ।
সতর্কতা: "মডেলটি নিরপেক্ষ কারণ এটি কেবল গণিত" বলার ভুলের মধ্যে পড়বেন না। মডেলটি শেখে এবং ডেটাতে মানুষের পক্ষপাত স্বয়ংক্রিয় করে। নিরপেক্ষতা একটি ডিফল্ট নয়, কিন্তু একটি ফলাফল যা পরিমাপ এবং নিশ্চিত করা আবশ্যক।
ন্যায়বিচার পরিমাপ
ন্যায়বিচার পরিচালনা করার জন্য, এটি প্রথমে পরিমাপ করা প্রয়োজন। এটি করার জন্য, একটি উপগোষ্ঠীর ভিত্তিতে মডেলটি মূল্যায়ন করুন: নির্ভুলতা, প্রত্যাহার, মিথ্যা ইতিবাচক হারের মতো মেট্রিকগুলি কি বিভিন্ন জনসংখ্যার গোষ্ঠীতে সমান? ন্যায়বিচারের কয়েকটি ধারণা:
- গোষ্ঠী ন্যায্যতা: মডেলটি কি একই হারে বিভিন্ন গোষ্ঠীকে সঠিক/ভুলভাবে আচরণ করে?
- সুযোগের সমতা: মডেলটি কি সত্যিকারের ইতিবাচকগুলোকে সমানভাবে সমস্ত গোষ্ঠীতে (সমান প্রত্যাহার) ক্যাপচার করে?
গুরুত্বপূর্ণ তথ্য: ন্যায়বিচারের বিভিন্ন সংজ্ঞা একই সময়ে সন্তুষ্ট নাও হতে পারে (এটি একটি গাণিতিক ফলাফল)। এই প্রেক্ষাপটে ন্যায়বিচারের কোন সংজ্ঞাকে অগ্রাধিকার দেওয়া হয় তা একটি নৈতিক এবং ব্যবসায়িক সিদ্ধান্ত, প্রযুক্তিগত নয় এবং স্টেকহোল্ডারদের সাথে একত্রে করা হয়।
দুর্বল পন্থা / শক্তিশালী পন্থা
দরিদ্র: "মডেলের সামগ্রিক নির্ভুলতা 88%, যা ন্যায্য।"
Güçlü: "সামগ্রিক নির্ভুলতা ছিল 88%, কিন্তু যখন আমরা এটিকে সাবগ্রুপে বিভক্ত করি, তখন প্রত্যাহার একটি গ্রুপে 91% এবং অন্য গ্রুপে 67% ছিল — মডেলটি পদ্ধতিগতভাবে সেই গোষ্ঠীটি অনুপস্থিত ছিল। আমরা কারণটি নথিভুক্ত করেছি (প্রতিনিধিত্বের অভাব), সেই গোষ্ঠীর জন্য ডেটা সংগ্রহ করেছি এবং পুনরায় মূল্যায়ন করেছি। আমরা ঠিক করেছি যে লক্ষ্যের সংজ্ঞাটি আমরা ন্যায্যতার সাথে বিবেচনা করব। অগ্রাধিকার দিন।"
পার্থক্য: শক্তিশালী পন্থা সাধারণ মেট্রিকের পিছনে লুকিয়ে থাকে না, এটি উপগোষ্ঠীগুলিকে আলাদা করে এবং ন্যায্যতাকে একটি খোলা সিদ্ধান্ত হিসাবে বিবেচনা করে।
নৈতিকতা এবং স্বচ্ছতা
দায়ী AI এর মূল নীতিগুলি হল:
- ব্যাখ্যাযোগ্যতা: মডেলটি কেন এই সিদ্ধান্ত নিয়েছে তা ব্যাখ্যা করা যেতে পারে? উচ্চ-প্রভাবিত সিদ্ধান্তগুলিতে (ক্রেডিট, নিয়োগ, স্বাস্থ্যসেবা) একজনের একটি ব্যাখ্যা পাওয়ার অধিকার রয়েছে। অব্যক্ত মডেল এই এলাকায় ব্যবহার করা উচিত নয় বা একটি ব্যাখ্যাযোগ্য পদ্ধতি দ্বারা সমর্থিত করা উচিত.
- মানুষের তত্ত্বাবধান: উচ্চ-প্রভাবিত সিদ্ধান্তগুলি স্বয়ংক্রিয়ভাবে নেওয়া উচিত নয়; মডেল প্রস্তাব, মানুষ নিশ্চিত.
- জবাবদিহিতা: মডেলটি ভুল করলে কে দায়ী তা পরিষ্কার হওয়া উচিত। "মডেল সিদ্ধান্ত নিয়েছে" একটি অজুহাত নয়.
- স্বচ্ছতা: ব্যবহারকারীর জানা উচিত যে তারা একটি AI এর সাথে ইন্টারঅ্যাক্ট করছে এবং কীভাবে তাদের ডেটা ব্যবহার করা হয়।
অনেক দেশ এবং সেক্টরে, এই নীতিগুলি আইনে (স্বচ্ছতা, নিরীক্ষা এবং উচ্চ-ঝুঁকির AI সিস্টেমের জন্য মানব তদারকি বাধ্যবাধকতা) এম্বেড করা হয়েছে। প্রকৌশলী তার ক্ষেত্রের নিয়মকানুন জানার জন্য দায়ী।
টিপ: প্রতিটি উচ্চ-প্রভাবিত মডেলের জন্য একটি "মডেল কার্ড" রাখুন: মডেলটি কী করে, কোন ডেটাতে এটি প্রশিক্ষিত হয়েছিল, কোন গোষ্ঠীতে এটি কতটা ভাল/খারাপভাবে কাজ করে, এর পরিচিত সীমাগুলি কী। এই নথিটি স্বচ্ছতা এবং জবাবদিহিতার হাতিয়ার।
খরচ এবং স্থায়িত্ব
AI সস্তা নয়। খরচ দুটি মাত্রায় পরিচালিত হয়:
আর্থিক খরচ:
- টোকেন খরচ (LLM): প্রতিটি অনুরোধ এবং প্রতিক্রিয়া টোকেন খরচ; আয়তন বাড়ার সাথে সাথে বিল বাড়তে থাকে। অপ্রয়োজনীয়ভাবে দীর্ঘ প্রম্পট, অত্যধিক বড় মডেল নির্বাচন এবং অনিয়ন্ত্রিত এজেন্ট লুপ (ইউনিট 5) খরচ বৃদ্ধি করে।
- প্রশিক্ষণ এবং হোস্টিং: ফাইন-টিউনিং এবং মডেল উপস্থাপনা হার্ডওয়্যার খরচ বহন করে।
- অপ্টিমাইজেশান: একটি ছোট মডেল যথেষ্ট হলে একটি বড় মডেল ব্যবহার করবেন না; ক্যাশে প্রায়শই জিজ্ঞাসিত প্রশ্ন; প্রম্পট ছোট করুন; ব্যাচ কি প্রক্রিয়া করা যেতে পারে.
পরিবেশগত খরচ: বড় মডেল প্রশিক্ষণ এবং অনুমান উল্লেখযোগ্য শক্তি খরচ করে। স্থায়িত্ব অপ্রয়োজনীয় গণনা (সঠিক আকারের মডেল, দক্ষ আর্কিটেকচার) এড়ানো একটি পেশাদার দায়িত্ব করে তোলে।
টিপ: খরচ অপ্টিমাইজেশানের প্রথম নিয়ম: "এই কাজের জন্য সবচেয়ে ছোট পর্যাপ্ত মডেল কি?" সর্বত্র সবচেয়ে শক্তিশালী মডেল স্থাপন করা একটি স্লেজহ্যামার দিয়ে পেরেক মারার মতো - ব্যয়বহুল এবং অপ্রয়োজনীয়।
তিনটি মিনি কেস
কেস 1 - গোপন বৈষম্য। একটি নিয়োগ স্ক্রীনিং মডেল সামগ্রিকভাবে ভাল লাগছিল। সাবগ্রুপ বিশ্লেষণে দেখা গেছে যে মডেলটি পদ্ধতিগতভাবে মহিলা প্রার্থীদের আন্ডারস্কোর করেছে কারণ ঐতিহাসিক তথ্য পুরুষ-প্রধান ছিল-এটি ঐতিহাসিক পক্ষপাত শিখেছে। মডেলটি বন্ধ করা হয়েছে, ডেটা ভারসাম্যপূর্ণ এবং ন্যায্যতা মেট্রিক্স পর্যবেক্ষণ করা হয়েছে। সাধারণ ধার্মিকতা গোপন বৈষম্যকে ঢেকে রাখে।
কেস 2 - ব্যাখ্যাতীত প্রত্যাখ্যান। একটি ক্রেডিট মডেল আবেদন প্রত্যাখ্যান করছিল, কিন্তু কেউ ব্যাখ্যা করতে পারেনি কেন। যখন একজন গ্রাহক আইনি ব্যাখ্যার অনুরোধ করেছিলেন, তখন দলটি সাড়া দিতে পারেনি। একটি ব্যাখ্যাযোগ্য পদ্ধতি যুক্ত না হওয়া পর্যন্ত এবং প্রতিটি প্রত্যাখ্যানের জন্য ন্যায্যতা তৈরি না হওয়া পর্যন্ত মডেলটিকে উচ্চ-প্রভাবিত সিদ্ধান্তগুলিতে ব্যবহার থেকে প্রত্যাহার করা হয়েছিল। পাঠ: উচ্চ-প্রভাবিত সিদ্ধান্ত গ্রহণের ক্ষেত্রে ব্যাখ্যাযোগ্যতা অপরিহার্য।
কেস 3 - বিল শক। একটি দল প্রতিটি অনুরোধের জন্য বৃহত্তম LLM এবং খুব দীর্ঘ প্রম্পট ব্যবহার করছিল। মাসিক বিল অপ্রত্যাশিতভাবে বেড়েছে। বিশ্লেষণের পরে: বেশিরভাগ অনুরোধ একটি ছোট মডেল দিয়ে সমাধান করা যেতে পারে, অর্ধেক প্রম্পট অপ্রয়োজনীয় ছিল এবং ঘন ঘন প্রশ্নগুলি ক্যাশে করা যেতে পারে। এই তিনটি অপ্টিমাইজেশন গুণমানের সাথে আপস না করেই খরচকে উল্লেখযোগ্যভাবে হ্রাস করেছে। পাঠ: সবচেয়ে শক্তিশালী মডেল সর্বত্র প্রয়োজনীয় নয়।
অনুলিপিযোগ্য টেমপ্লেট
পক্ষপাত/ন্যায্যতার জন্য এই মডেলটি মূল্যায়ন করতে আমাকে সাহায্য করুন। কোন উপগোষ্ঠী (ডেমোগ্রাফিক/সেগমেন্ট) আমি বিভক্ত এবং পরিমাপ করব? কোন মেট্রিক্স (নির্ভুলতা, প্রত্যাহার, গ্রুপ অনুসারে মিথ্যা ইতিবাচক হার) আমার তুলনা করা উচিত? ন্যায্যতার বিভিন্ন সংজ্ঞা বিরোধ করতে পারে, এই প্রসঙ্গে আমি কোনটিকে অগ্রাধিকার দিতে পারি এবং কেন? মডেল/সিদ্ধান্ত প্রসঙ্গ: [ব্যাখ্যা]
এই উচ্চ-প্রভাবিত মডেলের জন্য একটি খসড়া মডেল কার্ড তৈরি করুন। অন্তর্ভুক্ত করা উচিত: উদ্দেশ্য, প্রশিক্ষণের ডেটা এবং তারিখ, উপগোষ্ঠীতে কর্মক্ষমতা, পরিচিত সীমা, উপযুক্ত/অনুপযুক্ত ব্যবহার, ব্যাখ্যাযোগ্যতার অবস্থা, মানুষের তদারকির পয়েন্ট। মডেল: [বর্ণনা]
গুণমানের সাথে আপস না করে এই LLM বাস্তবায়নের খরচ কমাতে আমাকে সাহায্য করুন। উপলব্ধ: মডেলের আকার, গড় প্রম্পট দৈর্ঘ্য, অনুরোধের পরিমাণ, ক্যাশে আছে কি? মূল্যায়ন করুন: 1) ছোট মডেলটি কি যথেষ্ট (কোন কাজের জন্য)? 2) প্রম্পটটি কি ছোট করা যেতে পারে? 3) ঘন ঘন অনুরোধগুলি ক্যাশে করা যেতে পারে? 4) প্রতিটি ব্যাচের প্রভাব অনুমান করার জন্য কি কাজ পাওয়া যায়?
এই উচ্চ-প্রভাবিত সিদ্ধান্ত ব্যবস্থার জন্য একটি নৈতিকতা/দায়িত্বের চেকলিস্ট তৈরি করুন।- ব্যাখ্যাযোগ্যতা: সিদ্ধান্তের ন্যায্যতা তৈরি করা যায়?- মানব তদারকি: উচ্চ-প্রভাবিত সিদ্ধান্ত কি অনুমোদনের সাপেক্ষে?- জবাবদিহিতা: ত্রুটির ক্ষেত্রে কে দায়ী?- স্বচ্ছতা: ব্যবহারকারী কি জানেন যে AI ব্যবহার করা হচ্ছে?- বিধিনিষেধ: আইনগত ব্যবস্থা কী জড়িত?
পক্ষপাত উৎস টেবিল
উৎস
উপসর্গ
সতর্কতা
ঐতিহাসিক পক্ষপাত
অতীত বৈষম্য অব্যাহত রয়েছে
ডেটা অডিট + ন্যায্যতা মেট্রিক
প্রতিনিধিত্ব পক্ষপাত
ছোট নমুনা গ্রুপে কম নির্ভুলতা
সাবগ্রুপ বিশ্লেষণ + ভারসাম্য
পরিমাপের পক্ষপাত
পক্ষপাতমূলক লেবেল
লেবেল প্রক্রিয়া পর্যালোচনা
সমষ্টি পক্ষপাত
মহাবিশ্বের প্রতিনিধিত্ব করা হয় না
সম্পদ বৈচিত্র্য
সাধারণ ভুল
- সামগ্রিক মেট্রিকের উপর নির্ভর করা। উপগোষ্ঠী বিশ্লেষণ ছাড়া লুকানো বৈষম্য দেখা যায় না।
- "মডেল নিরপেক্ষ" ধরে নিচ্ছি। মডেলটি শেখে এবং ডেটাতে পক্ষপাতিত্ব বাড়ায়।
- অব্যক্ত মডেলের উপর উচ্চ প্রভাবের সিদ্ধান্ত ছেড়ে দেওয়া। আইনি এবং নৈতিক ঝুঁকি।
- মানুষের তত্ত্বাবধান বাইপাস. "মডেল সিদ্ধান্ত নিয়েছে" কোন অজুহাত.
- সর্বত্র সবচেয়ে বড় মডেল নির্বাণ. অপ্রয়োজনীয় খরচ এবং শক্তি.
- খরচ ট্র্যাকিং না. বিল নীরবে ফুলে যায়।
সংক্ষেপে
একটি প্রযুক্তিগতভাবে সঠিক মডেল এখনও একটি ব্যর্থতা যদি এটি ন্যায্য, ব্যাখ্যাযোগ্য এবং টেকসই না হয়। পক্ষপাত বেশিরভাগই ডেটা থেকে আসে এবং মডেলটি স্কেলে এটিকে বড় করে; সাবগ্রুপ দ্বারা ন্যায্যতা পরিমাপ করুন এবং ন্যায্যতার সংজ্ঞাকে অগ্রাধিকার দিতে হবে এমন স্টেকহোল্ডারদের সাথে সম্মত হন। ব্যাখ্যাযোগ্যতা, মানুষের তত্ত্বাবধান এবং জবাবদিহিতা উচ্চ-প্রভাবিত সিদ্ধান্তে অপরিহার্য; মডেল কার্ডের সাথে নথির স্বচ্ছতা। খরচ এবং শক্তি পরিচালনা করুন: সবচেয়ে ছোট পর্যাপ্ত মডেল নির্বাচন করুন, প্রম্পট ছোট করুন, ক্যাশে এবং ব্যাচ ব্যবহার করুন। এই মাত্রাগুলি ইঞ্জিনিয়ারিং মানের অবিচ্ছেদ্য অংশ, পরে যোগ করা হয় না।
আবেদন টাস্ক
একটি মডেলকে কমপক্ষে দুটি সাবগ্রুপে ভাগ করুন এবং গ্রুপ ভিত্তিতে রিকল এবং মিথ্যা ইতিবাচক হারের তুলনা করুন; যদি একটি উল্লেখযোগ্য পার্থক্য থাকে, তাহলে কারণ এবং একটি সতর্কতা লিখুন। একটি উচ্চ-প্রভাব মডেলের জন্য একটি সংক্ষিপ্ত মডেল কার্ড খসড়া (উদ্দেশ্য, ডেটা, উপগোষ্ঠীর কর্মক্ষমতা, সীমানা, ব্যাখ্যাযোগ্যতা)। একটি LLM বাস্তবায়নের খরচ কমাতে কমপক্ষে দুটি কংক্রিট অপ্টিমাইজেশান (ন্যূনতম / প্রম্পট ট্রাঙ্কেশন / ক্যাশে / ব্যাচ) সনাক্ত করুন এবং তাদের আনুমানিক প্রভাব লিখুন।
চেকলিস্ট
- [ ] আমি উপগোষ্ঠীর উপর ভিত্তি করে মডেলটি মূল্যায়ন করেছি, আমি সাধারণ মেট্রিকের উপর নির্ভর করিনি।
- [ ] আমি স্টেকহোল্ডারদের সাথে সিদ্ধান্ত নিয়েছি যে আমি ন্যায়বিচারের কোন সংজ্ঞাকে অগ্রাধিকার দেব।
- [ ] উচ্চ প্রভাবের সিদ্ধান্ত ব্যাখ্যাযোগ্য এবং মানুষের অনুমোদন সাপেক্ষে।
- আমি প্যাটার্ন কার্ডের সাথে স্বচ্ছতা এবং সীমানা নথিভুক্ত করেছি।
- [ ] আমি সবচেয়ে ছোট পর্যাপ্ত মডেল বেছে নিয়েছি; আমি প্রম্পট/ক্যাশে/ব্যাচ অপ্টিমাইজ করেছি।
- [] আমি খরচ এবং শক্তি প্রভাব নিরীক্ষণ.