লাভ:
- ML ওয়ার্কফ্লোতে (কোড, ডেটা, ডকুমেন্ট) কৃত্রিম বুদ্ধিমত্তা কোথায় কম ঝুঁকি নিয়ে সময় বাঁচায় এবং কোথায় মেট্রিক/ডেটা/উৎপাদন করার মতো সিদ্ধান্তগুলি টাস্ক ঝুঁকির স্তর অনুসারে মানুষের উপর ছেড়ে দেওয়া হয় তা আলাদা করতে সক্ষম হওয়া।
- একটি শৃঙ্খলা প্রয়োগ করার ক্ষমতা যা প্রতিটি AI আউটপুটকে উত্সের সাথে সংযুক্ত করে, এটিকে পুনরায় চালনা করে, এটি পরিমাপ করে এবং একটি ইঞ্জিনিয়ারিং ফিল্টারের মাধ্যমে এটিকে যাচাই করে।
- বাহ্যিক সরঞ্জামগুলিতে কাঁচা গোপনীয় এবং ব্যক্তিগত ডেটা না পাঠানোর অভ্যাস অর্জন করার ক্ষমতা, কর্পোরেট-অনুমোদিত সরঞ্জামগুলি ব্যবহার করে এবং শুধুমাত্র প্রতিরক্ষামূলক উদ্দেশ্যে নিরাপত্তা সংক্রান্ত সমস্যাগুলি পরিচালনা করা।
মেশিন লার্নিং ইঞ্জিনিয়ারিংয়ে কৃত্রিম বুদ্ধিমত্তা: ভূমিকা, সীমানা, বৈধতা এবং দায়িত্ব
একজন মেশিন লার্নিং ইঞ্জিনিয়ার (এমএল ইঞ্জিনিয়ার: একজন সফ্টওয়্যার পেশাদার যিনি ডিজাইন করেন, প্রশিক্ষণ দেন এবং মডেল আনেন যা ডেটা থেকে উৎপাদনে শেখে) আজ তার কাজের প্রতিটি ধাপে আরেকটি কৃত্রিম বুদ্ধিমত্তার সরঞ্জামের সাথে কাজ করে। একটি কোডিং সহকারী কার্যকর হয় কোড লেখার সময়, ডেটা অন্বেষণ করার সময় একটি কথোপকথনের মডেল এবং ডকুমেন্টেশন তৈরি করার সময় একটি বড় ভাষা মডেল (এলএলএম: কোটি কোটি প্যারামিটার সহ একটি নিউরাল নেটওয়ার্ক যা পাঠ্য বোঝে এবং তৈরি করে)। এই মডিউলটি কৃত্রিম বুদ্ধিমত্তাকে বিকশিত পণ্য এবং একজন এমএল ইঞ্জিনিয়ারের দৈনন্দিন কাজের হাতিয়ার হিসাবে বিবেচনা করে। এটি দুটি ভূমিকা মিশ্রিত না করে দায়িত্বের সীমানা স্পষ্টভাবে বর্ণনা করে কাজ করে।
এই প্রথম ইউনিটে, আমরা মৌলিক প্রশ্নের উত্তর দিই: এমএল ইঞ্জিনিয়ারিং-এ কোথায় কৃত্রিম বুদ্ধিমত্তা প্রকৃত সময় বাঁচায় এবং কোথায় আমাদের সিদ্ধান্তটি মানুষের হাতে ছেড়ে দিতে হবে? উত্তরটি ইঞ্জিনিয়ারিং শৃঙ্খলার কেন্দ্রবিন্দুতে রয়েছে: যিনি তৈরি করেন তিনি দ্রুত, যিনি যাচাই করেন তিনি দায়ী।
এমএল ইঞ্জিনিয়ারিংয়ে কৃত্রিম বুদ্ধিমত্তা কোথায় কাজে আসে?
একটি ML প্রকল্প মোটামুটি নিম্নলিখিত লাইনগুলির মধ্য দিয়ে যায়: ডেটা সংগ্রহ, ডেটা পরিষ্কার করা, বৈশিষ্ট্য প্রকৌশল (কাঁচা ডেটা ডিজিটাল সিগন্যালে অনুবাদ করা যা মডেল বুঝতে পারে), মডেল প্রশিক্ষণ, মূল্যায়ন, স্থাপনা (নিয়োজন: প্রকৃত ব্যবহারকারীর কাছে মডেলটি খোলা) এবং পর্যবেক্ষণ। AI এই লাইনের প্রতিটি স্টপে সাহায্য করে, কিন্তু এর কর্তৃত্বের মাত্রা পরিবর্তিত হয়।
উচ্চ-পুরস্কার, কম-ঝুঁকির ক্ষেত্র: একটি কোড কঙ্কাল তৈরি করা, একটি ডেটা ট্রান্সফরমেশন ফাংশন খসড়া করা, লগ বার্তাগুলির ব্যাখ্যা করা, একটি স্ট্যাক ট্রেস বর্ণনা করা, পরীক্ষার নোটের সংক্ষিপ্তকরণ, ডকুমেন্টেশন এবং README লেখা, একটি পরীক্ষার কেস প্রস্তাব করা। এখানে, কৃত্রিম বুদ্ধিমত্তার ভুলগুলি সস্তা; কারণ আউটপুট ইতিমধ্যে পরীক্ষা এবং পর্যালোচনার মধ্য দিয়ে যাবে।
উচ্চ ঝুঁকির ক্ষেত্র: প্রশিক্ষণে কোন ডেটা যায় তা নির্ধারণ করা, একটি মডেল উৎপাদনে যাওয়া উচিত কিনা তা নিশ্চিত করা, একটি মেট্রিককে বিচার করা "যথেষ্ট ভাল", ব্যক্তিগত ডেটা প্রক্রিয়া করার সিদ্ধান্ত, একটি নিরাপত্তা দুর্বলতাকে "জাঙ্ক" হিসাবে বন্ধ করে। এগুলো অর্থ, গোপনীয়তা, আইনি দায় এবং ব্যবহারকারীর বিশ্বাসকে প্রভাবিত করে। কৃত্রিম বুদ্ধিমত্তা এখানে পরামর্শ দেয়; উপযুক্ত প্রকৌশলী এবং দায়িত্বশীল দল দ্বারা সিদ্ধান্ত নেওয়া হয়।
টিপ: AI-তে একটি কাজ আউটসোর্স করার আগে, জিজ্ঞাসা করুন: "এই আউটপুটটি ভুল হলে খরচ কত, এবং কত সহজে কেউ ভুল ধরতে পারবে?" যদি দাম কম হয় এবং ক্যাপচার করা সহজ হয়, তাহলে এটি পাস করুন। দাম বেশি হলে বা ক্যাপচার করা কঠিন হলে, শুধুমাত্র খসড়ার জন্য AI ব্যবহার করুন এবং আপনি সিদ্ধান্ত নিন।
যাচাইকরণ শৃঙ্খলা: তিনটি ধাপ
এমএল ইঞ্জিনিয়ারিংয়ে, এআই আউটপুট কখনই "সমাপ্ত কাজ" নয়; এটি একটি খসড়া। এই তিনটি ধাপের মাধ্যমে প্রতিটি আউটপুট চালান:
- উৎসের সাথে এটি সংযুক্ত করুন। যদি মডেলটি একটি সংখ্যা, একটি থ্রেশহোল্ড বা একটি "সর্বোত্তম অনুশীলন" বলে থাকে তবে এটি অফিসিয়াল ডকুমেন্টেশন, কোডবেসের প্রকৃত মান বা একটি পরিমাপ করা মেট্রিকের উপর ভিত্তি করে। "মডেলের মানানসই" (হ্যালুসিনেশন: ভাষার মডেল দ্বারা অ-বাস্তব তথ্যের আত্মবিশ্বাসী উত্পাদন) এখানে প্রায়শই ধরা পড়ে।
- পুনরায় চালু করুন এবং পরিমাপ করুন। জেনারেট করা কোডটি চালান, আপনার নিজের পরীক্ষা সেটে এটি যে মেট্রিক তৈরি করে তা পুনরায় গণনা করুন, একটি ছোট নমুনায় প্রস্তাবিত SQL ক্যোয়ারী যাচাই করুন। কোড যে কাজ করে না মূল্যহীন, এমনকি যদি এটি সুন্দর দেখায়।
- একটি ইঞ্জিনিয়ারিং ফিল্টার মাধ্যমে এটি পাস. আউটপুট কি স্কেলে ধরে? প্রান্তের ক্ষেত্রে (খালি ডেটা, খুব বড় ইনপুট, অনুপস্থিত ক্ষেত্র) বিবেচনা করা হয়েছে? একটি নিরাপত্তা এবং গোপনীয়তা লঙ্ঘন আছে? শুধুমাত্র ক্ষেত্রটি জানেন এমন একজন ব্যক্তি এই পদক্ষেপটি করতে পারেন।
দুর্বল প্রম্পট / শক্তিশালী প্রম্পট
দুর্বল প্রম্পট: "আমাকে কিছু মডেল প্রশিক্ষণ কোড লিখুন।"
শক্তিশালী প্রম্পট: "স্কিট-লার্নের সাথে বাইনারি শ্রেণীবিভাগের জন্য একটি প্রশিক্ষণ স্ক্রিপ্ট লিখুন। ইনপুট: data/train.parquet, টার্গেট কলাম is_churn। এখানে শ্রেণী ভারসাম্যহীনতা (ধনাত্মক হার ~8%), এটি class_weight দিয়ে পরিচালনা করুন। PR-AUC (নির্ভুলতা-রিকল বক্ররেখার অধীনে এলাকা) ব্যবহার করুন কারণ একটি মিসক্যালডিং মিসক্লিডিং এর জন্য। ডেটা এলোমেলো বীজকে 42 এ ফিক্স করুন। কোড প্রিন্ট সেট PR-AUC এর শেষে পরীক্ষা করুন।"
পার্থক্য: দ্বিতীয় প্রম্পট টাস্কে ডেটা সত্য, সঠিক মেট্রিক, ভারসাম্যহীন তথ্য এবং পুনরাবৃত্তিযোগ্যতার প্রয়োজনীয়তা রয়েছে। এই প্রেক্ষাপট থেকে আউটপুট যাচাইযোগ্য এবং ব্যবহারযোগ্য।
গোপনীয়তা এবং ডেটা নিরাপত্তা: ইঞ্জিনিয়ারের প্রথম দায়িত্ব
এমএল ইঞ্জিনিয়ার প্রায়শই কোম্পানির সবচেয়ে সংবেদনশীল ডেটা স্পর্শ করে: গ্রাহকের রেকর্ড, লেনদেনের ইতিহাস, স্বাস্থ্য বা আর্থিক তথ্য, উৎপাদন সিস্টেমের লগ। কৃত্রিম বুদ্ধিমত্তার সরঞ্জামগুলিতে ডেটা দেওয়ার সময় তিনটি নিয়ম:
- বাহ্যিক সরঞ্জামগুলিতে কাঁচা ব্যক্তিগত এবং গোপনীয় ডেটা পাঠাবেন না। উদাহরণস্বরূপ, প্রম্পটে গ্রাহকের ইমেল পেস্ট করার পরিবর্তে, স্কিমা এবং ডামি (সিন্থেটিক) নমুনা পাঠান। বাস্তব ডেটার পরিবর্তে "ex: ahmet@example.com" এর মতো মুখোশযুক্ত উদাহরণ ব্যবহার করুন৷
- কর্পোরেট অনুমোদিত যানবাহন ব্যবহার করুন। এমন সরঞ্জামগুলি বেছে নিন যা চুক্তিগতভাবে স্পষ্ট হয় যেখানে ডেটা প্রক্রিয়া করা হয়, এটি সংরক্ষণ করা হয় কিনা, এটি শিক্ষার জন্য ব্যবহার করা হয় কিনা। একটি ব্যক্তিগত অ্যাকাউন্টের সাথে কর্পোরেট ডেটা প্রক্রিয়াকরণ বেশিরভাগ কোম্পানিতে লঙ্ঘন।
- ন্যূনতম ডেটা নীতি। টাস্ক সমাধানের জন্য প্রয়োজনীয় ন্যূনতম প্রসঙ্গ দিন। পুরো টেবিল নয়, তবে প্রাসঙ্গিক 5টি কলাম এবং স্কিমা।
সতর্কতা: অনুমান করুন যে আপনি একটি ভাষার মডেলে যে পাঠ্যটি দিয়েছেন তা পূর্বাবস্থায় ফেরানো যাবে না। "আমি পরে মুছে দেব" ভেবে কাঁচা ব্যক্তিগত ডেটা পাঠাবেন না; এটি পাঠানোর মুহূর্তে ঝুঁকিটি ঘটেছে।
নিরাপত্তা ক্ষেত্রে প্রতিরক্ষামূলক ব্যবহার
এমএল ইঞ্জিনিয়াররা প্রায়ই নিরাপত্তা ব্যবস্থা ইনস্টল করে: জালিয়াতি সনাক্তকরণ, দূষিত ট্র্যাফিক শ্রেণীবিভাগ, প্রমাণীকরণ। এই মডিউল জুড়ে, আমরা শুধুমাত্র প্রতিরক্ষামূলক উদ্দেশ্যে নিরাপত্তা সংক্রান্ত সমস্যাগুলি কভার করি: আক্রমণ সনাক্ত করা, সিস্টেমকে শক্ত করা, দুর্বলতা বন্ধ করা। অননুমোদিত অ্যাক্সেস, ডেটা ফাঁস বা অন্য কারও সিস্টেমে অননুমোদিত হস্তক্ষেপের জন্য কৃত্রিম বুদ্ধিমত্তা ব্যবহার করা উভয়ই বেআইনি এবং পেশাদার নৈতিকতার বিরুদ্ধে। যখন আপনি একটি দুর্বলতা খুঁজে পান, সঠিক উপায় হল দায়িত্বের সাথে রিপোর্ট করা এবং এটি ঠিক করা; শোষণ না
তিনটি মিনি কেস
কেস 1 - সময় সংরক্ষিত। একজন এমএল ইঞ্জিনিয়ার সাধারণত 40-কলামের ডেটা সেটের অনুসন্ধানমূলক ডেটা বিশ্লেষণ (EDA) করতে অর্ধেক দিন ব্যয় করবেন। তিনি কৃত্রিম বুদ্ধিমত্তার স্কিমা এবং df.describe() আউটপুট দিয়েছিলেন এবং জিজ্ঞাসা করেছিলেন, "কোন কলামে উচ্চ আউটলায়ার এবং অনুপস্থিত হার রয়েছে, আপনি কোন রূপান্তরের পরামর্শ দেন?" 20 মিনিটের মধ্যে, তিনি একটি অগ্রাধিকার তালিকা পেয়েছেন, প্রতিটি আইটেমকে তার নিজস্ব কোড দিয়ে যাচাই করে। সংরক্ষণ করুন: ~3 ঘন্টা, ত্রুটির কম ঝুঁকি কারণ প্রতিটি দাবি পরিমাপ করা হয়েছে।
কেস 2 - ধরা ত্রুটি. "প্রশিক্ষণের নির্ভুলতা 99%, দুর্দান্ত," মডেলটির একজন চ্যাট সহকারী বলেছিলেন। প্রকৌশলী তৃতীয় ধাপ (ইঞ্জিনিয়ারিং ফিল্টার) প্রয়োগ করেছেন এবং বুঝতে পেরেছেন: লক্ষ্য কলামটি দুর্ঘটনাক্রমে বৈশিষ্ট্যগুলি ফাঁস করেছে (ডেটা লিকেজ: মডেলটি এমন তথ্য দেখেছে যা প্রশিক্ষণে দেখা উচিত নয়)। প্রকৃত কর্মক্ষমতা অনেক কম ছিল. ইঞ্জিনিয়ারের সংশয়, AI এর "মহান" ব্যাখ্যা নয়, কাজটি বাঁচিয়েছে।
কেস 3 - গোপনীয়তা লঙ্ঘন প্রতিরোধ করা। একটি দল একটি বাহ্যিক মডেলে উত্পাদন ত্রুটির লগগুলি পেস্ট করছে এবং বলছে "এই ত্রুটিটি ঠিক করুন"৷ লগগুলিতে গ্রাহক সনাক্তকরণ নম্বর ছিল। দলটি একটি ছোট স্ক্রিপ্ট লেখার একটি নিয়ম তৈরি করেছে যা প্রথমে লগগুলিকে মাস্ক করে (তাদের আইডি নম্বর *** তৈরি করে) এবং সেভাবে সেগুলি পাঠায়৷ লঙ্ঘনের ঝুঁকি অদৃশ্য হয়ে গেছে, সহায়তার গতি পরিবর্তিত হয়নি।
অনুলিপিযোগ্য টেমপ্লেট
টাস্ক: [কি করতে হবে, একক বাক্য] প্রসঙ্গ: [ডেটা স্কিমা, আকার, সীমাবদ্ধতা; কোন বাস্তব ব্যক্তিগত তথ্য নেই]সীমাবদ্ধতা: [ভাষা/লাইব্রেরি, কর্মক্ষমতা, পুনরুত্পাদনযোগ্যতা] মেট্রিক্স: [কিভাবে সাফল্য পরিমাপ করবেন] কাঙ্খিত আউটপুট: [কোড/বিবরণ/তালিকা] এবং কেন এই বিন্যাসে
এই কোড চেক আউট. শুধু যে এটি কাজ করে তা নয়, এর পরিপ্রেক্ষিতেও মূল্যায়ন করুন: 1) এজ কেস (খালি ইনপুট, অনুপস্থিত কলাম, খুব বড় ডেটা) 2) ডেটা ফাঁসের ঝুঁকি3) পুনরুত্পাদনযোগ্যতা (বীজ, সংস্করণ) আপনার খুঁজে পাওয়া প্রতিটি সমস্যার সমাধানের পরামর্শ দিন৷ যেখানে আপনি নিশ্চিত নন সেখানে "যাচাই করুন" চিহ্নিত করুন। কোড: [কোড]
এই মেট্রিকের ফলাফল ব্যাখ্যা করুন, কিন্তু প্রথমে জিজ্ঞাসা করুন: এই সমস্যার জন্য এই মেট্রিকটি কি সঠিক? সমস্যা: [ভারসাম্যহীন/ভারসাম্যহীন শ্রেণীবিভাগ, রিগ্রেশন, র্যাঙ্কিং...]প্রতিবেদিত মেট্রিক এবং মান: [উদা. নির্ভুলতা 0.99]আপনি কোন মেট্রিক সুপারিশ করবেন এবং কেন, এবং বর্তমান ফলাফল সম্পর্কে সন্দেহ করার জন্য আমার কোন লক্ষণগুলি সন্ধান করা উচিত?
আমি নিম্নলিখিত প্রম্পটে যে ডেটা দেব তাতে ব্যক্তিগত/গোপনীয় তথ্য আছে কিনা তা পরীক্ষা করুন। নিচের টেক্সটে মাস্ক করা প্রয়োজন এমন ক্ষেত্রগুলি (নাম, ই-মেইল, আইডি নম্বর, ফোন, ঠিকানা) তালিকাভুক্ত করুন। পাঠ্য: [পাঠ্য]
ভূমিকা এবং কর্তৃত্ব টেবিল
কোয়েস্ট
কৃত্রিম বুদ্ধিমত্তার ভূমিকা
সিদ্ধান্তের মালিক
কোড কঙ্কাল / রূপান্তর ফাংশন
খসড়া জেনারেটর
ইঞ্জিনিয়ার (রিভিউ)
EDA / ডেটা সারাংশ
এক্সিলারেটর
প্রকৌশলী (পরিমাপ করে যাচাই করে)
মেট্রিক ব্যাখ্যা
সাজেশন
প্রকৌশলী
কি তথ্য প্রশিক্ষণে যেতে হবে?
সাজেশন
দল + ডেটা মালিক
মডেলটি উৎপাদনে রাখুন
চেকলিস্ট অনুস্মারক
দায়িত্বপ্রাপ্ত প্রকৌশলী + দল
ব্যক্তিগত তথ্য প্রক্রিয়াকরণ
কোনোটিই নয় (ব্যবহৃত নয়)
আইনি + ডেটা কন্ট্রোলার
সাধারণ ভুল
- এটি যাচাই না করে আউটপুট ব্যবহার করা। সবচেয়ে সাধারণ এবং সবচেয়ে ব্যয়বহুল ভুল। কোড বা মেট্রিক যা দেখতে সুন্দর তার মানে এই নয় যে এটি সঠিক।
- টুলে কাঁচা গোপনীয় তথ্য পেস্ট করা হচ্ছে। একবার পাঠানো হলে ফেরত নেওয়া যায় না।
- ভুল মেট্রিকের উপর নির্ভর করা। অসামঞ্জস্যপূর্ণ মেট্রিক্স যেমন ভারসাম্যহীন ডেটার যথার্থতা এবং র্যাঙ্কিং সমস্যায় RMSE বিভ্রান্তিকর।
- সিদ্ধান্ত গ্রহণকারী হিসাবে কৃত্রিম বুদ্ধিমত্তাকে ভুল করা। তিনি পরামর্শ দেন; দায়িত্ব স্বাক্ষরকারীর উপর বর্তায়।
- প্রসঙ্গহীন প্রম্পট। অস্পষ্ট অনুরোধ যেমন "একটি মডেল লিখুন" যাচাইযোগ্য আউটপুট তৈরি করে।
সংক্ষেপে
কৃত্রিম বুদ্ধিমত্তা হ'ল এমএল ইঞ্জিনিয়ার এবং এর প্রতিদিনের প্রতিলিপিকার দ্বারা বিকশিত পণ্য। কম-ঝুঁকিপূর্ণ, সহজে যাচাইকৃত কাজ যেমন কোড-ডেটা-ডকুমেন্টে এর মান সর্বোচ্চ; অর্থ, গোপনীয়তা এবং নিরাপত্তাকে প্রভাবিত করে এমন সিদ্ধান্ত ব্যক্তির কাছে থাকে। প্রতিটি আউটপুটকে উৎসের সাথে সংযুক্ত করুন, আবার পরিমাপ করুন, প্রকৌশল ফিল্টারের মধ্য দিয়ে যান। গোপনীয় তথ্য রক্ষা করুন, অনুমোদিত যানবাহন ব্যবহার করুন, শুধুমাত্র প্রতিরক্ষামূলক উদ্দেশ্যে নিরাপত্তায় কাজ করুন। এই শৃঙ্খলা পরবর্তী সমস্ত ইউনিটের ভিত্তি।
আবেদন টাস্ক
আপনার নিজের প্রকল্প থেকে একটি কাজ চয়ন করুন (যেমন একটি ডেটা পরিষ্কার ফাংশন লেখা)। প্রথমে একটি দুর্বল প্রম্পট লিখুন, তারপর এই ইউনিটে টেমপ্লেট ব্যবহার করে একটি শক্তিশালী প্রম্পট লিখুন। উভয় আউটপুট নিন, তিন-পদক্ষেপ যাচাইকরণ প্রয়োগ করুন (উৎস লিঙ্ক, পুনরায় চালানো, ইঞ্জিনিয়ারিং ফিল্টার)। নোট করুন কোন প্রম্পট কত মিনিট এবং কতগুলি সংশোধন সংরক্ষণ করে।
চেকলিস্ট
- আমি আমার টাস্কের ঝুঁকির মাত্রা (নিম্ন/উচ্চ) নির্ধারণ করেছি।
- [] আমি প্রম্পটে কোনো প্রকৃত ব্যক্তিগত/গোপনীয় তথ্য রাখিনি; আমি এটি মাস্ক বা একটি সিন্থেটিক নমুনা ব্যবহার.
- [ ] আমি আউটপুটটিকে উৎসের সাথে সংযুক্ত করেছি, এটি আবার চালিয়েছি, এটি একটি প্রকৌশল দৃষ্টিকোণ থেকে ফিল্টার করেছি।
- [ ] আমি পরীক্ষা করেছি যে আমি সঠিক মেট্রিক নির্বাচন করেছি৷
- আমি নিজে/দলের সাথে সমালোচনামূলক সিদ্ধান্ত নিয়েছি (উৎপাদন, ডেটা প্রসেসিংয়ে), আমি কৃত্রিম বুদ্ধিমত্তার উপর ছেড়ে দেইনি।
- আমি একটি কর্পোরেট অনুমোদিত যান ব্যবহার করেছি৷